深夜突袭一个月后复盘:V4 Pro 0813 发布夜,谁被刷屏,谁被撞车
深夜突袭一个月后复盘V4 Pro 0813 发布夜谁被刷屏谁被撞车【免费下载链接】DeepSeek-V4-Pro-0813项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Pro-08132026 年 8 月 13 日深夜DeepSeek 没有发布会、没有倒计时直接把 DeepSeek-V4-Pro-0813 的权重和 API 一起端了上来。华尔街见闻当晚用深夜突袭四个字定调第一财经跟进对标 Fable 5爱范儿则抛出了还藏了一个大招的悬念与此同时头条评论区里流传着一句更冷静的判断——综合得分仍落后 Kimi K3比较接近于 Grok 4.6这在发布之前就都知道。一个月后回看这场深夜发布热闹早已退潮留下的是一组可以对照验证的事实谁在当晚被刷屏谁在评测表上被撞车哪些预言兑现了哪些判断需要修正。这篇文章结合仓库源码与发布夜全网报道把这场突袭拆开复盘。发布夜一次没有预告的突袭DeepSeek-V4-Pro-0813 是 V4-Pro 预览版的正式替代者。仓库 README 开篇就说明了定位在预览版结构基础上挂载了一个 DSpark 投机解码模块后训练阶段重点优化智能体能力官方口径是在生产环境中的提升尤为显著见 README.md。当晚刷屏的认知主要来自三份数据对照逼近 Fable 5。DeepSWE 基准上0813 拿到62.7预览版只有 12.8Anthropic Fable-5w/ fallback为 70.0Opus-4.8 为 58.0。差距从 57 分缩到 7.3 分这是多项测试逼近 Fable 5的直接出处。更夸张的是 Cybergym0813 以83.3反超 Fable-5 的 83.1、Kimi K3 的 80.0而预览版只有 52.7。撞车 Grok 4.6。头条情报的判断是比较接近于 Grok 4.6而华尔街见闻把这场同期竞争称为撞车。社区观感是 0813 与 Grok 4.6 处于同一梯队、贴身肉搏没有拉开代差。仍被 Kimi K3 压一头。README 的基准表里Kimi K3 在 DeepSWE67.5 vs 62.7、Agents Last Exam27.6 vs 25.7、Toolathlon-Verified76.5 vs 74.1上全部领先Terminal Bench 2.1 上双方 88.3 vs 87.9 几乎打平。这印证了发布前就知道的判断DeepSeek 的护城河从来不是单项第一而是同梯队的性能配上碾压级的成本。支撑这些数字的技术底座全写在 config.json 里384 个路由专家、每 token 激活 6 个外加 1 个共享专家61 层 Transformer1048576 token 上下文100 万通过 YaRN 缩放factor 16从 65536 扩展而来专家权重以FP4e2m1fn存储、激活走 FP8 动态量化权重在显存上被压到近乎减半分层压缩注意力compress_ratios在 61 层间交错配置 128/4配合 sliding window 128 与哈希检索支撑百万 token 下的工程化成本。当夜刷屏的文章到底在吵什么发布夜的报道可以归纳为五类叙事每类都有可以落到仓库源码上的证据。逼近 Fable 5派华尔街见闻、爱范儿。核心论据就是 DeepSWE 62.7 与 NL2Repo 61.5预览版仅 38.5Opus-4.8 为 69.7。这类文章把 0813 定义为智能体能力的代际跃迁尤其强调长链路代码执行与工具调用的提升——这正是预览版被诟病最多的地方。只来了一半派观察者网、21 财经。标题直接点出正式版来了但只来了一半纯文本模型、无多模态输入API 并发限制 500涨价预期明确。21 财经则用顶尖模型开启肉搏形容当晚的舆论场——性能逼近、价格分化、各家粉丝互踩本质是这一轮竞争已经从谁更强滑向谁更便宜地更强。价格战派第一财经。对标 Fable 5、价格是 flash 版的三倍——Pro 定价高企的同时Flash 版免费/极低价策略不动摇。这种免费版引流、Pro 版收割高价值场景的双轨定价当晚就被解读为护城河的商业化落地。藏了大招派爱范儿。大招就是DSpark 投机解码——一个不需要单独草稿模型的投机采样方案。仓库源码给出了完整证据链inference/model.py 中DSparkMarkovHead第 795 行用markov_w1/markov_w2两个低秩投影构成马尔可夫秩头直接基于已生成 token 预测下一段草稿DSparkConfidenceHead第 807 行把草稿隐状态与马尔可夫嵌入拼接后投影为置信度标量用于接受/拒绝草稿DSparkBlock第 818 行则以 config 中的dspark_block_size: 5、dspark_target_layer_ids: [58, 59, 60]最后三层为粒度通过main_proj把主模型最后三层的隐状态投影成草稿输入。核心优势在于草稿与目标权重同源——部署时不需要像传统投机解码那样额外加载一个小模型。vLLM 侧只需一个 flag 即可启用README.mdvllm serve deepseek-ai/DeepSeek-V4-Pro-0813 \ --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \ --data-parallel-size 4 --enable-expert-parallel \ --moe-backend deep_gemm_mega_moe \ --attention-config {use_fp4_indexer_cache: true} \ --speculative-config {method:dspark,num_speculative_tokens:7,draft_sample_method:greedy}SGLang 侧同样通过--speculative-algorithm DSPARK开启且明确要求不设置--speculative-draft-model-path因为草稿权重与目标权重来自同一 checkpoint。细节党派CSDN 评测与配置文。当晚大量工程向文章聚焦在三个细节上reasoning_effort升级为low / high / max 三档encoding/README.md 中明确 high 与 max 档对应不同的提示词前缀且官方建议高推理档位下输出上限开到384K token工具调用使用 DSML 标记语言【免费下载链接】DeepSeek-V4-Pro-0813项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Pro-0813创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考