DeepSeek V4-Flash 0731官方版深度拆解:284B/13B MoE以Flash之身逼平Opus 4.8,Terminal-Bench 2.1跃升20.9分,$0.14/$0.28每百
2026/9/1 5:30:35 网站建设 项目流程

摘要

2026年8月31日,DeepSeek将V4-Flash推进到"0731官方版",取代此前上线一个多月的preview版本。架构与规模完全不变——仍为284B总参数 / 13B单Token激活的MoE(256个路由专家 + 1个共享专家 / 每Token激活6个),但通过完整的强化学习后训练重跑,Agent与编程基准实现"非连续跳跃":Terminal-Bench 2.1从61.8跃升至82.7(超GLM-5.2的81.0,逼近Opus 4.8的85.0和GPT-5.6 Luna的84.7)、DeepSWE从7.3暴涨至54.4(超越GLM-5.2的46.2)、NL2Repo从39.4升至54.2、Cybergym从38.7升至76.7、DSBench-FullStack从37.0升至68.7、Toolathlon-Verified从49.7升至70.3。价格保持**$0.14/输入 + $0.28/输出 / $0.0028/缓存命中**,比GPT-5.6 Sol的$5/$30便宜约35倍,比Opus 4.8的$5/$25便宜约18倍,比同日启动重新定价的Claude Sonnet 5的$3/$15便宜约11倍。权重以MIT许可证开源(~167 GB,FP4/FP8混合精度),Day-1生态覆盖vLLM(单flag启用DSpark推测解码)/ Cline(限时免费集成)/ Ollama Cloud(ollama run deepseek-v4-flash:0731-cloud)/ Unsloth(Q4 110GB、Q8 162GB GGUF)/ Hugging Face。与GPT-5.6 Luna同日降价80%形成微妙对垒——OpenAI降价次日DeepSeek就推出这款性能远超Luna、定价却更低的模型。这是中国大模型"以Flash之身做Opus之实"路线最完整的一次公开演示,也是OpenAI/Anthropic必须正面回应的真正压力点。(全文约5800字)


一、发布背景:一个MoE不动的"纯后训练跃迁"

1.1 为什么这次发布震动市场

8月30日深夜至8月31日凌晨,DeepSeek通过API将deepseek-v4-flash模型名直接路由到新版本0731,同时在Hugging Face上以MIT许可证发布配套权重。模型的结构、规模、参数完全没变——这并不是又一次"新模型",而是一次纯后训练升级:用完整的强化学习流程,把同一个284B/13B MoE的训练结果向前推了一大步。

但这个"推进"的幅度,足以让市场重新评估两个问题:

  1. Flash级小激活模型的天花板在哪里?
  2. OpenAI/Anthropic过去一年靠"模型尺寸"建立的护城河,还有多深?

过去两年,主流叙事一直是"更大的模型、更长的训练、更高的成本"。DeepSeek 0731用一组简单数字颠覆了这一叙事:

基准Preview版本0731官方版绝对跃升对比参照
Terminal-Bench 2.161.882.7+20.9超GLM-5.2(81.0) / 逼近Opus 4.8(85.0)
DeepSWE7.354.4+47.1超GLM-5.2(46.2)
NL2Repo39.454.2+14.8
Cybergym38.776.7+38.0
DSBench-FullStack37.068.7+31.7接近Opus 4.8的71.6
DSBench-Hard59.6接近Opus 4.8的71.7
Toolathlon-Verified49.770.3+20.6
Artificial Analysis 智能指数4050+10

表1:DeepSeek V4-Flash 0731核心基准跃升(数据来源:DeepSeek技术报告、Artificial Analysis、kimmonismus benchmark table,2026-08-31)

仅看Terminal-Bench 2.1一项,0731的82.7就超过GLM-5.2的81.0,距离Opus 4.8的85.0只剩2.3分——这是Flash级模型首次系统性接近前沿。考虑到V4-Flash单次激活参数只有Opus 4.8的几分之一,这样的"以小博大"在工程上和商业上都有深远意义。

1.2 与OpenAI降价形成"双日对垒"

这次发布的时机并非偶然:

  • 8月29日:OpenAI将GPT-5.6 Luna降价80%,从$1/$6降至**$0.20/$1.20/百万Token**,被普遍解读为应对中国大模型的价格压力。
  • 8月31日:DeepSeek推出V4-Flash 0731,价格$0.14/$0.28——比Luna还便宜30%,而Terminal-Bench 2.1得分反超Luna(82.7 vs Luna的84.7仅差2分)。
  • 同日:Claude Sonnet 5启动涨价(详见本日第二篇),市场焦点转向"价格战 vs 价值战"。

DeepSeek选在Luna降价次日推出0731,时机选择非常清晰:要在OpenAI制造的成本叙事被市场接受之前,把"低价+高性能"组合的标杆钉死。

1.3 一个不太被讨论的潜台词

DeepSeek在V4-Flash 0731的发布节奏上,还有一个值得注意的细节:V4-Pro的预览版早在6月就已发布,但官方版至今未落地。DeepSeek在变更日志中明确指出:“本更新仅适用于V4-Flash API,V4-Pro API、消费端App/网页模型保持不变。官方版V4-Pro即将发布。”

这意味着DeepSeek正采用"先打磨好用的Flash、再回头补完Pro"的反常规节奏。从工程上看,这种节奏有利于稳定生态——企业用户接入Flash几乎没有迁移成本——但也意味着DeepSeek主动放弃了一部分"前沿品牌"的话语权。


二、技术架构:284B/13B MoE + DSpark推测解码

2.1 与Preview完全一致的MoE骨架

V4-Flash 0731的架构与Preview版本完全一致,继承自V4-Flash-DSpark项目的设计:

维度数值
总参数284B(约304B含DSpark推测头)
单Token激活参数13B(激活率约4.6%)
上下文窗口1M Token(与Preview一致)
路由专家数256个路由专家+ 1个共享专家
每Token激活专家数6个(Top-6路由)
注意力机制与V4-Flash一致的稀疏+线性注意力混合
配套模块DSpark推测解码头(与模型一同发布)
推理Effort等级low / high / max(三档)

表2:V4-Flash 0731架构规格(数据来源:vLLM官方Recipe、Unsloth GGUF指南、DeepSeek技术报告,2026-08-31)

DSpark是DeepSeek在V4-Flash Preview阶段就预置的推测解码头——一个独立的轻量模型,与主模型一同发布,通过vLLM的单个flag即可启用

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731\--speculative-method dspark\--num-speculative-tokens8\--max-model-len1048576

启用DSpark后,每个解码步可一次预测最多8个候选Token,由主模型并行验证。这对Agent类工作负载尤其关键——长链路工具调用中的小步延迟会累积成数十秒的等待,DSpark在V4-Flash上的实测加速比为1.6-2.4×

2.2 后训练:从"对齐"到"工作流能力"

DeepSeek在V4-Flash Preview阶段的核心卖点是"参数效率":用13B激活做出与同期前沿50-100B激活模型相当的能力。但Preview在Agent工作流上的短板也很明显——Terminal-Bench 2.1只有61.8分,DeepSWE只有7.3分,距离能"干活"的模型还有显著差距。

0731版本的核心工作,是对预览版模型重新跑了一次完整的强化学习后训练。从基准跃升的特征看,这次后训练重点针对的是"多步骤工具使用 + 真实软件工程任务"这两类:

任务类别Preview表现0731表现跃升幅度评估方法
真实软件工程(DeepSWE)7.354.4+47.1多文件PR生成 + 测试通过率
多步任务(Terminal-Bench 2.1)61.882.7+20.9终端Agent执行完整工作流
数据科学(DSBench-FullStack)37.068.7+31.7端到端数据项目交付
网络安全(Cybergym)38.776.7+38.0真实漏洞利用场景
工具选择(Toolathlon-Verified)49.770.3+20.6多API工具调用决策

表3:0731版本针对Agent工作流的专项跃升(数据来源:DeepSeek技术报告、Artificial Analysis,2026-08-31)

几个值得注意的细节:

  1. 数据科学任务的跃升(+31.7)说明后训练覆盖了"长程规划+多模态数据理解+Python代码执行"的复合任务,而不仅仅是"代码补全"。
  2. 网络安全类(+38.0)的高分说明模型对"安全Agent"任务也具备较强能力,这与GLM-5.3、阿里Qwen 3.8-MAX同期在CyberGym上的高分形成了开源大模型在这一领域的"集中突破"。
  3. DeepSWE从7.3到54.4的跃升是绝对值最大的单项——这个基准要求模型在真实仓库中阅读代码、定位问题、生成多文件补丁、并通过测试。7.3分说明Preview几乎不具备这种能力,54.4分意味着0731已经可以作为初级开发者的辅助完成实际PR。

2.3 DeepSeek Harness:一个待解的"评测体系黑盒"

DeepSeek在0731的技术报告中提到了内部使用的DeepSeek Harness v0.1.1——一套用于评估Agent工作流的标准化框架。这个框架同时支持:

  • 多轮工具调用
  • 多语言代码执行(Python/JS/Shell)
  • 真实仓库工作流(Git checkout、测试运行、PR生成)
  • 联网检索+多模态输入

这套Harness并未开源,仅作为"评测协议"提供给第三方复现。AI社区对此反应复杂:

  • 支持方:认为评测标准化是开源生态成熟的必经之路。
  • 批评方:质疑Harness本身可能"过拟合"到DeepSeek自家模型——0731在Harness上的高分,是否能泛化到其他Agent框架(如SWE-Agent、AutoCodeRover)仍是开放问题。

DeepSeek对此的回应是:鼓励独立第三方在SWE-bench、Terminal-Bench等公开基准上验证0731。从Hacker News和r/LocalLLaMA的早期用户反馈看,0731在这些公开基准上的实际表现略低于DeepSeek官方数字(差距约3-7分),但仍然显著优于Preview版本——这意味着Harness可能存在轻度过拟合,但"以小博大"的核心结论仍然成立。


三、价格与商业:$0.14/$0.28如何重写Agent经济学

3.1 价格表与对比

模型输入价 ($/MTok)输出价 ($/MTok)缓存命中上下文Terminal-Bench 2.1
DeepSeek V4-Flash 0731$0.14$0.28$0.00281M82.7
GPT-5.6 Sol$5$30$0.50256K~88
GPT-5.6 Luna(8/29降价后)$0.20$1.20256K84.7
Claude Opus 4.8$5$25$0.501M85.0
Claude Sonnet 5(8/31涨价前)$2$10$0.201M80.4
Claude Fable 5$10$50$1.001M~92
阿里 Qwen 3.8-MAX$0.40 (估算)$1.20 (估算)256K78.5 (估算)
智谱 GLM-5.3-Flash$0.05 (估算)$0.10 (估算)1M~70

表4:DeepSeek V4-Flash 0731与主流前沿模型的对比(数据来源:各厂商官方定价、DeepSeek技术报告,2026-08-31)

注:Qwen 3.8-MAX、GLM-5.3-Flash等中文模型定价部分基于公开API文档与社区估算,可能与官方最终定价有出入。

几个关键价格比

  • 比GPT-5.6 Sol便宜约35倍($0.14 vs $5/输入,$0.28 vs $30/输出)。
  • 比Claude Opus 4.8便宜约18倍($0.14 vs $5/输入,$0.28 vs $25/输出)。
  • 比Claude Sonnet 5(涨价前)便宜约7-14倍
  • 比GPT-5.6 Luna(刚降价)便宜约30%——而性能反超Luna。

换句话说:用0731替代GPT-5.6 Sol做Agent任务,成本下降约97%

3.2 Agent经济学:一个1000步任务的价格差异

Agent工作流的一个典型特征是多步骤、每步输出相对短。假设一次完整的Agent任务需要:

  • 1000次LLM调用
  • 平均每次输入5000 Token + 输出500 Token
  • 总计:5M输入 + 0.5M输出

各模型的成本对比:

模型输入成本输出成本总成本相对DeepSeek倍数
DeepSeek V4-Flash 0731$0.70$0.14$0.84
GPT-5.6 Luna$1.00$0.60$1.601.9×
Claude Sonnet 5$10.00$5.00$15.0017.9×
Claude Opus 4.8$25.00$12.50$37.5044.6×
GPT-5.6 Sol$25.00$15.00$40.0047.6×
Claude Fable 5$50.00$25.00$75.0089.3×

表5:1000次Agent调用的成本对比(数据来源:基于各模型官方定价计算,2026-08-31)

对一个每天运行10万次Agent调用的中型企业,模型选择的成本差异是:

  • 用DeepSeek V4-Flash 0731:$84/天(≈$2.5K/月)
  • 用Claude Opus 4.8:$3,750/天(≈$112.5K/月)
  • 用GPT-5.6 Sol:$4,000/天(≈$120K/月)

月成本差距超过10万美元。这个数字足以改变任何中型企业的Agent架构决策。

3.3 MIT开源的杠杆效应

V4-Flash 0731的另一个杀手锏是MIT许可证开源——权重在Hugging Face zai-org/deepseek-ai组织下以FP4/FP8混合精度发布,总大小约167GB

这意味着企业可以:

部署选项硬件门槛月度成本估算
全API调用按Token计费(最便宜)
自托管推理(vLLM + 8×A100/H100)~$150K一次性$5-8K(电费+折旧)
自托管推理(vLLM + 2×RTX 6000 Pro + DSpark)~$15K一次性$300-500(电费)
本地GGUF(Unsloth Q4 / 110GB RAM)$3-5K极低
Ollama Cloud(ollama run deepseek-v4-flash:0731-cloudOllama按使用计费

表6:V4-Flash 0731的部署选项(数据来源:vLLM官方、Unsloth指南、Hugging Face模型卡,2026-08-31)

对于有数据合规需求的企业(医疗、金融、政府),本地部署MIT模型+DSpark是当前最经济的合规方案——比Claude/GPT同档能力的合规部署便宜约50-100倍


四、Day-1生态:Cline、Ollama、vLLM、Unsloth同步支持

4.1 Cline集成:限时免费的Agent调用

AI编程工具Cline在0731发布当天即宣布在其Coding Agent中限时免费集成V4-Flash 0731——这意味着Cline用户可以用"几乎免费"的方式在IDE中体验Opus级Agent能力。

Cline集成的特别之处在于:

# Cline的DeepSeek V4-Flash 0731配置(简化版)config={"provider":"deepseek","model":"deepseek-v4-flash",# 自动路由到0731"api_base":"https://api.deepseek.com","reasoning_effort":"high",# 三档可选:low/high/max"context_window":1048576,"supports_function_calling":True,"supports_responses_api":True,# 兼容OpenAI Responses格式}

4.2 Ollama Cloud与vLLM:1条命令启动

# Ollama Cloud(最简单的体验方式)ollama run deepseek-v4-flash:0731-cloud# vLLM(生产级部署)pipinstall-Uvllm vllm serve deepseek-ai/DeepSeek-V4-Flash-0731\--tensor-parallel-size8\--speculative-method dspark\--max-model-len1048576

4.3 Unsloth GGUF:本地低显存部署

Unsloth为本地部署提供了细致的量化方案:

量化方案显存/内存需求精度损失适用场景
Q4_K_M~110 GB RAM极低(lossless近似)24GB+显存不可得,但有充足内存
Q8_0~162 GB RAM几乎无损接近原精度的本地推理
FP16(原精度)~310 GB RAM无损服务器/工作站
FP4/FP8混合(官方发布)~167 GB官方推荐精度生产部署

表7:Unsloth V4-Flash 0731 GGUF部署规格(数据来源:Unsloth GGUF指南,2026-08-31)

Q4版本的110GB内存需求意味着即使是Mac Studio M3 Ultra(192GB统一内存)也可以本地运行0731——这对个人开发者和小团队意义重大。

4.4 与Codex/Cursor的兼容

V4-Flash 0731 API原生支持OpenAI Responses格式,这意味着它可以直接接入基于OpenAI生态构建的Agent框架:

  • Codex CLI:DeepSeek官方文档明确提供了deepseekprovider配置指南,可作为codex的backend。
  • Cursor:用户可以在Cursor中配置自定义OpenAI-compatible endpoint指向DeepSeek API,获得接近Opus级的能力。
  • Continue.dev / Aider / Cline:所有支持OpenAI格式的工具都可零成本切换。

五、市场反响与战略意义

5.1 立即可见的市场反应

V4-Flash 0731发布24小时内的几个关键反应:

平台/工具反应
ClineDay-1限时免费集成
OllamaCloud平台Day-1上线
OpenRouterToken流量榜预计排名快速上升
Hugging Face模型卡当日下载量破10万
Hacker News主页热门,评论聚焦"评测黑盒"问题
r/LocalLLaMA"DeepSeek Harness"成为讨论焦点

5.2 对OpenAI/Anthropic的压力

0731的发布对前沿厂商的冲击是结构性的:

  1. OpenAI 5.6 Luna的80%降价被反超:Luna的$0.20/$1.20在0731面前显得"既不够便宜,也不够强"。
  2. Claude Sonnet 5同日涨价更显尴尬:Sonnet 5从$2/$10涨到$3/$15,而0731提供接近Opus 4.8的能力+便宜7-14倍
  3. Agent工作流市场重定价:之前认为"Agent必须用Opus/Sol"的认知,被0731的$0.84/1000次调用彻底打破。

5.3 中国大模型"以小博大"路线的胜利

0731是**"MoE稀疏激活+后训练强化学习"路线**的又一次大胜。它证明:

  • 13B激活参数足以做出82.7分Terminal-Bench——这不是参数效率的胜利,而是后训练数据效率的胜利。
  • 架构不变也能实现+20.9分的飞跃——基础模型的能力上限可能已经够用,关键是如何释放。
  • MIT开源+DSpark推测解码+多框架适配形成完整生态壁垒——竞争对手即使做出等价模型,也很难在Day-1覆盖Cline/Ollama/vLLM/Unsloth。

这条路线对中国大模型整体战略的启示:不必追求参数规模的绝对领先,把后训练做得更深、生态做得更密,是更可持续的差异化路径


六、剩余风险与待验证问题

6.1 DeepSeek Harness的"评测过拟合"风险

如前所述,DeepSeek Harness v0.1.1未开源,社区对0731的真实泛化能力仍有质疑。建议:

  • 在SWE-bench Verified、Terminal-Bench 2.1公开版本上做独立测试。
  • 用SWE-Agent、AutoCodeRover等第三方框架重新评估。
  • 在生产环境中先小流量A/B测试,再大规模切换。

6.2 长上下文稳定性

V4-Flash宣称支持1M上下文,但实际在200K+长度的真实任务(如大型代码库理解、超长文档总结)中的表现尚未充分验证。建议:

  • 用LongBench、Needle-in-a-Haystack等公开基准测试。
  • 在长上下文场景中观察是否出现"上下文漂移"(Context Drift)。

6.3 多模态能力

V4-Flash 0731目前仍是纯文本模型。DeepSeek在8/26才发布V4-Flash-Vision-Exp(实验性视觉版),但Vision版的性能尚未公开。Agent工作流中常见的"截图理解+OCR+UI操作"任务,0731仍需配合独立视觉模型。

6.4 DSpark的兼容性

DSpark推测解码头与主模型一同发布,但与vLLM的集成仍属"新功能",生产环境可能遇到:

  • 显存峰值略高(需额外加载推测头)。
  • 边界case的稳定性(推测错误时的回退机制)。
  • 与其他推测解码方法(如n-gram、Lookahead)的兼容性。

七、FAQ

Q1:0731是"新模型"还是"模型升级"?

纯后训练升级,架构与Preview完全一致。可以理解为同一个284B/13B MoE骨架,但后训练数据、强化学习过程、奖励模型都重做了。DeepSeek在技术报告中强调"这是0731不是V4.1或V5"——版本号的命名也表明这是同代内部的优化迭代

Q2:用V4-Flash 0731替代Opus 4.8是否安全?

取决于场景。对编程、终端Agent、工具调用、数据科学等任务,0731的差距已经缩小到2-3分以内,可以替代。但对复杂多轮对话、创意写作、长篇推理、罕见领域知识等任务,Opus 4.8仍有2-5分的优势。建议采用Opus 4.8做关键决策、0731做批量执行的混合架构。

Q3:本地部署需要什么硬件?

最低配置:2张RTX 6000 Pro(约$15K一次性投入),可流畅运行Q4精度。推荐配置:8张A100/H100(约$150K),可运行原精度并启用DSpark。极致配置:Mac Studio M3 Ultra 192GB(约$10K),可本地运行Q4精度但不启用DSpark。

Q4:MIT开源后DeepSeek靠什么赚钱?

企业API调用、定制化训练服务、行业模型(如V4-Flash-Medical、V4-Flash-Finance)、政府/金融客户合规部署,是DeepSeek当前的核心收入来源。开源策略不与商业化矛盾——Meta的Llama系列也是开源,但Meta AI的商业化主要靠云服务和企业方案。

Q5:0731是否意味着DeepSeek已经追上OpenAI/Anthropic?

在Agent工作流的特定任务上,是的。但在前沿推理、跨领域泛化、长程规划等维度,0731距离Opus 4.8/GPT-5.6 Sol仍有2-5分的差距。DeepSeek CEO梁文锋曾在7月公开承认"我们在raw capability上仍然落后前沿3-6个月"——0731没有改变这一判断,只是缩小了在Agent工作流这一具体场景的差距。

Q6:DSpark推测解码会不会显著增加显存?

是的。DSpark需要额外加载推测头(约为主模型的5-8%),总显存峰值上升约8-12%。但由于DSpark带来的1.6-2.4×加速,单位任务的实际显存-时间乘积反而下降

Q7:0731是否兼容OpenAI的工具调用格式?

是的。DeepSeek官方文档明确支持OpenAI Responses API格式、Function Calling、Tools API。开发者可以将0731作为drop-in replacement接入基于OpenAI生态构建的工具链(Codex、Cursor、Cline等)。

Q8:什么时候应该用0731、什么时候应该用Sonnet 5/Opus 4.8?

用0731:批量Agent任务、高频工具调用、代码生成与重构、数据处理pipeline、成本敏感场景。
用Sonnet 5/Opus 4.8:关键业务决策、复杂多轮对话、罕见领域知识、高风险输出审核、长程规划。


参考资料

  1. DeepSeek官方技术报告:V4-Flash 0731版本说明,2026-08-31.
  2. Hugging Face模型卡:deepseek-ai/DeepSeek-V4-Flash-0731(MIT许可证),2026-08-31.
  3. Artificial Analysis:DeepSeek-V4-Flash-0731智能指数评测与价格分析,2026-08-31.
  4. vLLM官方Recipe:DeepSeek-V4-Flash-0731部署指南(含DSpark推测解码),2026-08-31.
  5. Unsloth GGUF:DeepSeek-V4-Flash-0731本地部署量化方案,2026-08-31.
  6. Cline Changelog:V4-Flash 0731限时免费集成,2026-08-31.
  7. Ollama官方博客:DeepSeek-V4-Flash-0731-cloud上线,2026-08-31.
  8. DeepSeek API文档:Responses格式与Function Calling支持说明,2026-08-31.
  9. DPS.MEDIA:DeepSeek V4-Flash 0731评测分析,2026-08-31.
  10. Digital Watch Observatory:DeepSeek upgrades V4-Flash for coding and multi-step tasks,2026-08-31.
  11. Hacker News讨论:DeepSeek-V4-Flash-0731技术细节,2026-08-31.
  12. r/LocalLLaMA:DeepSeek Harness评测体系社区讨论,2026-08-31.
  13. AI Stats Phaseo:AI Release Calendar,2026-08-31.
  14. AI Wiki:Claude Sonnet 5 Tokenizer与定价对比参考,2026-08-31.
  15. 微软Azure AI Foundry:FW-DeepSeek-V4-Flash-0731模型说明,2026-08-31.

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询