摘要
2026年8月31日,DeepSeek将V4-Flash推进到"0731官方版",取代此前上线一个多月的preview版本。架构与规模完全不变——仍为284B总参数 / 13B单Token激活的MoE(256个路由专家 + 1个共享专家 / 每Token激活6个),但通过完整的强化学习后训练重跑,Agent与编程基准实现"非连续跳跃":Terminal-Bench 2.1从61.8跃升至82.7(超GLM-5.2的81.0,逼近Opus 4.8的85.0和GPT-5.6 Luna的84.7)、DeepSWE从7.3暴涨至54.4(超越GLM-5.2的46.2)、NL2Repo从39.4升至54.2、Cybergym从38.7升至76.7、DSBench-FullStack从37.0升至68.7、Toolathlon-Verified从49.7升至70.3。价格保持**$0.14/输入 + $0.28/输出 / $0.0028/缓存命中**,比GPT-5.6 Sol的$5/$30便宜约35倍,比Opus 4.8的$5/$25便宜约18倍,比同日启动重新定价的Claude Sonnet 5的$3/$15便宜约11倍。权重以MIT许可证开源(~167 GB,FP4/FP8混合精度),Day-1生态覆盖vLLM(单flag启用DSpark推测解码)/ Cline(限时免费集成)/ Ollama Cloud(
ollama run deepseek-v4-flash:0731-cloud)/ Unsloth(Q4 110GB、Q8 162GB GGUF)/ Hugging Face。与GPT-5.6 Luna同日降价80%形成微妙对垒——OpenAI降价次日DeepSeek就推出这款性能远超Luna、定价却更低的模型。这是中国大模型"以Flash之身做Opus之实"路线最完整的一次公开演示,也是OpenAI/Anthropic必须正面回应的真正压力点。(全文约5800字)
一、发布背景:一个MoE不动的"纯后训练跃迁"
1.1 为什么这次发布震动市场
8月30日深夜至8月31日凌晨,DeepSeek通过API将deepseek-v4-flash模型名直接路由到新版本0731,同时在Hugging Face上以MIT许可证发布配套权重。模型的结构、规模、参数完全没变——这并不是又一次"新模型",而是一次纯后训练升级:用完整的强化学习流程,把同一个284B/13B MoE的训练结果向前推了一大步。
但这个"推进"的幅度,足以让市场重新评估两个问题:
- Flash级小激活模型的天花板在哪里?
- OpenAI/Anthropic过去一年靠"模型尺寸"建立的护城河,还有多深?
过去两年,主流叙事一直是"更大的模型、更长的训练、更高的成本"。DeepSeek 0731用一组简单数字颠覆了这一叙事:
| 基准 | Preview版本 | 0731官方版 | 绝对跃升 | 对比参照 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 61.8 | 82.7 | +20.9 | 超GLM-5.2(81.0) / 逼近Opus 4.8(85.0) |
| DeepSWE | 7.3 | 54.4 | +47.1 | 超GLM-5.2(46.2) |
| NL2Repo | 39.4 | 54.2 | +14.8 | — |
| Cybergym | 38.7 | 76.7 | +38.0 | — |
| DSBench-FullStack | 37.0 | 68.7 | +31.7 | 接近Opus 4.8的71.6 |
| DSBench-Hard | — | 59.6 | — | 接近Opus 4.8的71.7 |
| Toolathlon-Verified | 49.7 | 70.3 | +20.6 | — |
| Artificial Analysis 智能指数 | 40 | 50 | +10 | — |
表1:DeepSeek V4-Flash 0731核心基准跃升(数据来源:DeepSeek技术报告、Artificial Analysis、kimmonismus benchmark table,2026-08-31)
仅看Terminal-Bench 2.1一项,0731的82.7就超过GLM-5.2的81.0,距离Opus 4.8的85.0只剩2.3分——这是Flash级模型首次系统性接近前沿。考虑到V4-Flash单次激活参数只有Opus 4.8的几分之一,这样的"以小博大"在工程上和商业上都有深远意义。
1.2 与OpenAI降价形成"双日对垒"
这次发布的时机并非偶然:
- 8月29日:OpenAI将GPT-5.6 Luna降价80%,从$1/$6降至**$0.20/$1.20/百万Token**,被普遍解读为应对中国大模型的价格压力。
- 8月31日:DeepSeek推出V4-Flash 0731,价格$0.14/$0.28——比Luna还便宜30%,而Terminal-Bench 2.1得分反超Luna(82.7 vs Luna的84.7仅差2分)。
- 同日:Claude Sonnet 5启动涨价(详见本日第二篇),市场焦点转向"价格战 vs 价值战"。
DeepSeek选在Luna降价次日推出0731,时机选择非常清晰:要在OpenAI制造的成本叙事被市场接受之前,把"低价+高性能"组合的标杆钉死。
1.3 一个不太被讨论的潜台词
DeepSeek在V4-Flash 0731的发布节奏上,还有一个值得注意的细节:V4-Pro的预览版早在6月就已发布,但官方版至今未落地。DeepSeek在变更日志中明确指出:“本更新仅适用于V4-Flash API,V4-Pro API、消费端App/网页模型保持不变。官方版V4-Pro即将发布。”
这意味着DeepSeek正采用"先打磨好用的Flash、再回头补完Pro"的反常规节奏。从工程上看,这种节奏有利于稳定生态——企业用户接入Flash几乎没有迁移成本——但也意味着DeepSeek主动放弃了一部分"前沿品牌"的话语权。
二、技术架构:284B/13B MoE + DSpark推测解码
2.1 与Preview完全一致的MoE骨架
V4-Flash 0731的架构与Preview版本完全一致,继承自V4-Flash-DSpark项目的设计:
| 维度 | 数值 |
|---|---|
| 总参数 | 284B(约304B含DSpark推测头) |
| 单Token激活参数 | 13B(激活率约4.6%) |
| 上下文窗口 | 1M Token(与Preview一致) |
| 路由专家数 | 256个路由专家+ 1个共享专家 |
| 每Token激活专家数 | 6个(Top-6路由) |
| 注意力机制 | 与V4-Flash一致的稀疏+线性注意力混合 |
| 配套模块 | DSpark推测解码头(与模型一同发布) |
| 推理Effort等级 | low / high / max(三档) |
表2:V4-Flash 0731架构规格(数据来源:vLLM官方Recipe、Unsloth GGUF指南、DeepSeek技术报告,2026-08-31)
DSpark是DeepSeek在V4-Flash Preview阶段就预置的推测解码头——一个独立的轻量模型,与主模型一同发布,通过vLLM的单个flag即可启用:
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731\--speculative-method dspark\--num-speculative-tokens8\--max-model-len1048576启用DSpark后,每个解码步可一次预测最多8个候选Token,由主模型并行验证。这对Agent类工作负载尤其关键——长链路工具调用中的小步延迟会累积成数十秒的等待,DSpark在V4-Flash上的实测加速比为1.6-2.4×。
2.2 后训练:从"对齐"到"工作流能力"
DeepSeek在V4-Flash Preview阶段的核心卖点是"参数效率":用13B激活做出与同期前沿50-100B激活模型相当的能力。但Preview在Agent工作流上的短板也很明显——Terminal-Bench 2.1只有61.8分,DeepSWE只有7.3分,距离能"干活"的模型还有显著差距。
0731版本的核心工作,是对预览版模型重新跑了一次完整的强化学习后训练。从基准跃升的特征看,这次后训练重点针对的是"多步骤工具使用 + 真实软件工程任务"这两类:
| 任务类别 | Preview表现 | 0731表现 | 跃升幅度 | 评估方法 |
|---|---|---|---|---|
| 真实软件工程(DeepSWE) | 7.3 | 54.4 | +47.1 | 多文件PR生成 + 测试通过率 |
| 多步任务(Terminal-Bench 2.1) | 61.8 | 82.7 | +20.9 | 终端Agent执行完整工作流 |
| 数据科学(DSBench-FullStack) | 37.0 | 68.7 | +31.7 | 端到端数据项目交付 |
| 网络安全(Cybergym) | 38.7 | 76.7 | +38.0 | 真实漏洞利用场景 |
| 工具选择(Toolathlon-Verified) | 49.7 | 70.3 | +20.6 | 多API工具调用决策 |
表3:0731版本针对Agent工作流的专项跃升(数据来源:DeepSeek技术报告、Artificial Analysis,2026-08-31)
几个值得注意的细节:
- 数据科学任务的跃升(+31.7)说明后训练覆盖了"长程规划+多模态数据理解+Python代码执行"的复合任务,而不仅仅是"代码补全"。
- 网络安全类(+38.0)的高分说明模型对"安全Agent"任务也具备较强能力,这与GLM-5.3、阿里Qwen 3.8-MAX同期在CyberGym上的高分形成了开源大模型在这一领域的"集中突破"。
- DeepSWE从7.3到54.4的跃升是绝对值最大的单项——这个基准要求模型在真实仓库中阅读代码、定位问题、生成多文件补丁、并通过测试。7.3分说明Preview几乎不具备这种能力,54.4分意味着0731已经可以作为初级开发者的辅助完成实际PR。
2.3 DeepSeek Harness:一个待解的"评测体系黑盒"
DeepSeek在0731的技术报告中提到了内部使用的DeepSeek Harness v0.1.1——一套用于评估Agent工作流的标准化框架。这个框架同时支持:
- 多轮工具调用
- 多语言代码执行(Python/JS/Shell)
- 真实仓库工作流(Git checkout、测试运行、PR生成)
- 联网检索+多模态输入
这套Harness并未开源,仅作为"评测协议"提供给第三方复现。AI社区对此反应复杂:
- 支持方:认为评测标准化是开源生态成熟的必经之路。
- 批评方:质疑Harness本身可能"过拟合"到DeepSeek自家模型——0731在Harness上的高分,是否能泛化到其他Agent框架(如SWE-Agent、AutoCodeRover)仍是开放问题。
DeepSeek对此的回应是:鼓励独立第三方在SWE-bench、Terminal-Bench等公开基准上验证0731。从Hacker News和r/LocalLLaMA的早期用户反馈看,0731在这些公开基准上的实际表现略低于DeepSeek官方数字(差距约3-7分),但仍然显著优于Preview版本——这意味着Harness可能存在轻度过拟合,但"以小博大"的核心结论仍然成立。
三、价格与商业:$0.14/$0.28如何重写Agent经济学
3.1 价格表与对比
| 模型 | 输入价 ($/MTok) | 输出价 ($/MTok) | 缓存命中 | 上下文 | Terminal-Bench 2.1 |
|---|---|---|---|---|---|
| DeepSeek V4-Flash 0731 | $0.14 | $0.28 | $0.0028 | 1M | 82.7 |
| GPT-5.6 Sol | $5 | $30 | $0.50 | 256K | ~88 |
| GPT-5.6 Luna(8/29降价后) | $0.20 | $1.20 | — | 256K | 84.7 |
| Claude Opus 4.8 | $5 | $25 | $0.50 | 1M | 85.0 |
| Claude Sonnet 5(8/31涨价前) | $2 | $10 | $0.20 | 1M | 80.4 |
| Claude Fable 5 | $10 | $50 | $1.00 | 1M | ~92 |
| 阿里 Qwen 3.8-MAX | $0.40 (估算) | $1.20 (估算) | — | 256K | 78.5 (估算) |
| 智谱 GLM-5.3-Flash | $0.05 (估算) | $0.10 (估算) | — | 1M | ~70 |
表4:DeepSeek V4-Flash 0731与主流前沿模型的对比(数据来源:各厂商官方定价、DeepSeek技术报告,2026-08-31)
注:Qwen 3.8-MAX、GLM-5.3-Flash等中文模型定价部分基于公开API文档与社区估算,可能与官方最终定价有出入。
几个关键价格比:
- 比GPT-5.6 Sol便宜约35倍($0.14 vs $5/输入,$0.28 vs $30/输出)。
- 比Claude Opus 4.8便宜约18倍($0.14 vs $5/输入,$0.28 vs $25/输出)。
- 比Claude Sonnet 5(涨价前)便宜约7-14倍。
- 比GPT-5.6 Luna(刚降价)便宜约30%——而性能反超Luna。
换句话说:用0731替代GPT-5.6 Sol做Agent任务,成本下降约97%。
3.2 Agent经济学:一个1000步任务的价格差异
Agent工作流的一个典型特征是多步骤、每步输出相对短。假设一次完整的Agent任务需要:
- 1000次LLM调用
- 平均每次输入5000 Token + 输出500 Token
- 总计:5M输入 + 0.5M输出
各模型的成本对比:
| 模型 | 输入成本 | 输出成本 | 总成本 | 相对DeepSeek倍数 |
|---|---|---|---|---|
| DeepSeek V4-Flash 0731 | $0.70 | $0.14 | $0.84 | 1× |
| GPT-5.6 Luna | $1.00 | $0.60 | $1.60 | 1.9× |
| Claude Sonnet 5 | $10.00 | $5.00 | $15.00 | 17.9× |
| Claude Opus 4.8 | $25.00 | $12.50 | $37.50 | 44.6× |
| GPT-5.6 Sol | $25.00 | $15.00 | $40.00 | 47.6× |
| Claude Fable 5 | $50.00 | $25.00 | $75.00 | 89.3× |
表5:1000次Agent调用的成本对比(数据来源:基于各模型官方定价计算,2026-08-31)
对一个每天运行10万次Agent调用的中型企业,模型选择的成本差异是:
- 用DeepSeek V4-Flash 0731:$84/天(≈$2.5K/月)
- 用Claude Opus 4.8:$3,750/天(≈$112.5K/月)
- 用GPT-5.6 Sol:$4,000/天(≈$120K/月)
月成本差距超过10万美元。这个数字足以改变任何中型企业的Agent架构决策。
3.3 MIT开源的杠杆效应
V4-Flash 0731的另一个杀手锏是MIT许可证开源——权重在Hugging Face zai-org/deepseek-ai组织下以FP4/FP8混合精度发布,总大小约167GB。
这意味着企业可以:
| 部署选项 | 硬件门槛 | 月度成本估算 |
|---|---|---|
| 全API调用 | 无 | 按Token计费(最便宜) |
| 自托管推理(vLLM + 8×A100/H100) | ~$150K一次性 | $5-8K(电费+折旧) |
| 自托管推理(vLLM + 2×RTX 6000 Pro + DSpark) | ~$15K一次性 | $300-500(电费) |
| 本地GGUF(Unsloth Q4 / 110GB RAM) | $3-5K | 极低 |
Ollama Cloud(ollama run deepseek-v4-flash:0731-cloud) | 无 | Ollama按使用计费 |
表6:V4-Flash 0731的部署选项(数据来源:vLLM官方、Unsloth指南、Hugging Face模型卡,2026-08-31)
对于有数据合规需求的企业(医疗、金融、政府),本地部署MIT模型+DSpark是当前最经济的合规方案——比Claude/GPT同档能力的合规部署便宜约50-100倍。
四、Day-1生态:Cline、Ollama、vLLM、Unsloth同步支持
4.1 Cline集成:限时免费的Agent调用
AI编程工具Cline在0731发布当天即宣布在其Coding Agent中限时免费集成V4-Flash 0731——这意味着Cline用户可以用"几乎免费"的方式在IDE中体验Opus级Agent能力。
Cline集成的特别之处在于:
# Cline的DeepSeek V4-Flash 0731配置(简化版)config={"provider":"deepseek","model":"deepseek-v4-flash",# 自动路由到0731"api_base":"https://api.deepseek.com","reasoning_effort":"high",# 三档可选:low/high/max"context_window":1048576,"supports_function_calling":True,"supports_responses_api":True,# 兼容OpenAI Responses格式}4.2 Ollama Cloud与vLLM:1条命令启动
# Ollama Cloud(最简单的体验方式)ollama run deepseek-v4-flash:0731-cloud# vLLM(生产级部署)pipinstall-Uvllm vllm serve deepseek-ai/DeepSeek-V4-Flash-0731\--tensor-parallel-size8\--speculative-method dspark\--max-model-len10485764.3 Unsloth GGUF:本地低显存部署
Unsloth为本地部署提供了细致的量化方案:
| 量化方案 | 显存/内存需求 | 精度损失 | 适用场景 |
|---|---|---|---|
| Q4_K_M | ~110 GB RAM | 极低(lossless近似) | 24GB+显存不可得,但有充足内存 |
| Q8_0 | ~162 GB RAM | 几乎无损 | 接近原精度的本地推理 |
| FP16(原精度) | ~310 GB RAM | 无损 | 服务器/工作站 |
| FP4/FP8混合(官方发布) | ~167 GB | 官方推荐精度 | 生产部署 |
表7:Unsloth V4-Flash 0731 GGUF部署规格(数据来源:Unsloth GGUF指南,2026-08-31)
Q4版本的110GB内存需求意味着即使是Mac Studio M3 Ultra(192GB统一内存)也可以本地运行0731——这对个人开发者和小团队意义重大。
4.4 与Codex/Cursor的兼容
V4-Flash 0731 API原生支持OpenAI Responses格式,这意味着它可以直接接入基于OpenAI生态构建的Agent框架:
- Codex CLI:DeepSeek官方文档明确提供了
deepseekprovider配置指南,可作为codex的backend。 - Cursor:用户可以在Cursor中配置自定义OpenAI-compatible endpoint指向DeepSeek API,获得接近Opus级的能力。
- Continue.dev / Aider / Cline:所有支持OpenAI格式的工具都可零成本切换。
五、市场反响与战略意义
5.1 立即可见的市场反应
V4-Flash 0731发布24小时内的几个关键反应:
| 平台/工具 | 反应 |
|---|---|
| Cline | Day-1限时免费集成 |
| Ollama | Cloud平台Day-1上线 |
| OpenRouter | Token流量榜预计排名快速上升 |
| Hugging Face | 模型卡当日下载量破10万 |
| Hacker News | 主页热门,评论聚焦"评测黑盒"问题 |
| r/LocalLLaMA | "DeepSeek Harness"成为讨论焦点 |
5.2 对OpenAI/Anthropic的压力
0731的发布对前沿厂商的冲击是结构性的:
- OpenAI 5.6 Luna的80%降价被反超:Luna的$0.20/$1.20在0731面前显得"既不够便宜,也不够强"。
- Claude Sonnet 5同日涨价更显尴尬:Sonnet 5从$2/$10涨到$3/$15,而0731提供接近Opus 4.8的能力+便宜7-14倍。
- Agent工作流市场重定价:之前认为"Agent必须用Opus/Sol"的认知,被0731的$0.84/1000次调用彻底打破。
5.3 中国大模型"以小博大"路线的胜利
0731是**"MoE稀疏激活+后训练强化学习"路线**的又一次大胜。它证明:
- 13B激活参数足以做出82.7分Terminal-Bench——这不是参数效率的胜利,而是后训练数据效率的胜利。
- 架构不变也能实现+20.9分的飞跃——基础模型的能力上限可能已经够用,关键是如何释放。
- MIT开源+DSpark推测解码+多框架适配形成完整生态壁垒——竞争对手即使做出等价模型,也很难在Day-1覆盖Cline/Ollama/vLLM/Unsloth。
这条路线对中国大模型整体战略的启示:不必追求参数规模的绝对领先,把后训练做得更深、生态做得更密,是更可持续的差异化路径。
六、剩余风险与待验证问题
6.1 DeepSeek Harness的"评测过拟合"风险
如前所述,DeepSeek Harness v0.1.1未开源,社区对0731的真实泛化能力仍有质疑。建议:
- 在SWE-bench Verified、Terminal-Bench 2.1公开版本上做独立测试。
- 用SWE-Agent、AutoCodeRover等第三方框架重新评估。
- 在生产环境中先小流量A/B测试,再大规模切换。
6.2 长上下文稳定性
V4-Flash宣称支持1M上下文,但实际在200K+长度的真实任务(如大型代码库理解、超长文档总结)中的表现尚未充分验证。建议:
- 用LongBench、Needle-in-a-Haystack等公开基准测试。
- 在长上下文场景中观察是否出现"上下文漂移"(Context Drift)。
6.3 多模态能力
V4-Flash 0731目前仍是纯文本模型。DeepSeek在8/26才发布V4-Flash-Vision-Exp(实验性视觉版),但Vision版的性能尚未公开。Agent工作流中常见的"截图理解+OCR+UI操作"任务,0731仍需配合独立视觉模型。
6.4 DSpark的兼容性
DSpark推测解码头与主模型一同发布,但与vLLM的集成仍属"新功能",生产环境可能遇到:
- 显存峰值略高(需额外加载推测头)。
- 边界case的稳定性(推测错误时的回退机制)。
- 与其他推测解码方法(如n-gram、Lookahead)的兼容性。
七、FAQ
Q1:0731是"新模型"还是"模型升级"?
是纯后训练升级,架构与Preview完全一致。可以理解为同一个284B/13B MoE骨架,但后训练数据、强化学习过程、奖励模型都重做了。DeepSeek在技术报告中强调"这是0731不是V4.1或V5"——版本号的命名也表明这是同代内部的优化迭代。
Q2:用V4-Flash 0731替代Opus 4.8是否安全?
取决于场景。对编程、终端Agent、工具调用、数据科学等任务,0731的差距已经缩小到2-3分以内,可以替代。但对复杂多轮对话、创意写作、长篇推理、罕见领域知识等任务,Opus 4.8仍有2-5分的优势。建议采用Opus 4.8做关键决策、0731做批量执行的混合架构。
Q3:本地部署需要什么硬件?
最低配置:2张RTX 6000 Pro(约$15K一次性投入),可流畅运行Q4精度。推荐配置:8张A100/H100(约$150K),可运行原精度并启用DSpark。极致配置:Mac Studio M3 Ultra 192GB(约$10K),可本地运行Q4精度但不启用DSpark。
Q4:MIT开源后DeepSeek靠什么赚钱?
企业API调用、定制化训练服务、行业模型(如V4-Flash-Medical、V4-Flash-Finance)、政府/金融客户合规部署,是DeepSeek当前的核心收入来源。开源策略不与商业化矛盾——Meta的Llama系列也是开源,但Meta AI的商业化主要靠云服务和企业方案。
Q5:0731是否意味着DeepSeek已经追上OpenAI/Anthropic?
在Agent工作流的特定任务上,是的。但在前沿推理、跨领域泛化、长程规划等维度,0731距离Opus 4.8/GPT-5.6 Sol仍有2-5分的差距。DeepSeek CEO梁文锋曾在7月公开承认"我们在raw capability上仍然落后前沿3-6个月"——0731没有改变这一判断,只是缩小了在Agent工作流这一具体场景的差距。
Q6:DSpark推测解码会不会显著增加显存?
是的。DSpark需要额外加载推测头(约为主模型的5-8%),总显存峰值上升约8-12%。但由于DSpark带来的1.6-2.4×加速,单位任务的实际显存-时间乘积反而下降。
Q7:0731是否兼容OpenAI的工具调用格式?
是的。DeepSeek官方文档明确支持OpenAI Responses API格式、Function Calling、Tools API。开发者可以将0731作为drop-in replacement接入基于OpenAI生态构建的工具链(Codex、Cursor、Cline等)。
Q8:什么时候应该用0731、什么时候应该用Sonnet 5/Opus 4.8?
用0731:批量Agent任务、高频工具调用、代码生成与重构、数据处理pipeline、成本敏感场景。
用Sonnet 5/Opus 4.8:关键业务决策、复杂多轮对话、罕见领域知识、高风险输出审核、长程规划。
参考资料
- DeepSeek官方技术报告:V4-Flash 0731版本说明,2026-08-31.
- Hugging Face模型卡:deepseek-ai/DeepSeek-V4-Flash-0731(MIT许可证),2026-08-31.
- Artificial Analysis:DeepSeek-V4-Flash-0731智能指数评测与价格分析,2026-08-31.
- vLLM官方Recipe:DeepSeek-V4-Flash-0731部署指南(含DSpark推测解码),2026-08-31.
- Unsloth GGUF:DeepSeek-V4-Flash-0731本地部署量化方案,2026-08-31.
- Cline Changelog:V4-Flash 0731限时免费集成,2026-08-31.
- Ollama官方博客:DeepSeek-V4-Flash-0731-cloud上线,2026-08-31.
- DeepSeek API文档:Responses格式与Function Calling支持说明,2026-08-31.
- DPS.MEDIA:DeepSeek V4-Flash 0731评测分析,2026-08-31.
- Digital Watch Observatory:DeepSeek upgrades V4-Flash for coding and multi-step tasks,2026-08-31.
- Hacker News讨论:DeepSeek-V4-Flash-0731技术细节,2026-08-31.
- r/LocalLLaMA:DeepSeek Harness评测体系社区讨论,2026-08-31.
- AI Stats Phaseo:AI Release Calendar,2026-08-31.
- AI Wiki:Claude Sonnet 5 Tokenizer与定价对比参考,2026-08-31.
- 微软Azure AI Foundry:FW-DeepSeek-V4-Flash-0731模型说明,2026-08-31.