大模型价格战全面爆发:DeepSeek V4 Flash、GPT-5.6降价与GLM涨价的三角博弈
2026/8/6 16:00:43 网站建设 项目流程

大模型价格战全面爆发:DeepSeek V4 Flash、GPT-5.6降价与GLM涨价的三角博弈

2026年8月,大模型行业在一周之内经历了三种截然相反的定价策略——OpenAI把GPT-5.6 Luna砍价80%,DeepSeek用V4 Flash正式版把运行成本打到全球最低,智谱GLM却逆势涨价261%。这不是简单的价格调整,而是一场关于大模型商业化路径的根本性博弈。


一、一周三声枪响:三种定价策略的同台对决

7月30日到8月3日,大模型API市场在五天之内被三次"重塑"。

第一枪:OpenAI主动降价。7月30日,OpenAI宣布GPT-5.6 Luna价格下调80%——输入从每百万Token 1美元降至0.2美元,输出从6美元降至1.2美元。Terra也同步下调20%。旗舰模型Sol维持原价,但新增Fast模式(2倍价格换2.5倍速度)。Sam Altman的表述是:"在每一个模型层级,都提供最好的价格与智能比。"

值得注意的是,这次降价的"功劳"部分来自GPT-5.6自己。OpenAI披露,GPT-5.6 Sol在Codex中自主重写了生产环境的GPU Kernel,将端到端服务成本降低了20%,推测解码优化让Token生成效率提升15%以上。模型帮助优化自身推理系统,再将效率收益转化为价格下调——这在AI行业尚属首次。

第二枪:DeepSeek以价制价。7月31日,DeepSeek V4 Flash正式版API上线公测。没有发布会,没有高调宣传,但数据足以让行业震动:总参数2840亿,激活参数仅130亿(MoE架构),支持100万Token上下文窗口。Agent能力大幅跃升——Terminal Bench 2.1得分82.7,Cybergym得分76.7,在多项Agent基准上全面超越三个月前的V4-Pro预览版。

定价更加激进:每百万输入Token 0.14美元(缓存未命中)或0.0028美元(缓存命中),每百万输出Token 0.28美元。按Artificial Analysis的智能指数任务成本计算,V4 Flash每项任务平均成本仅3美分——而Kimi K3为86美分,GPT-5.6 Sol为1.86美元,Claude Fable 5为3.15美元。V4 Flash的运行成本只有Claude Fable 5的不到百分之一。

第三枪:智谱逆势涨价。就在DeepSeek和OpenAI争相降价的同时,智谱GLM Coding Plan新版上线,采用积分制——Pro版月费从149元涨到538元,涨幅261%;Max版从469元涨到1078元,涨幅130%。API层面,GLM-5.2的Prompt价格从0.28美元/百万Token涨到1.19美元,Completion从0.89美元涨到3.74美元,涨幅均超过3倍。

三种定价策略背后,是三种完全不同的商业逻辑。问题在于:谁的选择是对的?


二、数据透视:7.22万亿Token背后的格局重构

OpenRouter最新周报(7月27日-8月2日)给出了最直观的答案。

DeepSeek V4 Flash以7.22万亿Token的周调用量位居所有模型第一。全球调用量排名前五均为中国AI大模型:小米MiMo-V2.5、DeepSeek V4 Flash、腾讯HY3、智谱GLM-5.2、DeepSeek V4 Pro。中国AI大模型已连续14周在全球调用量排名中领跑,整体市场份额约63.5%,美国模型约35.5%。

这个数据需要放在更大的坐标系里理解。Gartner预计,2026年全球AI优化型IaaS终端用户支出将达到375亿美元,同比增长约105%。其中推理支出预计达到206亿美元,首次超过训练支出。到2029年,推理支出占比将超过65%。

推理正在取代训练,成为大模型行业最大的成本中心和收入来源。而DeepSeek以最低的推理成本拿下了最高的调用量——这不是"赔本赚吆喝",而是"用规模换壁垒"的典型互联网打法。

一名港股AI分析师的评价一针见血:"当市场还在争论'参数竞赛'是否可持续时,DeepSeek证明后训练优化足以让轻量级模型释放接近顶级闭源模型的Agent能力。这意味着推理成本曲线可能比我们预期的更陡峭,对整个产业链的估值体系都会产生连锁反应。"

OpenCode CEO透露的数据也印证了这一点:V4 Flash上线首日,其平台调用量提升30%,新注册用户同步增长30%。多名海外AI初创创始人在X平台表示,团队全线迁移至DeepSeek后,月度推理成本下降60%至85%。


三、85倍价差:三家定价策略的成本结构拆解

把三个模型放在同一张价格表上,差距的触目惊心程度远超想象。

模型输入($/百万Token)输出($/百万Token)智能指数(满分100)单任务成本
DeepSeek V4 Flash0.14(命中0.0028)0.2850$0.03
GPT-5.6 Luna(降价后)0.201.2051+$0.05
GPT-5.6 Sol(不变)5.0030.0056$1.86
Claude Fable 5--57$3.15
GLM-5.2(涨价后)1.193.7451-
Kimi K3--55$0.86

Claude Opus每百万输出Token定价大约是V4 Flash的85倍,而智能指数仅高出6分。换句话说,多拿6分,调用费高出52倍。

V2EX上一个99回复的热帖标题很直白:"最新的deepseek-v4-flash正式版真的有这么强吗?"另一个56回复的帖子则在讨论智谱涨价:"智普今天这波涨价,有点迷,涨了快3倍。"开发者的选型天平正在快速倾斜。

DeepSeek为什么能这么便宜?核心在MoE架构——2840亿总参数中每次推理仅激活130亿,这意味着实际计算量远小于参数规模暗示的水平。再加上后训练优化和峰谷定价机制(缓存命中时输入成本降至0.0028美元/百万Token),DeepSeek把"按10个月回本算都这么便宜"变成了现实。

OpenAI为什么选择降价?效率提升是直接原因,但更深层的原因是竞争压力。Luna降价80%后的月度账单(按5000万输入+500万输出Token/天计算)约为480美元,介于MiniMax M3(630美元)和DeepSeek V4 Flash(252美元)之间。OpenAI试图用降价守住中低端市场——但即便降价80%,DeepSeek的单任务成本仍比Luna低约60%。

智谱为什么逆势涨价?表面上看,智谱的解释是"需求爆发"——旧版套餐长期限售,每天上午10点限量开放购买。但更深的原因可能是算力成本压力:智谱已落地1GW级国产AI算力数据中心,全部采用国产芯片。国产芯片的推理效率与英伟达GPU仍有差距,这意味着智谱的单位推理成本可能高于使用H100的竞争对手。涨价可能不是"想赚更多",而是"不得不涨"。

一位开发者在V2EX上的吐槽很能代表情绪:"GLM涨价3倍,能力只差1分,凭什么要支付十几倍价格,还承担限流风险?"


四、开发者选型重构:从"信仰"到"账单"

价格战正在从根本上改变开发者的选型逻辑。

一年前,开发者的选型链路是:看跑分 → 看模型能力 → 看生态 → 看价格。价格是最后考虑的因素,因为所有模型都很贵,差异不大。

现在,选型链路变成了:看价格 → 看智能指数差距 → 看Agent能力 → 看稳定性。当一个模型的运行成本只有另一个的百分之一,而智能指数只差6分时,价格成了第一决策因素。

V2EX上的讨论反映了一个关键趋势:开发者的使用方式正在分化。

  • 重度场景(复杂推理、代码生成、长文档分析):仍然使用GPT-5.6 Sol或Claude Fable 5,追求最高质量
  • 日常场景(信息汇总、文件总结、简单编程):全面迁移到DeepSeek V4 Flash,追求极致性价比
  • 中间地带(中等复杂度任务):使用GPT-5.6 Luna(降价后)或Kimi K3,在质量和成本之间找平衡

一位AI开发者张泽给了每经记者一组直观的数据:他把V4 Flash接入Hermes执行了一次本地文件阅读和全网信息检索汇总任务,用量约51万Tokens,消耗0.53元。"最直观的感受就是任务处理速度很快,40秒完成,而GPT-5.6 Sol Codex用了1分47秒。当然Codex输出质量更高一些,不过V4 Flash的交付也达到了可用水平。"

GitHub上的开源生态也在围绕DeepSeek快速构建。antirez/ds4(DeepSeek 4本地推理引擎)获得2万Star,esengine/DeepSeek-Reasonix(DeepSeek原生AI编码Agent)登上Trending。一个完整的DeepSeek工具链正在形成——从云端API到本地推理,从编码Agent到安全工具,开源社区正在用脚投票。


五、开源生态共振:围绕DeepSeek的工具链正在成型

GitHub Trending不仅是一个排行榜,更是开发者注意力的风向标。

在2026年8月初的Trending列表中,与DeepSeek直接相关的项目至少有三个:antirez/ds4(DeepSeek 4本地推理引擎,C语言,2万Star),esengine/DeepSeek-Reasonix(DeepSeek原生AI编码Agent),以及多个基于DeepSeek API的Agent框架。

这不是偶然。当一个模型的API价格低到开发者"不需要犹豫"的程度时,围绕它构建工具链的动力就会指数级增长。就像2010年代围绕AWS构建的云生态一样——低价的基础设施催生了庞大的上层应用。

更值得注意的是,DeepSeek在Harness(包裹在AI模型外的工作条件基础设施)领域的布局。崔添翼在6月21日发文表示DeepSeek Harness组是新成立的部门,目标远大、工作繁重。中信证券认为,Harness的核心价值在于"将模型能力转化为稳定、低成本的端到端交付"——这正是从"能聊天"到"能干活"的关键一跃。

V4 Flash正式版首次披露了DeepSeek Harness的新进展:即将公布。这意味着DeepSeek不仅在卖模型,还在卖一整套让模型"能干活"的基础设施。当模型+Harness形成闭环,竞争壁垒就不再只是价格,而是生态。


六、冷思考:降价能否持续?

价格战的终局在哪里?这需要从三个维度审视。

算力成本拐点何时到来?Dwarkesh Patel在7月29日撰文预测"未来几年算力可能贵十倍以上",理由是AI芯片需求增速远超供给。如果这个判断成立,那么当前的低价策略可能不可持续——DeepSeek的低价建立在MoE架构效率之上,但如果底层算力成本持续攀升,MoE的效率优势会被侵蚀。

但反方观点同样有力:新一代AI芯片(英伟达Blackwell Ultra、国产替代芯片)的推理效率正在快速提升,而推理优化的软件技术(推测解码、KV Cache压缩、连续批处理)也在迭代。OpenAI用GPT-5.6 Sol自主优化推理系统、降低20%服务成本的案例证明,软件层面的效率提升空间还很大。

商业化拐点是否到来?Gartner预测2026年推理支出首次超过训练支出,意味着行业正从"烧钱训练"转向"靠推理赚钱"。但问题是,当DeepSeek把单任务成本压到3美分时,即使调用量达到7.22万亿Token/周,收入能否覆盖算力和研发成本?

参考一个估算:按V4 Flash的输出价格0.28美元/百万Token计算,7.22万亿Token中假设输出占20%(约1.44万亿),收入约403万美元/周,年化约2.1亿美元。这个数字与OpenAI的年化收入(数十亿美元)仍有数量级差距。但DeepSeek的成本结构也远低于OpenAI——MoE架构+国产算力+后训练优化,三重压缩使得盈亏平衡点远低于竞争对手。

行业格局会怎样演化?最可能的终局是"三层金字塔":

  • 顶层:GPT-5.6 Sol、Claude Fable 5——靠最强能力维持溢价,服务对质量极度敏感的场景
  • 中层:GPT-5.6 Luna(降价后)、Kimi K3、GLM-5.2——在质量和成本之间寻找平衡点,但GLM涨价后竞争力堪忧
  • 底层:DeepSeek V4 Flash、小米MiMo-V2.5——靠极致性价比+开源生态+Harness基础设施,吃下最大量的日常推理需求

智谱的处境最微妙。GLM-5.2智能指数51分,与V4 Flash的50分几乎持平,但价格高出十几倍。涨价可以短期改善收入,但长期会加速开发者流失。除非智谱能在Coding和Agent场景上拉开与DeepSeek的能力差距,否则涨价策略的可持续性存疑。


七、结语:价格战的本质是路线之争

大模型价格战看似是定价策略的博弈,本质上是三条技术路线的较量。

OpenAI的路线:用最强大模型优化自身推理系统→降低服务成本→降价→吸引更多用户→获得更多推理数据→进一步优化模型。这是一个"能力驱动成本下降"的飞轮,但前提是模型能力必须持续领先。

DeepSeek的路线:用MoE架构+后训练优化把推理成本压到极致→低价吸引最大量调用→构建Harness生态和开源工具链→形成基础设施级壁垒。这是"规模驱动生态成型"的飞轮,核心在于能否持续保持成本优势。

智谱的路线:用国产算力+涨价维持收入→在高价值Coding/Agent场景深耕→靠差异化能力建立溢价。这是"价值驱动溢价"的飞轮,但前提是差异化能力足够明显。

三条路线谁能跑通,不取决于今天的定价高低,而取决于明天的技术迭代速度。但有一点是确定的:大模型行业已经从"谁的模型最强"的时代,进入了"谁的模型最值"的时代。而对开发者来说,这可能是最好的时代——当AI从奢侈品变成基础设施,创新的门槛正在被前所未有地降低。


本文基于OpenRouter周报、Artificial Analysis测试数据、OpenAI官方公告、DeepSeek官方更新日志、智谱Coding Plan公告、V2EX社区讨论及多家媒体报道综合撰写。数据截至2026年8月5日。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询