从Kimi K3暂停订阅到DeepSeek V4峰谷计费:国产大模型告别粗放烧钱时代
2.8万亿参数登顶后48小时算力告急,DeepSeek首次引入峰谷定价——三家头部国产大模型在同一周同时面临"从烧钱到赚钱"的拐点。
一、一周三重奏:K3、V4、Qwen3.8的密集动作
7月的第三周,国产大模型头部三家公司几乎同步出手,但各人的烦恼却截然不同。
图2:GitHub Trending 榜单能反映开发者社区正在关注的技术方向,AI 编程和代码智能类项目持续占据高位(来源:github.com/trending,2026-07-21 截图)
Kimi K3:登顶之后的服务器告急。7月16日,月之暗面发布Kimi K3,2.8万亿参数,全球最大开源模型,基于KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,100万token上下文窗口。上线不到一天,在前端代码Arena评测中超越GPT-5.6 Sol和Claude Fable 5,登顶榜首。Arena负责人安杰洛普洛斯评价称"或将引发资本市场重新洗牌"。
图4:Kimi 官网当前仍主推 K2.6 标准版,K3 的订阅入口已暂停开放,侧面印证算力紧张(来源:kimi.moonshot.cn,2026-07-21 截图)
但热度来得太快。7月19日深夜——距发布仅48小时——月之暗面发布公开信《致Kimi用户:关于算力紧缺与会员暂停开放的说明》,宣布即日起暂停C端新用户订阅。"过去48小时,用户请求量已大幅超出我们的预估,并逼近现有集群的承载极限。"已有算力全部投入服务已订阅用户,同时全速推进算力扩容。
这是中国大模型公司第一次因为"用户太多"而主动关门。
DeepSeek V4:峰谷计费首现。几乎同期,DeepSeek V4正式版全量上线,分为V4 Pro(1.6万亿参数)和V4 Flash(2840亿参数)两个版本,均标配1M上下文。内部测试显示V4整体表现逼近Opus 4.8,编码能力直追GPT-5.6 Sol,Agent能力相比前代有质的飞跃。
但V4最受关注的不是性能,而是定价策略——峰谷计费。每日9:00-12:00和14:00-18:00(工作日)定义为高峰时段,API价格为平时的2倍。以V4 Pro为例:
图3:DeepSeek API 文档的 Models & Pricing 页面显示,V4 系列已区分 Flash/Pro 两种模型(来源:api-docs.deepseek.com,2026-07-21 截图)
| 计费项 | 平时段 | 高峰时段 |
|---|---|---|
| 输入(缓存命中) | 0.025元/百万tokens | 0.05元 |
| 输入(缓存未命中) | 3元/百万tokens | 6元 |
| 输出 | 6元/百万tokens | 12元 |
V4 Flash更低:平时输出2元,高峰4元。对比GPT-5.4的73元、Claude Opus 4.8的180元,DeepSeek即使高峰翻倍也仅有对方的六分之一到十五分之一。
这是全球大模型行业首次出现峰谷定价机制。
Qwen3.8:预览版低调发布。7月19日,阿里巴巴通义千问发布Qwen3.8预览版,2.4万亿参数,采用动态稀疏自适应门控架构。预览版API已开放申请,正式版预计8月上线。
三家头部在一周内的密集动作,指向同一个信号:国产大模型竞争的核心变量,正在从"参数规模和开源节奏"切换到"算力成本运营与可持续商业模式"。
二、两种算力供需管理策略:配额制 vs 价格制
Kimi和DeepSeek面对的是同一个问题——算力供需失衡——但给出了截然不同的解决方案。
Kimi的配额制:用准入控制需求
Kimi K3选择暂停新用户订阅,本质是配额制——通过控制用户准入数量来保护已有算力资源。这是一种"被动防御"策略:
- 优点:保障存量用户体验,避免服务器崩溃
- 缺点:流失潜在付费用户,给竞争对手窗口期
- 适用场景:需求爆发式增长,短期算力无法扩容
月之暗面还同步拆分了Kimi主权益(Web/App/Work)和Kimi Code权益,目的是"更精准匹配算力"——本质上是把用户分层,不同层级消耗不同算力。
DeepSeek的价格制:用价格调度需求
DeepSeek选择峰谷定价,本质是价格制——用价格信号引导用户错峰使用。这是一种"主动调节"策略:
- 优点:不拒绝任何用户,用经济杠杆平抑需求峰值
- 缺点:高峰时段涨价可能劝退价格敏感型开发者
- 适用场景:算力有一定余量但峰值集中,需要平滑需求曲线
DeepSeek的逻辑类似电力系统的峰谷电价:白天工业用电高峰时电价贵,夜间低谷时电价便宜,引导用户错峰。对于一个API调用量在工作时间高度集中的开发者群体来说,这种策略尤其有效——大量非实时任务可以转移到夜间和周末执行。
为什么选择不同?
两家公司的策略差异背后是业务结构差异:
- Kimi:C端用户为主,个人用户的请求具有即时性(对话、写作、搜索),难以错峰。用户不会等到凌晨2点再问AI问题。因此配额制比价格制更有效。
- DeepSeek:开发者API为主,编程任务、批量推理任务天然可以错峰。一个开发者完全可以让AI在夜间跑代码生成任务。因此价格制比配额制更有效。
这不是谁对谁错的问题,而是面对不同用户群体时的策略适配。
三、行业趋势:从"免费换流量"到"精算投入产出"
Kimi暂停订阅和DeepSeek峰谷计费,不是孤立事件,而是一个行业性拐点的缩影。
头部厂商集体涨价
2026年3月以来,国内主流大模型厂商先后上调API或算力产品价格:
- 智谱:GLM-4.6 API价格上调约30%
- 阿里云:通义千问API按场景分级定价
- 腾讯云:混元大模型推出企业版差异化定价
- 百度智能云:文心一言API价格结构调整
- MiniMax:abab系列模型涨价
当需求大到服务器扛不住时,用价格或配额来调节,正在成为行业共性选择。
海外对比:主动调价 vs 被动限流
海外巨头同样在探索商业化新路径,但节奏和逻辑不同:
- OpenAI:7月发布GPT-5.6系列,三款模型三种价格(Luna/High、Terra/Ultra、Sol/High),让用户按需选择
- 谷歌:5月宣布Gemini从按次计费转向按算力消耗计费
- Anthropic:6月底推出Claude Sonnet 5,7月同步限时优惠定价
海外巨头的调价更多是主动优化盈利结构,而国内头部厂商面临的算力供需失衡更为尖锐——这既折射出国产大模型真实的市场热度,也暴露了算力基础设施建设与需求增长之间的张力。
商业化提速的信号
两家公司同步传出上市消息:
- 月之暗面:据澎湃新闻报道,预计最快6个月内完成港股上市,已向投资人沟通上市议案
- DeepSeek:据市场消息,正在评估包括A股在内的资本化路径,年化营收逼近5亿美元
从技术竞赛到资本化布局,从烧钱换流量到精算投入产出比——国产大模型正在经历一次根本性的角色切换。
四、算力经济学:比模型参数更紧迫的命题
算力成本结构
一个大模型公司的算力成本主要由三部分构成:
- 训练成本:训练一次万亿级模型的GPU集群租用/折旧费用。K3训练据报道使用了超过3000张H100级GPU
- 推理成本:每处理一次用户请求消耗的GPU算力。K3的2.8万亿参数意味着每次推理都要激活更多参数
- 扩容成本:新增GPU集群的采购和部署周期。从下单到上线通常需要3-6个月
Kimi K3面临的困境是:训练已经完成,但推理需求的增速远超预期,而扩容需要时间——这就是"幸福的烦恼"的本质。
稀疏激活:技术路线的成本差异
值得注意的是,三家公司的技术路线在算力效率上存在结构性差异:
- Kimi K3:2.8万亿参数,全量激活(Dense模型),推理成本最高
- DeepSeek V4 Pro:1.6万亿参数,推理计算量仅为V3.2的27%
- Qwen3.8:2.4万亿参数,动态稀疏自适应门控,按需激活参数
稀疏激活架构(MoE/动态门控)的优势在于:模型总参数可以做得很大,但每次推理只激活一小部分参数,从而降低推理成本。这也是为什么DeepSeek能在价格上更有余裕——V4 Pro的推理计算量已经大幅压缩。
Kimi选择全量激活路线,换来了评测榜单上的最高分,但也承担了最高的推理成本——这正是"登顶后算力告急"的技术根源。
API定价的经济学逻辑
DeepSeek的峰谷定价本质上是一个需求侧管理工具,而非单纯的涨价。其经济学逻辑是:
- 高峰时段:需求刚性(用户必须在工作时间用),价格弹性低 → 涨价可以筛选掉低价值需求
- 平时段:需求弹性高(用户可以选择不用),价格敏感 → 保持低价吸引长尾需求
这种定价策略在电力、云计算、网约车等行业已经成熟应用,但在大模型API领域是首次——说明行业正在从"补贴换增长"的互联网逻辑转向"价格反映成本"的基础设施逻辑。
五、拐点的真正含义
所谓"拐点",并非指国产大模型的技术能力已经全面超越海外,而是行业竞争的核心变量正在发生根本性切换。
过去两年的胜负手:
- 模型参数(谁的模型更大)
- 评测榜单(谁在Arena上排名更高)
- 开源节奏(谁先开源权重)
如今的胜负手:
- 算力成本运营(推理成本/千次调用)
- 商业模式设计(订阅制 vs 按量计费 vs 峰谷定价)
- 用户分层能力(高价值用户优先保障,长尾用户错峰引导)
- 上市与融资节奏(谁能率先获得二级市场资金补充弹药)
Kimi因用户涌入被迫限流,DeepSeek通过峰谷计费首次将算力作为稀缺资源动态定价,多家厂商先后提价——一个清晰的信号已经发出:
大模型不再是可以无限烧钱抢用户的概念产品,而是一门必须精算投入产出比的真实生意。
这个转变本身,就是商业化的拐点。
六、对开发者的实际影响
API成本变化
对于依赖国产大模型API的开发者,峰谷计费意味着需要重新设计调用策略:
- 实时对话类应用:无法错峰,需接受高峰成本,但DeepSeek即使高峰价也远低于海外模型
- 批量推理类应用:可全部转移到平时段执行,成本减半
- Agentic Coding:部分任务可拆分,非关键步骤错峰执行
技术选型建议
基于当前定价和技术特征,开发者可以这样匹配需求:
| 使用场景 | 推荐模型 | 理由 |
|---|---|---|
| 高质量编程/复杂推理 | DeepSeek V4 Pro | 性能接近旗舰,成本仅GPT-5.6的1/6 |
| 日常对话/轻量任务 | DeepSeek V4 Flash | 平时段2元/百万tokens,极致性价比 |
| 长上下文/多模态 | Kimi K3(需排队) | 100万token窗口,视觉理解,但算力受限 |
| 企业级部署 | Qwen3.8(预览版) | 阿里云生态,企业级支持完善 |
| 错峰批处理 | 任意模型平时段 | 成本减半,适合数据处理/批量生成 |
七、写在最后
世界杯决赛那个夜晚,当全世界在为西班牙和阿根廷欢呼时,Anthropic的Levent Alpöge让Claude Fable 5在后台继续计算——第二天早上,他发了一条推文,推翻了87年的雅可比猜想。
而在中国,月之暗面的工程师们也在那个夜晚监控着服务器负载的曲线,看它一天天逼近集群的承载极限。他们面临的不是数学猜想,而是一个更现实的命题:
当你的产品好到所有人都想用,但你的服务器扛不住时,你该怎么办?
Kimi的回答是"先关门,保住存量"。DeepSeek的回答是"用价格,引导错峰"。
两种回答都指向同一个事实:国产大模型终于到了必须面对"算力经济学"的时刻。这不是坏消息——恰恰相反,这证明国产大模型的市场需求是真实的,技术竞争力是被认可的。
真正的拐点从来不是技术的突破,而是商业模式的重构。从这个意义上说,2026年7月这一周,可能是中国大模型行业从"少年时代"进入"成年时代"的分水岭。
少年只管跑得快。成年人要学会算账。