关注 霍格沃兹软件测试开发 公众号,回复「资料」, 领取人工智能测试开发技术合集
没有发布会,没有预告,它悄悄上线了——然后整个行业都睡不着了
大家好,我是某互联网公司的技术架构负责人。
上周三凌晨,团队群里突然弹出一条消息,附带一个链接:
“兄弟们,DeepSeek V4 Pro正式版上线了。没有发布会,没有预告,就是API文档里悄悄改了版本号。”
我点开看了一眼——DeepSeek-V4-Pro-0813。然后又看了一眼定价页——缓存命中输入0.025元/百万Token,输出6元/百万Token。接着往下翻,看到了一个让我彻底清醒的数字:DeepSWE从预览版的12.8飙到62.7,涨了将近5倍。
我关上手机,睡不着了。
一、它“转正”的方式,本身就是一种态度
先说说这次发布有多低调。
8月12日深夜,DeepSeek没有开发布会,没有官宣推文,只是在API文档和定价页里把模型版本号从Preview改成了DeepSeek-V4-Pro-0813。老用户什么都不用改,后端已经悄悄换成了新版。
同一天晚上,马斯克的Grok 4.6也在抢头条,两件事撞在一起,被媒体戏称为“梁文锋对垒马斯克”。
但我想说的是另一件事——这不是一个新模型,是转正。
今年4月24日,DeepSeek发布了V4系列预览版,Pro版当时还是Preview状态。三个多月后,正式版才来。这期间,行业里发生了太多事——Claude Fable 5发布了、GPT-5系列迭代了好几轮、各家大模型打得不可开交。DeepSeek在这三个月里没有发新版本,而是在打磨同一个模型。
然后在一个没有预兆的深夜,静默上线。
这种“不开发布会、不抢头条、产品说话”的风格,本身就是对行业规则的一种改写。
二、参数没变,但能力翻了5倍
先看硬参数。
DeepSeek-V4-Pro正式版:总参数1.6T(1.6万亿),激活参数49B。上下文100万Token,输出上限384K Token。支持thinking和non-thinking双模式,默认开启思考模式。接口同时兼容OpenAI和Anthropic两套格式。
参数和预览版一样。但能力完全不一样了。
最夸张的数字来自Agent相关评测:
基准测试
预览版
正式版
提升
DeepSWE
(软件工程)
12.8
62.7 +49.9
Terminal Bench 2.1
(终端操作)
72.1
87.9
+15.8
Cybergym
(网络安全攻防)
52.7
83.3
+30.6
NL2Repo
(自然语言转代码仓库)
38.5
61.5
+23.0
DSBench-FullStack
(全栈开发)
41.8
71.1
+29.3
数据来源:
DeepSWE从12.8跳到62.7。这项基准测的不是“会不会写一段代码”,而是 “能不能像工程师一样持续干活” 。12.8分是“写个Demo还行”,62.7分是“能独立完成一个完整任务”。差了将近5倍。
在Terminal Bench 2.1上,V4 Pro拿到87.9分,逼近Claude Fable 5的88.0分,只差0.1分。在Cybergym(网络安全智能体评测)和AutomationBench(高难度智能体评测)上,甚至反超了Fable 5。
参数没变,能力翻了5倍——这意味着什么?
意味着DeepSeek在后训练(post-training) 上下了狠功夫。同样的骨架,换了一套训练方法,直接把模型从一个“会答题的学生”变成了“能干活的人”。
官方的叙事也换了一个词——不再强调“更会答题”,而是强调“更会把一件事干完”。
三、六十分之一的价格,改写的是什么规则?
价格,是这次V4 Pro正式版最锋利的武器。
官方定价:输入(缓存未命中)3元/百万Token,输出6元/百万Token,缓存命中输入低至0.025元/百万Token。
放海外一比,差距是数量级的:Fable 5输出约360元/百万Token,V4 Pro的6元正好是它的六十分之一。对比Opus 5(约180元)是三十分之一。对比国内竞品Kimi K3(100元)是零头。
有博主算过一笔账:每天把几百段代码丢给模型做review,假设一天烧20万输出token,用Fable 5要72元,换成V4 Pro只要1.2元——一个月差两千多块,一年差出一辆二手电驴。
但价格的故事没这么简单。
官方已经在定价页挂出预告:“计划近期整体上调DeepSeek API服务定价,预计涨幅较大”。随后引入了峰谷计费——高峰期(9:00-12:00、14:00-18:00)价格翻倍甚至更多。
8月17日调价生效后:
计费项
调价前
空闲时段
高峰时段
输入(缓存未命中)
3元
4.5元
9元
输出
6元
13.5元
27元
输入(缓存命中)
0.025元
0.15元
0.3元
数据来源:
高峰时段输出从6元涨到27元,涨幅350%。缓存命中输入从0.025元涨到0.3元,涨幅1100%。
所以V4 Pro到底在改写什么规则?
第一,它证明了中国模型能在性能上逼近全球最前沿——Terminal Bench只差0.1分,部分基准甚至反超。
第二,它用六十分之一的价格,重新定义了“性价比”这三个字。
第三,也是最重要的一点——DeepSeek不再只是“价格屠夫”了。 它在性能上已经站到了全球第一梯队,然后才谈价格。顺序很重要——先有实力,再谈性价比。这才是真正的规则改写。
四、国产算力生态:从“备胎”到“主力”
这次V4 Pro还有一个被很多人忽略的信号——国产算力生态的成熟。
V4系列发布当天,华为昇腾就完成了首发适配。寒武纪等7家国产芯片也实现了高效适配。昇腾A2、A3及950全系列产品全面支持V4-Flash和V4-Pro。
基于V4-Pro模型,在8K输入场景,昇腾950超节点可实现TPOT约20ms时单卡Decode吞吐4700TPS。
DeepSeek V4是第一个在华为昇腾NPU上完成首发的万亿参数级大模型。它全程基于华为昇腾等国产AI芯片进行训练和推理。
英伟达从AI算力的必选项,变成了众多可选项之一。
这改写的是整个产业链的规则——中国AI不再只有“用别人的芯片、跑别人的生态”这一条路。
五、关于涨价:一个不得不说的“但是”
最后说一个很多人关心的问题——涨价。
V4 Pro正式版上线后第5天(8月17日),DeepSeek启动了API调价。高峰时段价格涨了好几倍,缓存命中输入涨幅甚至达到1100%。
有媒体用“梁文锋不想当’价格屠夫’了”来做标题。
但换个角度想:如果V4 Pro的性能真的逼近Fable 5,价格只有它的几十分之一,那这个价格本身就不可持续。 6元/百万Token的输出价格,在算力成本面前,更像是战略补贴——先把用户拉过来,再慢慢调价到合理水平。
涨价之后,V4 Pro仍然是全球性价比最高的旗舰模型之一。只是从“白菜价”变成了“正常折扣价”。
或者说——它终于开始按自己的真实价值定价了。
最后
DeepSeek V4 Pro的“闪电二连击”——4月预览版开源、8月正式版转正——正在改写至少四条规则:
第一,性能规则。 中国模型在Agent和代码能力上,已经逼近全球最前沿。DeepSWE从12.8到62.7,不是渐进式进步,是代际跨越。
第二,价格规则。 六十分之一的价格,让“顶尖性能=天价”这个等式不再成立。
第三,算力规则。 华为昇腾、寒武纪等国产芯片全面适配,英伟达不再是唯一选项。
第四,发布规则。 没有发布会、没有预告、静默上线——用产品说话,而不是用PPT说话。
有媒体在报道里写了一句很到位的话:
“DeepSeek V4不是最强的,但它或许是最重要的。”
因为它证明了一件事:中国大模型不需要靠“追赶”的姿态活着。它可以站到第一梯队,然后用自己定义的方式参与竞争。
这才是V4 Pro真正改写的东西。
本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。