换个环境就"开挂"?DeepSeek V4 模型没变但跑分飙到 99!
2026 年 8 月 14 日和 15 日,AI 社区有两个非常有意思的信息:DeepSeek v4 Pro在同一个接口被曝出三种截然不同的"思考风格",同一任务分数可以从 91 跳到 99;紧接着,紧接着轻量级的 V4 Flash 又被测出"超进化",在物理仿真任务上进了一梯队。两件事表面独立,最后指向同一个判断:DeepSeek V4 的能力上限不是写死在权重里的,是"思考强度 × 环境对齐"配出来的。这篇文章把来龙去脉讲清楚,给开发者一个能直接落地的结论。
TL;DR
- 同一个 deepseek-v4-pro API,换 IP、重开会话会出现三种思考链风格(“Let me…”、“The user wants me…”、“we”),社区一度怀疑官方在背后路由三个模型。
- 对照实验显示:V4 Pro 在 DSH Minimal(2 个工具)下拿到 99/96,在 DSH Standard(25 个工具)下只有 91。工具越少分越高。
- 原因指向 RL 训练环境对齐:官方 8/10 的 commit 写着 “align minimal agent with RL composition”,Minimal 模式复刻的是 V4 Pro 强化学习训练时的原始环境。
- 社区插件 dsh-anchored-standard 用"首轮模拟 Minimal、随后放开全部工具"的两阶段策略,连续跑出 98/99。
- 8 月 15 日,贴吧传出 V4 Flash 也可"超进化":内测插件按任务难度动态分配思考强度后,Flash 在台风模拟、混沌摆等物理仿真任务上达到第一梯队。
- 阶段结论:V4 家族的表现由"思考强度 × 环境对齐"共同决定,不是模型单方面的事。
DeepSeek V4 Pro 的"三种思考风格"是怎么回事?
8 月 15 日凌晨,博主 Max For AI 在 X 上爆料:社区发现,同样调用 deepseek-v4-pro,换 IP、重新开会话后,模型会出现三种截然不同的"思维链指纹"。这是社区观测到的原始现象,官方至今没有承认任何"多模型路由"机制。
三种指纹各有特征:
- 大量出现“Let me…”的版本,能力接近此前的 V4 Pro Preview;
- 常以“The user wants me…”开头的版本,风格更接近 V4 Flash;
- 大量使用“we”的版本,能力明显更强,被社区称作"神版 V4 Pro",且多在 Harness 的 Minimal 模式下出现。
诡异的地方在于:同一个会话一旦命中某种风格,后面就基本稳定。你抽到的是"中规中矩版"还是"神版",像开盲盒。这个现象直接催生了"官方在 API 后面路由了三个模型"的猜测。后面挖源码、跑实验,这个猜测基本被否定了,下文会说清楚。
"思维链指纹"为什么能当识别依据?
思维链指纹,指的是模型在思考链(CoT)里流露出的习惯性措辞:句式开头、口吻、用词偏好。它稳定、可统计、难以伪装,像笔迹一样。
大模型的思考模式本身不神秘。模型在给正式答案前,会先生成一段内部推理文字,拆问题、验假设、排步骤,最后才输出结论。这段文字通过reasoning_content字段返回,开发者可以选择展示或丢弃。
问题在于措辞习惯是训练出来的。不同模型、不同 RL 配方会养成不同的句式偏好:有的爱用 “let me”(第一人称、试探性),有的爱用 “we”(集体视角、工程化)。这些偏好足够稳定,于是成了识别"这段思考出自谁"的指纹。
7 月就有人用同样的逻辑抓过异常:Stage1st 论坛有用户测某个模型时,发现它的思维链里自称是 Claude。指纹既能证明身份,也能拆穿伪装。
为什么工具越少,V4 Pro 分数反而越高?
GitHub 用户 xiaobright 在 8 月 14 日发布对照实验,同一台 WSL、同一档 Think Max 下,同一个 V4 Pro 跑同一个冻结任务:
| 预设 | 工具面 | 分数 |
|---|---|---|
| DSH Standard | 约 25 个工具(skills、subagent、web search 等) | 91 |
| DSH PTC | Standard 的 Code Mode 变体(单一 run_code 入口) | 92 |
| DSH Minimal | 只有 2 个工具(bash + 编辑器) | 99 / 96 |
工具最全的 Standard 输给了只有两个工具的 Minimal,差 7-8 分。轨迹统计更直观:Standard 模式下思考链里 “let me” 出现 208 次,得分 91;Minimal 模式下 “let me” 几乎绝迹,“we” 出现 165-179 次,得分 99/96。思考风格跟着环境变,分数也跟着变。
原因藏在官方源码里。8 月 10 日,也就是 V4 Pro 正式版发布前三天,DeepSeek Harness 仓库有一条 commit:fix(preset): align minimal agent with RL composition,让 Minimal Agent 与强化学习训练时的 Agent 组合对齐。仓库里的快照测试命名更直白:“sends the exact RL prompt and schemas”。
也就是说,Minimal 模式不是 Standard 的"阉割版",它复刻的是 V4 Pro 在 RL 训练阶段真实接触的交互环境:极简 system prompt、两个训练对齐工具、训练时的上下文压缩策略。模型在训练时记住的不只是任务方法,还有这套环境长什么样。运行环境对上了,能力就发挥出来;对不上,就打折。这就是"过拟合训练脚手架",也叫训练分布对齐。
那个 99 分插件是怎么做到的?
知道问题出在环境对齐,解法就藏在问题里。xiaobright 写了社区插件 dsh-anchored-standard,思路分两步:
- 第一次请求:模拟 Minimal 环境,用完整的 RL 对齐 system prompt,只暴露 2 个工具,剥掉自动注入的上下文;
- 第一次工具调用之后:立刻恢复 Standard 的 25 个工具,正常干活。
“先锚定、后晋升”,利用的是模型的启动惯性:用最熟悉的姿态开局,再放开手脚。插件连续跑出 98 / 99,进了 Fable 5(98)、Opus 5(97)、GPT-5.6-sol(99/98)所在的顶端分数带。
作者原话是:“DeepSeek V4 Pro 对 API 可见的工具目录有强烈的条件依赖。”换句话说,决定表现的未必是模型的能力上限,而是它第一眼看到的 system prompt、工具 schema 和 Agent 脚手架。这也是给开发者最实用的一条提醒:换框架之前,先想想你的环境跟模型训练时的环境差多远。
V4 Flash 的"超进化"又是怎么回事?
8 月 15 日,百度贴吧一条帖子传开:《deepseekv4 flash疑似超进化!》。楼主贴出一个 B 站直播间"deepseek v4核弹!!",转述了 DeepSeek Harness 内测用户的做法:
他的插件能让 Flash 合理地调用思考强度,该正常思考的正常思考,该雷霆思考的雷霆思考。他的观点是 let me 思考是对的,只是没有合理运用。
**群里实测:台风模拟、混沌摆都达到第一梯队水准,台风模拟尤其强。**群友的评价是"效果有点夸张"。
这里的关键词是"let me 思考",也就是思考模式(Thinking Mode)。V4 有三档推理强度:Non-think 直出、Think High、Think Max。思考越深,token 烧得越多。内测用户的直觉是强度不该一刀切,应该按任务复杂度动态分配:简单问题直出,复杂任务拉满。Flash 拉满思考后,这个便宜轻量的模型在硬核物理仿真上越级打进了第一梯队。
对照组实验里有个细节值得注意:V4 Flash 切换环境时成绩纹丝不动(92-95 区间),不像 Pro 那样大起大落。Flash 对接口依赖弱、泛化稳,Pro 依赖强、上限高。一个靠"吃强度"释放实力,一个靠"环境对齐"释放实力,路数正好相反。
模型的真实能力是固定的吗?
把两个现场放在一起看:Pro 的变量是环境,Flash 的变量是思考强度。一个是"挑环境",一个是"吃强度",表面是两件事,实际上是同一枚硬币的两面。DeepSeek V4 家族的能力上限,不是写死在权重里的,而是"思考强度 × 环境对齐"配置出来的。
这也能解释"let me 思考"插件为什么值得关注:它从实践侧验证了"思考强度是资源、需要调度"这个理念。学术界那篇《Let Me Think!》的结论(一条长思考链的收益可以指数级超过多条短思考)正好互证:深度思考有价值,但值多少,取决于用在什么任务上。
我个人的看法:这件事最值得玩味的不是"DeepSeek 藏了什么",而是整个行业开始意识到,模型的成绩单从来不是模型一个人的事。基准分数、榜单排名,都得问一句:在什么环境、什么强度下测的?
开发者可以从中学到什么?
三件事,都跟实际工作直接相关:
- 选 Harness 别只看模型榜单。同一模型在不同框架下能差 8 分、token 消耗差 3 倍。先拿自己的真实任务在两个框架里各跑一遍,再决定用哪个。
- 把
reasoning_content当诊断数据用。发现思考链风格突变、句式异常,可能不是玄学,而是环境、路由或版本变了。思考强度也别一把梭哈 Think Max,按任务调度更省钱。 - 官方 benchmark 要打折看。官方分数是在自家 Harness、自家环境上测的自家模型。生产环境请以真实任务复测为准。
对了,还有个背景:DeepSeek 8 月 6 日预告 API 涨价,8 月 16 日 16:00(UTC)起执行峰谷定价,高峰时段价格是低谷的 2 倍。发布、疑云、超进化、调价全挤在同一周,这届 AI 圈的瓜密度确实高。
截至本文写作,官方还没回应 Flash 超进化的插件,"台风模拟第一梯队"的基准也还没有公开复现。第二现场的调查刚开始,后续有更新我会补一篇文章。
FAQ
Q:DeepSeek V4 Pro 真的有三种模型吗?
A:目前没有证据。社区最可信的解释是"API 服务环境差异 + 是否命中 RL 训练分布"叠加的结果,同一模型在不同 Harness 模式下表现出不同的行为姿态。官方已开源 V4 Pro 0813 权重。
Q:为什么工具越少,V4 Pro 分数越高?
A:因为 Minimal 模式复刻了模型 RL 训练时的原始环境(极简 prompt + 两个训练对齐工具)。模型对训练环境"过拟合",环境对上就发挥好,对不上就打折。DSH Minimal(2 工具)99 分,DSH Standard(25 工具)91 分。
Q:V4 Flash 的"超进化"是真的吗?
A:来自贴吧转述的 Harness 内测用户实测:用插件动态分配思考强度(简单任务直出、复杂任务 Think Max)后,Flash 在台风模拟、混沌摆上达到第一梯队。插件尚未开源,基准未公开复现,建议持保留态度看待。
Q:思维链(reasoning_content)可以关掉吗?
A:可以。DeepSeek V4 支持三档思考强度(Non-think / Think High / Think Max),Non-think 即直出模式,不返回推理痕迹,也省 token。
参考来源
- 贴吧帖子《deepseekv4 flash疑似超进化!》,2026-08-15。
- X @MaxForAI 系列推文(思维链指纹爆料),2026-08-15。
- xiaobright《DeepSeek V4 Pro 正式版:harness 对照分析》,2026-08-14,github.com/xiaobright/modeltest。
- dsh-anchored-standard 插件仓库,github.com/xiaobright/dsh-anchored-standard。
- DeepSeek Harness 官方源码,commit 47f9438(“fix(preset): align minimal agent with RL composition”,2026-08-10)。
- BlockBeats、快科技等公开报道(DeepSeek V4 发布与 API 定价调整,2026-08)。