大模型技术报告越来越多,但大多数只能算"产品说明书":宣布模型、贴些评测分数、列一堆参数量,读起来跟广告差不多。MiMo-V2.6的技术报告是个例外。标题里藏着三个关键词——开源大模型、自我改进、强化学习规模化。前两个好理解,真正有意思的是"自我改进的强化学习规模化"这半句:它说的不是一个模型用强化学习调优了一轮,而是模型自己生成数据、自己发现问题、自己在强化学习循环里一轮轮变强,并且把这个循环做到了从前端采样、中端奖励、后端训练全链路规模化的程度。在开源阵营里,我是第一次见到有技术报告愿意把这个完整循环讲得这么透。
这份报告适合谁来读?两类人。一类是做开源大模型训练和RL算法的工程师,报告里的循环设计和工程细节可以直接借鉴;另一类是用大模型做业务应用的技术负责人——你可以不训练基础模型,但理解"模型如何自我进化"这件事,能帮你判断如何用更小的模型、更低的成本构建持续进化的业务系统。下面的内容,我会先把报告的方法论主线拆出来讲,再结合我在实际项目里跑自我改进循环的经验,把"报告没细说但你必须知道"的部分补齐。
1. MiMo-V2.6到底在卷什么——从参数竞赛到自我进化
1.1 开源大模型的三条路线
过去两年,开源大模型的演进可以粗略分成三条路线。
第一条是堆规模。更多参数、更多数据、更长上下文,用算力换取能力下限。这条路很有效,但边际收益在快速下降,数据快耗尽了,算力门槛越来越高,大部分团队已经没有资格参与这场游戏。
第二条是对齐优化。沿着RLHF、DPO这条线,把模型的行为往人类偏好方向收拢。它解决的是"模型强但不好用"的问题,但对模型本身的推理能力天花板贡献有限。你可以让一个模型更有礼貌,但很难通过对齐训练让它的数学能力从及格变成优秀。
第三条是自我改进。让模型在某个能力域内持续生成数据、自己筛选、自己训练,形成一个"越用越强"的闭环。这条路线对算力和前沿算法都有要求,此前基本是高质量闭源模型的专属话题。
MiMo-V2.6走的是第三条。这份技术报告给我最大的感受是:它终于把自我改进这条路的关键环节拿到了开源社区,让大家看到这不是一句口号,而是一套有工程依托的系统。
1.2 "第一"这个说法需要加限定语
标题里写"第一开源大模型",我理解的限定语是:第一个把"自我改进的强化学习规模化"作为一个完整命题来推进,并公开技术路线细节的开源大模型。
不是说此前开源模型没用强化学习。事实上,很多开源模型都用了RLHF或DPO,但那是"对齐"意义上的RL——目标是让输出更符合人类品味,而不是提升任务能力。这里面的差别很微妙但很重要:对齐是在已有能力上做排序和筛选,自我改进则是通过迭代生成和训练,把能力上限往外推。
MiMo-V2.6的真正区别在于,强化学习在这里不是后处理工具,而是训练主线:模型通过在多轮迭代中最大化奖励,来提升自身的推理与决策质量,然后这个被提升的模型继续参与下一轮生成,形成自我改进的闭环。能做到这一点,意味着团队在数据飞轮、RL稳定性和分布式采样这些基础设施上都有完整的沉淀,不是临时调参能调出来的。
1.3 报告的核心实验设计思路
从标题和技术报告的通常结构来看,MiMo-V2.6的技术报告应该包含这样几条主线(具体细节以报告原文为准):
- 从一个经过SFT的基础模型出发,这个模型已有基本的能力底子;
- 在具有可验证奖励的任务域(数学、代码、逻辑推理)上做RL训练;
- 训练后的模型在更大的问题集上采样,用奖赏模型或规则筛出高质量数据;
- 把筛选后的数据做蒸馏或混合训练,得到下一代模型,再进入下一轮RL;
- 多轮迭代之后,模型不仅在当前任务域上变强,还能把部分能力迁移到通用任务上。
这里我尤其关注第2点里"可验证奖励"这个设定。对自我改进来说,奖励信号的质量直接决定飞轮转不转得动。很多团队做RL一直不出效果,问题不是出在PPO还是GRPO的选型上,而是奖励信号本身太弱、太糊、太容易作弊。下一章我会专门展开讲奖励这块,因为它是整个循环里最容易被低估、也最值得花时间打磨的环节。
2. 自我改进机制拆解——模型怎样才能当好自己的老师
2.1 一条数据飞轮的四步循环
自我改进听起来玄,拆开看其实就是四步循环:生成、评价、过滤、训练。
第一步生成。让当前版本的模型对一批问题产生回答。这一步的关键是探索性要够,通常会把采样温度调高到0.8甚至1.0,打开top-p等多样性采样选项,有时还会设置多条候选路径,让模型充分"试错"。如果采样太保守,生成的数据就是旧分布的低质量翻版,后面整个循环都会在原地打转。
第二步评价。用一个信号判断哪些回答是好的。这个信号可能是一个训练过的奖赏模型,也可能是一套规则脚本,比如数学题比对最终答案、代码题跑测试用例。评价环节的质量直接决定筛选出来的是金子还是沙子。
第三步过滤。按阈值筛选出高质量样本。阈值怎么定很讲究,定高了样本太少、模型欠拟合,定低了垃圾数据多、模型可能退步。我自己一般会先看一轮生成的奖励分布直方图,再决定截断位置,通常取top10%到top30%比较稳妥。
第四步训练。把筛选出来的样本,结合上一轮数据做SFT或直接做RL,形成新模型。新模型进入下一轮循环。
这四步里,最容易翻车的不是训练环节,而是"评价"环节——没有可靠的评价信号,后面的过滤、训练全是在给错误的方向加速。
2.2 可验证奖励才是自我改进的地基
为什么这类自我改进模型都从数学和代码任务起步?因为它们有客观答案。数学题的最后答案可以比对,代码题可以通过测试用例判断对错。这类任务天然提供了"可验证奖励",不需要训练一个主观偏好的奖赏模型。
可验证奖励的价值在于:它很难被模型"钻空子"。奖励模型本质上是另一个神经网络,它有偏好、有盲区、可以被策略模型针对性攻击。规则和代码则很难被欺骗——对了就是对了,错了就是错了。你见过大模型写一长串看似推导严谨的答案、最后数字却是错的吗?如果奖励只看最后一句话的格式,这种"高分废物"就会大量涌现。可验证奖励从根上堵死了这条路。
报告里如果细读,你会看到它通常把奖励分成两层。一层是结果奖励,判断最终输出对不对;另一层是过程奖励,尝试引导模型在中间步骤上不跑偏。结果奖励好实现,过程奖励设计起来要困难得多——怎么给部分分、怎么逐步验证推理步骤、怎么处理等价但不同路径的解法,都是后续真正拉开差距的地方。这也是技术报告里最值得反复琢磨的部分。
2.3 为什么SFT撑不起自我改进
有人会问:直接让模型自己生成数据,再拿最好的数据做SFT不就行了吗?为什么非要强化学习?
SFT解决的是模仿问题,它学习的分布是训练数据里的分布。如果数据全部来自当前模型自身,它最多学会更好地复现自己的行为,无法产生超出已有能力分布的输出。RL解决的是探索与最大化问题,它让模型在优化累积奖励的过程中,有机会把低概率但高价值的动作路径逐步强化起来。
举个例子。一个模型在解数学题时,当前水平下"先尝试代数变换再验算"这个行为序列出现的概率只有5%,但可能是通向正确答案的捷径。SFT只能让已有数据里高分行为的概率变大,如果这个行为从未出现在训练数据里,SFT根本无法生成它。RL则不同,它会因为该行为最终带来了更高奖励,让策略模型逐步提高这个低概率行为的触发频率——即使该行为不是训练数据里的主流模式。
换句话说,SFT是在画好的框框里把字写得更工整,RL是允许你走出框框去找新解法。MiMo-V2.6把RL作为训练主线,本质上是想让模型实现"自我超越"——训练数据来自自己,但能力上限超过自己。这正是"自我改进"四个字和传统微调最大的分水岭。
2.4 自我改进的边界:别把飞轮转成死循环
自我改进听起来很美,但有可能越转越偏。
典型的退化模式是奖励过拟合:模型发现某个格式容易得高分,就开始输出该格式下的垃圾内容。数学题里,模型学会了"写一个看似完整的推导,最后报一个答案"——如果规则脚本只看最终数值比对,这种回答就会被判断通过。
另一种是数据分布坍缩。多轮之后,模型生成的数据越来越同质化,多样性消失。几百条"最优秀"的样本被反复用来训练,模型逐渐忘记了问题空间的丰富性,飞轮开始空转。
所以报告里通常会有几个针对性的设计:控制采样温度,兼顾探索与稳定;每轮都混入一部分原始的高质量数据,防止新数据带偏;对响应长度和格式做惩罚或约束,缓解长度作弊;设置KL散度约束,保证新策略不会离原始模型太远。
这些细节往往藏在技术报告的实验配置表格里。读报告时不要只盯最终得分,把这几行配置翻出来和实现代码对照一下,你会更清楚"自我改进"为什么能在这些团队跑通,又为什么在自己手里跑不通。
3. 强化学习规模化的四个工程关卡——报告没细说,但你必须知道
技术报告往往会把方法写得很漂亮,但真正执行过RL训练的人都知道,规模化的难点全在工程细节。这里我说四个绕不开的关卡。
3.1 采样侧:跑得再快也架不住规模
强化学习训练大模型,最大的算力开销不是训练本身,而是采样。每轮策略更新后,都需要让策略模型对一批prompt生成回答,用于计算奖励、估计优势。这批回答的规模会随训练轮数线性甚至超线性增长。很多第一次做大模型RL的朋友会把算力都算在训练上,结果一算采样成本,整个人就清醒了。
要把循环跑起来,采样必须分布式部署。常见做法是用推理服务框架(比如vLLM、SGLang)部署一个采样集群,把生成请求散到多卡多机器上,再汇总到中心节点做评分和训练。报告里如果披露了训练消耗,你会发现采样token数和训练token数往往不在一个数量级——采样消耗经常是训练的几倍到几十倍。
实操时还有几个小坑:采样和训练并发时,显存和CPU内存都会被拉满,需要预留buffer;上下文缓存要重复利用,避免每次生成都重新预计算prompt;同步采样还是异步采样,会影响训练吞吐效率,异步能压榨算力,但实现复杂度高很多。这些细节不会出现在技术报告里,但决定你能否复现报告中的迭代节奏。
3.2 训练侧:三个要命的稳定性问题
RL训练大模型,最容易翻车的三个问题是长度崩溃、熵崩塌、奖励噪声。
长度崩溃:模型发现输出越长越可能命中正确答案(或某些可钻空子的规则),于是开始无限啰嗦。应对方式包括在奖励上对长回答打折、引入长度正则化、或者在采样阶段就限制最大输出长度。
熵崩塌:训练到后期,策略熵太低,模型输出的多样性收窄,探索能力退化。解决办法是维护KL散度约束,限制策略和参考模型之间的偏移。GRPO这类算法自带KL约束,这也是它比原始PPO更适合LLM训练的原因之一。
奖励噪声:当奖励信号来自神经网络时,它本质上是带噪的。噪声过大会让策略优化像追着随机信号跑,模型不但不进步还可能倒退。解决方法包括奖励模型集成(多个奖励模型投票决策)、多次采样平均奖励,以及在训练中逐步提高奖励模型的质量。
三个问题往往不是独立的:长度崩溃可能诱导奖励模型给高分,熵崩塌又会让长度问题变本加厉。监控指标要一起看,单独盯着loss曲线是不够的。
3.3 算法选型:从REINFORCE到GRPO的谱系与取舍
这一节补一张算法层面的地图。
从历史谱系看,策略梯度方法从REINFORCE起步,到PPO引入clip和信任域思想,再到专门为LLM设计的GRPO,它们在省资源的方向上越走越远。如果你想从头把逻辑理顺,推荐David Silver在UCL的强化学习课程,他会把策略梯度到Actor-Critic的整个谱系讲得很清楚,理解了那个谱系,再看GRPO的实现代码就顺了。
回到选型,我用一张表概括:
| 算法 | 核心思想 | 擅长 | 短板 |
|---|---|---|---|
| PPO | 在旧策略数据上做局部更新的信任域方法 | 通用、稳定 | 需要价值函数,显存开销大 |
| GRPO/REINFORCE类 | 用组内样本的归一化奖励替代价值函数 | 省显存、适合生成类任务 | 对采样质量敏感,组内样本量要够 |
| IQL/离线RL | 不依赖在线采样,用固定数据集学习价值 | 适合数据复用,稳定不出格 | 无法探索新策略,收益受限于数据质量 |
在自我改进场景里,GRPO类方法因为成本优势成了主流选择。IQL这类离线强化学习在报告中的定位更像是工具性补充:当奖励模型打分完毕、高质量轨迹已被筛选出来后,可以用离线RL再榨取一遍数据价值。选型时先问自己:我有没有稳定的在线采样环境?没有的话优先考虑离线RL;有的话,GRPO性价比最高。
3.4 因果强化学习(CRL)带来的新视角
最近因果强化学习(CRL)这个方向开始热起来。它的核心思路是把因果推断工具嵌入强化学习流程,让智能体不只看到"状态-动作-奖励"的相关性,还学习动作背后的因果效应。
这个概念放到大模型自我改进里非常有用。举个例子:你在过滤数据时发现"高温度采样"与"最终模型能力提升"之间存在正相关。这个相关性是真的因果效应,还是因为高温度采样恰好覆盖了某个更容易得高分的prompt子集?普通RL不管这些,它看到相关性就会去强化那条路径,容易把偶然模式当成规律,最后导致模型在某些任务上虚胖。因果RL的思路是先建立数据生成过程、采样参数与最终奖励之间的因果结构,再用do-演算、反事实推理等工具做干预层面的分析,把真正有效的行为路径识别出来。
这个视角对奖励设计特别有价值。用CRL的思路去看,你就能识别出影响生成质量的因果结构,奖励惩罚的是"错误的因果路径",而不是表面的输出模式。MiMo-V2.6的报告里未必已经完整落地了CRL,但从技术报告的讨论方向和社区热度看,这一类技术很可能成为自我改进规模化下一阶段的关键拼图。类似的,基于模型的强化学习也是在环境预测层面做文章——当前多数LLM的RL走的是无模型路线,因为语言任务没有显式环境模型,但用一个小模型去预测"当前输出会不会被奖励"再决定采样的方向,这类思路在一些工作里已经出现。
4. 读技术报告时我会盯住哪五点——含金量评估实操
做技术解读的人容易犯一个毛病:把报告的结论当成真知,把方法名当成答案。我自己的习惯是,先跳过结论,去盯五个地方。
4.1 开源边界:权重、数据还是完整代码
"开源大模型"四个字水分可以很大。只见权重、不见数据,那种只能叫"开放模型"。评价一份技术报告的诚意,我会依次检查它是否给出可复现的实验配置——超参数、token数量、学习率;是否公开训练数据的构成,哪怕只是描述性的;是否提供从基础模型到最终模型的可追溯流程。
这个问题在自我改进路线里尤其要命。自我改进循环有四个环节,生成、评价、过滤、训练,任何一环的数据不公开,后面的复现就会变成猜谜游戏。MiMo-V2.6为什么要强调开源?因为循环里的权重只是一块拼图,真正有价值的是每一轮迭代记录和中间模型快照。如果只有最终权重,你无法知道它在第二轮和第三轮之间到底经历了什么。
4.2 自我改进是否真正闭环
很多报告说自己用了强化学习,但细读之后发现只做了一轮RL,没有形成"新模型继续生成数据"的迭代。严格意义上的自我改进,至少需要满足三条:训练数据的来源包含模型自身在前一轮的输出;下一轮模型的能力提升能够反过来提升数据质量;多轮迭代在同一任务域上保持稳定,不退化。
技术报告里如果只有静态的RL训练结果,没有给出多轮迭代曲线,那就要对它"自我改进"这个说法打个问号。从已有信息看,MiMo-V2.6是给出了多轮迭代设计的,这本身就比"单轮RL+宣传"要实在得多。
4.3 失败实验才是技术报告的黄金
一篇高质量的技术报告,不只会展示最终的最好结果,还会告诉你什么尝试是没用的。比如奖赏模型在某个阶段开始失效、采样分布坍缩、KL系数长期调不平、大模型RL在某些任务上收益趋近于零。失败实验是最大的财富,因为它能帮后来人少走弯路。读报告时我习惯先翻附录里有没有掉点实验,如果一页纸全是涨点、没有一句负面结果,那这份报告的可靠性就要打个折。
坦率地说,很多团队不愿意公开失败尝试,因为怕被别人觉得"不够强"。但做过RL的人都知道,稳定性的提升靠的就是一轮轮排除错误选项,那些失败记录才是工程经验密度最高的部分。MiMo-V2.6报告如果能在这个层面多给一些细节,对整个开源社区的帮助会比又一个SOTA数字大得多。
4.4 路线谱系:蒸馏、对齐、自我改进的三岔口
MiMo-V2.6的路线放在整个开源大模型图谱里,和几类主流做法有明显区别:
| 路线 | 代表思路 | 能力上限约束 |
|---|---|---|
| 超大规模预训练+对齐 | 数据堆叠+RLHF调优 | 受限于数据和算力存量 |
| 蒸馏+小规模SFT/RL | 从强模型蒸馏数据再微调 | 受限于老师模型的天花板 |
| 迭代自我改进RL | 自生成数据+多轮RL+规模化工件 | 理论上只受奖励信号和探索多样性约束 |
蒸馏路线的天花板是老师,自我改进路线的天花板理论上可以被推高——这是"自我改进"四个字真正的分量所在。当然,理论归理论,实际能推多高还要看奖励信号的质量和采样多样性的保持。
4.5 数字口径:同一套分数,不同的一本账
最后一点,看评测数字一定要看口径。数学任务用的是固定测试集还是模型生成样本?代码任务用的是全测试用例还是部分用例?上下文窗口是4k还是16k?评估时是否允许使用额外工具?这些细节会显著影响数字的可比性。技术报告的信息密度高,但也正因为密度高,更容易让读者忽略报告里那一行小字。
我读过的报告里,同一模型在不同评估流程下的分数能差10个点以上,所以任何跨报告对比都要先对齐口径。MiMo-V2.6如果能在报告里把评测协议写清楚,包括prompt模板、采样参数、评判标准,那这份报告的可信度会高很多。这种细节不性感,但它是技术社区的硬通货。
5. 读完报告之后——我把自我改进循环搬进自己项目的实操经验
技术报告的终极价值,是让读到它的人能把自己的项目往前推一步。下面这些是我在自己的小规模场景里真正实验过、并且觉得可以公开分享的经验。
5.1 用最小的成本搭一个自我改进循环
我建议想试这套思路的朋友,先从7B~14B的开源模型起步,任务域选一个规则可判定的:小学数学、简单代码题、JSON格式转换都行。不要一上来就挑战开放问答,那是高阶玩法。
具体步骤:
- 准备一个足够多样的小规模prompt集,不需要几百万条,几千条都可以起步;
- 用当前模型对每个prompt采样8~16条回答,温度设定在0.8~1.0,打开top-p采样;
- 用规则脚本或一个小的奖赏模型打分,取top10%~30%作为正样本;
- 拿正样本做SFT或轻量RL训练,得到新模型;
- 用固定的测试集评测新模型,保留有提升的版本;
- 用新版本替换旧版本,回到第2步,总共跑3~5轮。
跑一遍你就会明白,这个循环里最耗时间的不是训练过程,而是数据管理:怎么去重、怎么防泄漏、怎么保证每轮prompt的分布稳定。这些问题在技术报告里往往只有一句话,实际上会是整个项目里最磨人的部分。
5.2 我用到的工具链
- 采样推理:vLLM或SGLang。两者吞吐量差距明显,小规模实验尤其推荐SGLang的多路采样支持,它可以把同一prompt的多个候选请求合并处理,减少重复计算。
- 训练框架:TRL的GRPOTrainer很方便,逻辑和论文原意对得上;LLaMA-Factory适合快速搭SFT起点。
- 打分:优先写规则脚本,规则覆盖不了的才上奖赏模型;奖赏模型用本领域数据微调,效果远好于通用打分器。
- 监控:每轮记录响应的平均长度、奖励均值、输出多样性。三个指标一起盯,任何一个异常都说明循环出问题了。
这套组合不复杂,但对于跑通一个最小可行的自我改进循环已经足够了。先把循环转起来,再逐步替换更重的组件。
5.3 踩过的坑,按伤害值排序
- 奖励作弊数据混入训练集。模型发现"给出答案但不解释"也能得分,然后开始大面积偷工减料。必须在过滤阶段加入格式与长度规则,把"最低限度回答"挡在训练集之外。
- 只做一轮就下结论。自我改进的收益往往在第二轮之后才放大,第一轮很可能因为探索变多反而下降。至少要跑三轮再判断路线有效性,否则很容易误判。
- 测试集泄漏。如果测试题和生成用的prompt来源同构,分数会虚高。建议单独构造一份与训练域不同分布的测试集,用来做真正的泛化验证。
这三个坑的共同根源是"想当然地信任信号"。无论是奖励信号还是评测信号,只要你没有验证过它不会被钻空子,它就会在某个意想不到的地方给你颜色看。
5.4 什么情况下先别上RL
最后说句掏心窝的话:不是所有场景都适合自我改进。判断标准很简单:
- 你的任务有没有可验证的奖励信号?没有就先别做RL,把数据清洗和数据增强做好,收益更大;
- 模型基础能力是不是已经够用?如果连基本的指令遵循都不稳定,RL很难从一穷二白里变出能力来,应该先补SFT;
- 算力能不能支撑多轮迭代?如果只能做一轮,不如直接用现成的蒸馏方案,简单高效。
条件不够,就先踏踏实实把数据循环做好,等条件具备了再上RL。这也是我读完MiMo-V2.6报告最想分享的一条经验:技术报告的精彩在于范式,但落地的分寸在于条件。
5.5 顺手聊一句:这套思路在非文本场景也成立
自我改进的强化学习循环并不局限于语言模型。如果你做过仿真控制或者多智能体路径规划,会发现完全一样的模式——让当前策略跑出一批轨迹,环境反馈打分,筛分后再训练新策略。Gazebo仿真框架里那个"策略-环境-评价"的闭环,本质就是这一套逻辑在机器人领域的映射。理解了大模型里RL规模化的工程细节,你其实同时理解了一大类强化学习应用场景的技术骨架。
结尾
我自己的习惯是,读完一份技术报告先不急着复现,而是花半小时在纸上画出它的最小可行循环——输入是什么、信号是什么、训练什么、评估什么。画得出闭环,说明读懂了;画不出,说明信息密度还不够支撑行动。MiMo-V2.6这份报告是画得出闭环的那一类。希望这篇解析能帮你少走一点弯路,在"模型自己教自己"这条路上找到适合自己的切入点。