☰
微软When2Think:让大模型学会难题多想、简单题少想
2026/9/28 19:56:57 网站建设 项目流程

When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models

作者:Jaejun Shim, HyunJin Kim, Young Jin Kim, JinYeong Bak
核心发表机构:Sungkyunkwan University、Microsoft
论文链接:arXiv:2609.19671v1
发布于:arXiv 预印本(cs.AI)

|—😐—😐—😐
| GSM-Plus | 79.4 / 590 | 85.7 / 1052 | +6.3 / +462 |
| OlympiadBench-Math | 58.8 / 8634 | 62.4 / 5909 | +3.6 / -2725 |
| AIME24 | 46.0 / 14195 | 56.0 / 10236 | +10.0 / -3959 |
| AIME25 | 32.0 / 12616 | 40.0 / 9549 | +8.0 / -3067 |

AIME24 上 token 减少比例约为14195 − 10236 14195 ≈ 27.9 % \frac{14195-10236}{14195}\approx 27.9\%1419514195−10236​≈27.9%,与摘要一致。AIME25 上 When2Think 达到 40.0% Pass@3。值得注意的是,GSM-Plus 上 When2Think 的 token 反而比 base 更多(590→1052),但准确率提升 6.3 点;论文解释为在对抗扰动 GSM-Plus 上,模型故意增加计算以换取准确率提升。相对压缩与路由基线,When2Think 在 AIME24/AIME25 上明显更优:例如 LC-R1 在 AIME24 准确率从 46.0 降至 36.0(-10.0),体现压缩导致难题欠分配;AdaptThink-delta0.05 在 AIME24 使用较少 token(5806)但 Pass@3 仅 44.7%;Thinkless-RL 在 AIME 上 NoThink 分支准确率为 0.0,说明刚性路由在难题上失败。

论文进一步分析了 token 使用按推理模式与正确性的分布。下图使用 KDE 展示:正确实例中,NoThink 在低 token 处尖峰,反映 System 1 效率;Think 即使正确也消耗更多 token,揭示过度思考。错误实例中,Think 呈重尾分布,达到上下文限制,显示失败 System 2 推理的高成本。

在实例级难度感知分配方面,论文按 MATH-500 难度 Level 1–5 分层分析。下图分别展示准确率与 token 使用随难度的变化,以及 Think ratio 的对比。When2Think 的 Think 轨迹比例随难度单调增加:Level 1 约 0.2,Level 5 超过 0.7。基线中,ThinkLess 分配近乎恒定计算量,DeepScaleR 过度思考简单实例,AdaptThink 对困难实例分配不足。这验证了 When2Think 能够根据难度自适应分配计算。

混合推理模式分析进一步显示,When2Think 在 AIME24/AIME25 上NoThink Ratio 为 0.0,即全部走 Think,避免难题上直接作答失败;而在简单基准 GSM-Plus 上,约 40.3% 的轨迹选择 NoThink,且 NoThink 准确率达 93.0,说明简单题直接回答质量高。在 Minerva 与 OlympiadBench 上,When2Think 也选择性使用 NoThink,其 NoThink 分支准确率分别达 78.8 与 90.5,显著高于 AdaptThink 和 Thinkless 的对应分支。

4.3 消融实验 / Ablation Study

论文通过消融分析 IDAC、BWS 与 IS 各自的作用。首先,为验证 BWS 相对 GRPO-style 实例内归一化的优势,论文使用 Monte Carlo 模拟比较三种奖励/优势形式:raw Think reward、BWS advantage、GRPO-style advantage。下图展示了优势景观:颜色表示参考准确率α \alphaα,蓝色为困难(α → 0 \alpha\to0α→0),黄橙色为简单(α → 1 \alpha\to1α→1);圆形表示正确,叉号表示错误。左侧 raw IDAC Think reward 带绝对长度敏感 bonus;中间 BWS advantage 保留困难问题上长而成功轨迹的正优势;右侧 GRPO-style advantage 因实例内归一化导致信号碎片化与水平条带。这表明 BWS 保留了跨实例难度结构,而 GRPO 式归一化会消除跨实例奖励比较,使困难实例上的长成功轨迹可能获得弱或不稳定信号。

BWS 的训练动态在 DeepScaleR 上进一步验证。下图比较 When2Think(红色,with BWS)与无 BWS 基线(蓝色)。无 BWS 时 raw reward 跨实例高方差导致 noisy gradient 和不稳定学习;BWS 使用 batch-level statistics 降低梯度方差,并将实例难度与策略质量解耦。在 AIME24 等难度变化剧烈的任务上,BWS 下即使最难实例也持续改进。此外,BWS 维持稳定 Think Ratio 和 Response Length,避免退化到极少推理或过度冗长。AIME24 上 When2Think 约用基线一半训练步达到峰值性能,性能差距随任务难度增加而扩大。

IS 与 IDAC 的消融在下图中展示。比较三个变体:Full When2Think(IS + IDAC + BWS)、无 IS(IDAC + BWS)、无 IDAC(IS + BWS)。结论是:IDAC 与 BWS 提供主要深度控制信号,去掉 IS 的 IDAC+BWS 变体在多数基准上仍具有竞争力,尤其 AIME24;但 IS 使策略转向更高效的操作点。在 GSM8K 上,完整模型与 IDAC+BWS 验证准确率相当,但 token 使用显著更低(1652 → 1052 1652\rightarrow10521652→1052),Think Ratio 也更低。IS 主要促进简单实例上的有效 NoThink 使用。去掉 IDAC 后,模型仍可学习切换 Think/NoThink,但缺少“一旦选择 Think,应当分配多少推理”的难度感知信号,导致困难实例系统性欠分配,验证准确率显著更差,尤其在 AIME24 上。

Hybrid bonus 的消融显示,单独为两种模式设置 bonus 收益有限。变化 NoThink bonusη \etaη时,较大η \etaη往往降低验证准确率,说明过强 NoThink 激励会使策略偏向直接回答,即使显式推理仍然有用,对应 hard-instance under-allocation。使用统一的 correctness-gated efficiency coefficientδ \deltaδ同时用于两种模式,并由 DADS 控制 bonus 对 Think 轨迹的强度,训练更稳定,避免 NoThink collapse 和 Think 过于冗长。因此论文不需要分开的 mode-specific bonus coefficients。

Dual Math Verifier 的有效性也在 MATH-500 上分析。按主题划分,Geometry 和 Precalculus 包含大量符号、结构化或文本型答案,Baseline 因 string-based verification 的固有局限而明显下降,无法识别语义等价但语法不同的解。Dual Math Verifier 通过 symbolic equivalence checking 解决该不匹配,提升这些主题的鲁棒性。Intermediate Algebra 的增益较小,论文归因于 verification strictness 与 recall 的权衡:复杂多步推导中,替代但等价的表达形式(如 factored vs. expanded polynomials)可能被严格符号解析误拒;此外 IDAC 的效率约束可能限制此类变换所需推理步数。

五、相关工作 / Related Work

论文将已有高效推理方法分为两类。推理压缩方法旨在缩短推理轨迹同时保持正确性。数据级方法如 Skip-Thinking 使用 chunk-level distillation,LC-R1 采用 validity-aware selection 移除冗余步骤;RL 方法如 ThinkPrune 施加硬 token 预算,LASER 与 DLER 使用基于奖励的长度惩罚。这些方法能减少简单实例过度思考,但静态或全局调优的约束会导致困难实例思考不足,产生 efficiency tax。混合推理方法选择性应用推理以减少计算。ARM、LHRM 在短推理与长推理轨迹之间切换;AdaptThink、ThinkLess 使用学习控制器在简单实例上跳过推理。这些方法通常缺乏细粒度、实例级控制,模式选择本身不足以决定推理深度。

When2Think 与上述工作的核心区别在于:它将推理深度视为连续、实例自适应的资源,通过 IDAC 进行 difficulty-aware reward shaping,同时控制“是否思考”与“思考多少”。与 AdaptThink 的关系方面,When2Think 采用了 AdaptThink 的 importance sampling 策略与 PPO-style clipped objective,但自身贡献聚焦于 instance-adaptive control of reasoning depth,而非重新设计 hybrid reasoning 基础训练框架。论文还讨论了推理时扩展(System 2 simulation)与后训练推理(learning to reason)两条路线:前者不修改参数,依赖 CoT、ToT、Self-Consistency 等提示或搜索方法,计算开销大且可能产生不必要长轨迹;后者通过 SFT、RL 或蒸馏将推理能力内化到参数中,但若缺乏显式难度感知长度控制,RLVR 倾向于膨胀 token,落入效率税。When2Think 位于后训练混合推理路线,通过 IDAC、BWS 与 IS 的联合设计,在不依赖 learned reward model 或在线参考模型查询的情况下实现稳定的 critic-free 优化。

六、局限性与展望 / Limitations & Future Work

论文的局限性主要围绕验证依赖、难度估计与实验范围。首先,When2Think 依赖verifiable rewards,因此最直接适用于数学推理等具有确定性答案验证的领域。扩展到开放式任务或社会敏感领域需要额外的奖励建模或人工评估,并需要领域特定验证、保守部署与 human-in-the-loop 监控等 safeguards。其次,方法依赖离线参考统计进行难度估计;当问题难度模糊或参考策略本身不可靠时,α i \alpha_iαi​与τ i \tau_iτi​可能无法准确反映真实难度,从而影响 IDAC 的分配效果。第三,Dual Math Verifier 虽然提升了符号等价验证的鲁棒性,但仍存在 verification strictness 与 recall 的权衡:严格符号解析可能误拒等价但不同形式的答案,而 IDAC 的效率约束也可能限制复杂变换所需的推理步数,这在 Intermediate Algebra 上表现为增益较小。第四,论文主实验集中在 1.5B 规模,作者解释为小模型上低效计算最具诊断性,IDAC 等自适应控制机制影响最大;向更大模型泛化时,由于大模型本身推理效率更强,这些效应可能不显著。第五,给定源码片段中主表与分层表存在空单元格,完整消融数值、损失函数公式与训练数据构成的细节未完全展开,因此无法核验所有逐项结果。此外,定性案例仍显示 overthinking 与 underthinking 未被完全消除:例如某些正确响应仍使用 31919 think tokens、492 steps;某些错误案例仍表现为思考不足。未来工作可探索 subject-aware verification tolerance、adaptive length modulation、开放域奖励建模以及更大规模模型的难度感知控制。

七、总结 / Conclusion

When2Think 的核心论点是:大型推理模型的低效并非因为推理过多,而是因为推理深度在实例间错误分配。现有方法通过统一长度惩罚或刚性路由减少计算,往往以困难问题欠分配为代价,形成 efficiency tax。论文将高效推理重新形式化为实例自适应计算分配问题,提出后训练框架 When2Think,通过 IDAC 利用预计算的参考准确率与 token 预算进行 reward shaping,结合 verifier-based rewards 与 BWS 实现稳定的 critic-free 优化,并借助 IS 平衡 Think/NoThink 探索。模型不仅学习“何时推理”,还学习“推理多少”,在简单实例上倾向 System 1 直接回答,在困难实例上保留或扩展 System 2 推理。在数学推理基准上,When2Think 改善了准确率—效率权衡:AIME24 上 Pass@3 提升 10.0% 且 token 减少 27.9%,AIME25 达到 40.0% Pass@3,优于 compression 与 routing-only 基线。总体而言,论文主张高效推理本质上是分配问题,而非压缩问题,为混合推理模型的自适应计算分配提供了新的优化视角与可复现的后训练方案。

原文摘要:Large Reasoning Models (LRMs) achieve strong performance on complex tasks but exhibit systematic inefficiency: they often overthink easy problems and underthink hard ones. Existing approaches based on uniform length penalties or rigid routing incur an efficiency tax, trading reduced computation on easy instances for accuracy loss on hard instances. We formulate efficient reasoning as an instance-adaptive computation allocation problem and propose When2Think, a post-training framework for hybrid reasoning that dynamically allocates computation based on problem difficulty. Our method introduces Instance-level Difficulty-Aware Control (IDAC), a reward-shaping mechanism that leverages pre-computed reference statistics (accuracy and token usage) to regulate reasoning depth. Combined with verifier-based rewards and batch-wise standardized advantages, IDAC enables stable critic-free optimization without learned reward models or online reference-model queries. When2Think encourages direct answering on easy instances while preserving extended reasoning on hard instances, thereby learning when to use System 1 (NoThink) versus System 2 (Think). Experiments on mathematical benchmarks demonstrate improved accuracy-efficiency trade-offs: on AIME24, Pass@3 increases by 10.0% while token usage is reduced by 27.9% relative to the base model, and on AIME25, When2Think achieves 40.0% Pass@3, outperforming compression and routing-only baselines.

PDF链接:https://arxiv.org/pdf/2609.19671v1

部分平台可能图片显示异常,请以我的博客内容为准

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询