☰
Salesforce:大模型后训练的协同效应与避坑指南
2026/10/11 7:16:54 网站建设 项目流程

📖标题:Understanding the Synergy between SFT, RLVR, and OPD in LLM Post-Training
🌐来源:arXiv, 2609.31900v1

🛎️文章简介
🔸研究问题:在大模型后训练中,监督微调(SFT)、可验证奖励强化学习(RLVR)和在线策略蒸馏(OPD)通常被串联使用,但如何安排这些阶段的顺序和搭配才能避免“好心办坏事”,让每一步都为下一步创造更好的学习条件?
🔸主要贡献:论文揭示了后训练各阶段之间存在强烈的相互依赖关系,提出了一套基于“学习接口”优化的组合策略,即先用RLVR增强教师模型,再短暂SFT预热学生模型,最后进行OPD蒸馏,显著提升了最终性能。

📝重点思路
🔸通过控制变量实验,系统研究了Qwen3系列模型在数学和科学推理任务上,SFT、RLVR和OPD三个阶段在不同顺序和配置下的交互影响。
🔸引入“可强化分数”作为衡量师生模型兼容性的新指标,发现蒸馏效果取决于师生配对兼容性,而非单纯依赖教师模型的规模或参数量。
🔸对比了不同学生预热方式对后续OPD的影响,发现短暂的SFT预热能拉近学生与教师的分布,而经过RLVR强化的学生虽然能力强,但在面对同一教师进行蒸馏时反而会出现性能回退。
🔸研究了教师模型适配对蒸馏的影响,发现用RLVR提升教师能力能有效传递给学生,且学生增益与教师能力提升成正比,直到教师性能达到瓶颈。
🔸比较了OPD和SFT作为后续RLVR初始化的效果,发现在起始准确率相当时,OPD能为后续的RLVR提供更好的初始化状态,支持更强的扩展性。

🔎分析总结
🔸单纯增加教师模型规模并不总能提升蒸馏效果,甚至可能因兼容性差导致效果下降;师生模型的初始兼容性比教师绝对能力更重要。
🔸学生能力的提升不等于可蒸馏性的提升。RLVR虽能大幅提升学生独立解题能力,但会破坏其与教师的分布一致性,导致后续OPD

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询