☰
SERPO:在开放式任务上做测试时强化学习
2026/10/12 3:53:35 网站建设 项目流程

一句话总结

不看标注、不用外部奖励模型、不请更强裁判的前提下,让模型从自己采样的回答里长出可演化的评分表,再用这张表做强化学习;HealthBench / ResearchQA 上相对基座最高涨 20 分,全面超越 “官方评分表 + 更强裁判” 的特权对照


  • 论文标题:SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning
  • 论文地址:https://arxiv.org/abs/2607.26873
  • 作者背景:华中科技大学、中国科学技术大学、阿里巴巴

一、动机

测试时强化学习(Test-Time Reinforcement Learning, TTRL)是指在模型的测试阶段,利用线上任务中获得的反馈信号进行强化学习更新。原始 TTRL 有一个核心设定:面对没有标注的测试题,不依赖标准答案,而是利用模型自身的采样结果构造优化信号

在数学题等具有明确答案的任务上,这一机制非常直观:对同一道题采样多条回答,通过多数投票选出伪标签,再根据每条回答是否与伪标签一致来分配奖励,进而利用强化学习更新模型参数。但这在开放式生产场景下难以复刻,主要问题在于:

  • 对比困难:开放性问题的回答在实际中可能难以判断谁好谁坏,相对更差的版本往往也并非一无是处需要惩罚
  • 共识固化遗漏:一组采样若都漏掉同一个关键点,遗漏会变成多数派并被奖励写进策略;说法不同但同样正确的回答,反而因跟多数对不上被扣分

另一方面,开放式任务通常会使用用评分表(rubric)做评估 —— 即把质量拆成准确性、完整性、安全性等原子准则逐条验证。据此形成了一些 rubric-based 的强化学习方法(RGSD、RLCER、EvoRubrics 等),但它们都需要更多的信息预算(一张靠谱的评分表、专门训练的评估器、外部强模型裁判等),这便不符合 TTRL 的应用场景

作者的思路是,既然评分表能取代投票解决开放式生成任务的价值判定问题,那想办法仅从原始模型、采样结果里构造评分表,而不利用其他外部信息,就能让 TTRL 应用在开放领域。具体方案是SERPO(Self-Evolving Rubric Policy Optimization,自演化评分表策略优化):用 query 专属的评分表验证代替投票,并让「回答证据、评分表、策略参数」三者闭环共演化


二、实现方案

SERPO 让同一个部署模型分饰三角:策略模型 actor,以及保持初始权重冻结的副本,作为评分表生成器和裁判

2.1 概率化打分

评分表把开放式回答质量拆成多条原子准则(准确性、完整性、安全相关要求等),裁判对 “回答是否满足该准则” 给出满足概率,最后聚合成标量奖励

之所以使用概率评分而非二元的 Pass/Fail 是因为,训练使用 GRPO 是用组内奖励减均值、除标准差得到优势,二元结论很可能导致结果无区分度。具体地,SERPO 让裁判先写完评估理由,然后在末尾输出 true/false 两个 token 的概率,归一化后作为最终奖励

2.2 G-N-B 回答演化

一开始,冻结的评分表生成器根据题目给出初始准则,之后每轮用当前评分表给组内回答打分,再从组里挑出好 / 中 / 差三档结果加入队列(Good-Normal-Bad 档案),挑选方式是保持 “好−中”、“中−差”、“好−差” 三个差距的乘积最大

为什么必须留中间档?只有好和差两档时,一条瞎蒙的准则也有一半概率蒙对方向;三档排成一条线,才能检验准则是否真把顺序排对。若最大分离度为零,档案本轮不更新,避免把无对比度的噪声写进去

2.3 评分表演化

每当一道题被选中 3 次,生成器会基于问题、现有评分表和 G-N-B 档案,提出能解释强弱对比的原子准则,再与旧池合并

每条候选准则需要计算鉴别力,要求准则能让「好-中-差」回答分数保持递减,并且差距足够明显

2.4 策略演化

SERPO 采用 GRPO 算法更新策略模型,与传统做法的主要区别就在于,奖励不是来自固定的规则或模型,而是每轮用这道题当前的自演化评分表现计算,具体分两步:

  1. 准则校准:不同类型的准则存在分布差异,像惩罚类准则(如 “不要给出错误安慰”)一般落在 0.1–0.4;鼓励类准则(如 “建议做产科评估”)常见 0.6–0.95,直接相加会让后者会主导奖励。解法是用这道题档案里的好 / 中 / 差三档做校准,把差档均值拉到 0、好档均值拉到 1
  2. 鉴别力加权:每条准则乘上它的鉴别力分数,能拉开好坏的准则权重高,分不出好坏的准则权重趋近于零

新 actor 采样刷新档案与评分表,再反哺下一轮奖励,如此形成回答证据 → 评分表 → 策略参数的闭环:


三、实验结果

3.1 实验设置与主结果

  • 基座模型:Qwen3-4B-Instruct-2507 与 Qwen3.5-9B(非 thinking 模式)
  • 数据集:HealthBench-500(医疗建议)、ResearchQA(科研问答)
  • 评测流程:模型在数据集上独立演化 30 epoch,然后分别在域外测试集 MedQA / LLMEval-Med、GPQA-Diamond / RaR-Science 数据集上评测
  • 实验组:
    • Base:原始模型,不做任何适应
    • response vote 回答投票:在开放式问答中使用多数投票,即把每条回答压缩成 ≤15 词的精简建议然后按词重合度聚类,落在最大簇的回答打 1 分否则打 0 分
    • claim consensus 主张共识:把每条回答拆成多条可独立核查的原子主张(事实、建议、警示等),汇总去重后再逐条判断每条回答是否支持每条主张;被至少一半回答支持的主张进入共识集,一条回答的奖励 = 它覆盖了共识集的几成
    • RGSD 基于准则引导的自蒸馏:由评分表指导的自蒸馏方法(同一个模型,看了评分准则的充当教师),这里的评分表也是初始模型根据问题自行生成的
    • + 评分表自演化:在 RGSD 基础上加入 SERPO 的 G-N-B 档案与评分表演化但不训练模型,衡量 “只演化评分表” 的效果
    • SERPO:评分表自演化 + GRPO 训练的完整方法
    • 外部裁判 + 官方评分表:特权信息对照,训练流程与 SERPO 相同但直接用官方评分表和更强的 Qwen3.6-27B 打分来生成奖励,评分表不演化

可见主张共识比简单的回答投票方案高 13–28%,但它存在共同遗漏进入共识集的问题;SERPO 在全部配置上是最强的无标签方法,相对 Base 提升约 21–54%

特权对照组上出现了反直觉现象:更强的外部裁判模型加上官方评分表,在域内确实更强,但在四个未见基准上都不如 SERPO 方法

官方评分表为单一榜单定制,照着它训容易学到该榜偏好;自演化准则来自模型回答的好坏差别,抓的是更通用的质量维度

3.2 消融实验

以健康问答为例,去掉各组件后的分数变化情况如下:

冻结 actor 不让策略模型更新带来的损失自然最大,去掉评分表演化、G-N-B 档案演化,或者让评分表生成器和裁判解冻加入训练,都会带来 12–13% 的损失

3.5 长程与跨基准训练

统计跟踪演化流程,回答投票和 RGSD 效果跟基座模型差距不大,SERPO 能持续优化 45 epoch。其余方法的采样往往会越来越同质化,只有不断刷新后的准则才能持续挖出质量差

先在 HealthBench 练 30 epoch,再切到 ResearchQA 练 30 epoch。这一设置下 SERPO 依然能继续涨分,因为评分表是在每道题上各自生长的,换到新领域会不与旧域抢同一把尺子


需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询