☰
为什么大模型评测分数越来越高实际却没变好?
2026/10/8 18:27:46 网站建设 项目流程

厂商就算把全部预算都砸在"让人愿意多聊"上,这个目标本身也接不住,因为现在绝大多数评测数字跟"聊天体验好不好"之间几乎没有耦合关系。

先把两类东西分清楚。一类是模型能做什么,解多难的题、写多长的代码、多步任务能不能收尾、有没有幻觉,这一类这三年是真的在涨,而且涨得幅度很大。另一类是模型说话的方式,什么时候该收住,用不用先说三句铺垫,给不给不确定的语气,像不像个人在说话,这一类基本原地踏步。而人们嘴里说的"变好"和"没变好",说的全是后者。分数量的是前者,你抱怨的是后者,中间那道桥断了。

奖励信号这一层是根子。当前的对齐路线高度依赖"可自动验证"这个前提。数学题能判对错,代码能跑测试集,agent 任务能看最终 diff 是否通过,幻觉率能对照标准答案列表。这些维度的共同点是判定成本极低、结果二值化。RLVR 把这个偏好推到极致:能用规则判的就用规则判,判不了的部分在训练里权重自然趋近于零。文风、节奏、分寸感恰好落在判不了的那一侧。什么样的比喻是好的,什么样的铺垫算多余,一个问题该不该先反问一句,这些既没有 ground truth,也没有可以复现的评分函数,于是它们不进损失函数,模型在这些方向上就基本不演化。

Anthropic 的工程师 Jackson Kernion 后来给过一条相当坦率的解释。Claude 4.6 之后研发重心明显向数学推理和复杂代码工程倾斜,训练数据里塞进大量"写给其他模型看"的技术解释和代码注释,模型慢慢就学会了面向机器解析来组织文本。对另一个模型来说高密度、无歧义、少修辞是优点,对人类读者来说就是"文字沙拉"。他把这个归到奖励函数的偏差上。当优化目标被设定为代码执行成功率、推理闭环和机器解析效率时,段落留白、口语化修辞、共情句式在训练中就是纯损失。

图 1 同一个问题的四份回答。2023 年的 gpt-3.5-turbo 只回了一个词,往后的三个模型都补了直径、质量、大气成分,还不忘加一句"以上数字你可能想再核对一下"。图源:Borisov 等,Do

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询