Salesforce:提升终端智能体泛化能力
2026/9/2 6:07:22 网站建设 项目流程

📖标题:Learning Generalizable Behaviors for Terminal Agents
🌐来源:arXiv, 2608.22631v2

🛎️文章简介
🔸研究问题:如何通过强化学习有效提升终端智能体在合成环境训练后的跨域泛化能力,而非仅仅依赖增加环境数量?
🔸主要贡献:论文提出“智能体组合泛化”假说,并据此设计了RIVER训练方案,通过过滤低质量环境和增强验证器信号,显著提升了模型性能与训练效率。

📝重点思路
🔸提出智能体组合泛化假说:认为预训练和SFT主要赋予模型底层原子技能(如具体命令执行),而RL主要塑造高层决策行为(如规划、验证、路由技能)。泛化能力源于RL学会如何组合和调用已有的底层技能。
🔸设计RIVER训练流程:包含环境过滤和验证器增强两个核心步骤。首先基于规则和大模型作为Oracle,过滤掉验证器弱、指令不匹配或存在答案泄露的低质量合成环境;其次引入过程级行为正则化,对重复循环等无效行为施加惩罚,优化奖励信号。
🔸实施分层训练策略:对于基础较弱的模型,先使用覆盖广泛原子技能的SFT数据进行微调,确保具备足够的底层能力储备,再进行RL训练以学习高层行为模式。

🔎分析总结
🔸RL主要重塑行为而非新增技能:实验显示,RL训练前后模型展示的底层技能集合高度相关,但任务与技能的组合结构发生显著变化,证明RL主要改变了技能的调度方式。
🔸行为特征比技能存在更预测成功:轨迹层面的高层行为特征(如完成前验证)对任务成功的预测能力远强于单一技能的存在与否,且这种关联性在RL训练后增强。
🔸高质量信号优于大规模数据:仅使用不到30%经过RIVER筛选的高质量TMax环境,在2B至27B不同规模模型上,相比全量数据训练,RL增益平均提升106%(Terminal-Bench-Lite)和30%(Terminal-Bench-v2.1)。
🔸行为正则化有效抑制捷径:引入针对重复行为的惩罚项能显著减少无效交互循环,提升整体性能,而单纯奖励验证行为并未带来额外增益,说明需关注因果相关的行为模式。

💡个人观点
论文跳出了单纯堆砌合成数据规模的常规思路,揭示了RL在智能体训练中的本质作用是“行为塑造”而非“技能习得”。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询