CoCA:面向长视界多模态智能体的组合式能力分配学习框架
arXiv编号:arXiv:2609.27869v1 [cs.AI]
摘要
长视界多模态智能体依赖感知、检索、推理、校验、执行等各类专用能力。现有系统大多激活固定能力集合或者执行预定义工作流,会带来巨大计算开销,并且无法适配随阶段动态变化的能力需求。本文研究组合式能力分配问题:长视界多模态智能体在每一轮交互阶段,选择一套对开销敏感的能力子集。该问题存在两大难点:能力的效用依赖于当前被同时激活的其它能力;上一轮的分配决策会改变后续决策所面对的环境状态。
本文提出CoCA(Conditional Capability Allocation,条件能力分配),一套同策略在线学习框架,从稀疏的条件偏好对比中学习可部署的能力子集策略。在学生策略访问的状态上,更强的教师模型,基于当前已经选中的能力子集,对比候选能力的边际净效用;构建条件成对效用模型,将对比信号转化为自回归能力子集策略,避免对组合动作空间做暴力枚举。进一步提出双层同策略蒸馏,同时对齐环境状态分布、集合构造过程中的部分子集分布,缓解分布偏移。最后使用轨迹级强化学习,从任务成功率、激活开销、分配稳定性多维度对蒸馏后的策略做精细化调优。推理阶段,仅使用轻量化学生策略完成能力分配,不需要调用教师模型,也无需在线更新。在长视界多模态仿真环境、受控的能力‑需求迁移场景开展实验,相比现有SOTA基线取得性能优势。
关键词
多模态智能体;长视界;能力分配;工具路由;同策略学习;组合决策;双层蒸馏;强化学习
目录
- 引言
- 相关工作
- 2.1 智能体系统的能力分配
- 2.2 基于偏好监督的同策略学习
- 方法
- 3.1 问题形式化
- 3.2 条件成对能力效用
- 3.3 自回归能力子集策略
- 3.4 双层同策略蒸馏
- 3.5 决策‑轨迹策略优化
- 理论分析
- 实验
- 5.1 实验设置
- 5.1.1 数据集与仿真环境
- 5.1.2 对比基线
- 5.1.3 评测指标
- 5.1.4 实现细节
- 5.2 实验结果
- 5.2.1 整体性能
- 5.2.2 消融实验
- 5.2.3 超参数敏感性
- 5.2.4 效率分析
- 5.1 实验设置
- 结论
- 参考文献
- 附录A 定理证明
- 附录B 定理证明
- 附录C 定理证明
- 附录D 完整算法伪代码
- 附录E 标准能力排序
- 附录F 偏好数据采集
- F.1 教师效用估计
- 附录G 数据集详细描述
- 附录H 基线方法完整配置
- 附录I 指标完整说明
- I.1 任务级性能指标
- I.2 受控能力‑需求迁移构造
- I.3 分配质量指标
- 附录J 补充实验结果
- 附录K 使用的全部提示词
1 引言
长视界多模态智能体依靠一整套专用能力库完成复杂交互任务,能力包含感知、检索、推理、校验、工具执行等。现有主流方案分为三类:①全程激活固定能力集合;②执行人工预定义工作流;③单工具路由,每一步只选择一个能力。
现实任务中,不同交互阶段对能力的需求动态变化。能力之间存在强耦合:一个能力的边际效用高度依赖本阶段同时被激活的其它能力;同时,前一轮的能力分配结果会改变环境中间状态,进而改变后续阶段需要的能力集合。
- 能力分配过剩:激活大量无关能力,带来巨大计算开销;
- 能力分配错位:缺少关键能力,任务失败;
- 振荡行为:轨迹不同轮次之间能力选择反复跳变,分配不稳定。
直接暴力枚举全部能力子集组合,组合空间爆炸,无法用于训练;人工标注每一步最优子集代价极高。因此监督信号只能以条件偏好对比形式给出:给定当前已经选中的能力集合,对比两个候选能力的边际净收益。
本文核心研究问题:在能力互相耦合、分配会改变后续环境状态的条件下,长视界多模态智能体每一个交互阶段应当选择激活哪些能力?
CoCA整体流水线
- 在学生策略采样得到的状态上,教师模型基于当前已选子集,输出候选能力之间的条件成对偏好对比;
- 学习条件成对效用模型,将偏好信号转化为自回归能力子集策略,避免暴力枚举组合空间;
- 双层同策略蒸馏:退火式教师‑学生混合采样,同时对齐环境状态分布、集合构造中途的部分子集分布,缓解分布偏移;
- 轨迹级强化学习:把任务成功、激活开销、分配稳定性作为多目标回报,对策略做精细化调优;
- 推理阶段:完全脱离教师,仅轻量化学生策略运行,不需要在线查询教师、不需要在线更新。
本文贡献
- 正式定义长视界多模态智能体的组合式能力分配问题;指出子集依赖的能力效用、策略诱导的状态偏移,使得固定集合、单工具路由方案存在固有缺陷。
- 提出CoCA完整学习框架:条件成对效用建模、自回归子集策略、双层同策略蒸馏、轨迹级多目标强化调优。
- 在长视界多模态仿真环境、受控能力‑需求迁移场景完成实验;相比SOTA基线,在任务成功率、能力分配质量、计算开销上取得提升。
2 相关工作
2.1 智能体系统的能力分配
现有智能体能力调度方案:固定能力集合、预定义工作流、单工具路由(每一步仅选一个工具)。
动态工具选择、开销感知路由、自适应智能体组合已有相关研究,但大多没有处理组合子集选择:一次可以同时激活多个能力,且能力之间效用互相耦合。
组合空间巨大,很难获取每一步最优子集标签;现有模仿专家流水线、阶段子集标注方案,难以适配耦合条件。
2.2 基于偏好监督的同策略学习
偏好RLHF大多针对单动作输出;CoCA面向集合类组合动作,监督信号是条件成对对比;双层蒸馏专门处理学生策略自己生成的状态与部分子集带来的分布偏移。
3 方法
3.1 问题形式化
环境M MM,能力全集C = { c 1 , c 2 , … , c K } \mathcal{C}=\{c_1,c_2,…,c_K\}C={c1,c2