什么样的智能体数据才算优质?——基于ACE视角的大语言模型智能体数据生成研究
论文来源:arXiv:2608.27260v1
摘要
大语言模型智能体越来越依赖生成式交互数据,以此学习与外部环境进行交互。和传统指令合成不同,智能体数据生成需要保证环境、任务、交互过程、成功信号四者之间的一致性,产出真正具备学习价值的数据,而不只是追求数据规模。现有相关工作覆盖众多智能体领域,但大多以应用领域为边界组织内容,异构的评价方式掩盖了通用生成机制,还经常把候选样本构建、校验筛选混为一谈。
本文建立一套两层分析框架:
- 将智能体数据抽象为可跨领域复用的因子化数据对象d = ( E , q , τ , v ) d=(E,q,\tau,v)d=(E,q,τ,v),分别代表环境规约、任务信号、交互实现、可选校验器;
- 将数据生成建模为带约束的分布设计,提出**(\mathcal{A})CE框架:准确性((\mathcal{A})ccuracy)‑复杂度(Complexity)‑多样性(divErsity)**。
- 准确性:定义具备可执行、内部自洽的数据可行支持集;
- 复杂度:在可行集合内,针对目标学习者能力与执行配置,分配有学习意义的数据样本;
- 多样性:保证环境、任务、交互行为层面具备有效覆盖度,降低样本冗余。
依托(\mathcal{A})CE框架,本文梳理现有研究如何做生成样本校验、难度构建校准、行为覆盖拓展。从已有文献可以看到研究趋势:从单纯判断结果是否合理,转向基于执行过程保障准确性;从静态难度启发式指标,转向相对模型能力的复杂度评估;从表面文本变体,转向真正行为层面的多样性。
进一步借助(\mathcal{A})CE视角探讨更多拓展方向:缩放定律、真实数据与合成数据、智能体预训练/中间训练的数据生成、自演化智能体的数据生成。
本文核心结论:智能体数据生成的难点不在于生成更多数据,而是随着智能体与环境不断演化,持续产出有效、高信息增益、低冗余的交互经验。
主要贡献
- 以(\mathcal{A})CE为核心,对智能体数据生成领域进行综述梳理,系统整理生成流水线保障准确性、校准面向学习者的复杂度、拓展有效多样性的各类方法,同时整理各领域实证、度量方式、成本与局限性;
- 提出跨领域的智能体数据形式化定义:因子化数据对象d = ( E , q , τ , v ) d=(E,q,\tau,v)d=(E,q,τ,v),统一刻画工具调用、软件工程、G(\mathcal{U})I、具身智能、社交智能体、科学智能体等场景下的数据组件与一致性约束;
- 面向机制的生成范式分类:按照主要锚定因子与依赖关系划分流水线,区分「数据如何构建」和「候选样本如何评估筛选」,而不是按照应用领域打标签。
目录
- 引言
- 形式化建模
2.1 智能体多轮交互
2.2 环境参数化
2.3 从交互到智能体数据
2.4 通用数据对象 - 生成范式
3.1 因子化视角
3.2 正向生成
- 交互过程的实现
3.3 反向生成
3.4 (\mathcal{A})CE:受约束的分布设计 - 准确性
4.1 (\mathcal{A})CE目标下的准确性
4.2 因子层面的准确性
4.3 数据全流程的准确性保障
- 4.3.1 规则‑模型‑人工分层校验
- 4.3.2 约束驱动式构建
- 4.3.3 基于执行与状态的校验
- 4.3.4 基于反馈的修复与选择性接纳
4.4 准确性的成本、权衡与局限
- 校验强度与成本
- 和复杂度、多样性的耦合关系
- 残留语义不确定性 - 复杂度
5.1 (\mathcal{A})CE目标下的复杂度
5.2 因子层面的复杂度
5.3 智能体复杂度的构建与校准
- 5.3.1 结构规约与组合
- 5.3.2 任务与信息控制
- 5.3.3 环境与交互设计
- 5.3.4 完成条件与反馈设计
- 5.3.5 演化与渐进式变换
- 5.3.6 基于失败、感知模型能力的校准
- 5.3.7 双向校准与脚手架辅助
5.4 复杂度的估计与报告方式
5.5 复杂度的权衡与局限
- 复杂度 vs 准确性
- 复杂度 vs 多样性
- 复杂度 vs 现实真实性
- 代理指标保真度与校准成本
- 任务难度 vs 可学习性
- 课程漂移与闭环偏差 - 多样性
6.1 (\mathcal{A})CE目标下的多样性
6.2 因子层面的多样性
- 环境规约多样性
- 任务信号多样性
- 交互实现多样性
- 生成器与来源溯源多样性
6.3 拓展智能体多样性:实现机制与各领域实证
- 6.3.1 数据源与支持集扩展
- 6.3.2 组合重组
- 6.3.3 探索优先、经验驱动发现
- 6.3.4 扰动与反事实变体
- 6.3.5 覆盖度引导的平衡与自适应
- 6.3.6 分领域实现与实证
* 工具使用与数字智能体
* Web、G(\mathcal{U})I、计算机操作智能体
* 代码与软件工程智能体
* 具身与社交智能体
* 科学与形式化推理智能体
6.4 多样性的度量
- 因子覆盖度与均衡性
- 行为非冗余性
- 基于(\mathcal{A})CE约束的覆盖度
- 迁移覆盖度
- 学习者边际收益
6.5 多样性的权衡与局限
- 多样性 vs 数据规模
- 多样性 vs 准确性
- 多样性 vs 感知模型的复杂度
- 真实性、可控性、规模之间矛盾
- 混合干扰与开放世界漂移 - 讨论
7.1 (\mathcal{A})CE目标下的缩放定律
7.2 (\mathcal{A})CE视角下真实数据与合成数据
7.3 面向智能体预训练、中间训练的数据生成
7.4 面向自演化智能体的数据生成 - 结论
- 参考文献
1 引言
大语言模型智能体需要执行动作而不仅仅输出文本响应:调用工具、操作系统、检索信息、修改文件,与模拟世界或物理世界交互。学习这类行为需要大量将决策、观测、状态变更关联起来的多轮交互经验。人工采集这类交互数据成本高昂,校验与扩充难度大,因此智能体数据生成成为训练与评估智能体的核心手段。
核心挑战不是简单生成更多样本,而是保证生成经验具备:准确、适配学习者的复杂度、足够的多样性。
智能体数据生成不等于“生成指令+采样回复”。一份高质量样本需要可执行环境、具备现实基础的任务、能产生有效观测和状态变更的交互过程。现代流水线不仅生成指令与演示轨迹,还产出工具生态、可执行环境、有状态任务、回滚反馈、校验流程。本文提出(\mathcal{A})CE三元组框架:
- 准确性(\mathcal{A})ccuracy:生成经验是否落地现实、内部自洽;
- 复杂度Complexity:对特定学习者是否构成有价值的挑战;
- 多样性divErsity:数据集是否覆盖不同场景行为,而不是简单重复。
当前该领域文献较为碎片化,很多研究以应用领域来描述数据((\mathcal{A})(\mathcal{P})I调用、代码库任务、G(\mathcal{U})I演示、模拟器回滚、科学发现经验等),带来两个问题:
- 机制与应用混淆:通用机制分散在不同场景论文中;
- 流水线描述混杂:把候选样本构建、校验、筛选、分配给学习者混在一起描述。
不同论文使用不同术语描述同类机制;而本质差异很大的生成流程,评价标准却难以对齐。因此需要一套统一描述:流水线构造哪些组件、如何在(\mathcal{A})CE约束下塑造数据分布。
本文把智能体数据抽象成因子化对象:d = ( E , q , τ , v ) d=(E,q,\tau,v)d=(E,q,τ,v)
- E EE:可执行世界,包含状态、动力学、策略、动作‑观测接口;
- q qq:任务条件目标与约束;
- τ \tauτ:已经发生的交互记录;
- v vv:可选,结果或过程监督信号,可以是可执行检查、模型评判、奖励。
该抽象可以兼容各类智能体场景,不需要每个数据集都序列化完全一样的字段。更关键的是明确(\mathcal{A})CE分别作用对象:准确性关注各因子局部有效性和相互一致性;复杂度关注配置带来的学习负担;多样性关注非冗余的覆盖范围。
图1:(\mathcal{A})CE视角将智能体数据生成视为受约束分布设计:准确性定义可行支持集;面向学习者的复杂度、多样性,共同在( E , q , τ , v ) (E,q,\tau,v)(E,q,τ,v)之上塑造有效、非冗余的经验分布。
(\mathcal{A})CE的非对称特性十分关键:难度高、变体多不能补偿样本本身无效;但是全部有效但过于简单、高度重复的数据学习收益很低。(\mathcal{A})CE不是数据集治理的完整检查清单,成本、效率、安全依旧是外部约束。(\mathcal{A})CE聚焦生成阶段直接决定智能体经验学习价值的三个属性,作为分析各类生成机制的统一透镜。
基于因子化表示,本文提出面向机制的生成范式分类,依据主要锚定因子、其余因子实例化依赖关系划分:
- 正向流水线:在已有环境中落地任务与交互;
- 任务优先、轨迹优先流水线:围绕目标能力或观测经验构造其余因子;
- 结构优先流水线:使用中间图、规划、蓝图协调全部因子。
这套框架同样可以描述联合迭代、自改进系统:校验失败、学习者反馈反过来修改已经生成的因子。生成范式回答如何构造数据;(\mathcal{A})CE回答哪些候选样本应当被接纳、优先使用。
梳理现有文献,可以看到清晰趋势:从只判断“看上去合理”走向基于执行保障准确性;从静态难度启发式走向相对模型、执行配置的复杂度;从表面文本变体走向真正行为层面覆盖度。同时智能体数据不再局限于训练后固定轨迹,拓展到预训练、中间训练监督信号,以及跟随学习者不断变化的闭环经验。
2 形式化建模
2.1 智能体多轮交互
参考将工具增强交互建模为部分可观测马尔可夫决策过程(\mathcal{P})(\mathcal{O})M(\mathcal{D})(\mathcal{P})的已有工作:
KaTeX parse error: Can't use function '\(' in math mode at position 24: …l{M}=(\mathcal{\̲(̲\mathcal{U}\)},…
- KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{U}\)}:任务/用户意图空间
- KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{S}\)}:隐状态空间
- KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{A}\)}:动作空间,包含文本回复、面向环境执行动作
- KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{O}\)}:观测空间
- KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{P}\)}:状态转移规则
- KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{R}\)}:可选奖励/评估函数
在第t tt轮,智能体基于可观测历史选择动作;环境返回新观测,同时更新内部隐状态:
KaTeX parse error: Can't use function '\(' in math mode at position 132: …})\sim\mathcal{\̲(̲\mathcal{P}\)}(…
关键区分:轨迹记录智能体看到什么、做什么;而可执行环境维护隐状态,用于状态转移、奖励计算。
该抽象可以覆盖绝大多数智能体场景:
- 工具调用:动作是结构化(\mathcal{A})(\mathcal{P})I调用,观测为工具返回值;
- Web/G(\mathcal{U})I智能体:动作是界面操作,观测为视觉或结构化页面状态;
- 代码智能体:环境包含代码仓库、shell、依赖、测试用例;
- 具身智能:模拟器或者物理真实世界。
用户轮次被包含在观测中:用户逐步给出约束、回答澄清问题、修改原始请求。任务不一定等于第一轮用户语句,可以是在整个交互过程逐步显现的隐式意图。
一条实现完成的交互轨迹记作:
τ = ( o 0 , a 1 , o 1 , … , a T , o T ) \tau=(o_{0},a_{1},o_{1},\ldots,a_{T},o_{T})τ=(o0,a1,o1,…,aT,o