☰
9.26 大语言模型研究简报:把 Agent 开发做成“数据—训练—Harness”闭环
2026/9/27 8:51:55 网站建设 项目流程

Qwen-Planner-Agent:把 Agent 开发做成“数据—训练—Harness”闭环

公开时间(北京时间):2026 年 9 月 24 日 22:38
机构:Alibaba Token Hub / MAI Team
状态:论文预印本 + 技术报告

核心进展

阿里MAI团队发布Qwen-Planner-Agent,重点不是单独训练一个更强的手机Agent,而是建立一套闭环开发框架:

AI for Data → AI for Training → AI for Harness

其中:

  • Data:多个 Agent 自动构造任务、采集轨迹、分析失败,并据此生成下一轮训练数据;
  • Training:先做planning-oriented SFT,再做hybrid-environment online RL;
  • CARE:根据模型当前能力动态调整reward / advantage,在任务成功率和推理、工具调用成本之间做权衡;
  • Harness:统一接入Memory、Skills、Tools和sub-agent,并把执行失败重新反馈给数据与训练环节。

作者报告,Qwen-Planner-Agent 27B在自建MobilePA-Bench上达到77.05% Overall,相比基座模型提升9.83 个百分点。该结果来自团队自建benchmark,仍需独立复现。

为什么重要

真正值得关注的是Model–Harness co-evolution。

过去很多Agent系统是:

固定模型 + 人工 Harness + Benchmark

这里变成:

执行 → 失败证据 → 数据生成 → RL → Harness 修改 → 再执行

也就是说,模型训练和 Agent runtime 不再完全分离,而是共同迭代。

与此前工作的关系

这项工作延续了Qwen / MAI在Mobile Agent、GUI Agent上的路线,但进一步把重点从“模型本身更强”转向:

训练数据飞轮 + Online RL + Memory/Skill/Tool Harness 的联合优化。

它更像一种agentic post-training + runtime co-design方法,而不是新的通用基础模型。

具体技术路线

这个是Qwen论文中,给出的lifecycle图

这个图里,Qwen提出的核心其实不是一个单一训练流程,而是一个持续自我改进的AI-for-AI Lifecycle。它把Agent的开发拆成三个相互连接的闭环:AI for Data、AI for Training、AI for Harness,再用 AI 诊断和人工审核把三个闭环串起来。

可以概括成:

真实任务执行 → 收集轨迹 → 构造/清洗数据 → 训练 Planner → 在线 RL → 真机执行 → 诊断失败 → 回流数据与训练 → 再迭代

第一部分是 AI for Data。系统先自动构造可执行任务,然后让 Agent 与环境交互,收集成功和失败的 trajectory。收集到的数据不会直接拿去训练,而是经过 Clean、Filter、Reweight,把高价值轨迹筛出来。这里形成第一个循环:

Task Construction → Trajectory Collection → Data Composition → 再生成新任务

意思是数据集不是一次性固定的,而是随着模型暴露出的弱点持续更新。

第二部分是 AI for Training。整理好的数据先进入 Planning Cold Start,让模型通过监督学习掌握基本 planning pattern。之后进入 Online Agentic RL,在真实或近真实环境中继续强化。这里的关键是 CARE schedule:根据模型当前能力动态调节训练难度和 reward,使训练重点跟着模型的短板变化。

训练后再做 Planner Evaluation,测模型在哪些任务上成功、在哪些地方失败;这些诊断结果又反馈给下一轮 cold start 和 RL。于是形成第二个闭环:

Planning Cold Start → Online Agentic RL → Planner Evaluation → 再训练

第三部分是 AI for Harness。训练好的模型并不是裸奔,而是放进一个 Harness 里运行。Harness 包括:

Context + Skills + Memory

模型负责 Plan → Act → Recover,Harness 则提供上下文、技能调用、记忆和运行时支持。系统随后在真实设备上执行任务,执行结果再反馈回来。

所以这一部分的闭环是:

Model → Harness → Real-device Execution → Feedback → Model / Harness

这点很重要,因为 Qwen 的思路不是只优化模型参数,而是同时优化模型和 runtime。

整个框架最关键的是底部这条“跨层反馈链”:

Real-device traces → AI-assisted Diagnosis → Human Review → 版本控制 / 审批 → 回流 Data / Training / Harness

AI 先分析失败轨迹,提出修改建议;人类负责最终审核、版本控制和批准。也就是说,它不是完全自动闭环,而是 AI 自动诊断 + 人类治理。

如果压缩成一句话:

Qwen Planner Agent 的 Lifecycle 本质上是一个“数据飞轮 + 训练飞轮 + Harness 飞轮”的三重闭环:真实执行产生失败,失败被 AI 诊断,诊断结果反过来生成新数据、调整训练策略和改进运行时系统,从而让 Agent 持续迭代。

相比传统流程:

Dataset → Train → Deploy

它更接近:

Deploy → Observe → Diagnose → Improve Data / Model / Harness → Redeploy

这也是这张图最核心的思想。

P.S. 这里 lifecycle 一般指的是:一个产品,“从创建到持续运行和迭代”的全过程

针对上述内容中提到的核心模块,可以分成AI for Data数据、‘AI for Training’ 训练、AI for Harness执行框架,三个部分,而且根据技术文档,可以把这三个模块理解成一个很清晰的闭环:Data负责发现并补齐能力缺口,Training负责把数据转化为能力,Harness负责把能力稳定地落到真实执行,并把执行反馈重新送回前两层。

  1. AI for Data:把“失败”转成下一轮训练数据


核心目标是:不是被动收集数据,而是根据模型当前不会什么,主动生成它最需要的数据。

流程可以压缩成:

能力需求 / 评测失败 → 构造可执行任务 → 多环境采集 trajectory → 验证与筛选 → 调整采样权重 → 进入训练
其中有三个关键动作:

  • Task Construction:根据能力需求或评测暴露的问题,自动构造任务,明确目标、工具、初始状态和完成条件。
  • Trajectory Collection:让 Agent 在 LLM 模拟环境、Sandbox 和真机上执行,收集完整的动作、反馈和结果。
  • Weakness Diagnosis:根据训练和评测结果判断哪些能力已经掌握、哪些不稳定、哪些完全缺失,然后分别做 down-sample / up-weight / new tasks。

所以 Data 模块本质上是一个:

failure-driven data flywheel

不是“数据越多越好”,而是让每一轮数据都对应一个明确的能力缺口。

  1. AI for Training:根据模型能力动态调整学习目标


核心目标是:模型在不同能力阶段,不应该使用完全相同的训练目标和奖励。
训练分成两步。

第一步是 Planning Cold Start / SFT。
先用高质量 trajectory 教模型基本的 planning pattern。对于错误动作可以 mask 掉,但保留经过验证的 recovery trajectory,让模型不仅学会“正确执行”,也学会“出错以后怎么恢复”。

第二步是 Online Agentic RL。
模型进入模拟环境、Sandbox 和精选真机环境中实际执行,再根据结果在线更新。

这里最关键的是 CARE。它根据当前模型的 competence 动态切换训练重点:

不会做时 → 强调 exploration / progress
基本会做时 → 强调 accuracy / task completion
已经稳定会做时 → 强调 efficiency,减少冗余 reasoning 和 tool calls
也就是:

先学会做,再学会稳定做,最后学会高效做。

因此 Training 模块不是固定 reward 的 RL,而是 competence-aware curriculum。

  1. AI for Harness:让模型能力在真实环境中稳定发挥


Harness 可以理解成 Agent 的 runtime / execution layer。
模型主要负责:

Reasoning → Planning → 输出 structured actions

Harness 负责:

理解运行时上下文 → 选择技能/工具 → 路由 action → 管理 memory → 执行 → 验证

这里有三个关键部分。

Scenario Adapter:根据当前任务和可用工具,加载合适的 skills、instruction 和操作流程。
Memory Manager:不是简单保存历史,而是保留 evidence / provenance,检查信息来源、冲突和过期内容。
Real-device Execution + Verifier:实际在设备上执行,并记录成功轨迹和失败结果。
这些真实执行证据再进入 AI-assisted Diagnosis,系统会分析:

  • 是模型 planning 错了?
  • 是 memory/context 有问题?
  • 是 skill 不合适?
  • 还是 Harness 的 routing / instruction 有问题?

然后决定下一轮是:

更新 Model,还是更新 Harness,或者两者一起更新。

所以 Harness 不是固定工程层,而是可以与模型 co-evolve 的。

  1. 总体 Workflow

整个系统可以压缩成这一条链:

真实执行 → 暴露失败 → AI 诊断能力缺口 → 构造针对性任务 → 收集和整理 trajectory → SFT 冷启动 → Online RL → 更新模型 → Harness 真机执行 → 再收集反馈

进一步抽象就是:

Observe → Diagnose → Generate Data → Train → Deploy → Execute → Observe

三个模块分别负责:

  • AI for Data:决定“下一步应该学什么”
  • AI for Training:决定“应该怎么学”
  • AI for Harness:决定“学到的能力怎么在真实环境中稳定发挥”

因此 Qwen Planner Agent 最核心的思想可以概括为:

把 Agent 开发从一次性的“数据 → 训练 → 部署”,变成由真实执行反馈驱动的 Data–Model–Harness 协同演进闭环。

最后,如果大家感兴趣的话,可以仔细阅读相关链接。

相关链接

  1. arXiv:Qwen-Planner-Agent
  2. 官方项目页 / Technical Report
  3. 官方 GitHub
  4. Hugging Face Papers

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询