【Agent】Towards Long‑Horizon Agents: A Survey
2026/9/1 15:38:43 网站建设 项目流程

note

  • VideoSeek Benchmark:Tool-augmented active perception in long video
  • 多模态理解侧重于如何在较长的时间跨度内定位有用信息,包括决定检查哪些片段以及调用哪些感知工具。
    • Understanding​ → 主要吃 C1(H1)和 C2(H2)的亏,靠 Context/Memory 外化解决;
  • 多模态生成侧重于如何理解用户意图并进行多轮规划、生成与优化,这一过程依赖于外部证据、验证机制和持久记忆。
    • Generation​ → 叠加不可逆副作用,靠 Plan-Execute + Verification 解决;
  • 全模态智能体侧重于不同模态之间的协调,使它们能够共同完成端到端任务
    • Omnimodal​ → 推到 H3/C3,必须 World Model + Self-evolution + Embodiment 一起上。

文章目录

  • note
    • 一、Towards Long‑Horizon Agents
    • 二、必须记住的三个关键概念
      • 1. 长时程的本质不是"时间长",而是"步骤间强耦合 + 持续反馈"
      • 2. 三层任务难度 + 三种对应能力(H1⊂H2⊂H3,C1⊂C2⊂C3)
      • 3. 与相邻概念的边界(避免混淆)
    • 三、演化脉络:控制面(Control Surface)的三次拓宽
    • 四、两大支柱
      • 🔧 支柱 I:Harness —— 把能力"外置"到运行时(第 4 章)
      • ⚙️ 支柱 II:Optimization —— 把能力"内化"进策略(第 5 章)
    • 五、应用场景:五类 Agent(按"交互接口"划分)
    • 六、前沿挑战(Frontier):四条主线
    • 七、重点提炼(TL;DR)
    • 八、相关benchmark
  • Reference

一、Towards Long‑Horizon Agents

论文标题:Towards Long-Horizon Agents: A Survey
论文链接:https://openreview.net/forum?id=HyhfhlbWGh
项目主页:https://long-horizon-agents.github.io/
项目仓库:https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents

论文:Towards Long-Horizon Agents: A Survey —— Foundation, Evolution, Harness, Optimization, Application, and Frontier
来源:中国人民大学等联合撰写(RUC-NLPIR 组),149 页,2026 年最新综述
一句话主旨长时程智能体(Long-Horizon Agent)的能力 = 外部化的 Harness 工程 + 内部化的模型优化,二者共同演化。

过去几年大模型从"单轮对话"走向"能持续行动的智能体",但整个领域存在一个根本缺口:没有统一的定义和分类法。"long-context / long-running / autonomous / self-evolving"这些词被混用,导致一项改进到底来自模型、Harness、数据还是评测协议,根本无法归因。

本文的核心论点(贯穿全文的 thesis):

长时程能力不是模型单方面的属性,而是「外部化 Harness 工程」与「内部化模型优化」共同演化的系统级能力。
Agent = π θ ⊕ H \text{Agent} = \pi_\theta \;\oplus\; \mathcal{H}Agent=πθH
其中π θ \pi_\thetaπθ是基础模型的策略,H \mathcal{H}H是环绕它的运行时结构(循环、工作流、工具、记忆、编排、钩子、验证)。⊕ \oplus运行时耦合,不是简单相加。

一个极具洞察力的动态判断:能力在 Harness 与模型之间持续迁移——Harness 的机制逐步被内化进模型权重(如把 ReAct 循环训成模型本能),更强的策略又反过来解锁更高级的 Harness。

该综述的整体逻辑:

Foundation(定义 + H1/H2/H3 三层) ↓ 控制面三次拓宽 Evolution(Prompt → Context → Runtime) ↓ 一分为二、共同演化 ┌──────────────────────────────────────────────┐ │ Pillar I: Harness(外部化) Pillar II: Optimization(内部化) │ │ 循环/工作流 Context/记忆 架构 → 数据/环境 → 预训练 → 微调 │ │ 工具/MCP 编排 钩子 验证 → Agent RL → OPD → 自演化 │ └──────────────────────────────────────────────┘ ↓ 能力迁移(Harness ⇄ 模型权重) Application(5 类场景 + 基准) ↓ Frontier(演化/有效性/效率/可信赖性)

二、必须记住的三个关键概念

1. 长时程的本质不是"时间长",而是"步骤间强耦合 + 持续反馈"

论文明确驳斥了"跑得久 = 长时程"的误解。真正的定义性特征是:大量紧密耦合的决策组成一条轨迹,误差会沿依赖图累积,且需要与真实环境持续交互、修订。一个可分解的长时间批处理,并不算长时程。

三大典型失败模式(全文技术讨论的骨架):

  • Goal drift & 错误累积:成千上万步后偏离原目标,局部错误把轨迹推向错误推理路径。
  • Context rot & 上下文压力:工作上下文填满后性能骤降;或模型因"感知到上下文上限"而提前终止、把部分进展谎报为成功。
  • 稀疏延迟奖励 & 不可逆性:只在终点给 reward,中间信号极稀疏;且动作越久越可能触发高风险不可逆操作——可恢复性(recoverability)成为刚需

2. 三层任务难度 + 三种对应能力(H1⊂H2⊂H3,C1⊂C2⊂C3)

任务层级范围所需能力核心挑战
H1上下文内单个窗口内(约分钟级)C1上下文内交互推理多步组合、验证与恢复
H2跨上下文跨窗口 / 跨会话C2跨上下文状态与记忆状态压缩、外部化、checkpoint 与续跑
H3跨任务流开放、持续的任务流C3跨任务经验积累技能复用、持续学习、目标漂移

三个递进论断(极其精辟):

  • H1 证明:单步准确 ≠ 成功(需持续交互);
  • H2 证明:更大的上下文窗口 ≠ 成功(需压缩/外部化状态);
  • H3 证明:单次任务成功 ≠ 成功(需把部署经验沉淀为持久能力)。

每一层的能力都可由"外部 Harness 提供"或"内部训练内化"两条路径达成——这正是全文两大支柱的由来。

3. 与相邻概念的边界(避免混淆)

  • vs Long-running:长运行强调"执行时长",长时程强调"决策依赖图的耦合深度"。
  • vs Autonomous:自主性是关于"谁做主",长时程是关于"能否跨越依赖链完成任务",两者正交。
  • vs Self-evolving:自演化强调"随时间改进自身",长时程强调"单次任务的跨度";自演化是长时程在 H3 层面的一种手段,二者有重叠但不等价。

三、演化脉络:控制面(Control Surface)的三次拓宽

阶段时期控制对象代表技术
Stage IPrompt Engineering2020–2023单轮提示CoT、Plan-and-Solve、Least-to-Most、Self-Refine
Stage IIContext Engineering2023–2025上下文窗口RAG、GraphRAG、RAPTOR、Self-RAG、ReSum
Stage IIIRuntime Harnesses2025–至今运行时系统ReAct、Toolformer、AutoGPT、OpenHands、NLAH

趋势:控制单位从"一句话提示" → “一窗口上下文” → “一整套运行时闭环”,能力边界由模型内部逐步外溢到 Harness。

关键数据(METR):前沿 agent 的任务时长中位数约每 7 个月翻倍,近期加速到约每 4 个月;GLM-5.1 报告单任务可持续独立执行8 小时(规划→实现→测试→迭代→交付)。前沿已接近16 小时天花板。


四、两大支柱

🔧 支柱 I:Harness —— 把能力"外置"到运行时(第 4 章)

六类运行时结构,是让长时程执行"可规定、可引导、可验证、可恢复"的关键:

  1. Loops & Workflows:线性 / Plan-Execute / 分支工作流(ReAct、ToT、LATS、Reflexion)。
  2. Context & Memory:工作上下文 + 持久记忆(MemGPT、MemoryBank、MemoryOS)——解决 H2 状态外部化。
  3. Tools, MCP & Skills:工具接口与协议(Toolformer、Gorilla、MCP)、主动工具发现、技能库。
  4. Orchestration:任务分解与角色、协调拓扑、编排优化、Agent 协议(MetaGPT、AutoGen、LangGraph、A2A)。
  5. Hooks & Middleware:预定义规则钩子、用户自定义钩子、运行时自适应钩子(Claude Code hooks、ShieldAgent)——安全与可恢复性的落点
  6. Verification:验证目标、验证层级、验证器策略(Reflexion、CRITIC、AgentHarm、OWASP)。

⚙️ 支柱 II:Optimization —— 把能力"内化"进策略(第 5 章)


完整的 Agent 训练流水线,从架构到自演化:

  1. Architectural Substrate:显式上下文 / 压缩状态 / 混合架构 / 高吞吐机制(DeepSeek、NSA、FlashAttention、Mamba)。
  2. Data & Environment Synthesis:任务合成、环境合成、轨迹合成(WebShaper、SWE-Gym、SWE-smith、EnvScaler)——论文直言:环境构建才是下一阶段的能力瓶颈,而非模型规模
  3. Pre/Mid-training:推理先验、长上下文状态、多模态感知、数据混合策略(DeepSeek-V3、Qwen3、GLM-4.5)。
  4. Fine-tuning:指令筛选与混合、课程学习、蒸馏(AgentTuning、CodeActInstruct、ToolACE)。
  5. Agentic Reinforcement Learning(重点章节):
    • Credit Assignment:Outcome / Process / Rubric / Multi-granularity 四类信用分配;
    • Policy Optimization:GRPO 等;
    • Sampling Strategy
    • Interaction Patterns:层级、工具使用、多智能体协作、记忆。
  6. On-Policy Distillation (OPD):教师引导 OPD + 自改进 OPD(GKD、SCoRe、MAD-OPD)——在线自适应生成监督。
  7. Self-evolution:离线自演化 / 在线自演化 / Agent-环境共演化(ExpeL、Absolute Zero、ADAS、DGM)——对应 H3 的能力内化。

五、应用场景:五类 Agent(按"交互接口"划分)

应用接口反馈强度关键技术
Software Engineering代码 / 终端(测试/编译,硬 oracle)仓库定位、工作流规划、反馈驱动修复
Information Seeking搜索引擎/文档(仅证据)深度搜索、广度搜索、研究综合
Computer Use截图/DOM/键鼠部分(延迟状态)浏览器/桌面 GUI/移动端 Agent
Multimodal视频/音频/图像流稀疏多模态理解/生成、全模态 Agency
General-purpose多工具/多接口/人混合个人助理、具身 Agent、生产性 Agent

一个重要洞见:从"软件工程"(边界清晰、反馈强、可验证)到"通用 Agent"(开放、异构、反馈弱),是能力需求递增的光谱——越往右,越依赖 Harness 的验证与恢复机制。

评测资源:SWE-bench、WebArena、OSWorld、Mind2Way、AndroidWorld、GAIA、AgentBench、τ-bench、MLE-bench、Terminal-Bench、METR 等,覆盖从代码到具身的完整基准。

六、前沿挑战(Frontier):四条主线

维度核心问题
EvolutionHarness/模型自演化、Harness 的泛化与可迁移性、持续终身学习
Effectiveness真实世界环境交互、从数字 Agent 到具身 Agent
Efficiency成本/预算感知、多模态与全模态 Harness 的证据调度(何时观察、保留什么、如何压缩)
Trustworthiness反思与错误鲁棒性、安全与治理

几处点睛观点(作者 Outlook):

  • 下一阶段能力瓶颈是环境构建,而非模型规模
  • "忠实度(faithfulness)"值得像任务成功率一样被显式评测;
  • 反思(reflection)应基于外部可验证证据,而非让模型自说自话;
  • 安全上需把人类纠偏轨迹纳入训练,让 Agent 学会"何时 + 如何"请求干预。

七、重点提炼(TL;DR)

  1. 长时程 ≠ 时间长,而是"决策强耦合 + 误差累积 + 持续反馈 + 需恢复"。
  2. 核心公式Agent = π θ ⊕ H \text{Agent} = \pi_\theta \oplus \mathcal{H}Agent=πθH,能力由 Harness 与模型共同演化塑造——这是全文灵魂。
  3. 三层任务 H1/H2/H3 ↔ 三种能力 C1/C2/C3:上下文推理 → 状态记忆 → 经验积累(递进嵌套)。
  4. Harness 六件套(循环、记忆、工具、编排、钩子、验证)是"可靠长时程"的工程落点;Optimization 七步走(架构→数据环境→预训练→微调→Agent RL→OPD→自演化)是"能力内化"的训练路径。
  5. 瓶颈转移:下一步限制因素从"模型规模"转向"环境构建 + 忠实度评测 + 可恢复性/安全性"。
  6. 实践启示:想让 Agent 可靠跑数小时,靠的不只是换更大模型,而是好的 Harness(验证器 + checkpoint + 记忆 + 预算控制)长时程训练数据/RL的组合。

八、相关benchmark

Reference

[1] Towards Long‑Horizon Agents: A Survey
[2] 人大高瓴最新发布149页综述-迈向长程智能体

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询