note
- VideoSeek Benchmark:Tool-augmented active perception in long video
- 多模态理解侧重于如何在较长的时间跨度内定位有用信息,包括决定检查哪些片段以及调用哪些感知工具。
- Understanding → 主要吃 C1(H1)和 C2(H2)的亏,靠 Context/Memory 外化解决;
- 多模态生成侧重于如何理解用户意图并进行多轮规划、生成与优化,这一过程依赖于外部证据、验证机制和持久记忆。
- Generation → 叠加不可逆副作用,靠 Plan-Execute + Verification 解决;
- 全模态智能体侧重于不同模态之间的协调,使它们能够共同完成端到端任务
- Omnimodal → 推到 H3/C3,必须 World Model + Self-evolution + Embodiment 一起上。
文章目录
- note
- 一、Towards Long‑Horizon Agents
- 二、必须记住的三个关键概念
- 1. 长时程的本质不是"时间长",而是"步骤间强耦合 + 持续反馈"
- 2. 三层任务难度 + 三种对应能力(H1⊂H2⊂H3,C1⊂C2⊂C3)
- 3. 与相邻概念的边界(避免混淆)
- 三、演化脉络:控制面(Control Surface)的三次拓宽
- 四、两大支柱
- 🔧 支柱 I:Harness —— 把能力"外置"到运行时(第 4 章)
- ⚙️ 支柱 II:Optimization —— 把能力"内化"进策略(第 5 章)
- 五、应用场景:五类 Agent(按"交互接口"划分)
- 六、前沿挑战(Frontier):四条主线
- 七、重点提炼(TL;DR)
- 八、相关benchmark
- Reference
一、Towards Long‑Horizon Agents
论文标题:Towards Long-Horizon Agents: A Survey
论文链接:https://openreview.net/forum?id=HyhfhlbWGh
项目主页:https://long-horizon-agents.github.io/
项目仓库:https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents
论文:Towards Long-Horizon Agents: A Survey —— Foundation, Evolution, Harness, Optimization, Application, and Frontier
来源:中国人民大学等联合撰写(RUC-NLPIR 组),149 页,2026 年最新综述
一句话主旨:长时程智能体(Long-Horizon Agent)的能力 = 外部化的 Harness 工程 + 内部化的模型优化,二者共同演化。
过去几年大模型从"单轮对话"走向"能持续行动的智能体",但整个领域存在一个根本缺口:没有统一的定义和分类法。"long-context / long-running / autonomous / self-evolving"这些词被混用,导致一项改进到底来自模型、Harness、数据还是评测协议,根本无法归因。
本文的核心论点(贯穿全文的 thesis):
长时程能力不是模型单方面的属性,而是「外部化 Harness 工程」与「内部化模型优化」共同演化的系统级能力。
Agent = π θ ⊕ H \text{Agent} = \pi_\theta \;\oplus\; \mathcal{H}Agent=πθ⊕H
其中π θ \pi_\thetaπθ是基础模型的策略,H \mathcal{H}H是环绕它的运行时结构(循环、工作流、工具、记忆、编排、钩子、验证)。⊕ \oplus⊕是运行时耦合,不是简单相加。
一个极具洞察力的动态判断:能力在 Harness 与模型之间持续迁移——Harness 的机制逐步被内化进模型权重(如把 ReAct 循环训成模型本能),更强的策略又反过来解锁更高级的 Harness。
该综述的整体逻辑:
Foundation(定义 + H1/H2/H3 三层) ↓ 控制面三次拓宽 Evolution(Prompt → Context → Runtime) ↓ 一分为二、共同演化 ┌──────────────────────────────────────────────┐ │ Pillar I: Harness(外部化) Pillar II: Optimization(内部化) │ │ 循环/工作流 Context/记忆 架构 → 数据/环境 → 预训练 → 微调 │ │ 工具/MCP 编排 钩子 验证 → Agent RL → OPD → 自演化 │ └──────────────────────────────────────────────┘ ↓ 能力迁移(Harness ⇄ 模型权重) Application(5 类场景 + 基准) ↓ Frontier(演化/有效性/效率/可信赖性)二、必须记住的三个关键概念
1. 长时程的本质不是"时间长",而是"步骤间强耦合 + 持续反馈"
论文明确驳斥了"跑得久 = 长时程"的误解。真正的定义性特征是:大量紧密耦合的决策组成一条轨迹,误差会沿依赖图累积,且需要与真实环境持续交互、修订。一个可分解的长时间批处理,并不算长时程。
三大典型失败模式(全文技术讨论的骨架):
- Goal drift & 错误累积:成千上万步后偏离原目标,局部错误把轨迹推向错误推理路径。
- Context rot & 上下文压力:工作上下文填满后性能骤降;或模型因"感知到上下文上限"而提前终止、把部分进展谎报为成功。
- 稀疏延迟奖励 & 不可逆性:只在终点给 reward,中间信号极稀疏;且动作越久越可能触发高风险不可逆操作——可恢复性(recoverability)成为刚需。
2. 三层任务难度 + 三种对应能力(H1⊂H2⊂H3,C1⊂C2⊂C3)
| 任务层级 | 范围 | 所需能力 | 核心挑战 |
|---|---|---|---|
| H1上下文内 | 单个窗口内(约分钟级) | C1上下文内交互推理 | 多步组合、验证与恢复 |
| H2跨上下文 | 跨窗口 / 跨会话 | C2跨上下文状态与记忆 | 状态压缩、外部化、checkpoint 与续跑 |
| H3跨任务流 | 开放、持续的任务流 | C3跨任务经验积累 | 技能复用、持续学习、目标漂移 |
三个递进论断(极其精辟):
- H1 证明:单步准确 ≠ 成功(需持续交互);
- H2 证明:更大的上下文窗口 ≠ 成功(需压缩/外部化状态);
- H3 证明:单次任务成功 ≠ 成功(需把部署经验沉淀为持久能力)。
每一层的能力都可由"外部 Harness 提供"或"内部训练内化"两条路径达成——这正是全文两大支柱的由来。
3. 与相邻概念的边界(避免混淆)
- vs Long-running:长运行强调"执行时长",长时程强调"决策依赖图的耦合深度"。
- vs Autonomous:自主性是关于"谁做主",长时程是关于"能否跨越依赖链完成任务",两者正交。
- vs Self-evolving:自演化强调"随时间改进自身",长时程强调"单次任务的跨度";自演化是长时程在 H3 层面的一种手段,二者有重叠但不等价。
三、演化脉络:控制面(Control Surface)的三次拓宽
| 阶段 | 时期 | 控制对象 | 代表技术 |
|---|---|---|---|
| Stage IPrompt Engineering | 2020–2023 | 单轮提示 | CoT、Plan-and-Solve、Least-to-Most、Self-Refine |
| Stage IIContext Engineering | 2023–2025 | 上下文窗口 | RAG、GraphRAG、RAPTOR、Self-RAG、ReSum |
| Stage IIIRuntime Harnesses | 2025–至今 | 运行时系统 | ReAct、Toolformer、AutoGPT、OpenHands、NLAH |
趋势:控制单位从"一句话提示" → “一窗口上下文” → “一整套运行时闭环”,能力边界由模型内部逐步外溢到 Harness。
关键数据(METR):前沿 agent 的任务时长中位数约每 7 个月翻倍,近期加速到约每 4 个月;GLM-5.1 报告单任务可持续独立执行8 小时(规划→实现→测试→迭代→交付)。前沿已接近16 小时天花板。
四、两大支柱
🔧 支柱 I:Harness —— 把能力"外置"到运行时(第 4 章)
六类运行时结构,是让长时程执行"可规定、可引导、可验证、可恢复"的关键:
- Loops & Workflows:线性 / Plan-Execute / 分支工作流(ReAct、ToT、LATS、Reflexion)。
- Context & Memory:工作上下文 + 持久记忆(MemGPT、MemoryBank、MemoryOS)——解决 H2 状态外部化。
- Tools, MCP & Skills:工具接口与协议(Toolformer、Gorilla、MCP)、主动工具发现、技能库。
- Orchestration:任务分解与角色、协调拓扑、编排优化、Agent 协议(MetaGPT、AutoGen、LangGraph、A2A)。
- Hooks & Middleware:预定义规则钩子、用户自定义钩子、运行时自适应钩子(Claude Code hooks、ShieldAgent)——安全与可恢复性的落点。
- Verification:验证目标、验证层级、验证器策略(Reflexion、CRITIC、AgentHarm、OWASP)。
⚙️ 支柱 II:Optimization —— 把能力"内化"进策略(第 5 章)
完整的 Agent 训练流水线,从架构到自演化:
- Architectural Substrate:显式上下文 / 压缩状态 / 混合架构 / 高吞吐机制(DeepSeek、NSA、FlashAttention、Mamba)。
- Data & Environment Synthesis:任务合成、环境合成、轨迹合成(WebShaper、SWE-Gym、SWE-smith、EnvScaler)——论文直言:环境构建才是下一阶段的能力瓶颈,而非模型规模。
- Pre/Mid-training:推理先验、长上下文状态、多模态感知、数据混合策略(DeepSeek-V3、Qwen3、GLM-4.5)。
- Fine-tuning:指令筛选与混合、课程学习、蒸馏(AgentTuning、CodeActInstruct、ToolACE)。
- Agentic Reinforcement Learning(重点章节):
- Credit Assignment:Outcome / Process / Rubric / Multi-granularity 四类信用分配;
- Policy Optimization:GRPO 等;
- Sampling Strategy;
- Interaction Patterns:层级、工具使用、多智能体协作、记忆。
- On-Policy Distillation (OPD):教师引导 OPD + 自改进 OPD(GKD、SCoRe、MAD-OPD)——在线自适应生成监督。
- Self-evolution:离线自演化 / 在线自演化 / Agent-环境共演化(ExpeL、Absolute Zero、ADAS、DGM)——对应 H3 的能力内化。
五、应用场景:五类 Agent(按"交互接口"划分)
| 应用 | 接口 | 反馈强度 | 关键技术 |
|---|---|---|---|
| Software Engineering | 代码 / 终端 | 强(测试/编译,硬 oracle) | 仓库定位、工作流规划、反馈驱动修复 |
| Information Seeking | 搜索引擎/文档 | 弱(仅证据) | 深度搜索、广度搜索、研究综合 |
| Computer Use | 截图/DOM/键鼠 | 部分(延迟状态) | 浏览器/桌面 GUI/移动端 Agent |
| Multimodal | 视频/音频/图像流 | 稀疏 | 多模态理解/生成、全模态 Agency |
| General-purpose | 多工具/多接口/人 | 混合 | 个人助理、具身 Agent、生产性 Agent |
一个重要洞见:从"软件工程"(边界清晰、反馈强、可验证)到"通用 Agent"(开放、异构、反馈弱),是能力需求递增的光谱——越往右,越依赖 Harness 的验证与恢复机制。
评测资源:SWE-bench、WebArena、OSWorld、Mind2Way、AndroidWorld、GAIA、AgentBench、τ-bench、MLE-bench、Terminal-Bench、METR 等,覆盖从代码到具身的完整基准。
六、前沿挑战(Frontier):四条主线
| 维度 | 核心问题 |
|---|---|
| Evolution | Harness/模型自演化、Harness 的泛化与可迁移性、持续终身学习 |
| Effectiveness | 真实世界环境交互、从数字 Agent 到具身 Agent |
| Efficiency | 成本/预算感知、多模态与全模态 Harness 的证据调度(何时观察、保留什么、如何压缩) |
| Trustworthiness | 反思与错误鲁棒性、安全与治理 |
几处点睛观点(作者 Outlook):
- 下一阶段能力瓶颈是环境构建,而非模型规模;
- "忠实度(faithfulness)"值得像任务成功率一样被显式评测;
- 反思(reflection)应基于外部可验证证据,而非让模型自说自话;
- 安全上需把人类纠偏轨迹纳入训练,让 Agent 学会"何时 + 如何"请求干预。
七、重点提炼(TL;DR)
- 长时程 ≠ 时间长,而是"决策强耦合 + 误差累积 + 持续反馈 + 需恢复"。
- 核心公式:Agent = π θ ⊕ H \text{Agent} = \pi_\theta \oplus \mathcal{H}Agent=πθ⊕H,能力由 Harness 与模型共同演化塑造——这是全文灵魂。
- 三层任务 H1/H2/H3 ↔ 三种能力 C1/C2/C3:上下文推理 → 状态记忆 → 经验积累(递进嵌套)。
- Harness 六件套(循环、记忆、工具、编排、钩子、验证)是"可靠长时程"的工程落点;Optimization 七步走(架构→数据环境→预训练→微调→Agent RL→OPD→自演化)是"能力内化"的训练路径。
- 瓶颈转移:下一步限制因素从"模型规模"转向"环境构建 + 忠实度评测 + 可恢复性/安全性"。
- 实践启示:想让 Agent 可靠跑数小时,靠的不只是换更大模型,而是好的 Harness(验证器 + checkpoint + 记忆 + 预算控制)与长时程训练数据/RL的组合。
八、相关benchmark
Reference
[1] Towards Long‑Horizon Agents: A Survey
[2] 人大高瓴最新发布149页综述-迈向长程智能体