☰
多智能体编排的三个点
2026/10/4 6:06:15 网站建设 项目流程

多智能体编排的三个点

写在前面

同一个模型,放在不同的系统结构里,产出质量差异很大。Harness engineering 的实测数据:控制模型不变,系统结构可将每任务成本降低 41%、墙钟时间降低 44%、Token 消耗降低 38%,质量持平。

这篇文章讨论一套 AI 自动化工作流在三个点上的设计——通信拓扑、完成信号闭环、多角色验证——以及这些设计为什么有效。


四项研究

SDE:提示词中语义负载 Token 占比是输出质量的强预测因子。SDE > 0.80 比稀释提示平均提升 8.4 个百分点,零额外 Token。低语义 Token 参与 softmax 归一化,稀释高语义 Token 的注意力权重。

CAVEWOMAN:压缩的后果取决于通道,且非对称。输出压缩降低成本 1.4–2.4 倍;输入压缩适得其反,净成本增加约 1.15 倍,最差 2.7 倍。模型会用更长响应补偿被压缩的输入。

Sample More Reflect Less:等 Token 成本下,自我检查不优于重复采样。36 组比较中 10 组可靠更差,全是模型检查自身输出。7B 上 Self-Refine/Reflexion 低于基线 3.6–10.1 个百分点。但模型越大,自我检查的损失越小。

MAXTOKEN:提出七层框架实现无界输出生成。关键限定:计算无界已证明可达,信息无界未证明。压缩必然有损,问题在于如何在有损前提下保持任务相关的语义锚点。


一、通信拓扑

怎么做的

子代理之间直接relay,不经过主代理。主代理禁止转发小组内部消息,两类硬拒:

  • 消息以发送方身份前缀开头 → 判定为主代理粘贴转发 → 拒绝
  • 主代理去掉前缀后逐字粘贴子代理报告 → 命中已知签名 → 拒绝

消息携带发送方身份前缀:子→父[来自子会话 <ID>],子↔子[来自会话 <ID>],父→子不携带。

为什么

三个理由。

信息保真。子代理的产出经主代理上下文后,可能被压缩、改写、丢失。主代理的上下文窗口有限,被迫承载所有子代理的完整输出会挤占其调度决策所需的工作记忆。

错误相关性。主代理与子代理共享训练语料、模型家族。经主代理中转的错误,可能被其确认而非质疑。独立验证的前提是验证者与生成者的错误分布不相关——主代理中转破坏了这一前提。

延迟与 Token 成本。中转引入额外的生成-消费循环。

送达语义

relay的 delivery 分级:

级别含义
received对端已入账签收
accepted平台受理未确认
accepted_busy受理时目标忙
queued压缩排队
rejected确定未达
timeout超时不确定

received是唯一可声称送达的证据。relayed仅表平台受理,不等于对端已读。

当前 Agent 通信协议在传输、流式、Schema 定义和生命周期管理方面已成熟,但在澄清、上下文对齐和验证方面提供的协议级机制有限。送达语义是对这一空白的填补。

与研究对照

与 SDE 一致:消息不含礼貌用语、过渡句,合规提示行仅一行。

与 CAVEWOMAN 一致:输出侧主动压缩,输入侧不压缩。


二、完成信号闭环

三路保障

子代理完成信号到达父代理有三条路径:

  1. 平台注入(原生 task 完成回传)
  2. 子代理主动 relay
  3. 插件搬运

搬运的触发条件:busy→idle 跃迁时,本窗口无 relay 回执、无平台回复、有非空摘要,且同内容未搬运过(按尾部消息 ID 判重)。

为什么三路

单路有单点失败风险。平台注入可能因版本差异丢失;子代理可能因异常中止未发 relay;主代理可能因 busy 未及时处理。三路是冗余设计——任一路径成功,完成信号即到达。

双通道去重

平台注入与插件搬运可能同时到达。判重:子级回执在本等待周期内 → 平台注入是重复信号;否则回退父级窗口判定。

task 子有精确单通道:V2 宿主平台原生 task 回复可用时,task 子不参与插件搬运。这消除了 task 场景下的双通道重复注入。

子错误上报与空闲巡检

非用户中止错误且有父 → 向父一次性上报。同签名只报一次(跨实例 CAS 抢占),子 relay 回复后清零。

派发后超窗零回复 → 巡检向父上报"已挂"并复活唤醒一次。三态:

状态处理
true已投递 → 无响应则续做经prompt直发,新任务经task新开
parked受理排队(压缩中)→ 不判终结
rejected确定未达 → 上报用户
false超时未确认 → 下轮复核

核心是区分"确定未达"与"超时未确认"。后者可能是迟到送达,立即判死会误杀;前者是确定失败,必须上报。这与分布式系统的 at-least-once 语义一致——消息可能重复,但不会静默丢失。

与研究对照

MAXTOKEN 提出压缩必然有损,问题在于保持语义锚点。工作流用context_limit(默认 400k)有界策略,达限触发压缩,保留目标状态(objective/status/budget/turns),但不保留代码结构信息。

一个可实验方向:压缩时额外保留代码骨架摘要——每个源文件的导出函数/类型签名清单。这是高信息密度、低 Token 成本的表示,与 SDE 的取向一致。


三、多角色工作流

角色矩阵

角色职责禁止
主代理分发、收口、承接、标记完成代做方案/审计/执行;转发组内消息;介入小组过程
两审计 AI独立审计,产出方案/缺陷清单(证据=路径:行)—
执行 AI按定案 TDD 实现,报审计 AI—

审计与执行必须两两不同 AI。

流程

① 两审计独立审计 → ② 磋商(互相审计盲区,多方案碰撞择优) → ③ 报主代理定案,经task新开执行 AI → ④ 执行 TDD,报审计 → ⑤ 两审计验证 → ⑥ 两名审计一致盖章 → 主代理报告

有问题重新定稿回①。审计→修复成对往复,无次数上限,直至方案能完成目标。

验证标准:禁止仅以测试通过判定。方案须命中根因、最小改动、无副作用、与既有契约一致。

组间隔离:每个缺陷/方案自成一组,组间禁止共享会话。

为什么

两审计而非一。单一审计可能漏判。模型错误存在显著相关性——两个模型都出错时对同一错误答案存在高度一致。当配对错误相关性为正时,增加 Agent 数量不会将多数错误概率降至零。一致盖章要求两者都认可,降低相关错误被采纳的概率。

审计与执行不同 AI。生成者与检查者是同一上下文时,倾向于确认已有结论。独立 AI 的错误分布不相关,交叉验证有效。

组间隔离。防止跨组上下文污染。

与研究对照

Sample More Reflect Less 的实验范围是 1.5B–7B 小模型,结论是否外推到前沿模型需要验证。但论文提供了一个可实验方向:在执行 AI 产出方案后,先让执行 AI 对同一任务多次独立采样(Best-of-N),然后由审计 AI 从多个方案中选取最优。这比"审计指出问题 → 执行改写 → 再审计"的循环更符合等 Token 成本下的最优策略。


四、控制论对应

钱学森《工程控制论》的核心概念可以对应到这套工作流:

控制论工作流
受控对象执行 AI 产出
控制器两审计独立验证 + 一致盖章
设定点定案方案
反馈回路有问题重新定稿
确定性控制层主代理调度闭环
人类边界熔断后用户决定恢复

控制器与被控对象分离。反馈控制的基本前提。控制器参与被控对象的生成,则观测会被自身参与污染。工作流中主代理不参与执行,观测是独立的。

人类在回路中。连续 5 次零输出 → 熔断。恢复必须由用户决定。系统反复进入不稳定状态时,将恢复决策交给系统外部的决策者。

反馈回路的完整性:

环节机制
状态观测get_goal是子代理状态唯一事实依据
偏差检测空闲巡检、子错误上报
修正动作唤醒+上报,或熔断
收敛条件一致盖章

每回路有明确终止与循环条件。终止条件防止无限循环,循环条件确保有问题时必须修正。


结论

三个设计点是为了解决通信冗余、完成信号丢失、验证不足。

  • 通信拓扑:子-子直连消除中转节点,送达语义建立确认规则。
  • 完成信号:三路保障确保至少一条到达,双通道去重防重复注入。
  • 多角色工作流:审计与执行分离,一致盖章收敛。

Agent 质量的来源不在单点能力,而在通信拓扑、完成信号完整性、验证结构。


参考

  • Semantic Density Effect (SDE)
  • CAVEWOMAN (2026)
  • Sample More, Reflect Less (arXiv:2607.28576)
  • MAXTOKEN
  • 钱学森. 工程控制论. 1954.

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询