约束效用函数U(m,S,z,E)逐项拆解:sprix-sage-router如何权衡质量、预算与截止时间
【免费下载链接】sprix-sage-routerSprix AI at 屿智同行 — state-aware SELF/COLLABORATE/HANDOFF routing for A2A agent networks.项目地址: https://gitcode.com/gh_mirrors/sp/sprix-sage-router
sprix-sage-router(SAGE Router)是一个面向 A2A 多智能体网络的状态感知路由器:它用一个可审计的约束效用函数U(m,S,z,E),在同一把"尺子"下比较"自己干、组队干、交接给专家干"三条路线,在质量、预算与截止时间之间做出可解释的取舍。这篇文章把公式里的每一项拆开讲清楚,并指出它们在源码中的确切位置。
SAGE 路由流水线:过滤候选 → 三模式效用对比 → 联合搜索分配与调度 → 从执行证据中学习
一、先看懂公式:三个模式与四个自变量
任务执行中(甚至执行到一半时),路由器要为"在任智能体"(incumbent)做三选一决策:
| 模式 m | 所有权 | 适用场景 |
|---|---|---|
| SELF | 在任者独自完成 | 现有能力与已积累上下文够用 |
| COLLABORATE | 在任者保留所有权 | 一个小互补团队能补齐缺口 |
| HANDOFF | 对等者接管全部 | 专家优势大于上下文迁移损失 |
公式中的四个自变量分别代表:
- m:模式(上表三选一)
- S:执行团队(SELF/HANDOFF 时为单人,COLLABORATE 时为组队)
- z:需求到执行者的角色分配(谁做哪件事)
- E:由任务依赖关系诱导出的通信拓扑(哪些智能体之间要传话)
每条可行路线的最终得分就是 ALGORITHM.md 第 7 节给出的约束效用:
$$ U=V\hat p-\lambda_c C-\lambda_l L-\lambda_r R-\lambda_h H-\lambda_o O-\lambda_u\mathcal U+\beta\mathcal B $$
其中 $\hat p$ 是学习型成功概率,$C/L/R/H/O$ 是各项归一化损失,$\mathcal U/\mathcal B$ 支撑不确定性感知探索。源码中对应的计算在 sprix_sage.py 的_evaluate_assignment方法里,一眼可数:一项收益、六项惩罚、一项探索奖励。
二、逐项拆解:每一项只负责一件事
1. 质量项 V·p̂:从执行证据学习成功率
收益项 = 任务价值 V × 预测成功率 p̂。p̂ 不是手写的成功公式,而是一个在线逻辑回归模型(OnlineSuccessModel):输入覆盖度、瓶颈满足度、上下文信任、配对协同、冗余度、协调/交接/切换损失、执行者负载等特征,从保守先验出发,每收到一次真实执行结果就做带 L2 正则的随机梯度更新。
团队覆盖度采用 noisy-OR 形式 $C_r(S)=1-\prod(1-q_{a,r})$(见 sprix_sage.py),奖励的是边际需求覆盖,而不是把几个分数高但能力重复的智能体凑在一起。
2. 预算项 λc·C:报价校准,别让超支悄悄发生
C 是风险调整后的团队总成本除以预算。关键点在"风险调整":每个智能体的报价会被其历史报价忠诚度(bid fidelity)上调——
调整后成本 = 报价 × (1 + 0.20 × (1 − 成本忠诚度))忠诚度来自record_outcome用"报价 vs 实际花费"偏差持续学习(sprix_sage.py)。经常"报价 0.1、实际 0.2"的智能体会被自动加价,预算惩罚因此更贴近现实。默认权重 λc = 0.18,是六项惩罚中第二大的,预算是核心权衡变量。
3. 截止时间项 λl·L:关键路径延迟与并行化
L 是 DAG 关键路径延迟除以截止时间。调度器(_schedule)遵循两条直觉规则:同一智能体的工作串行,不同智能体上的独立需求并行。延迟同样做风险调整(按负载与可用率放大)。
这一项正是 z 和 E 出现在公式里的原因:把某项需求分给稍弱一点的同行,可能让独立节点并行起来,关键路径大幅缩短——ALGORITHM.md 第 5 节专门说明,角色分配因此与调度联合搜索,而不是"每项都交给最强者"的贪心策略。
外层团队束搜索 + 内层角色分配束搜索:保留多个竞争前缀,用小能力余量换并行执行
4. 风险项 λr·R:按需求校准的信任分,而非单一声誉
R = 1 − 加权上下文信任。信任不是全局一个分,而是全局可靠性 35% + 该需求条件信任 65%的混合(_contextual_trust):写代码的成功不会自动迁移到研究检索上。冷启动智能体仍可被选中。任务的风险容忍度会调节该项力度——容忍度越高,惩罚越轻。
上下文信任校准与证据感知更新:成功率按"证据强度"分配给智能体与需求后验
5. 交接项 λh·H:只有"换人"才扣的分
H 在 HANDOFF 模式下才非零(_switch_loss),由四个因子共同决定:
- 保留率:新团队保留了几名在任执行者,上下文损失越小;
- 进度:进度越深,切换越贵;
- 上下文可迁移性:可传递上下文越多,损失越小;
- 失败计数:连续失败越多,切换折扣越大——
1/(1+失败次数)让"反复失败后换人"更容易。
默认 λh = 0.22 是全部惩罚项中权重最高的:项目方的态度很明确,打断一个在途任务是最昂贵的操作。
6. 协调项 λo·O:组队的沟通成本
O 只在 COLLABORATE 模式非零:协调开销系数 × 跨智能体通信边数。依赖的两个节点分属不同智能体就产生一条通信边;孤立组件还会被挂到协调者下,避免低估沟通成本。调度结果还会乘(1 + 开销系数 × 边数)放大延迟——组队的代价同时计入预算与时间两项。
7. 探索项 λu·U 与 β·B:不确定时的安全网
U 是需求加权后的后验不确定性(Beta 分布标准差)。打开探索模式后,路由器对每个信念做一次一致的 Thompson 采样并复用到同一轮比较中,β·B 为不确定路线提供小额奖励——鼓励"多试一次"而非盲目押注。探索默认关闭,权重 β = 0.08。
三、硬约束过滤器:预算与截止时间是门槛,不是扣分
⚠️ 效用函数只决定"谁赢",能不能上场由硬约束说了算,且分两道闸:
- 排名前(智能体级):失败、不可用、缺权限、风险调整后成本超预算、延迟超截止时间——任一命中即出局,并留下明确原因(_exclusion_reasons)。权限不足的智能体无论预测质量多高都不会进入排名。
- 组队后(团队级):团队总成本 ≤ 预算、关键路径延迟 ≤ 截止时间,二次复核(_team_feasible)。
调用route_with_trace(sprix_sage.py)还会拿到完整审计记录:赢家、按效用排序的全部可行替代方案、合格候选、以及每个被排除智能体的具体理由。
四、默认权重速查表:如何调整权衡口味
所有 λ 集中在 RouterWeights,构造SAGERouter时传入即可"调口味":
| 参数 | 默认值 | 管什么 | 调大的效果 |
|---|---|---|---|
costλc | 0.18 | 预算 | 更省钱、更倾向 SELF |
latencyλl | 0.10 | 截止时间 | 更保守的并行分配 |
riskλr | 0.12 | 信任风险 | 更倾向高信任老智能体 |
handoffλh | 0.22 | 交接/切换损失 | 最贵项,抑制换人 |
coordinationλo | 0.08 | 协调开销 | 小团队优先 |
uncertaintyλu | 0.05 | 后验不确定性 | 更保守 |
explorationβ | 0.08 | 探索奖励 | 更多试错 |
实测模式扫描:预算越紧、在任能力越强,SELF 越占优;权重与学习状态会移动这条边界
五、一键运行:用 demo 与基准测试验证权衡
在仓库根目录运行即可看到完整决策过程:
python demo.py—— 可读的端到端路由示例,输出模式、角色分配与拓扑;python benchmark.py—— 2,500 个任务 × 5 个种子,在与 SAGE 预测模型故意不同的外部模拟器中对照 5 种策略。
基准结果值得注意(详见 docs/BENCHMARKING.md 与 benchmark.py):在线学习版 SAGE 以 0.422 的归一化成本换取 0.631 的外部质量(对比静态版 0.584),且截止失约率仅 0.4%——"多花钱换质量"的权衡被如实保留在指标里,而不是藏在单一能力分后面。
同一外部评估器下的质量、公共效用、归一化成本与截止失约率(误差棒为 5 种子总体标准差)
进阶阅读:examples/replan_and_persist.py 演示失败后重规划与学习状态持久化;examples/a2a_execution_plan.py 展示从 Agent Card 到传输中立执行计划的完整链路。
六、小结
- 一个公式,三种模式同台:SELF / COLLABORATE / HANDOFF 共用 U(m,S,z,E) 排名,而非各自一套启发式;
- 质量是学出来的:V·p̂ 由在线模型预测,成本与延迟经报价忠诚度校准,信任按需求条件化;
- 预算与截止时间双重身份:既是效用中的软惩罚项,又是不可逾越的硬门槛;
- 默认口味清晰:交接(0.22)>预算(0.18)>风险(0.12)>延迟(0.10)——换人最贵,省钱次之;
- 每个决策可审计:
route_with_trace留下赢家、替代方案与排除理由,权重可通过RouterWeights随时调校。
【免费下载链接】sprix-sage-routerSprix AI at 屿智同行 — state-aware SELF/COLLABORATE/HANDOFF routing for A2A agent networks.项目地址: https://gitcode.com/gh_mirrors/sp/sprix-sage-router
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考