让Agent成本暴降90%!自动化Harness适配框架被CMU开源了
2026/7/31 2:45:56 网站建设 项目流程

团队没有继续训练模型,而是让meta-agent分析失败轨迹,自动调整指令、工具和Agent循环。

结果很直接:优化后的harness在21个“任务-SLM”组合中的16个上显著提升性能,7个组合弥合了SLM与前沿LLM之间的性能差距。表现最好的SLM恢复了约89%的前沿LLM性能,推理成本仅为前沿LLM的4%。

01

不是换模型

而是把部分难度移出模型

当前很多Agent系统是围绕前沿LLM设计的。模型需要自己理解任务、制定计划、挑选工具,并在出错后重新规划。前沿模型通常能够较好地完成这些工作,SLM却更容易暴露出模型能力与任务需求之间的缺口。

作者将常见问题归为五类:工具使用失败(tool-use failure)、遵循指令失败(instruction-following failure)、知识失败(knowledge failure)、长上下文失败(long-context failure),以及规划或推理失败(planning/reasoning failure)。

问题并不完全出在模型无法完成单个步骤,而是它需要同时承担过多工作:既要推断流程,又要从大量工具中做选择,还要避免重复发送消息。

harness adaptation的思路,是把不同实例共享的部分难点固化到外部系统中。明确的步骤写入system prompt,重复操作封装为工具,不相关工具直接隐藏,必须遵守的条件交给程序检查。

模型不必临场解决所有问题,只需可靠完成harness为它划定的任务。

02

meta-agent

自动修改Agent系统

手工寻找合适的harness并不轻松。同一次失败可能同时涉及工具选择、上下文增长和指令遵循,而且不同模型的失败方式并不相同。

因此,研究团队把harness设计转化为一个由数据和评估驱动的搜索问题。

harness optimizer接收目标SLM、训练及验证数据和初始harness,在一个明确的空间中修改system prompts、skills、dynamic contexts、工具、hooks、上下文管理组件和sub-agents。

首先,从已经尝试过的harness候选池中采样一个版本,在训练实例上运行,并记录完整轨迹,包括工具调用、中间观察、输出、分数和反馈。

meta-agent读取原始轨迹与当前harness代码,诊断失败原因,再提出具体修改。它还会查看过去方案及效果,避免重复尝试已经证明无效的调整。

最后,新harness先经过低成本的代码检查,通过后,它会在同一批实例上重新评估,只有出现改进,才进入完整验证并被加入候选池。

团队使用gemini-3.1-pro-preview作为meta-agent。每个任务与模型组合的单次优化预算为20美元,执行三次独立搜索,再保留验证分数最高的harness。

这不是让Agent自由重写自己,而是在受约束的组件空间内,用真实失败轨迹寻找有效修改。

03

预算审批从75.0%升至98.3%

预算审批任务最能说明harness具体改了什么。

经过23轮迭代,优化器为gemma-4-26b-a4b找到了三项关键调整。

第一,把简短的通用提示改写为明确的逐步流程,规定联系人发现、信息收集、预算核对和消息回复的顺序。

第二,过滤不需要的MCP工具,缩小模型的动作空间,减少工具选择错误。

第三,创建anti_loop_hook.py。当Agent准备向同一接收人再次发送完全相同的消息时,hook会直接拒绝调用,并要求模型进入下一步或结束任务。

调整之后,gemma-4-26b-a4b的准确率从75.0%提升至98.3%,超过gemini-3.1-pro-preview的97.3%;单实例平均成本则从0.039美元降至0.017美元。

harness承担了脆弱的规划、筛选和检查,SLM只负责执行已经结构化的流程。

04

什么时候用小模型加harness

论文在七项业务相关任务上进行了实验,包括考勤审计、预算审批、库存预警、IoT时序异常检测、Playwright测试生成、网站管理和代码重构。

三款SLM分别是qwen3-coder-30b-a3b、ministral-3-8b和gemma-4-26b-a4b,对照模型为gemini-3.1-pro-preview。所有配置运行三次并报告平均结果。

三款SLM中,整体适配效果最强的是gemma-4-26b-a4b。它在通用harness下的七项任务平均准确率只有31.4%,优化后达到80.2%;平均延迟也从328秒降至135秒。前沿LLM的平均准确率为89.7%,平均延迟为181秒。

qwen3-coder-30b-a3b的平均准确率从26.9%提升至74.8%。但ministral-3-8b只从9.5%提升至25.0%,部分任务仍然没有改善。

这说明harness可以转移任务难度,但无法替代模型缺失的核心能力。

因此,预算审批、考勤审计、库存预警等流程相对固定的任务,更适合使用“小模型+专用Harness”,代码重构等需求差异较大的开放任务,则更难依靠一套Harness覆盖。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询