今天的从业者,能想明白吗?
99%的AI从业者,一样想不明白。他们把"模型参数"当终极真理,把"评测榜单"当唯一标尺,把"单步推理准确率"当全部战斗力。一谈AI就是"某某模型又突破了几个点",一问业务落地就含糊其辞,仿佛模型强则一切强。
为什么?
就一个答案:向执行层要力量!
有投资人讲"模型决定上限""参数才是护城河""人才是核心"。而一个简单的事实摆在面前:把Claude最强的推理模型放在那里,让它自己去执行一个17小时的长程任务,成功率能维持多少?
METR的测试清清楚楚——降到50%以下。
给它再强的代码生成能力,让它自己去调用工具、管理上下文、处理错误状态,看看它能不能稳定跑完一个企业级流程?
模型是大脑,但大脑再聪明,如果没有脊髓和四肢,没有神经系统传导,没有肌肉执行反馈,能做成什么事?
距离GPT-4发布已近三年,AI圈的认知却还停留在"参数越多越无敌""模型越大越通吃"这个最初画下的圈子里。不是否定模型的基础性作用,而是要厘清模型与执行层的真实权重关系,二八开或者三七开。
模型很重要,但Harness执行层才是将智能转化为生产力的关键转换器。你说"模型好",好,那去跑一个真实的跨国企业自动化流程,不要求多,就跑一天,中间别断、别报错、别超Token、别把上下文撑爆。
敢不敢试试?
什么样的模型优势,也比不上一个稳定、可控、低成本的交付系统。整个AI产品,可以视为"模型是大脑,Harness是骨骼、神经和手脚"。大脑再聪明,如果执行系统脆如薄纸,一步都动不了。
跟2023年的AI有什么区别?区别就是现在有了Harness,有了执行中间层,有了任务闭环。否则,跟ChatGPT刚出的那年有什么本质不同?
给1万个Agent,配上无限算力,去接管一家中型企业的全部办公流程,从代码开发到财务审批到数据分析,能行吗?肯定说太多了,哪用得着1万,500个Agent足矣。
给1万个Agent去替换一个传统软件公司的所有业务模块,肯定也说多了,用不了这么多。
1万个Agent的成本才多少?无非是几百万Token的调用费用而已。
而过去三年,AI行业的主流方向是什么?几乎全在卷模型架构、卷训练数据、卷算力规模。原因很简单:Transformer架构自2017年以来已被反复挖掘,该卷的变体基本卷遍了。再堆参数、再刷榜,能带来多少真实的端到端任务完成率提升?边际效益递减已经非常明显。
所以,头部厂商开始将重心转向Harness执行层,转向工具调用、状态管理、沙箱隔离、错误恢复、Multi-Agent编排,转向如何让模型在真实环境中稳定跑完任务。这不是说模型不重要,而是说单纯迷信模型已无法解决规模化交付的核心矛盾。
只盯着模型,就好比只磨刀不练刀法。而真正的高手知道,再锋利的刀,握不稳也砍不中目标。
历史早就告诉过同样的道理。
1287年,第三次波蒙战争,波兰人靠什么挡住了横扫欧亚的蒙古骑兵?石头城堡。每一座城堡高8米、厚3米,间隔30公里,首尾呼应。蒙古人能打下来吗?能,但一颗一颗牙去啃,再强的骑兵也耗不起。石头,就是那个时代对抗游牧民族快速突击的"执行层"。它不是战术,不是士气,它是让战斗能力能够持续发挥的系统。
13世纪,人类早就找到了收拾那些"看起来很能打但缺乏系统支撑"的力量的秘笈:执行层。
石头城堡就是中世纪的Harness。火药和制式火枪就是近代早期的Harness。
这些都不是"模型",它们是让技术能力能够被重复、稳定、低成本地投送到战场上的中间系统。
AI行业,如果继续忽视执行层,就会重蹈历史上那些只重个体技巧、不重组装体系的失败者覆辙。
今天,微软的CodeAct Harness能通过优化工具编排,将任务执行时间缩短52%、Token消耗下降63%;Anthropic的研究显示,如果不加约束,Multi-Agent系统的Token消耗会是普通对话的15倍,状态维护和错误传播随规模指数上升。这些数字清楚地说明:模型能力是原料,Harness才是加工车间。原料再好,车间不稳,产品就是废品。
为什么阿里要把QoderWork、悟空、MuleRun整合成千问办公?为什么腾讯要把WorkBuddy与QClaw团队收敛?为什么OpenAI打通ChatGPT与Codex入口?为什么xAI强化Cursor与模型工作流的结合?
表面看是产品整合,本质上都是在强化模型与场景之间的执行中间层。巨头们意识到,谁能把执行层做得更稳、更顺、更省,谁才能真正拿到企业的长期订单,而不是靠一张评测榜单赢得一两次关注。
今天,模型单步推理再强,如果Harness层无法稳定协调多工具、管理长上下文、自动纠错恢复,连一个正常的企业需求都跑不完全程。而对手的Harness却能在一周七天、每天24小时里持续交付结果——差距就在这里。
所以,重视Harness层,不是否定模型,而是承认一个朴素的产业事实:模型能力的领先窗口正在缩短,执行层的工程壁垒和场景数据却是时间的朋友。
开源模型三到六个月就能追平榜单分数,但一套经过数百万次真实任务打磨的Harness,包含路由策略、沙箱环境、错误模式库、工具调用轨迹,这些东西无法从论文或代码库中复制,只能靠日复一日的执行积累。
而每一次成功交付,都会沉淀下高质量的长程任务轨迹;
每一次用户纠错,都会转化为系统优化的信号;每一次工具调用的选择,都会让路由策略更精准。这就是"交付—数据—优化"的正向飞轮,它让先行者的Harness越跑越强,追赶者越追越累。
模型让人进门,Harness让人留下来。交付让人赚钱,数据让人把赚到的钱变成别人拿不走的壁垒。今天的从业者,如果还在只看模型不看Harness,那么已经落后了。不是落后在参数上,而是落后在对真实世界的理解上。