AI前沿 | 2026年9月7日:GPT-6 Astra 的「37 分鸿沟」——当 AGI 加冕礼变成 harness 测试
2026/9/7 14:10:25 网站建设 项目流程

AI前沿 | 2026年9月7日:GPT-6 Astra 的「37 分鸿沟」——当 AGI 加冕礼变成 harness 测试

📊本期导读:OpenAI 凭「ARC-AGI-3 99.9%」宣布欢迎来到 AGI 时代,而基准作者 ARC Prize 在同一份报告里给出另一分数:同一模型、标准 harness 只有62.7%。差 37 个百分点的不是智力,是套在模型外的脚手架。本文拆解两种 harness 到底差了什么、发布后「成绩单」怎么变的,以及采购/选型怎么不被评测叙事绑架。

一、事实还原:同一个模型,为什么有两个分数

9 月 3 日,OpenAI 正式发布GPT-6 Astra——首个在超过 10 万张 GPU上训练的模型,总裁格雷格·布罗克曼在吹风会上说「欢迎来到 AGI 时代」。支撑这个叙事的核心证据,是它在ARC-AGI-3上拿到99.9%,而对标上一代 GPT-5.6 Sol 的 7.8% 被拿来做「十三倍」对比。

同日,ARC Prize(ARC 基准的作者方)在同一份报告中,用两种 harness 跑出了两个分数:

测量口径最佳成绩算力成本本质差异
标准 harness(中立,所有模型同口径)62.7%(Max)约 26,098 美元模型自己决定携带哪些可见笔记,其余丢弃
Provider Adapter harness99.9%(High)约 18,817 美元保留模型不透明的推理状态,压缩长对话跨请求复用

ARC Prize 把两种都称为 state-of-the-art——这是对的:两种口径下它都是新纪录。真正的问题在于,99.9% 是「装配了厂商上下文管理能力的系统」的成绩,而对外销售的是「模型」。

💡启示AI 评测正在从「测模型」变成「测部署系统」。谁的 harness 越强,谁就越能「测」出更好的分数——而你买的从来不是分数本身,是可复现的、对应你真实用法的那个分数。

二、机制拆解:脚手架为什么比推理更「通神」

ARC Prize 公布的分档表里有一行,比任何争论都有说服力:把reasoning effort 调到 None(不带任何显式推理)——

  • 标准 harness:35.2%
  • Provider Adapter:96.7%

不带推理的配置,比标准 harness 跑满 Max(62.7%)还高 34 个百分点。这行数据把「99.9% » AGI」的推理链条直接打断:如果产出高分的主要是「带状态的脚手架」而非「显式推理」,那这个分数学到的就不是基准想测的「通用抽象推理」。

推理强度标准 harnessProvider Adapter
Max62.7%98.6%
XHigh59.3%98.4%
High54.8%99.9%
Medium38.6%98.4%
Low17.5%98.0%
None35.2%96.7%

ARC Prize 在 X 上的口径也比较克制:Astra 的96% 关卡「动作效率」超过测试的人类中位数——注意这是「步数更少」,不是「完成率更高」。Chollet 本人的口径与基金会又有 3 个点的出入(66% vs 62.7%)。同一基准,三个数字——这就是今天评测体系的真实生态。

三、发布后还在变的「成绩单」:5 项指标被修订

《Fortune》比对了 OpenAI 发布帖的存档快照,发现 Astra 上线后至少有5 项对外数字被修改

指标首发快照变化轨迹备注
Astra 幻觉率4.2%一度改 2%目前已回到 4.2%
Fable 5.1 FrontierMath87.8%一度 78%最终 83%
Sol ExploitBench5.5%翻倍至 11.5%官方称在调查是否回退
ARC-AGI-3(解禁稿)98.6%正式帖 99.99%两种写法并存

Snorkel AI 的 Vincent Sunn Chen 的判断值得听:发布前最后几小时的「数字微调」在业内很普遍——checkpoint、配置、harness、评分都会动;关键是修订要可追溯。他建议建立「修订公开评测数字必须留痕」的行业规范。OpenAI 也坦承:99.9% 来自自家 responses API harness,且「不会针对 ARC-AGI-3 做特别适配」——合规,但留白在脚注里

从 Artificial Analysis 的独立视角看,故事更平淡:Coding Agent Index Astra 67 分与 Opus 5/Fable 5 同档(Fable 5.1 领先 70);Intelligence Index 61 分与上一代 Sol 持平,比 Fable 5.1 低 5 分,且按任务完成成本计比 Sol 贵约 75%。

四、对 AI 买家和创业者的工程建议

不要用「发布会排名」做选型,用「可复现的双口径评测」做选型:

  1. 固定口径:对比一律用同一 harness、同一 reasoning effort,能跑第三方复测就第三方复测(ARC Prize 已承诺未来并列标注 Standard / Provider Adapter)。
  2. 看「成本/得分」而非单点分数:62.7%@$26K 与 99.9%@$19K 的关系说明,更省的分可能来自更好的状态管理——对应到你的产品,就是更快、更省地完成任务。
  3. 把「评测环境」当产品特性验收:厂商说「我们测了 X 项目」时,追问「用的哪套 harness、对比模型是否同口径」——这与追问「用了多少 GPU、多少钱」同等重要。
  4. 建立自己的基准飞轮:把高频真实任务沉淀成你的私有评测集,模型更新时用你无比分比,别用「它家发布稿」比「你家旧版」。

💡对创业者的启示99.9% vs 7.8%被做成「十三倍差距」的营销故事,而同口径下的 62.7% vs 7.8% 才是真实进步——依然是巨大跃迁,真进步不需要夸大排版。在这个「分数会呼吸」的时代,谁能给出可复现的横评,谁就能在采购决策里重新拿回主动权。

来源:ARC Prize 官网报告与博客 / The Next Web / YFarmX / IQ Metrics / Fortune / ArtiFicial Analysis。/ 本文章为 AI 辅助整理的真实行业事件分析,不构成投资建议。


📚 延伸阅读 · 我的付费专栏

觉得这篇文章对你有帮助?我把同类主题的系统化内容沉淀成了付费专栏,欢迎订阅支持持续输出:

专栏定价内容
大模型工程师修炼手记9.9 元51 篇 AI 编程 / Agent 深度实战
AI时代程序员的自我提升89.9 元27 篇 AI 时代成长方法论

💡 一杯咖啡的价格,换来系统化的知识体系;你的订阅,是我持续创作的最大动力。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询