AI前沿 | 2026年9月7日:GPT-6 Astra 的「37 分鸿沟」——当 AGI 加冕礼变成 harness 测试
📊本期导读:OpenAI 凭「ARC-AGI-3 99.9%」宣布欢迎来到 AGI 时代,而基准作者 ARC Prize 在同一份报告里给出另一分数:同一模型、标准 harness 只有62.7%。差 37 个百分点的不是智力,是套在模型外的脚手架。本文拆解两种 harness 到底差了什么、发布后「成绩单」怎么变的,以及采购/选型怎么不被评测叙事绑架。
一、事实还原:同一个模型,为什么有两个分数
9 月 3 日,OpenAI 正式发布GPT-6 Astra——首个在超过 10 万张 GPU上训练的模型,总裁格雷格·布罗克曼在吹风会上说「欢迎来到 AGI 时代」。支撑这个叙事的核心证据,是它在ARC-AGI-3上拿到99.9%,而对标上一代 GPT-5.6 Sol 的 7.8% 被拿来做「十三倍」对比。
同日,ARC Prize(ARC 基准的作者方)在同一份报告中,用两种 harness 跑出了两个分数:
| 测量口径 | 最佳成绩 | 算力成本 | 本质差异 |
|---|---|---|---|
| 标准 harness(中立,所有模型同口径) | 62.7%(Max) | 约 26,098 美元 | 模型自己决定携带哪些可见笔记,其余丢弃 |
| Provider Adapter harness | 99.9%(High) | 约 18,817 美元 | 保留模型不透明的推理状态,压缩长对话跨请求复用 |
ARC Prize 把两种都称为 state-of-the-art——这是对的:两种口径下它都是新纪录。真正的问题在于,99.9% 是「装配了厂商上下文管理能力的系统」的成绩,而对外销售的是「模型」。
💡启示:AI 评测正在从「测模型」变成「测部署系统」。谁的 harness 越强,谁就越能「测」出更好的分数——而你买的从来不是分数本身,是可复现的、对应你真实用法的那个分数。
二、机制拆解:脚手架为什么比推理更「通神」
ARC Prize 公布的分档表里有一行,比任何争论都有说服力:把reasoning effort 调到 None(不带任何显式推理)——
- 标准 harness:35.2%
- Provider Adapter:96.7%
不带推理的配置,比标准 harness 跑满 Max(62.7%)还高 34 个百分点。这行数据把「99.9% » AGI」的推理链条直接打断:如果产出高分的主要是「带状态的脚手架」而非「显式推理」,那这个分数学到的就不是基准想测的「通用抽象推理」。
| 推理强度 | 标准 harness | Provider Adapter |
|---|---|---|
| Max | 62.7% | 98.6% |
| XHigh | 59.3% | 98.4% |
| High | 54.8% | 99.9% |
| Medium | 38.6% | 98.4% |
| Low | 17.5% | 98.0% |
| None | 35.2% | 96.7% |
ARC Prize 在 X 上的口径也比较克制:Astra 的96% 关卡「动作效率」超过测试的人类中位数——注意这是「步数更少」,不是「完成率更高」。Chollet 本人的口径与基金会又有 3 个点的出入(66% vs 62.7%)。同一基准,三个数字——这就是今天评测体系的真实生态。
三、发布后还在变的「成绩单」:5 项指标被修订
《Fortune》比对了 OpenAI 发布帖的存档快照,发现 Astra 上线后至少有5 项对外数字被修改:
| 指标 | 首发快照 | 变化轨迹 | 备注 |
|---|---|---|---|
| Astra 幻觉率 | 4.2% | 一度改 2% | 目前已回到 4.2% |
| Fable 5.1 FrontierMath | 87.8% | 一度 78% | 最终 83% |
| Sol ExploitBench | 5.5% | 翻倍至 11.5% | 官方称在调查是否回退 |
| ARC-AGI-3(解禁稿) | 98.6% | 正式帖 99.99% | 两种写法并存 |
Snorkel AI 的 Vincent Sunn Chen 的判断值得听:发布前最后几小时的「数字微调」在业内很普遍——checkpoint、配置、harness、评分都会动;关键是修订要可追溯。他建议建立「修订公开评测数字必须留痕」的行业规范。OpenAI 也坦承:99.9% 来自自家 responses API harness,且「不会针对 ARC-AGI-3 做特别适配」——合规,但留白在脚注里。
从 Artificial Analysis 的独立视角看,故事更平淡:Coding Agent Index Astra 67 分与 Opus 5/Fable 5 同档(Fable 5.1 领先 70);Intelligence Index 61 分与上一代 Sol 持平,比 Fable 5.1 低 5 分,且按任务完成成本计比 Sol 贵约 75%。
四、对 AI 买家和创业者的工程建议
不要用「发布会排名」做选型,用「可复现的双口径评测」做选型:
- 固定口径:对比一律用同一 harness、同一 reasoning effort,能跑第三方复测就第三方复测(ARC Prize 已承诺未来并列标注 Standard / Provider Adapter)。
- 看「成本/得分」而非单点分数:62.7%@$26K 与 99.9%@$19K 的关系说明,更省的分可能来自更好的状态管理——对应到你的产品,就是更快、更省地完成任务。
- 把「评测环境」当产品特性验收:厂商说「我们测了 X 项目」时,追问「用的哪套 harness、对比模型是否同口径」——这与追问「用了多少 GPU、多少钱」同等重要。
- 建立自己的基准飞轮:把高频真实任务沉淀成你的私有评测集,模型更新时用你无比分比,别用「它家发布稿」比「你家旧版」。
💡对创业者的启示:
99.9% vs 7.8%被做成「十三倍差距」的营销故事,而同口径下的 62.7% vs 7.8% 才是真实进步——依然是巨大跃迁,真进步不需要夸大排版。在这个「分数会呼吸」的时代,谁能给出可复现的横评,谁就能在采购决策里重新拿回主动权。
来源:ARC Prize 官网报告与博客 / The Next Web / YFarmX / IQ Metrics / Fortune / ArtiFicial Analysis。/ 本文章为 AI 辅助整理的真实行业事件分析,不构成投资建议。
📚 延伸阅读 · 我的付费专栏
觉得这篇文章对你有帮助?我把同类主题的系统化内容沉淀成了付费专栏,欢迎订阅支持持续输出:
| 专栏 | 定价 | 内容 |
|---|---|---|
| 大模型工程师修炼手记 | 9.9 元 | 51 篇 AI 编程 / Agent 深度实战 |
| AI时代程序员的自我提升 | 89.9 元 | 27 篇 AI 时代成长方法论 |
💡 一杯咖啡的价格,换来系统化的知识体系;你的订阅,是我持续创作的最大动力。