AI创业者通识日报 | 2026年9月7日
📊今日导读:ARC Prize 双口径炸场——GPT-6 Astra 同一基准标准 harness 62.7%、Provider Adapter 99.9%,「99.9%」被指出是装配系统而非模型本身,OpenAI 发布后还改了 5 项指标 | Anthropic 首次向外部研究者开放 25 万段 Claude 真实使用数据 | CNBC 用「模型疲劳」形容四大实验室一周连发 | Anthropic 2026 算力合约合计已超 2750 亿美元 本期为「评测口径」+「数据开放 + 算力军备」主题合集,图表达量级。
🚀 今日头条 · ARC Prize 给了同一个模型两个「AGI 成绩」
62.7% 还是 99.9%?同一个模型、同一个基准、同一周发布两个成绩
9 月 3 日,ARC Prize(这套基准的作者机构)在同一篇报告里,为 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上同时给出两个分数:
| 测量口径 | 最佳成绩 | 对应算力成本 |
|---|---|---|
| 标准 harness(中立、各家同口径) | 62.7%(Max 推理) | 约 26,098 美元 |
| Provider Adapter harness(保留厂商不透明推理状态) | 99.9%(High 推理) | 约 18,817 美元 |
两个分数都是真的,但含义完全不同:标准 harness 让模型自己决定带哪些「笔记」到下一轮;Provider Adapter 则把模型内部不透明的推理状态在请求间持续保留,并用压缩让之前的工作可复用。差 37 个百分点的不是模型,是套在模型外面的脚手架(harness)。
对创业者的启示:当 AI 厂商把「评测环境」当作能力卖点时,你要问的不是「分数多少」,而是「在什么 harness 下跑的、跟谁同口径比」。你的选型评测如果不统一此口径,买回来的可能只是对方的脚手架厉害。
来源:ARC Prize 官网/博客 / The Next Web / IQ Metrics
🔬 技术前沿 · 推理强度関掉也能 96.7%:脚手架比推理更「通神」?
两行数据让「99.9% » AGI」的推理链条破裂
ARC Prize 公布的分档表里有一行比任何争论都有说服力:把推理强度(reasoning effort)关到None,标准 harness 只有35.2%,而 Provider Adapter 仍有96.7%——比前者跑满 Max(62.7%)还高 34 个百分点。
| 推理强度 | 标准 harness | Provider Adapter |
|---|---|---|
| Max | 62.7% | 98.6% |
| High | 54.8% | 99.9% |
| Medium | 38.6% | 98.4% |
| Low | 17.5% | 98.0% |
| None | 35.2% | 96.7% |
也就是说,不带明面推理,装配上厂商的上下文管理能力,得分依然接近满分——产出这分数的更多是「带状态的脚手架」,而非基准想测的「通用推理」。
ARC Prize 联合创始人 Mike Knoop 明确回应:「我们还缺乏把这件事称为 AGI 的证据。」OpenAI 也自称:99.9% 是在自家 responses API harness 下跑的,而非给对比模型用的口径。
对技术决策者的启示:
99.9% vs 7.8%这组「十三倍差距」是不同口径;同口径下62.7% vs 7.8%依然是巨大跃迁。真进步不必靠夸大叙事——真正该记住的是:模型能力评测正在从「测模型」变成「测系统部署方式」。
来源:ARC Prize / YFarmX / 赢政天下 / The New Stack
📊 评测与数字 · 发布后还在变的「成绩单」
Fortune 扒出:Astra 发布后至少有 5 项对外指标被改动
《Fortune》对比了 OpenAI 发布帖的存档快照发现:Astra 发布后至少5 项数字被修订——幻觉率先 4.2% 改 2% 又改回 4.2%;Anthropic Fable 5.1 的 FrontierMath 从 87.8% 降到 78% 再回升到 83%;Sol 的 ExploitBench 从 5.5% 翻倍到 11.5%;媒体解禁稿里 ARC-AGI-3 是 98.6%,正式帖则写 99.99%(两种写法)。
| 指标 | 首发快照 | 后续变化 | 现状 |
|---|---|---|---|
| Astra 幻觉率 | 4.2% | 一度改 2% | 已回到 4.2% |
| Fable 5.1 FrontierMath | 87.8% | 一度 78% | 83% |
| Sol ExploitBench | 5.5% | 翻倍 | 11.5%(官方称在查是否回退) |
Snorkel AI 的 Vincent Sunn Chen 指出:发布前最后一刻调整成绩在业内很常见,问题是「修订公开数字时应同步标注」。业内建议已出现:以后修订已发布评测数字,应像修正论文一样留痕。
对创业者的启示:评测数字是「会呼吸的营销物料」,不是合同附件。你的选型决策应锚定第三方复测(ARC Prize 同口径 / Artificial Analysis),而不是厂商发布稿的快照。
来源:Fortune / The Next Web / IQ Metrics
🛡 安全与治理 · Anthropic 首次开放 Claude 真实使用数据
25 万段真实对话交给斯坦福 / 牛津 / METR 独立提问
Anthropic 宣布完成首个「外部独立研究用好自家真实使用数据」的试点:通过隐私保护分析工具Anthropic Insights(原 Clio),向三组外部团队开放了约25 万段 2026 年 4-5 月 Claude.ai / Claude Code 对话的聚合数据:
| 团队 | 研究问题 | 早期发现 |
|---|---|---|
| 斯坦福 SALT Lab | 人类如何与 AI 协作 | 超一半对话把「高影响力/难挽回」的工作交给 AI,多数场景人仍主导、调整输出 |
| 牛津 人类信息处理 Lab | 使用感受与行为关系 | 用 AI 的体验模式与日常上网高度相似 |
| METR | 编程智能体的真实生产力 | 能力更强的模型为用户节省更多时间 |
研究者从未接触原始对话,只看聚合输出;Anthropic 的合同审查权被限制在隐私等四个窄项,且结果不利也照发。聚合数据集已公开发布,下一步正在评估是否规模化。
对数据产品团队的启示:「隐私保护聚合分析 + 外部提问权 + 结果公开」正在成为一种新的数据开放模板。做数据/Agent 产品的团队可以提前想:如果某天你的真实使用数据要被第三方审计,你的遥测与脱敏管线今天够不够格?
来源:Anthropic 官方博客 / AI 快讯 / EntAIne
📅 行业脉络 · 一周连发与 2750 亿美元算力合约
四大实验室一周内全部上新,CNBC 起名「模型疲劳」
9 月首周,Anthropic(9.1 Fable/Mythos 5.1)→ Meta(9.2 Muse Spark 1.3)→ 谷歌(9.2 Gemini 3.8 Flash + Flash Cyber)→ OpenAI(9.3 GPT-6 Astra)密集上新,CNBC 在 9 月 6 日直接以「model fatigue(模型疲劳)」概括买家心态:评测记分牌更新太快,IT 采购已经跟不上。
同一周,英伟达以129.3 亿美元收购 Hugging Face落定。而在 IPO 之前,Anthropic 2026 年签下的算力合约合计已达2700 亿+美元(AWS 千亿级 / Fluidstack 500 亿 / Nscale 450 亿 / SpaceX 450 亿 / Lambda 350 亿),接近其 9650 亿美元私有估值的3 成。
| 事件 | 金额/时间 |
|---|---|
| 四大实验室一周连发 | 2026.09.01-03 |
| 英伟达收购 Hugging Face | 129.3 亿美元(2026.09.03 官宣) |
| Anthropic 算力合约合计 | 超 2750 亿美元(2026 年至今) |
对创业者的启示:当巨头同时「打排位赛」和「囤算力」,留给创业者的时间窗口在两边被同时压缩——要么赶在生态被巨头锁死前做差异化,要么想办法成为算力/评测/数据开放链条上不可替代的一环。
来源:CNBC via AI 中文社区 / 网易 / Value Add Pulse / 彭博
🤔 今日思考题
ARC Prize 给同一个模型贴了两个分数——法律一样的严谨(62.7%),营销一样的性感(99.9%)。OpenAI 总裁布罗克曼喊「欢迎来到 AGI 时代」,而基准作者自己说「这不是 AGI」。
🤖 当「厂商自测」可以比「中立复测」高 37 个百分点,当基准的记分牌一周就能改三次——你还会用「满分/第一名」判断该不该采某一个模型吗?如果你要给公司搭一条不被评测叙事绑架的选型流水线,第一步会做什么?
欢迎在知识星球分享你的判断,我们一起跟踪 AGI 时代的产业化进程。
来源汇总 ARC-AGI 双口径:ARC Prize 官网/博客、YFarmX、赢政天下、The Next Web、IQ Metrics。 指标修订:Fortune、The Next Web。 Claude 数据开放:Anthropic 官方博客、AI 快讯(lzw.me)、EntAIne。 模型疲劳与行业脉络:CNBC via AI 中文社区、网易(第一财经来源)、Value Add Pulse、彭博。 本日报基于公开网络信息整理,旨在为 AI 创业者提供行业参考,不构成任何投资建议。 AI创业者通识日报 · 2026年9月7日 · AI辅助生成
📚 延伸阅读 · 我的付费专栏
觉得这篇文章对你有帮助?我把同类主题的系统化内容沉淀成了付费专栏,欢迎订阅支持持续输出:
| 专栏 | 定价 | 内容 |
|---|---|---|
| 大模型工程师修炼手记 | 9.9 元 | 51 篇 AI 编程 / Agent 深度实战 |
| AI时代程序员的自我提升 | 89.9 元 | 27 篇 AI 时代成长方法论 |
💡 一杯咖啡的价格,换来系统化的知识体系;你的订阅,是我持续创作的最大动力。