💡一句话总结:OpenAI 把内部模型写出的 719 份数学手稿一次性开源(openai/math 仓库),数学界反弹之激烈超乎想象——陶哲轩领衔的声明称之为「力量的展示」;而同一周发布的 PaperBenchX 评测显示,最强模型端到端复现一篇已发表论文的成功率只有 13.98%。这两个数字放在一起看,才是 AI for Science 的真实切面。
导语:从「88 小时破千禧难题」到「一次砸 719 份手稿」
过去一个月,如果你关注 AI 圈,大概率被数学新闻刷过屏:先是有说法称某内部模型 88 小时拿下 Navier-Stokes 方程这个百年千禧难题,接着是「单月解决 100 多个悬置问题」的官宣级爆料。数学家们先是不信,然后是震惊,再然后——联名公开信。25 位菲尔兹奖得主签字,核心诉求一句话:别把解决数学问题当基准测试刷。
OpenAI 的回应方式很有自己的风格:10 月 6 日前后,直接把仓库开在了 GitHub 上——openai/math,719 份手稿、372 个成果族,一次性放出。里面的标题随便拎一个出来都够数学系喝一壶的:Unique Games 猜想的证明、黎曼 zeta 函数的零点自由区、CM 阿贝尔簇上的 Hodge 猜想、若干千禧难题的进展,还附了 π 的无理性指数、自旋玻璃这些方向的 10 份推理摘要。
官方口径也给了:绝大多数结果出自同一个流程——向一个未发布的内部模型投喂约 4,000 个问题,平均每个结果烧 3 小时 ChatGPT Pro 级别的思考算力。按这个口径,这是一场用算力堆出来的「数学大生产」。
一手来源
- 💻 仓库:GitHub · openai/math
- ✍️ 陶哲轩博客 AHM 声明:terrytao.wordpress.com
- 📊 PaperBenchX:GitHub · UniPat-AI/PaperBenchX
数学界为什么炸锅?
看热闹的第一反应是「这不好事吗」,但数学家们的愤怒点非常具体。陶哲轩任主席的 AHM(数学调解协会)在声明里有一句被广泛引用的话:这不是学术的展示,是力量的展示。数学家们"并没有要求做这些工作"——一整个领域没有征得同意,就收到了 700 多份需要人来验证的作业。
拆开看,反弹集中在四个点上。
- 验证赤字。官方自己写明:顶层结果只有约 42% 完成 Lean 形式化(Lean 是数学界的"机器裁判",证明逐步可机检),且「部分未形式化结果可能有问题」。换句话说,过半重磅主张当前处于"未验明正身"状态,就已经公开传播了。
- 可读性是稀缺劳动。复杂性理论学家 Scott Aaronson 记录了妻子 Dana Moshkovitz 连夜审读 Unique Games「证明」的体验:大量引用不给理由、行文晦涩,"不借助 AI 根本读不下去"。批量倾倒原始草稿,等于让社区免费承担把证明改写成人类语言的工作。
- 署名与训练数据的旧账。联名信点名「仓促发布、不引相关工作」构成严重的署名与剽窃问题,还隐晦关联了 OpenAI 在全球的版权诉讼——弦外之音是:这些成果建立在学习了数学家毕生工作之上。
- 生态层面的担忧。陶哲轩在 Mastodon 上把话说得更重:问题一旦被"解出"就回不去了,知道解存在本身就会污染其他路径的探索;研究者开始因为怕被 AI 抢发而藏起自己的方向。他把现状叫作需要转向「Math 2.0」——用解释、社区建设、新方向开拓来衡量数学,而不是解题速度。
不过社区并非铁板一块。陶哲轩博客评论区里,相当一部分人认为抵制不现实:OpenAI 不会停下来,公开总比捂在内部强。也有人把 Anthropic 的做法树成对照——和研究者合作、付酬、产出人类可读的证明——但 Aaronson 反问得很准:那样做的代价是"由私人公司挑选谁是结果的代言人"。两条路线,各有各的坑。
同一周的第二记冷水:复现率 13.98%
如果说数学家的愤怒偏价值判断,那另一个数字就更扎工程人的心了。量子位 10 月 8 日报道了 UniPat AI 的 PaperBenchX 基准:93 个真实论文的端到端复现任务,横跨电磁、光子、化学、材料、生物、机器人 12 个方向,3,168 条专家校验的评分项。结果,表现最强的 GPT-6 Astra,完整复现率 13.98%——不到七分之一。
更有信息量的是分阶段得分:建模 62.70%、执行 61.84%,都不难看,验证只有 42.80%。翻译成人话:AI 能把仿真搭起来、把求解器跑出结果文件,但"跑出来的东西在科学上站不站得住",十次里有六次答不上来。一个和论文对得上的数字,背后可能是错误的物理模型、没收敛的仿真,或者碰巧凑对的无效后处理。
把两条新闻叠在一起,结论自己浮出来了:「能破前沿猜想」和「能可靠地重做一遍已发表工作」是两种能力,前者是长板惊叹号,后者才是科学工作流的及格线。OpenAI 内部模型 3 小时算力冲一个猜想,和最强模型复现论文不到 14%,并不矛盾——它们测的根本不是同一件事。
这跟写代码的人有什么关系?
三个值得带走的观察。
- 验证闭环决定 AI 能走多远,这条铁律再次被两个领域同时验证。数学有 Lean,代码有测试——OpenAI 只敢说 42% 形式化的部分"可靠",ts-rust 敢说 100% 兼容也是因为 181,711 个测试全过。想让 agent 干重活,先给它配一个机器裁判。
- "机器生成、无人能读"正在从代码圈蔓延到数学圈。ts-rust 的 130 万行 Rust 和 openai/math 的 719 份手稿,是同一个问题的两个切面:当产出速度超过人类的阅读带宽,"可读性"就成了新的稀缺资源,而谁来做这个脏活、谁来付钱,两个圈子都还没有答案。
- 看 AI 新闻先问评测口径。同样是"AI 数学家",解出猜想(选题、尝试、成功率约 5%)和复现论文(13.98%)差着一个量级;下次再看到"AI 碾压 XX"的标题,先找找它测的是哪种能力。
冷静一下
这篇里的重磅主张——Unique Games、Hodge/CM、zeta 零点自由区——目前全部处于"不同验证阶段",独立验证结论一个都还没有;Aaronson 关于"约 8,000 题、5% 成功率、AI 公司私测密码学"的说法来自匿名信源,未经 OpenAI 证实;719 与 722 的手稿数在不同报道里也对不上。仓促给"AI 解决了 XX 猜想"下结论,和仓促宣布抵制,都还早。可以确定的只有两件事:AI for Science 的评测标准之争正式开场了,以及——数学界的 Lean、代码圈的测试、科学复现的重放验证,全世界都在给 AI 找同一个东西:一个不收买的裁判。
参考来源
- openai/math 仓库(规模、产出方式、形式化率、验证声明):https://github.com/openai/math
- 陶哲轩博客 · AHM 关于 10 月 6 日发布的声明:https://terrytao.wordpress.com/2026/10/07/ahm-statement-on-openais-october-6-release-of-mathematical-documents/
- Scott Aaronson · "Mathocalypse"(含 Unique Games 审读细节与密码学方向转述):https://scottaaronson.blog/?p=10169
- the-decoder · 数学家呼吁抵制 OpenAI 汇总报道:https://the-decoder.com/some-mathematicians-call-for-openai-boycott-after-ai-generated-proofs-flood-their-field/
- 量子位 · ChatGPT 破解千禧难题但论文复现率低至 13.98%(PaperBenchX):https://www.qbitai.com/2026/10/501995.html