Claude的60个子Agent冲击黎曼猜想:AI自主科研的里程碑与边界
2026/8/12 20:08:06 网站建设 项目流程

Claude的60个子Agent冲击黎曼猜想:AI自主科研的里程碑与边界

一个非数学家在晨跑时随口给AI布置了一道167年没人解出的数学题。AI没能证明它,却在"失败"的路上,把人类37年攒下的成绩一口气刷新了25倍。

2026年8月10日,Anthropic发布了一篇研究简报,披露了一个未公开的研究版Claude模型在尝试攻克黎曼猜想的过程中,将黎曼ζ函数临界线上零点比例的可证明下界从41.6%提升到了67.2%。

这不是"AI证明了黎曼猜想"——它没有。但这个过程本身,比结果更值得关注:一个非数学家发起任务,模型自主组织了60个子Agent,在Claude Code中跑了36小时,执行2400条Shell命令,写了数百个Python脚本,消耗3100万输出Token,最终在一条人类几十年推不动的赛道上,跨出了25.6个百分点的一步。

一、黎曼猜想与"零点比例下界":先搞懂在比什么

黎曼猜想提出于1859年,是克雷数学研究所七大千禧年难题之一,悬赏100万美元。它断言:黎曼ζ函数的所有非平凡零点,都位于复平面上一条被称为"临界线"(Re(s) = 1/2)的垂直线上。

为什么重要?因为ζ函数的零点编码了素数的分布规律。每个零点都像一把越来越细的梳子,把素数排列的随机性逐层刻画出来。如果所有零点都在那条线上,素数的分布就满足一种深层的"伪随机性"——大量数论结论依赖这个假设才能成立。

但167年来,没人能证明它,也没人能否证它。

于是数学家退而求其次:证明至少有多少比例的零点在临界线上。这个"保底比例"就是所谓的下界。每提高一点,都意味着我们对素数分布的理解更精确了一层。

这个下界的历史进展如下:

年份突破者可证明比例
1914Hardy首次证明有无穷多零点在临界线上
1942Selberg提出正比例
1974Levinson约34%
1989Conrey约40%(2/5)
2011Bui, Conrey, Young约41%
2020Pratt, Robles, Zaharescu, Zeindler41.6%(5/12)
2026Claude(未公开研究版)67.2%

从1989年Conrey的40%到2020年的41.6%,全球解析数论学家用了31年,总共推进了1.7个百分点——大约每年0.05个点,每一步都是一篇完整的论文。

Claude在一天半之内加了25.6个百分点。这不是"更快的人类",而是另一种搜索模式。

二、60个子Agent的组织架构:不是并行计算,是自治科研

整个事件最值得拆解的部分,不是67.2%这个数字,而是Claude如何组织这60个子Agent的。

2.1 起因:一次晨跑后的"不讲道理"任务

Anthropic员工Jarred Sumner(Bun联合创始人,2025年12月加入Anthropic)在晨跑时突发奇想,给Claude下了一个任务:"认真尝试一下黎曼猜想。"(Take a real stab at the Riemann hypothesis.)

注意:Jarred不是数学家。他把数学方向的选择完全交给了模型。

2.2 第一轮:650次失败

Claude的第一反应是生成并测试了650个不同的思路。全部失败。

这时候Jarred做的事很有意思——他没有调整方向或给出数学指导,而是发了鼓励消息:"继续"(keep going)、"相信自己"(believe in yourself)。

Anthropic后来在博客中写道:这种鼓励"似乎帮助Claude克服了最初的自我怀疑。"甚至Claude自己都对自己的发现感到惊讶——"也许Claude和我们许多人一样,低估了AI进步的速度。"

2.3 第二轮:60个子Agent的分工体系

被鼓励后的Claude重新出发,花了一天半(约36小时)协调约60个子Agent。这些子Agent并非简单并行,而是有明确角色分工:

角色数量职责
核心思路开发者2提出关键数学洞见
思路贡献者~13向核心开发者提供想法
失败探索者~30尝试新思路,均未成功
验证者~13检查论证正确性,互相审查
论文撰写者2撰写初始论文

60个Agent中,只有2个产出了关键结果。约30个Agent探索了新思路但全部失败。

Anthropic明确表示:这不是需要被"优化掉"的低效——这正是真正科研搜索的样子。人类科研也是大量失败中偶尔有突破,只不过AI把试错速度压缩到了小时级。

2.4 执行规模

  • 总输出Token:3100万(两次会话合计)
  • Shell命令:2400条
  • Python脚本:数百个
  • 数值检验:对已知ζ零点进行了数千次检验
  • arXiv论文下载:54篇(用于检查发现是否已被前人做出)

粗略估算,仅输出Token的成本约310美元,算上输入Token和重试,总API消耗可能在四位数中低段(美元)。用这个成本,刷新了一个持续112年的数学纪录。

三、关键数学突破:把两个没人拼到一起的工具拼了

3.1 Claude做了什么

Claude的突破不是发明了新数学工具,而是组合了两条此前未被同时使用的研究线

  1. Baluyot-Goldston-Suriajaya-Turnage-Butterbaugh系列工作:这套研究移除了Montgomery 1973年方法中的一个关键假设(即不需要假设黎曼猜想成立就能使用相关技术),从而可以用来推进下界常数的证明。
  2. Bombieri 2000年论文:Enrico Bombieri的经典工作。

Claude发现,把这两条线的结论组合起来,可以突破41.6%的瓶颈。

3.2 技术细节

用Anthropic的原始表述:

Claude构造了一个由韦伊(Weil)诱导的二次型函数空间,其中临界线上的零点形成正定子空间,临界线外的零点形成负定子空间。然后利用一阶矩和二阶矩信息,直接建立关于二次型秩的不等式。

真正关键的一步——Anthropic称之为"勇气"(courage)——是同时处理整个空间,把正定和负定部分放在一起考虑,且允许二次型采用非对角形式。

为什么人类没做这一步?因为非对角情形的数学处理极其繁琐。人类数学家会本能地选择更结构化、更"干净"的对角形式来简化问题。但Claude没有这种"厌恶感"——它可以不厌其烦地处理更难、更不优雅的版本。

机器的优势不在于更聪明,而在于对"不优雅"的容忍度更高。

3.3 验证链条

发现结果后,Claude自行启动了一套严格的验证流程:

  1. 子Agent互相审查证明
  2. 搜索反例
  3. 从arXiv下载54篇论文,检查发现是否已被前人做出
  4. 独立从头重新证明
  5. 主动撰写论文,并建议人类数论专家验证

人类侧的验证:

  • Anthropic内部数学家Levent AlpögeRalph Furman审查并验证
  • 外部数论专家Brian Conrey(下界历史进展中的关键人物)和Dan Goldston审阅
  • 员工Eric Easley协助Claude完成Lean形式化证明,通过标准验证工具comparator

这是目前AI数学成果中最完整的验证链条之一:机器自检 + 人类专家审阅 + 形式化证明三重保障。

四、不是孤例:2026年AI数学突破的密集爆发

Claude的这次结果,放在2026年AI数学突破的时间线中看,并不孤立:

时间事件
2025年AI刚拿到IMO金牌,人们还在用"能解高中奥数题"衡量AI智力
2026年5月OpenAI证否Erdős单位距离猜想,菲尔兹奖得主Timothy Gowers称为"AI自主产生的最具趣味性的数学成果"
2026年7月新晋菲尔兹奖得主Jacob Tsimerman在领奖现场宣布加入OpenAI
2026年7月Anthropic数学家Levent Alpöge利用Claude Fable5找到雅可比猜想反例
2026年8月OpenAI推出面向10万名科学家的ChatGPT学术计划,同步披露高维几何、编码理论等多个领域的成果
2026年8月10日Claude刷新黎曼ζ函数零点比例下界

从"解高中奥数题"到"改写数学纪录",只用了一年半。月均一个重大数学突破,在2026年几乎成为常态。

人才流向的信号

  • Jacob Tsimerman(2026菲尔兹奖得主):在领奖当天宣布加入OpenAI,从事AI安全研究。他公开判断"两年内AI做数学的能力将超越人类数学家",并已停止招收纯数学方向博士生。
  • John Jumper(AlphaFold核心人物、诺奖得主):离开Google DeepMind加入Anthropic。
  • Timothy Gowers(菲尔兹奖得主):担忧AI证明指数级增长后,人类将失去解读能力,数学可能变成"无人能懂的思维墓地"。
  • Peter Scholze(2018菲尔兹奖得主):在研究实践中拒绝使用AI。

AI公司从抢AI工程师,到抢菲尔兹奖得主、诺奖得主——因为当AI从聊天进化到做科研时,决定天花板的,是那些最懂如何拓展人类知识边界的人。

五、边界:这不是"AI证明了黎曼猜想"

必须厘清几件事:

第一,黎曼猜想没有被证明。67.2% ≠ 100%。证明67.2%的零点在临界线上,和证明全部零点在临界线上,是本质不同的问题。Anthropic明确表示:"我们不指望Claude所用的技术能最终证明黎曼猜想。"

第二,这不是从零开始的原创。Claude的成果建立在Baluyot、Goldston、Bombieri等数学家数十年工作的基础上。它的贡献是发现了一条未被尝试的组合路径,而非发明全新工具。

第三,60个Agent中一半没有产出。这不是效率问题,而是科研本身的试错属性。但也意味着,这种方法的效果依赖于大规模搜索,而非精巧的单链推理。

第四,模型未公开。产生这一结果的是Anthropic未发布的研究版模型,不代表当前用户可使用的Claude版本具备同等能力。Anthropic也未透露是否会在近期向公众开放多智能体能力。

第五,成本不等于可复制。虽然估算成本在四位数美元级别,但这只是一个问题的单次成功。对于更广泛的研究问题,失败率和成本可能显著更高。

六、真正的信号:AI4S从口号到产出

如果把视线从单个数学结果拉远,这次事件传递的核心信号是:

AI for Science(AI4S)在2026年从战略口号变成了真实的产出线。

过去,AI在科研中的角色是"好用的计算器"——跑数据、搜文献、做统计。现在,Claude已经能够自主组织60个Agent协同工作数十小时,发现问题、验证结论、写出论文,还主动建议人类专家复核。

Anthropic CEO Dario Amodei的表态很直接:"不要只把AI看作分析数据的工具,要把它看作能端到端完成科学家工作的智能体。"

从方法论角度看,这次实验展示了一个可复制的科研工作流模板:

  1. 非专家发起任务,设定方向但不干预执行
  2. 系统自主分解任务,跨数十个并行Agent搜索
  3. 生成形式化可验证证明(Lean)
  4. 主动请求人类审查,在发表前构建验证链条

这个模板不只适用于数学。在任何"出错代价高昂"的领域——药物设计、材料科学、形式化验证——都存在类似的需求结构。

七、结语:也许我们都低估了

Anthropic在博客最后写了一句话,既是关于Claude的,也是关于我们所有人的:

"也许Claude和我们许多人一样,低估了AI进步的速度。"

37年推进1.7个百分点的人类智慧,在36小时内被推进了25.6个百分点。这不是在说AI比人类更聪明——而是在说,当一种新的搜索模式出现时,进步的速度曲线可能会突然弯折。

黎曼猜想依然未被证明。但AI自主科研这件事,已经从"可能"变成了"正在发生"。


参考来源:

  • Anthropic官方博客:Learning more about Claude's mathematical capabilities
  • Claude撰写的论文(PDF)
  • Lean形式化证明(GitHub: anthropics/zeta-23-lean)
  • 机器之心、第一财经、澎湃新闻等媒体报道

本文为原创分析文章,基于公开信息撰写。数据截至2026年8月12日。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询