Anthropic 于 2026 年 9 月 4 日公布,费马大定理已经有了一份可由计算机全程验证的证明。绝大部分工作由 Claude 完成,历时约 11 天,写出的 Lean 代码达到 1300 万行,最终证明中用到了 29500 条中间定理。这并没有诞生新的数学成果,但验证证明这件事的速度,已经和过去完全不在一个量级上。
走了 350 年的证明,和它背后的验证难题
费马把那句话写在书页空白处,大约是 1637 年。对任意大于 2 的指数,不存在正整数 a、b、c 满足 a 的 n 次方加 b 的 n 次方等于 c 的 n 次方。命题本身谁都读得懂,证明却 350 多年无人给出。1908 年有人悬赏 10 万金马克,仅第一年就收到 621 份错误证明。※该奖金按今天的币值约合 100 万至 200 万美元(约 1.6 亿至 3.1 亿日元)。按 1 美元 = 156 日元换算。
真正了结此事的是 1995 年 Andrew Wiles 那篇 129 页的论文。这份证明同样没有被立刻接受。1993 年演讲中公布的初版在审查过程中被指出存在关键漏洞,Wiles 花了一年时间,和昔日学生 Richard Taylor 一起把缺口补上。而要读通这 129 页并确认无误,多位数学家投入了数月时间。
形式化的思路正是从这里来的:把证明改写成机器能读的语言,让计算机去找逻辑漏洞。写给人看的证明会把大量步骤视为显然而跳过,而证明助手 Lean 要求每一步都写清楚。就费马大定理而言,Imperial College London 的 Kevin Buzzard 于 2024 年发起的社区项目一直在推进,仅描述初始阶段的设计蓝图就有 86 页。这原本被认为是以年为单位的工程。
11 天,1300 万行
推动这件事的是 Anthropic 研究员 Tianyi Peng。他在 Columbia University 的团队一直在做形式化工具,他想试试 Claude 能在这个难题上走多远,结果超出了预期。
数字能说明规模。11 天生成 1300 万行 Lean 代码,途中证明了 30300 条定理,其中 29500 条进入最终证明。作为依托的 Mathlib 是社区最核心的数学证明库,而这份证明的体量是它的 5 倍以上。Anthropic 自己也承认,写法很可能比实际需要的冗长得多。
证明路线并非 Wiles 的原始论证,而是以 Henri Darmon、Fred Diamond 和 Richard Taylor 的简化讲解为底本。人类的介入仅限于偶尔给出的高层建议,例如把作为概形的雅可比优先处理。最终证明只依赖 Lean 的三条标准公理,并通过专门的比对工具确认了所证命题与 Mathlib 中费马大定理的表述一致。
这份成果并非凭空而来。它从 Buzzard 的项目以及处理正则素数情形的 flt-regular 中吸收了组件,而 Lean 与 Mathlib 本身就是数百位数学家共同养成的产物。Buzzard 在读过这份证明后指出,AI 自动形式化的产物如今已经稳固到可以被别人拿来继续搭建的程度。
最初的尝试是失败的
过程并不顺利。早期试验中,各个智能体起初还有进展,随后就搞不清整个项目进行到了哪一步,协作随之瓦解。最终证明里去掉样板代码后的行数中,约 7% 来自这些失败的尝试。
局面转变的节点,是改用 Prove2Me 这一协作平台之后。它由 Peng 及其合作者设计,起作用的有三点:把待证定理之间的依赖关系维护成有向无环图,让智能体能判断下一步该从哪里入手;把定理陈述与证明拆到不同文件,从而减轻编译负担;为每条定理附上自然语言描述,使已完成的结果可被检索和复用。
底层是基于 Claude Code 搭建的多智能体框架,消耗的输出 token 约 60 亿。所用模型是内部通用研究模型,能力大致相当于 Claude Fable 5.1。
对数学研究现场意味着什么
当形式化能在现实可接受的时间内完成,同行评议的分量就变了。原本要靠人花上数年确认一项新结果是否成立,如今机器可以分担相当一部分。在 AI 生成的数学成果不断堆积的当下,这部分验证成本已经大到无法忽视。
这套方法看来也不是大型项目的专利。Anthropic 研究人员做过一个小实验,只用三个个人版 Claude Max 订阅,通过 Prove2Me 协同,三天就完成了维诺格拉多夫三素数定理的形式化。只要脚手架搭得合适,用普通订阅去形式化重要定理并非遥不可及。
对 Claude 自身也有副作用。近期由 Claude 完成的成果,往往在证明的同时并行做形式化,Claude 似乎会用这些部分形式化来自查假设是否站得住,就像它写数值模拟来确认方向是否正确一样。
完整证明已在 GitHub 公开,并附有梳理证明脉络的说明文档。
总结
11 天、1300 万行、29500 条中间定理。费马大定理第一次有了机器可以从头验到尾的证明。价值不在于新数学,而在于验证。确认证明是否正确的工序正从人手转向机器,而产出的成果已经稳固到能成为下一份证明的地基,这才是此次最大的变化。
