Anthropic Claude 用 11 天证明费马大定理:1300 万行 Lean 代码,AI 拿下世纪数学猜想形式化

· 科技资讯

Anthropic 9 月 4 日扔出一颗深水炸弹:Claude 在基本自主运行 11 天后,完成了对费马大定理(FLT)的首个端到端、经过计算机检查的形式化证明。整个证明在 Lean 证明助手中逐步通过验证,最终证明规模超过 Mathlib 这个主要数学证明库的 5 倍。这是 AI 第一次端到端搞定一道悬而未决 357 年的世纪猜想的形式化工作——而数学内容本身早在 1995 年就由怀尔斯证明过了。

Anthropic Claude 用 11 天证明费马大定理:1300 万行 Lean 代码,AI 封面

11 天干了什么

Anthropic 公布的关键数字:

| 指标 | 数据 |

|——|——|

| 自主运行时间 | 11 天 |

| 生成的 Lean 代码 | 约 1300 万行 |

| 证明的定理 | 约 3.03 万个 |

| 纳入最终证明的中间定理 | 约 2.95 万个 |

| 输出 Token | 约 60 亿 |

| 使用模型 | 与 Claude Fable 5.1 大致相当的内部研究模型 |

| 验证工具 | Lean(仅使用 3 条标准公理) |

整个项目由 Anthropic 研究员 Tianyi Peng 发起,通过哥伦比亚大学合作者开发的 Prove2Me 平台,用有向无环图(DAG)记录待证明的定理及其依赖关系,并支持多个 Claude 智能体并行工作。人类输入只限于”少量高层次指令”,比如指定某些数学对象或定理的优先级,具体证明过程由 Claude 完成。

为什么形式化比”证明”更难

怀尔斯 1995 年的费马大定理原始证明长达 129 页,正确性在发表前还经历了数月的人工核查。而 Lean 形式化要求把每一个被人类数学家”省略”掉的推导步骤都明确写出来——因为 Lean 需要逐步验证每一个逻辑环节。这次工作的目标是采用 Darmon、Diamond 和 Taylor 对怀尔斯证明的简化版本进行形式化。

Anthropic 特别强调:这次成果的重点不是 AI 独立提出新的费马大定理证明。创新在于利用 AI 大规模自动完成证明形式化,并由 Lean 对最终结果进行计算机验证。

Kevin Buzzard 审阅后认为,这项自动形式化成果显示,AI 辅助形式化大型数学成果已经取得重要进展

读者能立刻用上的部分

Lean 形式化能力跃迁:原来数学家需要数年的形式化工作,现在 AI 智能体可以在数天量级完成。未来新数学论文发表的”标配”可能从”形式化附录”变成”形式化证明仓库”。

多智能体协作范式:DAG + 并行证明代理的架构,可以直接迁移到代码迁移、协议验证、安全审计等”长链条”任务。

60 亿 Token 的工程含义:这不是”问一句答一句”的聊天场景,而是 11 天连续运行的”AI 工程师”。这类长任务对推理基础设施的要求,会继续推高专用算力的需求。

数学知识资产化:Anthropic 这次把 FLT 形式化的完整证明开源,意味着任何团队都可以基于这份”可验证数学资产”做二次开发,比如自动出题系统、形式化教学工具。

该警惕的部分

“AI 证明新定理”的边界:这次工作不是”AI 独立发现数学”,而是把已有数学证明转成机器可验证形式。媒体如果误读为”AI 解决了新数学猜想”会误导公众。

算力门槛:60 亿输出 Token 按市场价算已经超过 100 万美元成本,这类工作目前只有头部实验室能复现。

可控性挑战:11 天连续运行的智能体如何避免偏离目标、如何随时中断、如何审计中间状态,是下一阶段要解决的核心问题。

完整证明已经在 GitHub 公开:`https://github.com/anthropics/fermats-last-theorem`。


🔥 关注LC智趣厅,看 AI 在科学发现上的下一步动作。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅