陶哲轩团队用 GPT-5.2 Pro 解出 Erdős 问题 #728
在人机反复协作下,AI 找到数论问题 #728(关于数的整除性)的解,且查不到前人已发表的证明——这是早期少见的“真正新增”的 AI 数学结果。
Arena AI 盲测 Elo · Artificial Analysis 智能指数 · OpenRouter 实时价格
一站式追踪全球大模型能力、厂商格局与 API 成本
2026 年 1 月 — 9 月 · 仅收录 AI 实际解决的数学问题(定理、猜想、反例与形式化证明)。从悬置半个世纪的猜想,到被攻下的千禧年难题,这一年被许多数学家称为数学研究的“相变时刻”。
在人机反复协作下,AI 找到数论问题 #728(关于数的整除性)的解,且查不到前人已发表的证明——这是早期少见的“真正新增”的 AI 数学结果。
在 2025 年 9 月布朗大学代数组合学项目基础上,DeepMind 的模型先证出较简单情形;数学家随后让模型补全“一般情形”的证明细节,1 月 12 日的预印本显示它成功了。被视为 AI 辅助研究的一个范例。
包括代数几何中 Chen–Gendron 悬置五年的猜想,以及由 AI 完全自主解决并即时机器验证的 Fel 猜想(关于 syzygies)。数学家中有人评价其证明“优雅而美丽”。
AI 系统独立交出多道尚未发表的“研究级问题”的完整证明,被评价为“奥数水平跨入研究生水平”的时刻。数学界普遍认为这是 AI 证明能力一次公开、可核验的跃迁。
计算机科学泰斗 Donald Knuth 研究有向哈密顿圈时留下的一个图论问题,被 Claude Opus 4.6 独立解出(构造性方法);Knuth 随后补全严格证明并写成论文《Claude’s Cycles》,还发现该构造存在 760 种同类分解方式。Knuth 坦言要重新评估生成式 AI。(已解奇数 m;偶数 m 仍开放。)
借助 GPT-5.4 Pro,陶哲轩给出 #380 的完整解,并对相关问题 #374 得到部分结果。此前数月,AI 已被用于批量攻克这类悬置多年的组合与数论问题。
中国团队用一个“双智能体”框架,独立解决了交换代数中由 Dan Anderson 于 2014 年提出、悬置十余年的开放问题,并几乎在无人干预下自动完成形式化验证。
这个由 Erdős 于 1946 年提出、悬置 80 年的几何猜想被 AI 否证:模型构造出一族全新的高维格点结构,优于传统的方格排列。菲尔兹奖得主 Tim Gowers 称之为“AI 数学的里程碑”,并直言若由人类完成,会毫不犹豫推荐发表在顶尖期刊。(数日后,Anthropic 的 Claude Mythos 在断网环境下又独立给出了一份不同方法的证明。)
基于 AlphaProof 的新系统给出了 9 个 Erdős 开放问题的形式化(Lean)证明,其中 2 个已悬置 56 年,进一步推高了 AI 在组合数论方向的上限。
由数学家与 AI 工具协作产出的一篇重要论文,攻下 Erdős 问题 #1196,是本年度人机协作的代表性成果之一。
经济学界长期沿用、但从未被严格证明的一个结论,由 AI 补上了验证(与反垄断理论相关)。这被视为 AI 数学能力外溢到其他学科的信号。
新一轮 10 道尚未发表的研究级问题,AI 表现继续提升,但结果的正确性核查与“清理”仍需人类大量介入,也凸显出验证流程正成为新的瓶颈。
诺奖得主 Giorgio Parisi 与罗马一大 Francesco Zamponi 用 Claude 攻克“阻塞态临界指数恒等式 a+b=1”的证明——该关系此前只被数值验证、十余年无人能严格证明。Claude 很快给出正确的核心思路,人类研究者复核并修补逻辑漏洞后完成证明,成果发表于 JSTAT。它揭示 Parisi 与 Wyart 两套阻塞理论实为同一物理定律。
把连接分拆理论、模形式、表示论与数学物理的核心语言 q-级数做了扎实的形式化开发,验证工作由 AxiomProver 完成。
一篇 36 位合著者的论文,把 Gemini Deep Think 当作真正的“合作者”,构建“神经符号系统”,解决了包括宇宙弦引力波在内的一批开放问题,并提出“递归自聚合”等协作范式。
由自然语言陈述出发,自主产出并在 Lean 中验证证明。这也是 Axiom Math 员工发表的首篇研究论文。
数学家 Levent Alpöge(现于 Anthropic)在 X 上公布:悬置 87 年(Keller,1939)的雅可比猜想其实是假的,并给出维度 3 上的一个反例(Claude Fable 5 参与发现)。反例足够简短,可手工独立复核。学界称其为“AI 参与解决过的最重要猜想”之一。
其一削弱了后量子签名方案 HAWK(约 60 小时找到改进攻击,使其安全级别大致减半);其二改进了对 7 轮 AES-128 的攻击,比此前人类方法快 200–800 倍。两项结果均不影响生产系统,但展示了 AI 在前沿密码分析上的实力。
Anthropic 一位非数学背景员工让 Claude“认真试试”黎曼猜想。Claude 并没有证出 RH,而是通过结合 Aryan 与 Baluyot–Goldston–Suriajaya–Turnage-Butterbaugh 的结果以及 Bombieri 的方法(有限维 Weil 二次型 + 秩-迹论证),把“已证明落在临界线上的零点比例”下界从 41.6% 推到 67.2%(论文给出 ≥2/3、优化常数约 0.6725,并证明 ≥2/3 为单零点、≥5/6 互异)。由 Anthropic 数学家 Alpöge 与 Furman 复核,Claude 与 Eric Easley 完成 Lean 形式化,外部专家 Conrey、Goldston 检查。⚠️ 尚未经同行评议。
关于分拆数 p(n) 奇偶性的一个长期难题取得突破——这是数论与组合中出名的“顽固墙”。
把 Maynard / Polymath8b 关于“存在无穷多对素数其差不超过 246”的定理,首次完整翻译为可机器验证的 Lean 4 证明。Axiom 首席数学家 Ken Ono 称该定理代表着“人类关于素数的知识边界”。
由 AxiomProver 形式化并验证相关代数恒等式,给出端到端的机器证明证书。
Jihao Liu 构造出一个极化光滑射影五维簇,证明它 K-半稳定(K-polystable)却不承认常标量曲率 Kähler 度量,从而否证了 YTD 猜想(把“最优度量存在性”与“K-稳定性”对应起来的著名猜想)。论文附录说明结果借助生成式 AI 得到,用到 GPT-5.6-sol、Fable 5 与 Danus 系统;其中 Danus 能独立复现反例与完整演绎链。学界认为这说明原始 YTD 猜想用错了稳定性条件,uniform K-稳定性 才是更稳健的判据。
数学家 Levent Alpöge 在 X 上公布一个六维球面 S⁶ 上的复结构构造(Claude 参与),宣称得到一个与标准光滑六维球面微分同胚的紧复三维流形,直接挑战悬置 60 余年、屡有伪证的 Hopf 问题。已有配套 Lean 形式化项目(deancureton/sphere-six-complex)。⚠️ 极具争议、尚待严格验证——Hopf 问题历史上“双向”的错误证明层出不穷。
Anthropic 的 Claude 在 Lean 中给出形式化证明,声称在任意维度、处于临界概率时都不存在无限连通簇(θ(p_c)=0),即著名的“临界点无渗流”问题——它被列入《普林斯顿数学指南》,是概率论公认最著名的开放问题之一。⚠️ 目前仅为 Anthropic 单方“声称(Claimed)”,尚待独立验证;关于具体公布时间与是否由 Alpöge 复核,我未能找到可靠出处确认。
8 月 28 日起,一场多路“赛跑”迅速推进“无穷多对素数间距的上界”:GPT-5.6 Sol 的论证(由张涵信呈现)把 Polymath8b 的 246 推到 240;数日后 Julia Stadlmann 用新技巧独立给出 240;9 月 1 日 Shiva Kintali 携 AI 智能体给出 236;9 月 3 日 Axiom Math 的 AxiomProver 推到 212(附 Lean 证书,建立在 Stadlmann 工作之上);同日前几小时,OpenAI 用 GPT-6 Astra 进一步声称推到 186。⚠️ 截至 2026 年 9 月,上述结果均未同行评议,学界公认的纪录仍是 Polymath8b 的 246。
Claude 产出约 1300 万行、可计算机逐行验证的 Lean 证明,把数学史上最著名的定理之一首次完整形式化(中间证明了约 30,300 条定理,最终用到 29,500 条,规模超过 Mathlib 五倍),仅用 11 天,而人类团队预计需约 10 年。方法基于 Prove2Me 平台与多智能体协作;Kevin Buzzard 复核称“没有除数学公理之外的任何假设”。Nature 于 9 月 7 日报道。
OpenAI 称其内部新一代模型协调最多约 10,000 个并行 AI 智能体、耗时约 88 小时,给出解析证明并附 Lean 形式化,主张三维不可压缩光滑流体可在有限时间内产生奇点(即否证全局光滑性)。若经独立验证成立,这将是 AI 首次解决 Clay 千禧年难题。目前仍待同行评议——9 月 7 日,NYU 的 Tristan Buckmaster 与 Anthropic 的 Alpöge 也已公布用 Codex/Claude 得到的多篇相关结果,双方就署名与数据使用爆发争议。
📌 说明:本时间轴仅收录 AI 在实际数学问题上的成果(证明、反例、构造与形式化验证),不包含考试、综述文章与模型发布。综合 Quanta Magazine、Nature、Scientific American、New Scientist、Anthropic、OpenAI、Google DeepMind、Axiom Math 官方发布及 arXiv 等公开信息整理(2026 年 1 月 — 9 月)。标注“待验证”的结果尚待同行评议或独立复现;请以原始论文与官方发布为准。
基于 600万+ 人类盲测投票的 Elo 排名 · 每日更新 · 点击模型名查看详情
💡 新模型会因评分人数过少造成排名偏低,等待数日即可恢复正常位置。数据更新可能有延迟。
站长基于实际体验对模型的综合评价 · 10 分制 · 仅代表个人观点
相比上一快照排名变化最大的模型 · 每日更新 · ↑ 排名上升 / ↓ 排名下降
按推理输出速度 (tokens/s) 排序 · 附质量分与 API 价格参考
今日快照中首次出现的模型 · 来自综合 / 代码 / 多模态榜单
精英模型数基于 Arena 综合对话榜 (40%) + 峰值百分位 (35%) + 覆盖广度 (25%) · 不堆数量,看质量
价格单位:美元 / 百万 tokens · 数据来源 OpenRouter · 支持筛选和排序
数据来源:OpenRouter · 价格可能随时变动,请以官方为准 · 仅显示主流模型