⚡ 多源数据 · 实时聚合

大模型排行榜

Arena AI 盲测 Elo · Artificial Analysis 智能指数 · OpenRouter 实时价格
一站式追踪全球大模型能力、厂商格局与 API 成本

330+
收录模型
3
权威数据源
11
能力维度榜单
24h
更新频率
✦ 2026 年度专题

AI 数学突破时间轴

2026 年 1 月 — 9 月 · 仅收录 AI 实际解决的数学问题(定理、猜想、反例与形式化证明)。从悬置半个世纪的猜想,到被攻下的千禧年难题,这一年被许多数学家称为数学研究的“相变时刻”。

★ 里程碑 = 具标志性意义的重大突破 · 按时间先后整理
2026 年 1 月
1 月 4 日

陶哲轩团队用 GPT-5.2 Pro 解出 Erdős 问题 #728

在人机反复协作下,AI 找到数论问题 #728(关于数的整除性)的解,且查不到前人已发表的证明——这是早期少见的“真正新增”的 AI 数学结果。

GPT-5.2 Pro陶哲轩数论
1 月 12 日

Vakil 等:AI 补全一个一般情形的证明(预印本)

在 2025 年 9 月布朗大学代数组合学项目基础上,DeepMind 的模型先证出较简单情形;数学家随后让模型补全“一般情形”的证明细节,1 月 12 日的预印本显示它成功了。被视为 AI 辅助研究的一个范例。

Google DeepMindRavi Vakil代数几何
2026 年 2 月
2 月 4 日

Axiom Math 的 AxiomProver 攻下 4 个长期未解问题

包括代数几何中 Chen–Gendron 悬置五年的猜想,以及由 AI 完全自主解决并即时机器验证的 Fel 猜想(关于 syzygies)。数学家中有人评价其证明“优雅而美丽”。

Axiom MathAxiomProver代数几何
2 月 13 日 ★ 里程碑

FirstProof 首批结果:AI 独立解出多道研究级问题

AI 系统独立交出多道尚未发表的“研究级问题”的完整证明,被评价为“奥数水平跨入研究生水平”的时刻。数学界普遍认为这是 AI 证明能力一次公开、可核验的跃迁。

FirstProof研究级证明
2 月 28 日

Claude 解出高德纳(Knuth)的图论猜想

计算机科学泰斗 Donald Knuth 研究有向哈密顿圈时留下的一个图论问题,被 Claude Opus 4.6 独立解出(构造性方法);Knuth 随后补全严格证明并写成论文《Claude’s Cycles》,还发现该构造存在 760 种同类分解方式。Knuth 坦言要重新评估生成式 AI。(已解奇数 m;偶数 m 仍开放。)

Claude Opus 4.6图论Knuth
2026 年 3 月
3 月 31 日

陶哲轩用 GPT-5.4 Pro 解决 Erdős 问题 #380

借助 GPT-5.4 Pro,陶哲轩给出 #380 的完整解,并对相关问题 #374 得到部分结果。此前数月,AI 已被用于批量攻克这类悬置多年的组合与数论问题。

GPT-5.4 ProErdős 问题
2026 年 4 月
4 月 4 日

北大团队:双智能体框架自主解出 Anderson 猜想

中国团队用一个“双智能体”框架,独立解决了交换代数中由 Dan Anderson 于 2014 年提出、悬置十余年的开放问题,并几乎在无人干预下自动完成形式化验证。

北京大学交换代数自动形式化
2026 年 5 月
5 月 20 日 ★ 里程碑

OpenAI 模型推翻 Erdős 平面单位距离猜想

这个由 Erdős 于 1946 年提出、悬置 80 年的几何猜想被 AI 否证:模型构造出一族全新的高维格点结构,优于传统的方格排列。菲尔兹奖得主 Tim Gowers 称之为“AI 数学的里程碑”,并直言若由人类完成,会毫不犹豫推荐发表在顶尖期刊。(数日后,Anthropic 的 Claude Mythos 在断网环境下又独立给出了一份不同方法的证明。)

OpenAI组合几何反例
5 月 21 日

Google DeepMind 发布 AlphaProof Nexus 并解决 9 个 Erdős 问题

基于 AlphaProof 的新系统给出了 9 个 Erdős 开放问题的形式化(Lean)证明,其中 2 个已悬置 56 年,进一步推高了 AI 在组合数论方向的上限。

DeepMindAlphaProof NexusLean
5 月

陶哲轩、Lichtman 等合作解决 Erdős 问题 #1196

由数学家与 AI 工具协作产出的一篇重要论文,攻下 Erdős 问题 #1196,是本年度人机协作的代表性成果之一。

陶哲轩Erdős #1196人机协作
2026 年 6 月
6 月 1 日

Axiom Math 攻克经济学沿用 50 年的未证命题

经济学界长期沿用、但从未被严格证明的一个结论,由 AI 补上了验证(与反垄断理论相关)。这被视为 AI 数学能力外溢到其他学科的信号。

Axiom Math经济学
6 月 16 日

FirstProof 第二批:AI 继续解出研究级问题

新一轮 10 道尚未发表的研究级问题,AI 表现继续提升,但结果的正确性核查与“清理”仍需人类大量介入,也凸显出验证流程正成为新的瓶颈。

FirstProofarXiv 2606.18119
2026 年 7 月
7 月 1 日

Claude 助诺奖得主 Parisi 证明十年悬案(阻塞态 jamming)

诺奖得主 Giorgio Parisi 与罗马一大 Francesco Zamponi 用 Claude 攻克“阻塞态临界指数恒等式 a+b=1”的证明——该关系此前只被数值验证、十余年无人能严格证明。Claude 很快给出正确的核心思路,人类研究者复核并修补逻辑漏洞后完成证明,成果发表于 JSTAT。它揭示 Parisi 与 Wyart 两套阻塞理论实为同一物理定律。

Claude统计物理阻塞态
7 月 3 日

Axiom Math 完成 q-级数理论基础工作的 Lean 形式化

把连接分拆理论、模形式、表示论与数学物理的核心语言 q-级数做了扎实的形式化开发,验证工作由 AxiomProver 完成。

Axiom MathLeanq-级数
7 月 9 日

CMU × Google:用 AI 攻克一批开放数学问题

一篇 36 位合著者的论文,把 Gemini Deep Think 当作真正的“合作者”,构建“神经符号系统”,解决了包括宇宙弦引力波在内的一批开放问题,并提出“递归自聚合”等协作范式。

CMUGoogle神经符号
7 月 14 日

AxiomProver 解决 MIT 数学家 Stanley 提出的开放问题

由自然语言陈述出发,自主产出并在 Lean 中验证证明。这也是 Axiom Math 员工发表的首篇研究论文。

Axiom Math组合数学
7 月 19 日 ★ 里程碑

AI 参与推翻 87 年历史的雅可比猜想

数学家 Levent Alpöge(现于 Anthropic)在 X 上公布:悬置 87 年(Keller,1939)的雅可比猜想其实是假的,并给出维度 3 上的一个反例(Claude Fable 5 参与发现)。反例足够简短,可手工独立复核。学界称其为“AI 参与解决过的最重要猜想”之一。

Claude Fable 5雅可比猜想反例
7 月 28 日

Anthropic:Claude 自主发现两种密码学攻击

其一削弱了后量子签名方案 HAWK(约 60 小时找到改进攻击,使其安全级别大致减半);其二改进了对 7 轮 AES-128 的攻击,比此前人类方法快 200–800 倍。两项结果均不影响生产系统,但展示了 AI 在前沿密码分析上的实力。

AnthropicClaude Mythos密码学
2026 年 8 月
8 月 10 日 ★ 里程碑

Claude 把黎曼 ζ 函数临界线上零点比例的下界从 41.6% 提高到 67.2%

Anthropic 一位非数学背景员工让 Claude“认真试试”黎曼猜想。Claude 并没有证出 RH,而是通过结合 Aryan 与 Baluyot–Goldston–Suriajaya–Turnage-Butterbaugh 的结果以及 Bombieri 的方法(有限维 Weil 二次型 + 秩-迹论证),把“已证明落在临界线上的零点比例”下界从 41.6% 推到 67.2%(论文给出 ≥2/3、优化常数约 0.6725,并证明 ≥2/3 为单零点、≥5/6 互异)。由 Anthropic 数学家 Alpöge 与 Furman 复核,Claude 与 Eric Easley 完成 Lean 形式化,外部专家 Conrey、Goldston 检查。⚠️ 尚未经同行评议。

Claude黎曼 ζ 函数Lean 形式化
8 月 12 日

Axiom Math 证明 2010 年提出的分拆函数奇偶性猜想

关于分拆数 p(n) 奇偶性的一个长期难题取得突破——这是数论与组合中出名的“顽固墙”。

Axiom Math分拆数
8 月 17 日 ★ 里程碑

AxiomProver 首次在 Lean 中形式化“246 定理”

把 Maynard / Polymath8b 关于“存在无穷多对素数其差不超过 246”的定理,首次完整翻译为可机器验证的 Lean 4 证明。Axiom 首席数学家 Ken Ono 称该定理代表着“人类关于素数的知识边界”。

Axiom MathLeanarXiv 2608.15219
8 月 18 日

Axiom Math 证明 Huang–Jiang–Oblomkov 猜想首四个非平凡情形

由 AxiomProver 形式化并验证相关代数恒等式,给出端到端的机器证明证书。

Axiom Math代数
8 月 19 日 ★ 里程碑

生成式 AI 参与推翻 Yau–Tian–Donaldson(YTD)猜想

Jihao Liu 构造出一个极化光滑射影五维簇,证明它 K-半稳定(K-polystable)却不承认常标量曲率 Kähler 度量,从而否证了 YTD 猜想(把“最优度量存在性”与“K-稳定性”对应起来的著名猜想)。论文附录说明结果借助生成式 AI 得到,用到 GPT-5.6-sol、Fable 5 与 Danus 系统;其中 Danus 能独立复现反例与完整演绎链。学界认为这说明原始 YTD 猜想用错了稳定性条件,uniform K-稳定性 才是更稳健的判据。

GPT-5.6-solFable 5Danus复几何
8 月 23 日

AI 辅助构造六维球面 S⁶ 上的复结构(Hopf 问题)

数学家 Levent Alpöge 在 X 上公布一个六维球面 S⁶ 上的复结构构造(Claude 参与),宣称得到一个与标准光滑六维球面微分同胚的紧复三维流形,直接挑战悬置 60 余年、屡有伪证的 Hopf 问题。已有配套 Lean 形式化项目(deancureton/sphere-six-complex)。⚠️ 极具争议、尚待严格验证——Hopf 问题历史上“双向”的错误证明层出不穷。

ClaudeHopf 问题待验证
8 月 28 日

Claude 声称证明“临界点无渗流”(渗流理论最著名悬案之一)

Anthropic 的 Claude 在 Lean 中给出形式化证明,声称在任意维度、处于临界概率时都不存在无限连通簇(θ(p_c)=0),即著名的“临界点无渗流”问题——它被列入《普林斯顿数学指南》,是概率论公认最著名的开放问题之一。⚠️ 目前仅为 Anthropic 单方“声称(Claimed)”,尚待独立验证;关于具体公布时间与是否由 Alpöge 复核,我未能找到可靠出处确认。

Claude渗流待验证
2026 年 9 月
9 月 3 日 ★ 里程碑

孪生素数间距纪录被 AI 接连刷新:从 246 一路攻到 186

8 月 28 日起,一场多路“赛跑”迅速推进“无穷多对素数间距的上界”:GPT-5.6 Sol 的论证(由张涵信呈现)把 Polymath8b 的 246 推到 240;数日后 Julia Stadlmann 用新技巧独立给出 240;9 月 1 日 Shiva Kintali 携 AI 智能体给出 236;9 月 3 日 Axiom Math 的 AxiomProver 推到 212(附 Lean 证书,建立在 Stadlmann 工作之上);同日前几小时,OpenAI 用 GPT-6 Astra 进一步声称推到 186。⚠️ 截至 2026 年 9 月,上述结果均未同行评议,学界公认的纪录仍是 Polymath8b 的 246。

GPT-6 AstraAxiomProver孪生素数待验证
9 月 4 日 ★ 里程碑

Anthropic:Claude 用 11 天完成费马大定理的形式化证明

Claude 产出约 1300 万行、可计算机逐行验证的 Lean 证明,把数学史上最著名的定理之一首次完整形式化(中间证明了约 30,300 条定理,最终用到 29,500 条,规模超过 Mathlib 五倍),仅用 11 天,而人类团队预计需约 10 年。方法基于 Prove2Me 平台与多智能体协作;Kevin Buzzard 复核称“没有除数学公理之外的任何假设”。Nature 于 9 月 7 日报道。

AnthropicClaudeLean 形式化费马大定理
9 月 8 日 ★ 里程碑

OpenAI 宣称 AI 解决了千禧年难题:Navier–Stokes 存在性与光滑性

OpenAI 称其内部新一代模型协调最多约 10,000 个并行 AI 智能体、耗时约 88 小时,给出解析证明并附 Lean 形式化,主张三维不可压缩光滑流体可在有限时间内产生奇点(即否证全局光滑性)。若经独立验证成立,这将是 AI 首次解决 Clay 千禧年难题。目前仍待同行评议——9 月 7 日,NYU 的 Tristan Buckmaster 与 Anthropic 的 Alpöge 也已公布用 Codex/Claude 得到的多篇相关结果,双方就署名与数据使用爆发争议。

OpenAI千禧年难题Navier–Stokes待验证

📌 说明:本时间轴仅收录 AI 在实际数学问题上的成果(证明、反例、构造与形式化验证),不包含考试、综述文章与模型发布。综合 Quanta Magazine、Nature、Scientific American、New Scientist、Anthropic、OpenAI、Google DeepMind、Axiom Math 官方发布及 arXiv 等公开信息整理(2026 年 1 月 — 9 月)。标注“待验证”的结果尚待同行评议或独立复现;请以原始论文与官方发布为准。

🏆 大模型能力排行榜 Arena AI

基于 600万+ 人类盲测投票的 Elo 排名 · 每日更新 · 点击模型名查看详情

💡 新模型会因评分人数过少造成排名偏低,等待数日即可恢复正常位置。数据更新可能有延迟。

# 模型 Elo 评分 票数
加载排行榜数据…

站长主观排行榜 主观

站长基于实际体验对模型的综合评价 · 10 分制 · 仅代表个人观点

# 模型 评分 备注
加载主观评分…

📈 本周排名变化 趋势

相比上一快照排名变化最大的模型 · 每日更新 · ↑ 排名上升 / ↓ 排名下降

# 模型 Elo 评分 变化
加载排名变化…

速度排行榜 Artificial Analysis

按推理输出速度 (tokens/s) 排序 · 附质量分与 API 价格参考

# 模型 速度 质量分 价格 (输入/输出)
加载速度数据…

🆕 最新上榜模型 New

今日快照中首次出现的模型 · 来自综合 / 代码 / 多模态榜单

加载新上榜模型…

🏢 AI 厂商综合实力排名 综合

精英模型数基于 Arena 综合对话榜 (40%) + 峰值百分位 (35%) + 覆盖广度 (25%) · 不堆数量,看质量

加载厂商排名…
🏟️ Arena AI 原 LMSYS Chatbot Arena,600万+ 人类盲测投票 Elo 排行,衡量「人觉得哪个更好」
📊 BenchLM 281 个模型 × 296 个基准,专项能力评测:指令遵循 / 科学推理 / 工具调用 / 学术知识
🎯 LiveBench 防作弊实时评测,每月更新题目,6 个维度:推理/编程/数学/数据分析/语言/指令遵循
🇨🇳 中文基准 聚合 SuperCLUE + C-Eval + CMMLU 三大中文评测,加权综合排名
📊 Artificial Analysis 质量/速度/价格三维对比,独立评测,含推理速度 (tokens/s) 和性价比分析
💰 OpenRouter 聚合 345+ 模型 API 价格,实时更新的输入/输出 token 单价和上下文窗口

💰 大模型 API 价格参考 USD

价格单位:美元 / 百万 tokens · 数据来源 OpenRouter · 支持筛选和排序

模型 输入价格 输出价格 上下文
加载价格数据…

数据来源:OpenRouter · 价格可能随时变动,请以官方为准 · 仅显示主流模型