Anthropic宣布其AI模型历时11天基本自主运行,完成费马大定理首个端到端、经计算机检查的Lean形式化证明。该工作并非重新发现数学证明,而是将已有证明转化为Lean证明助手可逐步验证的形式,由Claude生成相关证明内容。
Anthropic的AI模型Claude在黎曼猜想证明上取得重大突破,确认67.25%的zeta零点位于临界线且为单零点,打破37年仅推进0.8%的停滞,将攻克这一数学圣杯的剩余距离缩至32.75%。
欧洲Mistral AI推出数学形式化证明模型Leanstral 1.5,专为Lean4语言,总参数119B但推理仅激活6B,以极低开销和Apache-2.0许可完全开源。在miniF2F基准上验证集和测试集均达100%完成率,PutnamBench同样表现惊人。
Anthropic 的Claude Mythos模型通过巧妙证明解决了组合几何领域的百年难题——Erdős单位距离猜想,紧随OpenAI的GPT-5.5之后。这一突破采用智能体协同范式,而非传统单一模型,标志着AI在纯数学发现领域的竞争白热化。
Goedel-Prover 是一款开源的自动化定理证明模型,专注于数学问题的形式化证明。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$7
$35
Google
$2.1
$17.5
$21
$105
$0.7
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
Moonshot
Bytedance
$0.8
32
deepseek-ai
专为Lean 4形式化定理证明设计的开源大语言模型,通过递归定理证明流程收集数据,结合非正式和形式化的数学推理。
ByteDance-Seed
BFS-Prover是Lean4中最先进的定理证明系统,基于Qwen2.5-Math-7B大语言模型开发,能够根据Lean4中的证明状态自动生成策略,逐步推进数学定理的证明过程。
internlm
InternLM-Step-Prover 是一款基于 7B 语言模型的先进 LEAN4 步骤证明器,在 Lean-Github 和多个合成数据集上训练,在 MiniF2F、ProofNet 和 Putnam 等数学基准测试中表现出色,展示了强大的形式化数学证明能力。
InternLM-Math-Plus 是最先进的双语开源数学推理大语言模型,具备求解、证明、验证和增强能力。
InternLM-Math-Plus 是最先进的双语开源数学推理大语言模型,具备求解、证明、验证和增强等功能,为数学推理领域提供强大支持。
LoneStriker
InternLM-Math是由上海人工智能实验室开发的最先进的双语开源数学推理大语言模型。它在数学推理任务上表现卓越,支持多种数学问题的解决和证明,还可作为奖励模型使用,同时具备数据增强和代码解释等实用功能。