欧洲Mistral AI推出数学形式化证明模型Leanstral 1.5,专为Lean4语言,总参数119B但推理仅激活6B,以极低开销和Apache-2.0许可完全开源。在miniF2F基准上验证集和测试集均达100%完成率,PutnamBench同样表现惊人。
Anthropic 的Claude Mythos模型通过巧妙证明解决了组合几何领域的百年难题——Erdős单位距离猜想,紧随OpenAI的GPT-5.5之后。这一突破采用智能体协同范式,而非传统单一模型,标志着AI在纯数学发现领域的竞争白热化。
OpenAI最新推理模型成功推翻数学家保罗·Erdős在1946年提出的单位距离猜想,首次依靠自身长链推理能力自主攻克数学核心开放难题。这一里程碑式突破经专家独立验证,标志着人工智能从检索式解答迈入原创性证明阶段。
比利时布鲁塞尔自由大学研究发现,商用大模型已能独立生成原创数学证明。ChatGPT-5.2成功破解了2024年提出的数学猜想,标志着大语言模型能力超越代码辅助和文本创作,进入需要极强逻辑推理的数学领域。
Goedel-Prover 是一款开源的自动化定理证明模型,专注于数学问题的形式化证明。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$7
$35
Google
$2.1
$17.5
$21
$105
$0.7
Alibaba
$4
$16
$1
$10
256
$6
$24
Baidu
128
$2
$20
Moonshot
Bytedance
$0.8
32
deepseek-ai
专为Lean 4形式化定理证明设计的开源大语言模型,通过递归定理证明流程收集数据,结合非正式和形式化的数学推理。
ByteDance-Seed
BFS-Prover是Lean4中最先进的定理证明系统,基于Qwen2.5-Math-7B大语言模型开发,能够根据Lean4中的证明状态自动生成策略,逐步推进数学定理的证明过程。
internlm
InternLM-Step-Prover 是一款基于 7B 语言模型的先进 LEAN4 步骤证明器,在 Lean-Github 和多个合成数据集上训练,在 MiniF2F、ProofNet 和 Putnam 等数学基准测试中表现出色,展示了强大的形式化数学证明能力。
InternLM-Math-Plus 是最先进的双语开源数学推理大语言模型,具备求解、证明、验证和增强能力。
InternLM-Math-Plus 是最先进的双语开源数学推理大语言模型,具备求解、证明、验证和增强等功能,为数学推理领域提供强大支持。
LoneStriker
InternLM-Math是由上海人工智能实验室开发的最先进的双语开源数学推理大语言模型。它在数学推理任务上表现卓越,支持多种数学问题的解决和证明,还可作为奖励模型使用,同时具备数据增强和代码解释等实用功能。