大语言模型在数学几何题上表现不佳。GPT-4.1和Gemini-2.5-Pro虽在写作、编程领域优秀,但面对需画辅助线或函数图像的题目时频繁出错。根源在于模型擅长文本推理,却缺乏几何空间想象能力,无法精准脑中构图,导致错误结论。
字节跳动Seed团队研发的自动定理证明系统Seed-Prover在IMO2025比赛中表现亮眼,成功解决四道数学难题。该系统在几何题上仅用2秒完成证明,数论题则需3天并生成数千行证明,组合代数题还展现了创新解法。虽然比赛期间未能及时完成第一题,但赛后成功补证。目前该项目尚未开源模型权重,仅提供论文和项目资料。这一成果展示了AI在数学证明领域的潜力,为学术研究提供了新工具。
谷歌DeepMind的数学人工智能模型在今年的国际数学奥林匹克(IMO)比赛中取得了突破性进展。据官方消息,正规数学推理模型AlphaProof和改进版几何求解模型AlphaGeometry2共同攻克了本届IMO六道难题中的四道,首次达到了与人类银牌获得者相当的水平。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
-
Anthropic
$21
$105
200
Alibaba
$4
$16
Baidu
128
Moonshot
256
Bytedance
$0.8
$2
Tencent
$1
32
$54
$163
Deepseek
$12
$1.6
$0.4
$15
Iflytek
$3.5
Xai
nvidia
基于深度学习的数学问题自动求解系统,支持代数、几何、微积分等多种数学题型