OpenAI升级GPT-5.5 Instant模型,显著增强意图识别与引申义捕捉能力,复杂任务处理更稳定。该模型5月5日发布,高风险领域幻觉率下降52.5%,数学、科学及视觉推理进步明显。5月30日的更新进一步优化回复自然度。
初创AI公司Axiom Math宣布其AI系统自2月以来提交的8篇数学论文中,5篇通过同行评审并被接收,标志着AI在纯数学研究领域取得突破性进展,特别是在解决分拆多项式倒数和等复杂学术猜想上迈出实质性一步。
OpenAI的通用推理模型在没有人类指导的情况下,独立解决了组合几何领域困扰学界80年的埃尔德什单位距离猜想。该问题由数学家埃尔德什于1946年提出,核心是探究平面上n个点之间最多能有多少对距离为1的单位距离对。
Anthropic 的Claude Mythos模型通过巧妙证明解决了组合几何领域的百年难题——Erdős单位距离猜想,紧随OpenAI的GPT-5.5之后。这一突破采用智能体协同范式,而非传统单一模型,标志着AI在纯数学发现领域的竞争白热化。
数学领域的开源AI模型,助力数学竞赛。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$7
$35
Google
$2.1
$17.5
$21
$105
$0.7
Alibaba
$4
$16
$1
$10
256
Baidu
128
$2
$20
$6
$24
Moonshot
Bytedance
EssentialAI
Rnj-1-instruct 是由 Essential AI 从头开始训练的 80 亿参数开放权重密集模型,针对代码、STEM 领域、智能体能力和工具调用进行了优化。它在多种编程语言中表现出色,同时在数学和科学领域也展现出强大实力,能力与最先进的开放权重模型相当。
Rnj-1 是由 Essential AI 从头训练的一系列 80 亿参数、开放权重的密集模型。该模型针对代码和 STEM 领域进行了优化,在编程、数学推理、智能体任务和工具调用方面表现出色,能力与最先进的开放权重模型相当。
Nanbeige
Nanbeige4-3B-Thinking是第四代Nanbeige大语言模型家族中的30亿参数推理模型,通过提升数据质量和训练方法实现了先进的推理能力。该模型在数学、科学、创意写作、工具使用等多个领域表现出色,支持多阶段课程学习和强化学习训练。
Jackrong
本项目通过创新的两阶段训练流程,将GPT的推理能力蒸馏到Llama-3.1-8B模型中。首先通过监督微调进行知识蒸馏和格式对齐,然后利用强化学习激励模型自主探索和优化推理策略,专注于数学推理领域的能力突破。
suayptalha
Sungur-14B 是一个专门针对土耳其语的大语言模型,基于 Qwen/Qwen3-14B 派生而来。该模型使用包含 41.1k 个土耳其语样本的数据集进行微调,涵盖数学、医学和常识等领域的推理对话,旨在增强土耳其语的本土推理能力。
prithivMLmods
palmyra-mini系列模型在复杂推理和数学问题解决领域展现出卓越能力,尤其在需要深入理解和多步骤思考的基准测试中表现出色。该模型擅长解决小学水平的数学问题,在gsm8k基准测试中取得0.818的高分,在MATH500基准测试中同样获得0.818分数,在AMC23基准测试中获得0.6的稳健分数。
unsloth
Qwen3-235B-A22B-Thinking-2507是一款强大的混合专家语言模型,在知识推理、数学计算、科学分析、编程等多个领域表现出色。该模型具有235B总参数和22B激活参数,支持256K长上下文理解,在开源思考模型中达到了最先进的性能水平。
mradermacher
UniReason-Qwen3-14B-RL 是一个经过量化的多领域适用模型,特别擅长文本生成和数学推理任务。
nvidia
一款15亿参数的开源权重模型,专为复杂推理任务设计,在数学、编码、科学及逻辑谜题等领域表现卓越。
LLM360
Guru-7B是基于Qwen2.5-7B的强化学习推理模型,在论文《Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective》中提出。该模型在数学、代码、科学、逻辑推理等多个领域展现出卓越的推理能力,在多项基准测试中表现优异。
lmstudio-community
基于microsoft/Phi-4-reasoning-plus模型转换的MLX 4bit量化版本,专为Apple Silicon优化,在自然语言处理、数学推理、代码生成和对话等多个领域具有高效性能
Phi-4-reasoning是一款由微软开发的先进推理模型,基于Phi-4进行微调,专注于提升数学、科学和编码等领域的推理能力。
Phi-4-reasoning是基于Phi-4微调的先进推理模型,通过监督微调与强化学习,在数学、科学和编码等领域展现出卓越的推理能力。
Phi-4-reasoning-plus是微软基于Phi-4微调的最先进开放权重推理模型,专注于数学、科学和编码领域的高级推理能力。
Phi-4推理增强版是微软研究院开发的140亿参数开源推理模型,通过监督微调和强化学习优化,专注于数学、科学和编程领域的高级推理能力。
Phi-4-reasoning-plus 是由微软研究院开发的开源推理模型,专注于数学、科学和编程领域的高级推理能力。
Bojun-Feng
Qwen2.5是通义千问大模型的最新系列,包含从0.5B到72B参数规模的基础模型和指令微调模型,在代码、数学、指令遵循、长文本生成等领域有显著提升。
microsoft
Phi-4-reasoning-plus 是微软研究院开发的先进开放权重推理模型,基于 Phi-4 通过监督微调和强化学习优化,专注于数学、科学和编码领域的高级推理能力。
Danielbrdz
基于google/gemma-3-4b-it模型训练的多模态模型,专注于数学、编程、科学和解谜领域的高质量数据处理。
TIGER-Lab
General-Reasoner是一种大语言模型训练范式,旨在全面增强模型在不同领域的推理能力,涵盖数学、编程、物理、化学、金融、人文等多个领域。该模型基于Qwen2.5-14B训练,通过多样化推理数据和基于模型的验证器提升跨领域推理性能。
一个提供WolframAlpha LLM API访问的MCP服务器,支持自然语言查询数学、科学等多领域问题
一个提供WolframAlpha LLM API访问的MCP服务器,支持自然语言查询数学、科学、历史等多领域问题,返回结构化响应。