OpenAI发布超旗舰大模型GPT-6 Astra,总裁布罗克曼称其或标志着人类迈入通用人工智能(AGI)时代。该模型在数学与科学测试中实现代际跃升,FrontierMath Tier4和GPQA Diamond分别达97.6%和96%,动手能力等表现亦突出。
OpenAI科学团队负责人Kevin Weil预测,2026年将是AI在科学领域实现突破的关键一年。他指出,GPT-5.2模型正从工具演变为科研“数字脑暴伙伴”,显著提升科研效率。在GPQA基准测试中,GPT-5.2表现远超GPT-4的39%,接近人类专家70%的门槛,显示出巨大潜力。
谷歌Gemini 3 Pro以1501 Elo创LMArena历史新高,超越GPT-5.1等模型,成多模态模型榜首。在科学、数学及视频任务中表现卓越,如“人类终极考试”达37.5%,GPQA Diamond 91.9%。Deep Think模式进一步提升推理能力,通用智能测试ARC-AGI-2得分45.1%。
谷歌发布Gemini3,首次提供100万tokens上下文窗口,原生支持文本、图像、视频与代码多模态推理。Gemini3 Pro在GPQA测试获91.9%准确率,LMArena以1501分超越GPT-5.1与Claude4.5登顶。采用Deep Think推理模式,通过“思维签名”产品化推理链,在逻辑、事实与科学推理方面表现突出。
Anthropic
$105
输入tokens/百万
$525
输出tokens/百万
200
上下文长度
Alibaba
$0.3
-
32
$2
131
$1
ParrotRouter
这是基于Qwen3-4B-Instruct模型转换的GGUF量化版本,采用Q8量化技术,适用于llama.cpp推理框架。模型通过模型融合技术优化,在MMLU和GPQA等学术基准测试中表现优异。
Mungert
ZR1-1.5B是一个小型推理模型,在编码和数学问题上经过大量强化学习训练。该模型在复杂编码任务上表现优于Llama-3.1-70B-Instruct,比基础模型提升50%以上,仅用1.5B参数就在GPQA-Diamond上实现了37.91%的pass@1准确率。
reasonir
ReasonIR-8B是首个专为通用推理任务训练的检索模型,在BRIGHT基准上实现了最先进的检索性能,并在RAG应用中显著提升了MMLU和GPQA基准的表现。
qihoo360
Light-R1-14B-DS是一个14B参数的数学SOTA模型,采用强化学习训练,在AIME24/25和GPQA基准测试中表现优异。
sometimesanotion
Lamarck-14B-v0.7-Fusionvergence是一个采用创新多阶段融合方法构建的14B参数大语言模型,通过融合多个优秀基础模型的优势,在自由形式的创意任务中展现出卓越性能,具有较高的GPQA得分和强大的推理能力。
scb10x
台风T1 3B是SCB 10X开发的新型开放推理模型系列的首款产品。该模型基于Llama 3.2架构,具备跨领域推理能力,在GPQA、MMLU Pro和AI数学奥林匹克等基准测试中表现优异,特别支持泰语推理过程生成。