OpenAI被曝完成代号“Bel”的10万亿参数超大规模预训练模型,作为继“Doug”后的下一代基座,架构与参数规模大幅跃升,目标直指通用人工智能(AGI)。其在编码、推理及长时程智能体任务等维度性能表现突出。
Artificial Analysis联合Liquid AI发布手机端本地AI性能基准,聚焦iPhone 17 Pro真实表现。前者测智能水平,后者测推理性能,涵盖函数调用、指令遵循、知识认知、高难问答与数学五类。测试对象为4bit量化、体积不超8GB的端侧模型,旨在验证小模型也能实现高智能。
Anthropic被曝将推Sonnet 5.5,内部代号Fennec(沙漠狐),或下月发布。支持最高200万token上下文,推理速度快、延迟低,长上下文推理及多步规划显著提升,浏览器/终端工具调用增强。性能直逼旗舰Claude Fable 5,但维持Sonnet定价,打造性价比之王。
OpenAI 发布 GPT-5.6 模型家族,包括旗舰 Sol、均衡 Terra 与高性价比 Luna。新一代通过底层技术栈深度优化,大幅提升每 token 智能效率,在降低 API 成本的同时增强性能。其中,旗舰 Sol 开启最大推理能力后,在编码智能体基准测试中表现超越竞品。
GPT 5是下一代AI模型,提供卓越的编码、数学和推理性能。
小米首个推理大模型MiMo开源,专为推理任务设计,性能卓越。
昆仑万维开源的高性能数学代码推理模型,性能卓越
Atom of Thoughts (AoT) 是一种用于提升大语言模型推理性能的框架。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$7
$35
Google
$2.1
$17.5
$21
$105
$0.7
Alibaba
$4
$16
$1
$10
256
$2
$20
$6
$24
Baidu
128
Moonshot
Bytedance
$0.8
32
MaziyarPanahi
这是NousResearch/Hermes-4.3-36B模型的GGUF量化格式版本,由MaziyarPanahi进行量化处理。GGUF是一种高效的模型格式,旨在优化本地部署和推理性能,支持多种量化级别(2位至8位),适用于广泛的文本生成任务。
bartowski
这是由Mistral AI开发的大型语言模型Mistral-Large-3-675B-Instruct-2512的GGUF量化版本。原始模型拥有6750亿参数,专为指令遵循任务设计。本项目使用llama.cpp工具,结合imatrix校准数据集,生成了从Q8_0到IQ1_S共20多种不同精度的量化模型文件,旨在平衡模型性能、推理速度与存储/内存占用,使其能在更广泛的硬件上运行。
T5B
Z-Image-Turbo 是经过 FP8 E5M2 和 E4M3FN 格式量化的图像处理模型,基于原始 Tongyi-MAI/Z-Image-Turbo 模型优化,在保持性能的同时显著减少模型大小和推理资源需求。
PrimeIntellect
INTELLECT-3是一个拥有1060亿参数的混合专家(MoE)模型,通过大规模强化学习训练而成。在数学、编码和推理基准测试中展现出卓越性能,模型、训练框架和环境均以宽松许可协议开源。
noctrex
这是一个基于Huihui-MiroThinker-v1.0-30B模型进行的MXFP4_MOE imatrix量化版本,专门针对文本生成任务优化,在保持模型性能的同时显著减小了模型体积和推理成本。
Dogacel
这是一个基于原始DeepSeek-OCR模型的优化版本,专门支持在苹果金属性能着色器(MPS)和CPU上进行推理的OCR模型。它能够从图像中提取文本并转换为结构化格式,支持多语言文档识别。
mradermacher
Diver-GroupRank-7B是一个专门用于段落排序、文本排序、推理和信息检索的7B参数模型。本版本提供了多种量化格式,适用于不同的硬件和性能需求。
allenai
Olmo 3是由Allen Institute for AI开发的新一代语言模型家族,包含7B和32B的指令和思维变体。该模型在长链式思维方面表现出色,能显著提升数学和编码等推理任务的性能。所有代码、检查点和训练细节都将公开,推动语言模型科学发展。
这是一个基于Huihui-MiroThinker-v1.0-8B模型的量化版本,专门针对文本生成任务进行了优化,通过量化技术提高了推理效率,同时保持了模型的性能表现。
XiaomiMiMo
米模具身模型(MiMo-Embodied)是一款强大的跨具身视觉语言模型,在自动驾驶和具身AI任务中均展现出了卓越的性能。它是首个将这两个关键领域相结合的开源视觉语言模型,显著提升了在动态物理环境中的理解和推理能力。
Olmo 3是由Allen Institute for AI开发的一系列语言模型,包含7B和32B两种规模,具有指令式和思考式两种变体。该模型在长链式思维方面表现出色,能有效提升数学和编码等推理任务的性能。采用多阶段训练方式,包括有监督微调、直接偏好优化和可验证奖励的强化学习。
magiccodingman
这是一个基于Qwen3 VL 8B模型的实验性混合量化版本,采用MXFP4_MOE技术结合高精度权重,在保持接近Q8精度的同时,实现更小的文件体积和更高的推理速度。该模型探索了混合量化方法,在精度损失和性能之间取得了良好平衡。
DevQuasar
MiroThinker-v1.0-72B是一个72B参数的大语言模型量化版本,致力于让知识为每个人所用。该项目基于原始模型进行优化,提供更高效的推理性能。
cyankiwi
MiniMax-M2 AWQ - INT4是基于MiniMax-M2模型进行量化后的版本,采用INT4量化技术,在保证性能的前提下显著减少内存使用并提高推理效率。该模型在编码和智能体任务方面表现出色,具有卓越的综合性能。
unsloth
aquif-3.5系列是2025年11月3日发布的巅峰之作,包含Plus和Max两个版本,提供先进的推理能力和前所未有的100万标记上下文窗口,在各自类别中实现了最先进的性能。
ModelCloud
这是一个基于MiniMax M2基础模型的4bit W4A16量化版本,由ModelCloud的@Qubitum使用GPT-QModel工具进行量化。该模型专门针对文本生成任务进行了优化,在保持较好性能的同时显著减少了模型大小和推理资源需求。
GLM-4.6 AWQ - INT4是GLM-4.6模型的4位量化版本,采用AWQ量化方法,在保持模型性能的同时显著减少了存储和计算资源需求。该模型支持200K上下文长度,在编码、推理和智能体任务方面相比GLM-4.5有显著提升。
QuantTrio
MiniMax-M2-AWQ是基于MiniMaxAI/MiniMax-M2模型的量化版本,通过vLLM框架实现高效的文本生成。该模型采用AWQ量化技术,在保持模型性能的同时显著减少内存占用和提升推理速度,支持32K上下文长度和工具调用功能。
TheStageAI
TheWhisper-Large-V3-Turbo 是 OpenAI Whisper Large V3 模型的高性能微调版本,由 TheStage AI 针对多平台实时、低延迟和低功耗语音转文本推理进行优化。支持流式转录、单词时间戳和可扩展性能,适用于实时字幕、会议和设备端语音界面等场景。
P1 - 30B - A3B是一个300亿参数的大语言模型,经过MXFP4_MOE量化处理,在保持模型性能的同时优化了推理效率,适用于文本生成任务。