科大訊飛發佈星火X2.5大模型,採用混合專家架構,總參數2930億、推理僅激活300億,兼顧高效與性能提升。重點強化代碼生成和智能體交互,數學計算、語義理解等通用能力增強,並全面支持256K長上下文處理。
OpenAI被曝完成代號“Bel”的10萬億參數超大規模預訓練模型,作爲繼“Doug”後的下一代基座,架構與參數規模大幅躍升,目標直指通用人工智能(AGI)。其在編碼、推理及長時程智能體任務等維度性能表現突出。
Artificial Analysis聯合Liquid AI發佈手機端本地AI性能基準,聚焦iPhone 17 Pro真實表現。前者測智能水平,後者測推理性能,涵蓋函數調用、指令遵循、知識認知、高難問答與數學五類。測試對象爲4bit量化、體積不超8GB的端側模型,旨在驗證小模型也能實現高智能。
Anthropic被曝將推Sonnet 5.5,內部代號Fennec(沙漠狐),或下月發佈。支持最高200萬token上下文,推理速度快、延遲低,長上下文推理及多步規劃顯著提升,瀏覽器/終端工具調用增強。性能直逼旗艦Claude Fable 5,但維持Sonnet定價,打造性價比之王。
GPT 5是下一代AI模型,提供卓越的編碼、數學和推理性能。
小米首個推理大模型MiMo開源,專為推理任務設計,性能卓越。
崑崙萬維開源的高性能數學代碼推理模型,性能卓越
Atom of Thoughts (AoT) 是一種用於提升大語言模型推理性能的框架。
Openai
$2.8
輸入tokens/百萬
$11.2
輸出tokens/百萬
1k
上下文長度
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$7
$35
Google
$2.1
$17.5
$21
$105
$0.7
Alibaba
$1
$10
256
$6
$24
$2
$20
$4
$16
Baidu
128
Moonshot
Bytedance
$0.8
32
T5B
Z-Image-Turbo 是經過 FP8 E5M2 和 E4M3FN 格式量化的圖像處理模型,基於原始 Tongyi-MAI/Z-Image-Turbo 模型優化,在保持性能的同時顯著減少模型大小和推理資源需求。
PrimeIntellect
INTELLECT-3是一個擁有1060億參數的混合專家(MoE)模型,通過大規模強化學習訓練而成。在數學、編碼和推理基準測試中展現出卓越性能,模型、訓練框架和環境均以寬鬆許可協議開源。
noctrex
這是一個基於Huihui-MiroThinker-v1.0-30B模型進行的MXFP4_MOE imatrix量化版本,專門針對文本生成任務優化,在保持模型性能的同時顯著減小了模型體積和推理成本。
Dogacel
這是一個基於原始DeepSeek-OCR模型的優化版本,專門支持在蘋果金屬性能著色器(MPS)和CPU上進行推理的OCR模型。它能夠從圖像中提取文本並轉換為結構化格式,支持多語言文檔識別。
mradermacher
Diver-GroupRank-7B是一個專門用於段落排序、文本排序、推理和信息檢索的7B參數模型。本版本提供了多種量化格式,適用於不同的硬件和性能需求。
allenai
Olmo 3是由Allen Institute for AI開發的新一代語言模型家族,包含7B和32B的指令和思維變體。該模型在長鏈式思維方面表現出色,能顯著提升數學和編碼等推理任務的性能。所有代碼、檢查點和訓練細節都將公開,推動語言模型科學發展。
這是一個基於Huihui-MiroThinker-v1.0-8B模型的量化版本,專門針對文本生成任務進行了優化,通過量化技術提高了推理效率,同時保持了模型的性能表現。
XiaomiMiMo
米模具身模型(MiMo-Embodied)是一款強大的跨具身視覺語言模型,在自動駕駛和具身AI任務中均展現出了卓越的性能。它是首個將這兩個關鍵領域相結合的開源視覺語言模型,顯著提升了在動態物理環境中的理解和推理能力。
Olmo 3是由Allen Institute for AI開發的一系列語言模型,包含7B和32B兩種規模,具有指令式和思考式兩種變體。該模型在長鏈式思維方面表現出色,能有效提升數學和編碼等推理任務的性能。採用多階段訓練方式,包括有監督微調、直接偏好優化和可驗證獎勵的強化學習。
magiccodingman
這是一個基於Qwen3 VL 8B模型的實驗性混合量化版本,採用MXFP4_MOE技術結合高精度權重,在保持接近Q8精度的同時,實現更小的文件體積和更高的推理速度。該模型探索了混合量化方法,在精度損失和性能之間取得了良好平衡。
DevQuasar
MiroThinker-v1.0-72B是一個72B參數的大語言模型量化版本,致力於讓知識為每個人所用。該項目基於原始模型進行優化,提供更高效的推理性能。
cyankiwi
MiniMax-M2 AWQ - INT4是基於MiniMax-M2模型進行量化後的版本,採用INT4量化技術,在保證性能的前提下顯著減少內存使用並提高推理效率。該模型在編碼和智能體任務方面表現出色,具有卓越的綜合性能。
unsloth
aquif-3.5系列是2025年11月3日發佈的巔峰之作,包含Plus和Max兩個版本,提供先進的推理能力和前所未有的100萬標記上下文窗口,在各自類別中實現了最先進的性能。
ModelCloud
這是一個基於MiniMax M2基礎模型的4bit W4A16量化版本,由ModelCloud的@Qubitum使用GPT-QModel工具進行量化。該模型專門針對文本生成任務進行了優化,在保持較好性能的同時顯著減少了模型大小和推理資源需求。
GLM-4.6 AWQ - INT4是GLM-4.6模型的4位量化版本,採用AWQ量化方法,在保持模型性能的同時顯著減少了存儲和計算資源需求。該模型支持200K上下文長度,在編碼、推理和智能體任務方面相比GLM-4.5有顯著提升。
QuantTrio
MiniMax-M2-AWQ是基於MiniMaxAI/MiniMax-M2模型的量化版本,通過vLLM框架實現高效的文本生成。該模型採用AWQ量化技術,在保持模型性能的同時顯著減少內存佔用和提升推理速度,支持32K上下文長度和工具調用功能。
TheStageAI
TheWhisper-Large-V3-Turbo 是 OpenAI Whisper Large V3 模型的高性能微調版本,由 TheStage AI 針對多平臺即時、低延遲和低功耗語音轉文本推理進行優化。支持流式轉錄、單詞時間戳和可擴展性能,適用於即時字幕、會議和設備端語音界面等場景。
P1 - 30B - A3B是一個300億參數的大語言模型,經過MXFP4_MOE量化處理,在保持模型性能的同時優化了推理效率,適用於文本生成任務。
這是PromptCoT-2.0-SelfPlay-30B-A3B模型的MXFP4_MOE量化版本,專門用於文本生成任務。該模型採用了思維鏈提示和自博弈訓練技術,通過量化優化實現了更高效的推理性能。
這是GLM-4.5-Air-REAP-82B-A12B模型的MXFP4_MOE量化版本,專門針對文本生成任務進行了優化。該模型基於cerebras的GLM-4.5-Air-REAP-82B-A12B基礎模型,通過MXFP4混合專家量化技術實現,在保持性能的同時顯著減小模型體積和推理成本。