OpenAI發佈超旗艦大模型GPT-6 Astra,總裁布羅克曼稱其或標誌着人類邁入通用人工智能(AGI)時代。該模型在數學與科學測試中實現代際躍升,FrontierMath Tier4和GPQA Diamond分別達97.6%和96%,動手能力等表現亦突出。
OpenAI科學團隊負責人Kevin Weil預測,2026年將是AI在科學領域實現突破的關鍵一年。他指出,GPT-5.2模型正從工具演變爲科研“數字腦暴夥伴”,顯著提升科研效率。在GPQA基準測試中,GPT-5.2表現遠超GPT-4的39%,接近人類專家70%的門檻,顯示出巨大潛力。
谷歌Gemini 3 Pro以1501 Elo創LMArena歷史新高,超越GPT-5.1等模型,成多模態模型榜首。在科學、數學及視頻任務中表現卓越,如“人類終極考試”達37.5%,GPQA Diamond 91.9%。Deep Think模式進一步提升推理能力,通用智能測試ARC-AGI-2得分45.1%。
谷歌發佈Gemini3,首次提供100萬tokens上下文窗口,原生支持文本、圖像、視頻與代碼多模態推理。Gemini3 Pro在GPQA測試獲91.9%準確率,LMArena以1501分超越GPT-5.1與Claude4.5登頂。採用Deep Think推理模式,通過“思維簽名”產品化推理鏈,在邏輯、事實與科學推理方面表現突出。
Anthropic
$105
輸入tokens/百萬
$525
輸出tokens/百萬
200
上下文長度
Alibaba
$0.3
-
32
$2
131
$1
ParrotRouter
這是基於Qwen3-4B-Instruct模型轉換的GGUF量化版本,採用Q8量化技術,適用於llama.cpp推理框架。模型通過模型融合技術優化,在MMLU和GPQA等學術基準測試中表現優異。
Mungert
ZR1-1.5B是一個小型推理模型,在編碼和數學問題上經過大量強化學習訓練。該模型在複雜編碼任務上表現優於Llama-3.1-70B-Instruct,比基礎模型提升50%以上,僅用1.5B參數就在GPQA-Diamond上實現了37.91%的pass@1準確率。
reasonir
ReasonIR-8B是首個專為通用推理任務訓練的檢索模型,在BRIGHT基準上實現了最先進的檢索性能,並在RAG應用中顯著提升了MMLU和GPQA基準的表現。
qihoo360
Light-R1-14B-DS是一個14B參數的數學SOTA模型,採用強化學習訓練,在AIME24/25和GPQA基準測試中表現優異。
sometimesanotion
Lamarck-14B-v0.7-Fusionvergence是一個採用創新多階段融合方法構建的14B參數大語言模型,通過融合多個優秀基礎模型的優勢,在自由形式的創意任務中展現出卓越性能,具有較高的GPQA得分和強大的推理能力。
scb10x
颱風T1 3B是SCB 10X開發的新型開放推理模型系列的首款產品。該模型基於Llama 3.2架構,具備跨領域推理能力,在GPQA、MMLU Pro和AI數學奧林匹克等基準測試中表現優異,特別支持泰語推理過程生成。