海光DCU完成萬億參數大模型Kimi K3全棧適配與驗證,標誌着國產算力首次穩穩支撐此類超大模型。通過底層算子到推理引擎的深度優化,模型無需任何代碼改動,遷移成本近乎零,開發者拿到算力即可部署。同時針對KDA注意力與896專家MoE架構實現從容兼容,打破海外旗艦芯片壟斷,提供開箱即用的國產方案。
MiniMax稀宇科技於2026年6月1日發佈新一代前沿大模型M3,這是國內首個集成頂尖編程、1M超長上下文及原生多模態能力的開源模型,對標海外閉源旗艦。針對複雜智能體任務的上下文擴展瓶頸,M3自主研發稀疏注意力架構(MSA),實現更精確的KV分塊與算子層優化,計算速度較同類開源方案提升4倍以上,在1M上下文下每Token計算量顯著降低。
寒武紀宣佈完成對DeepSeek-V4全系列模型的“Day0”適配,基於vLLM推理框架,覆蓋285B參數Flash版及1.6T參數Pro版。通過自研Torch-MLU-Ops算子庫優化稀疏注意力與壓縮結構,確保模型發佈當日即可在寒武紀硬件上穩定運行,相關代碼已開源至GitHub。
螞蟻百靈團隊開源兩款高效思考模型Ring-flash-linear-2.0和Ring-mini-linear-2.0,專爲提升深度推理效率設計。同時發佈FP8融合算子和線性Attention推理融合算子,支持“大參數、低激活”的高效推理與超長上下文。通過架構優化與高性能算子協同,實現顯著性能提升。
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$6
$24
$4
$16
Baidu
128
Bytedance
$1.2
$3.6
4
$2
Moonshot