阿里通義千問團隊近日開源全新多模態MoE模型Qwen3.8-Flash-Next,作爲Qwen4架構早期預覽版。該模型採用高度稀疏的混合專家設計,總參數1250億,另搭配510億參數N-gram嵌入表和40億參數多token預測模塊,以極低計算開銷實現越級性能表現。
DeepSeek團隊推出Engram模塊,爲稀疏大語言模型引入“條件記憶軸”,旨在解決傳統Transformer處理重複知識時計算資源浪費的問題。該模塊作爲混合專家模型的補充,將N-gram嵌入技術融入模型,提升處理重複模式的效率。
Alibaba
$2
輸入tokens/百萬
-
輸出tokens/百萬
上下文長度
Tencent
$0.7