阿里通义千问团队近日开源全新多模态MoE模型Qwen3.8-Flash-Next,作为Qwen4架构早期预览版。该模型采用高度稀疏的混合专家设计,总参数1250亿,另搭配510亿参数N-gram嵌入表和40亿参数多token预测模块,以极低计算开销实现越级性能表现。
DeepSeek团队推出Engram模块,为稀疏大语言模型引入“条件记忆轴”,旨在解决传统Transformer处理重复知识时计算资源浪费的问题。该模块作为混合专家模型的补充,将N-gram嵌入技术融入模型,提升处理重复模式的效率。
Alibaba
$2
Input tokens/M
-
Output tokens/M
Context Length
Tencent
$0.7