阿里通义千问团队近日开源全新多模态MoE模型Qwen3.8-Flash-Next,作为Qwen4架构早期预览版。该模型采用高度稀疏的混合专家设计,总参数1250亿,另搭配510亿参数N-gram嵌入表和40亿参数多token预测模块,以极低计算开销实现越级性能表现。
谷歌近日为开源模型Gemma4推出多Token预测(MTP)起草器,利用推测解码架构将推理速度提升最高3倍,同时保持输出质量和逻辑能力。该模型发布后下载量迅速增长,成为全球最受关注的开源模型之一。
京东开源大模型JoyAI-LLM-Flash,参数48亿,激活参数3亿,经20万亿文本预训练,具备前沿知识理解、推理和编程能力。采用FiberPO优化框架,结合纤维丛理论与强化学习,使用Muon优化器和稠密多Token预测技术,解决了模型规模扩展的不稳定问题。
春节期间国产大模型集中发布,智谱AI推出旗舰模型GLM-5,定位全能型对话、编程与智能体模型,采用稀疏注意力与多Token预测技术,参数量达745B,约为前代两倍。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
Alibaba
$1
$10
256
$2
$20
-
$3.9
$15.2
64
Bytedance
$0.8
$0.15
$1.5
128
Baidu
32
$8
$1.6
$4
Tencent
24