阿里通义千问团队近日开源全新多模态MoE模型Qwen3.8-Flash-Next,作为Qwen4架构早期预览版。该模型采用高度稀疏的混合专家设计,总参数1250亿,另搭配510亿参数N-gram嵌入表和40亿参数多token预测模块,以极低计算开销实现越级性能表现。
阿里千问发布多模态MoE模型Qwen3.8-Flash,并开源下一代架构Qwen3.8-Flash-Next(Qwen4雏形)。模型总参数125B,搭载51B N-gram Embedding,每token仅激活6B;原生支持26万token,可扩展至100万。训练成本为前代1/9,API定价输入每百万Tokens 1元、输出3元。
前OpenAI CTO穆拉蒂创立的思维机器实验室发布首款从零训练多模态模型Inkling,号称美国最强开源。采用MoE(975B总参/41B激活),上下文100万token,预训练45万亿token覆盖图文音视频,已开源权重。团队豪华,但推理编程不及中国开源劲旅。
NVIDIA推出统一音频-文本大模型Audex,基于纯文本MoE架构,采用单一Transformer,解决多模态模型音频增强导致文本逻辑下降的难题,实现高效音频理解与文本能力的平衡。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$2
$20
$6
$24
Gjm1234
Wan2.2是基础视频模型的重大升级版本,专注于将有效MoE架构、高效训练策略和多模态融合等创新技术融入视频扩散模型,为视频生成领域带来更强大、更高效的解决方案。
NyxKrage
Moondream 3 Preview HF是基于HuggingFace Transformers架构规范对Moondream 3 (Preview)模型的重新实现,使其能够与Hugging Face生态系统完全兼容。这是一个多模态视觉语言模型,采用专家混合(MoE)文本主干,约90亿参数,20亿活跃参数。
unsloth
Qwen3-VL是迄今为止Qwen系列中最强大的视觉语言模型,在文本理解与生成、视觉感知与推理、上下文长度、空间和视频动态理解以及智能体交互能力等方面都进行了全面升级。该模型采用混合专家(MoE)架构,提供卓越的多模态处理能力。
inclusionAI
Ming-flash-omni 预览版是基于 Ling-Flash-2.0 稀疏专家混合(MoE)架构构建的多模态大模型,总参数达100B,每个token仅激活6B参数。该模型在Ming-Omni基础上进行了全面升级,在多模态理解和生成方面有显著提升,特别是在语音识别、图像生成和分割编辑方面表现突出。
Mungert
ERNIE-4.5-21B-A3B-PT是基于MoE架构的先进文本生成模型,具有210亿参数和高效的多模态处理能力。
ERNIE-4.5-300B-A47B 是一款文本 MoE 后训练模型,拥有 3000 亿的总参数,每个标记有 470 亿的激活参数。该模型具备多模态异构 MoE 预训练、高效扩展基础设施和特定模态后训练等先进技术,能在文本理解与生成、图像理解及跨模态推理等任务中表现出色。
gabriellarson
ERNIE-4.5-300B-A47B 是一款基于 MoE 架构的多模态预训练模型,具备强大的文本理解和生成能力,支持视觉-语言联合推理。
RedHatAI
Llama 4 Maverick是Meta推出的170亿参数混合专家架构(MoE)多模态模型,支持12种语言和图像理解,适用于商业与研究用途。
Llama-4-Scout是Meta推出的Llama 4系列模型之一,采用混合专家(MoE)架构,是原生多模态AI模型,支持文本和图像输入,在多语言文本理解和视觉任务方面表现出色。该模型具有17B参数,16个专家,专为商业和研究用途设计。
shadowlilac
Llama 4 Scout是Meta推出的170亿参数混合专家架构(MoE)多模态模型,支持12种语言和图像理解,采用topk=4专家动态融合机制。
bnb-community
Llama 4系列是Meta开发的多模态AI模型,支持文本与图像交互,采用混合专家架构(MoE),在文本和图像理解领域具有领先性能。
Undi95
Llama 4 Maverick 是 Meta 发布的多模态 AI 模型,支持文本与图像理解,采用混合专家架构(MoE),在多语言文本和代码生成任务中表现优异。
meta-llama
Llama 4 Maverick是Meta推出的170亿参数多模态AI模型,采用混合专家架构(MoE),支持多语言文本和图像理解,具备128个专家模块。
Llama 4系列是Meta开发的多模态AI模型,支持文本与图像交互,采用混合专家架构(MoE),在文本和图像理解方面具有行业领先性能。
LanguageBind
MoE-LLaVA是一种基于专家混合架构的大型视觉语言模型,通过稀疏激活参数实现高效的多模态学习
MoE-LLaVA是一种基于专家混合架构的大规模视觉语言模型,通过稀疏激活参数实现高效的多模态学习。