阶跃全量开放旗舰基座 Step5Preview,定位真实世界 Agentic 任务主力模型。它针对能力、效率、成本三角难题,采用稀疏 MoE 架构外推帕累托前沿。模型总参数达600B,每次激活更少参数以平衡性能与成本。
阶跃今日全量开放新一代旗舰基座Step5Preview,定位真实世界Agentic任务主力模型。它采用稀疏MoE架构,总参数600B,旨在破解能力、效率、成本三者相互拉扯的“帕累托题”:不是让取舍消失,而是以新设计把帕累托前沿整体外推,成为面向智能体任务的高效主力模型。
国产大模型 Step 5 Preview 正式全量开放,由阶跃星辰推出。其采用稀疏 MoE 架构,总参数 600B、仅激活 27B,性能对标 2.8 万亿参数 K3,性价比高;支持 100 万 Token 上下文和图文输入。API 与 Studio 已可用,10 月 15 日将发布完整权重,长任务自主运行表现突出。
阶跃星辰发布旗舰基座模型Step5Preview,面向AI编程、软件工程、专业知识及金融等场景,提升Agentic任务表现并平衡智能、成本与效率。该模型在AA综合智能指数中跻身全球开源模型前三,单任务成本仅为Claude Opus5的1/8,采用稀疏MoE架构,计划10月15日正式开源。
Alibaba
$4
Input tokens/M
$16
Output tokens/M
1k
Context Length
$2
$20
-
256
Moonshot
Bytedance
$0.8
128
Xai
$1.4
$10.5
Tencent
$1
32
Deepseek
$12
Openai
$0.4
$0.75
64
24
Chatglm
$8
$0.7
$1.95
16
jackcloudman
Qwen3-Next-80B-A3B-Thinking 是通义千问团队推出的新一代思考型大语言模型,采用创新的混合注意力机制和高稀疏MoE架构,在保持高效推理的同时具备强大的复杂推理能力,原生支持262K上下文长度。
inclusionAI
Ming-flash-omni 预览版是基于 Ling-Flash-2.0 稀疏专家混合(MoE)架构构建的多模态大模型,总参数达100B,每个token仅激活6B参数。该模型在Ming-Omni基础上进行了全面升级,在多模态理解和生成方面有显著提升,特别是在语音识别、图像生成和分割编辑方面表现突出。
cpatonn
Qwen3-Next-80B-A3B-Instruct是通义千问团队开发的高效稀疏混合专家模型,总参数量80B,激活参数量仅3B。该模型采用创新的混合注意力机制和极低激活率的MoE架构,在保持强大性能的同时大幅提升推理效率,原生支持262K上下文长度并可扩展至1M令牌。
Qwen3-Next-80B-A3B-Thinking-AWQ-4bit是基于Qwen3-Next-80B-A3B-Thinking模型通过AWQ量化技术生成的4位版本,显著提升了模型推理效率。该模型采用混合注意力机制和高稀疏MoE架构,在复杂推理任务中表现出色,支持长达262K标记的上下文长度。
LanguageBind
MoE-LLaVA是一种基于专家混合架构的大型视觉语言模型,通过稀疏激活参数实现高效的多模态学习
MoE-LLaVA是一种基于专家混合架构的大规模视觉语言模型,通过稀疏激活参数实现高效的多模态学习。
hywu
Camelidae-8x7B是基于参数高效稀疏构建技术的专家混合体模型,通过QLoRA和Adapter技术将密集模型转换为MoE架构,在代码和数学等多个领域表现出色。
google
基于掩码语言建模任务训练的混合专家(MoE)模型,参数规模达1.6万亿,采用类似T5的架构但前馈层替换为稀疏MLP层
Switch Transformers是基于专家混合(Mixture of Experts, MoE)架构的掩码语言模型,在T5架构基础上改进,用稀疏MLP层替代前馈层,包含32个专家网络。该模型在训练效率和微调任务表现上优于T5,支持自然语言处理相关应用。
Switch Transformers是基于混合专家(MoE)架构的语言模型,在掩码语言建模任务上训练。该模型架构与T5相似,但将前馈层替换为包含16个专家MLP的稀疏MLP层,在保持性能的同时实现了更快的训练速度和更好的可扩展性。
Switch Transformers是基于混合专家(MoE)架构的语言模型,专为掩码语言建模任务训练。该模型架构与T5类似,但将前馈层替换为包含8个专家MLP的稀疏MLP层,在微调任务上表现优于T5,同时实现更快的训练速度。