AIBase
首页
AI 资讯
AI 产品库
GEO 平台
MCP 服务
模型算力广场
VIP会员
ZH

AI资讯

查看更多

通义千问发布Qwen3.8-Flash-Next,提前剧透Qwen4架构

阿里通义千问团队近日开源全新多模态MoE模型Qwen3.8-Flash-Next,作为Qwen4架构早期预览版。该模型采用高度稀疏的混合专家设计,总参数1250亿,另搭配510亿参数N-gram嵌入表和40亿参数多token预测模块,以极低计算开销实现越级性能表现。

14.9k 5 小时前
通义千问发布Qwen3.8-Flash-Next,提前剧透Qwen4架构

​DeepSeek 推出 Engram 模块:为稀疏大模型植入“条件记忆轴”,效率大幅提升

DeepSeek团队推出Engram模块,为稀疏大语言模型引入“条件记忆轴”,旨在解决传统Transformer处理重复知识时计算资源浪费的问题。该模块作为混合专家模型的补充,将N-gram嵌入技术融入模型,提升处理重复模式的效率。

18.3k 5 天前
​DeepSeek 推出 Engram 模块:为稀疏大模型植入“条件记忆轴”,效率大幅提升

模型

查看更多

Qwen-Image

Alibaba

Qwen-Image

$2

输入tokens/百万

-

输出tokens/百万

-

上下文长度

Hunyuan-Embedding

Tencent

Hunyuan-Embedding

$0.7

输入tokens/百万

$0.7

输出tokens/百万

-

上下文长度

AIBase
智启未来,您的人工智能解决方案智库
English简体中文繁體中文にほんご
友情链接:
AI Newsletters AI ToolsMCP ServersAI NewsAI MarketingLLM LeaderboardAI Ranking
© 2026AIBase
商务合作网站地图