AIBase
Home
AI NEWS
AI Tools
GEO & AEO
MCP
AI Models
Join Now
EN

AI News

View More

通义千问发布Qwen3.8-Flash-Next,提前剧透Qwen4架构

阿里通义千问团队近日开源全新多模态MoE模型Qwen3.8-Flash-Next,作为Qwen4架构早期预览版。该模型采用高度稀疏的混合专家设计,总参数1250亿,另搭配510亿参数N-gram嵌入表和40亿参数多token预测模块,以极低计算开销实现越级性能表现。

14.9k 1 hours ago
通义千问发布Qwen3.8-Flash-Next,提前剧透Qwen4架构

​DeepSeek 推出 Engram 模块:为稀疏大模型植入“条件记忆轴”,效率大幅提升

DeepSeek团队推出Engram模块,为稀疏大语言模型引入“条件记忆轴”,旨在解决传统Transformer处理重复知识时计算资源浪费的问题。该模块作为混合专家模型的补充,将N-gram嵌入技术融入模型,提升处理重复模式的效率。

18.3k 4 days ago
​DeepSeek 推出 Engram 模块:为稀疏大模型植入“条件记忆轴”,效率大幅提升

Models

View More

Qwen-Image

Alibaba

Qwen-Image

$2

Input tokens/M

-

Output tokens/M

-

Context Length

Hunyuan-Embedding

Tencent

Hunyuan-Embedding

$0.7

Input tokens/M

$0.7

Output tokens/M

-

Context Length

AIBase
Empowering the future, your artificial intelligence solution think tank
English简体中文繁體中文にほんご
FirendLinks:
AI Newsletters AI ToolsMCP ServersAI NewsAI MarketingLLM LeaderboardAI Ranking
© 2026AIBase
Business CooperationSite Map