Perplexity公司宣布,其智能体系统Perplexity Computer将于今夏升级,引入“混合智能体推理”模式。该模式能根据任务类型和数据敏感度,在本地紧凑模型与云端前沿模型间智能切换,平衡隐私保护与计算性能,提升复杂任务执行效率。
人工智能初创公司Liquid AI发布并开源了端侧大模型LFM2.5-8B-A1B,专为消费级硬件设计,优化工具调用和指令遵循能力。该模型采用稀疏混合专家架构,总参数量8.3B,但每个Token仅激活1.5B参数,在降低计算成本的同时提升推理性能,可流畅运行于手机和笔记本电脑上。
阿里巴巴千问团队开源稀疏混合专家模型Qwen3.6-35B-A3B,总参数量350亿,激活参数仅30亿。该模型以低计算成本在多项编程基准测试中超越Qwen3.5-27B,并显著领先前代Qwen3.5-35B-A3B,实现轻量级模型在智能体编程领域的关键突破。
DeepSeek团队推出Engram模块,为稀疏大语言模型引入“条件记忆轴”,旨在解决传统Transformer处理重复知识时计算资源浪费的问题。该模块作为混合专家模型的补充,将N-gram嵌入技术融入模型,提升处理重复模式的效率。
Openai
$7.7
Input tokens/M
$30.8
Output tokens/M
200
Context Length
-
Anthropic
$7
$35
$21
$105
Alibaba
$4
$16
1k
$2
256
Tencent
$1
32
Deepseek
$12
128
$0.75
$1.75
$14
400
64
$0.63
$3.15
131
Chatglm
$8
$0.8
moonshotai
Kimi Linear是一种高效混合线性注意力架构,在短上下文、长上下文和强化学习场景中均优于传统全注意力方法。它通过Kimi Delta Attention (KDA)机制优化注意力计算,显著提升性能和硬件效率,特别擅长处理长达100万令牌的长上下文任务。
radicalnumerics
RND1是一个实验性的扩散语言模型,拥有300亿参数,采用稀疏专家混合架构。该模型从预训练的自回归基础模型转换而来,支持基于扩散的文本生成,每个标记仅激活30亿参数,在计算效率和模型容量之间取得平衡。
Intel
基于Qwen3-Next-80B-A3B-Thinking模型,通过英特尔auto-round工具生成的混合int4量化模型。采用混合精度量化技术,非专家层回退到8位,在保证精度的同时显著降低计算资源需求,支持思维内容解析功能。
cpatonn
Qwen3-Next-80B-A3B-Instruct-AWQ-4bit是基于Qwen3-Next-80B-A3B-Instruct模型进行4位AWQ量化的高效版本。该模型采用混合注意力机制和高稀疏专家混合架构,支持长达262K tokens的上下文长度,在保持高性能的同时大幅降低计算资源需求。
cof139
这是一个基于GPT-OSS架构的6B参数混合专家模型,经过剪枝优化仅保留7个专家,采用Q4_K_M量化格式的GGUF版本。该模型专注于高效推理和文本生成任务,通过剪枝和量化技术实现了更好的计算效率。
NikolayKozloff
这是一个基于GPT架构的6B参数规模的专业化混合专家模型,经过剪枝优化仅保留7个专家,并转换为GGUF格式的量化版本。模型采用Q8_0量化,在保持性能的同时显著减少内存占用和计算需求。
mlx-community
该模型是基于Qwen3-235B-A22B-Thinking-2507转换的MLX格式版本,采用3-5位混合量化技术,在保持高性能的同时显著减少模型大小和计算需求,适用于苹果芯片设备的高效推理。
unsloth
Qwen3-235B-A22B-Thinking-2507是一款强大的混合专家语言模型,在知识推理、数学计算、科学分析、编程等多个领域表现出色。该模型具有235B总参数和22B激活参数,支持256K长上下文理解,在开源思考模型中达到了最先进的性能水平。
LFM2-350M是由Liquid AI开发的第二代混合模型,专为边缘AI和设备端部署设计。该模型在质量、速度和内存效率方面树立了新标准,具有3.5亿参数,支持多种语言,适用于边缘计算场景。
tiiuae
Falcon-H1是由阿联酋技术创新研究所开发的新型大语言模型家族,采用结合Transformer注意力机制和状态空间模型(SSMs)的混合架构,具备出色的长上下文记忆能力和计算效率。该系列模型提供从0.5B到34B参数的多种配置,在推理、数学、多语言任务等方面表现卓越。
inclusionAI
玲珑线性预览版是由InclusionAI开源发布的混合线性稀疏大语言模型,总参数量17.1B,激活参数量3.0B。该模型基于混合线性注意力机制实现长文本推理,在推理过程中具备近线性计算复杂度与近恒定空间复杂度。
nvidia
首个结合Mamba与Transformer优势的计算机视觉混合模型,通过重构Mamba公式增强视觉特征建模效率,在Mamba架构最后几层引入自注意力模块提升长程空间依赖建模能力。
MambaVision是首个结合曼巴(Mamba)与Transformer优势的计算机视觉混合模型,通过重新设计曼巴公式增强视觉特征建模能力,并在曼巴架构最后几层加入自注意力模块提升长距离空间依赖建模能力。
首个结合曼巴(Mamba)与Transformer优势的混合计算机视觉模型,通过重构曼巴公式增强视觉特征建模能力
首个融合曼巴(Mamba)与Transformer优势的计算机视觉混合模型,通过重构曼巴公式增强视觉特征建模效率,并在曼巴架构末端引入自注意力模块提升长程空间依赖建模能力。
MambaVision是首个融合Mamba与Transformer优势的计算机视觉混合模型,通过重构Mamba公式增强视觉特征建模能力,并在Mamba架构最后几层加入自注意力模块提升长程空间依赖建模能力。
首个结合Mamba与Transformer优势的计算机视觉混合模型,通过重新设计Mamba公式增强视觉特征建模能力
首个结合曼巴(Mamba)与Transformer优势的计算机视觉混合模型,通过重构曼巴公式增强视觉特征建模效率,并在曼巴架构末端加入自注意力模块提升长程空间依赖建模能力。
首个结合Mamba与Transformer优势的计算机视觉混合模型,通过重新设计Mamba公式增强视觉特征建模能力,并在Mamba架构中融入自注意力模块提升长程空间依赖建模。
MambaVision是首个结合Mamba和Transformer优势的计算机视觉混合模型,通过重新设计Mamba公式并集成ViT模块,显著提升了长距离空间依赖关系的建模能力。
GNNEPCSAFT MCP Server是基于模型上下文协议(MCP)的实现,用于GNNePCSAFT工具的热力学计算。它通过图神经网络(GNN)预测ePC-SAFT参数,支持纯物质和混合物的密度、蒸汽压等热力学性质计算,并能自动从PubChem获取分子数据。