Kimi公司发布论文《Attention Residuals: Rethinking depth-wise aggregation》,提出注意力残差新方法,优化深度聚合机制。特斯拉CEO马斯克在社交媒体点赞,称其为“亮眼工作”。Kimi官方幽默回应,引发全球AI社区热议。
国产大模型GLM-5在2026年初实现重大突破,开源后在全球权威榜单Artificial Analysis中位列第四,评分与Claude Opus4.5相当。其核心创新包括:参数规模扩展至744B,预训练数据达28.5T;集成DeepSeek稀疏注意力机制,在保持长文本理解能力的同时降低部署成本;在编程与工程领域表现突出。
阿里巴巴新一代基座模型Qwen3.5即将发布,已在HuggingFace提交代码合并申请。该模型采用全新混合注意力机制,可能原生支持视觉理解。预计将开源至少2B密集模型及35B-A3B的MoE模型,有望在春节期间正式开源。
商汤科技与南洋理工大学联合推出原生多模态架构NEO,并开源2B与9B模型。该架构摒弃传统三段式设计,从注意力机制到语义映射全面重构,实现“像素到Token”的连续映射,数据需求仅为行业平均的十分之一。
Alibaba
$1
Input tokens/M
$10
Output tokens/M
256
Context Length
$2
$20
-
$3.9
$15.2
64
Bytedance
$0.8
$0.15
$1.5
128
Baidu
32
$8
$1.6
$4
Openai
$8.75
$70
400
Tencent
24
$0.3
$3
$9
Google
16
moonshotai
Kimi Linear是一种混合线性注意力架构,在各种场景下包括短、长上下文以及强化学习扩展机制中,均优于传统的全注意力方法。它能有效解决传统注意力机制在长上下文任务中效率低下的问题,为自然语言处理等领域带来更高效的解决方案。
Kimi Linear是一种高效混合线性注意力架构,在短上下文、长上下文和强化学习场景中均优于传统全注意力方法。它通过Kimi Delta Attention (KDA)机制优化注意力计算,显著提升性能和硬件效率,特别擅长处理长达100万令牌的长上下文任务。
FlameF0X
i3-80M是一种创新的混合架构语言模型,结合了卷积/循环层与全注意力层的优势。该模型采用RWKV风格的时间混合与Mamba状态空间动态,在早期层实现高效序列处理,在深层使用标准多头注意力机制进行复杂模式识别。
facebook
Mask2Former是基于Transformer的统一图像分割模型,支持实例分割、语义分割和全景分割任务,采用掩码注意力机制提升性能
google
LongT5是基于T5架构的文本到文本转换模型,采用瞬态全局注意力机制高效处理长序列输入
ccdv
基于CamemBERT-base调整的长序列处理模型,采用局部+稀疏+全局注意力机制(LSG),高效处理长文本
基于LEGAL-BERT的小型版本,采用局部+稀疏+全局注意力机制(LSG)高效处理长序列
LSG模型是基于BART-large改进的长序列处理模型,采用局部+稀疏+全局注意力机制,高效处理长文本任务