谷歌发布全新多模态模型Gemma4 12B,颠覆传统架构,取消独立编码器组件,实现消费级硬件上的高效本地部署与推理。这一突破显著降低多模态模型的计算复杂度,提升运行速度,标志着开源大模型生态进入新阶段。
谷歌发布Gemma 4 12B多模态模型,拥有12亿参数,创新取消传统编码器,可直接处理视觉与音频数据。该模型仅需16GB显存,可在高端笔记本本地运行,无需依赖云端资源。
Google发布全新开源大模型Gemma412B,采用“Unified”无编码器架构,突破端侧全模态AI。该模型无需传统视觉、音频外部编码器,直接输入文字、图像、音频、视频四种模态数据至同一Transformer主干网络处理,消除了外挂“翻译”模块带来的显存占用和高延迟问题。
英伟达发布开放式多模态模型Nemotron 3 Nano Omni,整合视频、音频、图像和文本推理能力,采用30B-A3B混合专家架构,集成视觉与音频编码器,无需额外感知模型,显著提升大规模推理效率,在复杂文本处理等领域表现出色。
Xai
$1.4
Input tokens/M
$10.5
Output tokens/M
256
Context Length
Openai
$8.75
$70
400
Anthropic
$105
$525
200
Chatglm
-
128
$2
$8
Google
$140
$280
32
1k
Baidu
$21
$14
$56
$0.14
$0.28
131
$1050
facebook
这是一个7亿参数的视觉Transformer模型,采用掩码自编码器自监督学习方法在20亿网络图像上训练,无需语言监督。
10亿参数的视觉Transformer模型,通过掩码自编码器自监督学习方法在20亿网络图像上训练,无需语言监督即可学习视觉表征。
这是一个参数量达3亿的视觉Transformer模型,通过掩码自编码器自监督学习在20亿网络图像上训练,无需语言监督。
eljandoubi
Donut是一种无需OCR的文档理解Transformer模型,通过视觉编码器直接处理文档图像
IvanTang
ENEL是一个探索无编码器架构在3D大型多模态模型中的潜力的模型。
recursionpharma
专为显微图像特征提取设计的通道无关图像编码模型CA-MAE,采用ViT-S/16编码器架构
McGill-NLP
LLM2Vec是一种将仅解码器架构的大语言模型转换为文本编码器的方案,通过启用双向注意力、掩码下一词预测和无监督对比学习实现转换。
LLM2Vec是一种将仅解码器的大语言模型转换为文本编码器的简单方法,通过启用双向注意力、掩码下一词预测和无监督对比学习实现。
PekingU
RT-DETR是首个实时端到端目标检测器,通过混合编码器和查询选择机制实现高效检测,无需NMS后处理。
RT-DETR是首个实时端到端目标检测Transformer模型,通过高效混合编码器和查询选择机制实现无NMS的高效检测
首个实时端到端目标检测器,通过混合编码器和查询选择机制实现无NMS的高效检测
LLM2Vec是将仅解码器架构的大语言模型转化为文本编码器的简易方案,通过启用双向注意力机制、掩码下一词预测和无监督对比学习实现。
LLM2Vec是将仅解码器架构的大语言模型转化为文本编码器的简易方案,通过启用双向注意力、掩码下一词预测和无监督对比学习实现。
lmsys
ToxicChat-T5-Large是一个开源的文本审核模型,通过在ToxicChat数据集上微调T5-large得到。该模型基于编码器-解码器的Transformer架构,能够准确识别输入文本是否含有毒性内容,生成'positive'表示有毒,'negative'表示无毒。
AdamCodd
基于Donut架构的收据文本提取专用模型,通过视觉编码器和文本解码器实现无需OCR的文档理解
基于Conformer架构的语音编码器,在450万小时无标注音频数据上预训练,支持143种以上语言
codedrainer
Donut是一种无需OCR的文档理解Transformer模型,结合视觉编码器和文本解码器处理文档图像
naver-clova-ix
Donut是一种无需OCR的文档理解Transformer模型,结合视觉编码器和文本解码器实现图像到文本的转换。
Donut是一种无需OCR的文档理解Transformer模型,结合视觉编码器和文本解码器处理文档图像。
Donut是一种无需OCR的文档理解Transformer模型,结合视觉编码器和文本解码器处理图像到文本的转换