据7月24日报道,腾讯于7月23日宣布将混元多模态模型部门与大语言模型部门合并,组建基础模型部,由首席AI科学家姚顺雨统率。此举旨在提升研发与协同效率,全力冲刺全模态模型的智能上限。整合早有伏笔,去年12月姚顺雨已接管大语言模型团队,如今双边归一,意味着腾讯集中资源推动多模态与语言深度融合,加速构建新一代统一基础模型,向全模态智能更高峰迈进。
Soul在WAIC2026上发布AI硬件B Soul,展示实时多模态交互与情绪感知应用。CTO陶明表示,公司已从社交App进化为聚焦情绪感知、交互技术和AI模型融合的生态型公司,坚持自研交互大模型路线,区别于通用大模型。
大模型与算力快速突破,但企业AI落地价值未达预期,业界焦点正从模型转向数据。OceanBase发布湖库一体AI数据库,融合数据湖海量存储、数据库事务分析及多模态处理,构建强一致数据底座,为AI Agent提供高效支撑。
阿里发布多模态大模型Qwen3.7-Plus,在文本能力基础上增强视觉-语言功能,统一为智能体基座。该模型融合GUI与CLI交互,实现从原型到软件工程的端到端自动化,并在Vision Arena榜单中表现强劲。
ByteDance推出的新一代多模态4K AI视频与图像生成与编辑平台。
VibePaper 是一款将图像、视频与文本融合在无限画布上的多模态 AI 创意协同工具。
先进的多模态理解模型,融合视觉与语言能力。
多模态大型语言模型,融合视觉与语言理解。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
-
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
$6
$24
Baidu
128
$8
$240
52
Gjm1234
Wan2.2是基础视频模型的重大升级版本,专注于将有效MoE架构、高效训练策略和多模态融合等创新技术融入视频扩散模型,为视频生成领域带来更强大、更高效的解决方案。
AbstractPhil
MM-VAE Lyra是一个专门用于文本嵌入转换的多模态变分自编码器,采用几何融合技术。它结合了CLIP-L和T5-base模型,能够有效处理文本嵌入的编码和解码任务,为多模态数据处理提供创新解决方案。
Qwen
Qwen3-VL-2B-Instruct-GGUF是通义千问系列的多模态视觉语言模型的GGUF量化版本,具备20亿参数,支持图像理解和文本生成的无缝融合,可在CPU、GPU等设备上高效运行。
Hugguf
Qwen3-VL-30B-A3B-Instruct是基于Qwen3-VL-30B模型的多模态视觉语言模型,支持图像和文本的联合理解与生成任务。该模型采用先进的视觉语言融合架构,能够处理复杂的多模态推理任务。
NexaAI
Qwen3-VL-4B-Instruct是阿里云Qwen团队推出的40亿参数指令调优多模态大语言模型,专为高通NPU优化,融合强大的视觉语言理解能力与对话微调功能,适用于聊天推理、文档分析和视觉对话等实际应用场景。
chs20
FuseLIP是一种创新的多模态嵌入模型,它通过一个单一的Transformer模型,使用扩展的词汇表同时处理文本和图像离散令牌,实现了模态间的早期深度融合。该方法解决了传统对比式语言-图像预训练模型无法原生编码多模态输入的问题,在视觉问答和文本引导的图像检索等任务上表现出色。
jobs-git
SkyReels V2是全球首个采用扩散强制框架的无限长度电影生成模型,融合多模态大语言模型、多阶段预训练、强化学习与扩散强制技术实现全面优化。
shadowlilac
Llama 4 Scout是Meta推出的170亿参数混合专家架构(MoE)多模态模型,支持12种语言和图像理解,采用topk=4专家动态融合机制。
aimagelab
ReT是一种支持多模态查询与文档检索的创新方法,通过融合视觉与文本骨干网络多层级表征实现细粒度检索。
Robeeeeeeeeeee
Phi-4-multimodal-instruct是一款轻量级开源多模态基础模型,融合了Phi-3.5和4.0模型的语言、视觉及语音研究与数据集。支持文本、图像和音频输入,生成文本输出,并具备128K标记的上下文长度。
microsoft
Phi-4-multimodal-instruct是一款轻量级开源多模态基础模型,融合了Phi-3.5和4.0模型的语言、视觉及语音研究数据。支持文本、图像和音频输入,生成文本输出,并具备128K token的上下文长度。
TucanoBR
ViTucano是首个原生葡萄牙语预训练的视觉助手,融合视觉理解与语言能力,适用于多模态任务如图像描述、视觉问答等。
NVEagle
Eagle是一个以视觉为中心的高分辨率多模态大语言模型家族,通过融合多种视觉编码器和不同输入分辨率,增强了多模态大语言模型的感知能力。
facebook
Meta变色龙是FAIR研发的混合模态早期融合基础模型,支持图像和文本的多模态处理。
zongzhuofan
MoVA-8B是一个开源的多模态大语言模型,采用从粗到细的机制,自适应地路由和融合特定任务的视觉专家模块,可用于多模态模型和聊天机器人的研究。
vikhyatk
16亿参数的多模态模型,融合SigLIP与Phi-1.5技术架构,支持图像理解和问答任务
PsiPi
基于Mistral-7B的视觉语言模型,融合SigLIP-400M视觉编码器和函数调用能力,支持多模态交互
declare-lab
Mustango是一个专为可控音乐生成而设计的全新多模态大语言模型,融合了潜在扩散模型(LDM)、Flan-T5和音乐特征来实现高质量的文本到音乐生成。
photonmz
BabyDoctor是一个多模态大语言模型,融合了CLiP和LLaMA 2的能力,能够理解和生成文本,同时理解图像。该模型经过微调,专门用于解读X光、超声波、核磁共振和CT扫描等放射学图像。