字节跳动Seed发布原生音视频全双工大模型SeedRealtime,采用统一架构融合音频、视频与文本,实现“边看边听边说”的实时交互,推进全模态自然交互。同时,国产大模型如DeepSeek等集中迭代升级,市场分析认为国产算力逻辑持续加强。
阿里发布新一代大模型Qwen3.8-Max,在编程、办公、长程任务及多模态智能体等能力上全面升级,可端到端自主执行复杂任务,极少人工干预即可完成从目标理解到成果交付。模型权重下周开源,重点强化智能体在真实场景下的执行与交付能力。
美团7月27日否认LongCat团队基础模型负责人裴鹏离职传闻,称消息不实。裴鹏毕业于北大,2023年加入美团,先后任基座模型预训练负责人及LongCat基础模型负责人,全面主导大语言模型、多模态模型与Agent智能体的研发,并牵头万亿参数大模型LongCat-2.0的研发与落地。
据7月24日报道,腾讯于7月23日宣布将混元多模态模型部门与大语言模型部门合并,组建基础模型部,由首席AI科学家姚顺雨统率。此举旨在提升研发与协同效率,全力冲刺全模态模型的智能上限。整合早有伏笔,去年12月姚顺雨已接管大语言模型团队,如今双边归一,意味着腾讯集中资源推动多模态与语言深度融合,加速构建新一代统一基础模型,向全模态智能更高峰迈进。
一款支持多模态功能的全功能大语言模型安卓应用。
首个全面评估多模态大型语言模型在视频分析中的性能基准。
全模态大模型,拥有更强的认知、理解、创作能力
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$6
$24
$2
$20
Baidu
128
cpatonn
Qwen3-VL是通义大模型系列最强大的视觉语言模型,在文本理解、视觉感知、空间理解、视频处理等方面全面升级,提供卓越的多模态能力。
inclusionAI
Ming-flash-omni 预览版是基于 Ling-Flash-2.0 稀疏专家混合(MoE)架构构建的多模态大模型,总参数达100B,每个token仅激活6B参数。该模型在Ming-Omni基础上进行了全面升级,在多模态理解和生成方面有显著提升,特别是在语音识别、图像生成和分割编辑方面表现突出。
Open-Bee
Bee-8B是一个先进的全开源多模态大语言模型,专注于数据质量,旨在缩小与专有模型的性能差距。通过使用高质量的Honey-Data-15M语料库和先进的数据处理管道HoneyPipe,在复杂推理等方面展现了卓越性能。
nvidia
OmniVinci是NVIDIA开发的全模态理解大语言模型,具备视觉、文本、音频处理和语音交互能力,支持多模态推理和理解。
Emova-ollm
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,能够生成具有情感控制的文本和语音响应。
jobs-git
SkyReels V2是全球首个采用扩散强制框架的无限长度电影生成模型,融合多模态大语言模型、多阶段预训练、强化学习与扩散强制技术实现全面优化。
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,具备情感语音对话能力。
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,无需依赖外部模型即可实现多模态理解和生成。
MBZUAI
GLaMM-全功能版是一个多模态大模型,整合了GLaMM的全部能力,包括场景对话生成、指代表达分割、区域级图像描述、图像级描述生成和视觉问答等功能。
declare-lab
Mustango是一个专为可控音乐生成而设计的全新多模态大语言模型,融合了潜在扩散模型(LDM)、Flan-T5和音乐特征来实现高质量的文本到音乐生成。