字节跳动Seed发布原生音视频全双工大模型SeedRealtime,采用统一架构融合音频、视频与文本,实现“边看边听边说”的实时交互,推进全模态自然交互。同时,国产大模型如DeepSeek等集中迭代升级,市场分析认为国产算力逻辑持续加强。
8月3日,MiniMax开源全模态视频模型H3,该模型融合文本、图像、视频、音频上下文,泛化强。生成4-15秒视频,24fps、32kHz立体声,支持多种宽高比。
据7月24日报道,腾讯于7月23日宣布将混元多模态模型部门与大语言模型部门合并,组建基础模型部,由首席AI科学家姚顺雨统率。此举旨在提升研发与协同效率,全力冲刺全模态模型的智能上限。整合早有伏笔,去年12月姚顺雨已接管大语言模型团队,如今双边归一,意味着腾讯集中资源推动多模态与语言深度融合,加速构建新一代统一基础模型,向全模态智能更高峰迈进。
网易有道发布“子曰”大模型4.0,全面迈入全模态时代,实现文本、图片、音频高效融合交互。该版本以全量开源为核心,向开发者社区开放核心技术,旨在降低AI落地成本与门槛。核心突破包括全模态融合交互、深层重构等维度,推动AI生态发展。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
jobs-git
SkyReels V2是全球首个采用扩散强制框架的无限长度电影生成模型,融合多模态大语言模型、多阶段预训练、强化学习与扩散强制技术实现全面优化。
declare-lab
Mustango是一个专为可控音乐生成而设计的全新多模态大语言模型,融合了潜在扩散模型(LDM)、Flan-T5和音乐特征来实现高质量的文本到音乐生成。