第32届全国大豆科研生产研讨会上,王晓波团队发布大豆垂直大模型“丰菽”2.0。该版本实现多模态数据深度融合,系统整合大豆专业资料,构建更完善的结构化数据体系,为大豆产业数字化转型按下“加速键”。
字节跳动Seed发布原生音视频全双工大模型SeedRealtime,采用统一架构融合音频、视频与文本,实现“边看边听边说”的实时交互,推进全模态自然交互。同时,国产大模型如DeepSeek等集中迭代升级,市场分析认为国产算力逻辑持续加强。
8月3日,MiniMax开源全模态视频模型H3,该模型融合文本、图像、视频、音频上下文,泛化强。生成4-15秒视频,24fps、32kHz立体声,支持多种宽高比。
据7月24日报道,腾讯于7月23日宣布将混元多模态模型部门与大语言模型部门合并,组建基础模型部,由首席AI科学家姚顺雨统率。此举旨在提升研发与协同效率,全力冲刺全模态模型的智能上限。整合早有伏笔,去年12月姚顺雨已接管大语言模型团队,如今双边归一,意味着腾讯集中资源推动多模态与语言深度融合,加速构建新一代统一基础模型,向全模态智能更高峰迈进。
Openai
$2.8
输入tokens/百万
$11.2
输出tokens/百万
1k
上下文长度
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
$6
$24
Baidu
128
jobs-git
SkyReels V2是全球首个采用扩散强制框架的无限长度电影生成模型,融合多模态大语言模型、多阶段预训练、强化学习与扩散强制技术实现全面优化。
declare-lab
Mustango是一个专为可控音乐生成而设计的全新多模态大语言模型,融合了潜在扩散模型(LDM)、Flan-T5和音乐特征来实现高质量的文本到音乐生成。