腾讯微信视觉团队开源多模态嵌入模型WeMM-Embedding,支持文本、图像等多模态输入,提供2B、4B、9B三个版本以适应不同部署需求,采用统一技术架构与训练策略,旨在为AI开发者提供支撑,推动垂直领域创新应用。
Black Forest Labs发布FLUX3多模态基础模型,采用统一架构联合学习图像、视频和音频。基于Self-Flow自监督流匹配框架,在FLUX系列基础上扩展多模态生成与理解。支持文生视频、图生视频,单次生成最长20秒视频并原生输出同步音频,性能全面超越前代。
黑森林实验室发布多模态模型Flux3,基于Self-Flow架构并集成图像、视频、音频、动作编解码器,实现物理与数字世界的统一理解与生成。其亮点是首次支持原生音频生成,一次输出20秒音视频同步片段,能力涵盖文本、图像、视频转视频等。
德国黑森林实验室发布多模态基础模型Flux3,基于Self-Flow架构及专用图像、视频、音频、动作编解码器,实现物理与数字环境的统一理解与生成。性能碾压Luma、Runway,首次原生支持音频生成,可一次性输出20秒音视频同步片段,并具备文本/图像/视频转视频、关键帧转场和多语言对话等功能。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
-
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
$8
$240
52
ByteDance-Seed
SAIL是一个专为视觉与语言设计的单一Transformer模型,作为统一的多模态大语言模型(MLLM),它在单一架构中无缝集成了原始像素编码和语言解码功能。
Athagi
Janus-Pro 是一种新颖的自回归框架,统一了多模态理解和生成。它通过解耦视觉编码路径,使用单一的统一 Transformer 架构处理多模态任务。
deepseek-ai
Janus-Pro 是一种新颖的自回归框架,统一了多模态理解与生成能力。通过解耦视觉编码路径,使用单一 Transformer 架构处理多模态任务。
Janus-Pro 是一种创新的自回归框架,统一了多模态理解与生成功能。通过解耦视觉编码路径,采用单一Transformer架构处理,解决了视觉编码器在理解与生成角色间的冲突。