Black Forest Labs发布FLUX3多模态基础模型,采用统一架构联合学习图像、视频和音频。基于Self-Flow自监督流匹配框架,在FLUX系列基础上扩展多模态生成与理解。支持文生视频、图生视频,单次生成最长20秒视频并原生输出同步音频,性能全面超越前代。
黑森林实验室发布多模态模型Flux3,基于Self-Flow架构并集成图像、视频、音频、动作编解码器,实现物理与数字世界的统一理解与生成。其亮点是首次支持原生音频生成,一次输出20秒音视频同步片段,能力涵盖文本、图像、视频转视频等。
德国黑森林实验室发布多模态基础模型Flux3,基于Self-Flow架构及专用图像、视频、音频、动作编解码器,实现物理与数字环境的统一理解与生成。性能碾压Luma、Runway,首次原生支持音频生成,可一次性输出20秒音视频同步片段,并具备文本/图像/视频转视频、关键帧转场和多语言对话等功能。
德国初创黑森林实验室发布多模态基础模型Flux3,基于Self-Flow架构,集成图像、视频、音频与动作编解码器,统一理解并生成物理与数字环境。作为首款原生支持音频生成的模型,Flux3可一次性输出20秒音视频同步片段,并支持文本、图像、视频转视频及关键帧驱动等多样化生成任务,显著推动生成式视频技术发展。