Black Forest Labs發佈FLUX3多模態基礎模型,採用統一架構聯合學習圖像、視頻和音頻。基於Self-Flow自監督流匹配框架,在FLUX系列基礎上擴展多模態生成與理解。支持文生視頻、圖生視頻,單次生成最長20秒視頻並原生輸出同步音頻,性能全面超越前代。
黑森林實驗室發佈多模態模型Flux3,基於Self-Flow架構並集成圖像、視頻、音頻、動作編解碼器,實現物理與數字世界的統一理解與生成。其亮點是首次支持原生音頻生成,一次輸出20秒音視頻同步片段,能力涵蓋文本、圖像、視頻轉視頻等。
德國黑森林實驗室發佈多模態基礎模型Flux3,基於Self-Flow架構及專用圖像、視頻、音頻、動作編解碼器,實現物理與數字環境的統一理解與生成。性能碾壓Luma、Runway,首次原生支持音頻生成,可一次性輸出20秒音視頻同步片段,並具備文本/圖像/視頻轉視頻、關鍵幀轉場和多語言對話等功能。
德國初創黑森林實驗室發佈多模態基礎模型Flux3,基於Self-Flow架構,集成圖像、視頻、音頻與動作編解碼器,統一理解並生成物理與數字環境。作爲首款原生支持音頻生成的模型,Flux3可一次性輸出20秒音視頻同步片段,並支持文本、圖像、視頻轉視頻及關鍵幀驅動等多樣化生成任務,顯著推動生成式視頻技術發展。