德國 AI 公司 Black Forest Labs (BFL) 推出了 Flux 3,這是一個能同時從圖像、影片和音訊中學習的多模態基礎模型。在 BFL 的早期測試中,它在影片生成方面擊敗了多個競爭對手。
BFL 將 Flux 3 描述為邁向「真實世界視覺智慧」的一步,他們將其定義為能夠「感知、預測並在實體和數位環境中行動」的模型。該公司也是更廣泛地建構所謂「世界模型」的推動者之一。
BFL 認為,沒有單一模態能完整捕捉現實。圖像顯示空間結構,影片捕捉其隨時間的變化,而音訊則能揭示機械事件與其產生聲音之間的連結。同時訓練這三種模態,能讓它們相互填補空白,為模型提供比單獨訓練每種模態更多的資訊。
Flux 3 首次為長達 20 秒的影片添加了原生音訊。它支援文字轉影片、圖像轉影片、影片轉影片、基於關鍵影格的轉場、多語言對話,以及用於更長多鏡頭序列的代理驅動連結。BFL 表示,該模型特別擅長處理人類面部表情,並將聲音與物理事件匹配。
在對 720p 解析度的 10 秒影片片段進行的早期評估中,BFL 報告稱,在 93% 的比較中,Flux 3 優於 Luma Ray 3.2;在 77% 的比較中優於 Runway Gen-4.5;在 69% 的比較中優於 Grok Imagine Video。
面對更強大的競爭對手時,差距則有所縮小。Flux 3 在 60% 的時間裡優於 Kling v3 Pro,59% 優於 Happy Horse v1,57% 優於 Happy Horse 1.1,以及 52% 優於 Seedance 2.0 和 Gemini Omni Flash。
BFL 表示這些結果是初步的,目前尚無獨立測試可用。如果能與 Seedance(已進入好萊塢)和 Gemini Omni Flash 等領先系統匹敵,將使 Flux 3 躋身頂級影片模型之列。
BFL 也預計 Flux 3 將改進圖像生成,特別是在複雜提示詞和多語言準確文字渲染方面。該公司計劃在未來幾週內推出 Flux 3 Image 的搶先體驗版。
BFL 表示,該模型還能根據其對世界的理解來預測行動。該公司與 Mimic Robotics 合作開發了 Flux-mimic,這是一個影片動作模型,目前正在 Audi 的生產任務中進行測試。
Flux 3 基於 BFL 的 Self-Flow 方法,該方法旨在教導一個模型同時生成和理解內容。一個多模態轉換器使用專用組件將圖像、影片和音訊轉換為共享的內部表示,然後再將其轉換回輸出。
一個用於行動的組件為機器人應用提供了基礎。BFL 表示,這種統一的學習過程在生成品質和模型對物理世界的理解方面,都比以前標準的流匹配方法提供了更好的結果。
BFL 計劃分階段推出所有功能,並設有搶先體驗階段以收集回饋和進行安全測試。Flux 3 Video 已可用,Flux 3 Image 預計將在未來幾週內推出。行動預測最初將透過選定的合作夥伴提供。
BFL 還計劃以「Flux 3 Dev」的名義,開放多模態骨幹的權重。從長遠來看,該公司正在開發下一代模型,目標是將感知、行動和語言預測結合在單一模型中。
