Google DeepMind 推出一款名為 GenCeption 的新模型,它以預訓練的影片生成模型為基礎,執行經典的電腦視覺任務。該模型在深度估計、分割和 3D 姿態估計方面達到了最先進的效能,且僅需極少的訓練資料。

語言模型在學習預測下一個單詞的過程中,幾乎是作為副產品而成為多功能的處理系統。這項任務似乎要求模型在訓練期間吸收語法、世界知識和上下文關係,這也是大型語言模型(LLM)湧現能力的普遍解釋。

電腦視覺領域目前仍缺乏類似的訓練方法。該領域主要由專門模型主導,例如用於分割的 "Segment Anything" 和用於深度估計的 "Depth Anything",每個模型都採用其獨特的架構。

GenCeption 能夠根據文字提示詞,從同一段影片中生成深度圖、表面法線、分割遮罩和姿態估計。儘管主要在合成資料上進行訓練,它仍能處理真實世界的影片素材,甚至適用於訓練期間未曾遇到的物件類別。

在一篇新論文中,DeepMind 研究人員指出,大型文字轉影片模型可以彌補這個差距。生成逼真的影片需要理解場景的空間幾何、物體的移動方式以及基本物理原理。這些模型在訓練時也使用文字描述,將語言與視覺內容連結起來。由於資料標註成本相對較低,它們可以在龐大的資料集上進行訓練。

GenCeption 將影片生成器重新用於視覺任務。

GenCeption 以阿里巴巴開源的 Wan2.1 影片模型為基礎。其主要改進在於更簡化的架構。擴散模型通常透過許多小步驟從雜訊中生成影片,而 GenCeption 則能透過一次前向傳播(forward pass)產生預測結果,使其速度足以應付實際的電腦視覺任務。

GenCeption 調整了文字轉影片擴散模型,以一次前向傳播解決密集和稀疏的感知任務。一個文字提示詞會告知模型要執行哪項任務。

研究人員採用一種簡單的方法,讓一個模型處理多項任務。GenCeption 將所有輸出表示為標準的三通道 RGB 圖像,無論結果是深度圖、表面法線圖還是分割遮罩。它還將攝影機的移動轉換為圖像表示。

文字提示詞會告知模型要執行哪項任務,這與給聊天機器人的指令非常相似。研究團隊還為不產生圖像的任務(例如 3D 關鍵點預測)添加了可訓練模組。

訓練過程對所有任務使用單一的損失函數。研究人員並未針對每項任務改變模型架構,而是處理訓練資料以符合各任務的特定要求。

僅用少量資料便能匹敵專用模型。

大部分訓練資料來自一個僅包含 7,500 段影片的合成資料集。研究團隊將 800 個人體數位模型與 200 個來自動作捕捉資料集的動作序列結合,然後在 Blender 中以不同的背景和攝影機角度進行渲染。真實影片僅用於語言引導的分割任務。

GenCeption 在多項任務上接近最先進的成果,同時使用的訓練資料量僅為既有模型的七分之一到五百分之一。

根據這項研究,儘管 GenCeption 對每項任務都使用單一架構,它在許多基準測試中仍能達到或超越最先進的結果。其深度估計與 DepthAnything 3 等專用模型相當。在表面法線估計方面,GenCeption 超越了 NormalCrafter 和 Lotus-2。

它在 3D 姿態識別方面也優於 Genmo 和 TRAM。在複雜的語言引導分割任務上,它與 Meta 的 SAM 3 結合 Gemini 3.5 Flash 的表現相當。

像 D4RT 和 VGGT Omega 這樣的模型是在數百萬段影片上進行訓練的。GenCeption 僅使用 7 到 500 倍少的資料就能達到相似的結果。在相同條件下測試時,基於影片生成的預訓練也優於 V-JEPA 和 VideoMAE V2 等方法。作者將這些成果歸因於生成任務本身,而非單純的資料量。他們認為影片生成有助於模型學習空間和運動的有用表示。

GenCeption 為比其合成訓練資料更複雜的真實世界場景,生成了詳細的深度和表面法線估計。

超越訓練資料的強大泛化能力,但仍有明顯限制。

GenCeption 幾乎完全在一次只顯示一個人的合成影片上進行訓練,但它仍能處理畫面中有多個人的真實影片,以及動物和人形機器人等不相關的類別。根據研究,某些輸出結果甚至比用於訓練的 Blender 渲染圖包含更多細節。這些結果能夠保留貓的鬍鬚和單根頭髮的邊緣。

GenCeption 僅在人物合成影片上進行訓練,但其感知能力卻能轉移到訓練期間未曾遇到的動物類別。

跨所有任務的聯合訓練確實會損害 3D 關鍵點估計的效能。研究人員懷疑,這項任務所需的額外組件會干擾基礎模型在預訓練期間學到的機制。

他們的結論是,應盡可能減少對原始模型架構的修改。處理速度也需要改進。較小的模型處理一段 81 幀的影片約需六秒,而參數達 140 億的較大模型則需約十秒。

影片生成器可能包含有用的世界模型,即使它們不理解物理。

作者們駁斥了影片生成器僅是娛樂工具的觀點。他們認為這些模型已經包含一種通用的「世界模型」,可以支持電腦視覺的基礎模型。這樣的系統在圖像處理中,可以扮演與大型語言模型在文字處理中相同的角色。

這種觀點是否成立仍有爭議。一個國際研究團隊最近透過 OpenWorldLib 提出了一個統一的定義,並明確排除了文字轉影片模型,因為它們缺乏來自真實世界的反饋。

前 Meta 首席 AI 科學家 Yann LeCun 更進一步,認為生成式影片模型是死路一條。Meta 的 V-JEPA 2 遵循他所倡導的替代方案,即預測抽象概念而非像素。清華大學的一項基準測試也指出像素預測的局限性。Sora 2、Seedance 2.0 和 Veo 3.1 即使輸出看起來令人信服,也屢次未能通過基本物理和邏輯測試。

GenCeption 將影片生成用於更狹窄的目的。研究人員並非要求 Wan2.1 預測世界的行為方式,而是利用它來提取特定任務(如深度估計和分割)的特徵,在這些任務中,這些學習到的特徵可以超越專用系統。Google DeepMind 也正透過 Genie 3 探索不同的方法,該模型旨在為訓練 AI 代理建立互動式 3D 環境。