Runway 公開了其在即時影片生成方面的研究進展。這項技術旨在讓使用者能像描述內容一樣即時串流生成影片,而非傳統的輸入提示詞後等待。
目前的影片模型運作方式是分階段進行。使用者輸入提示詞後,需要等待數秒或數分鐘才能獲得成品影片;如果結果不滿意,就必須重新開始。Runway 表示,使用者經常反映在生成和修改影片上花費最多時間,因此他們希望將首幀生成時間降至最低,並在使用者輸入提示詞時即時串流影片。
Runway 在三月首次透過 Runway Characters 討論了這種方法。該技術採用了該公司首個「通用世界模型」GWM-1,此模型於 2025 年 12 月推出。GWM-1 以 Gen-4.5 為基礎,能逐幀生成影片,並接受攝影機移動、機器人指令或音訊作為控制輸入。數週前,Runway 還展示了 Solaris,這是一個利用 Gen-4.5 逐幀生成使用者介面的系統,能回應點擊或語音輸入。
即時生成技術有望大幅減少等待時間並降低 GPU 成本。Runway 認為,即時生成能縮短創意與實現之間的距離。透過即時回饋,使用者將能把大部分時間用於主動引導影片內容,而非被動等待。
Runway 也指出這項技術能降低成本。更快的模型意味著更少的 GPU 使用時間,從而提高成本效益。Runway 表示,在特定品質水準下,每次輸出的成本決定了哪些應用在經濟上可行;即時生成將降低這個門檻,使過去不具經濟效益的應用變得可行。
Runway 的即時模型在生成每個新片段時,都會將所有先前生成的幀作為上下文參考。
微小的視覺錯誤可能累積成嚴重的扭曲。文字模型可以在句子中途自我修正,但影片模型是逐幀建立的,這使得微小的錯誤會隨著時間累積成嚴重的扭曲。Runway 將此描述為基於 LLM 方法的核心問題,並透過讓模型學習自己的輸出而非僅限於無錯誤輸入來解決,藉此教導模型修正自身的偏差而非放大錯誤。
與語言模型不同,影片模型無法修正先前的錯誤,因為每個新幀都是建立在有缺陷的舊幀之上。
新創公司 Decart 也為其即時模型 MirageLSD 採用了類似的方法,在訓練過程中刻意讓模型接觸有缺陷或扭曲的圖像。Google Deepmind 則表示,其世界模型 Genie 3 能以每秒 24 幀、720p 的速度,維持互動世界數分鐘的一致性。
Runway 指出,即時生成將運算負載從訓練階段轉移到使用階段。模型必須夠快地生成每一幀,以跟上播放速度,同時還要能在多個會話共享的硬體上運行。
世界模型將用於訓練機器人和自駕計程車。Runway 認為,互動式應用是 AI 生成媒體最大的長期應用場景。該公司表示,教育、遊戲和機器人技術都需要能像觀看者一樣快速反應的影片。評估機器人或自動駕駛車輛在現實世界中的行為,也需要能即時生成並立即回應邊緣案例的環境。Runway 先前推出了 GWM Robotics,這是 GWM-1 的一個變體,用於為機器人生成合成訓練數據。
Waymo 也採用了類似的方法,推出了 Waymo World Model,該模型基於 Genie 3 並針對道路交通進行了調整。它讓 Waymo 能夠模擬其車隊從未觀察過的情境,例如遇到大象、龍捲風或被洪水淹沒的住宅區。Waymo 表示,Waymo Driver 在虛擬世界中行駛了數十億英里後,才會在公共道路上遇到這些情境。
今年三月,Runway 還在晶片製造商 Nvidia 的 GTC 大會上展示了與 Nvidia 共同開發的即時模型研究預覽。該模型在 Vera Rubin 平台上運行,旨在於 100 毫秒內提供首幀畫面。Runway 尚未公布其上市時間表。
