手術機器人正迅速從遠端操作邁向具備更強大視覺、語言與動作策略的階段。然而,這些系統的評估與訓練仍充滿挑戰。實體機器人平台操作成本高昂,實驗重現速度慢,且失敗可能損壞儀器或生物材料。傳統模擬器提供更安全的替代方案,但手術場景極難建模,因為可變形組織、精細的器械互動、鏡面反射表面、縫線、針頭、煙霧和遮蔽物等因素都至關重要。

世界基礎模型提供了一條不同的路徑。它們無需手動建立每個物體和物理互動,而是直接從同步的影片和機器人運動學中學習視覺動態。NVIDIA 的 Cosmos-H-Surgical-Simulator 展示了這種方法,它能從初始場景和一系列機器人動作生成未來的手術影片,並在 Open-H-Embodiment 生態系統中實現比實體操作更快的評估和合成資料生成。

今天,我們將介紹下一步:Cosmos-H-Dreams,這是一個即時、動作條件式的生成式手術機器人模擬器。Cosmos-H-Dreams 將 Cosmos-H-Surgical-Simulator 的能力蒸餾成一個因果、少步驟的學生模型,並透過 NVIDIA 的加速串流推理函式庫 FlashDreams 提供服務。

它可在單一 NVIDIA RTX PRO 6000 GPU 上運行,提供一個可供人類或學習策略進行閉環控制的互動式環境。

Cosmos-H-Surgical-Simulator 是一個動作條件式的世界基礎模型,它基於 NVIDIA Cosmos-Predict2.5-2B 構建,並在 Open-H-Embodiment 資料集上進行後續訓練。給定一個手術情境畫面和未來的機器人軌跡,它能生成影片,顯示這些動作可能產生的視覺結果。

這使其適用於離線策略評估和合成資料生成,無需在實體機器人上重複執行動作,即可將記錄或策略生成的軌跡發送給模型,生成相應的模擬結果,並進行檢查或評分。

Cosmos-H-Dreams 將模型帶入即時運作的範疇。我們從 Cosmos-H-Surgical-Simulator 學到的多實體手術先驗知識出發,將模型專門用於 da Vinci Research Kit (dVRK) 桌面縫合任務,並將其蒸餾成一個因果學生模型,以自迴歸方式生成場景。發布的模型接收初始 RGB 畫面和機器人運動學的即時串流,然後在繼續下一個動作區塊之前,產生下一批畫面。

我們也與 CMR Surgical 和 Cambridge Consultants 合作,將 Cosmos-H-Dreams 整合到 Versius 手術控制器中,使其能在 Versius 平台上實現即時操作,展現了其多功能性。

主要挑戰在於在降低生成成本的同時,保留有用的手術動態。Cosmos-H-Dreams 採用了專為長時間、自迴歸模擬設計的師生訓練流程。

雙向教師模型從 Cosmos-H-Surgical-Simulator Open-H 檢查點開始,該檢查點使用統一的 44 維動作表示。對於發布的 dVRK 桌面模型,雙臂 dVRK 的動作內容,包括相對末端執行器平移、旋轉和夾持器狀態,都被映射到這個通用表示中。

教師模型隨後在 JHU dVRK 桌面混合資料集上進行微調,其中包含成功的示範,以及針頭掉落、投擲失誤和打結失敗等故障和分佈外情境。這些失敗案例很重要,因為旨在評估策略的模擬器必須重現不良動作的後果,而不僅僅是理想的示範。

為了提高長時間模擬的穩定性,訓練過程逐步增加教師模型的時間範圍。我們從 12 幀的時間範圍開始訓練,並逐步增加到 72 幀。在每次時間範圍增加時,我們都會使用預訓練權重初始化已預熱的模型。

教師模型的去噪軌跡會首先被預先計算並快取。一個因果學生模型會從教師模型初始化,並訓練其模仿這些快取的軌跡。這個預熱階段教會學生模型在開始從自己生成的歷史中學習之前,如何使用因果注意力機制和串流鍵/值快取進行操作。

自迴歸模型面臨一個常見問題:在訓練期間,它們可能會看到乾淨、真實的上下文,但在部署時,它們必須以自己不完美的輸出為條件。因此,微小的錯誤可能會隨著時間累積。

Cosmos-H-Dreams 透過自強制蒸餾來解決這種不匹配。在訓練期間,學生模型會使用自己生成的上下文向前推進。然後,來自凍結教師模型的分佈匹配監督會引導這些自生成的模擬結果趨向真實的手術影片。這使得學生模型為在互動式推理中將遇到的相同條件做好準備。

由此產生的模型支援少步驟擴散,每個潛在幀只需兩個去噪步驟,而非完整教師模型所使用的多步驟過程。它將教師模型的手術先驗知識與串流所需的因果結構結合在一起。

模型蒸餾只是實現即時性的其中一環。Cosmos-H-Dreams 透過 FlashDreams 提供服務,這是一個用於自迴歸世界模型和影片模型的加速推理函式庫。

FlashDreams 透過多種互補的優化措施,例如串流 KV 快取、CUDA Graph 捕捉或模型編譯,將蒸餾後的學生模型轉變為低延遲的串流系統。

這些技術共同將經過微調的蒸餾手術世界模型,從標準 Cosmos-H-Surgical-Simulator 推理的每秒約十幀速度,提升到單一 NVIDIA RTX PRO 6000 上每秒約 160 幀的互動式操作速度。

Cosmos-H-Dreams 還提供了人機介面,將生成轉化為互動。瀏覽器客戶端可以透過 WebRTC 發送鍵盤指令並接收生成的畫面。Meta Quest 客戶端則能將追蹤到的控制器動作映射為機器人動作,並透過 WebXR 顯示合成場景。同一個模型也可以連接到學習型手術策略,在閉環中交換生成的觀察結果和預測動作。

儘管 Cosmos-H-Dreams 包含用於桌面縫合的預訓練檢查點,但該系統設計為可擴展以適應您特定的實體。為了使用您自己的資料集訓練即時學生模型,我們在逐步指南中提供了完整的教師模型微調和自強制蒸餾方法。

Cosmos-H-Dreams 為手術模擬開闢了新領域:從真實機器人資料中學習的環境,其反應速度足以供人或策略在其中操作。

下一步是評估視覺品質以外的更多方面。一個有用的手術模擬器必須正確回應動作,在長時間模擬中保持器械和場景結構,並支持可轉移到實體機器人的結論。這促使我們建立一系列新的閉環基準測試,包括工具尖端到達和姿態準確性、夾持器循環保真度、閒置穩定性、反事實動作多樣性、長時程漂移,以及模擬與實際策略結果之間的一致性。

即時世界模型也能成為手術策略開發的積極夥伴。它們可以按需生成罕見的故障情境,為強化學習或模仿學習提供可擴展的環境,並實現新策略的快速評估,而無需將每個實驗都綁定在稀缺的機器人硬體上。

展望未來,即時模擬將實現一系列下游應用,例如延遲感知遠端手術(世界模型有助於維持更穩定的顯示)、互動式手術排練、程序規劃和術中決策支援。Cosmos-H-Dreams 是一個研究與開發平台,而非診斷系統、術中影像的替代品,或實體手術機器人的控制器。然而,它為安全探索這些可能性奠定了基礎。

隨著模型保真度、時間穩定性和硬體效率的不斷提高,即時生成式模擬有助於將外科醫生教育、合成資料生成、策略訓練和策略評估整合在一個共享的實體 AI 環境中。

探索 Cosmos-H-Dreams 背後的模型、資料和運行時:

Cosmos-H-Dreams 將動作條件式的手術世界建模帶入即時循環,為人類和策略提供一個新的環境,用於練習、探索、生成資料並評估接下來會發生什麼。