數十年來,我們一直夢想著機器人能無縫融入我們的世界並提供協助。如今,這個願景向前邁進了一大步。

大多數機器人都是預先編程或遠端操作,僅能執行狹窄、重複的任務序列。它們缺乏真正自主學習或適應不可預測環境的能力。此外,將習得的技能從一個機器人身體轉移到另一個仍然極其困難。為了大規模解決最困難的問題,各種形狀和尺寸的機器人需要 AI 模型賦予它們思考、行動和智慧互動的能力,以安全地完成任務。

我們曾展示 Gemini 的多模態理解如何透過 Gemini Robotics 驅動現實世界的行動。今天,我們推出 Gemini Robotics 2,這是為下一代真正適應性機器人提供動力的智慧層。這項重大進展在它邁出第一個實際步伐時,解鎖了智慧全身控制、進階靈巧性以及多機器人協作。

Gemini Robotics 2 使機器人能夠透過每個動作進行推理,解鎖了廣泛的任務。例如,它可以讓一個人形機器人行走、蹲下、伸展和操作物體來清理雜亂的房間。它甚至可以與其他機器人合作,更快地完成工作。

這種深層智慧還可以在設備上本地運行,同時在短短幾個小時內無縫適應全新的機器人身體。

我們透過三個高效能模型實現了這一點,它們共同賦予機器人前所未有的能力。這些模型包括 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,各自專注於不同的智慧層面。

Gemini Robotics 2 是我們最先進的視覺-語言-動作(VLA)模型,它將視覺和語言輸入轉換為馬達控制,使機器人能夠採取行動。這個模型能夠控制完整的人形機器人,從腳到指尖,以及其他雙臂機器人。它還為雙手和夾爪帶來了新的靈巧操作水平。

Gemini Robotics ER 2 是我們最強大的具身推理(ER)模型。它是一個視覺語言模型(VLM),作為我們的代理,使機器人能夠與人類溝通,理解物理世界並規劃持續數分鐘的多步驟任務。我們還引入了機器人團隊協作的能力。

Gemini Robotics On-Device 2 是我們最高效的視覺-語言-動作(VLA)模型,經過優化可在機器人設備上本地運行。這個模型現在只需幾個小時的數據,就能快速適應全新的機器人實體。

Gemini Robotics ER 2,我們的推理模型,現已在 Google AI Studio 上提供,並在 Gemini Enterprise Agent Platform 上進行私人預覽。我們的 VLA 和 On-Device 模型則開放給早期合作夥伴。您可以在我們的開發者部落格上閱讀如何將這些模型應用於您的硬體。

世界是為人類動作而建造的;它要求我們在狹窄、雜亂的空間中伸手、彎腰和保持平衡。雖然我們之前的模型控制人形機器人的上半身來完成桌面任務,但 Gemini Robotics 2 將實體 AI 擴展到全身動作。

我們的模型首次能夠控制整個人形機器人,將意圖轉化為智慧的全身控制。例如,當控制 Apptronik 的 Apollo 2 人形機器人時,我們可以要求它「把灑水壺放到下層架子的綠色垃圾桶裡」。Apollo 處理指令,走到桌邊,拿起灑水壺,走幾步到架子旁,然後精確地將其放置在目的地。儘管我們的機器人在移動速度方面還有待進步,但這是邁向完成需要全身協調的更複雜現實世界任務所需技能的重要一步。

為了在我們的家庭和工作場所真正有用,機器人需要精巧度。Gemini Robotics 2 解鎖了不同末端執行器(無論機器人使用手還是夾爪)的全新實體靈巧水平,使機器人比以往任何時候都更有用。

該模型現在可以控制 Apollo 2 機器人上的五指、22 自由度 SharpaWave 手,以完成打結或密封夾鏈袋等精細動作。它還可以在 Franka Duo 平台上操作標準的兩指平行夾爪,執行複雜的靈巧任務(例如緊密包裝)。我們將繼續提升精確度和速度,以達到人類水平的靈巧度。

大多數現實世界的任務都需要多個步驟,並持續一段時間。為了管理這種複雜性,我們的具身推理(ER)模型 Gemini Robotics ER 2 作為機器人的高階大腦,處理使用者指令並與人類溝通。它觀察房間,推理完成任務所需的步驟,與 VLA 協調執行動作,並追蹤進度直到任務完成。這種設置允許機器人執行複雜的多步驟任務,在步驟失敗時進行自我修正,並泛化到新的情境和目標。

在這次更新中,我們使機器人能夠更可靠地執行更長的任務序列,持續數分鐘並涉及數百個決策。Gemini Robotics ER 2 現在能理解任務何時開始和結束,並能精確指出關鍵事件發生的時刻,標誌著進度理解的質變。

此外,我們引入了多機器人協作。這使得不同類型的機器人能夠溝通並協同工作,解決單一機器人無法獨自完成的複雜工作流程。

許多機器人應用需要在沒有網路延遲或網路連接的情況下運行。Gemini Robotics On-Device 2 專為處理這些限制而設計——它是我們最高效的視覺-語言-動作(VLA)模型,經過優化可在機器人設備上本地運行。

這個模型天生具有多實體能力,並繼承了 Gemini Robotics 1.5 的先進「動作轉移」技術。我們現在只需幾個小時的適應時間,通常少於 200 個範例,就能適應新的雙臂機器人實體。即使是形狀、感測器和自由度截然不同的新實體,這也適用,如下所示,Dexmate、SO101 和 Trossen 平台執行了多樣化的任務。

安全是我們機器人研究的基礎。隨著機器人獲得更多實體能力,我們致力於確保端到端的安全和對齊。每次發布時,我們都採用多層次方法,將傳統的實體安全措施與強大的 AI 安全框架結合起來。

Gemini Robotics 2 特別提升了機器人在應對現實世界不確定性以及與人類協作方面的安全性。我們引入了 ASIMOV-Agentic,這是一個用於代理安全協調和不確定性解決的新基準。

它衡量具身推理代理拒絕 VLA 發出的不安全工具呼叫的能力。它還衡量代理預測任務是否可能,並在不確定時主動請求人類干預的能力。

此外,憑藉增強的具身推理能力,Gemini Robotics ER 2 是我們迄今為止在安全約束遵循和人類接近度基準方面最安全的機器人模型。它能更好地偵測到人類何時靠近,觸發安全工具呼叫,並在有人靠得太近時使機器人安全停止。這是協作安全標準中的一項關鍵要求。請閱讀我們的 Gemini Robotics 2:安全技術報告以了解更多詳情。

Gemini Robotics 2 標誌著邁向解決物理世界中通用人工智慧(AGI)道路上的重要里程碑。釋放機器人真正潛力需要超越單一任務自動化,轉向通用智慧。透過建立這種核心智慧,我們的目標是讓物理世界的 AI 能夠與人類協同工作,解決複雜的挑戰。