Gemini Robotics ER 2 代表著機器人技術的一大躍進,透過影像理解、任務編排和多機器人協作,讓機器人在實體世界中變得更加實用。

為了讓機器人能在日常環境中協助人類,僅有精確的空間推理是不夠的。機器人還必須快速思考,使其決策和推理速度能與實體世界的即時速度同步。這就是我們今天推出 Gemini Robotics ER 2 的原因,它是我們功能最強大的機器人「具身推理」(embodied reasoning)模型。

您可以將 Gemini Robotics ER 2 視為機器人的高階大腦,它讓機器人能夠與人類對話、理解實體世界並規劃多步驟任務。隨後,它會將馬達執行交由任何底層的視覺-語言-動作(VLA)模型處理。Gemini Robotics ER 2 還能原生呼叫 Google Search 等工具來查找資訊,或執行任何其他使用者定義的功能。

Gemini Robotics ER 2 的設計讓機器人能夠在執行動作的同時「思考」下一步。

Gemini Robotics ER 2 相較於 Gemini Robotics ER 1.6 有顯著升級。透過觀看連續的影像串流,機器人現在可以追蹤自己的進度,在出現問題時進行調整,並確切知道何時進入下一步。我們還引入了多機器人協作功能,使機器人能夠在共享空間中協同工作,完成單一機器人無法獨立完成的複雜工作流程。

Gemini Robotics ER 2 現已透過 Gemini API、Google AI Studio 向開發者公開提供,並在 Gemini Enterprise Agent Platform 上進行私人預覽。為了幫助您入門,我們分享了如何配置模型並提示它來執行更有用的實體 AI 任務的範例。

實體世界中的大多數任務都很複雜,需要多個步驟才能完成。Gemini Robotics ER 2 是一個實體代理(physical agent),它為機器人編排步驟,使其能夠自我修正並泛化到更多新穎的情境。為了建立代理設定,開發者可以將低階控制介面(例如視覺-語言-動作(VLA)模型或導航 API)聲明為工具,並將多模態影像、音訊或文字直接串流到模型中。

Gemini Robotics ER 2 改進了這種工具編排工作流程。我們可以在模擬環境中使用機器人、使用真實世界的機器人控制,甚至與遠端控制機器人的人類配對來評估其性能。

在機器人學中,高階推理取決於執行速度。Gemini Robotics ER 2 整合到 Gemini Live API 中,使用針對延遲敏感任務優化的雙向串流端點。結果是流暢的編排:Gemini Robotics ER 2 指揮動作模型和機器人 API 完成多步驟任務,而不會出現令人不適的「停下來思考」的暫停。

為了說明這一點,我們與合作夥伴 Boston Dynamics 的 Spot 機器人建立了一個演示。我們使用 Gemini Robotics ER 2 來編排 Spot API,例如導航和機械臂移動,創建一個可以為您取物的互動式機器人。

程式碼已在 Github 上提供,並附有其他範例。機器人學中最困難的挑戰之一是知道任務何時完成。Gemini Robotics ER 2 在影像理解和進度追蹤方面帶來了質的飛躍,可以驗證複雜任務(例如擰緊燈泡或綁垃圾袋)是否按照規範完成,然後再切換到下一個任務。在這次更新中,我們在任務進度理解的兩個基礎能力上取得了進展:進度分類和關鍵時刻尋找。

進度分類是指機器人追蹤任務完成進度的能力。在我們的評估中,我們將影像串流中的每一幀分為五個進度等級(0-20%、20-40%、40-60%、60-80%、80-100%)。透過量化任務進度,Gemini Robotics ER 2 為機器人提供了即時情境感知,並允許它們即時調整動作或重試失敗的步驟,而無需重新啟動整個工作流程。

關鍵時刻尋找衡量模型識別關鍵事件發生確切影像幀的能力(例如,何時停止將咖啡倒入杯中)。Gemini Robotics ER 2 在關鍵時刻尋找方面的性能取得了顯著提升,使機器人能夠精確地在任務之間切換、驗證成功並建議修正。

對於關鍵時刻尋找任務,Gemini Robotics ER 2 實現了 91.3% 的準確度,平均絕對距離為 0.96 秒。它與更大模型類別的性能非常接近,但以更低的計算成本和 4 倍的執行速度提供了這種精確度——亞秒級的延遲是現實世界中安全操作實體機器人實際所需的。

沒有單一機器人適合所有任務——輪式漫遊車在室內表現出色,而人形機器人可能在崎嶇地形上表現出色。Gemini Robotics ER 2 實現了多機器人協作,允許不同的機器透過共享的語義理解進行通信,以交接並完成複雜任務。請參閱 Gemini Robotics ER 2 如何讓 Apptronik 的 Apollo 2 和 Franka F3 Duo 在此協作。

Gemini Robotics ER 2 提升了我們的核心空間推理能力,這透過三個基準進行衡量:成功/失敗檢測:現在在原始影像串流上運行,而不是靜態快照,以捕捉執行中的失敗,例如溢出、滑動或錯位。通用儀器讀取:擴展到圓形錶盤和視窗之外,包括數位顯示器、線性刻度、尺子和液體溫度計。我們測試了 10 種不同類型的儀器。增強型空間 VQA:透過 Gemini 在多模態理解方面的進步,改進了視覺問答。

Gemini Robotics ER 2 是我們最安全的模型,在安全指令遵循和人類接近度基準上取得了顯著進展,這些基準評估模型在推理任務期間如何遵守物理限制以及檢測人類的空間感知能力。我們發現,當有人靠近時,Gemini Robotics ER 2 成功地停止了人形機器人,並在區域清除後才自主恢復工作。

為了提高實體代理的安全性,我們引入了一個基準,評估基礎模型作為安全 VLA 編排器的能力,透過測試其執行安全約束、監控環境、評估物理可行性並尋求人類澄清的能力。有關詳細資訊,請參閱我們的安全技術報告。

展望未來,我們的計畫是推動這些模型處理更複雜的任務,以加速實用機器人的開發並支持機器人社群。