由 Google Gemini AI 模型驅動的機器人,能力現已大幅提升。隨著 Gemini Robotics 2 的首次亮相,這些實體機器人現在能完成更複雜的任務、持續分析不斷變化的環境,並與其他機器人協作。這歸功於三款新的子模型,其中一款已於今日起開放開發者使用。

多年來,機器人奔跑、跳舞和後空翻的影片一直是網路上的熱門內容,但這些機器人都是被程式設計來執行這些非常狹窄的任務。Gemini Robotics 的目標是創造一種通用型機器人,能夠完成人類所能做的任何事情。Google DeepMind 的科學家有時稱之為「實體 AGI」。

本質上,你告訴機器人要做什麼,它就會去執行。透過 2.0 版本的發布,Google 表示其機器人 AI 能夠控制整個仿人機器人,即使是擁有複雜仿人手的機器,也能展現出更高的靈巧度。

這始於 Gemini Robotics ER 2,這是一個升級版的「具身推理」(embodied reasoning)模型,DeepMind 聲稱它比之前的 1.6 版本有了顯著的飛躍。它已整合到 Gemini Live API 中,讓開發者有機會體驗這項據稱的進步。

Gemini Robotics ER 2 是一種視覺語言模型(VLM),旨在理解指令及其周圍的世界。這次的主要升級在於 ER 2 能夠處理來自機器人攝影機的即時影像串流,讓系統在機器人從一個步驟緩慢移動到下一個步驟時追蹤進度。Google 指出,Gemini Robotics ER 2 能夠以近 60% 的準確度分類影片影格的完整性。

這雖然還遠非完美,但已比 1.6 版本或競爭對手 AI 模型在視覺理解方面的表現要好得多。

在影片串流中找到特定時刻也是正確完成任務的關鍵。當你要求機器人倒一杯咖啡時,你肯定希望它知道何時停止倒水。ER 2 顯然在這方面做得更好,能以近 90% 的準確度識別關鍵時刻。當機器人執行多步驟任務時,具身推理模型讓它們能夠即時理解失敗。然後系統可以再次嘗試該單一步驟,而不是從頭開始。例如,如果機器人試圖撿起的球滾走了,或者有人移動了容器,機器人可以重新調整其手部位置和動作。

新的具身推理版本也賦予了 Google DeepMind 升級後的機器人 AI 協作能力。影片演示展示了 Apptronik 的 Apollo 2 和較簡單的 Franka F3 Duo 在執行任務時能夠協同工作,而不會互相妨礙。儘管測試機器人仍無法與人類的速度或優雅相媲美,但影片演示包含了大量機器人實際運作的即時畫面,它們看起來確實比過去的測試中更不猶豫。

理解只是第一步——讓機器人在物理世界中移動是另一個模型的職責。在規劃好任務後,視覺語言模型會將任務交給一個升級版的視覺-語言-動作模型,簡稱為 Gemini Robotics 2。這個 AI 模型會根據指令生成機器人動作,就像其他生成式系統創造文字或圖像一樣。此外,還有一個低延遲的離線版本,稱為 Gemini Robotics On-Device 2。這些模型目前僅限於一小部分測試人員使用。

Google 表示,新的動作模型更加準確和高效。即使是較小的裝置端版本,也只需數小時的運動數據(約 200 個範例),就能適應新的機器人設計。

AI 幻覺的問題目前已眾所周知,但當 AI 擁有實體並與人類共享空間時,錯誤可能造成的潛在危害會大得多。在每次發布 Gemini Robotics 時,Google DeepMind 都強調他們認真對待這項風險。根據 DeepMind 的說法,Gemini Robotics 的每一層都包含「傳統的物理安全措施與強大的 AI 安全框架」。

隨著 Gemini Robotics 2 的發布,引入了一個名為 ASIMOV-Agentic 的新安全基準。這項測試會評估模型在各種安全因素上的表現。它能評估具身推理代理是否會拒絕來自 VLA 的不安全工具呼叫。它還可以判斷給定任務是否能安全完成,以及模型在不確定安全性時是否能呼叫人類協助。

Google DeepMind 指出,Gemini Robotics ER 2 是該團隊迄今為止最安全的模型,展現出強大的安全理解能力,並能在人類過於接近機器人時停止動作。Google 的新安全基準已完整發布於 Hugging Face 上。