Google DeepMind 表示,其 Gemini Robotics AI 模型的最新版本現在能夠「控制整個人形機器人」。根據週四的公告,雖然先前的模型主要專注於控制人形機器人的上半身,但 Gemini Robotics 2 現在支援從腳尖到指尖的「全身動作」。

這個新模型將使人形機器人能夠執行更廣泛的動作,例如走路、蹲下、伸展和操作物體。Google 分享的影片展示了 Apptronik 的 Apollo 2 機器人如何彎腰撿起灑水壺,以及從架子上找到並取下特定物品。

儘管 Google DeepMind 指出其機器人「在移動速度上仍有進步空間」,但它補充說,這次更新「是邁向完成需要全身協調的更複雜、現實世界任務所需技能的重要一步」。

此外,Gemini Robotics 2 支援更好的靈巧度,因為它現在可以控制更複雜的五指手。這使得機器人能夠執行諸如密封 Ziploc 袋、綁垃圾袋或旋下燈泡等任務。

Google DeepMind 也正在更新 Gemini Robotics ER (embodied reasoning) 模型,這是一個視覺語言模型,可幫助機器人分析周圍環境、處理指令並執行多步驟任務。Gemini Robotics ER 2 在長時間內完成任務方面表現更佳,並且「現在能理解任務何時開始和結束」。

Google DeepMind 表示,這次更新還允許不同類型的多個機器人協同工作並完成任務。其中一個影片展示了 Apollo 2 如何指示 Google 的雙臂機器人將工具放入垃圾桶,同時清理車庫。

該公司指出,Gemini Robotics ER 2 是其「迄今為止最安全的機器人模型」,因為它能「更好地偵測人類是否在附近,觸發安全工具呼叫,並在有人靠近時讓機器人安全停止」。

同時,Google DeepMind 也改進了其 Gemini Robotics On-Device Model,該模型可以在沒有網路連接的情況下於機器人本地運行。這個模型現在可以更快地適應新的實體,包括那些「形狀、感測器和自由度截然不同」的實體。