Google 發表新一代機器人 AI 模型 Gemini Robotics ER 2,定位如同機器人的「高階大腦」。它能理解人類指令、規畫多步驟任務,並持續觀看即時影像,在機器人執行動作的同時判斷進度、發現錯誤及安排下一步。

相較前一代 Gemini Robotics ER 1.6,新模型加入連續影片理解、工具調度、任務進度追蹤與多機器人協作等能力。Google 1ul3g4目前已透過 Gemini API 與 Google AI Studio 向開發者開放,企業版則在 Gemini Enterprise Agent Platform 提供私人預覽。

Gemini Robotics ER 2 主要負責理解周遭環境、拆解任務及決定下一步,再將實際動作交給底層的視覺、語言與動作模型,也就是 VLA 模型執行。

開發者也能將導航、機械手臂控制介面及其他 API 設定成可呼叫工具,讓模型根據現場狀況自行安排使用順序,必要時也能呼叫 Google 搜尋或開發者自訂功能取得資訊。

Gemini Robotics ER 2 整合 Gemini Live API,可透過雙向串流持續接收影像、聲音與文字,讓機器人不必每完成一個動作就停下來重新思考。

Google 也與 Boston Dynamics 合作,將模型用於控制 Spot 四足機器人的導航與機械手臂。展示中,使用者只要下達「幫我拿爆米花」等指令,Spot 就能自行尋找並取回物品。

Gemini Robotics ER 2 不再只分析單張影像,而是能持續觀看攝影機畫面,判斷燈泡是否鎖緊、垃圾袋是否綁好,或咖啡是否已倒至適當容量。

Google 將影片中的畫面依任務完成程度分成五個階段。Gemini Robotics ER 2 在這項進度分類測試中的準確率為 57.4%,代表模型判斷每格畫面位於哪個進度區間的表現,並非整項任務的成功率。

在「關鍵時刻辨識」測試中,新模型的準確率為 91.3%,預測時間點與正確答案平均相差約 0.96 秒。Google 也表示,在相近測試條件下,其推論速度約為對照大型模型的 4 倍。

透過連續影片理解,Gemini Robotics ER 2 能在任務執行期間辨識液體灑出、物品滑落或位置偏移等情況,並調整動作或重新嘗試失敗步驟,不必從頭執行整套流程。

模型也強化儀器讀值能力,除了傳統指針與液位視窗,也能辨識數位顯示器、線性刻度、直尺及液體溫度計。

Google 表示,目前已針對十種不同類型的儀器進行測試。

不過,這些效能數字主要來自 Google 自家測試,實際表現仍可能受到機器人硬體、攝影機配置與使用環境影響。

Gemini Robotics ER 2 也支援多機器人協作,讓輪式機器人、人形機器人與固定式機械手臂,根據各自擅長的工作分工並互相交接任務。

Google 展示 Apptronik Apollo 2 人形機器人與 Franka F3 Duo 雙機械手臂共同執行工作,完成單一機器人較難獨立處理的流程。

在安全性方面,Google 表示,當有人進入機器人的作業範圍時,系統可先停止動作,並在確認人員離開後恢復工作。Google 也提出新的安全評估基準,用來檢查模型是否能遵守實體限制、持續觀察環境,以及在風險不明時主動向人類確認。

目前公開成果仍以 Google 內部測試、模擬環境與合作夥伴展示為主。Gemini Robotics ER 2 能否在長時間運作及更複雜的真實環境中維持相同表現,仍有待後續實際部署與第三方驗證。