18+

Google 推出機器人「高階大腦」Gemini Robotics ER 2!能邊做邊判斷、發現錯誤

圖片來源/Google
圖片來源/Google

Google 發表新一代機器人 AI模型Gemini Robotics ER 2,定位如同機器人的「高階大腦 」。它能理解人類指令、規畫多步驟任務,並持續觀看即時影像,在機器人執行動作的同時判斷進度、發現錯誤及安排下一步。

相較前一代Gemini Robotics ER 1.6,新模型加入連續影片理解、工具調度、任務進度追蹤與多機器人協作等能力。Google 1ul3g4目前已透過Gemini API 與Google AI Studio向開發者開放,企業版則在Gemini Enterprise Agent Platform提供私人預覽。

成為機器人的「高階大腦」

Gemini Robotics ER 2 主要負責理解周遭環境、拆解任務及決定下一步,再將實際動作交給底層的視覺、語言與動作模型,也就是VLA模型執行。

開發者也能將導航、機械手臂控制介面及其他API設定成可呼叫工具,讓模型根據現場狀況自行安排使用順序,必要時也能呼叫Google搜尋或開發者自訂功能取得資訊。

Gemini Robotics ER 2整合Gemini Live API,可透過雙向串流持續接收影像、聲音與文字,讓機器人不必每完成一個動作就停下來重新思考。

Google也與Boston Dynamics合作,將模型用於控制Spot四足機器人的導航與機械手臂。展示中,使用者只要下達「幫我拿爆米花」等指令,Spot就能自行尋找並取回物品。

能判斷工作進度,也知道何時該停手

圖片來源/Google
圖片來源/Google

Gemini Robotics ER 2不再只分析單張影像,而是能持續觀看攝影機畫面,判斷燈泡是否鎖緊、垃圾袋是否綁好,或咖啡是否已倒至適當容量。

Google將影片中的畫面依任務完成程度分成五個階段。Gemini Robotics ER 2在這項進度分類測試中的準確率為57.4%,代表模型判斷每格畫面位於哪個進度區間的表現,並非整項任務的成功率。

圖片來源/Google
圖片來源/Google

在「關鍵時刻辨識」測試中,新模型的準確率為91.3%,預測時間點與正確答案平均相差約0.96秒。Google也表示,在相近測試條件下,其推論速度約為對照大型模型的4倍。

發現錯誤後,可調整或重新嘗試

透過連續影片理解,Gemini Robotics ER 2能在任務執行期間辨識液體灑出、物品滑落或位置偏移等情況,並調整動作或重新嘗試失敗步驟,不必從頭執行整套流程。

模型也強化儀器讀值能力,除了傳統指針與液位視窗,也能辨識數位顯示器、線性刻度、直尺及液體溫度計。

Google表示,目前已針對十種不同類型的儀器進行測試。

不過,這些效能數字主要來自 Google 自家測試,實際表現仍可能受到機器人硬體、攝影機配置與使用環境影響。

不同機器人可分工合作

Gemini Robotics ER 2也支援多機器人協作,讓輪式機器人、人形機器人與固定式機械手臂,根據各自擅長的工作分工並互相交接任務。

Google展示Apptronik Apollo 2人形機器人與Franka F3 Duo雙機械手臂共同執行工作,完成單一機器人較難獨立處理的流程。

在安全性方面,Google表示,當有人進入機器人的作業範圍時,系統可先停止動作,並在確認人員離開後恢復工作。Google也提出新的安全評估基準,用來檢查模型是否能遵守實體限制、持續觀察環境,以及在風險不明時主動向人類確認。

目前公開成果仍以Google內部測試、模擬環境與合作夥伴展示為主。Gemini Robotics ER 2能否在長時間運作及更複雜的真實環境中維持相同表現,仍有待後續實際部署與第三方驗證。

《原文刊登於合作媒體三嘻行動哇,聯合新聞網獲授權轉載。》

圖片及資料來源:Google

延伸閱讀

Google發表具備強大「代理行動」能力的Gemini 3.5系列模型 Gemini 3.5 Flash首發登場

分析/面對NVIDIA機器人帝國進逼 AMD如何靠賽靈思「 Body-to-Brain 」與開放架構逆襲?

劍指NVIDIA Jetson!AMD揭曉Ryzen AI Embedded X100與Kria開放機器人平台 強攻實體AI商機

讓AI幫忙寫出一套作業系統!Google Antigravity 2.0代理人開發平台以桌面端、CLI介面與SDK三路齊發

本日熱門 本周最熱 本月最熱