Google 發表新一代機器人 AI模型Gemini Robotics ER 2,定位如同機器人的「高階大腦 」。它能理解人類指令、規畫多步驟任務,並持續觀看即時影像,在機器人執行動作的同時判斷進度、發現錯誤及安排下一步。
相較前一代Gemini Robotics ER 1.6,新模型加入連續影片理解、工具調度、任務進度追蹤與多機器人協作等能力。Google 1ul3g4目前已透過Gemini API 與Google AI Studio向開發者開放,企業版則在Gemini Enterprise Agent Platform提供私人預覽。
成為機器人的「高階大腦」
Gemini Robotics ER 2 主要負責理解周遭環境、拆解任務及決定下一步,再將實際動作交給底層的視覺、語言與動作模型,也就是VLA模型執行。
開發者也能將導航、機械手臂控制介面及其他API設定成可呼叫工具,讓模型根據現場狀況自行安排使用順序,必要時也能呼叫Google搜尋或開發者自訂功能取得資訊。
Gemini Robotics ER 2整合Gemini Live API,可透過雙向串流持續接收影像、聲音與文字,讓機器人不必每完成一個動作就停下來重新思考。
Google也與Boston Dynamics合作,將模型用於控制Spot四足機器人的導航與機械手臂。展示中,使用者只要下達「幫我拿爆米花」等指令,Spot就能自行尋找並取回物品。
能判斷工作進度,也知道何時該停手
Gemini Robotics ER 2不再只分析單張影像,而是能持續觀看攝影機畫面,判斷燈泡是否鎖緊、垃圾袋是否綁好,或咖啡是否已倒至適當容量。
Google將影片中的畫面依任務完成程度分成五個階段。Gemini Robotics ER 2在這項進度分類測試中的準確率為57.4%,代表模型判斷每格畫面位於哪個進度區間的表現,並非整項任務的成功率。
在「關鍵時刻辨識」測試中,新模型的準確率為91.3%,預測時間點與正確答案平均相差約0.96秒。Google也表示,在相近測試條件下,其推論速度約為對照大型模型的4倍。
發現錯誤後,可調整或重新嘗試
透過連續影片理解,Gemini Robotics ER 2能在任務執行期間辨識液體灑出、物品滑落或位置偏移等情況,並調整動作或重新嘗試失敗步驟,不必從頭執行整套流程。
模型也強化儀器讀值能力,除了傳統指針與液位視窗,也能辨識數位顯示器、線性刻度、直尺及液體溫度計。
Google表示,目前已針對十種不同類型的儀器進行測試。
不過,這些效能數字主要來自 Google 自家測試,實際表現仍可能受到機器人硬體、攝影機配置與使用環境影響。
不同機器人可分工合作
Gemini Robotics ER 2也支援多機器人協作,讓輪式機器人、人形機器人與固定式機械手臂,根據各自擅長的工作分工並互相交接任務。
Google展示Apptronik Apollo 2人形機器人與Franka F3 Duo雙機械手臂共同執行工作,完成單一機器人較難獨立處理的流程。
在安全性方面,Google表示,當有人進入機器人的作業範圍時,系統可先停止動作,並在確認人員離開後恢復工作。Google也提出新的安全評估基準,用來檢查模型是否能遵守實體限制、持續觀察環境,以及在風險不明時主動向人類確認。
目前公開成果仍以Google內部測試、模擬環境與合作夥伴展示為主。Gemini Robotics ER 2能否在長時間運作及更複雜的真實環境中維持相同表現,仍有待後續實際部署與第三方驗證。
《原文刊登於合作媒體三嘻行動哇,聯合新聞網獲授權轉載。》
圖片及資料來源:Google
訂閱《科技玩家》YouTube頻道!
💡 追新聞》》在Google News按下追蹤,科技玩家好文不漏接!
📢 Galaxy Z Fold8 Ultra開箱!摺痕退散、多工效能 同時爽玩Pokemon GO、Pikmin Bloom
📢Sony 1000X THE COLLEXION耳機開箱!工地實測降噪效果 空間音訊秒置身電影院
📢電商平台買「全新庫存機」踩雷!電池循環44次還帶維修紀錄 網揭無良賣家手法
📢 Apple Pay、信用卡搭北捷「只扣1元」是沒刷到嗎?官方曝扣款規則秒懂
📢國家級「行動斷網」演習完整指引!NCC揭3重點:勿用手機處理重要工作
📢 LINE免費貼圖4款!「蛤」字必下載爽用半年、熊大兔兔動態圖超Q

討論區