說到機器人,很多人可能會想到會走路、會跳舞,或是在展場上做出各種高難度動作的展示機器人。
但近期 AI 機器人發展的新亮點,不只是讓機器人「動起來」,而是讓它開始理解現場、拆解任務,並把判斷轉換成實際行動。
Google DeepMind 於 2026 年 7 月推出 Gemini Robotics 2 系列模型,主打讓 AI 進一步走進真實世界。這項技術希望讓機器人不只接收指令,也能看懂環境、規劃下一步,並控制身體完成任務。
🤖 從預設動作,走向理解任務後的行動
現在的機器人已經可以走路、跳舞,甚至完成許多高難度展示動作。
但 Gemini Robotics 2 想凸顯的重點,不是「機器人終於會動」,而是 AI 開始協助機器人理解任務,並把判斷轉換成實際行動。
過去有些機器人比較像是「照著劇本演出」:工程師先設定好動作,或透過遙控、示範、訓練資料,讓機器人學會在特定情境下完成指定任務。只要場景固定、物品位置差不多,它就能穩定執行。
但真實世界往往不是這麼整齊。桌上的東西可能換了位置,物品可能被其他東西擋住,任務也可能不是一步就能完成。
這也是新一代 AI 機器人想突破的地方:機器人不只是接收「往前走」、「伸手」、「拿起來」這種單一步驟,而是能先看懂現場,再思考整個任務該怎麼完成。
用比較白話的方式說,過去比較像是:「照著已經寫好的動作表執行。」現在則更像是:「先看現場發生什麼事,再決定下一步怎麼做。」
👀 機器人要先看懂現場,才知道怎麼行動
對人類來說,整理桌面、拿起東西、繞過障礙物,看起來都是很自然的日常動作。
但對機器人來說,這些其實都很複雜。例如要整理一個雜亂空間,機器人不能只會蹲下或伸手。它還要判斷物品在哪裡、要先拿哪一個、路線會不會被擋住、手要怎麼轉、身體要不要先彎下來,甚至做到一半時,還要判斷任務是否完成。
簡單來說,機器人早就可以做出漂亮動作;但更困難的是,讓它知道自己為什麼要這樣動、下一步該怎麼做,以及遇到變化時能不能調整。
🧠 技術上,它像是把大腦、眼睛和手腳串起來
Gemini Robotics 2 的技術概念,可以用「大腦、眼睛和手腳開始連在一起」來理解。
「眼睛」負責看見現場:辨識物品、空間位置和周遭環境。
「大腦」負責理解任務:理解使用者需求、拆解執行步驟,並判斷任務進度。
「手腳」負責執行動作:將判斷轉化為走近、彎腰、伸手、抓取等真實世界的操作。
這類模型常被稱為 VLA(Vision-Language-Action),是目前「具身智能(Embodied AI)」發展中的重要技術路線之一。白話來說,就是把「看到的畫面(Vision)」、「聽懂的語言(Language)」與「實際動作(Action)」串聯起來。
除了全身控制,本次同系列推出的 Gemini Robotics ER 2 更強化了實體空間推理與長時間任務規劃能力。這意味著機器人不只是聽到一句話就照做,而是能把指令放進真實且動態的場景中理解,拆解步驟、判斷進度,並選擇較合適的行動。
🤝 不只單打獨鬥,還可能和其他機器人合作
Gemini Robotics 2 也特別強調了多機器人協作(Multi-robot collaboration)的方向。
未來不一定是一台機器人包辦所有事,而是不同型態的機器人分工合作。例如一台類人型機器人負責移動、觀察與判斷現場,另一台雙臂機器人則專注於工具整理或細緻操作。
這有點像人類團隊合作:不是每個人都做同一件事,而是依照各自優勢分工,讓整體任務更有效率。
⚠️ 目前還不是萬能機器人
不過,這並不代表我們已經進入「萬能機器人」時代。
目前這類技術仍然需要特定的硬體、訓練資料、感測器與安全設計配合。機器人在真實世界中行動,面臨的考驗遠比螢幕裡的 AI 更嚴苛。
因為聊天機器人回答錯了,可以隨時修正;但實體機器人如果判斷錯誤,可能會發生碰撞、掉落物品,甚至影響周遭人的安全。因此,安全性永遠是 AI 機器人發展中最關鍵的一環。
✨ AI 正在從「會說」走向「會做」
過去大家熟悉的 AI,多半是聊天、寫文章、生成圖片或回答問題。
但 AI 機器人的持續突破,代表 AI 正在從螢幕裡的智慧,逐漸邁向真實世界中的實體行動力。
這次的新意不是「機器人會不會動」,而是 AI 能不能讓機器人看懂現場、理解任務、規劃步驟,並把這些判斷轉換成實際行動。
換句話說,AI 不只要會說,下一步,也正在學著看懂世界,並動手完成任務。
使用工具:chatgpt、Google Gemini
資料整理:南投縣政府計畫處
