Google DeepMind发布Gemini Robotics 2
TECH

Google DeepMind发布Gemini Robotics 2

34+
Signals

战略概览

  • 01.
    Gemini Robotics 2取代了早期系统(包括DeepMind自己的Gemini Robotics 1.5)中分离的移动与操作控制器,采用单一学习策略同时协调腿部、躯干、双臂以及一个拥有22个自由度的手部。
  • 02.
    产品线中的推理模型Gemini Robotics ER 2通过Gemini Live API上的双向流式端点连接,使机器人在执行当前步骤的同时规划下一步,而非暂停思考。
  • 03.
    通过持续观察机载视频,系统可跟踪自身在多步骤任务中的进展,察觉异常并决定何时进入下一阶段。
  • 04.
    此次发布实为三个独立模型:一个将视觉与语言转化为运动控制的视觉-语言-动作模型;用于推理和多步规划的Gemini Robotics ER 2;以及专为在机器人本体上本地运行而构建的On-Device模型。
  • 05.
    目前仅推理模型广泛可用——Gemini Robotics ER 2已上线Google AI Studio,并在Gemini Enterprise Agent Platform提供私有预览;而真正驱动机器人运动的模型仍仅限于早期合作伙伴使用。

一个策略,适配任意机器人身体

Google DeepMind的核心技术主张是架构层面的,而非表面性的。此前系统(包括公司自研的Gemini Robotics 1.5)在交接点拼接了分别用于移动与操作的独立控制器[1]。Gemini Robotics 2用单一学习策略替代了这一拼接,同时协调腿部、躯干、双臂及一个22自由度的手部[1]。该系列分为三个职责明确的模型:视觉-语言-动作模型将视觉与语言输入直接转换为运动控制;Gemini Robotics ER 2负责通信、世界理解与多步规划;Gemini Robotics On-Device 2则优化为在机器人本体上本地运行[2]。实践中,这体现为同一AI层运行于不同物理硬件上——同一基准测试套件报告了配备Inspire手部的Apollo 2人形机器人,以及双臂Franka Duo桌面平台的结果[3],这正是DeepMind“一个大脑适配任意机器人”定位的实际依据,而非为每台机器定制专属模型。

成功率的现实检验

系鞋带与更换灯泡的演示视频掩盖了更为参差的基准测试结果。在多指灵巧性任务中,DeepMind自身公布的数据显示:拧下灯泡的成功率为92%,扎紧垃圾袋为44%,密封拉链袋为40%,而簸箕任务仅为32%[3]。全身操作的成功率也因情境而异——Apollo 2平台上从货架取物成功率为76.3%,但从地面取物仅为45.7%[3]。这种差异至关重要,因为据外部报道,展示的任务并非开放泛化的证据:所展示的机器人并非通用机器,其模型是通过人类遥操作、视频示例和仿真针对每个视频任务专门训练的[4]。灵巧性成功率从约三分之一到超过九成不等,与“物理AGI”的叙事之间的落差,正是独立观察者提出质疑的关键所在。

谁真正能访问此系统

尽管发布范围广泛,但大部分技术栈尚不可试用。目前可通过Google AI Studio及Gemini Enterprise Agent Platform的私有预览获取推理与规划模型Gemini Robotics ER 2[5]。而实际驱动运动控制的视觉-语言-动作模型,以及为离线硬件适配构建的On-Device模型,仍仅限于选定的早期合作伙伴[5]。这意味着公众目前可查询的部分是负责规划与推理的“大脑”,而非操控机器人手指的部分——这一区别在将发布视为单一产品的报道中极易被忽略。

物理AGI雄心遭遇现实质疑

Google DeepMind以极为宏大的措辞定位此次发布。机器人部门负责人Carolina Parada称其为迈向‘物理AGI’的一步,并强调随着部署场景扩大,安全问题愈发紧迫:“安全问题更加迫切,因为你正将它们置于更多其他情境中。”[6]。公司声明更进一步,将此里程碑描述为向“能够完成人类所能做的一切的机器人”迈进的进展[7]。然而,这种定位与上述参差的成功率以及外部批评——即所展示任务为逐项专门训练而非证明具备通用性——难以相容[4]。公众反应亦呈两极:对系鞋带、单手换灯泡等具体灵巧性成果的赞赏广泛存在,但也有显著的怀疑声音质疑演示是否反映真实泛化能力或仅为有利布景,并指出该人形机器人仍落后于Figure、特斯拉及中国机器人项目等竞争对手。对于一个最难灵巧任务失败率接近一半的系统,“物理AGI”是否是恰当标签,正是此次发布引发的核心开放问题。

历史背景

发布了最初的Gemini Robotics与Gemini Robotics-ER模型,基于Gemini 2.0构建——第一代旨在实现灵巧、交互式机器人,具备空间推理能力,但仅支持上半身控制。
推出Gemini Robotics On-Device,首个优化为在机器人硬件上本地运行的变体,仅需50至100次演示即可适应新任务。
在2026年国际消费电子展(CES)宣布合作,将DeepMind的AI基础模型集成至Boston Dynamics下一代Atlas人形机器人,现代计划于2026至2028年间在工厂部署。
Agile Robots成为最新一家与Google DeepMind合作的机器人公司,将Gemini Robotics基础模型集成至其自有机器人中。
宣布Gemini Robotics 2,以单一统一的全身策略取代Gemini Robotics 1.5中分离的移动与操作控制器。

关键关系图

关键玩家
主题

Google DeepMind发布Gemini Robotics 2

AP

Apptronik

长期与DeepMind合作的伙伴,其配备Sharpa五指手的Apollo 2人形机器人是Gemini Robotics 2的主要演示平台;Apollo还正在梅赛德斯-奔驰制造产线及GXO物流仓库进行试点。

BO

Boston Dynamics

与Google DeepMind合作,于2026年1月5日CES宣布将Gemini基础模型集成至其下一代Atlas人形机器人;现代计划自2026年起在工厂部署,目标在2028年前完成零部件排序等任务。

AG

Agile Robots

于2026年3月24日宣布与Google DeepMind建立战略合作研究关系,将Gemini Robotics基础模型集成至其自有机器人中。

TE

Tesla (Optimus)

被外界评论定位为缺乏DeepMind具身无关策略的竞争对手,外部客户部署少于Figure或Apptronik,且Optimus仍被描述为早期研发阶段。

CA

Carolina Parada, Google DeepMind

高级总监/机器人负责人;作为公共发言人,将此次发布定位为迈向‘物理AGI’的一步,并强调随着机器人进入更多现实情境,安全风险日益上升。

事实来源

8 条引用
  1. [1] Google Gemini Robotics 2 Brings Whole-Body Humanoid Control
  2. [2] Gemini Robotics 2 Brings Whole-Body Intelligence to Robots
  3. [3] Google DeepMind Gemini Robotics 2: Whole-Body Control, Dexterity, and Multi-Robot Collaboration
  4. [4] Google's Gemini Robotics 2 Platform Brings Intelligent Whole-Body Control
  5. [5] Google DeepMind Unveils Gemini Robotics 2 as Apptronik Humanoid Demonstrates Whole-Body AI
  6. [6] Gemini Robotics 2 Gives Robots Full-Body AI Control
  7. [7] Gemini Robotics 2 Autonomous Robots
  8. [8] Gemini Robotics ER 2

来源文章

Top 5

THE SIGNAL.

Analysts

将Gemini Robotics 2定位为迈向‘物理AGI’的进展,并主张安全问题因机器人被部署于更广泛的现实情境中而愈发紧迫:“安全问题更加迫切,因为你正将它们置于更多其他情境中。”

Carolina Parada
机器人部门负责人 / Google DeepMind机器人高级总监

描述DeepMind的战略是构建通用物理理解能力,而非将特定任务硬编码至机器人:“我们不希望机器人预装一组固定任务,而是认为机器人应像我们一样理解物理世界。”

Carolina Parada
Google DeepMind机器人高级总监

认为商业化Atlas类人形机器人需超越运动表现:“它们必须能自然地与人互动。”

Alberto Rodriguez
Boston Dynamics Atlas行为总监

明确将Gemini Robotics 2定位为迈向‘物理AGI’的里程碑——即能够完成人类所能做的一切的机器人。

Google DeepMind
公司声明
The Crowd

One brain. For any robot. We're launching Gemini Robotics 2: our next-generation physical AI bringing full body intelligence to humanoids, advanced dexterity, multi-robot teamwork and more.

@@GoogleDeepMind4655

WILD: THIS ROBOT JUST TIED A KNOT WITH ITS OWN HANDS It also unscrewed a lightbulb and sealed a bag of grapes without being programmed for any of them. The robot runs on Google DeepMind's Gemini Robotics 2 with 22 finger joints, all controlled by a single AI model.

@@coinbureau129

Google $GOOGL DeepMind just posted this: "One brain. For any robot. We're launching Gemini Robotics 2: our next-generation physical AI bringing full body intelligence to humanoids, advanced dexterity, multi-robot teamwork and more."

@@StockMKTNewz213

Gemini Robotics 2 brings whole body intelligence to robots

@u/XxSpookxX320
Broadcast
Gemini Robotics 2 brings whole body intelligence to robots

Gemini Robotics 2 brings whole body intelligence to robots

Intelligent whole-body control with Gemini Robotics 2

Intelligent whole-body control with Gemini Robotics 2

Google DeepMind Demos Gemini Robotics 2 Doing Household Chores, and We Can't Wait for the Future!

Google DeepMind Demos Gemini Robotics 2 Doing Household Chores, and We Can't Wait for the Future!

Google DeepMind发布Gemini Robotics 2 — AI 新闻 | Agentic Brew