Google DeepMind发布Gemini Robotics 2用于人形机器人控制
TECH

Google DeepMind发布Gemini Robotics 2用于人形机器人控制

38+
Signals

战略概览

  • 01.
    Google DeepMind的Gemini Robotics 2能够控制整个人形机器人,从脚到指尖,相比上一代仅限于上半身控制是重大扩展。
  • 02.
    此次发布包含三个模型:Gemini Robotics 2(VLA,用于人形机器人全身控制)、Gemini Robotics ER 2(具身推理,支持多机器人协同)以及Gemini Robotics On-Device 2,后者可在本地运行,并通过几小时的数据适应新机器人本体。
  • 03.
    目前仅Gemini Robotics ER 2广泛可用,开发者可通过Gemini API和Google AI Studio访问,同时在Gemini Enterprise Agent Platform上提供私有预览;而VLA和On-Device模型仍仅限早期合作伙伴使用。
  • 04.
    演示在Apptronik的Apollo机器人上运行,利用其五指、22关节的手成功完成打结和密封拉链袋等任务,同时该模型也在其他平台的简易两指夹爪上运行。

三个模型,一个架构:全身控制背后的技术体系

与上一代Gemini Robotics主要控制机器人上半身不同,新的VLA模型能够从头到脚控制整个人形机器人 [3]。Gemini Robotics ER 2位于其上层,作为高层智能体:它通过流式传输视频、音频和文本,规划可持续数分钟的多步骤任务,然后将实际的电机执行交由底层VLA模型完成 [2]

效率方面的关键是Gemini Robotics On-Device 2,它直接在机器人本地运行,仅需几小时数据和不到200次演示即可适应全新的机器人本体 [1]。这种灵活性在演示中得以体现:同一套架构可驱动Apptronik的Apollo机器人,利用其五指、22关节的手完成打结和密封拉链袋等任务,随后无需重建即可在另一平台上运行更简单的两指夹爪 [3]。DeepMind列出Boston Dynamics和Agile Robots为已接入该架构的硬件合作伙伴 [4],Franka也被列为合作平台 [2],这表明Gemini Robotics旨在成为一个通用模型架构,适用于人形机器人、工业机械臂和移动机器人,而非绑定于某一专有机器人。

无人提及的灵巧性差距

全身控制的升级确实存在,但精细操作的数据揭示了更为保守的现实:Gemini Robotics 2在拧灯泡任务中成功率高达92%,但在扎垃圾袋时降至44%,密封拉链袋时仅为40% [3]。DeepMind机器人部门主管Kanishka Rao将这一差距视为该领域尚未解决的核心问题,而非微小误差:机器人仍仅在已见过的场景中表现良好,难以泛化至陌生情境 [3]

这一局限性也体现在谷歌以外渠道的演示反馈中。Reddit上一场高参与度的讨论在表达对该发布热情的同时,普遍对现实世界中的速度与可靠性表示怀疑。另一条低关注度的社区评论声称,某竞争对手早在约一年前就已展示过类似的多机器人协同能力。该说法仅基于单条评论,并非广泛共鸣的批评,尚不足以构成对Gemini Robotics 2新颖性的定论性质疑。DeepMind自身发布的YouTube解释视频则强化了官方叙事——即能力稳步、渐进式提升,而更怀疑的解读则出现在社区帖子的评论区中。这场争论体现了本次发布的核心张力:模型可尝试的任务范围无疑实现了跃升,但可靠性数据仍远未达到可在现实世界中无人监管部署的水平。

Apptronik的数据工厂与中国硬件挤压

Gemini Robotics 2之所以成为可能,不仅归功于DeepMind的建模工作,还得益于专门的训练数据供给:Apptronik位于奥斯汀的扩建版“机器人园区”(Robot Park)设施,正通过远程操作和自主执行会话,持续运行Apollo 2人形机器人,其数据直接反馈用于训练和优化Gemini Robotics模型,Mercedes-Benz和GXO被列为与该项目相关的客户 [5]

这一数据管道的开启恰逢其所依赖的硬件环境在美国日益复杂。特朗普政府与联邦通信委员会(FCC)以国家安全为由,禁止进口外国制造、主要来自中国的双足和四足机器人,警告这些设备可能被远程控制或用于监视、网络攻击 [6]。中国占据全球人形机器人市场约85%的份额,因此DeepMind试图让单一模型架构适配多种机器人形态的战略,如今正面临美国境内可合法运行的非中国机器人本体日益减少的现实 [6]

教机器人说“不”:智能体安全操作手册

随着Gemini Robotics ER 2承担更多智能体职责,如规划多步骤任务并协调多个机器人,DeepMind也为其配套推出了新的安全基准ASIMOV-Agentic,旨在测试推理模型是否能拒绝不安全指令、标记不可能完成的任务,并在无法处理时主动向人类求助,而非自行发挥 [7]。相关安全论文指出,操控物理实体的智能体需要超越单一模型的防护机制:拒绝超出约束的任务、在硬件故障时触发干预、并保护底层VLA模型免受其未受训指令的影响 [7]

DeepMind还从更直接的意义上称ER 2是其迄今最安全的发布:它能更好检测人类是否靠近机器人,并在人员在场时暂停动作,直至区域清空后才恢复运行 [3]。将此类行为与能力升级打包推出,表明DeepMind认为,安全认证而不仅是原始灵巧性,才是决定这些模型能否在无人监管下靠近人类运行的关键门槛。

历史背景

首次推出原始Gemini Robotics和Gemini Robotics-ER模型,首次将Gemini的多模态推理能力引入物理机器人控制。
发布Gemini Robotics 1.5和Gemini Robotics-ER 1.5,引入智能体能力及跨具身形态的运动迁移技术,并在ALOHA 2、Apptronik的Apollo和Franka机器人上测试;ER 1.5通过Gemini API和AI Studio开放,而1.5版本仍限于精选合作伙伴。
宣布Gemini Robotics 2、Gemini Robotics ER 2和Gemini Robotics On-Device 2,扩展全身人形控制能力(此前仅限上半身),并引入ASIMOV-Agentic安全基准。

关键关系图

关键玩家
主题

Google DeepMind发布Gemini Robotics 2用于人形机器人控制

GO

Google DeepMind

Gemini Robotics 2模型家族的开发者,包括VLA、ER 2和On-Device 2变体

AP

Apptronik

人形机器人制造商,在Apollo机器人上演示Gemini Robotics 2;运营位于奥斯汀的“机器人园区”设施,为DeepMind生成训练数据

BO

Boston Dynamics

研究合作伙伴;其Spot机器人已集成至Gemini Robotics ER 2的取物任务演示中

AG

Agile Robots

研究合作伙伴,与Apptronik和Boston Dynamics并列列入Gemini Robotics项目

US

US federal government (FCC / Trump administration)

以国家安全为由禁止进口外国制造、主要来自中国的双足和四足机器人,影响Gemini Robotics在美国可合法运行的硬件选择

事实来源

8 条引用
  1. [1] Gemini Robotics 2 Brings Whole-Body Intelligence to Robots
  2. [2] Introducing Gemini Robotics ER 2
  3. [3] Gemini Robotics 2 Brings Whole-Body Humanoid Control
  4. [4] Gemini Robotics (Models Overview)
  5. [5] Apptronik Launches Robot Park to Train Apollo Humanoid Robots With Google DeepMind
  6. [6] US Government Bans New Foreign-Made Humanoids, Robot Dogs, and Solar Inverters Citing Risks to National Security
  7. [7] Gemini Robotics 2 Safety
  8. [8] Google DeepMind Launches Gemini Robotics ER 2 With Multi-Robot Collaboration

来源文章

Top 5

THE SIGNAL.

Analysts

将机器人长期愿景描述为与手机或电脑类似的AI交互界面,并指出多项机器人能力同时取得性能提升。引述:"最终,机器人将成为我们与AI互动的又一界面,就像我们的手机或电脑一样——成为物理世界中的智能体。"

Carolina Parada, Head of Robotics, Google DeepMind
对机器人成为AI通用交互界面持乐观态度

表示真正的灵巧性仍是遥远目标,机器人学习效率远低于人类——人类仅需一两次错误即可调整行为;指出在陌生场景中的泛化能力是机器人领域的核心未解难题。引述:"机器人领域的一大挑战,也是你为何未在各处看到实用机器人的原因,是机器人通常在曾经历过的场景中表现良好,但在陌生场景中却难以泛化。"

Kanishka Rao, Director of Robotics, DeepMind
对灵巧性和泛化能力的剩余局限持谨慎态度

将DeepMind的机器人工作视为迈向真正有用的通用机器人的一步,此言论发表于Gemini Robotics 1.5前代版本发布期间。引述:"真正有用的通用机器人"

Sundar Pichai, CEO, Alphabet/Google
将智能体机器人推进视为迈向通用机器人的进展
The Crowd

For decades, we've dreamed of robots that can seamlessly step into our world and lend a hand. Today, we take a major stride toward making that dream a reality: Introducing Gemini Robotics 2 from @GoogleDeepMind, the intelligence layer powering the next generation of truly [capable robots]

@@GoogleAI1599

$GOOGL DeepMind launched Gemini Robotics 2 as "one brain for any robot" adding full-body intelligence, dexterity and multi-robot teamwork. The model is designed to power everything from humanoids to industrial arms and mobile robots.

@@StockSavvyShay136

Google DeepMind just dropped Gemini Robotics 2! The new framework expands beyond simple tabletop tasks, bringing whole-body intelligence to humanoids from "feet to fingertips." Watch @Apptronik's Apollo 2 seamlessly navigate a cluttered space, while @SharpaRobotics' 22-DoF hand demonstrates dexterous manipulation

@@humanoidsdaily4

Gemini Robotics 2 brings whole body intelligence to robots

@u/XxSpookxX209
Broadcast
Gemini Robotics 2 brings whole body intelligence to robots

Gemini Robotics 2 brings whole body intelligence to robots

Intelligent whole-body control with Gemini Robotics 2

Intelligent whole-body control with Gemini Robotics 2

Multi-robot collaboration with Gemini Robotics 2

Multi-robot collaboration with Gemini Robotics 2