一个策略,适配任意机器人身体
Google DeepMind的核心技术主张是架构层面的,而非表面性的。此前系统(包括公司自研的Gemini Robotics 1.5)在交接点拼接了分别用于移动与操作的独立控制器[1]。Gemini Robotics 2用单一学习策略替代了这一拼接,同时协调腿部、躯干、双臂及一个22自由度的手部[1]。该系列分为三个职责明确的模型:视觉-语言-动作模型将视觉与语言输入直接转换为运动控制;Gemini Robotics ER 2负责通信、世界理解与多步规划;Gemini Robotics On-Device 2则优化为在机器人本体上本地运行[2]。实践中,这体现为同一AI层运行于不同物理硬件上——同一基准测试套件报告了配备Inspire手部的Apollo 2人形机器人,以及双臂Franka Duo桌面平台的结果[3],这正是DeepMind“一个大脑适配任意机器人”定位的实际依据,而非为每台机器定制专属模型。



