Generalist AI的GEN-1.5通用机器人学习模型
TECH

Generalist AI的GEN-1.5通用机器人学习模型

26+
Signals

战略概览

  • 01.
    GEN-1.5能够通过一段3至12秒的单次演示,在无需梯度更新的情况下学会一项新的物理任务,其采用‘物理提示’机制,将演示内容置于模型30秒上下文窗口内。
  • 02.
    该模型在十项任务中一次性成功的平均成功率为59%(±10%),在仅使用约5分钟数据(大约50次演示)进行10次梯度更新后,成功率提升至83%(±9%),而模型权重变化不足0.15%。
  • 03.
    GEN-1.5能够使用从未训练过的陌生工具进行即兴操作,例如用簸箕铲起并倾倒积木,或将香蕉当作临时刷子使用,Generalist AI认为这是经过八个多月连续预训练后涌现出的行为。
  • 04.
    所有报告的性能数据均来自Generalist AI,尚未由外部研究人员独立验证。

深度分析

物理提示:机器人领域的LLM式上下文学习

GEN-1.5被构建为一个统一的大型多模态模型,可接收视频、传感器、语言和本体感知输入,并以每秒100赫兹的频率输出动作轨迹[1]。该模型一次可在工作记忆中保留约30秒的输入流。所谓‘物理提示’——一段3至12秒的人类使用手持夹具执行任务的视频,或机器人自身先前尝试的回放片段——会被直接插入该上下文窗口,类似于将少量示例粘贴进大语言模型的提示中,随后机器人立即尝试执行任务,且完全不进行梯度更新[1]。当Generalist选择进行轻微微调时,调整幅度极小:仅需在约1至5分钟的数据(约10至50次演示)上进行10次梯度更新,即可使模型权重变化小于0.15%,远低于以往机器人适应流程所需的数万次梯度更新[3]。这种轻量级调整足以使十项保留任务的平均成功率从59%(±10%)提升至83%(±9%)[1][2]。网络上的反响反复提及同一个类比——X平台和Reddit上的评论独立指出,这堪称“机器人领域的GPT-2时刻”,即规模与合适的数据结构结合,催生了无人显式编程的上下文学习能力。

用香蕉即兴发挥:泛化能力还是记忆结果?

最能证明GEN-1.5具备泛化能力而非机械记忆的证据,是它面对从未训练过的工具时的表现。当被给予一个簸箕时,GEN-1.5自主组合出全新的接触序列——用簸箕铲起积木并倒入碗中——且未收到任何语言指令要求这样做[1]。当被给予一根香蕉时,它将水果重新用作临时刷子,将积木扫入碗中[1]。Generalist AI解释称,这些行为是在三个训练阶段、超过八个月的物理交互数据连续预训练中自发涌现的,而非专门针对工具即兴使用进行训练的结果[1]。该公司在YouTube上发布的演示视频(播放量超41,000次)还展示了另外两个同类的一次性泛化案例:机器人在任务中途切换手部实现双手协作,以及根据瓶子形状不同调整抓握方式。独立分析则更为谨慎:the-decoder指出,其他研究团队此前已在机器人中展示过类似的上下文学习能力,但仅限于少数任务类型,且Generalist AI的所有结果均未经独立验证[2]。社区反应也呈现分歧:r/singularity论坛用户将工具替换视为真正具备LLM式泛化能力的证据,认为这种能力源于正确组织的数据结构所引发的涌现现象;而同一讨论区也有反对声音指出,受控的沙盒环境刻意规避了可能暴露‘黄金路径失败’的真实变量。

星号警告:自我报告结果与有限基线

核心数据背后存在一个被行业媒体和网络观众反复提及的警示:所有结果——包括59%的一次性平均成功率、微调后的83%成功率——均由Generalist AI自行报告,尚未获得独立验证[2]。一个小型独立YouTube解说视频在对比脚本策略和强化学习基线时重复引用了59%这一数字,但它只是转述了Generalist AI公布的数值,并未提供额外验证。这种怀疑态度在社区内部早有先例:当Generalist AI的前代模型GEN-1宣称达到99%成功率时,r/Futurology论坛的讨论同样质疑——受控演示环境的表现未必能预测真实世界部署效果——其中一种反驳观点引用了一个仓库试点案例:模型更新后错误率从6.3%降至1.8%,这类更混乱、实际生产环境中的数据才真正具有说服力。然而,GEN-1.5至今未发布任何可与此类数据相提并论的一次性主张验证结果。

创始人、融资与对基础模型机器人的押注

GEN-1.5是快速迭代路线图中的第三款模型——GEN-0于2025年11月发布,GEN-1于2026年4月紧随其后,据称将平均任务成功率从此前模型的64%提升至99%,完成速度约为当时最先进水平的三倍[4]。打造该模型的团队正是为此目标而组建:CEO Pete Florence与首席科学家Andy Zeng均来自Google DeepMind,曾参与机器人语言模型RT-2与PaLM-E的研发;CTO Andrew Barry此前曾在Boston Dynamics担任机器人工程师[4]。投资者正为此背景买单——2026年6月,Generalist AI在由Radical Ventures领投、Nvidia与Bezos Expeditions参与的新一轮融资中筹集4亿美元,估值达20亿美元,累计融资额已突破5亿美元[4][5][6]。这笔资本实质上是在下注:‘预训练一次,演示即提示’的架构能够通用于整个机器人行业,而无需针对每项任务或每个机器人进行定制化工程开发。

历史背景

由前Google DeepMind与Boston Dynamics研究人员创立的公司,致力于为物理世界构建通用智能。
发布了早期具身基础模型GEN-0。
发布了GEN-1,据称将平均任务成功率从此前模型的64%提升至99%,任务完成速度约为当时最先进水平的三倍。
在由Radical Ventures领投的融资中筹集4亿美元,估值达20亿美元,Nvidia与Bezos Expeditions参与其中。

关键关系图

关键玩家
主题

Generalist AI的GEN-1.5通用机器人学习模型

GE

Generalist AI

开发GEN-1.5的机器人初创公司;2024年由前Google DeepMind与Boston Dynamics研究人员创立

PE

Pete Florence

CEO兼联合创始人,前DeepMind高级科学家,曾参与RT-2与PaLM-E的创建

AN

Andy Zeng

首席科学家兼联合创始人,前Google DeepMind研究员

AN

Andrew Barry

CTO兼联合创始人,前Boston Dynamics机器人工程师

RA

Radical Ventures

Generalist AI 4亿美元融资轮(2026年6月,估值20亿美元)的领投方

NV

Nvidia (NVentures)

Generalist AI的现有投资者,通过其NVentures投资部门参与了2026年6月的4亿美元融资轮

事实来源

6 条引用
  1. [1] Generalist AI Blog: GEN-1.5
  2. [2] GEN-1.5: Generalist AI Teaches Robots New Tasks From a Single Demo
  3. [3] Generalist's GEN-1.5 Enables One-Shot Robot Learning
  4. [4] Generalist Raises $400M to Scale Its General-Purpose AI Models
  5. [5] Nvidia-Backed Robotics Startup Generalist AI Valued at $2 Billion
  6. [6] Congrats Generalist AI on $400M Raise at $2B Valuation

来源文章

Top 5

THE SIGNAL.

Analysts

指出其他研究团队此前已在机器人中展示过类似的上下文学习能力,但仅限于少数任务类型,并强调Generalist AI的所有结果均由公司自行报告,尚未获得独立验证。

the-decoder
科技新闻媒体,编辑分析
The Crowd

Introducing GEN-1.5, a one-shot learner. It can learn new tasks in a few seconds. Show it what to do, and it generalizes. This capability emerged from pretraining on physical data at scale, as a step towards our mission of building general intelligence for the physical world.

@@GeneralistAI9936

At 10:06pm on Aug 3, I watched a robot do something I thought was years away. We were working on few-gradient learning with GEN-1.5, wondering how far we were from landing physical prompting: show the robot a task once, and it just does it. We YOLOed it, and the robot imitated

@@felixwyw1091

GEN, our latest embodied foundation model, can learn new tasks prompted with 3 - 12 seconds of a single demonstration, no gradient updates or fine-tuning. It generalizes prompts to new situations, recovers from mistakes, and improvises new strategies to reach the same goal.

@@GeneralistAI655

Introducing GEN-1.5, a one-shot learner

@u/GraceToSentience1100
Broadcast
Introducing GEN-1.5, a one-shot learner

Introducing GEN-1.5, a one-shot learner

Generalist GEN-1.5 : A Robot That Learns From 12 Seconds of Video

Generalist GEN-1.5 : A Robot That Learns From 12 Seconds of Video

This $440 Million Startup Is Solving Robotics' Biggest Problem

This $440 Million Startup Is Solving Robotics' Biggest Problem