物理提示:机器人领域的LLM式上下文学习
GEN-1.5被构建为一个统一的大型多模态模型,可接收视频、传感器、语言和本体感知输入,并以每秒100赫兹的频率输出动作轨迹[1]。该模型一次可在工作记忆中保留约30秒的输入流。所谓‘物理提示’——一段3至12秒的人类使用手持夹具执行任务的视频,或机器人自身先前尝试的回放片段——会被直接插入该上下文窗口,类似于将少量示例粘贴进大语言模型的提示中,随后机器人立即尝试执行任务,且完全不进行梯度更新[1]。当Generalist选择进行轻微微调时,调整幅度极小:仅需在约1至5分钟的数据(约10至50次演示)上进行10次梯度更新,即可使模型权重变化小于0.15%,远低于以往机器人适应流程所需的数万次梯度更新[3]。这种轻量级调整足以使十项保留任务的平均成功率从59%(±10%)提升至83%(±9%)[1][2]。网络上的反响反复提及同一个类比——X平台和Reddit上的评论独立指出,这堪称“机器人领域的GPT-2时刻”,即规模与合适的数据结构结合,催生了无人显式编程的上下文学习能力。



