修复每个长视频世界都会崩溃的致命缺陷
世界模型通过前序帧生成每一帧新画面,因此微小误差会不断累积——纹理模糊、几何变形,最终导致场景崩溃。这种失效模式正是大多数交互式世界模型在几秒或几分钟后就开始瓦解的原因。LingBot-World 2.0 从训练层面应对这一问题:Robbyant 采用因果预训练方式,使模型严格按时间顺序学习世界演化过程,并引入团队称为 MoBA 的机制,防止长时程生成中误差累积 [3]。相关报道指出,该模型实现了长达一小时的连续生成且无明显质量衰减 [2]。
模型仅是系统的一半。Robbyant 将其封装在一个代理框架中:由视觉-语言模型规划事件,视频生成器负责渲染。该系统运行两个代理:一个“飞行员”代理负责规划并执行角色行为,一个“导演”代理持续注入新的环境事件,确保在探索过程中世界不会枯竭 [1]。团队类比的是编程代理:强大的基础模型只有在具备状态检查、行动和多轮目标追踪能力的框架中才能真正发挥作用。


