LingBot-World 2.0 开源实时世界模型
TECH

LingBot-World 2.0 开源实时世界模型

21+
Signals

战略概览

  • 01.
    蚂蚁集团旗下的具身智能公司 Robbyant 于 2026 年 7 月初开源了 LingBot-World 2.0(也称 LingBot-World-Infinity),这是一个交互式世界模型。
  • 02.
    该模型旨在以因果预训练方法结合 MoBA 机制实现 720p 分辨率、60fps 的实时输出,并支持长达一小时的连续生成而不出现可察觉的质量衰减,防止长时程漂移。
  • 03.
    发布的检查点是一个基于 Wan2.2 基础构建的 140 亿参数模型(lingbot-world-v2-14b-causal-fast),另有一个适用于单个消费级 GPU 的 13 亿参数变体,通过 GitHub、Hugging Face 和 ModelScope 以非商业许可 CC BY-NC-SA 4.0 发布。
  • 04.
    该模型与 Robbyant 更广泛的具身智能技术栈一同发布,其中包括于 2026 年 7 月 11 日发布的用于物理机器人控制的因果视频-动作模型 LingBot-VA 2.0。

修复每个长视频世界都会崩溃的致命缺陷

世界模型通过前序帧生成每一帧新画面,因此微小误差会不断累积——纹理模糊、几何变形,最终导致场景崩溃。这种失效模式正是大多数交互式世界模型在几秒或几分钟后就开始瓦解的原因。LingBot-World 2.0 从训练层面应对这一问题:Robbyant 采用因果预训练方式,使模型严格按时间顺序学习世界演化过程,并引入团队称为 MoBA 的机制,防止长时程生成中误差累积 [3]。相关报道指出,该模型实现了长达一小时的连续生成且无明显质量衰减 [2]

模型仅是系统的一半。Robbyant 将其封装在一个代理框架中:由视觉-语言模型规划事件,视频生成器负责渲染。该系统运行两个代理:一个“飞行员”代理负责规划并执行角色行为,一个“导演”代理持续注入新的环境事件,确保在探索过程中世界不会枯竭 [1]。团队类比的是编程代理:强大的基础模型只有在具备状态检查、行动和多轮目标追踪能力的框架中才能真正发挥作用。

一小时是演示,不是基准

这些 headline 数据值得审慎看待。MarkTechPost 的技术分析指出,720p/60fps 的指标依赖于 Robbyant 未发布的部署基础设施,而公开的参考实现实际上在八块 GPU 上以 480x832 分辨率运行 [1]。长达一小时的稳定性声明基于单次定性 60 分钟 rollout,缺乏标准世界模型基准测试——没有 VBench,也没有 FVD——作为支撑 [1]

此外还存在许可限制,影响他人在其基础上构建。权重虽已开源,但采用非商业许可 CC BY-NC-SA 4.0 发布,且 Robbyant 明确未公开其部署代码 [5]。因此,营销中达到 720p/60fps 的模型,并非开发者今天可下载复现的同一产物。这种演示视频与可下载检查点之间的差距,是理解此次发布最关键的一点。

当人们真正下载后发生了什么

开源权重迅速遭遇现实挑战。尽管发布的检查点是 140 亿参数模型,但其权重文件约 74GB,另加一个独立的多 GB 文本编码器,开发者社区立即聚焦于它是否能在非服务器机架设备上运行。普遍结论是:消费级使用需依赖激进量化——将权重压缩至 8 位或 4 位——且发布初期尚无现成工具如 GGUF 文件或 ComfyUI 节点可用。

更尖锐的争论是哲学性的:这究竟是一个持久世界,还是仅仅是可操控的视频?怀疑者指出,当你转身时模型会忘记背后的场景,说明其并无底层 3D 状态,只有对输入做出反应的帧生成。发布方本身也坦承这一局限:不声称具备真正长期记忆,当前视野外的区域可被重新生成而非精确回溯。然而实际体验仍令人印象深刻——有开发者搭建了一个可玩场景,让鸡变成武器,并报告物体在不同场景间保持连贯,鼠标控制的摄像机体验比以往任何工具更接近真实游戏。‘它只是视频’与‘它已像游戏’之间的张力,正是这项技术当前所处的位置。

为何蚂蚁集团一次性发布完整技术栈

LingBot-World 2.0 并非孤立发布。它是 Robbyant 陆续推出的六模型具身智能技术栈之一,该栈还包括 LingBot-Depth 2.0、LingBot-Vision、LingBot-VLA 2.0、LingBot-Video,以及在世界模型发布两天后推出的 LingBot-VA 2.0——一个从零构建、专为控制物理机器人而非改编自数字视频生成器的因果视频-动作模型 [4]。综合来看,这些并非孤立的研究演示,而是蚂蚁集团资产负债表支持的“物理智能”全栈押注。

此举也可视为快速跟随策略。开源实时交互式世界模型并免费提供权重——即使采用非商业许可——是赢得开发者心智、在竞争对手锁定前确立开放基准的经典手段 [5]。该策略以短期商业控制换取生态引力:若研究人员和开发者将 LingBot 视为开放世界模型栈的标准,Robbyant 就将主导未来发展方向。这才是真正的奖赏,而非一小时演示,而是其背后的平台地位。

历史背景

Robbyant 首次开源了 LingBot-World(v1),一个为毫秒级实时交互构建的世界模型。
Robbyant 推出 LingBot-World 2.0(Infinity),将生成时程从几分钟延长至一小时连续生成,并引入原生代理框架。
Robbyant 推出用于物理智能的因果视频-动作模型 LingBot-VA 2.0,完成其六模型具身智能技术栈。

关键关系图

关键玩家
主题

LingBot-World 2.0 开源实时世界模型

RO

Robbyant

蚂蚁集团旗下的具身智能公司;LingBot-World 2.0 及周边 LingBot 技术栈的开发者与开源发布方。它决定发布节奏和许可条款,决定谁能在其模型基础上进行构建。

AN

Ant Group

为 Robbyant 进军世界模型和物理智能提供资金支持的母公司,为这一异常快速的六模型发布节奏提供企业与财务平台。

SG

SGLang

为 LingBot-World 2.0 提供首发日支持的推理框架,尽管 Robbyant 未公开其部署代码,仍降低了第三方部署该模型的门槛。

GI

GitHub, Hugging Face, and ModelScope

托管开源权重和代码的分发平台,是研究人员和开发者实际获取并运行该模型的实际渠道。

事实来源

5 条引用
  1. [1] Meet LingBot-World-Infinity, an Open Causal World Model with an Agentic Harness
  2. [2] Robbyant open-sources LingBot-World 2.0 for live video
  3. [3] Robbyant Unveils LingBot-World 2.0, Pioneering Hour-Long Real-Time Generation in World Models
  4. [4] Ant Group's Robbyant Unveils LingBot-VA 2.0: A Causal Video-Action Model Built Natively for Physical AI
  5. [5] Robbyant/lingbot-world-v2

来源文章

Top 4

THE SIGNAL.

Analysts

720p/60fps 的声明依赖于 Robbyant 未发布的部署基础设施;公开参考实现以 480x832 分辨率在八块 GPU 上运行,且长达一小时的稳定性基于单次定性 rollout,缺乏 VBench 或 FVD 基准测试。

MarkTechPost
AI/ML 技术出版物

该模型的核心贡献在于通过因果分解和自 rollout 蒸馏,而非更高分辨率,在有效无限的交互时程中维持一致的输出质量。

MarkTechPost
AI/ML 技术出版物
The Crowd

Robbyant released LingBot-World 2.0 (Infinity), a new open-source World model capable of generating hour-long experiences. > No quality decay, stable 720p / 60 fps real-time output. > Users can interact with the world via Actions. > The world is dynamic, with built-in agents

@@testingcatalog104

LingBot World 2.0 made me think about how quickly world models are evolving. The most interesting part isn't the hour long generation. It's the idea of AI worlds that keep responding, changing, and creating new experiences as you explore. That feels like a meaningful step

@@manishkumar_dev48

LingBot-World is unveiled as an open-source, real-time interactive world model built on Alibaba's Wan2.2, capable of generating. But heres the catch: nearly 10 minutes of stable, continuous generation - even after the camera looks away for 60 seconds, objects remain intact when

@@kimmonismus523

lingbot world. A new open weights world model.

@u/AffectionateSwim6614392
Broadcast
Introducing LingBot-World 2.0: The First Hour-Long Interactive World Model | Open Source

Introducing LingBot-World 2.0: The First Hour-Long Interactive World Model | Open Source

China's Answer to Google Genie 3 is Here (LingBot-World)

China's Answer to Google Genie 3 is Here (LingBot-World)

Lingbot-World Real-Time World Model and MOVA's Video-Audio AI Video Release

Lingbot-World Real-Time World Model and MOVA's Video-Audio AI Video Release

LingBot-World 2.0 开源实时世界模型 — AI 新闻 | Agentic Brew