World Labs Atlas 多模态世界模型
TECH

World Labs Atlas 多模态世界模型

25+
Signals

战略概览

  • 01.
    由李飞飞联合创立的 World Labs 于 2026 年 9 月 1 日发布了 Atlas:这是一种从零开始预训练的全模态自回归扩散变换器模型,能够在一个统一的空间上下文中原生处理文本、图像、视频和三维数据。
  • 02.
    Atlas 可生成长达一分钟的 1440p 视频,具备像素级精准的相机控制能力,还能输出显式的三维表示,例如点云和高斯点阵,仅需两到三张图像即可重建场景,最多可支持一百张以上图像输入。
  • 03.
    发布演示中,工程师使用三到五部普通智能手机,架设在三脚架和背包式便携夹具上进行拍摄,随后 Atlas 重建并重新渲染了这些画面,生成了手机从未拍摄过的摄像机视角,实现了类似‘子弹时间’的视觉效果。
  • 04.
    Atlas 目前仅向部分合作伙伴开放早期访问,而非作为独立的消费级产品发布;World Labs 表示,该模型将用于驱动其 Marble 产品的未来版本。

深度分析

一个模型取代整条处理流程

World Labs 将 Atlas 构建为一个单一的多模态自回归扩散变换器,从零开始预训练,原生支持在统一空间上下文中处理文本、图像、视频和三维数据,将过去需要独立的摄影测量、点阵训练和相机求解流程的任务整合进一个模型 [1]。该模型可生成长达一分钟的 1440p 视频,具备像素级精准的相机控制,并能同时输出显式的三维点云和高斯点阵,以及标准视频帧 [1]。在稀疏视角三维重建任务上,World Labs 报告 Atlas 的平均绝对相对点图误差为 25.3,优于次优专业模型的 28.7,行业分析认为这一结果表明生成与重建本质上是同一类任务 [2]。这才是真正的关键:Atlas 并非主打更优的视频生成能力,而是押注于一个足够大的模型能够完全取代一系列专业的三维工具。

背包拍出子弹时间:稀疏视角捕捉的突破

发布会的核心演示刻意保持朴素:工程师使用三到五部普通智能手机,安装在三脚架和背包式便携夹具上拍摄场景,随后由 Atlas 重建场景并从手机从未拍摄过的视角重新生成画面,实现了通常需要专用多相机阵列才能实现的‘子弹时间’效果 [1]。线上反响迅速且广泛,从官方演示视频、李飞飞本人将其称为迄今最优秀的相机条件化世界模型,到独立评论,甚至延伸至中文 AI 社区,各方观点都聚焦于同一个细节:实现这一镜头不再需要相机阵列。除了创意层面的重构,World Labs 还将这种稀疏到稠密的重建能力定位为机器人‘现实到仿真’(Real-to-Sim)工作流的工具,用于生成机器人训练所需的仿真环境 [3]

信任鸿沟:无论文、无代码、数据自报

尽管发布视频制作精良,但 World Labs 尚未发布任何论文、arXiv 条目、模型卡或代码,导致其架构和训练数据从外部几乎无法验证 [3]。所有关键数据,包括 Atlas 在人类评分中以 75–94% 的偏好率胜过 MiniMax H3、Gemini Omni Flash、FLUX 3 和 Seedance 2.5 的结果,均来自 World Labs 内部测试,尚未被独立复现 [2]。这种‘精良演示’与‘缺乏证据’之间的落差,正是线上反应出现分歧的根源:在广泛兴奋的同时,也有声音尖锐指出演示‘如同障眼法’,静态暂停帧‘看起来很糟糕’,并指出一个警示信号——独立分析(包括 YouTube 上的拆解)识别出一种稀疏视角下的幻觉失效模式:稀疏输入视角被生成的几何结构而非真实捕捉的几何结构填充。Reddit 上的怀疑者直言不讳地总结情绪,称 Atlas 只是‘比摄影测量法略微领先一小步’。

十亿美元级押注,三款产品纵深推进

Atlas 是 World Labs 在不到两年内发布的第三款公开产品,每一步都在强化同一核心论点。该公司于 2024 年 9 月结束隐匿状态,获得 2.3 亿美元融资,支持李飞飞的观点:AI 必须原生理解三维空间与时间,才能真正理解物理世界 [6]。2025 年 11 月,公司推出首款商业产品 Marble,可将文本、照片、视频或全景图输入转化为可编辑的三维环境 [5]。截至目前,总融资额已增长至约 12 至 12.3 亿美元,投资方包括 Nvidia、AMD、Autodesk、a16z、Intel Capital、Eric Schmidt 和 Ashton Kutcher [4]。Atlas 目前正进入与部分合作伙伴的早期访问阶段,World Labs 表示将把该模型整合进未来版本的 Marble 中,而非作为独立产品发布 [1],这表明公司仍在通过一个面向消费者的界面实现商业化,同时利用每一款新模型不断加深其技术护城河。

历史背景

World Labs 以 2.3 亿美元融资结束隐匿状态,由李飞飞领衔,致力于构建‘空间智能’AI 模型。
World Labs 预览了其首个 AI 系统,可从单张图像生成可交互、可探索的三维场景,这一概念后来作为 Marble 实现商业化。
World Labs 推出 Marble,其首款商业多模态世界模型,可将文本、照片、视频或全景图输入转化为可编辑、可下载的三维环境。
World Labs 推出 World API,扩大对其空间智能模型的程序化访问,为 Atlas 发布铺路。
World Labs 发布 Atlas,其全模态多模态世界模型,进入与部分合作伙伴的早期访问阶段。

关键关系图

关键玩家
主题

World Labs Atlas 多模态世界模型

WO

World Labs

空间智能初创公司,开发并发布了 Atlas,此前已推出 Marble 产品(2025 年 11 月)和 World API(2026 年 1 月);掌控早期访问的发布节奏和集成路线图。

FE

Fei-Fei Li

World Labs 联合创始人;提出公司公开的‘空间智能’理论,Atlas 被定位为该理论的实现。

JU

Justin Johnson

World Labs 联合创始人,曾公开将世界模型描述为实现完整交互式三维仿真的工具,而非静态图像或视频输出。

BE

Ben Mildenhall

World Labs 联合创始人,NeRF 与高斯点阵技术先驱,其研究背景支撑了 Atlas 的三维重建与点阵输出能力。

WO

World Labs 投资者(Nvidia, AMD, Autodesk, a16z, Intel Capital, Eric Schmidt, Ashton Kutcher)

在总计约 12 至 12.3 亿美元的融资轮次中提供支持,为 Atlas 背后的算力与研究提供资金。

事实来源

6 条引用
  1. [1] Atlas: A World Model for Spatial Intelligence
  2. [2] World Labs Atlas Beats Specialized 3D Models With One Omni Model
  3. [3] World Labs Announces New World Model: Atlas
  4. [4] Fei-Fei Li's World Labs Debuts Atlas, a World Model Showcase for Advanced Spatial Intelligence
  5. [5] Fei-Fei Li's World Labs Speeds Up the World Model Race With Marble, Its First Commercial Product
  6. [6] World Labs AI Can Generate Interactive 3D Environments

来源文章

Top 1

THE SIGNAL.

Analysts

将 Atlas 描述为实现其空间智能理论的重要里程碑,称其为迄今最优秀的相机条件化世界模型,并指出其在视觉特效到机器人领域的广泛应用前景。

Fei-Fei Li
World Labs 联合创始人

将世界模型定位为实现完整交互式三维仿真的工具,而非仅用于静态图像或视频生成。

Justin Johnson
World Labs 联合创始人
The Crowd

Introducing Atlas: The world's first multimodal world model that generates image and video frames with pixel-perfect camera control and reconstructs them in 3D. Model the world, move the camera, and simulate space & time.

@@theworldlabs29027

I'm so excited that our @theworldlabs team has achieved a major milestone today! Introducing Atlas - a first of its kind multimodal world model trained from scratch! 🚀 Atlas is capable of generating frames with pixel-perfect camera control, reconstructing large scenes from as few as one single input image, simulating space-time by reframing videos, natively outputting 3D spaces from one or more input images, composing multiple posed images into a consistent 3d world, and more! This is the best camera conditioned world model ever, opening doors to many possible use cases from VFX to robotics. I'm so so so proud of our team!♥️

@@drfeifei8922

wtf!?视频拍完以后,居然还能重新选机位。 早上写过李飞飞 World Labs 新发布的世界模型 Atlas,这个是刚放出来的一个具体玩法。 现场只用 3-5 台普通手机/运动相机,从几个角度拍下砊西瓜的过程。 Atlas

@@MaxForAI389

World Labs' new Atlas model: Space-time simulation, "bullet time" from 3 cell phones, and scalable Real-to-Sim

@u/jasteinerman413
Broadcast
Introducing Atlas; A Foundation Model for Spatial Intelligence

Introducing Atlas; A Foundation Model for Spatial Intelligence

World Labs Atlas Is INSANE: AI Can Generate 3D Worlds From ONE Image

World Labs Atlas Is INSANE: AI Can Generate 3D Worlds From ONE Image

World Labs Atlas: Just Changed AI Video Forever With 3D Worlds

World Labs Atlas: Just Changed AI Video Forever With 3D Worlds