一个模型取代整条处理流程
World Labs 将 Atlas 构建为一个单一的多模态自回归扩散变换器,从零开始预训练,原生支持在统一空间上下文中处理文本、图像、视频和三维数据,将过去需要独立的摄影测量、点阵训练和相机求解流程的任务整合进一个模型 [1]。该模型可生成长达一分钟的 1440p 视频,具备像素级精准的相机控制,并能同时输出显式的三维点云和高斯点阵,以及标准视频帧 [1]。在稀疏视角三维重建任务上,World Labs 报告 Atlas 的平均绝对相对点图误差为 25.3,优于次优专业模型的 28.7,行业分析认为这一结果表明生成与重建本质上是同一类任务 [2]。这才是真正的关键:Atlas 并非主打更优的视频生成能力,而是押注于一个足够大的模型能够完全取代一系列专业的三维工具。


