发布:全模态世界模型 Atlas 登场
由李飞飞联合创立的空间智能公司 World Labs 于 9 月 1 日正式发布新一代世界模型 Atlas。这是一个「全模态」世界模型:从零开始预训练,原生处理文本、图像、视频与 3D 四种模态。在架构上,Atlas 是一个多模态自回归扩散 transformer,所有输入被合并进一个共享的空间上下文,模型据此生成接下来发生的内容,并在三维空间中与已经看到的一切保持一致,同时想象视野之外的景象。World Labs 强调,Atlas 为规模化而生,其性能随训练算力的增加持续提升,并且公司预计这一趋势将随规模扩大继续成立。
四项核心能力:从相机控制到虚实仿真
Atlas 的能力覆盖世界生成、重建与仿真三大类。其一是相机控制生成:给定一至六张参考图像,Atlas 可沿手动设计的相机路径生成新视角内容,输出最长 1 分钟、分辨率 1440p 的视频,并以相机几何作为原生输入实现像素级精确的镜头控制,远超以往基于文本描述的粗粒度指令。其二是空间重建:从一张到数十张输入图像重建真实场景,同时输出新视角图像帧与显式 3D 数据,性能超越专门面向 3D 重建训练的先进模型。其三是时空仿真:从输入视频中建模空间与时间,可对视频进行电影级重新构图,并支撑机器人领域的 Real-to-Sim 工作流。其四是图像生成:从文本生成图像与 360 度全景,支持复杂提示词与文字渲染等多种视觉风格。
空间上下文:与语言模型的关键区别
World Labs 解释了 Atlas 与语言模型的核心差异:与大语言模型先把输入编码为上下文、再条件生成输出的范式类似,Atlas 也遵循这一流程,但每张图像都被锚定在三维空间的具体位置上,形成一个真正的空间上下文。这带来全新的创作控制方式——用户可以把两张毫不相关的参考图放入上下文并指定它们在 3D 空间中的位置,Atlas 会生成一个在两者之间平滑过渡的世界,自行想象出门洞、走廊、壁龛等过渡空间。在长视频生成中,用户可以设计每一个场景与机位,官方将其形容为「坐在导演椅上编排场景,而不是拉动老虎机的拉杆」。
稀疏重建:直击 3D 视觉数十年难题
在空间重建方向上,Atlas 不需要特殊采集设备或数百张密集视角照片,即可从稀疏输入忠实重建物体与场景。World Labs 称这是朝着解决「稀疏输入新视角合成」问题迈出的重要一步——这是 3D 计算机视觉领域数十年悬而未决的基础难题。当输入视图未覆盖场景的一部分时,Atlas 会凭借其世界知识想象出合理的补全;而在用户需要精确还原的场景中,模型也能切换为严格重建模式。团队表示,这些能力将逐步整合进其空间计算产品 Marble 的未来版本,Atlas 现已开放早期访问申请。
行业意义:世界模型竞赛升温
世界模型被广泛视为继语言模型之后 AI 竞争的下一个主战场:它要求模型理解世界如何呈现、如何运动、如何演化,从而为创意工作者渲染想象中的世界、为自动驾驶与机器人提供高保真仿真环境。与纯粹生成像素的视频模型不同,世界模型需要内在的三维一致性,这正是空间智能路线的核心技术壁垒。Atlas 将文本、图像、视频与 3D 统一进单一模型的做法,显示多模态融合正在从拼接多个专家模型走向原生统一架构。随着 World Labs、谷歌 DeepMind 等多方持续投入,从生成到仿真的完整技术链条正在快速闭合。