← 返回博客
Ai预计阅读 10 分钟

李飞飞的 Atlas 把一张照片变成你可以走进去的房间

发布于 2026年10月2日
李飞飞的 Atlas 把一张照片变成你可以走进去的房间

World Labs 于 9 月 1 日将 Atlas 开放早期访问。这家由李飞飞联合创办的公司称其为面向空间智能的“全知世界模型”(omni world model),而演示内容也相当直白:输入几张普通手机拍摄的房间照片,输出一个可交互的 3D 场景。你可以在其中任意移动虚拟摄像机,可以从中读取深度信息,也可以把几何结构交给机器人,拿它当练习场地。

多年来,李飞飞一直主张 AI 的下一个前沿不是语言,而是物理世界。她用的词是“空间智能”,其判断是:一个只用文本和平面图像训练的模型,缺失了某种根本性的东西。语言模型描述的是一个它看不见的世界。Atlas 是目前为止最清晰的一次尝试,想要造出一个能看见的世界模型。

Atlas 能做什么

World Labs 把 Atlas 描述为一个多模态自回归扩散 Transformer(multimodal autoregressive diffusion transformer),在同一个空间框架内接收文本、图像、视频和 3D 数据,并在同一组模态上生成内容。它的输出比视频生成器更广:可控摄像机的图像,以及最高 1440p、时长约一分钟的视频,此外还有新视角、深度图、点云和 3D 高斯泼溅(Gaussian splat)。

体化(volumetric)输出正是它与文生视频模型的分野。视频生成器预测的是下一帧,它未必知道任何东西在空间中的位置,也不知道场景从摄像机从未占据过的角度看起来是什么样。Atlas 内部携带一个 3D 表征,因此当观看者在其中移动时,环境能够保持一致。一段看似合理的片段和一个可导航的空间之间的差别,正是“世界模型”这个叫法的全部意义所在。

从稀疏输入出发——在某些演示中只是几帧手机拍摄的画面——模型就能重建出场景,精度足以在其中放置一台虚拟摄像机。World Labs 报告称稀疏视角重建误差为 25.3,优于最佳专用模型的 28.7。在它自行委托开展的盲测中,对于是否遵循所要求的镜头运动,人类评分者在 75% 的情况下更偏好 Atlas 而非 MiniMax H3,81% 的情况下更偏好 Atlas 而非 Gemini Omni Flash,94% 的情况下更偏好 Atlas 而非 Seedance 2.5。

这些数字来自公司自己开展的评测,这一点必须直说。Atlas 仍处于早期访问阶段,因此合作伙伴之外还没有人能复现这些结果。

真实到仿真(Real-to-sim),以及机器人为何在意

最显而易见的商业应用是视觉特效、游戏和虚拟制片。电影人可以在拍摄结束后再安排镜头。不过 World Labs 重点强调的方向是机器人。

这套工作流叫 real-to-sim(真实到仿真)。你拍摄真实空间的视频,Atlas 将其转换成 3D 仿真环境,机器人可以在其中接受训练或测试,而无需承担操作实物的成本和风险。一个想要一千种仓库通道变体的机器人团队,只需扫描一次通道,然后生成各种变体,而不必逐一拍摄。

这是一个狭窄但真实存在的痛点。机器人的训练数据之所以昂贵,是因为收集数据就意味着要运行机器人。仿真很便宜,但通常需要有人手工搭建环境,既慢,又往往与真实场所毫不相似。一个能把真实房间变成仿真文件的模型,把两个昂贵的步骤合并成一个。这也解释了为什么英伟达和 AMD 都是投资方——两家都卖训练与仿真所依赖的算力。

披露问题

雄心与纸面证据之间存在落差。World Labs 随 Atlas 一同发布的,没有研究论文、没有模型卡、没有参数量、也没有训练算力数据。它没有公布价格,也没有公布正式上线日期。对于一个要对比有着充分文档的竞争对手并作出比较性主张的系统来说,这种沉默并不寻常,也使得那些盲测结果无法被核查。

怀疑者提出了更尖锐的问题:Atlas 究竟是在真正仿真这个世界,还是只是在渲染令人信服的视图?这是两种不同的能力,而这个区别对每一个依赖物理规律的应用场景都至关重要。一个能从新角度渲染房间的模型,对电影有用。而一个机器人要学着在其中行走的模型,其中的物体必须按照物体的方式行动,否则策略学到的只是在模型里管用的东西。

World Labs 表示,Atlas 将为 Marble(其现有产品)的未来版本提供动力。这让它有了商业归宿,这一点比大多数研究发布都要强。几何结构在精心策划的演示之外是否站得住脚,将是早期访问合作伙伴最先弄明白的事。

中国的对标者

Atlas 并不是唯一怀有城市级野心的世界模型。9 月 10 日,中国地图公司高德(Amap)发布了 ABot-Earth 0.7,称其为全球首个 3D 原生城市世界模型。它接收卫星影像或文本描述,将其转化为可行走、可交互的 3D 场景,在同一个模型中从行星尺度一直到街道级地标都能多尺度生成。高德称,它可以在消费级 GPU 上约十分钟生成公里级 3D 城市场景,格式为 3D 高斯泼溅,且该能力已在其“飞行街景”(Flight Street View)产品中运行。

两者从相反的方向指向同一个理念。Atlas 从几张照片自下而上,高保真地重建一个房间。ABot-Earth 从卫星数据自上而下,规模化地生成一座城市。两者合在一起,勾勒出一个空间模型所能覆盖的范围,同时也展示出两个市场在交付方式上的差异:一个通过合作伙伴计划发布、没有公开基准,另一个则嵌入消费级产品,任何人都能看到输出结果。

空间模型仍需证明什么

这个领域有势头。Meta 的 V-JEPA 2 在超过一百万小时的视频上训练。谷歌的 Genie 2 生成可交互的 3D 环境,Gemini Robotics 则在物理空间中进行推理与操作。李飞飞的主张——几何与透视必须是模型原生的,而不是从文本推断出来的——已经从一种研究立场变成了一整个产品类别。

但这些都还没有回答的问题是:一个能生成连贯几何结构的模型,是否等同于一个理解物理空间的模型?重建是可测量的。仿真更难,而这恰恰是机器人真正需要的。Atlas 为前者给出了有力的论证。接下来一年的合作伙伴成果,将决定后者能随之实现多少。

对设计师和开发者来说,近期的影响比发布时的措辞所暗示的要温和。一个能从三张照片重建房间、并让你用摄像机在其中穿行的工具确实有用,而它会先出现在创意软件里,再出现在机器人里。空间模型正是以这种方式最先触达大多数人——通过“制作一个场景”的工作,而不是“穿行于一个场景”的工作。

相关文章