卫星影像正在成为机器人训练数据

要让机器认识一个新地方,最快的途径或许并不是把它开过去。本月发布的两项成果从相反的方向指向了同一个想法。一个把卫星影像变成模拟作业现场,让机器人在真正到场之前先练手;另一个则修正视频世界模型底层的几何结构,让机器人所想象的内容与物体的实际位置相符。
为农业和采矿设备开发自主软件的 Bonsai Robotics 于 10 月 2 日推出了 Bonsai World。该系统以农场、矿区或其他崎岖地形的卫星影像为起点,把这种平面视图转化为结构化的三维模拟。机器随后可以在其中演练真实路径。该公司表示,系统还能叠加车队在现实中尚未碰到的条件,包括扬尘、碎屑、动物、车辆以及地面的变化。
其背后的算力来自一套跨厂商技术栈。Google 的 Gemini 视觉模型读取卫星影像并构建结构化地图。Bonsai 自研的世界模型则基于横跨逾百万英亩采集的 5000 多万条真实样本进行后训练,用来生成地面视角画面。训练在配备 Nvidia A100 GPU 的 Google A2 虚拟机上运行,按需生成环境则使用配备 RTX PRO 6000 Blackwell 服务器 GPU 的 Google G4 机器。最底层则是 Nvidia 的 Cosmos 模型。
其商业论点围绕部署调试时间(bring-up time)展开。要让自主软件适配一种新作物、一台新机器或一个新场地,通常意味着必须到现场采集数据并就地反复迭代,既慢又贵。如果系统能先在一个足够可信的重建环境中演练,机器到场时就离可用状态更近。Bonsai 表示,这一方法减少而非取代实地采集——这是对自身说法较为诚实的版本。
没有人看见的几何问题
用影像做模拟,只有当它生成的三维是真实可信时才行得通。这正是本月发表于 arXiv 的一篇论文有意思的地方。来自捷克技术大学和 Inria 的团队发布了 DepthWorld(已被 Conference on Robot Learning 接收),而它开篇就承认了一件足以削弱大量演示效果的事:当前的视频世界模型仅用 RGB 训练,其生成的推演画面逐帧看都没问题,却无法组合成一个一致的三维世界。
这种失效很容易想象。给一个仅用 RGB 训练的世界模型一个柜门敞开的衣柜场景,它分不清敞开的柜门和实心表面,于是会模拟出机械臂撞上空无一物的地方。如果你用这个模型去评估一条策略,这类错误产生的信号比没有还糟,因为它看起来像一次真实的失败,其实并不是。
该团队的第一项修正针对数据。他们构建了一条标定流水线,把学习得到的立体深度与联合因子图结合起来,将同一台实体机器人采集的所有回合(episode)汇总在一起,使模型能够同时恢复该机器人共用的运动学参数与每个场景的相机外参。将其应用于最大的开放遥操作数据集 DROID,便得到了 DROID-3D:覆盖 7 万多个回合的稠密度量深度与重新标定的多视角外参,其中外部相机在 90% 的回合上重投影误差低于 0.7 像素。
第二项修正针对架构。他们没有重新初始化一个预训练视频模型来加入深度——因为这样做有可能破坏它已经学到的视觉与运动先验——而是把 RGB 与深度并排拼接到一个更宽的潜空间网格中,并扩展位置嵌入以覆盖它。预训练部分保持不动。回报是一个我读到时颇为意外的结果:把深度作为第二个预测目标,反而改善了 RGB 预测本身——在相同训练预算下 PSNR 提升了 1.48 dB。
这个数字为何不止关乎这篇论文
世界模型只有在长时间推演中几何依然成立时,才对规划有用——与 Nvidia 的 PointWorld 的对比正是在这里变得有意思。PointWorld 在短时程上对运动物体的预测更准,但 DepthWorld 随时间退化得少得多:全场景误差从 8 毫米升到 9 毫米,而对方则从 8 毫米升到 18 毫米。对于一个要做数分钟前瞻规划的系统来说,这条曲线比起点更重要。
把 Bonsai World 和 DepthWorld 放在一起看,一种规律便浮现出来。物理 AI 训练的瓶颈已不再是算力,甚至也不是模型能力,而是合成世界的质量,具体说就是其中的几何是否具备度量尺度、是否经过标定、是否稳定。这首先是一个数据工程问题,其次才是建模问题。DROID-3D 的贡献是一条流水线,而不是一种架构:它从一个原本并非为此设计的数据集中恢复出毫米级精度的相机位姿,靠的是汇总多个回合,而不是信任任何单个回合。
什么会变好,什么不会
这些收益是真实的,也是有限的。Bonsai World 适用于有卫星影像可用、且地形是主要变量的结构化户外环境。这很好地覆盖了农业和露天采矿。但对杂乱的厨房或医院走廊就很无力,因为这些空间无法从轨道上看到,其难点来自物体,而不是地面。该公司自己的措辞——崎岖且非结构化环境——既是范围声明,也是市场描述。
DepthWorld 的局限恰好相反。它在你能从同一台机器人获得大量回合、并汇总其标定结果时表现最好,而这正是研究实验室的标准配置,在硬件混杂的实际车队中并不常见。论文自身的基准也只用了单一开放数据集。
还有一个值得点出的验证缺口。Bonsai 在发布时并未公布独立的实地性能数据,也没有开放模型权重。在公司之外有人测试之前,这个世界模型只是一个说法。DepthWorld 的代码与数据集则是相反的情况:一篇已发表的论文、一个被接收的会议、一条可复现的流水线——这也是为什么即便没人使用这特定一个模型,它也很可能影响其他团队构建自己世界模型的方式。
真正该让机器人团队担心的部分
如果合成环境成为预训练自主系统的默认方式,那么模拟的质量就会成为众多部署中的单点故障。生成器中固化的偏差——无论关乎光照、地形还是障碍物分布——都会传播到每一台在其上训练过的机器中,而且这种传播是看不见的,因为失败的机器根本到不了实地,无从暴露问题。
这就是为什么即便合成版本看起来很可信,也仍应在流程中保留一部分真实世界的数据采集。实地数据的价值来自它提供的样本,更重要的是它对模拟器形成的检验。本月这两项成果都在这一点上推动了领域前进:一个让模拟环境的生成变得廉价,另一个让其中的几何变得诚实。但两者都没有消除最终必须把机器开出去、看它实际表现如何的必要。