衛星照片如今成了機器人的訓練資料

要讓機器認識一個新場地,最快的途徑或許不是把它開過去。本月發布的兩項成果從相反方向指向同一個概念。其一將衛星影像轉換為模擬的工作場址,讓機器人能在抵達前先行演練。其二則修正影片世界模型底層的幾何結構,使機器人所想像的內容與物件的實際所在相符。
為農業與採礦設備打造自駕軟體的 Bonsai Robotics,於 10 月 2 日推出 Bonsai World。該系統以農場、礦場或其他崎嶇地形的衛星影像為起點,把這份平面視圖轉換成結構化的 3D 模擬環境。機器接著可在其中演練真實路徑。該公司表示,系統還能疊加機隊在現實中尚未遇過的狀況,包括粉塵、碎屑、動物、車輛以及變動的地面。
其背後的運算是一套跨廠商的堆疊。Google 的 Gemini 視覺模型負責讀取衛星影像並建立結構化地圖。Bonsai 自家的世界模型則以橫跨逾百萬英畝、超過 5,000 萬筆真實世界樣本進行後訓練,用來生成地面視角的畫面。訓練執行於搭載 Nvidia A100 GPU 的 Google A2 虛擬機器,而隨需產生的環境則使用配備 RTX PRO 6000 Blackwell 伺服器 GPU 的 Google G4 機器。Nvidia 的 Cosmos 模型則位於底層。
商業上的論點在於導入所需的時間。要讓自駕軟體適用於新作物、新機具或新場址,通常意味著得蒐集田野資料並針對地點反覆調整,既緩慢又昂貴。若系統能先對著一份合理的重建模型進行演練,機器到位時就更接近可用狀態。Bonsai 表示,這套做法是減少田野資料蒐集而非取而代之——這是這個說法誠實的版本。
沒人看見的幾何問題
從影像生成的模擬,唯有在產出的 3D 忠於現實時才行得通。這正是本月發表於 arXiv 的一篇論文有趣之處。來自捷克理工大學與 Inria 的團隊發布了 DepthWorld,該論文獲機器人學習會議(CoRL)接受,而它開頭就坦承一件戳破許多展示的事實:現今的影片世界模型僅以 RGB 訓練,產生的推演逐格看起來正確,卻無法組構成一致連貫的 3D 世界。
這種失敗不難想像。給一個只吃 RGB 的世界模型一個敞開衣櫃的場景,它分不清敞開的櫃門與實心表面,於是模擬出機械手臂撞上空氣的情況。如果你用這種模型來評估策略,這類錯誤產生的訊號比無用更糟,因為它看起來像真的失敗,實際上卻不是。
該團隊的第一項修正著手於資料。他們建構了一套校正流程,將學習式立體深度與聯合因子圖結合,把同一台實體機器人蒐集到的每一段 episode 彙整起來,讓模型能在還原每個場景相機外參的同時,一併推得該機器人共通的運動學參數。應用於 DROID——最大的開放遙操作資料集——之後,產出了 DROID-3D:涵蓋超過 70,000 段 episode 的稠密公制深度與重新校正的多視角外參,其中外部相機在 90% 的 episode 上重投影誤差低於 0.7 像素。
第二項修正屬於架構層面。他們沒有重新初始化一個預訓練影片模型來加入深度,因為那可能破壞它已學到的視覺與運動先驗;取而代之,他們把 RGB 與深度並排鋪設在更寬的潛在網格中,並延伸位置嵌入以涵蓋這個更大的網格。預訓練的部分維持不動。回報是我讀到時頗感意外的結果:把深度當作第二個預測目標,竟讓 RGB 預測本身也變好,在相同訓練預算下 PSNR 提升 1.48 dB。
這個數字為何超越論文本身的意義
世界模型只有在長時間推演中幾何仍站得住腳時,才對規劃有用,而這正是與 Nvidia 的 PointWorld 相比較時有趣的地方。PointWorld 在短時間尺度下對移動物體更準確,但 DepthWorld 隨時間劣化的幅度小得多:整體場景誤差從 8 毫米增至 9 毫米,而對方則從 8 毫米增至 18 毫米。對於要規劃數分鐘之後行動的系統而言,曲線比起點更重要。
把 Bonsai World 與 DepthWorld 放在一起看,一個模式就浮現了。物理 AI 訓練的瓶頸已不再是算力,甚至也不是模型能力。瓶頸變成了合成世界的品質,尤其是其中的幾何是否為公制、經過校正且穩定。這在本質上是資料工程問題,而非建模問題。DROID-3D 的貢獻是一套流程而非架構:它從一個從未被設計來提供相機姿態的資料集中,還原出毫米級精確的相機姿態,而且是靠彙整多段 episode 而非信任任何單一 episode 來達成。
改善了什麼,又沒改善什麼
這些進展是真實的,但範圍狹窄。Bonsai World 適用於有衛星影像可取得、且地形是主要變數的結構化戶外環境。這很好地涵蓋了農業與露天採礦。但它對雜亂的廚房或醫院走廊則涵蓋得很差,因為這些空間從軌道上看不見,而其難度來自物件而非地面。該公司自己的說法——嚴苛且非結構化的環境——既是市場描述,也是一份適用範圍的聲明。
DepthWorld 的局限則相反。它在你能取得同一台機器人的大量 episode、並能彙整其校正參數時表現最好,而這正是研究實驗室的配置,在硬體混雜的實際部署機隊中則較少見。該論文自己的基準測試也只是一個開放資料集。
還有一個值得點名的驗證落差。Bonsai 在發布時並未公布獨立的實地效能量測,也未公開模型權重。在有人在公司外部測試之前,這個世界模型都還只是宣稱。DepthWorld 的程式碼與資料集則恰恰相反:一篇已發表的論文、一個獲接受的會議場地,以及一套可重現的流程——這也是為什麼即使沒人使用這個特定模型,它仍可能影響其他團隊如何打造自己的世界模型。
機器人團隊該擔心的部分
若合成環境成為預訓練自駕能力的預設做法,那麼模擬的品質就會成為橫跨眾多部署的單點失效。生成器中內建的偏誤——無論是關於光照、地形還是障礙物分布——都會傳播到每一台以此訓練的機器,而且是隱形地傳播,因為失敗的機器根本沒機會上場揭露這個問題。
這正是為何即便合成版本看起來很有說服力,仍應在流程中保留一部分真實世界資料蒐集的理由。實地資料的價值來自它提供的範例,更重要的是,來自它對模擬器構成的檢核。本月這兩項發布都在這方面推動了領域前進:一個讓模擬環境的生成變得便宜,另一個讓其中的幾何變得誠實。兩者都沒有消除最終仍得把機器開出去、看看它表現如何的必要。
相關文章
Google 的 Gemini 3.5 Live Translate 消除了停頓
翻譯連續不斷地運作,用講者自己的聲音,在你口袋裡本來就有的手機上進行,讓這項功能從你得另外打開的東西,變成一直開著的東西。
中國制定首部 AI 代理強制性安全標準
安全不再是你拿來宣傳的功能,而是必須通過的關卡。風險清單共 13 個類別、97 個項目。
AI 生成的內容開始要表明身分了
這一步不解決所有問題,但它把「AI 生成」從一個可以隱瞞的選項,變成了一個必須回答的問題。
阿里巴巴的 SearchQwen3-8B,以及小型搜尋代理的價值
這個模型是搜尋代理,不是搜尋引擎。大多數搜尋代理的呼叫都是例行性的,而例行性工作最適合由小型模型來做。