李飛飛的 Atlas,把一張照片變成你能走進去的房間

World Labs 於 9 月 1 日開放 Atlas 的早期試用。這家由李飛飛共同創辦的公司把它稱為用於空間智慧的「全方位世界模型」(omni world model),而示範的內容很簡單:輸入幾張用普通手機拍攝的房間照片,輸出的則是一個可互動的 3D 場景。你可以讓虛擬攝影機在其中任意移動,可以從中讀取深度資訊,也可以把這份幾何資料交給機器人,當作練習的場地。
李飛飛多年來一直主張,AI 的下一個前沿不是語言,而是物理世界。她用的詞是「空間智慧」,而她的主張是:只靠文字與平面影像訓練的模型,漏掉了某種根本的東西。語言模型描述的是它們看不見的世界。Atlas 是目前為止最清楚的一次嘗試,要打造出真正看得見的模型。
Atlas 能做什麼
World Labs 將 Atlas 描述為一個多模態自迴歸擴散 Transformer,單一架構就能在同一個空間框架內接收文字、圖像、影片與 3D 資料,並在同一組模態上進行生成。它的輸出範圍比影片生成器更廣:可控制攝影機的圖像,以及最高 1440p、長度約一分鐘的影片,另外還有新視角、深度圖、點雲與 3D 高斯潑濺(3D Gaussian splats)。
體積化的輸出正是它與文生影片模型的分野。影片生成器預測的是下一格畫面,它未必知道任何東西在空間中的位置,也不知道從攝影機從未佔據過的角度看去,場景會是什麼模樣。Atlas 內部帶有 3D 表徵,因此當觀看者在其間移動時,整個環境仍能保持一致。一段看起來合理的影片片段,與一個可以走進去探索的空間,兩者的差別正是它被稱作世界模型的重點所在。
面對稀疏的輸入——在某些示範中只是幾格手機影片——這個模型重建場景的精確度已足以把虛擬攝影機放進去。World Labs 回報的稀疏視角重建誤差為 25.3,低於最佳專用模型的 28.7。在它委託進行的盲測中,人類評分者認為 Atlas 對指定攝影機運動的遵循程度優於 MiniMax H3 的比例為 75%、優於 Gemini Omni Flash 為 81%、優於 Seedance 2.5 則為 94%。
這些都是該公司自己在自家評估中得出的數字,這一點必須直說。Atlas 仍在早期試用階段,因此合作夥伴以外的任何人都還無法重現這些結果。
從真實到模擬(real-to-sim),以及機器人為何在意
最顯而易見的商業應用是視覺特效、遊戲與虛擬製作。電影工作者可以在拍攝完成之後再重新安排鏡頭。不過,World Labs 主打的框架是機器人。
這套流程叫做 real-to-sim。你拍下真實空間的影片,Atlas 把它轉換成 3D 模擬環境,機器人可以在其中接受訓練或測試,而不必承擔操作實體的成本與風險。機器人團隊若想要一千種變化的倉庫走道,只要掃描一次走道,再生成各種變化即可,不必逐一拍攝。
這是個範圍狹窄但真實存在的痛點。機器人的訓練資料之所以昂貴,是因為蒐集資料就意味著要實際操作機器人。模擬很便宜,但通常得有人手工建構環境,既慢,成果又往往跟真實地點毫不相像。一個能把真實房間變成模擬檔案的模型,等於把兩個昂貴的步驟壓縮成一個。這也解釋了輝達(Nvidia)與超微(AMD)為何是投資方——兩家賣的都是訓練與模擬所仰賴的算力。
資訊揭露的問題
雄心與書面資料之間存在落差。World Labs 在發布 Atlas 時沒有發表任何研究論文、模型卡、參數量,也沒有訓練算力的數字。它沒有公布價格,也沒有公布正式上市日期。對於一個拿有完整文件紀錄的競爭對手來做比較的系統而言,這種省略並不尋常,也讓那些盲測結果無從查核。
懷疑者提出了更尖銳的問題:Atlas 究竟是真的在模擬世界,還是只是在渲染以假亂真的視角?這是兩種不同的能力,而這個區別對每一個仰賴物理的應用情境都很重要。一個能從新角度渲染房間的模型,對電影很有用。但一個要讓機器人學會在其中行走的模型,必須讓裡面的物體表現得像物體,否則學到的策略只在模型裡行得通。
World Labs 表示,Atlas 將驅動其現有產品 Marble 的未來版本。這讓它有了商業上的歸宿,而這是大多數研究發表所沒有的。至於這套幾何表現能否在精心策劃的示範之外站得住腳,將是早期試用夥伴最先知道的事。
中國的對應方案
Atlas 並不是唯一懷抱城市級野心的世界模型。9 月 10 日,中國地圖公司高德(Amap)發布了 ABot-Earth 0.7,自稱是全球首個 3D 原生城市世界模型。它接收衛星影像或文字描述,將其轉換成可行走、可互動的 3D 場景,並在同一個模型內生成從行星到街景地標等多種尺度。高德表示,它能在消費級 GPU 上以約十分鐘產生一公里規模的 3D 城市場景,格式為 3D 高斯潑濺,而這項能力已實際運行於其 Flight Street View 產品中。
兩者從相反的方向指向同一個構想。Atlas 從少數幾張照片由下往上建構,高保真地重建一個房間。ABot-Earth 則從衛星資料由上往下生成,產出大規模的城市。兩者合起來勾勒出空間模型所能涵蓋的範圍,也顯示出兩個市場的出貨方式有多不同:一個透過合作夥伴計畫發布,沒有任何公開基準;另一個則嵌入消費級產品,任何人都能看到輸出結果。
空間模型還得證明什麼
這個領域氣勢正盛。Meta 的 V-JEPA 2 用了超過一百萬小時的影片訓練。Google 的 Genie 2 能生成可互動的 3D 環境,Gemini Robotics 則專注於物理空間中的推理與操作。李飛飛的主張——幾何與視角必須是模型的原生能力,而不是從文字推斷而來——已經從一種研究立場變成一個產品類別。
但這一切都還沒回答的是:一個能產出一致幾何的模型,是否等同於一個理解物理空間的模型。重建是可以量測的。模擬更難,而它才是機器人真正需要的。Atlas 為前者提出了強而有力的證據。接下來一年合作夥伴的成果,將決定後者能隨之實現多少。
對設計師與開發者而言,近期的實際影響比發表時的措辭來得溫和。一個能從三張照片重建房間、讓你用攝影機在其中穿梭的工具確實有用,而它會先出現在創作軟體裡,然後才出現在機器人裡。空間模型就是這樣先觸及大多數人——透過打造場景的工作,而非穿梭其間的工作。