← 返回部落格
News預計閱讀 7 分鐘

七所大學聯合開源 OpenWAM:機器人不只要「看見」,還要「預判下一秒」

發布於 2026年10月6日
七所大學聯合開源 OpenWAM:機器人不只要「看見」,還要「預判下一秒」

十月初,一個由新加坡國立大學、清華大學、北京大學等七所大學研究人員組成的團隊,把 OpenWAM 放上了 GitHub 和 Hugging Face。專案定位很明確:面向世界動作模型(World Action Model,WAM)的開源研究全端,外加一個基座模型。論文已經上 arXiv,編號 2609.07398,儲存庫到十月一日大約 940 顆星。

這則消息在國內的傳播不算慢,但真正值得多看一眼的地方,是它想解決的那個老問題:機器人光辨識出眼前是什麼,並不夠用。

傳統模擬器把物理和視覺分開算

過去開發機器人策略,常見兩條路。一條是直接從機器人示範中同時學習視覺規律與控制訊號,另一條是先透過圖像文本預訓練,把語義和語言知識帶進來,這就是 VLA 路線。

世界動作模型走了第三條路:先從影片生成預訓練中繼承「世界會怎麼變」的先驗,再透過具身經驗學習「在這個世界裡該做什麼」。聽起來像繞遠路,但它迴避了模擬與真機之間那道老裂縫。傳統模擬器的物理和視覺往往各算各的,動作效果和畫面觀感對不上;OpenWAM 的做法是讓模型直接從資料中學習「動作如何改變世界」,再據此預測物體位置、場景語義和任務狀態。

拆成三層,讓實驗可重現

團隊把問題拆成三層,每一層對應一個元件。

OpenWAM-Infra 是模組化基礎設施,把可組合模型、訓練執行環境、部署執行環境和評測協定四層解耦。這一層的作用是把世界動作模型從緊耦合的單一實作,變成可以替換零件的實驗台。

OpenWAM-Study 負責沉澱設計規律。它不做模型,做的是受控實驗,用一組組對照把「什麼樣的設計有效」變成可重現的結論。

OpenWAM-α 是基座模型本身,在大規模人類第一人稱視角影片和機器人資料上驗證整套方案。

三條設計原則,每條都有對照數字

這類論文最怕全是口號。OpenWAM 給的三條結論都附帶了對照實驗。

第一條,需要足夠強的生成式世界先驗。14B 影片骨幹拿到 93.79%,1.3B 只有 90.14%;預設配置選了 5B,比 14B 只低 1.4 個百分點。配上 DINOv3 與 S-VAE 壓縮出的緊湊視覺潛空間,效果接近 Wan2.2 內建的 VAE。

第二條,訓練時必須建立明確的世界到動作資訊流。讓「動作流看見世界流」,準確率 92.39%;改成孤立遮罩只有 87.41%,差了整整 5 個百分點。推論時同步聯合去噪效果最好。

第三條,資料要分來源使用。機器人資料負責保住動作的 grounding,人類第一人稱視角影片負責擴大世界的涵蓋範圍,單階段協同訓練把兩者整合。有意思的是,預訓練域內提升有限,分布外(OOD)成功率卻從 14.50% 提升到 26.62%。

基座模型的實際規格

OpenWAM-α 由兩部分拼成:Wan2.2-TI2V-5B 擔任影片流,再掛上一個 1B 的動作 DiT。動作空間統一成 80 維,相容 17 個物理平台。預訓練資料 14300 小時,其中人類第一人稱視角占 30%,合成資料 30%,真實資料 40%。

淺色木工台上的一頁空白實驗記錄紙,旁邊並排三枚拋光金屬關節元件

推論速度上,RTX 5090 上單個動作區塊 170 毫秒。評測涵蓋 LIBERO、RoboTwin2.0、RoboDojo 等 8 個模擬基準,形態從單臂、雙臂到移動操作和靈巧手。EBench 的移動雙臂項目上,它目前是最佳,領先第二名約 4 個百分點。真機驗證用 Franka 單臂跑了六個任務,平均成功率 82.5%,高於 LingBot-VA 的 77.5% 和 π0.5 的 55.0%,其中兩項做到 100%。換成訓練時沒見過的靈巧手,微調後也全面超過 π0.5。

它沒有宣告 VLA 出局

論文裡有一段結論值得單獨提出來:WAM 靠未來影片潛變數做監督,在分布內更貼合;VLA 在分布外擾動下更穩健。兩者勝負未分。

這句話比「某個典範已死」要誠實得多。讀論文的人容易只記住分數,其實更該記住的是這句:兩條路線現在各有所長,還沒有到可以一錘定音的時候。

門檻被壓低了一檔

放在更大的背景裡看,世界模型這條線上,Google 的 Gemini Robotics 2 喊出「一個大腦,適用於任何機器人」,NVIDIA 的 Jim Fan 拋出「VLA 已死,世界動作模型當立」。十月三日,NVIDIA 又擴展了開放物理 AI 堆疊,把 Cosmos 世界模型、Isaac Lab Arena、自動駕駛的 Alpamayo、編排工具 OSMO 和 OpenUSD 函式庫一起放出,Caterpillar、LEM Surgical、Neura Robotics 都成了首批使用者。十月四日,浙江杭州雲深處科技的多台人形機器人走上街頭,測試路口交通指揮和遊客諮詢,雨天也在跑。

在這樣的密度下,大學把全端底座開源,等於把這個方向的門檻壓低了一檔,也讓「用影片學世界、用軌跡學動作」成為更公開的路線。

它不是拿來直接部署的

需要說清楚的是,OpenWAM 的定位是研究基礎設施,不是開箱即用的產品。官方 README 建議準備約 640GB 訓練資料,環境容量約 6.5GB,儲存庫仍在活躍變動。它適合已有 GPU 和資料、想在此基礎上做世界動作模型研究的團隊,不適合拿來做小規模落地的場景。

後續值得盯的觀察點也很具體:這批研究的重現率有多高,半年之後還有多少人在上面提交改進,以及有沒有團隊真的把它微調進產品線。發布當天的熱度會散去,能留下來的是那些還在被使用的程式碼。

相關文章