← 返回部落格
Ai預計閱讀 10 分鐘

Runway 的 Praxis-1 賭注:以影片預訓練作為通往機器人大腦的捷徑

發布於 2026年10月2日
Runway 的 Praxis-1 賭注:以影片預訓練作為通往機器人大腦的捷徑

每個懷抱認真部署企圖心的機器人計畫,都會撞上同一道牆,而這道牆不是硬體牆。真實世界資料稀缺,且要以通用策略所需的規模來蒐集,成本極為高昂。對於充滿邊緣案例的領域,包括自動駕駛、家用機器人,以及在雜亂環境中的倉儲工作,根本沒有實際可行的方法能蒐集到足夠示範資料,用來訓練出能應付實際狀況的模型。

Runway 於 9 月 30 日發表 Praxis-1,其論點就從那道牆開始。Praxis-1 是一個開放權重的世界動作模型,能將 Runway 的大規模影片預訓練轉化為真實機器人的控制策略。該公司正與早期合作夥伴 Noble Machines、Standard Bots 和 Ultra 進行測試,由各方在自己的硬體上運行該模型,並計畫在未來幾個月內以開放權重公開發布。

以影片取代遙操作

這個前提一旦說出口,其實很直接。影片實際上無窮無盡,而且隨著生成式模型在品質與速度上逐漸追平真實影像,影片只會更多。人們每天拍攝並上傳的日常生活片段,比任何機器人實驗室能透過遙操作示範捕捉到的都還多。如果模型能從這些影像中學到物理世界的結構,瓶頸就會從稀缺的機器人資料,轉移到充沛的一般影片。

讓這個說法有份量的是實證。Runway 報告指出,在其世界模型內模擬機器人策略,能以 0.95 的相關性預測真實世界結果,相較於更昂貴、以 3D 重建為基礎的技術更為有利。一個能當作忠實測試環境使用的世界模型,會改變策略開發的經濟效益,因為評估不再需要每一次迭代都動用實體硬體。

該公司也發現,隨著第三人稱影片規模增加,策略效能會隨之提升,並得出結論:一個有能力策略的瓶頸,在於模型能訓練多少一般影片。這正是推動語言模型的同一套擴展論證,如今套用到馬達控制上。相較於僅以動作資料打造的策略,一個已從影片預訓練理解物理合理性與物體行為的策略,起跑位置要強得多。

賭注背後的架構

Praxis-1 建立於同一套影片預訓練之上,而這套預訓練也催生了 Runway 的通用世界模型,以及 Solaris 與 GWM Worlds 系列等互動式即時作品。這條血脈的邏輯很重要。教導模型物體如何運動、手如何移動,以及任務進行到一半時看起來是什麼樣子,能為數位與實體環境中的代理訓練創造動態環境。

Runway 將此定位為一種複合優勢。模型從影片中越理解世界如何運作,就越能在不同於訓練時所見環境的情況下控制機器人。其宣稱目標是為機器人開發者與研究人員提供一個通用策略模型,能跨越任何具身形態或環境運作,而不是只針對單一機械臂或單一夾爪調校的策略。

這種雄心正是懷疑論者切入之處。「能跨越任何具身形態運作」是個很強的主張,而目前證據來自三個具名合作夥伴在自家硬體上運行該模型,且還是在更廣泛發布之前。0.95 的相關性數字,衡量的是 Runway 世界模型內部的模擬與真實世界結果之間的關係,這既是對策略的驗證,也同樣是對模擬器的驗證。兩者都有用,而在現階段,兩者都是 Runway 自家提出的數字。

為何採用開放權重,以及這為何是戰略論述

Runway 以開放權重而非封閉模型的形式推出 Praxis-1,而對一家多數模型都維持專有的公司來說,其理由罕見地明確。公告將此事定調為美國在物理 AI 上的競爭力問題:要重奪製造業領導地位、加速生產力,並鞏固盟友,用 Runway 的話來說,將需要美國模型展現出目前實體應用場景尚不存在的互通性與開放程度。

這是一種帶有政策色彩的論述,且正好落在當前關於 AI 堆疊該有多開放的激烈辯論之中。就機器人領域而言,支持開放權重的理由比前沿語言模型更強。硬體開發者需要在自家機器上、用自己的感測器與致動器運行策略,而要求把這些訊號送到外部的雲端 API 並不適合。開放世界模型能給硬體製造商帶來託管模型無法提供的彈性與控制權。

公告中還有一個沒有明說的競爭面向。開放權重影片與世界模型的許多動能,都來自中國實驗室。一家知名美國公司在同一類別中推出開放權重,某種程度上可解讀為試圖在別人之前先定義生態系的重心。

0.95 的相關性是個很強的數字,值得進一步解讀。它意味著當 Runway 在世界模型內運行候選策略並衡量其表現時,真實機器人的表現幾乎相同。如果這在各種任務中都成立,實際後果就是機器人團隊可以在模擬中進行大部分實驗,並把實體硬體保留到最後檢查。考量到實體試驗既昂貴又緩慢,這會是「一週跑一百次迭代」與「一個月跑少數幾次」之間的差別。

更難的問題是泛化。影片教會模型世界看起來如何、物體傾向如何表現,但機器人還需要知道,面對特定機械臂、特定任務,以及特定容錯程度時該怎麼做。Runway 的論點是,經影片訓練的先驗知識能減少達到目標所需的任務特定資料量。這聽來合理,但尚未在大規模上獲得驗證。

這在更廣泛的機器人競賽中處於何種位置

Praxis-1 問世之際,正值人形與製造機器人從展示走向部署的一年。Figure 一直在訓練退役人形機器人執行極端任務。人形機器人製造商紛紛與車廠簽署工廠試點,Boston Dynamics 也開始在 Hyundai 廠區內測試其 Atlas 機器人,並計畫在 2030 年前大規模部署。共同點在於,能力的進步速度比餵養它的資料管線更快。

Runway 的貢獻在於主張資料管線問題有捷徑,而這條捷徑穿過影片。如果模擬與真實結果之間的相關性在合作夥伴與任務間都成立,實際效果就是機器人團隊可以在世界模型中迭代、把實體測試保留到最終驗證,並從一種會自行持續成長的資料類別中學習。

這是個有意義但尚未證實的主張。該公司正提供發表前使用權限給部分合作夥伴,並邀請研究人員在自家硬體上測試。真正重要的證據不會是 Runway 內部工作得出的相關性數字,而是獨立實驗室是否能重現結果,以及一個主要用第三人稱網路影片訓練出的策略,能否處理它從未見過的任務、在它從未到過的房間裡。這才是決定影片預訓練會成為機器人大腦的預設基礎,或仍只是有趣研究方向的那場測試。

相關文章