Reka Rho-1 將理解與生成放進同一個 KV 快取

大多數多模態系統都是管線式架構。語言模型負責規劃,擴散模型負責算繪,偵測器負責定位,策略網路負責驅動機器人。每一次交接都有成本。狀態必須序列化、在服務之間搬移,並重新編碼成下一個元件所預期的格式。
Reka AI 的 Rho-1 走不同的路線。這款 190 億參數模型於 10 月 5 日以研究預覽形式發布,在單一網路內處理文字、圖像、影片與機器人動作,並將所有內容以符元表示在單一上下文視窗中。沒有工具呼叫,也沒有第二個模型。
Demo 讓差異變得具體。使用者要求一個低空鳥瞰視角,畫面是岩石岬角上紅白相間的燈塔。Rho-1 把它算繪出來。使用者要求在燈塔周圍加上一個方框;它畫了一個。使用者要求將其製作成無人機飛入的動畫;它從剛生成的影像影格生成影片。使用者要求在保持攝影機運動完全相同的情況下加入暴風雪;它編輯了影片。最後,使用者詢問兩段短片之間有什麼變化,模型以文字回答。
那個序列中的每一步都取決於模型仍能存取它先前產生的內容。傳統管線必須在服務之間傳遞影像與影片,並在每個邊界重建上下文。Rho-1 將其保留在同一個注意力上下文中,這就是這條鏈能夠連貫的原因。
兩條串流,一個快取
該架構將每個 transformer 區塊分配給兩個專家權重串流,兩者共享一個注意力運算。理解串流處理語言、內部推理符元與視覺輸入,並由下一符元預測頭輸出離散結果。生成串流則使用流匹配頭,將連續潛在表示去噪成圖像與影片。
兩個串流都從同一個 KV 快取讀取。指令、先前生成的視覺內容、推理符元與馬達命令全都保持可用。一個特殊符元會在有回應需要視覺生成時發出訊號,讓生成串流能從累積的狀態繼續,而不是從頭開始。

模型刻意以兩種格式承載資訊。離散符元處理文字與符號推理。連續表示承載圖像潛在向量、影片影格、機器人動作與本體感覺。讓物理訊號保持連續,可避免將關節位置與速度硬塞進離散詞彙所造成的精度損失。
最後這個細節,正是讓機器人控制的主張不只是行銷話術的原因。預測相機影像的同一組權重也驅動機器人運動,因為兩者存在於相同的表徵空間中。
從另一個方向切入生成
Reka 回報了兩個變體。基礎模型使用 99 個去噪步驟,生成速度中位數為即時速度的 0.79 倍,串流輸出約在六秒後開始。名為 Rho-1 Flash 的蒸餾版本使用八個步驟,約一秒內回傳一段 5.3 秒的短片。Flash 編輯則約在 1.1 秒內重新算繪約一秒的短片。
串流介面可以從先前的潛在狀態延伸短片,並在生成過程中接受新指令。在一段空中演示中,向左傾斜與向右傾斜的指令在生成開始半秒後送達。產生的分支在分岔前共享相同的開頭影格。如果這在受控演示之外也成立,那就是一項真正的能力,因為這意味著導演可以在拍攝中途操控鏡頭,而不必從頭重新生成。
為了繞過機器人訓練資料短缺的問題,Reka 建立了一個逆動力學模型,從一般網際網路影片中擷取控制訊號。它在 320 張 H100 GPU 上訓練共享主幹約三個月,相較於前沿訓練算是規模不大。
運算方面的故事值得強調。以 320 張 H100 訓練一個 19B 模型三個月,以前沿標準來說算是小規模,因為前沿系統會用上數萬個加速器來訓練。如果 Rho-1 在這樣的規模下能實現其架構承諾的一小部分,就意味著下一波多模態能力不需要龐大資本,而較小的實驗室仍能做出結構性貢獻,而不是只在運算資源上競爭。
這在世界模型競賽中的位置
Rho-1 問世的這一週,試圖表徵場景如何演變的模型相當擁擠。InSpatio 發布了 InSpatio-World 1.5,能將單一圖像、全景圖或影片變成可導航的 4D 世界,並在即時互動方法的動態場景基準中名列前茅。Nvidia 開源了 Lyra 2.0,可將圖像轉換成可探索的 3D 環境。Google 與一系列中國實驗室也都在同一條礦脈上工作。
Reka 的角度與重建派不同。那些專案建立的是你可以穿梭其中的場景。Rho-1 試圖建立的模型既能描述場景,也能應要求改變場景,同時還能輸出據以行動的馬達命令。如果成功,同一個檢查點就能驅動機器人,並敘述機器人看見什麼,不需要另外的策略網路或另外的視覺語言模型。
機器人方面的主張最為關鍵,卻也最未經證實。Reka 表示,預測相機影像的同一組權重也驅動機器人運動,而且由於機器人資料稀少,它建立了一個逆動力學模型,從一般網際網路影片中提取控制訊號。如果這個方法成立,它就指向一條繞過具身 AI 最大瓶頸的道路,也就是真實機器人軌跡收集成本高昂且多樣性有限。如果不成立,機器人控制功能就只是一段演示短片。
這次發布也關係到這些系統如何定價。大多數多模態產品會分別針對規劃、圖像生成與影片生成收費,因為每一項都是不同的服務。能在單一上下文視窗中執行這三者的單一模型,會改變任何建構於其上的產品單位經濟效益。這是否會反映在較低的價格上,取決於這個統一模型服務並行請求的效率,而這正是獨立測試能揭露的事情。
仍待驗證的主張
Rho-1 的效能數據來自 Reka 的預覽,目前無法重現,因為沒有公開權重或 API。硬體配置、批次處理、輸出設定與編譯選擇都可能大幅改變影片延遲,因此這些效率數字需要獨立複現,否則意義不大。
這款模型有已承認的限制。原生影片上限為 672x384。長時程結構漂移、影片接地與編輯穩定性,都被該公司自己描述為弱點。這些正是困擾每一個世界模型的相同問題,而一個 19B 網路不太可能徹底解決它們。
這次發布符合朝向世界模型的更廣泛轉變,目標是建立一個能預測場景如何演變並據此行動的系統。Rho-1 的貢獻在於架構:它主張理解與生成應該共享權重與上下文,而不是被拼接在一起。這個主張是否勝出,取決於其他實驗室接下來幾次研究預覽的樣貌,也取決於 Reka 是否推出任何第三方能測試的東西。
相關文章
Cloudflare 推出 270 億參數決策模型,在 Jev 的主場擊敗 Jev
有些模型呼叫應該回傳一個數字,而不是一段文字。一個類別正圍繞這個想法成形。
BOSSFIGHT 讓前沿模型當了 24 週咖啡店老闆,多數輸給了「什麼都不做」
在測驗中拒絕賄賂,與在真實季度中拒絕妥協,是兩種不同的能力,而目前的評測往往只衡量了較容易的那一種。
NASA 與 IBM 開源了以 17 年軌道器資料訓練的月球基礎模型
該模型對於尋找和描述特徵很有用,但對於高精度地指出它們的確切位置則不可靠。
四步取代四十步:蒸餾如何把開放圖像模型塞進消費級 GPU
低步數蒸餾是一種取捨,而非免費午餐。文字保真度、編輯精確度與多參考一致性是最先受影響的部分。