語言與視覺,一個框架搞定:地平線的 16 億參數開源模型

來自華中科技大學、北京交通大學與地平線機器人(Horizon Robotics)的一篇論文,提出了一個聽起來幾乎太過基本、以至於稱不上新穎的想法:用單一模型,把語言與影像當成同一類東西來處理。
這個框架名為 Multimodal Flow,簡稱 MF-1,完全開源。最大的版本有 16 億參數,以 1,500 億個預訓練 token 訓練而成。它在 GenEval 上拿下 82.8 分,在 DPG-Bench 上拿下 75.3 分,讓一個規模不大的模型得以與體積遠大於它的多模態系統並列。
一句話說清楚這個想法
大多數多模態模型都是拼裝出來的。一個文字模型加一個影像模型,或是一個語言主幹外掛獨立的視覺元件,透過離散 token 或各自獨立的編碼器來回傳遞表徵。MF-1 不這麼做。它把文字與影像放在共享的嵌入空間中一起建模,並以 Flow Matching 作為兩者共用的單一生成目標與取樣程序。

這才是真正有趣的主張。模型不是在模態的邊界上進行轉譯,而是在同一個連續表徵上運作,語言與視覺在其中並非本質上不同的物件。作者主張,這麼做能避開目前主流做法中離散式與混合式方法的弱點。
如果這個主張站得住腳,回報就是通用性。單一框架同時處理語言建模、視覺理解、影像生成、編輯與影片序列,在訓練、擴充與推理上都比一串專才組成的流程簡單得多。它也指向一個未來:其他模態,任何能被表示為有序連續區塊的輸入,都能套進同樣的結構,而不需要重新設計。
想要這個結果,除了優雅之外還有實務上的理由。每當你把一個新模態接到系統上,就多了一個要維護的介面,也多了一個錯誤會悄悄累積的地方。把視覺編碼器串接到語言模型,意味著影像必須被摘要成語言模型能理解的 token,而這個摘要過程會丟失資訊。共享表徵跳過了轉譯這一步,而多模態系統中許多細微的品質流失,正是發生在這裡。
作者名單上的那個名字
作者名單中有一個細節值得再多看一眼。作者之一包括地平線機器人創辦人、曾任百度深度學習體系架構師的余凱,以及共同創辦人黃暢。通訊作者則是華中科技大學視覺實驗室的王興剛。
余凱出現在論文作者名單上並不尋常。自 2016 年以來,他極少發表論文;那一年他參與了早期一項統一自然場景文字偵測的嘗試。如今他再度現身,在一篇談語言與視覺統一的論文上,讀起來像是刻意回到十年前處理過的問題,而時機正好是產業終於擁有讓它成真的算力與資料。
他早先在一次演講中有一句話很能說明問題:VLA、VLM、端到端、世界模型這些流行詞,在商業上的意義往往大於技術上的意義,而認真的團隊大致上都在做類似的事。一篇把其中幾個類別收攏進同一個生成框架的論文,與這種看法一致。這是在主張:標籤不如底層機制重要。
為什麼小與開源才是重點
一個 16 億參數、且表現具競爭力的模型之所以值得注意,原因和其他實驗室推出的小模型一樣:每參數能力(capability per parameter)才是決定什麼能跑在本機、什麼能跑在手機上、以及一個小團隊負擔得起微調什麼的指標。
以尖端標準來看,1,500 億個訓練 token 也算節制,這意味著這個方法靠的是效率,而不是暴力堆疊。這種效率能否在更大規模下維持,是尚未解答的問題。一個小模型表現良好,能說明方法的一些事,但不是全部。
開放權重在此有其特定理由。統一生成框架唯有在其他人能擴充它、在作者沒試過的模態上測試它、並以這個共享表徵為基礎繼續建造時,才最有用。封閉版本會是一篇有趣的論文;開放版本則是一件工具。
基準測試沒有涵蓋的部分
GenEval 與 DPG-Bench 衡量的是模型把提示詞轉成影像的忠實程度。它們完全沒有說明統一表徵是否提升了模型同時對文字與影像進行推理的能力,而後者才是真正的主張。一個模型可能在影像保真度上得分很高,實際上卻把兩種模態當成剛好共用同一種數字格式的兩個獨立子系統。作者清楚這個落差,而論文真正的論證在架構裡,不在分數上。對任何評估這項工作的人來說,正確的問題是:共享表徵是否改變了那些需要兩種模態同時參與的任務上的行為,而這正是基準測試沒有測到的部分。
誠實面對的未知
把多個模態統一在一個空間裡是個很強的主張,而強主張必然招來檢視。基準分數是真的,但它們衡量的是影像生成的保真度,而不是共享表徵是否真的如論述框架所暗示的那樣,幫助模型跨模態推理。拿到漂亮的 GenEval 分數,同時模型只是把文字與影像當成嵌入空間裡的鄰居、而非真正同一種材料,這是有可能的。
另一個未知是規模。連續的統一表徵在歷史上一直有理論上迷人、實作上頑固的問題,因為訓練訊號可能比離散架構更難穩定。一個 16 億參數的成功令人振奮,但還稱不上定論。
下一步指向哪裡
最明顯的延伸是影片與音訊,兩者都是連續訊號,因此天然適合建立在連續表徵上的框架。作者對此有所暗示,把任何能表示為有序連續區塊的模態都視為可納入的範圍。如果這個方法站得住,回報就是單一流程,團隊可以把它擴充到原作者從未觸及的模態。這正是開放權重在此的承諾:不是完成品,而是別人能彎折以解決自己問題的基礎。
更大的格局
這件事值得關注的地方,與其說是模型,不如說是方向。這個領域花了多年,在各自獨立的文字與視覺系統之間搭建越來越精巧的橋樑。MF-1 押注的是這些橋樑根本沒必要,正確的做法是停止把語言與影像視為彼此陌生,改把它們放在同一個立足點上建模。
如果這個賭注押對了,實際後果會是最好那種無聊:一套框架、一個訓練目標、一組工具,套用到你下一個需要的任何模態上。如果押錯了,它仍然是一個由在此領域耕耘已久的團隊所執行良好、並以開源形式釋出、可供檢驗的實驗。
不論是哪一種,有趣的是:看了這個問題十年的人,選擇在此刻再次進攻它,而且選擇用一個開放的小模型,而不是龐然大物。這種組合通常是個訊號,代表有人相信真正一直缺的是方法,而不是規模。