PixelUMM 捨棄了所有視覺 AI 模型都依賴的兩個元件

10 月 1 日,一位以 CongWei1230 為名發表作品的開發者發布了 PixelUMM,這是一款無編碼器(encoder-free)的多模態模型,能直接在像素空間中處理影像與影片的理解與生成。程式碼與訓練完成的權重皆已公開。真正有意思的地方,在於這個模型「沒有」包含什麼。
過去幾年建構的視覺 AI 系統大多共享兩個元件。變分自編碼器(VAE)會把影像壓縮成精簡的潛在表徵,生成模型則在這個壓縮空間中運作,而非直接在原始像素上作業。另外,視覺 Transformer(ViT)會把影像切成圖塊(patch),讓語言模型得以對其推理。PixelUMM 把兩者都捨棄了。它移除了用於生成的潛在空間,以及用於理解的圖塊編碼器,直接處理像素。
這是一項架構層面的主張,而值得思考的是:為什麼幾乎其他所有人都保留了這兩個元件。
這兩個元件原本負責什麼
VAE 的存在,是為了讓生成變得可負擔。一張 1024×1024、三個色彩通道的照片大約有三百萬個數值。每一步都對三百萬個數值執行擴散過程所費不貲,因此 VAE 會把影像壓縮成較小的潛在網格,模型便在那裡進行去雜訊。代價是 VAE 引入了有損的瓶頸。細膩的細節與精準的文字渲染往往在壓縮過程中流失資訊,這也是早期影像模型難以處理細小文字的原因之一。
ViT 的存在則是為了讓理解成為可能。語言模型消費的是 token,而 ViT 會把影像轉換成一連串看起來像 token 的圖塊嵌入。多模態模型正是靠這個方式回答關於圖片的問題。代價是圖塊網格是固定的,而圖塊交界處的資訊可能變得混亂。

PixelUMM 的賭注是:同時捨棄兩者之後,它能把理解與生成統一到同一個框架中,並避開這兩個元件各自引入的失真。
為什麼這件事很難
像素層級的擴散並非新構想,卻一再撞上算力這道牆。潛在模型去雜訊的對象是 128×128 的潛在網格,像素模型去雜訊的對象則是 1024×1024 的影像網格,每一步要處理的位置數量約為前者的 64 倍。序列長度暴增,注意力運算成本則隨序列長度的平方成長,結果就是多數實驗室不願意為了中等程度的品質提升,而支付這樣的訓練與推論帳單。
無編碼器的理解則有另一種問題。要訓練模型直接在原始像素上推理,意味著模型必須從零開始學習視覺特徵,而不是從預先訓練好的視覺編碼器出發。這需要補回大量的監督訊號,而效益是否大於成本,並非顯而易見。
PixelUMM 押注的是:架構的簡潔與保真度值得付出這些算力。公開的權重,就是供人評估這項主張的證據。它能否在「每一塊錢換得的品質」上勝出,仍是個開放問題,而答案將由實際跑過它的人決定,而不是由發布貼文決定。這正是架構提案的尋常生命週期:在有人做出基準測試之前很有趣,之後則不是變得有用,就是被遺忘。
真正新的部分
這項發布之所以值得注意,在於它宣稱的統一性。多數影像與影片的生產系統,都是由各自獨立設計的零件拼裝而成:為某個目的訓練的 VAE、為另一個目的設計的擴散 Transformer、又是為第三個目的的視覺編碼器。它們之間的每一處接縫,都可能是訓練與部署行為出現落差的地方,也是誤差層層累積的地方。
若能以單一框架、同一種表徵同時處理生成與理解,這些接縫就會消失。如果行得通,除錯多模態流程會變得簡單許多,因為只有一種表徵與一組失效模式,而不是四組。
這裡還有資料面的意義。一個從不壓縮的模型不會繼承壓縮失真,因此原則上能保留精確的細節,包括文字與細緻紋理,而不需要額外的精修階段。對於建構文件、UI 或產品影像流程的人來說,這點相當重要,因為在這些場景裡,微小的錯誤就足以讓結果不合格。
時機並非偶然
PixelUMM 問世的同一週,好幾套商業系統都把「細節保留」當成主打功能。Black Forest Labs 推出支援 4K 輸出與像素級區域編輯的 FLUX 3 Image,Google 的 Imagen 4 系列則登上代管平台。市場顯然正在獎勵那些能保留使用者原有內容、只更動使用者要求更動之處的模型。
像素空間生成,是研究者對同一個問題給出的答案,而那些產品用的是工業工程的手法。商業路線是在潛在架構之上加上解析度與編輯控制;研究路線則是移除潛在架構,並以算力作為代價。兩者都想達到同一個目標:讓生成的細節經得起檢視。而評判它們的,會是同一群使用者。
為什麼有人選在現在發布
這次發布也是對開放生態現況的一種評論。兩年來,開源模型社群主要在規模上競爭,不斷發布更大、以更多資料訓練的模型。這場競爭確實催生出真正有能力的系統,卻也造就了大量極為相似的架構,因為幾乎所有模型都採用相同的潛在擴散設計與同一系列的視覺編碼器。
發布無編碼器模型,是在結構而非規模上競爭的一種方式。嘗試不同架構,比在訓練資料上砸錢超越最大的實驗室來得便宜;而若真能成功,貢獻也更有價值。只把既有設計放大的社群,最終會收斂到單一做法;願意測試替代方案的社群,則能讓更多選項存活下來。
這是比較寬厚的解讀,而且很可能就是正確的。公開權重讓這個做法獲得公平審視的機會,這已經比多數架構提案得到的待遇好得多。
什麼才算成功
權重已經公開,所以測試成本低廉,而且很難造假。
先看文字渲染。無編碼器生成在相同預算下,應該比潛在模型更能處理細小字體,否則就沒有理由接受這樣的算力成本。
再看單一張消費級加速卡上的記憶體用量與延遲。如果模型需要資料中心等級的硬體才能產生一張普通大小的影像,它就仍只是研究樣品;如果它能在高階工作站顯卡上以堪用的速度運行,它就成了一項工具。
最後看影片路徑。這次發布宣稱影像與影片以統一方式處理,而影片正是算力問題咬得最凶的地方,因為時間軸上的序列長度會把一切都放大。若能在像素空間生成出一段可信的短片,將是這套做法最有力的證據。
預期結果會好壞參半。新架構通常如此,而第一批公開基準測試也很少能呈現全貌。像這樣的發布之所以重要,是因為它讓現行設計的預設前提變得明確;而那些前提被視為理所當然已經太久了,有人直接去測試它們,是件有幫助的事。