Iris-3B:一個不用 VAE 就直接生成像素的圖像模型

幾乎所有流行的圖像生成器在底層邏輯上是一樣的。它不直接畫像素,而是先用一個叫變分自編碼器(VAE)的組件把圖像壓縮成更小的抽象表示,在那個壓縮空間裡生成,再解碼回像素。這種兩步設計很高效,很多小毛病也來自這裡。細小的文字被糊掉,細線抖動,細節在一次往返中被丟失。
2026 年 10 月,一個叫 Speridlabs 的小團隊發布了 Iris-3B,一個 30 億參數的模型,乾脆跳過了這次往返,直接生成像素。權重以 Apache 2.0 授權開放,整體基於 flow-matching transformer 構建。它不是這個月最大或最耀眼的圖像模型,但就它透露的訊息而言,可能是最有意思的一個。
跳過 VAE 為什麼重要
VAE 的存在是為了讓生成變便宜。在壓縮後的潛空間裡工作,能把所需算力砍掉一大截,這就是幾乎每個擴散模型都用它的原因。代價是:編碼器在生成開始之前就丟掉了一部分資訊,解碼器得把它猜回來。在低解析度下這種損失看不見,在高解析度或者文字密集、邊緣精確的圖像上,它就表現為生成器在小細節周圍常有的那種糊。
在像素空間裡生成,就移除了這個瓶頸,因為沒有任何壓縮步驟會丟東西。代價是你現在要在一個大得多的數值網格上做事,這很貴。Iris-3B 的主張是:它足夠小,可以把這份開銷控制在可承受範圍內。這在實踐中是否成立,要由社群去測,但方向很清楚:隨著效率提升,接受 VAE 品質代價的理由會越來越弱。
{{INLINE1}}
第二個花招:把生成先驗用於視覺任務
Iris-3B 更不尋常的地方在於它還做別的事。模型把它的生成先驗應用到對細節敏感的視覺任務上,包括深度估計和圖像修復。說白了,一個被訓練來產出圖像的模型,也可以被要求從圖像裡恢復資訊:估計物體有多遠,或者把一張退化的照片清理乾淨。
這是個有意義的組合,因為它指向一個更廣的趨勢。曾經,生成和理解被當成兩個問題、兩套模型。近來它們在合併。一個能產出可信圖像的系統,已經對場景如何結構、光如何落、物體在空間裡如何相互關聯理解得很深。把這份理解複用給分析任務,比給每個任務單獨訓一個模型更便宜。
flow matching 在說什麼
Iris-3B 基於 flow-matching transformer,這個概念比名字好懂。更早的圖像模型透過一步步逆轉「給圖片加隨機雜訊直到圖像消失」的過程來學習,生成時再把這個過程倒著跑一遍,逐步去雜訊直到圖像浮現。flow matching 走得更直接。它學的是從雜訊到圖像的一條近乎筆直的路,而不是一條蜿蜒的路,理論上需要更少的步數、更少的算力就能得到好結果。
這一點對像素空間模型尤其重要。在原始像素上工作很貴,而控制這份成本的常規辦法就是讓每一步都高效。更直的路意味著更少的步數,這也是為什麼一個 30 億參數模型能嘗試這種、原本靠 VAE 捷徑才能控制開銷的任務。架構選擇與模型規模是配套的,單靠任何一個都不夠。
獨立測試會決定這筆交易是否划算。如果像素空間生成能和潛空間生成在相近成本下打平,VAE 就不再是預設選項,而是一個選擇。如果不能,Iris-3B 仍然是一個關於「牆在哪裡」的有用數據點。
一個小的開放模型到底是幹什麼用的
Iris-3B 不會在任何榜單上蓋過那些巨頭。30 億參數只是商業領頭羊的一小部分,這個規模的通用模型在最難的提示上一定會輸。用那個標準來評判它,就錯過了重點。
這個量級的開放模型靠三種方式掙到自己的位置。它們能跑在人們已經擁有的硬體上,所以沒有按張計費,也沒有資料離開大樓;它們能針對一個狹窄任務做微調,而這往往是小模型勝過大型模型的地方,一個專門在某公司產品攝影上訓練過的模型,在那個具體任務上會打敗通用模型;它們可被檢視,這對需要解釋輸出從哪來的團隊很重要。
Apache 2.0 授權正是讓這三件事同時成立的那個細節。一個寬鬆授權意味著新創公司可以在 Iris-3B 之上搭產品,不必談判條款,也不必擔心未來的價格變動。對一個想讓自己的架構被採用的研究團隊來說,這是通往相關性最快的路。模型不必贏下榜單,它要做的是那個別人用來搭建的東西。
一個適用於每個開放模型發布的提醒
有一個提醒適用於每個開放模型,Iris-3B 也不例外。寬鬆授權覆蓋的是權重,不是訓練資料,也不是輸出。打算商業化交付的團隊仍要考慮模型從什麼資料裡學來、以及一張生成的圖附著什麼權利。這是授權回答不了的法律問題,也是每個開放模型都會提出的同一個問題。自己跑模型的能力是真實而有價值的自由,但它不等於免於責任。
更大的圖景
2026 年 10 月的圖像領域從頂部看很擁擠。Nano Banana 2.1、GPT Image 2.5、FLUX 3 和 Seedream 5.0 都發布了近期更新,前沿上的進步是用很小的邊際來衡量的。而在底下,更有意思的動向是架構層面的。像素空間生成質疑了一個自第一批擴散模型以來一直成立的假設:你必須先壓縮,才能創造。而開放的小模型不斷證明,把一個想法擴散到整個領域的最快方式,是把它送出去。
Iris-3B 可能最終只是一條腳註,也可能成為別人去抄的那個版本。無論如何,它提出的兩個問題值得關注:你能不能在沒有任何有損中間步驟的情況下全細節生成圖像,以及一個模型能不能既創造又分析。如果答案變成「能」,下一代圖像工具將建立在與上一代不同的地基上。
相關文章
Decagon 的 PACT 協議,想讓「同意」成為一個標準
Decagon 開源了一個協議,用來驗證個人智能體的身分,以及客戶授予它的權限。這是管道工程,而它決定了智能體經濟能不能跑起來。
AI「重逢」熱潮:一場還沒想好該如何感受的討論
AI 致敬短片把逝去的公眾人物帶回中國螢幕,拿下數十萬點讚。然後反彈來了,而它爭論的是「同意」。
Apple 發布了一個開源多模態模型,卻幾乎沒告訴任何人
蘋果的這次「研究優先」式發布悄然越過了主流視野,但模型那種細粒度的視覺 grounding,透露了它的 AI 棧正走向哪裡。
OpenCut 與「開源剪映」的那一刻
一款免費、MIT 授權的影片剪輯器持續衝上 GitHub 趨勢榜,而它的路線圖裡包含一個面向 AI 智能體的 MCP server。圍繞 AI 媒體的工具,正在追上模型本身。