四步取代四十步:蒸餾如何把開放圖像模型塞進消費級 GPU

強大的開放圖像模型與消費級顯示卡之間的差距,幾個月來不斷縮小。其機制在於更少的去噪步驟。一個過去需要四十次傳遞才能把雜訊變成圖像的模型,如今只要接上正確的適配器,四步、六步或八步就能做到。
十月初的兩項發布又從相反方向推進這條前沿:一篇重新思考蒸餾訓練方式的研究論文,以及一個將此概念應用於廣受使用的開放模型的可投入生產的 LoRA。
DMAD 將分佈匹配變成分類問題
這篇論文是 DMAD,全名為 Distribution Matching as Adversarial Distillation(將分佈匹配作為對抗蒸餾),出自德州農工大學與字節跳動的研究人員。它於 10 月 1 日首次公開,並處理蒸餾中一個眾所周知的成本問題。
標準做法是這樣的。教師模型在許多步驟中生成高品質樣本。學生模型必須在一到四步內逼近相同的分佈。為了引導學生,你會訓練一個輔助擴散模型,讓它不斷擬合學生當前的分佈,然後用教師分數與學生分數之間的差異來更新學生。問題在於學生持續改變,因此輔助模型必須不斷追趕它。記憶體與運算需求也隨之攀升。
DMAD 將目標改寫為分類。在共享的特徵骨幹上放置兩個判別器頭。一個區分真實資料與學生樣本。另一個區分教師樣本與學生樣本。在最佳條件下,判別器的輸出分數對應於對數密度比,這表示學生可以沿著由判別器分數推導出的線性目標進行更新。不需要獨立的輔助分數模型。
第二個要素是依雜訊等級而定的監督。教師模型在某些雜訊等級下接近真實分佈,在另一些等級下則明顯偏離。DMAD 用第一個判別器頭測量真實樣本與教師樣本之間的經驗分數差異,然後據此重新加權學生的訓練,讓學生在教師最弱的雜訊等級下較少繼承教師的偏差。這把「教師永遠正確」這個假設,轉化為可測量的東西。
結果涵蓋三種規模。在 ImageNet 上的圖像分類訓練中,一步 64x64 生成達到 FID 1.04。FID 衡量生成分佈與真實分佈的差異程度,數值越低越好。
正式版本已經上線
同樣的概念透過 LoRA 適配器而非論文傳達給使用者。阿里巴巴 PAI 在 Hugging Face 上發布了 Qwen-Image-2.1-Fun-Acc-LoRAs,應用並行解碼蒸餾,將推論從教師模型的 40 次神經函數評估降至 4 次,同時適用於文字轉圖像與基於指令的編輯。該適配器為 rank 64、network alpha 64,採 BF16,模型卡提供 Diffusers 與 VideoX-Fun 的快速入門腳本。
模型卡坦率說明了取捨。與教師模型相比,密集的小字會退化,圖像編輯的結果也會略微模糊或偏暗。對於帶有一整段細字的海報,四步並不是合適的工具。對於文字簡短且較大的社群媒體尺寸圖片,它則勝任。
第二個適配器在品質上更進一步。Qwen-Image-2.1 Turbo v0.2.1 是 rank-128、六步的 LoRA,大小約 648 MB,將基礎流匹配模型冗長的機率流 ODE 壓縮成從 1.0 到 0.25 的 sigma 排程。六步是中間設定:傳遞次數足以保留細節,又少到能保持快速。
社群蒸餾作品補齊了這道階梯的其餘部分。Viggle 的 turbo 適配器以四步為目標。PrunaAI 的適配器則以五步或八步為目標。兩者都坦承仍是進行中的作品,而 Pruna 的說明指出,低步數版本在多參考構圖、換臉,以及帶有多重限制的編輯上,尚未追上基礎模型。
Krea 2 Turbo 在授權方面走了不同的路。其兩步與四步蒸餾適配器現在隨附 Apache-2.0 的 ComfyUI 工作流程,支援 Comfy Cloud、本機 ComfyUI 與 Apple MLX,並可自動切換步數。工作流程層採用 Apache-2.0,對任何想在其上打造產品、又不想經過法律審查的人來說都很重要。
對實際執行的人來說,真正改變了什麼
實際效果是同樣的硬體能產出更多圖像,而重要的設定也隨之改變。Qwen 2.1 的社群討論串建議,載入 LoRA 時使用 CFG 2.0 到 3.0 與 40 步,並搭配約 676 MB 的紋理修復 VAE。其他人則回報,未使用 LoRA 的標準工作流程在 2.0 百萬像素下,如今能產出早期開放模型很少達到的渲染品質。
誠實的解讀是:低步數蒸餾是一種取捨,而非免費午餐。文字保真度、編輯精確度與多參考一致性是最先受影響的部分,因為這些任務需要最多傳遞次數才能解決。對於單一清楚主體的提示詞遵循度則維持得不錯。

這暗示的是一套工作流程,而不是單一設定。以四步打草稿,挑選你想要的構圖,然後用完整步數重新渲染選定的畫面。蒸餾適配器讓探索變得便宜,並把最後一遍留給完整品質。
研究在適配器之外還帶來了什麼
使用者下載的 LoRA 是這項工作看得見的一端,但 DMAD 論文解釋了為什麼下一代適配器應該會更好。舊做法需要一個即時輔助模型來追蹤學生不斷變動的分佈,而這項額外開銷會隨著每個訓練步驟增加。把目標重新切割成一對判別器,就能移除輔助模型,這表示同樣的 GPU 預算可以訓練出更強的學生。
重新加權的概念是更持久的貢獻。把教師視為一律正確,正是限制蒸餾學生能有多好的假設,因為學生若在教師表現最差的時刻接受訓練,就會繼承那些錯誤。測量教師在哪些地方偏離真實資料,並對那些區域降低權重,是一項通用技術,應該能轉移到影片擴散、音訊,以及任何其他使用蒸餾來降低推論成本的生成模態。
如何判斷蒸餾適配器是否夠用
決策取決於任務類型。低步數適配器能好好處理單一主體、光線清楚、大尺寸的構圖。它們對任何需要多次傳遞才能解決的東西都很吃力:成段的小字、精細字體排印、必須在多個參考之間保持身分一致的編輯,以及一次疊加多項限制的指令。這些正是模型卡警告的情況,而且各家的警告相當一致。
授權是另一個變數。這些適配器有些帶有研究用途或其他限制條款,而商業使用的問題不一定會在模型卡上說清楚。阿里巴巴 PAI 的發布將授權列為「other」,未說明商業條款,這表示要把它部署到產品中的團隊,在上線前還得自己做功課。Krea 的 Apache-2.0 工作流程是例外,而這種寬鬆授權很可能對任何要在其上建立商業服務的人來說都很重要。
前進方向很清楚。開放圖像模型正被壓縮到人們已經擁有的硬體上,而這種壓縮是公開進行的,伴隨權重、模型卡與明確列出的限制。這種開放性本身就有用,因為它讓買方在投入之前判斷取捨。封閉的供應商可以在更新中降低品質,卻稱之為速度改進。一個連同模型卡一起發布、並點名自身弱點的適配器則做不到這點。
關於該測量什麼的提醒
這個領域的速度宣稱很容易被誇大,因為步數只是延遲的其中一項輸入。解析度、批次大小、取樣器,以及每個提示詞生成的圖像數量,對實際耗時的影響都遠比標題上的步數所暗示的更大。在中階顯示卡上以高解析度執行四步適配器,可能比在同一硬體上以草稿解析度跑四十步還要慢。
對買方真正重要的比較,是在自己實際擁有的硬體上,以自己實際需要的品質,計算每分鐘能產出多少圖像。模型卡很少回報這個數字,所以必須在本機測量。適配器讓測量變得便宜,這才是真正的益處。四步夠快,足以跑完那項告訴你四步到底夠不夠的實驗。
接下來該關注什麼
這些適配器和這篇論文指向同一個方向。開放圖像模型的推論成本持續下降,而每一次新的蒸餾都縮小了消費級顯示卡與租用加速器之間的差距。值得追蹤的問題是,下一輪適配器是否會縮小文字渲染與參考保真度的差距,或者那些限制其實是低步數生成本身內建的。在這一點塵埃落定之前,明智的姿態是把步數視為眾多旋鈕之一,並在自己實際擁有的硬體上測量每分鐘圖像數。
相關文章
Cloudflare 推出 270 億參數決策模型,在 Jev 的主場擊敗 Jev
有些模型呼叫應該回傳一個數字,而不是一段文字。一個類別正圍繞這個想法成形。
BOSSFIGHT 讓前沿模型當了 24 週咖啡店老闆,多數輸給了「什麼都不做」
在測驗中拒絕賄賂,與在真實季度中拒絕妥協,是兩種不同的能力,而目前的評測往往只衡量了較容易的那一種。
NASA 與 IBM 開源了以 17 年軌道器資料訓練的月球基礎模型
該模型對於尋找和描述特徵很有用,但對於高精度地指出它們的確切位置則不可靠。
代理程式本週開始執導短片。瓶頸轉移到了品質控制。
生成是廉價的,編排是產品,決定一條管線是否有用的因素是它能否判斷自己何時失敗。