訓練文字轉圖像模型的速度如今快了 3.6 倍

訓練圖像模型是一場等待遊戲。你得花上數週時間和一大筆 GPU 費用,教導神經網路把文字變成圖片,而其中大部分時間都花在計算那些感覺上應該可以重複使用的東西。Linum AI 本月流傳的一篇論文宣稱,文字轉圖像模型的訓練速度可提升 3.6 倍,而背後的技術即使你從不自己訓練模型,也值得了解。
這項研究名為 JIT-DDT,屬於讓擴散模型訓練更有效率的一系列研究。擴散模型是驅動大多數圖像生成器的模型家族,其運作方式是學習逆轉加噪過程。訓練它們時,必須反覆讓模型處理逐步被破壞的資料,並在許多時間步中進行前向與反向傳播。其中大量計算以不明顯的方式重複,除非你仔細檢視訓練迴圈實際上把時間花在哪裡,而這正是該論文所做之事。
最受矚目的結果是訓練速度提升 3.6 倍,這意味著原本要花三週的相同模型可能只要一週,或者同樣的預算可以透過更多迭代訓練出更好的模型。對於一個以算力為主要成本、迭代速度決定勝負的領域來說,這是個有意義的數字。它降低了小型實驗室與開源團隊的門檻,這也是 Hacker News 討論串如此熱烈的原因。留言照例涵蓋各種立場,從質疑基準測試條件的人,到立刻看出更廣泛意涵的人:更便宜的訓練意味著更多模型、更多實驗,以及對所有人來說更快的回饋循環。
更廣泛的背景是,訓練效率本身已成為一條研究前沿。幾年前,對於「我們如何得到更好的模型」這個問題,答案幾乎總是「更多算力」,而這意味著「更多錢」,也就意味著整個領域會向最能花錢的一方傾斜。如今,這個領域也開始問:「我們如何用更少資源得到相同結果?」這部分出於經濟考量,部分出於環境考量,也部分是因為人們認知到縮放曲線不可能永遠是唯一的槓桿。到了某個點,蠻力計算的成本會超出即使是最大實驗室也願意支付的程度,而效率就會成為競爭優勢。
對圖像生成而言,效率提升的影響特別大。圖像模型相對於其規模而言訓練成本高昂,因為圖像維度很高,而且擴散過程需要許多步驟。它們的服務成本也很高,因為每個使用者提示都會觸發一次全新的生成,有時還會並行生成好幾次。加速訓練的技術通常也有加速推論的對應技術,因此訓練上的突破可以擴散成更快、更便宜的產品。這種連結並非自動發生,但關於哪些計算可以跳過或重複使用的底層洞見,往往可以轉移。
開源的角度在這裡很重要。訓練速度提升 3.6 倍,主要受益的是原本負擔不起舊成本的人,也就是開源社群與新創團隊,而不是擁有最大規模叢集的實驗室。巨頭可以吸收低效率,他們只要投入更多算力就好。小型玩家做不到,因此每一次效率提升都會擴大他們能嘗試的範圍。當訓練變得更便宜,更多人就有能力打造自己的模型,這也助長了開源圖像模型逐漸縮小與閉源模型差距的趨勢。效率研究與開源模型浪潮彼此強化,讓另一方更容易取得。
這也與本月其他重大新聞相呼應。Qwen-Image 2.1 是一款可在消費級硬體上運行的 70 億參數模型,展示了效率能帶來什麼。在中國創作者平台上流傳的整合包、那些「可在 6GB 顯卡上運行」的教學,全都建立在一個假設上:圖像模型可以做得又小又快,而不會損失太多品質。訓練效率就是這個假設的上游版本。如果你無法有效率地訓練,就負擔不起針對那些最終將在各處運行的小模型進行迭代。
有一個值得謹記的但書,而且這個但書適用於每一篇訓練論文。在特定設定、特定硬體、特定資料上測得的加速,不一定能乾淨地轉移到其他設定。這項宣稱是真的,但 3.6 倍這個數字是某一個配置下的結果,而你的實際成效取決於細節:模型大小、資料分布、硬體。這不是否定,只是對機器學習結果的標準解讀,而 Hacker News 討論串中對確切數字提出質疑的人,正是正確地採用了這種解讀。
儘管如此,方向是明確的。訓練正變得更便宜,圖像模型正變得更易取得,而受益最大的人正是那些過去被成本擋在門外的人。每一篇效率論文,即使是誇大數字的那些,都會把這個領域推向一個這樣的世界:打造圖像模型是小型團隊負擔得起嘗試的事情。那是結構性改變,不是一次性結果。
3.6 倍加速只是一步,但它象徵效率前沿正以和能力前沿一樣快的速度推進。對任何關注這個領域的人來說,這種進展日後會以你真正能運行的模型、真正擁有的硬體、真正存在的團隊訓練出來的成果出現在眼前。基準測試搶盡頭條,但效率論文才是讓這些基準測試一開始得以實現的基礎。
值得再深入一點理解,為什麼擴散訓練一開始會浪費算力,因為這正是加速得以實現的原因。擴散模型透過看帶有不同程度雜訊的圖像,並學習去除雜訊來進行學習。訓練迴圈會取樣一個雜訊程度,把圖像破壞到該程度,然後要求模型預測乾淨版本,如此反覆進行,跨越許多雜訊程度。大量計算都花在稍微不同的雜訊程度上重新處理相同資訊,而加入雜訊的前向傳播在每一步之後就被丟棄。如果你能避免重新計算不會改變的部分,或跨步驟重複使用資訊,浪費就會消失,訓練也就加速了。
這是擴散領域中大多數效率研究的概略樣貌,而 JIT-DDT 只是這類技術日益增加目錄中的一項。對一般讀者而言,確切機制不如它所揭示的模式重要:一個曾經把算力視為無限的領域,如今把它視為需要節省的東西,因為事實證明那些浪費從來就不是必要的,只是未被檢視。從某種意義上說,每一篇效率論文都在提醒我們:早期實作是為了開發速度而打造,不是為了執行速度,而且還有很多進步空間。
環境角度也值得一提,即使它不是頭條。訓練大型圖像模型有真實的能源成本,而在其他條件相同下,3.6 倍的削減就是該成本減少 3.6 倍。在 AI 的環境足跡已成為公共辯論一部分的這一年,效率不只是經濟上的勝利,也是讓這項技術更永續的一種方式。這不是研究者做這項工作的原因,但這是值得注意的後果。
對於只想使用圖像生成的人來說,這些都不需要採取行動。效率提升會間接顯現,例如更便宜的 API、更快的本地模型,以及更多開源發布。但理解這些提升從何而來,會改變你閱讀新聞的方式。當某個實驗室宣布一個比預期更便宜或更快的新模型時,原因往往不是某個單一巧妙技巧,而是累積的效率研究在底層默默運作,就像更快的車通常是上百項小改進的結果,而不是一次突破。
相關文章
一次十張參考圖:AI 圖像編輯從單張操作邁向合成
單圖編輯產生變化,多圖編輯產生組合。一次十張參考圖,改變了我們提示與合成的方式。
原生透明正悄然成為 AI 圖像中最實用的新功能
大家都要求寫實感。設計師要求的是透明背景。為什麼原生 Alpha 通道生成,是那個默默改變真實工作流程的低調功能。
阿里巴巴的 Qwen-Image 2.1 剛剛改變了開源模型授權的討論
技術規格令人印象深刻,但授權才是真正的故事。Qwen-Image 2.1 放棄了 Apache 2.0,轉而採用研究授權,而細則現在比以往任何時候都更重要。
通義萬相 Qwen-Image 2.1 開源:7B 小模型如何把透明圖和 10 張圖編輯裝進一張消費級顯示卡
一個 7B 的開源生圖模型,憑什麼把透明圖、多圖編輯裝進一張 6G 顯示卡?拆解 Qwen-Image 2.1 的核心升級與授權轉折。