蒸餾一次,即可套用 54 個模型:NVIDIA 的 LongLive-Plug 影片方案

每個專門化的影片模型往往都得付同一筆稅。你從一個大型擴散模型開始,把它微調成特定用途,比如深度條件生成器或機器人模擬器,然後再蒸餾它,讓它跑得夠快、足以實用。蒸餾步驟很昂貴,而且到目前為止,你每打造一個新模型就得再付一次。NVIDIA 的 LongLive-Plug 想問的是:這個步驟能不能只付一次?
這篇論文 arXiv 2609.38154 於 9 月 29 日發布,同時在 Hugging Face 上釋出六個轉接器檔案。它出自 NVIDIA 的 Efficient-Large-Model 團隊與 MIT 合作,描述了一套作者稱之為「一次到位蒸餾」(once-for-all distillation)的框架。
蒸餾究竟是為了什麼
影片擴散模型透過在多個步驟中對潛在表徵去雜訊來生成。本文中的模型通常要跑 30 到 50 步,而每一步都是一次完整的前向傳遞,穿過擁有數十億參數的 transformer。步驟數就是延遲,所以削減步驟數是最直接的加速槓桿。
旁邊還坐著另外兩項成本。無分類器引導(classifier-free guidance)這種讓樣本更緊密跟隨提示的技術,通常會在每一步把模型跑兩次:一次以提示為條件,一次不帶提示,然後在兩者之間外推。這會讓每一步的運算量加倍。而自迴歸影片模型——也就是一塊一塊生成長片段的那種——會隨著生成過程累積誤差,所以除非有東西修正偏移,後面的影格會糊掉。
這三個問題各自都有專屬的訓練配方。通常的工作流程會在每一個專門化的檢查點上,再把對應配方跑一遍。LongLive-Plug 的賭注是:這些配方產出的東西可以重複使用,所以你不應該需要每次都重跑。
關鍵之舉:把蒸餾出的能力當作 LoRA
這個想法是:為某個主幹模型家族凍結一個基礎模型,把某項能力蒸餾一次到 LoRA 參數裡,然後把這個 LoRA 掛到家族中任何相容的下游模型上,不必再訓練。這個轉接器是針對基礎模型的行為擬合出來的,而其主張是:該家族的後代模型共享這種行為的程度夠高,足以讓同一組更新得以生效。
LongLive-Plug 把工作拆成每個主幹三個獨立的轉接器。少步數轉接器負責削減取樣步數,是在受 CFG 引導的教師模型下,以分佈匹配蒸餾訓練而成。CFG 轉接器把引導折疊進單一條件式傳遞。長上下文轉接器則修正因果式滾動生成中的誤差累積。重要的設計選擇在於:它們是各自分開的檔案,而不是一個內建模組,因為在單一引導尺度上訓練的單一 LoRA 會卡在那個尺度。拆開之後,CFG 權重就變成一個旋鈕:調高它會強化提示屬性,而不必重跑無條件分支。論文建議的比例是少步數對 CFG 為一比一半。把單一的耦合 LoRA 調大,效果不同且更糟:它會把更新與步數綁在一起移動,反而降低輸出品質。
這些轉接器也被設計成能挺過下游模型所做的變更。新增條件分支或擴張輸出通道都不會讓它們失效,所以同一組檔案可以掛到完整微調、任務 LoRA,以及帶有額外控制模組的模型上。
實際發布了什麼,以及測試的代價
釋出的集合包含六個轉接器,分別為 MiniMax H3、Wan2.1-T2V-14B 和 Wan2.2-TI2V-5B 各提供一個少步數檔案與一個 CFG 檔案。Wan2.1-14B 的少步數檔案最容易試,因為它是以 lightx2v 命名匯出,而 ComfyUI 的 Wan LoRA 載入器已經讀得懂。把它像其他加速 LoRA 一樣丟進 loras 資料夾就能運作。MiniMax H3 轉接器是 PEFT 匯出檔,所以需要先經過轉換步驟,ComfyUI 才能載入;模型卡也建議目前分開使用少步數與 CFG 檔案,而不是把它們合併。
驗證方面的主張就是那個標題數字:無需訓練即可部署到 54 個下游模型,橫跨三個主幹家族與八個任務類別,包括世界建模、機器人、編輯與多模態生成。論文的成本比較指出,共享的基礎蒸餾大約需 80 GPU 小時,而其論點是:在那之後的一切都省下了針對每個目標的訓練執行。
這些結果附帶兩個誠實的警告。可轉移性假設——也就是基礎蒸餾出的 LoRA 在長出新分支的後代模型上仍然有效——是在那 54 個模型上以實證方式驗證,而非從理論推導而來。而分開訓練的 CFG 與少步數轉接器以相加方式組合,被假設為不會互相干擾;這有轉移結果支持,但並未被證明。這類假設往往在基準測試中成立,偶爾在實際生產中失效。
你今天實際能跑什麼
這次釋出的規模很小,值得具體說明使用者拿到什麼。六個檔案,每個主幹兩個。對 Wan2.1-T2V-14B 而言,少步數轉接器是以 lightx2v 命名匯出,而 ComfyUI 的 Wan LoRA 載入器已經看得懂,所以它可以作為隨插即用的加速 LoRA,與既有工作流程並用。這是最低摩擦的切入點,大概也是多數人第一次試這個想法的方式。
另外兩個主幹則需要多一些功夫。MiniMax H3 轉接器以 PEFT 匯出檔形式提供,這表示 ComfyUI 載入之前需要先轉換;模型卡也建議目前分開使用少步數與 CFG 檔案,而不是疊加使用。Wan2.2-TI2V-5B 也同樣採用 PEFT 轉接器命名出貨。對熟悉這套工具的人來說,這些都不是障礙,但這確實意味著該框架更接近研究釋出,而非完成的外掛。
更有趣的問題是,這些可重複使用的轉接器除了加速之外還能帶來什麼。如果蒸餾出的能力可以在基礎模型與其後代之間移動,那麼建立在同一主幹上的機器人模擬器、深度條件生成器和會說話的頭像模型,就能繼承同樣的少步數行為與同樣的引導控制,而不必各自為自己的蒸餾付費。論文在八個任務類別、54 個模型上(從世界建模到編輯)的驗證,就是這項主張的證據。如果它在生產環境中成立,實際效果就是:實驗室能把一個新的專門模型在幾天內而非幾週內推到可用速度,因為昂貴的部分已經做過一次了。
為什麼這是有趣的方向
LoRA 已經改變了圖像與影片社群的工作方式,把微調變成可攜帶的東西。你下載一個檔案,把它掛到基礎模型上,不必訓練任何東西就能得到新能力。LongLive-Plug 把同樣的邏輯往上套一層,套用到蒸餾步驟本身。如果能力轉接器真的能在一個家族內轉移,那麼推出專門化影片模型的經濟效益就會改變。實驗室不再為每個模型編列一次蒸餾執行的預算,而是每個主幹編列一次,然後重複使用。
這在專門模型不斷增殖的地方最重要。世界模型、機器人模擬器、深度條件控制、會說話的頭像生成器和編輯流程,全都是少數幾個影片主幹的延伸。每一個過去都背著自己的速度稅。把這筆稅當成可重複使用的元件,是自然的下一步;而正是這種不起眼的基礎設施工作,決定了整個領域其他部分能跑多快。