Quattro passaggi invece di quaranta: come la distillazione sta comprimendo i modelli open di immagini sulle GPU consumer

Il divario tra un forte modello open di immagini e una scheda grafica consumer si sta riducendo da mesi. Il meccanismo è un minor numero di passaggi di denoising. Un modello che una volta richiedeva quaranta passaggi per trasformare il rumore in un'immagine ora può arrivarci in quattro, o sei, o otto, se si collega l'adattatore giusto.
Due rilasci all'inizio di ottobre hanno spostato di nuovo quella frontiera da direzioni opposte: un articolo di ricerca che ripensa come viene addestrata la distillazione, e una LoRA di produzione che applica l'idea a un modello open ampiamente utilizzato.
DMAD trasforma il distribution matching in un problema di classificazione
L'articolo è DMAD, abbreviazione di Distribution Matching as Adversarial Distillation, di ricercatori della Texas A&M e ByteDance. È stato reso pubblico per la prima volta il 1° ottobre e affronta un costo ben noto nella distillazione.
La ricetta standard funziona così. Un modello insegnante genera campioni di alta qualità in molti passaggi. Un modello studente deve approssimare la stessa distribuzione in uno a quattro passaggi. Per guidare lo studente, si addestra un modello di diffusione ausiliario che continua ad adattarsi alla distribuzione corrente dello studente, poi si usa la differenza tra lo score dell'insegnante e lo score dello studente per aggiornare lo studente. Il problema è che lo studente continua a cambiare, quindi il modello ausiliario deve continuare a inseguirlo. Memoria e calcolo aumentano.
DMAD riscrive l'obiettivo come classificazione. Su un backbone di feature condiviso ci sono due teste discriminatore. Una separa i dati reali dai campioni dello studente. L'altra separa i campioni dell'insegnante dai campioni dello studente. In condizioni ottimali, il punteggio di output del discriminatore corrisponde a un rapporto logaritmico di densità, il che significa che lo studente può aggiornarsi lungo un obiettivo lineare derivato dal punteggio del discriminatore. Non è necessario un modello di score ausiliario separato.
Il secondo ingrediente è la supervisione dipendente dal livello di rumore. Un insegnante è vicino alla distribuzione reale ad alcuni livelli di rumore e visibilmente fuori ad altri. DMAD misura la differenza di score empirica tra campioni reali e campioni dell'insegnante con la prima testa discriminatore, poi ripesa l'addestramento dello studente di conseguenza, così lo studente eredita meno del bias dell'insegnante ai livelli di rumore in cui l'insegnante è più debole. Questo converte un'assunzione, "l'insegnante ha sempre ragione", in qualcosa di misurabile.
I risultati coprono tre scale. Nell'addestramento di classificazione di immagini su ImageNet, la generazione one-step 64x64 ha raggiunto un FID di 1,04. FID misura quanto la distribuzione generata differisce da quella reale, e più basso è meglio.
La versione di produzione è già disponibile
La stessa idea raggiunge gli utenti attraverso adattatori LoRA piuttosto che articoli. Alibaba PAI ha pubblicato Qwen-Image-2.1-Fun-Acc-LoRAs su Hugging Face, applicando la distillazione con decodifica parallela per ridurre l'inferenza dalle 40 valutazioni di funzione neurale dell'insegnante a 4, sia per text-to-image che per editing basato su istruzioni. L'adattatore è rango 64 con network alpha 64 in BF16, e la model card fornisce script di avvio rapido per Diffusers e VideoX-Fun.
La model card è schietta sui compromessi. Il testo piccolo e denso si degrada rispetto all'insegnante, e le modifiche alle immagini risultano leggermente più sfocate o più scure. Per un poster con un paragrafo di testo in piccolo, quattro passaggi non sono lo strumento giusto. Per immagini di dimensioni social dove il testo è breve e grande, lo è.
Un secondo adattatore spinge più avanti sulla qualità. Qwen-Image-2.1 Turbo v0.2.1 è una LoRA rango 128, a sei passaggi, di circa 648 megabyte che comprime il lungo ODE probability-flow del modello base flow-matching in uno schedule sigma che va da 1.0 a 0.25. Sei passaggi è un'impostazione intermedia: abbastanza passaggi per mantenere i dettagli, pochi abbastanza per restare veloce.
Le distillazioni della community completano il resto della scala. Un adattatore turbo di Viggle punta a quattro passaggi. Gli adattatori di PrunaAI puntano a cinque o otto. Entrambi sono onesti nel dichiarare che sono lavori in corso, e le note di Pruna dicono che la versione a basso numero di passaggi non eguaglia ancora il modello base su composizione multi-riferimento, scambi di volti e modifiche con diversi vincoli.
Krea 2 Turbo ha preso una strada diversa sul licensing. I suoi adattatori di distillazione a due e quattro passaggi ora vengono forniti con workflow ComfyUI Apache-2.0 per Comfy Cloud, ComfyUI locale e Apple MLX, con commutazione automatica dei passaggi. Apache-2.0 sul livello di workflow conta per chiunque voglia costruirci sopra un prodotto senza revisione legale.
Cosa cambia davvero per chi lo esegue
L'effetto pratico è che lo stesso hardware produce più immagini, e le impostazioni che contano cambiano. Le discussioni della community per Qwen 2.1 consigliano CFG da 2.0 a 3.0 e 40 passaggi quando è caricata una LoRA, insieme a un VAE texture-fix di circa 676 megabyte. Altri riportano che il workflow standard a 2.0 megapixel senza LoRA ora produce una qualità di rendering che i modelli open precedenti raggiungevano raramente.
La lettura onesta è che la distillazione a basso numero di passaggi è uno scambio, non un pranzo gratis. Fedeltà del testo, precisione di editing e coerenza multi-riferimento sono le prime cose a soffrire, perché sono i compiti che richiedono il maggior numero di passaggi per risolversi. L'aderenza al prompt su un singolo soggetto chiaro tiene bene.

Questo suggerisce un workflow piuttosto che un'unica impostazione. Abbozza a quattro passaggi, scegli la composizione che vuoi, poi renderizza di nuovo il fotogramma scelto al numero completo di passaggi. Gli adattatori di distillazione rendono l'esplorazione economica e lasciano il passaggio finale a piena qualità.
Cosa aggiunge la ricerca oltre agli adattatori
Le LoRA che gli utenti scaricano sono l'estremità visibile di questo lavoro, ma l'articolo DMAD spiega perché la prossima generazione di adattatori dovrebbe essere migliore. La vecchia ricetta richiedeva un modello ausiliario attivo per tracciare la distribuzione mutevole dello studente, e quel sovraccarico cresceva a ogni passo di addestramento. Ritagliare l'obiettivo come una coppia di discriminatori rimuove il modello ausiliario, il che significa che lo stesso budget GPU può addestrare uno studente più forte.
L'idea di ripesatura è il contributo più duraturo. Trattare l'insegnante come uniformemente corretto è l'assunzione che limita quanto può essere bravo uno studente distillato, perché uno studente addestrato contro i momenti peggiori dell'insegnante eredita quegli errori. Misurare dove l'insegnante diverge dai dati reali e ridurre il peso di quelle regioni è una tecnica generale, e dovrebbe trasferirsi alla diffusione video, all'audio e a qualsiasi altra modalità generativa in cui la distillazione viene usata per ridurre il costo di inferenza.
Come decidere se un adattatore distillato è sufficiente
La decisione si riduce al tipo di compito. Gli adattatori a basso numero di passaggi gestiscono bene composizioni a soggetto singolo, ben illuminate e in grande formato. Faticano con qualsiasi cosa che richieda molti passaggi per risolversi: paragrafi di testo piccolo, tipografia fine, modifiche che devono preservare l'identità attraverso più riferimenti e istruzioni che impilano diversi vincoli contemporaneamente. Sono esattamente i casi di cui avvertono le model card, e gli avvertimenti sono coerenti tra i vendor.
Il licensing è l'altra variabile. Alcuni di questi adattatori hanno termini di ricerca o comunque restrittivi, e la questione dell'uso commerciale non è sempre risolta sulla model card. Il rilascio di Alibaba PAI elenca la sua licenza come "other" senza specificare i termini commerciali, il che significa che un team che lo distribuisce in un prodotto ha dei compiti da fare prima di spedire. I workflow Apache-2.0 di Krea sono l'eccezione, e quella permissività probabilmente conterà per chiunque costruisca un servizio commerciale sopra.
La direzione di marcia è chiara. I modelli open di immagini vengono compressi sull'hardware che le persone già possiedono, e la compressione avviene in pubblico, con pesi, model card e limitazioni dichiarate. Questa apertura è di per sé utile, perché consente a un acquirente di giudicare i compromessi prima di impegnarsi. Un vendor chiuso può tagliare la qualità in un aggiornamento e chiamarlo miglioramento di velocità. Un adattatore pubblicato con una model card che ne nomina i punti deboli non può.
Una nota su cosa misurare
Le affermazioni sulla velocità in questo spazio sono facili da esagerare, perché il numero di passaggi è solo un input per la latenza. Risoluzione, dimensione del batch, sampler e numero di immagini generate per prompt cambiano il tempo wall-clock molto più di quanto suggerisca il numero di passaggi in evidenza. Un adattatore a quattro passaggi ad alta risoluzione su una scheda di fascia media può essere più lento di un'esecuzione a quaranta passaggi a risoluzione di bozza sullo stesso hardware.
Il confronto che conta per un acquirente è immagini al minuto alla qualità di cui ha effettivamente bisogno, sull'hardware che possiede effettivamente. Le model card raramente riportano quel numero, quindi deve essere misurato localmente. Gli adattatori rendono la misurazione economica, che è il vero beneficio. Quattro passaggi è abbastanza veloce per eseguire l'esperimento che ti dice se quattro passaggi erano sufficienti.
Cosa guardare dopo
Gli adattatori e l'articolo indicano la stessa direzione. Il costo di inferenza per i modelli open di immagini continua a scendere, e ogni nuova distillazione riduce il divario tra una scheda consumer e un acceleratore noleggiato. La domanda da tenere d'occhio è se il prossimo giro di adattatori colmerà il divario di rendering del testo e fedeltà dei riferimenti, o se quei limiti sono intrinseci alla generazione a basso numero di passaggi. Finché la questione non è risolta, la posizione sensata è trattare il numero di passaggi come una manopola tra diverse, e misurare le immagini al minuto sull'hardware che possiedi effettivamente.
Articoli correlati
BOSSFIGHT ha messo i modelli frontier a gestire caffetterie per 24 settimane. La maggior parte ha perso contro il non fare nulla.
Resistere a una tangente in un quiz e rifiutarsi di piegarsi in un trimestre reale sono due abilità diverse, e le valutazioni attuali tendono a misurare quella più facile.
NASA e IBM hanno reso open source un modello fondativo lunare addestrato su 17 anni di dati in orbita
Il modello è utile per individuare e caratterizzare le caratteristiche del terreno, ma inaffidabile nel dire con alta precisione dove si trovino esattamente.
Questa settimana gli agenti hanno iniziato a dirigere cortometraggi. Il collo di bottiglia si è spostato sul controllo qualità.
La generazione è economica, l'orchestrazione è il prodotto, e ciò che decide se una pipeline è utile è se sa riconoscere quando ha fallito.
Reka Rho-1 mette comprensione e generazione nella stessa KV cache
Gli stessi pesi che predicono un'immagine della telecamera guidano anche il movimento del robot, perché entrambi vivono nello stesso spazio rappresentazionale.