La generazione di immagini open source compressa su una scheda grafica consumer: Hunyuan DiT abbassa la soglia a 6 GB di VRAM

Nell'ultimo anno, gli aggiornamenti della generazione di immagini da testo open source hanno ruotato essenzialmente attorno alla qualità visiva. Chi aveva testi più nitidi, chi aveva luci e ombre più fotografiche, riusciva a restare qualche giorno in più nelle classifiche. Ma con questo ottobre il vento è un po' cambiato. Il fulcro delle discussioni nella community non è più “quale immagine è più bella”, ma “la mia scheda grafica ce la fa o no a farla girare”.
La soglia dei 6 GB di VRAM è stata conquistata a morsi
Tra le novità annunciate di recente da Hunyuan, il grande modello text-to-image di Tencent (Hunyuan DiT), la più utile è l'open source della “versione a bassa VRAM”. Secondo quanto dichiarato ufficialmente, bastano 6 GB di VRAM per farlo girare. Chiunque abbia usato la generazione di immagini open source sa bene quanto pesi questo numero: fino a poco tempo fa, per far girare in locale un sistema text-to-image decente, 16 GB di VRAM erano quasi il prezzo d'ingresso, 8 GB il minimo indispensabile e con 6 GB venivi scoraggiato subito.

Anche le azioni di contorno sono state allineate. Questa versione è stata adattata, insieme a plugin come LoRA e ControlNet, all'interno della libreria Diffusers, e ha aggiunto il supporto per l'interfaccia grafica di Kohya. Il ruolo di Kohya nella community è proprio quello di tirare fuori “l'addestramento del proprio LoRA” dalla barriera della riga di comando, trasformandolo in una questione di pochi clic del mouse. Il fatto che sia stato integrato equivale ad aver spianato la strada al “voglio che il modello impari il mio stile”.
Allo stesso tempo, il corpo principale di Hunyuan DiT è salito alla versione 1.2, e i miglioramenti indicati ufficialmente si concentrano sulle texture dell'immagine e sulla composizione. Questi due aspetti sono proprio i punti a lungo criticati nei modelli open source: quando i dettagli sono troppi l'immagine si impasta, quando la composizione è complessa si disgrega.
Un'altra notizia, più facile da trascurare ma cruciale: Tencent ha reso open source anche il modello di tagging di Hunyuan, “Hunyuan Captioner”. Il modello di tagging è la prima fase dell'addestramento di un LoRA: bisogna prima far scomporre alla macchina ogni materiale in frasi descrittive leggibili, e solo allora si può parlare di addestramento. In passato questo passaggio richiedeva o interfacce closed source o alternative di qualità disomogenea. Ora che è open source, nella catena di addestramento locale c'è una dipendenza in meno da servizi esterni.
Dopo che i modelli open source hanno iniziato a girare, la community è impegnata a “riparare”
I progressi di Hunyuan consistono nell'allargare la strada, mentre la community sta applicando patch a un'altra linea. Dopo l'open source di Qwen-Image 2.1 c'è stata una grande ondata di rielaborazioni, seguita da un ciclo intenso di correzioni.
Una combinazione piuttosto rappresentativa è Qwen-Image-2.1-viggle-turbo: 7,26 GB, inferenza in 6 passaggi, quantizzazione int8, spesso usata per produrre rapidamente immagini di riferimento dei personaggi, abbinata a un VAE texture-fix da 676 MB per rifinire le texture. Il Fix v2.0 di un altro autore dichiara di riuscire a eliminare quel caratteristico strato di rumore e di dettagli disordinati di Qwen, senza quasi toccare la composizione. Esiste anche una versione Opinionated dall'immagine più nitida, al costo di spostare leggermente l'inquadratura; l'autore l'ha pubblicata in pacchetto con un set di sampler res_2m_nc derivati da RES4LYF.
Queste patch sembrano banali, ma dicono una cosa: quando un modello open source entra nella produzione reale, a determinare se è davvero utilizzabile spesso non è la versione del giorno del rilascio, ma se nelle settimane successive la community è disposta a scrivere correzioni per esso.
Nella community si sono anche sedimentati alcuni parametri da copiare direttamente. Qualcuno, dopo aver caricato un LoRA su Qwen 2.1, consiglia un CFG tra 2.0 e 3.0, 40 passaggi, con sampler res_multistep o beta. Un altro, che esegue il flusso di lavoro standard da 2,0 MP senza LoRA, dice che la nuova versione del modello di immagini Qwen ha prodotto un sapore alla Midjourney che prima si vedeva solo nei modelli closed source.
Ci sono progressi evidenti anche sulla velocità. Krea 2 Turbo, un checkpoint LoRA distillato in due passaggi, ha ridotto il tempo di denoising a 1024x1024 da 76,4 secondi a 19,3 secondi, quasi quattro volte tanto. Il prezzo è che la qualità dei dettagli resta tra 0,97 e 1,09 volte quella del modello insegnante, molto meglio dello 0,40–0,65 volte del Turbo nativo a due passaggi, ma le inquadrature in primo piano rendono al meglio, mentre sulle grandi scene è ancora un po' carente.
Anche le piccole lacune colmate di sfuggita
Oltre ai modelli principali, anche alcuni modelli open source di nicchia ma con una reputazione solida stanno gradualmente colmando le loro lacune. Aesthetic v1.1 e One Obsession v4 di Anima vengono spesso usati per output stilizzati; gli utenti ne lodano lo stile obbediente e i prompt facili da scrivere: fissando il seed e modificando il prompt si ottengono varianti coerenti, e si può anche renderizzare testo breve. I suoi punti deboli sono altrettanto schietti: i personaggi multipli nella stessa scena e i testi lunghi restano faticosi, e la community aspetta Anima 2.
Sul fronte di Krea 2, le lamentele si concentrano sul fatto che “seed diversi sembrano tutti uguali”; così qualcuno ha messo a punto un metodo senza aggiungere LoRA né installare nodi specifici del modello: riutilizzare l'encoder di testo di ComfyUI (per esempio Qwen3VL 4B) come LLM per espandere il prompt, trattando il seed del prompt come manopola di regolazione grossolana e il seed di campionamento come manopola di regolazione fine. Questo tipo di “soluzione artigianale” circola in fretta e spesso risolve i problemi concreti meglio della documentazione ufficiale.
Cosa conta dopo che la soglia si è abbassata
Mettendo insieme tutte queste mosse, la direzione è chiara. La generazione di immagini open source non risponde più solo alla domanda “si può disegnare in modo realistico?”, ma inizia a rispondere ad altre due domande: può girare su una macchina che posso permettermi, e può essere modificata con precisione secondo le mie intenzioni?
Hunyuan, comprimendo la VRAM a 6 GB e rendendo open source il modello di tagging, risponde alla prima domanda. Quel gruppo di correzioni e di LoRA di accelerazione della community di Qwen risponde al “modificare con precisione” e al “girare veloce” della seconda domanda. Le due linee sembrano scollegate, ma il punto d'arrivo è lo stesso: far passare la generazione dalla demo alla quotidianità.
Per i creatori comuni, questo è probabilmente il cambiamento più concreto dell'ultimo anno. Non devi più noleggiare potenza di calcolo per una singola immagine, né reinstallare l'intero ambiente per cambiare stile. Una scheda grafica di fascia media di qualche anno fa, più quella catena di strumenti messa insieme dalla community, basta già a produrre una serie di opere decenti.
Ciò che si è davvero ridotto è la distanza tra “vorrei provare” e “ho davvero iniziato a farlo”.
Articoli correlati
Agility Digit 5 arriva con un safety case, non solo una scheda tecnica
Il pavimento di un magazzino non è un laboratorio. La certificazione è il passaggio obbligato, non la demo.
Gli agenti di frontiera hanno completato il 30 percento di un flusso di lavoro di ricerca. Questo è il numero.
Gli agenti possono eseguire ricerca. Inventare la procedura è ancora fuori portata.
Figure AI blinda 3,5 miliardi di dollari di potenza di calcolo prima di avere un prodotto da vendere
La scommessa è che la generalizzazione sia un problema di potenza di calcolo. Il settore non ha ancora deciso.
OpenAI introduce finalmente gli sfondi trasparenti nell'API per le immagini
Una piccola funzionalità che elimina un intero passaggio dalla pipeline.