← Torna al blog
Ai4 min

Tongyi Wanxiang Qwen-Image 2.1 open source: come un piccolo modello da 7B mette immagini trasparenti ed editing con 10 immagini in una singola GPU consumer

Pubblicato 27 set 2026
Tongyi Wanxiang Qwen-Image 2.1 open source: come un piccolo modello da 7B mette immagini trasparenti ed editing con 10 immagini in una singola GPU consumer

Il 20 settembre, il team Alibaba Qwen ha pubblicato Qwen-Image 2.1 sulla piattaforma open source. Appena diffusa la notizia, su Bilibili i video con pacchetti integrati sono aumentati già in giornata, e i titoli riportavano quasi tutti la stessa frase: si può eseguire con appena 6 GB di VRAM. Per un settore come quello del text-to-image, spesso etichettato in passato come "affamato di GPU", questo numero è già una notizia.

A prima vista, molti lo considerano la nuova generazione successiva a Qwen-Image 3.0. In realtà non lo è. Qwen aveva annunciato Qwen-Image 3.0 lo scorso luglio, sostenendo il supporto a prompt ultra-lunghi da 4500 token, ma si trattava solo di un'anteprima, senza pesi né benchmark. Il 2.1 è il legittimo successore della linea open source 2.0; la parte di generazione visiva resta un Single-Stream DiT a 32 livelli, con 7B di parametri, mantenendo la stessa architettura leggera del 2.0 rilasciato a febbraio.

Ciò che sorprende davvero sono le funzionalità, non i parametri. Visti insieme, questi tre aggiornamenti puntano nella stessa direzione: far entrare davvero gli strumenti di generazione immagini nei flussi di produzione, invece di fermarsi allo stadio di "demo impressionante".

Il primo è la generazione nativa di immagini trasparenti. In passato, per generare un PNG con canale alfa serviva un modello separato; Qwen aveva pubblicato a dicembre un modello dedicato, Qwen-Image-Layered. Il 2.1 integra la capacità delle immagini trasparenti in un modello unificato: con un solo prompt si può passare da un'immagine normale a RGBA e modificare direttamente i livelli trasparenti — cambiare l'espressione mantenendo lo sfondo trasparente, oppure ritagliare il soggetto da una foto e usarlo come asset. Per chi crea immagini per l'e-commerce o asset UI, questo passaggio elimina parecchi fastidi legati ai continui cambi di strumento.

Il secondo è l'aumento delle immagini di riferimento da poche a 10. Con il 2.0 l'editing multi-immagine era ancora limitato a pochi input; il 2.1 può combinare direttamente sei ritratti diversi in una foto di gruppo, oppure mettere insieme un outfit completo usando un'immagine ciascuno per modella, vestito, scarpe, borsa e cappello. A livello implementativo usa un meccanismo di attenzione a granularità mista: il testo segue una causal mask a livello di token, la generazione delle immagini una mask a livello di chunk, e la riutilizzazione della KV cache fa sì che immagini di riferimento e istruzioni vengano calcolate una sola volta e riutilizzate più volte. In parole povere, si tratta di usare l'ingegnerizzazione per contenere il rallentamento dovuto all'aumento delle immagini.

Il terzo è il perfezionamento dell'editing locale. Ora si possono disegnare cerchi, tracciare annotazioni o caricare separatamente una mask, limitando l'istruzione di modifica a una piccola area senza toccare il resto dell'immagine. La copertura dei task si è estesa anche a immagini panoramiche, infografiche e storyboard.

Sulla scrivania di un designer, lo schermo mostra l'editing di immagini AI e la sovrapposizione di livelli trasparenti

Ma questa volta l'open source arriva con una condizione raramente vista in passato. Qwen-Image 2.1 usa la Qwen Research License, che consente solo ricerca e valutazione; per l'uso commerciale bisogna negoziare una licenza a pagamento. Questo lo distingue dalla rotta Apache 2.0 seguita di recente dalla maggior parte dei progetti open source di Alibaba, e lo allontana anche da modelli a pesi aperti completamente permissivi come Z-Image e Ideogram 4.0. Per i team che vogliono usarlo per commesse commerciali o per costruire prodotti, la licenza è una cosa da verificare prima ancora della soglia della GPU.

La reazione della community cinese si è concentrata sul fatto che "si riesce a eseguire". Diversi creator di Bilibili stanno preparando pacchetti integrati one-click, puntando su estrazione e uso immediato, minimo 6 GB di VRAM, supporto alla generazione in batch e all'editing di immagini; nei commenti molti lo confrontano con strumenti a pagamento. Questo sentimento ha un retroscena: negli ultimi due anni, i modelli di generazione immagini più efficaci sono per lo più chiusi dietro API e abbonamenti, mentre quelli eseguibili in locale sono spesso un gradino sotto. Qwen-Image 2.1 si trova proprio su quel punto d'intersezione — dimensioni ridotte, open source, prestazioni paragonate a concorrenti closed source — e così l'affermazione "straccia gli strumenti a pagamento" ha terreno fertile per diffondersi, anche se la frase in sé merita qualche dubbio.

Oggettivamente, il valore di Qwen-Image 2.1 non sta nello "stracciare" qualcuno, ma nel fatto che racchiude immagini trasparenti, editing multi-immagine e controllo locale — cose che i designer fanno ogni giorno — in un piccolo modello eseguibile su una GPU consumer. Al momento della consegna, cosa manca ancora a un'immagine generata dall'AI per essere utilizzabile? Persone da scontornare, asset di cui cambiare il testo, disposizione dei prodotti da regolare, testo e forma della bottiglia sulla confezione che non devono cambiare insieme. Il 2.1 punta proprio a questi "ultimi chilometri". Se possa davvero sostituire una parte degli strumenti a pagamento dipende da cosa ci fa chi lo usa, non da ciò che dice un titolo.

Almeno a giudicare dall'entusiasmo della community open source, la risposta tende all'ottimismo. Un piccolo modello da 7B, più una scheda da 6 GB, trasformano "eseguire in locale un modello di generazione immagini utilizzabile" da smanettamento in un doppio clic dopo l'estrazione. L'impatto sul settore potrebbe durare più a lungo di un singolo benchmark.

Articoli correlati