← Torna al blog
Ai4 min

Tongyi Wanxiang Qwen-Image 2.1 è open source: perché con 7B parametri osa sfidare Google e OpenAI

Pubblicato 27 set 2026
Tongyi Wanxiang Qwen-Image 2.1 è open source: perché con 7B parametri osa sfidare Google e OpenAI

Il 20 settembre, il team Alibaba Tongyi ha silenziosamente sganciato una “piccola bomba nucleare”: Qwen-Image 2.1. Un modello text-to-image con soli 7 miliardi di parametri che, nelle valutazioni interne, ha superato Nano Banana 2.0 di Google, costringendo i modelli closed-source di OpenAI e Meta a voltarsi indietro. Appena uscita la notizia, Bilibili, Zhihu e, all’estero, Hacker News e Reddit sono esplosi.

Perché è “piccolo e aggressivo”

Negli ultimi anni i modelli di generazione di immagini sono diventati sempre più grandi: quelli closed-source arrivano facilmente a decine o centinaia di miliardi di parametri e per funzionare richiedono una scheda grafica professionale. Qwen-Image 2.1 fa il contrario, comprimendo la parte generativa a 7B, e sulla propria classifica Qwen-Image-Bench ha ottenuto 60,28 punti. Che livello è questo punteggio nella classifica generale? Nano Banana 2.0 di Google è a 59,82 punti, superato di mezza posizione; nella fazione open source il secondo è LongCat-Image (6B) di Meituan, con poco più di 54 punti. In altre parole, è attualmente il più forte tra tutti i modelli di cui si possono scaricare i pesi.

La valutazione indipendente di terze parti di AI Arena è un po’ più fredda. Lì Nano Banana 2.0 ha ottenuto 1260 punti, Qwen-Image 2.1 1228, e il closed-source GPT Image 2.5 Sunburst arriva a 1423 punti. Il divario c’è ancora, ma è ormai ridotto al punto da stargli alle calcagna. Per un modello open source, questa posizione è già di per sé una vittoria.

Tre capacità davvero utili

La prima è lo sfondo trasparente nativo. In passato, per creare adesivi, stampe personalizzate o bozze di design, dopo la generazione AI bisognava ritagliare di nuovo l’immagine. Qwen-Image 2.1 produce direttamente immagini RGBA con canale alpha; un unico modello svolge sia generazione sia editing, e i livelli trasparenti possono essere modificati direttamente senza essere uniti. Per chi lavora nel merchandising culturale e creativo, questo punto fa risparmiare moltissimo tempo.

La seconda è la modifica simultanea con dieci immagini di riferimento. Inserisci una foto di una persona e poi fornisci alcune immagini di vestiti: riesce a sintetizzare “questa persona che indossa questi capi”. Può anche fondere sei ritratti in una foto di gruppo, oppure inserire dieci immagini di mobili nella stessa stanza. Su Bilibili alcuni creator hanno già mostrato “coerenza del personaggio + cambio d’abito”, e la sezione commenti è piena di “è troppo naturale”.

La terza è la leggerezza sufficiente per girare su schede grafiche consumer. Su una RTX 4090 un’immagine da 1 megapixel richiede circa 5 secondi, sulle GPU serie 50 circa 25 secondi; c’è persino chi fa girare immagini 2K con una RTX 3060 e 64 GB di RAM, una ogni 50 secondi. Alibaba dichiara ufficialmente una configurazione minima con 6 GB di VRAM, e su Bilibili stanno già iniziando a comparire in fila tutorial con “pacchetti all-in-one”.

Un computer desktop sta generando un’immagine, sullo schermo la scena si forma gradualmente dall’aggregarsi di particelle

Ciò che salta più all’occhio non sono le prestazioni, ma la licenza

A far litigare davvero la community è la licenza. La precedente serie Qwen-Image era sotto Apache 2.0, utilizzabile liberamente in ambito commerciale. Questa volta si passa alla Qwen Research License “solo per ricerca”, e per l’uso commerciale bisogna trattare separatamente con Alibaba. Su Reddit e HN è una polemica accesa: alcuni pensano che sia una marcia indietro, altri ritengono che “ti diamo i pesi da scaricare, le immagini le usi come vuoi” sia già abbastanza generoso.

Alibaba è intervenuta rapidamente per chiarire con una frase: i pesi del modello non possono essere ridistribuiti per uso commerciale, ma le immagini che generi con esso sono tue e puoi usarle commercialmente senza problemi. Questa distinzione è cruciale: per la stragrande maggioranza di chi vuole solo creare immagini, l’impatto non è poi così grande.

Il significato più ampio di questa vicenda

Qwen-Image 2.1 ha dimostrato una cosa: grazie alla distillazione dell’architettura e a dati di addestramento più puliti, i modelli piccoli possono raggiungere il livello di generazione immagini dei modelli grandi. Il titolo di quel video del creator Bilibili 爱分享的剑二十七 è molto diretto: “Il modello open source di pittura AI di Alibaba surclassa una serie di strumenti a pagamento”. È un’affermazione un po’ esagerata, ma la direzione è giusta.

Quando un’immagine può uscire in pochi secondi su una scheda grafica consumer, pagare o meno un abbonamento mensile diventa un conto che ogni creatore deve rifare. I produttori closed-source dovranno d’ora in poi dimostrare il proprio valore con la velocità, l’integrazione nei flussi di lavoro e la collaborazione multimodale, non potendo più contare solo sul fatto che “genero immagini belle”.

Per le persone comuni, la buona notizia è che il tetto massimo della generazione di immagini open source, questo mese, si è alzato ancora un po’.

Articoli correlati