Qwen-Image 2.1 vs Nano Banana 2.0: un modello aperto da 7B è appena arrivato alle calcagna di Google

Alibaba ha rilasciato Qwen-Image 2.1 il 20 settembre, e da allora la conversazione sui benchmark non è più la stessa. Un generatore di immagini da 7 miliardi di parametri con pesi scaricabili ora si posiziona davanti a Nano Banana 2.0 di Google nella classifica di Alibaba, e abbastanza vicino anche nelle leaderboard indipendenti da far sgranare gli occhi a molti. Il thread su Hacker News dedicato al rilascio ha raccolto oltre 700 punti e quasi 200 commenti in un giorno, il che la dice lunga sull'attenzione repressa che questa categoria si porta dietro.
I numeri, e perché contano
Su Qwen-Image-Bench di Alibaba, il nuovo modello ottiene 60,28 contro i 59,82 di Nano Banana 2.0. Si tratta di un vantaggio di mezzo punto, che conta meno come affermazione tecnica e più come segnale: Alibaba ora indica Google come il benchmark che intende superare. L'unico modello a pesi aperti con meno parametri, LongCat-Image 6B di Meituan, resta indietro a circa 54 punti. Per confronto, GPT Image 2.5 Sunburst di OpenAI guida la classifica di Alibaba con 67, mentre Muse Image si ferma a 62,34; entrambi chiusi.
AI Arena, che gestisce voti ciechi uomo-contro-uomo, racconta una storia più modesta. Nano Banana 2.0 detiene 1260 di Elo contro i 1228 di Qwen-Image 2.1, con GPT Image Sunburst in testa a 1423 e Muse a 1276. Il modello aperto non sta ancora vincendo quella sfida. È però primo tra tutti i modelli a pesi aperti sia nella Image Edit Arena sia nella Text-to-Image Arena, che è la categoria che interessa davvero a molti. L'account di Qwen lo ha presentato come "il modello open source numero uno", e su questa affermazione più ristretta i dati indipendenti li supportano.
Dove brilla davvero
La trasparenza è la caratteristica che tutti continuano a citare. Qwen-Image 2.1 genera immagini RGBA in modo nativo, quindi puoi chiedere uno sfondo trasparente e ottenere un ritaglio pulito senza un secondo passaggio attraverso un tool di rimozione dello sfondo. Per chi vende sticker, per i negozi di print-on-demand e per chiunque componga elementi in un progetto più ampio, questo elimina un passaggio concreto. Il modello può anche modificare un livello trasparente senza appiattirlo, cosa che prima richiedeva un modello separato per i livelli.
La modifica con un massimo di dieci immagini di riferimento è l'altro titolo di rilievo. Dagli in pasto la foto di una persona e qualche scatto di abbigliamento, e compone la persona che indossa quei vestiti. Unisci sei ritratti in una foto di gruppo. Combina dieci immagini di mobili in un'unica stanza. Puoi indicare la regione da modificare in tre modi: disegnare cerchi colorati, dipingere sopra l'area, oppure passare l'originale più una maschera separata. La via della maschera è quella da usare quando non puoi permetterti di sovrascrivere i pixel originali.
Poi c'è la velocità su hardware modesto. I primi utilizzatori riportano un'immagine da 1 megapixel in circa cinque secondi su una RTX 4090, intorno ai 25 secondi sulle schede della serie 50, e all'incirca 50 secondi per un'immagine 2K su una RTX 3060 con 64 GB di RAM di sistema. Un commentatore su Hacker News ha detto di aver convertito un'immagine da 1 MP in circa cinque secondi su una 4090. Un utente su r/StableDiffusion ha riportato immagini da 1 MP in circa 25 secondi su una 5070 o 5080, osservando però che la modifica è l'operazione più lenta e che accumulare immagini di riferimento fa salire la latenza in modo evidente. Non è veloce come il cloud, ma è abbastanza veloce da non essere più una scusa.

Il nodo della licenza
Ecco la parte che ha diviso la community. I precedenti modelli di immagini Qwen erano rilasciati con licenza Apache 2.0, che ti permetteva di fare fine-tuning e vendere ciò che avevi creato. Qwen-Image 2.1 viene rilasciato con una licenza solo per ricerca, che vieta l'uso commerciale dei pesi senza un accordo separato con Alibaba. Il thread su HN si è acceso per l'ambiguità, e l'account di Alibaba è intervenuto per chiarire: i pesi sono vincolati, ma le immagini che generi con essi sono tue, anche per uso commerciale.
La distinzione sembra piccola ma conta molto. Se vuoi semplicemente generare immagini per clienti, prodotti o i tuoi progetti, sei a posto, e Alibaba ha confermato che gli output non comportano obblighi di licenza. Se invece volevi fare fine-tuning e ridistribuire il modello, sei tu quello che deve negoziare. La maggior parte delle persone rientra nella prima categoria, ed è per questo che le polemiche sono state fragorose ma alla fine contenute.
L'argomento più ampio dell'efficienza
La cosa interessante qui non è il punteggio grezzo. È l'efficienza. Qwen-Image 2.1 arriva a pochi punti Elo da modelli molte volte più grandi e del tutto chiusi. Il generatore ha 32 layer DiT Single-Stream, legge i prompt attraverso un text encoder Qwen3-VL 8B e renderizza nativamente in 2K fino a 2752 x 2752 pixel. Sul fronte dell'efficienza, dimostra che la distillazione architetturale e dati di addestramento più puliti possono colmare gran parte del divario che tutti davano per scontato richiedesse scala.
Questo mette sotto pressione il modello in abbonamento in un modo che nessuna slide di marketing potrebbe mai fare. Se una GPU consumer può renderizzare un output di qualità professionale in pochi secondi, "generiamo le immagini migliori" smette di essere una ragione sufficiente per pagare ogni mese. Google e OpenAI sono ancora in testa nelle attività di ragionamento semantico e spaziale più difficili, dove le valutazioni cieche continuano a dare loro il vantaggio. Qwen-Image 2.1 non ha colmato quel divario. Ha solo fatto sembrare quel divario opzionale per gran parte del lavoro quotidiano, e questa è una disruption più grande di qualsiasi singolo punteggio di benchmark.
Il verdetto pratico della community
Le discussioni sui benchmark ti portano solo fino a un certo punto. Il segnale più concreto è ciò che le persone riportano davvero dopo averlo provato in prima persona, e i resoconti di questa settimana sono insolitamente coerenti. Su r/StableDiffusion, un utente ha pubblicato un confronto affiancato di 192 immagini generate mettendo a paragone Qwen-Image 2.1 con Krea 2, ordinate per categoria come generazione di testo e anatomia umana. La conclusione era che il modello aperto se la cavava bene sulla struttura, ma ha dovuto aggirare il problema con un text encoder quantizzato per far entrare il denoiser su una 5090.
Un altro utente è riuscito a far girare il modello su un MacBook Pro M1 Max con 32 GB di memoria, generando un'immagine 512 x 512 in circa 24 secondi usando un runtime nativo Apple Silicon. È lento secondo gli standard desktop, ma dimostra che il modello non è vincolato all'hardware Nvidia, cosa che conta per una larga fetta di utenti occasionali. Un terzo ha costruito attorno ad esso uno studio locale in stile Fooocus, aggiungendo maschere, annotazioni, outpainting e riferimenti di posa OpenPose, e ha chiesto critiche oneste invece che elogi.
Le capacità di modifica hanno suscitato il maggiore entusiasmo. Un post descriveva la generazione di character design sheet senza alcun LoRA, usando la modifica con immagini di riferimento del modello per mantenere un personaggio coerente tra pose e outfit. Una volta serviva un'intera pila di modelli con fine-tuning e molto lavoro manuale di rifinitura. Il fatto che un singolo modello da 7B lo faccia subito, senza configurazioni, è il titolo silenzioso che la maggior parte dei grafici di benchmark non cattura.
Cosa tenere d'occhio adesso
I risultati iniziali sono ancora in fase di assestamento. Qwen ha creato il proprio benchmark e non ha pubblicato i prompt né i punteggi per categoria, quindi i numeri interni sono più un'affermazione che una misurazione. I numeri indipendenti di AI Arena sono più affidabili e leggermente meno lusinghieri. La lettura onesta al momento è che Qwen-Image 2.1 è il miglior modello di immagini a pesi aperti disponibile, un vero gradino sotto i leader chiusi, e una prova concreta che piccolo e aperto può essere competitivo. Le prossime settimane di test indipendenti diranno se il vantaggio di mezzo punto su Nano Banana 2.0 è duraturo o è stato solo una fetta lusinghiera del benchmark.
Articoli correlati
I modelli cinesi di immagini AI stanno conquistando fan all'estero, e Washington osserva
L'adozione è tecnica prima che politica. Gli sviluppatori scaricano ciò che funziona, e al momento proviene sempre più spesso da laboratori cinesi.
Cosa scommettono i mercati predittivi sulle immagini AI
Soldi veri scommettono su chi vincerà nelle immagini AI. OpenAI guida sulle immagini statiche, MiniMax sul video, e i modelli aperti sono il jolly che nessuno prezza.
I modelli di immagini cinesi stanno conquistando il mondo, e questo mese la conversazione è cambiata
I modelli di immagini cinesi stanno conquistando il mondo. Come sono cambiati questo mese i benchmark, le sezioni commenti e Washington.
I mercati predittivi stanno puntando denaro reale su chi vincerà nell'IA per immagini, e le quote sono sbilanciate
I mercati predittivi scommettono su chi vince nell'IA per immagini. Cosa misurano davvero le quote sbilanciate, e come leggerle.