← Torna al blog
Aicirca 7 min di lettura

Google ha dimezzato il prezzo di output di Nano Banana 2.1 e ha corretto i suoi punti deboli

Pubblicato 6 ott 2026
Google ha dimezzato il prezzo di output di Nano Banana 2.1 e ha corretto i suoi punti deboli

--- title: Google ha dimezzato il prezzo di output di Nano Banana 2.1 e ha corretto i suoi punti deboli meta_title: Nano Banana 2.1 dimezza il prezzo e ricostruisce l'editing meta_description: Nano Banana 2.1 di Google punta su design visivo, editing con maschera e coerenza del soggetto, con il prezzo di output tagliato di circa la metà per le risoluzioni 1K e 4K. ---

Google ha rilasciato Nano Banana 2.1 il 6 ottobre, e il dettaglio più rilevante sta fuori dall'elenco delle funzionalità: il prezzo.

Il costo di output è sceso da 0,067 $ a 0,0336 $ per immagine a 1K, e da 0,151 $ a 0,0756 $ per immagine a 4K, secondo il listino standard dell'API Gemini. Entrambi i tagli si avvicinano alla metà, il che cambia l'economia di qualsiasi flusso di lavoro che generi immagini in volume, e il nuovo modello è costruito sull'architettura Gemini 3.6 Flash.

Sulla carta, l'azienda ha migliorato tre cose: design visivo, editing con maschera e coerenza del soggetto.

Design visivo e rendering del testo

Le dimostrazioni di Google puntano sulla parte della generazione di immagini che è stata più debole: far quadrare testo e layout. Gli esempi mostrano tipografia svizzera brutalista con lettere sovrapposte e stringhe di coordinate, un poster da road trip anni '70 in cui una figura occlude una parola dietro di sé, la homepage di uno studio di design e un poster di prodotto modellato su una foto di prodotto esistente.

La dichiarazione va oltre il renderizzare tutto questo in modo pulito: il modello rispetta istruzioni specifiche su testo e layout invece di produrre approssimazioni plausibili. La conformità ai prompt sulla tipografia è stata una lacuna costante, e il design è l'ambito in cui l'errore è più visibile, perché un carattere fuori posto rovina l'intero lavoro.

Il modello supporta anche rapporti d'aspetto insoliti, tra cui 1:4, 4:1, 1:8 e 8:1, e Google afferma che gli artefatti di giunzione negli output 2K e 4K sono stati corretti.

Editing con maschera e perché conta più di quanto sembri

L'editing con maschera significa contrassegnare una regione in un'immagine e lasciare che il modello modifichi solo quella regione. La dimostrazione di Google usa un soffione di tarassaco con gocce d'acqua, con una linea tracciata a mano attorno al seme e un prompt che chiede di estrarre l'oggetto cerchiato in un ambiente completamente diverso.

Questa è la funzionalità che conta di più per il lavoro di produzione, anche se riceve meno attenzione della qualità dell'immagine. La differenza tra un modello che rigenera un'intera immagine quando vuoi cambiare un solo elemento e un modello che modifica solo l'area contrassegnata è la differenza tra uno strumento che usi per le bozze e uno che usi per le revisioni. L'iterazione è dove se ne va la maggior parte del tempo creativo reale.

L'asticella tecnica qui è più alta di quanto sembri. Lasciare intatto il resto dell'immagine significa che il modello deve preservare uno specifico intorno di pixel mentre genera nuovi contenuti che si fondano in modo convincente al confine. Black Forest Labs ha pubblicato questo mese una capacità comparabile con FLUX 3 Image, dove le modifiche parziali lasciano tra il 67,8% e l'89,7% dei pixel identici bit per bit. Quell'intervallo è il modo onesto di riportarlo, perché la frazione dipende da quanto è grande la regione modificata.

Coerenza del soggetto

Google afferma che il modello mantiene la coerenza dei personaggi su un massimo di 14 immagini di riferimento, coprendo fino a quattro personaggi. Un numero elevato per un modello di immagini generico, che indica usi in cui la stessa persona o lo stesso prodotto deve comparire in una serie di immagini: vignette a fumetti, varianti di campagna, cataloghi di prodotti.

La coerenza tra i riferimenti è un problema difficile perché il modello deve tenere l'identità separata da stile, posa e illuminazione. Riuscirci con 14 riferimenti suggerisce che la cifra sia una capacità reale e non un massimo di marketing, anche se l'azienda non ha pubblicato una verifica indipendente del limite superiore.

Una singola goccia d'acqua su una foglia verde scuro, coperta per metà da una macchia opaca smerigliata

Il valore pratico dipende da dove si colloca davvero il tetto. Quattro personaggi mantenuti in modo coerente bastano per un catalogo prodotti con diversi modelli, o per una campagna con un piccolo cast ricorrente. Non bastano per un fumetto con un ampio ensemble, che richiederebbe più chiamate o un fine-tuning. A stabilirlo sarebbero i test indipendenti.

C'è una capacità correlata degna di nota dalla stessa finestra di rilascio. Qwen-Image-2.1-Pro di Alibaba, attivo su Alibaba Cloud dal 2 ottobre, punta sulla generazione di livelli RGBA trasparenti e sull'estrazione del soggetto dalle foto, usando un componente di generazione visiva da 7B con un design DiT a stream singolo a 32 livelli. I due modelli convergono sullo stesso problema da direzioni diverse, il che è un segnale ragionevole del fatto che coerenza e località delle modifiche siano ormai ciò su cui gli acquirenti chiedono informazioni.

Il divario nei benchmark è l'avvertenza onesta

La copertura di terze parti del rilascio contiene una nota importante che la narrazione di Google omette. I resoconti descrivono il modello come superiore al precedente modello Pro su alcuni benchmark di generazione di immagini, notando al contempo che il predecessore otteneva buoni punteggi nei test e che il modello Pro produrrebbe immagini migliori nell'uso reale.

Quel divario tra prestazioni nei benchmark e output pratico è una caratteristica ricorrente della valutazione dei modelli di immagini. Un modello può ottenere buoni punteggi in test strutturati e deludere comunque nei compiti che gli utenti tentano davvero. Il prezzo più basso complica la questione: un modello più economico che rende meno nella pratica non è la proposta di valore che il prezzo implica.

La soluzione arriverà dai test indipendenti. Se gli utenti che confrontano Nano Banana 2.1 con il modello Pro preferiranno sistematicamente il più recente, i benchmark acquisteranno credibilità. Se il modello Pro continuerà a vincere sugli output reali, i punteggi diventeranno un segnale più debole.

C'è anche una complicazione pratica degna di nota. La copertura del lancio segnala una discrepanza tra la documentazione ufficiale di Google, che indica la disponibilità generale, e alcuni aggregatori di terze parti che elencano il modello come "in arrivo" su certe piattaforme. Le prime segnalazioni suggeriscono anche che le richieste potrebbero ancora essere indirizzate alle versioni precedenti del modello in alcuni casi, nonostante gli aggiornamenti dell'interfaccia. Chiunque integri il modello dovrebbe verificare quale versione risponde effettivamente.

Dismissione dei modelli e la tassa di manutenzione

Un dettaglio che conta per chiunque abbia il modello attuale in produzione: la versione API di Nano Banana 2 sarà dismessa il 29 ottobre.

È una finestra breve. I team con Nano Banana 2 in una pipeline hanno circa tre settimane per testare la 2.1, confrontare la qualità dell'output sul proprio corpus e migrare. Dato che il nuovo modello costa meno, la migrazione vale probabilmente la pena, ma il calendario è più stretto di quanto la maggior parte dei team sceglierebbe.

Questa cadenza di dismissione sta diventando routine ed è essa stessa una ragione per cui alcuni team preferiscono modelli di immagini a pesi aperti. Quando i pesi sono tuoi, il modello non scompare secondo i tempi di un fornitore. Il compromesso è che il deployment, gli aggiornamenti e le regressioni di qualità sono a tuo carico, un costo reale che i modelli ospitati dai fornitori assorbono per te.

Cosa tenere d'occhio

Se il divario tra benchmark e pratica si ridurrà grazie ai test indipendenti. Questa è la domanda centrale, e la risposta arriverà dagli utenti che fanno confronti sul proprio lavoro, non dai materiali stampa.

Se la coerenza su 14 riferimenti reggerà nella pratica. Se regge, il modello apre casi d'uso che prima richiedevano fine-tuning: personaggi coerenti in una serie, set di prodotti, varianti di campagna. Se regge per quattro personaggi ma non per quattordici, il tetto pratico è più basso di quanto la specifica suggerisca.

Se il taglio di prezzo è duraturo o introduttivo. Circa la metà in meno è aggressivo, e se i concorrenti si allineeranno, la generazione di immagini su larga scala diventerà sostanzialmente più economica per tutti. Se è una finestra promozionale, i team che costruiscono proiezioni di costo su di essa dovranno rivederle.

Nano Banana 2.1 è un'iterazione solida che affronta i punti deboli giusti e si posiziona nel prezzo per essere usata, non solo provata. Il taglio di prezzo è la vera notizia, ed è probabilmente la parte a cui gli altri fornitori reagiranno.

Articoli correlati