Google ha dimezzato i prezzi delle immagini e triplicato il costo dell'invio dei riferimenti

Google ha rilasciato Nano Banana 2.1 il 6 ottobre. La notizia principale è un taglio di prezzo: un'immagine 1K scende da 6,70 centesimi a 3,36, un'immagine 4K da 15,10 centesimi a 7,56. Il prezzo batch le dimezza ulteriormente, portando una generazione 1K a 1,68 centesimi. Per chiunque esegua generazione di immagini su larga scala, è il tipo di cambiamento che modifica ciò che vale la pena costruire.
La parte che riceve meno attenzione è sul lato input. Google ha dimezzato i token di output per milione, da 60 $ a 30 $, e ha aumentato i token di input da 0,50 $ a 1,50 $ per milione. L'output di testo e thinking è passato da 3 $ a 7,50 $ per milione. La cifra per immagine, però, è una frazione di ciò che un cliente paga effettivamente.
Perché il cambiamento sull'input conta
Una richiesta di immagine comporta molto più di un output. È un prompt più, sempre più spesso, immagini di riferimento. Nano Banana 2.1 accetta fino a 14 immagini di riferimento in una singola richiesta, e ogni immagine di input consuma circa 1.120 token. Un flusso di lavoro che fonde una dozzina di riferimenti per mantenere un prodotto coerente tra le varianti invia molti input per ogni output.
Triplica il prezzo dell'input e un flusso di lavoro con molti riferimenti può vedere un risparmio molto inferiore a quanto suggerisca il numero per immagine. I team che traggono maggior beneficio da questo rilascio sono quelli che fanno text-to-image su larga scala con prompt brevi. I team che dovranno prima modellare i propri numeri sono quelli che fanno editing multi-riferimento, perché è lì che domina il lato input.
La guida di Google stesso non lo nasconde. La pagina dei prezzi elenca 3.780 token per immagine 4K, che risulta più vicino a 11 centesimi che ai 7,56 centesimi circolati nella copertura. Fai i calcoli sul tuo carico di lavoro prima di dare per scontato che la bolletta si dimezzi.
Il modo pratico per modellarlo è contare le immagini al mese per ogni risoluzione, moltiplicare per il nuovo prezzo di output per immagine, poi aggiungere il costo dell'input, ovvero il numero medio di immagini di riferimento per richiesta moltiplicato per i token per immagine e per il nuovo prezzo dell'input. Per un carico di lavoro text-to-image con prompt brevi, il risparmio si avvicina a quello del titolo. Per un carico di lavoro con molto editing che invia una dozzina di riferimenti a ogni chiamata, il lato input può assorbirne la maggior parte. Il rilascio premia uno stile di lavoro e tassa un altro, e la pagina dei prezzi è l'unico posto in cui questa distinzione è visibile.
Cosa è effettivamente migliorato
La storia delle capacità è più concreta di quella del prezzo. Il modello mantiene coerenti quattro personaggi e dieci oggetti mentre fonde fino a 14 immagini di riferimento, la funzione che conta per cataloghi prodotti, storyboard e campagne di marca. La coerenza del soggetto tra i turni di editing è stato uno dei punti di rottura più frustranti negli strumenti per immagini, e questo lo affronta direttamente.
Anche il testo nelle immagini è migliorato. Il punteggio di fattualità delle infografiche di Google è balzato da 0,179 a 0,521, e l'azienda afferma di aver corretto artefatti di tiling che comparivano in rapporti d'aspetto ampi. L'output arriva a 1K, 2K e 4K, con rapporti d'aspetto fino a 8:1.
Il grounding è disponibile tramite Google Web e Image Search, e i livelli di thinking sono configurabili su minimal, medium e high. Il modello include anche C2PA Content Credentials per il tracciamento dell'origine, cosa che diventa più rilevante man mano che piattaforme e autorità di regolamentazione spingono per la provenienza delle immagini generate.
Ci sono limiti che vale la pena conoscere prima di migrare un agente. Generazione audio, caching, esecuzione di codice, ricerca file, function calling, Maps grounding, Live API, output strutturati e contesto URL non sono supportati. Se la tua pipeline si affida a function calling o output strutturati attorno allo step dell'immagine, quella logica deve risiedere in una chiamata separata a un modello testuale. La Batch API è supportata.
La lista di distribuzione è ampia fin dal primo giorno: l'app Gemini, AI Mode in Search, Google AI Studio, Google Flow, Stitch, Google Ads e la piattaforma enterprise ricevono tutti il modello al lancio. Questo conta perché significa che i miglioramenti raggiungono i prodotti consumer e l'API per sviluppatori nello stesso momento. Uno sviluppatore può lanciare una funzione basata su un modello che milioni di persone stanno già usando attraverso una superficie diversa, il che accorcia il ciclo di feedback tra una decisione di prodotto e la reazione di un utente.
Una restrizione viene ereditata dal resto del settore. La generazione di persone reali non è disponibile nel tier enterprise della piattaforma. Questo conterà per alcuni casi d'uso, ed è un promemoria che la questione delle capacità e quella dei permessi sono separate, anche per un importante fornitore di piattaforme.
La scadenza per la migrazione è più morbida di quanto sembri
Diversi articoli indicano il 29 ottobre come il giorno in cui il modello precedente, gemini-3.1-flash-image, smette di rispondere. Il changelog di Google stesso dice che è deprecato senza una data di dismissione annunciata. Chiunque pianifichi una migrazione attorno al 29 ottobre si basa su un numero che il fornitore non sta pubblicando.
Ciò non rende la migrazione opzionale. Un modello deprecato continua a funzionare finché il fornitore non dice il contrario, e il costo di restare su di esso è raddoppiato rispetto al sostituto. Il vecchio modello ora è un sovrapprezzo permanente del 50% sullo stesso output.
Il quadro più ampio è una guerra dei prezzi
Google, OpenAI e i laboratori cinesi di modelli open-weight stanno tutti inseguendo gli sviluppatori che integrano funzionalità per immagini nelle app. OpenAI rimuove gpt-image-1 dalla sua API il 23 ottobre e indirizza gli utenti verso GPT Image 2.5 Sunburst o Flare. Nella classifica indipendente Arena text-to-image, Nano Banana 2.1 si posiziona quinto dietro diverse versioni dei modelli di OpenAI.
Quella classifica è il contesto in cui va letto il taglio di prezzo. Nella board indipendente, Google è dietro ai leader di qualità. È in testa sulla distribuzione, con il modello distribuito su superfici consumer e API per sviluppatori lo stesso giorno, e ha scelto di competere sul prezzo anziché sul primo posto in un voto di preferenza. È una strategia coerente per un'azienda che ha già gli utenti. È anche un segnale che, per la fascia media del mercato, essere abbastanza buoni ed economici batte l'essere migliori e costosi.
Nel frattempo le opzioni open-weight continuano a colmare il divario dal basso. Modelli come Qwen-Image e i rilasci di decomposizione per livelli non hanno alcun costo per immagine, il che stabilisce un pavimento sotto cui nessun fornitore hosted può scendere. La guerra dei prezzi per immagine si combatte nello spazio tra i pesi aperti gratuiti e il tier premium, e quello spazio si restringe ogni trimestre.
Output più economici e una migliore resa del testo spingono le immagini AI sempre più verso lavori che prima richiedevano un designer per ogni revisione: banner localizzati, menu, semplici infografiche. È la direzione verso cui punta il taglio di prezzo. La domanda che ogni team deve porsi è se il lato input della propria pipeline gli consente di raccoglierne i benefici.
L'effetto più ampio riguarda ciò che conta come funzionalità di prodotto ragionevole. Quando un'immagine generata costa tre centesimi e arriva in pochi secondi, una funzionalità che produce un'immagine per utente per sessione diventa accessibile in un modo che non lo era l'anno scorso. Illustrazioni personalizzate, asset di marketing per località e placeholder generati passano tutti da idee costose a dettagli implementativi. Cambiamenti di prezzo a questo livello fanno più che ridurre i costi sul lavoro esistente. Rendono possibili nuove categorie di lavoro, perché l'aritmetica che le escludeva non vale più.
La decisione di Google di tagliare i prezzi di output triplicando quelli di input è una scommessa su quale stile di lavoro dominerà. Presuppone che i team faranno più generazione e meno editing con molti riferimenti, e prezza di conseguenza. I team che fanno l'opposto dovrebbero testare prima di migrare, anziché presumere che il titolo si applichi a loro.
Articoli correlati
Le foto satellitari sono ora dati di addestramento per i robot
Il collo di bottiglia nell'addestramento dell'IA fisica ha smesso di essere la potenza di calcolo o la capacità del modello. È diventata la qualità del mondo sintetico.
Gemini 3.5 Live Translate di Google elimina la pausa
Una traduzione che funziona in continuo, con la voce di chi parla, su un telefono già nella tua tasca, sposta la funzione da qualcosa che apri a qualcosa che è semplicemente attiva.
La Cina ha scritto il primo standard di sicurezza obbligatorio per gli agenti AI
La sicurezza passa dall'essere una funzionalità che pubblicizzi a un cancello che devi superare. L'inventario dei rischi si attesta su 13 categorie e 97 voci.
I contenuti generati dall'AI iniziano a dover dichiarare la propria identità
Questo passo non risolve tutti i problemi, ma trasforma «generato dall'AI» da un'opzione che si poteva nascondere a una domanda a cui è obbligatorio rispondere.