Google halbiert seine Bildpreise – und verdreifacht die Kosten für das Senden von Referenzen

Google hat Nano Banana 2.1 am 6. Oktober veröffentlicht. Die Schlagzeile ist eine Preisreduzierung: Ein 1K-Bild fällt von 6,70 Cent auf 3,36, ein 4K-Bild von 15,10 Cent auf 7,56. Batch-Preise halbieren das noch einmal, wodurch eine 1K-Generierung auf 1,68 Cent kommt. Für alle, die Bildgenerierung in großem Umfang betreiben, ist das die Art von Veränderung, die beeinflusst, was sich zu bauen lohnt.
Der Teil, der weniger Aufmerksamkeit erhält, liegt auf der Eingabeseite. Google hat die Ausgabe-Tokens pro Million von 60 $ auf 30 $ halbiert und die Eingabe-Tokens von 0,50 $ auf 1,50 $ pro Million erhöht. Text- und Thinking-Ausgabe stiegen von 3 $ auf 7,50 $ pro Million. Die Angabe pro Bild ist jedoch nur ein Bruchteil dessen, was ein Kunde tatsächlich zahlt.
Warum die Änderung bei den Eingaben wichtig ist
Eine Bildanfrage enthält weit mehr als eine Ausgabe. Sie ist ein Prompt plus – zunehmend – Referenzbilder. Nano Banana 2.1 akzeptiert bis zu 14 Referenzbilder in einer Anfrage, und jedes Eingabebild verbraucht ungefähr 1.120 Tokens. Ein Workflow, der ein Dutzend Referenzen zusammenführt, um ein Produkt über Varianten hinweg konsistent zu halten, sendet für jede Ausgabe sehr viel Eingabe.
Verdreifacht man den Eingabepreis, kann ein Workflow mit vielen Referenzen eine Ersparnis sehen, die viel kleiner ist, als die Zahl pro Bild vermuten lässt. Die Teams, die am meisten von diesem Release profitieren, sind diejenigen, die Text-zu-Bild in großem Umfang mit kurzen Prompts betreiben. Die Teams, die zuerst ihre eigenen Zahlen modellieren müssen, sind diejenigen, die Multi-Referenz-Editing betreiben, denn dort dominiert die Eingabeseite.
Googles eigene Hinweise verbergen das nicht. Die Preisseite listet 3.780 Tokens pro 4K-Bild, was eher auf 11 Cent hinausläuft als auf die 7,56 Cent, die in der Berichterstattung kursieren. Rechnen Sie mit Ihrer eigenen Arbeitslast nach, bevor Sie annehmen, dass sich die Rechnung halbiert.
Die praktische Methode zur Modellierung ist, Bilder pro Monat in jeder Auflösung zu zählen, mit dem neuen Ausgabepreis pro Bild zu multiplizieren und dann die Eingabekosten hinzuzufügen, also die durchschnittliche Anzahl der Referenzbilder pro Anfrage mal Tokens pro Bild mal den neuen Eingabepreis. Für eine Text-zu-Bild-Arbeitslast mit kurzen Prompts liegt die Ersparnis nahe an der Schlagzeile. Bei einer bearbeitungsintensiven Arbeitslast, die bei jedem Aufruf ein Dutzend Referenzen sendet, kann die Eingabeseite das meiste davon auffangen. Das Release belohnt den einen Arbeitsstil und besteuert einen anderen, und die Preisseite ist der einzige Ort, an dem dieser Unterschied sichtbar ist.
Was sich tatsächlich verbessert hat
Die Geschichte der Fähigkeiten ist konkreter als die des Preises. Das Modell hält vier Charaktere und zehn Objekte konsistent, während es bis zu 14 Referenzbilder zusammenführt, was das Feature ist, das für Produktkataloge, Storyboards und Markenkampagnen zählt. Subjektkonsistenz über Bearbeitungsschritte hinweg war einer der frustrierenderen Fehlerpunkte in Bildwerkzeugen, und dies zielt direkt darauf ab.
Auch Text in Bildern hat sich verbessert. Googles eigener Infografik-Fakten-Score sprang von 0,179 auf 0,521, und das Unternehmen sagt, es habe Kachelartefakte behoben, die bei breiten Seitenverhältnissen auftraten. Die Ausgabe geht bis 1K, 2K und 4K, mit Seitenverhältnissen bis zu 8:1.
Grounding ist über Google Web- und Bildersuche verfügbar, und die Thinking-Stufen sind auf minimal, mittel und hoch konfigurierbar. Das Modell trägt außerdem C2PA Content Credentials zur Herkunftsverfolgung, was relevanter wird, da Plattformen und Regulierungsbehörden auf Provenienz bei generierten Bildern drängen.
Es gibt Grenzen, die man kennen sollte, bevor man einen Agenten überführt. Audiogenerierung, Caching, Codeausführung, Dateisuche, Function Calling, Maps-Grounding, die Live API, strukturierte Ausgaben und URL-Kontext werden nicht unterstützt. Wenn Ihre Pipeline auf Function Calling oder strukturierte Ausgaben rund um den Bildschritt angewiesen ist, muss diese Logik in einem separaten Textmodell-Aufruf untergebracht werden. Die Batch API wird unterstützt.
Die Vertriebsliste ist von Anfang an breit: Die Gemini-App, der AI-Modus in der Suche, Google AI Studio, Google Flow, Stitch, Google Ads und die Enterprise-Plattform erhalten das Modell zum Start. Das ist wichtig, denn es bedeutet, dass die Verbesserungen Verbraucherprodukte und die Entwickler-API gleichzeitig erreichen. Ein Entwickler kann ein Feature gegen ein Modell ausliefern, das Millionen von Menschen bereits über eine andere Oberfläche nutzen, was die Rückkopplungsschleife zwischen einer Produktentscheidung und einer Nutzerreaktion verkürzt.
Eine Einschränkung setzt sich aus dem Rest der Branche fort. Das Generieren realer Personen ist in der Enterprise-Plattform-Stufe nicht verfügbar. Das wird für einige Anwendungsfälle wichtig sein, und es ist eine Erinnerung daran, dass die Frage der Fähigkeit und die Frage der Erlaubnis getrennt sind, selbst für einen großen Plattformanbieter.
Die Migrationsfrist ist weicher, als sie aussieht
Mehrere Artikel nennen den 29. Oktober als den Tag, an dem das vorherige Modell, gemini-3.1-flash-image, nicht mehr antwortet. Googles eigener Changelog sagt, es sei veraltet, ohne dass ein Abschaltdatum angekündigt wurde. Wer eine Migration um den 29. Oktober herum plant, arbeitet mit einer Zahl, die der Anbieter nicht veröffentlicht.
Das macht die Migration nicht optional. Ein veraltetes Modell funktioniert weiter, bis der Anbieter etwas anderes sagt, und die Kosten, darauf zu bleiben, haben sich im Vergleich zum Nachfolger verdoppelt. Das alte Modell ist jetzt ein dauerhafter Aufschlag von 50 % auf dieselbe Ausgabe.
Das größere Bild ist ein Preiskrieg
Google, OpenAI und die chinesischen Open-Weight-Labore sind alle hinter Entwicklern her, die Bildfunktionen in Apps einbauen. OpenAI entfernt gpt-image-1 am 23. Oktober aus seiner API und verweist Nutzer auf GPT Image 2.5 Sunburst oder Flare. Auf dem unabhängigen Arena-Text-zu-Bild-Board belegt Nano Banana 2.1 den fünften Platz hinter mehreren Versionen von OpenAIs Modellen.
Dieses Ranking ist der Kontext, vor dem die Preissenkung gelesen werden muss. Auf dem unabhängigen Board liegt Google hinter den Qualitätsführern zurück. Es führt bei der Verbreitung, da das Modell am selben Tag über Verbraucher-Oberflächen und die Entwickler-API ausgeliefert wird, und hat sich entschieden, über den Preis zu konkurrieren statt über den Spitzenplatz in einer Präferenzabstimmung. Das ist eine kohärente Strategie für ein Unternehmen, das die Nutzer bereits hat. Es ist auch ein Signal, dass für die Mitte des Marktes gut genug und günstig besser ist als am besten und teuer.
Unterdessen schließen die Open-Weight-Optionen die Lücke von unten. Modelle wie Qwen-Image und die Layer-Decomposition-Releases tragen überhaupt keine Rechnung pro Bild, was eine Untergrenze setzt, die kein gehosteter Anbieter unterbieten kann. Der Preiskrieg pro Bild wird in dem Raum zwischen kostenlosen Open Weights und der Premium-Stufe ausgetragen, und dieser Raum wird jedes Quartal enger.
Günstigere Ausgabe und bessere Textwiedergabe treiben KI-Bilder weiter in Arbeiten, die früher für jede Überarbeitung einen Designer erforderten: lokalisierte Banner, Menükarten, einfache Infografiken. Das ist die Richtung, in die die Preissenkung zeigt. Die Frage, die jedes Team für sich beantworten muss, ist, ob die Eingabeseite der eigenen Pipeline es zulässt, davon zu profitieren.
Die breitere Wirkung betrifft die Frage, was als vernünftiges Produktfeature gilt. Wenn ein generiertes Bild drei Cent kostet und in wenigen Sekunden ankommt, wird ein Feature, das ein Bild pro Nutzer und Sitzung erzeugt, auf eine Weise erschwinglich, wie es letztes Jahr nicht der Fall war. Personalisierte Illustrationen, Marketing-Assets pro Standort und generierte Platzhalter bewegen sich alle von teuren Ideen zu Implementierungsdetails. Preisänderungen auf diesem Niveau senken nicht nur die Kosten für bestehende Arbeit. Sie ermöglichen neue Kategorien von Arbeit, weil die Arithmetik, die sie ausgeschlossen hat, nicht mehr gilt.
Googles Entscheidung, die Ausgabepreise zu senken und gleichzeitig die Eingabepreise zu verdreifachen, ist eine Wette darauf, welcher Arbeitsstil dominieren wird. Sie geht davon aus, dass Teams mehr generieren und weniger referenzlastiges Editing betreiben, und bepreist dies entsprechend. Teams, die das Gegenteil tun, sollten vor der Migration testen, statt anzunehmen, dass die Schlagzeile auf sie zutrifft.
Verwandte Artikel
Satellitenbilder sind jetzt Trainingsdaten für Roboter
Der Engpass beim Training physischer KI ist nicht mehr die Rechenleistung oder die Modellfähigkeit. Er wurde die Qualität der synthetischen Welt.
Googles Gemini 3.5 Live Translate beseitigt die Pause
Übersetzung, die kontinuierlich läuft, in der Stimme der sprechenden Person, auf einem Telefon, das ohnehin schon in der Tasche steckt, macht das Feature von etwas, das man öffnet, zu etwas, das einfach an ist.
China hat den ersten verbindlichen Sicherheitsstandard für KI-Agenten geschrieben
Sicherheit wird von einem Feature, mit dem man wirbt, zu einer Hürde, die man passieren muss. Das Risikoinventar umfasst 13 Kategorien und 97 Punkte.
KI-generierte Inhalte müssen jetzt ihre Identität offenlegen
Dieser Schritt löst nicht alle Probleme, aber er macht „KI-generiert“ von einer Option, die man verbergen konnte, zu einer Frage, die beantwortet werden muss.