Google halbiert den Ausgabepreis von Nano Banana 2.1 und behebt die schwächsten Features

--- title: Google halbiert den Ausgabepreis von Nano Banana 2.1 und behebt die schwächsten Features meta_title: Nano Banana 2.1 halbiert den Preis und baut die Bearbeitung neu auf meta_description: Googles Nano Banana 2.1 zielt auf visuelles Design, Maskenbearbeitung und Subjektkonsistenz, wobei die Ausgabepreise für 1K- und 4K-Auflösungen etwa halbiert werden. ---
Google hat Nano Banana 2.1 am 6. Oktober veröffentlicht, und das folgenreichste Detail steht außerhalb der Funktionsliste: der Preis.
Die Ausgabekosten sanken von 0,067 $ auf 0,0336 $ pro 1K-Bild und von 0,151 $ auf 0,0756 $ pro 4K-Bild, zu den Standardpreisen der Gemini API. Beide Senkungen liegen nahe bei der Hälfte, was die Wirtschaftlichkeit jedes Workflows verändert, der Bilder in großem Umfang generiert, und das neue Modell basiert auf der Gemini-3.6-Flash-Architektur.
Auf den ersten Blick hat das Unternehmen drei Dinge verbessert: visuelles Design, Maskenbearbeitung und Subjektkonsistenz.
Visuelles Design und Textwiedergabe
Googles Demonstrationen zielen auf den Teil der Bildgenerierung, der am schwächsten war: Text und Layout richtig hinzubekommen. Die Beispiele zeigen Schweizer brutalistische Typografie mit überlappenden Buchstabenformen und Koordinatenketten, ein Roadtrip-Poster der 1970er-Jahre, bei dem eine Figur ein Wort hinter sich verdeckt, eine Homepage eines Designstudios und ein Produktposter, das auf einem vorhandenen Produktfoto basiert.
Die Behauptung geht über das saubere Rendern dieser Elemente hinaus: Das Modell befolgt spezifische Text- und Layoutanweisungen, statt plausibel wirkende Annäherungen zu erzeugen. Prompt-Treue bei Typografie war eine anhaltende Lücke, und Designarbeit ist der Bereich, in dem das Versagen am sichtbarsten ist, denn ein falsch platzierter Buchstabe ruiniert das Werk.
Das Modell unterstützt außerdem ungewöhnliche Seitenverhältnisse wie 1:4, 4:1, 1:8 und 8:1, und Google sagt, dass Stitching-Artefakte in 2K- und 4K-Ausgaben behoben wurden.
Maskenbearbeitung und warum sie wichtiger ist, als sie klingt
Maskenbearbeitung bedeutet, einen Bereich in einem Bild zu markieren und das Modell nur diesen Bereich ändern zu lassen. Googles Demonstration verwendet einen Löwenzahn-Samenstand mit Wassertropfen, mit einer handgezeichneten Linie um den Samen, und einen Prompt, der darum bittet, das umkreiste Objekt in eine völlig andere Umgebung zu extrahieren.
Dies ist die Funktion, die für Produktionsarbeit am wichtigsten ist, auch wenn sie weniger Aufmerksamkeit als die Bildqualität erhält. Der Unterschied zwischen einem Modell, das ein ganzes Bild neu generiert, wenn man ein Element geändert haben möchte, und einem Modell, das nur den markierten Bereich ändert, ist der Unterschied zwischen einem Werkzeug für Entwürfe und einem für Überarbeitungen. Iteration ist der Bereich, in den die meiste echte kreative Zeit fließt.
Die technische Messlatte liegt hier höher, als es scheint. Den Rest des Bildes unangetastet zu lassen bedeutet, dass das Modell eine bestimmte Pixelumgebung bewahren muss, während es neuen Inhalt generiert, der an der Grenze überzeugend verschmilzt. Black Forest Labs hat diesen Monat mit FLUX 3 Image eine vergleichbare Fähigkeit veröffentlicht, bei der Teilbearbeitungen zwischen 67,8 % und 89,7 % der Pixel bitidentisch lassen. Diese Spanne ist die ehrliche Art, es anzugeben, denn der Anteil hängt davon ab, wie groß der bearbeitete Bereich ist.
Subjektkonsistenz
Google sagt, das Modell bewahrt Figurenkonsistenz über bis zu 14 Referenzbilder hinweg und deckt bis zu vier Figuren ab. Diese Zahl ist hoch für ein allgemeines Bildmodell und deutet auf Anwendungen hin, bei denen dieselbe Person oder dasselbe Produkt über eine Reihe von Bildern hinweg erscheinen muss: Comic-Panels, Kampagnenvarianten, Produktkataloge.
Konsistenz über Referenzen hinweg ist ein hartes Problem, weil das Modell Identität von Stil, Pose und Beleuchtung getrennt halten muss. Es bei 14 Referenzen richtig hinzubekommen, deutet darauf hin, dass die Zahl eine echte Fähigkeit und kein Marketingmaximum ist, obwohl das Unternehmen keine unabhängige Verifizierung der Obergrenze veröffentlicht hat.

Der praktische Wert hängt davon ab, wo die Obergrenze tatsächlich liegt. Vier Figuren konsistent zu halten, reicht für einen Produktkatalog mit mehreren Models oder eine Kampagne mit einer kleinen wiederkehrenden Besetzung. Es reicht nicht für einen Comic mit einem großen Ensemble, das entweder mehrere Aufrufe oder Fine-Tuning erfordern würde. Unabhängige Tests wären das, was die Frage klärt.
Es gibt eine verwandte Fähigkeit, die im selben Veröffentlichungsfenster erwähnenswert ist. Alibabas Qwen-Image-2.1-Pro, seit dem 2. Oktober auf Alibaba Cloud verfügbar, betont die Generierung transparenter RGBA-Ebenen und die Subjektextraktion aus Fotos, unter Verwendung einer 7B-Visual-Generierungskomponente mit einem 32-schichtigen Single-Stream-DiT-Design. Die beiden Modelle nähern sich demselben Problem aus unterschiedlichen Richtungen, was ein vernünftiges Zeichen dafür ist, dass Konsistenz und Bearbeitungslokalität inzwischen das sind, wonach Käufer fragen.
Die Benchmark-Lücke ist der ehrliche Vorbehalt
Die Berichterstattung Dritter über die Veröffentlichung enthält einen wichtigen Hinweis, den Googles eigene Darstellung auslässt. Berichte beschreiben das Modell als leistungsstärker als das vorherige Pro-Modell bei einigen Bildgenerierungs-Benchmarks, merken aber auch an, dass der Vorgänger in Tests gut abschnitt und das Pro-Modell in der realen Nutzung Berichten zufolge bessere Bilder erzeugte.
Diese Lücke zwischen Benchmark-Leistung und praktischer Ausgabe ist ein wiederkehrendes Merkmal der Bewertung von Bildmodellen. Ein Modell kann bei strukturierten Tests gut abschneiden und bei Aufgaben, die Nutzer tatsächlich versuchen, trotzdem enttäuschen. Der niedrigere Preis verschärft das Problem: Ein günstigeres Modell, das in der Praxis schlechter abschneidet, ist nicht das Wertversprechen, das der Preis impliziert.
Die Klärung wird aus unabhängigen Tests kommen. Wenn Nutzer, die Nano Banana 2.1 mit dem Pro-Modell vergleichen, durchweg das neuere bevorzugen, gewinnen die Benchmarks an Glaubwürdigkeit. Wenn das Pro-Modell bei realen Ausgaben weiter gewinnt, werden die Punktzahlen zu einem schwächeren Signal.
Es gibt außerdem eine praktische Unstimmigkeit, die erwähnenswert ist. Die Berichterstattung zum Start weist auf eine Diskrepanz hin zwischen Googles offizieller Dokumentation, die allgemeine Verfügbarkeit angibt, und einigen Drittanbieter-Aggregatoren, die das Modell als bald verfügbar für bestimmte Plattformen listen. Frühe Berichte legen außerdem nahe, dass Anfragen in manchen Fällen trotz Interface-Updates weiterhin an frühere Modellversionen geleitet werden könnten. Wer das Modell integriert, sollte überprüfen, welche Version tatsächlich antwortet.
Modellstilllegung und die Wartungssteuer
Ein Detail, das für alle wichtig ist, die das aktuelle Modell in Produktion einsetzen: Die API-Version von Nano Banana 2 wird am 29. Oktober eingestellt.
Das ist ein kurzes Zeitfenster. Teams mit Nano Banana 2 in einer Pipeline haben ungefähr drei Wochen, um 2.1 zu testen, die Ausgabequalität auf ihrem eigenen Korpus zu vergleichen und zu migrieren. Da das neuere Modell günstiger ist, lohnt sich die Migration wahrscheinlich, aber der Zeitplan ist enger, als die meisten Teams wählen würden.
Diese Stilllegungsfrequenz wird zur Routine und ist selbst ein Grund, warum manche Teams zu Open-Weight-Bildmodellen neigen. Wenn die Gewichte Ihnen gehören, verschwindet das Modell nicht nach dem Zeitplan eines Anbieters. Der Kompromiss ist, dass Sie Deployment, Updates und Qualitätsverschlechterungen selbst verantworten, was reale Kosten sind, die anbietergehostete Modelle für Sie abfedern.
Was zu beobachten ist
Ob sich die Lücke zwischen Benchmark und Praxis unter unabhängigen Tests verringert. Das ist die zentrale Frage, und die Antwort wird von Nutzern kommen, die Vergleiche mit ihrer eigenen Arbeit anstellen, nicht von Pressematerialien.
Ob die Konsistenz über 14 Referenzen in der Praxis hält. Wenn ja, eröffnet das Modell Anwendungsfälle, die zuvor Fine-Tuning erforderten: konsistente Figuren über eine Serie hinweg, Produktsets, Kampagnenvarianten. Wenn sie für vier Figuren, aber nicht für vierzehn hält, liegt die praktische Obergrenze niedriger, als die Spezifikation nahelegt.
Ob die Preissenkung dauerhaft oder ein Einführungsangebot ist. Etwa die Hälfte Rabatt ist aggressiv, und wenn Wettbewerber nachziehen, wird Bildgenerierung in großem Maßstab flächendeckend deutlich günstiger. Wenn es ein Aktionszeitraum ist, müssen Teams, die ihre Kostenprognosen darauf aufbauen, diese überdenken.
Nano Banana 2.1 ist eine solide Iteration, die die richtigen Schwächen angeht und sich so bepreist, dass sie genutzt statt nur ausprobiert wird. Die Preissenkung ist die eigentliche Geschichte, und sie dürfte der Teil sein, auf den andere Anbieter reagieren.
Verwandte Artikel
Google Flow und Adobe Firefly holen KI-Video aus dem Chat-Fenster
Die Qualität der Basismodelle hat sich so weit angeglichen, dass sich das Differenzierungsmerkmal auf das verlagert hat, was das Modell umgibt.
Vida will KI-Agenten nach Ergebnissen statt nach Nutzung abrechnen
Nutzungsbasierte Abrechnung koppelt den Umsatz des Anbieters daran, dass der Agent länger braucht. Die Ergebnispreisgestaltung kehrt das um.
Decagons Voice 3 und PACT bereiten den Kundensupport auf Agenten am anderen Ende vor
Support-Systeme haben Jahrzehnte damit verbracht, menschliches Verhalten zu modellieren. Jetzt sind einige eingehende Anfragen Maschinen, die im Namen von Menschen handeln.
Creatify trainiert MiniMax H3 für Werbeanzeigen nach und senkt die Kosten auf vier Cent pro Sekunde
Ein Werbetreibender braucht kein Modell, das eine Dokumentation rendert. Er braucht eines, bei dem das Produkt richtig aussieht und die Person sich nicht mitten im Satz verwandelt.