Das Wettrüsten der Bildmodelle: Midjourney, Nano Banana und der leise Aufstieg offener Gewichte

Wenn Sie sich für ein paar Monate von der KI-Bildgenerierung verabschiedet haben, ist die Landschaft, zu der Sie zurückkehren, kaum wiederzuerkennen. Die großen Namen haben die Versionen gewechselt, ein ehemaliger Publikumsliebling wird eingestellt, und das Open-Weights-Feld ist deutlich stärker geworden. Hier ist der Stand im Herbst 2026.
Midjourney ist auf V8 umgestiegen, und V8.2 wurde im Juli zum Standard. Es ist immer noch das Tool, zu dem Menschen greifen, wenn das Ziel Art Direction statt roher Leistungsfähigkeit ist, das Modell, das Stimmung und Licht so interpretiert, wie es ein menschlicher Regisseur tun würde. Native 2K-Ausgabe ohne Upscaling, besseres Prompt-Verständnis und ein Personalisierungssystem, das Ihren Geschmack anhand der Bilder lernt, die Sie auswählen. Die Kompromisse haben sich nicht geändert: keine kostenlose Stufe, drei aktive Urheberrechtsklagen und Textwiedergabe, die besser, aber für komplexe Typografie immer noch unzuverlässig ist.
Googles Nano Banana hat die verwirrendste Entwicklung durchgemacht. Das Original wurde im Februar 2026 still und leise durch Nano Banana 2 ersetzt, das auf Gemini 3.1 Flash basiert, und es wurde zum Standard in der Gemini-App. Das ältere Gemini 2.5 Flash Image wird abgekündigt und am 2. Oktober eingestellt. Der Community-Spitzname verbirgt die Tatsache, dass Nano Banana überhaupt kein eigenständiges Produkt ist. Es ist die Bildgenerierung, die in Gemini integriert ist, was entweder praktisch oder frustrierend ist, je nachdem, ob Sie eine Chat-Oberfläche oder ein dediziertes Tool möchten. Die Stärken sind real: Multi-Turn-Editing, das den Kontext behält, und die getestete Fähigkeit, bis zu fünf Personen und vierzehn Objekte über Bearbeitungen hinweg konsistent zu halten.
Der Trick bei Nano Banana, wie ein Community-Leitfaden es ausdrückt, besteht darin, jedem Referenzbild eine Aufgabe zu geben: eines für Identität, eines für Pose, eines für Stil. Stopfen Sie alles in eine einzige Referenz, und die Ausgabe wird matschig. Es ist eine kleine Disziplin, die mehr zählt als die meisten Prompt-Tricks, und es ist dasselbe Prinzip hinter Multi-Reference-Editing im gesamten Feld.
OpenAIs GPT Image-Reihe treibt Instruction-Scoped-Editing mit bis zu sechzehn Referenzbildern voran, und die neueren Varianten Sunburst und Flare stehen an der Spitze der LMArena Image Edit Arena, die inzwischen über 30 Millionen Stimmen über 57 Modelle hinweg gesammelt hat. Grok Imagine Image 2.0 von xAI hat präzise Bearbeitungen und gestochen scharfe Textwiedergabe zu seinem Verkaufsargument gemacht und positioniert sich als produktionsreife Option, nachdem der frühere Deepfake-Skandal ein Überdenken seiner Schutzmechanismen erzwungen hat.
Die Geschichte, die langfristig am wichtigsten ist, spielt sich bei den offenen Gewichten ab. FLUX.2 von Black Forest Labs führt jetzt das Feld der editierbaren Hochauflösungs-Open-Modelle an, mit einer klein 4B-Variante und einer Turbo-Variante für Geschwindigkeit. Z-Image, Qwen-Image und Ideogram 4.0 runden die unter Apache-2.0 lizenzierten Optionen ab, und die Open-Weights-Renderqualität von Ideogram wird von Entwicklern als Spitzenklasse bezeichnet. Die Lizenzierung ist zum eigentlichen Unterscheidungsmerkmal geworden: FLUX.2 dev ist nicht kommerziell, während FLUX.2 klein, Z-Image und Qwen-Image die kommerzielle Nutzung unter Apache 2.0 erlauben. Die Wahl eines Basismodells beginnt jetzt mit der Lizenz, nicht mit dem Benchmark.
Der Lizenzpunkt verdient Betonung, denn hier stolpern die meisten. Zwei Modelle können im Benchmark gleich abschneiden und doch Welten davon entfernt sein, was Sie mit der Ausgabe tun dürfen. Ein Modell, das Sie feinabstimmen und für Kunden einsetzen können, ist mehr wert als ein etwas besseres Modell, das Sie nur für Forschung nutzen können. Das offene Feld hat sich genau entlang dieser Linie gespalten, und die kommerziell nutzbare Stufe, Apache 2.0 oder gleichwertig, ist der Bereich, in dem das Ökosystem tatsächlich baut.
Die Verschiebung unter all dem ist, dass Editing die Generierung als Frontier abgelöst hat. Vor einem Jahr ging es darum, wer das fotorealistischste Bild aus Text rendern konnte. Jetzt kann das jeder. Das neue Rennen ist, wer Sie eine Sache ändern lässt, ohne alles neu zu generieren, wer eine Figur über hundert Bilder hinweg konsistent halten kann, wer gestochen scharfen, korrekten Text auf ein Poster setzen kann. Die Modelle, die gewinnen, sind diejenigen, die für Iteration optimiert sind, nicht für den Wow-Effekt der ersten Generation.
Die Hardware-Geschichte läuft parallel zu all dem. Die offenen Modelle sind klein genug geworden, dass ein Modell der 7B-Klasse auf einer Consumer-GPU läuft, und die Community hat mit One-Click-Integrationspaketen reagiert, die lokale Generierung für Menschen versprechen, die nie ein Terminal anfassen wollen. Der Benchmark "läuft auf einer 6GB-Karte" ist zu einem ebenso großen Marketingversprechen geworden wie jeder Leaderboard-Score, denn er entscheidet, ob ein Modell eine Spielerei oder ein Werkzeug ist.
Es gibt auch eine leise Verschiebung darin, wie Menschen über Konsistenz denken, die zum eigentlichen Schlachtfeld geworden ist. Ein Modell, das ein schönes Bild rendert, ist Grundvoraussetzung. Ein Modell, das dieselbe Figur über hundert Bilder hinweg rendert oder dasselbe Produkt aus einem Dutzend Winkeln, ist dasjenige, das einen Platz in einem echten Workflow verdient. Der referenzbasierte Ansatz, ein bis vierzehn Bilder einer Figur anzuhängen und das Modell sie reproduzieren zu lassen, ist der schnelle Einstieg. LoRA-Training, ein kleiner Adapter, der auf Ihren eigenen kuratierten Bildern feinabgestimmt wird, ist der schwerere Hammer, wenn Referenzen abdriften. Der Kompromiss ist Kontrolle versus Einrichtungszeit, und die ehrliche Antwort ist, dass keine Methode ein stabiles Gesicht garantiert, weshalb jeder ernsthafte Creator vor dem Festlegen gegen eine feste Shotlist testet.
Die Kategorie hat auch ein nützliches Vokabular für Laien entwickelt. Multi-Turn-Editing bedeutet, dass das Modell sich merkt, was es getan hat, und mit Ihnen iteriert. Instruction-Scoped-Editing bedeutet, dass Sie ihm genau sagen können, was geändert werden soll, und es den Rest in Ruhe lässt. Multi-Reference Composition bedeutet, mehrere Bilder einzuspeisen und jedem seine Aufgabe zuzuweisen. Nichts davon ist exotisch; sie sind jetzt Standardfunktionen, und die Modelle konkurrieren darum, wie gut sie sie ausführen, nicht darum, ob es sie überhaupt gibt.
Für alle, die heute ein Tool auswählen, hat sich der ehrliche Rat nicht geändert und wird es wahrscheinlich auch nicht. Passen Sie das Modell zur Aufgabe. Midjourney für Ästhetik, Nano Banana für Multi-Turn-Editing innerhalb von Googles Ökosystem, GPT Image oder Grok für instruction-scoped Produktionsedits, offene Gewichte, wenn Sie Kontrolle, Datenhoheit oder eine feinabgestimmte Figur brauchen, die Sie für immer behalten können. Die Tage, in denen ein Modell die richtige Antwort für alles war, endeten leise, und niemand hat es wirklich angekündigt. Was es ersetzt hat, ist ein Markt, in dem die richtige Antwort vollständig davon abhängt, was Sie herstellen möchten, und diejenigen, die am besten abschneiden, sind die, die aufgehört haben, einem einzelnen Gewinner nachzujagen, und gelernt haben zu shoppen.
Die eine Konstante über all diese Verschiebungen hinweg ist, dass das Unterscheidungsmerkmal nicht mehr die rohe Bildqualität war, sondern der Workflow darum herum. Konsistenz, Editierbarkeit, Lizenzklarheit und Integration mit den Tools, die Sie bereits nutzen. Das bestimmt tatsächlich, ob ein Modell in Ihrer täglichen Arbeit auftaucht oder in einem Ordner mit beeindruckenden Demos, die Sie nie wieder ansehen. Das Wettrüsten ist real, aber die Gewinner sind nicht die Modelle mit dem besten Benchmark. Es sind diejenigen, die in die Art und Weise passen, wie Menschen tatsächlich arbeiten, und das ist schwerer zu messen und ein viel besserer Prädiktor dafür, was sich durchsetzt.
Verwandte Artikel
Step 5 übersprang vier Versionsnummern, landete auf Platz zwei unter offenen Modellen – und niemand ruft es ab
Die Benchmark-Position ist ein Signal, das Produzenten nutzen, um ein Modell zu beurteilen. Das Aufrufvolumen ist ein Signal, das Nutzer durch seine Nutzung erzeugen.
Gemini Omni 1.1 Flash verkettete vier Anfragen zu einer 40-Sekunden-Aufnahme. Der Workflow ist das Produkt.
Google hat eine Produktionspipeline ausgeliefert, bei der ein Review-Gate in die Preisgestaltung eingebaut ist.
Microsoft senkt die Latenz für Teiltranskripte auf 100 Millisekunden. Das verändert, wofür Transkription da ist.
Unterhalb von 100 Millisekunden kann ein Transkriptionsprodukt reagieren, während jemand noch spricht.
Synthesia hat ein Jahrzehnt lang Avatare aufgezeichnet. Jetzt sollen sie zurücksprechen.
Ein Trainingswerkzeug, das Menschen freiwillig wiederholen, ist ein anderes Produkt als eines, das sie abschließen, weil es ihnen zugewiesen wurde.