Qwen-Image 2.1 vs. Nano Banana 2.0: Ein offenes 7B-Modell ist Google dicht auf den Fersen

Alibaba hat Qwen-Image 2.1 am 20. September veröffentlicht, und die Benchmark-Diskussion ist seither nicht mehr dieselbe. Ein Bildgenerator mit 7 Milliarden Parametern und herunterladbaren Gewichten liegt jetzt in Alibabas eigenem Ranking vor Googles Nano Banana 2.0 und auf unabhängigen Leaderboards nah genug dran, dass viele zweimal hinschauen. Der Hacker-News-Thread zur Veröffentlichung sammelte an einem Tag über 700 Punkte und fast 200 Kommentare – ein Zeichen dafür, wie viel aufgestaute Aufmerksamkeit in dieser Kategorie steckt.
Die Zahlen und warum sie wichtig sind
Im Qwen-Image-Bench von Alibaba erreicht das neue Modell 60,28 Punkte gegenüber 59,82 für Nano Banana 2.0. Das ist ein Vorsprung von einem halben Punkt, der weniger als technische Aussage zählt denn als Signal: Alibaba nennt Google nun als den Maßstab, den es übertreffen will. Das einzige Open-Weight-Modell mit weniger Parametern, Meituans 6B LongCat-Image, liegt bei etwa 54 Punkten zurück. Zum Vergleich: OpenAIs GPT Image 2.5 Sunburst führt Alibabas Tabelle mit 67 Punkten an, Muse Image liegt bei 62,34 – beide sind geschlossen.
AI Arena, wo blinde Mensch-gegen-Mensch-Abstimmungen laufen, erzählt eine bescheidenere Geschichte. Nano Banana 2.0 hält 1260 Elo gegenüber 1228 von Qwen-Image 2.1, während GPT Image Sunburst mit 1423 an der Spitze liegt und Muse bei 1276. Das offene Modell gewinnt diesen Kampf noch nicht. Allerdings ist es in der Image Edit Arena und der Text-to-Image Arena jeweils auf Platz eins unter allen Open-Weight-Modellen – und das ist die Kategorie, die viele eigentlich interessiert. Qwens eigener Account formulierte es als "das Nummer-eins-Open-Source-Modell", und bei dieser engeren Behauptung stützen die unabhängigen Daten sie.
Wo es wirklich glänzt
Transparenz ist die Funktion, die alle immer wieder nennen. Qwen-Image 2.1 gibt Bilder nativ als RGBA aus, sodass man einen transparenten Hintergrund anfordern und ein sauberes Freisteller-Ergebnis erhalten kann, ohne einen zweiten Durchlauf durch ein Hintergrundentfernungs-Tool. Für Sticker-Verkäufer, Print-on-Demand-Shops und alle, die Assets in ein größeres Design einfügen, entfällt damit ein echter Arbeitsschritt. Das Modell kann außerdem eine transparente Ebene bearbeiten, ohne sie abzuflachen, was früher ein separates Ebenenmodell erforderte.
Das Bearbeiten mit bis zu zehn Referenzbildern ist die andere Schlagzeile. Gib ihm ein Foto einer Person und ein paar Kleidungsaufnahmen, und es setzt die Person in diese Kleidung zusammen. Führe sechs Porträts zu einem Gruppenfoto zusammen. Setze zehn Möbelbilder zu einem Raum zusammen. Man kann den zu bearbeitenden Bereich auf drei Arten angeben: farbige Kreise zeichnen, über die Fläche malen oder das Original plus eine separate Maske übergeben. Der Weg über die Maske ist der richtige, wenn man es sich nicht leisten kann, die ursprünglichen Pixel zu überschreiben.
Dann ist da die Geschwindigkeit auf bescheidener Hardware. Frühe Anwender berichten von einem 1-Megapixel-Bild in etwa fünf Sekunden auf einer RTX 4090, rund 25 Sekunden auf Karten der 50er-Serie und ungefähr 50 Sekunden für ein 2K-Bild auf einer RTX 3060 mit 64 GB System-RAM. Ein Hacker-News-Kommentator sagte, er habe ein 1-MP-Bild in etwa fünf Sekunden auf einer 4090 konvertiert. Ein Nutzer auf r/StableDiffusion berichtete von 1-MP-Bildern in rund 25 Sekunden auf einer 5070 oder 5080 und merkte an, dass Bearbeiten der langsamste Vorgang sei und dass das Hinzufügen weiterer Referenzbilder die Latenz spürbar erhöhe. Das ist nicht Cloud-schnell, aber schnell genug, um keine Ausrede mehr zu sein.

Der Haken bei der Lizenzierung
Hier ist der Teil, der die Community gespalten hat. Frühere Qwen-Bildmodelle wurden unter Apache 2.0 veröffentlicht, was es erlaubte, alles zu fine-tunen und zu verkaufen, was man damit baute. Qwen-Image 2.1 erscheint unter einer Nur-für-Forschung-Lizenz, die die kommerzielle Nutzung der Gewichte ohne eine separate Vereinbarung mit Alibaba verbietet. Der HN-Thread regte sich über die Unklarheit auf, und Alibabas Account griff ein, um klarzustellen: Die Gewichte sind beschränkt, aber die Bilder, die man damit generiert, gehören einem, einschließlich der kommerziellen Nutzung.
Dieser Unterschied klingt klein, ist aber wichtig. Wer nur Bilder für Kunden, Produkte oder eigene Projekte generieren will, ist fein raus, und Alibaba bestätigte, dass die Ausgaben keinen Lizenzpflichten unterliegen. Wer das Modell fine-tunen und weiterverbreiten wollte, muss verhandeln. Die meisten Menschen fallen in die erste Gruppe, weshalb der Gegenwind laut, aber letztlich begrenzt war.
Das größere Effizienz-Argument
Die interessante Aussage hier ist nicht der Rohwert. Es ist die Effizienz. Qwen-Image 2.1 kommt bis auf wenige Elo-Punkte an Modelle heran, die ein Vielfaches seiner Größe haben und vollständig geschlossen sind. Der Generator verfügt über 32 Single-Stream-DiT-Schichten, liest Prompts über einen Qwen3-VL-8B-Textencoder und rendert nativ in 2K mit bis zu 2752 mal 2752 Pixeln. In puncto Effizienz beweist es, dass architektonische Destillation und sauberere Trainingsdaten den größten Teil der Lücke schließen können, für die alle Skalierung für nötig hielten.
Das setzt das Abonnementmodell unter Druck, wie es eine Marketing-Folie nie könnte. Wenn eine Consumer-GPU Studioqualität in Sekunden rendern kann, reicht "wir generieren die besten Bilder" nicht mehr als Grund, monatlich zu zahlen. Google und OpenAI führen weiterhin bei den schwierigsten semantischen und räumlichen Denkaufgaben, wo blinde Bewertungen ihnen weiterhin den Vorteil geben. Qwen-Image 2.1 hat diese Lücke nicht geschlossen. Es hat die Lücke nur für einen großen Teil der Alltagsarbeit optional erscheinen lassen, und das ist eine größere Disruption als jede einzelne Benchmark-Punktzahl.
Das Hands-on-Urteil der Community
Mit Benchmark-Argumenten kommt man nur bis zu einem gewissen Punkt. Das belastbarere Signal ist, was Leute tatsächlich berichten, nachdem sie es selbst ausgeführt haben, und die Berichte dieser Woche sind ungewöhnlich konsistent. Auf r/StableDiffusion postete ein Nutzer einen direkten Vergleich von 192 generierten Bildern, der Qwen-Image 2.1 gegen Krea 2 stellte, sortiert nach Kategorien wie Textgenerierung und menschliche Anatomie. Das Fazit war, dass das offene Modell bei der Struktur gut mithielt, aber einen quantisierten Textencoder umgehen musste, um den Denoiser auf einer 5090 unterzubringen.
Ein anderer Nutzer brachte das Modell auf einem M1 Max MacBook Pro mit 32 GB Arbeitsspeicher zum Laufen und generierte ein 512 × 512 Bild in etwa 24 Sekunden mit einer nativen Apple-Silicon-Runtime. Das ist für Desktop-Verhältnisse langsam, aber es beweist, dass das Modell nicht auf Nvidia-Hardware festgelegt ist, was für einen großen Teil der Gelegenheitsnutzer wichtig ist. Ein Dritter baute ein lokales Studio im Fooocus-Stil darum herum, ergänzte Masken, Annotationen, Outpainting und OpenPose-Posereferenzen und bat um ehrliche Kritik statt Lob.
Die Bearbeitungsfunktionen sorgten für die meiste Begeisterung. Ein Beitrag beschrieb das Generieren von Character-Design-Sheets ohne jegliche LoRAs, wobei die Referenzbild-Bearbeitung des Modells genutzt wurde, um eine Figur über Posen und Outfits hinweg konsistent zu halten. Früher erforderte das einen Stapel fein abgestimmter Modelle und viel manuelle Nacharbeit. Dass ein einzelnes 7B-Modell das out of the box schafft, ist die leise Schlagzeile, die die meisten Benchmark-Diagramme nicht einfangen.
Was als Nächstes zu beobachten ist
Die frühen Ergebnisse müssen sich noch setzen. Qwen hat seinen eigenen Benchmark gebaut und weder die Prompts noch die Punkte pro Kategorie veröffentlicht, daher sind die internen Zahlen eher eine Behauptung als eine Messung. Die unabhängigen AI-Arena-Zahlen sind vertrauenswürdiger und etwas weniger schmeichelhaft. Der ehrliche Befund ist derzeit, dass Qwen-Image 2.1 das beste verfügbare Open-Weight-Bildmodell ist, ein klarer Rückstand gegenüber den geschlossenen Marktführern und ein echter Beleg dafür, dass klein und offen wettbewerbsfähig sein kann. Die nächsten Wochen unabhängiger Tests werden zeigen, ob der Halbpunkt-Vorsprung gegenüber Nano Banana 2.0 Bestand hat oder nur ein schmeichelhafter Ausschnitt des Benchmarks war.
Verwandte Artikel
Huaweis Ascend-Chips bauen einen alternativen Weg für KI-Bildmodelle
Bildmodelle sind rechenhungrig, und die Hardware-Geschichte hat gerade einen zweiten Weg bekommen. Was Huaweis Ascend-Vorstoß dafür bedeutet, wer sie sich leisten kann zu bauen und zu betreiben.
Apple will jetzt KI mit deinen Daten trainieren – und Bildmodelle geraten ins Fadenkreuz
Das Datenschutz-Unternehmen will jetzt mit deinen Fotos trainieren. Apples laut Berichten vollzogene Kehrtwende ist ein Signal dafür, woher Trainingsdaten künftig kommen.
Groks Bilderzeugungs-Chaos schreibt die Regeln für alle anderen neu
Millionen nicht einvernehmlicher Deepfakes, Untersuchungen auf drei Kontinenten und ein Abo-Pflaster. Was die Grok-Krise bei der Verantwortung für KI-Bilder geklärt hat.
Chinesische KI-Bildmodelle gewinnen Fans im Ausland, und Washington schaut zu
Die Verbreitung ist zuerst technisch, politisch erst an zweiter Stelle. Entwickler laden herunter, was funktioniert, und das kommt derzeit zunehmend von chinesischen Laboren.