Tongyi Wanxiang Qwen-Image 2.1 ist Open Source: Warum ein 7B-Modell es mit Google und OpenAI aufnehmen kann

Am 20. September hat Alibabas Tongyi-Team still und leise eine kleine Bombe veröffentlicht – Qwen-Image 2.1. Ein Text-zu-Bild-Modell mit nur 7 Milliarden Parametern, das in den eigenen Benchmarks Google Nano Banana 2.0 übertrifft und die Closed-Source-Modelle von OpenAI und Meta aufhorchen lässt. Als die Nachricht herauskam, explodierten Bilibili, Zhihu sowie Hacker News und Reddit im Ausland.
Warum es "klein, aber mächtig" ist
Bildgenerierungsmodelle sind in den letzten Jahren immer größer geworden; Closed-Source-Modelle haben oft mehrere Milliarden bis zu Dutzenden Milliarden Parameter und benötigen zum Laufen eine professionelle Grafikkarte. Qwen-Image 2.1 macht das Gegenteil und komprimiert den Generierungsteil auf 7B. Das Ergebnis: 60,28 Punkte auf der eigenen Qwen-Image-Bench-Liste. Was bedeutet diese Punktzahl im Gesamtranking? Google Nano Banana 2.0 erreicht 59,82 Punkte und liegt damit knapp dahinter; im Open-Source-Lager belegt Meituans LongCat-Image (6B) den zweiten Platz, mit etwas über 54 Punkten. Das heißt, es ist derzeit das schlagkräftigste Modell unter allen Modellen mit herunterladbaren Gewichten.
Das unabhängige Dritt-Benchmark AI Arena fällt ein etwas nüchterneres Urteil. Dort erreicht Nano Banana 2.0 1260 Punkte, Qwen-Image 2.1 kommt auf 1228 Punkte, und das Closed-Source-Modell GPT Image 2.5 Sunburst liegt mit 1423 Punkten an der Spitze. Der Abstand ist noch da, aber bereits so klein, dass man dem Führenden dicht auf den Fersen sitzt. Für ein Open-Source-Modell ist diese Position an sich schon ein Sieg.
Drei wirklich nützliche Fähigkeiten
Die erste ist ein nativer transparenter Hintergrund. Früher musste man bei Stickern, Druckvorlagen oder Designentwürfen nach der KI-Generierung noch einmal freistellen. Qwen-Image 2.1 gibt direkt RGBA-Bilder mit Alpha-Kanal aus; ein Modell erledigt gleichzeitig Generierung und Bearbeitung, und transparente Ebenen lassen sich direkt bearbeiten, ohne zusammengeführt zu werden. Für Leute, die Kreativprodukte und Merchandise erstellen, spart das enorm viel Arbeit.
Die zweite ist die gleichzeitige Bearbeitung mit zehn Referenzbildern. Man wirft ein Foto einer Person hinein und füttert das Modell mit ein paar Bildern von Kleidung, und es kann "diese Person trägt diese Kleidungsstücke" zusammenfügen. Es kann auch sechs Porträts zu einem Gruppenfoto zusammenfügen oder zehn Möbelbilder in denselben Raum einfügen. Auf Bilibili gibt es bereits Creator, die "Charakterkonsistenz + Outfit-Wechsel" demonstrieren, und in den Kommentaren heißt es nur so: "Das ist ja unglaublich natürlich."
Die dritte: So leicht, dass es auf Consumer-Grafikkarten läuft. Auf einer RTX 4090 dauert ein 1-Megapixel-Bild etwa 5 Sekunden, auf einer 50er-Grafikkarte rund 25 Sekunden; manche lassen sogar mit einer RTX 3060 und 64 GB RAM 2K-Bilder laufen, etwa 50 Sekunden pro Bild. Alibaba gibt als offizielle Mindestanforderung 6 GB VRAM an; auf Bilibili tauchen bereits gehäuft Tutorials für "Ein-Klick-Integrationspakete" auf.

Das Auffälligste ist nicht die Leistung, sondern die Lizenz
Was die Community wirklich spaltet, ist die Lizenz. Die frühere Qwen-Image-Reihe stand unter Apache 2.0 und war frei kommerziell nutzbar. Diesmal wurde sie durch die Qwen Research License ersetzt, die "nur für Forschungszwecke" gilt; für kommerzielle Nutzung muss man separat mit Alibaba verhandeln. Auf Reddit und Hacker News wird heftig gestritten: Die einen halten das für einen Rückschritt, die anderen finden, dass "die Gewichte zum Herunterladen, die Bilder zur freien Nutzung" schon ein faires Angebot ist.
Alibaba stellte schnell klar: Die Modellgewichte dürfen nicht kommerziell weiterverbreitet werden, aber die Bilder, die man damit generiert, gehören einem selbst und dürfen kommerziell verwendet werden. Diese Unterscheidung ist entscheidend – für die überwiegende Mehrheit, die einfach nur Bilder erstellen will, ist der Einfluss tatsächlich nicht so groß.
Was das Ganze darüber hinaus bedeutet
Qwen-Image 2.1 beweist eine Sache: Mit Architektur-Distillation und saubereren Trainingsdaten können kleine Modelle das Bildgenerierungsniveau großer Modelle erreichen. Der Titel des Videos des Bilibili-Creators "爱分享的剑二十七" brachte es direkt auf den Punkt: "Alibabas Open-Source-KI-Zeichenmodell schlägt eine ganze Reihe von Bezahltools um Längen." Das ist etwas übertrieben, aber die Richtung stimmt.
Wenn ein Bild auf einer Heim-Grafikkarte in wenigen Sekunden erzeugt werden kann, wird die Frage, ob man monatlich ein Abo bezahlen soll, für jeden Kreativen zu einer neuen Kalkulation. Closed-Source-Anbieter müssen künftig mit Geschwindigkeit, Workflow-Integration und multimodaler Zusammenarbeit beweisen, dass sie ihr Geld wert sind, und können sich nicht mehr nur auf "meine Bilder sehen einfach gut aus" verlassen.
Für Normalverbraucher ist die gute Nachricht: Die Obergrenze der Open-Source-Bildgenerierung wurde diesen Monat erneut ein Stück angehoben.
Verwandte Artikel
Kann man ein KI-Bild noch von einem echten unterscheiden? Die ehrliche Antwort ist nein.
Die Erkennungsmerkmale sind weg und die Detektoren sind unzuverlässig. Die ehrliche Antwort auf das Erkennen von KI-Bildern ist nein, und die Lösung liegt nicht bei deinen Augen.
Der leise Lizenzwandel, der Open-Source-KI-Bilder verändern könnte
Offene Gewichte bedeuten nicht mehr dasselbe wie vor einem Jahr. Das Lizenz-Kleingedruckte wird komplizierter – genau in dem Moment, in dem die Modelle besser werden.
Der lokale Modell-Engpass: Warum Kreative weiterhin uneingeschränkte Bildmodelle suchen
Jede Woche bittet ein weiterer Creator um ein uneingeschränktes Modell. Die Nachfrage sagt mehr über die Cloud-Tools aus als über die Personen, die danach fragen.
Der Open-Source-KI-Bild-Stack wird neu aufgebaut – ein Workflow nach dem anderen
Workflow1111 bildet AUTOMATIC1111 mit 73 Knoten und 11 Pipelines nach. Was der Neuaufbau durch die Community für die lokale Bildgenerierung bedeutet.