← Zurück zum Blog
News5 Min.

Chinesische Open-Source-Bildgeneratoren legen im September nach: SenseTime, Ant und Shusheng können nicht mehr stillsitzen

Veröffentlicht 26. Sept. 2026
Chinesische Open-Source-Bildgeneratoren legen im September nach: SenseTime, Ant und Shusheng können nicht mehr stillsitzen

Im gerade vergangenen September gab es bei der chinesischen KI-Bildgenerierung eine unscheinbare, aber wichtige Veränderung: Open Source. Innerhalb nur einer Woche veröffentlichten SenseTime, Ant und das Shusheng-Team des Shanghai AI Laboratory nacheinander Open-Source-Bildgenerierungsmodelle und legten Fähigkeiten offen, die zuvor nur in den Händen großer Closed-Source-Anbieter lagen. Die Auswirkungen dürften weit größer sein als der Start eines einzelnen neuen Modells.

Was die drei Anbieter jeweils auf den Tisch legen

SenseTime SenseNova U1.5 Lite wurde am 8. September als Open-Source-Modell veröffentlicht und ist ein Bildgenerierungsmodell im 8B-Maßstab. Sein Verkaufsargument ist die direkte 4K-Ausgabe; offiziell heißt es, es könne „mit Closed-Source-Großmodellen mithalten“. Die 8B-Größe ist entscheidend: Sie bedeutet, dass auch die Grafikkarte normaler Entwickler das Modell betreiben kann, ohne dass man sofort 12 GB oder 24 GB VRAM benötigt.

Das 6B-Unified-Image-Modell von Ant wurde am 6. September als Open Source veröffentlicht. Es geht einen bequemeren Weg: Textgenerierung und instruktionsbasierte Bearbeitung sind in einem einzigen Modell vereint. Anders gesagt: Man kann es ein Bild von Grund auf zeichnen lassen oder ihm ein Bild geben und es auffordern, „den Hintergrund auszutauschen“ oder „die Farben aufzuhellen“, ohne zwischen zwei Modellen wechseln zu müssen. Noch seltener: Ant hat auch das vollständige Trainingsrezept offengelegt. Es gibt viele Open-Source-Modelle, aber nur wenige, bei denen die Trainingsdetails offen auf dem Tisch liegen.

Shusheng InternLumina-U2 wurde am 3. September vorgestellt und ist ein großes visuelles Modell, das Bildverständnis und -generierung vereint; die Gewichte sollen offengelegt werden. Es ist stärker darauf ausgerichtet, dass ein Modell Bilder sowohl verstehen als auch erzeugen kann. In Szenarien, in denen das Modell zuerst ein Referenzbild verstehen und es dann entsprechend verändern soll, ist das gegenüber rein generativen Modellen im Vorteil.

Schematische Darstellung des Ökosystems chinesischer Open-Source-KI-Bildgenerierungsmodelle

Warum das Thema Open Source eine eigene Betrachtung verdient

Viele mögen denken, Open-Source-Modelle seien weit weg von normalen Nutzern, schließlich trainiere man selbst ja keine Modelle. Doch die tatsächliche Wirkungskette sieht so aus: Open-Source-Modelle werden zum Fundament verschiedener kostenloser Tools.

Was tut ein unabhängiger Entwickler oder ein kleines Team, das kein Budget für die APIs großer Anbieter hat, aber seinem Produkt eine Bildgenerierungsfunktion hinzufügen möchte? Die Antwort: Man holt sich ein Open-Source-Modell von Hugging Face und lässt es lokal oder auf einer günstigen gemieteten GPU laufen. Größen wie SenseTime 8B und Ant 6B liegen genau in dem Bereich, der in eine Consumer-Maschine passt. Je mehr, je kleinere und je stärkere Open-Source-Modelle es gibt, desto mehr kostenlose Bildgenerierungslösungen können normale Nutzer selbst aufsetzen.

Umgekehrt ist das auch eine Antwort chinesischer Modelle auf etablierte Open-Source-Ansätze wie Stable Diffusion und Flux. Früher bedeutete Open-Source-Bildgenerierung standardmäßig das Stable-Diffusion-Ökosystem. Jetzt drängen chinesische Anbieter hinein – und bringen lokale Vorteile wie das Verständnis chinesischer Prompts und die Darstellung chinesischer Schriftzeichen mit. Für chinesischsprachige Nutzer ist das ein echter Zugewinn.

Worum es nach der Open-Source-Veröffentlichung geht

Open Source ist kein Endpunkt, sondern ein Anfang. Ob ein offengelegtes Modell tatsächlich genutzt wird, hängt von drei Dingen ab.

Erstens: das Ökosystem. Gewichte allein reichen nicht; es braucht passende Inferenz-Tools, LoRA-Trainingsskripte und WebUI-Unterstützung. Dass Stable Diffusion bis heute für viele die Standardwahl ist, liegt nicht an einer bestimmten Version, sondern an der großen Toolchain dahinter.

Zweitens: die Chinesisch-Kompetenz. Die größte Differenzierung chinesischer Modelle liegt im Verständnis chinesischer Prompts und im Rendering chinesischer Schriftzeichen. Genau hier haben ausländische Open-Source-Modelle lange geschwächelt, und genau hier sollten chinesische Open-Source-Modelle den Vorsprung festhalten.

Drittens: der Kommerzialisierungspfad. Wie Open-Source-Modelle Geld verdienen, ist seit jeher eine schwierige Frage. Akteure wie SenseTime, Ant und Shusheng machen Open Source wohl kaum aus Wohltätigkeit; sie wollen durch Offenlegung ein Ökosystem aufbauen und es später über Unternehmensdienste, Cloud-APIs und Individualisierungen monetarisieren. Für Nutzer bedeutet das: Es wird immer mehr kostenlose Angebote geben. Ob „kostenlos“ aber gleichbedeutend mit „kontinuierlich gepflegt“ ist, wird sich erst noch zeigen müssen.

Noch ein Hintergrund ist erwähnenswert: Diese Open-Source-Welle trifft genau auf einen Moment, in dem das ausländische Open-Source-Ökosystem etwas ins Stocken geraten ist. Stable Diffusion hat schon lange kein wirklich großes Versionsupdate mehr erhalten, und Flux hat bislang keine vollständigen Open-Source-Gewichte veröffentlicht. Dass chinesische Modelle nun Größen wie 6B und 8B offenlegen, die in einen Heimrechner passen, bedeutet: In der Verschnaufpause der Konkurrenz wird das Fundament für chinesische Open-Source-Bildgenerierung gelegt.

Was das für normale Kreative bedeutet

Konkret für den Einzelnen bringen diese Open-Source-Modelle eine Veränderung: Die Kosten für die Bilderzeugung sinken weiter.

Wer früher mit KI-Bildgenerierung zuverlässig etwas Ernsthaftes erstellen wollte, musste entweder ein Tool abonnieren oder pro Bild API-Gebühren zahlen. Mit mehr Open-Source-Modellen gibt es inzwischen eine Reihe kostenloser, lokal laufender Lösungen. Zwar haben diese Lösungen in der Regel eine Einstiegshürde – man muss Umgebungen einrichten und Parameter einstellen können –, aber genau diese Hürde wird von der Community nach und nach abgetragen.

Meine Einschätzung: Kurzfristig bleiben Web-Tools für normale Kreative am unkompliziertesten. Doch wer gerade ein kleines Produkt oder eine kleine Anwendung baut und eine Bildgenerierungsfunktion einbetten möchte, sollte angesichts der Dichte und Größe dieser Open-Source-Welle noch einmal genauer hinschauen. Zumindest die Aussage, es gebe keine brauchbaren chinesischen Open-Source-Bildgenerierungsmodelle, ist seit September nicht mehr haltbar.

Verwandte Artikel