Wer wirklich nutzt: Chinesische Modelle holen mehr als die Hälfte der Bild- und Videogenerierung außerhalb Chinas

Vom 24. August bis zum 5. Oktober hat Overchat AI 1,09 Millionen Nutzer und 31,6 Millionen Modellinteraktionen erfasst. Breitet man diese anonyme Statistik aus, ist das Auffälligste nicht, wer auf irgendeiner Rangliste einen Punkt besser abschneidet, sondern wem die Menschen bei der tatsächlichen Nutzung ihre Stimme geben: Bei der Bild- und Videogenerierung – den beiden rechenintensivsten und teuersten Aufgaben – wird mehr als die Hälfte von chinesischen Modellen erledigt.
Das sind keine Benchmark-Punkte, sondern Nutzungszahlen. Punkte lassen sich durch einen einmalig aufgeblasenen Test hochtreiben, Nutzung lässt sich nur durch wiederholtes Klicken, ein Mal nach dem anderen, ansammeln.
Zuerst zur Definition dieser Daten, damit man sie nicht für eine Markterhebung hält. Sie stammen von einer Plattform, die mehrere Modelle in dieselbe Mini-App integriert; erfasst wurden zwischen dem 24. August und dem 5. Oktober 31,6 Millionen Interaktionen von 1,09 Millionen Nutzern in 1,2 Millionen Sessions; der Anteil wird so berechnet, dass „ein Nutzer, der ein Modell einmal verwendet, einmal zählt“, und nicht jede einzelne Anfrage kumuliert. Die Stichprobe ist naturgemäß zu Nutzern hin verzerrt, die bereit sind, mehrere Modelle gleichzeitig auszuprobieren; deshalb ist sie eher eine Momentaufnahme davon, „wer immer wieder geöffnet wird“, und keine Umsatzabrechnung der gesamten Branche. Aber gerade weil alle Modelle im selben Einstiegspunkt liegen und dieselbe Gruppe von Menschen sehen, ist dieser Vergleich überzeugender als die von Herstellern jeweils veröffentlichten Benchmarks.
Text bleibt amerikanisch, Bilder wechseln gerade den Besitzer
Schauen wir zuerst auf das, was sich nicht verändert hat. Bei Textinteraktionen kommen Gemini, GPT, Claude und Grok zusammen auf 86,2 %; US-Anbieter haben hier praktisch keine Konkurrenz. Verändert hat sich das Bild: Der Anteil chinesischer Modelle an der Bildgenerierung stieg von 54,0 % in der vorherigen Periode auf 59,5 %, bei Videogenerierung von 43,5 % auf 53,6 %. Im selben Zeitraum machen chinesische Modelle 36,9 % aller Interaktionen aus.
Zoomt man auf konkrete Modellfamilien heran, wird die Arbeitsteilung deutlicher. Auf der Bildseite sitzt ByteDances Seedream mit 33,5 % fest auf Platz eins, Googles Nano Banana kommt auf 26,1 %, Alibabas Qwen Image auf 26,0 %; Letzteres ist fast doppelt so viel wie die 12,3 % der vorherigen Periode. Auf der Videoseite bleibt xAIs Grok Imagine die Nummer eins unter den Einzelmodellen (30,6 %, allerdings ein Rückgang von 39,6 % in der vorherigen Periode), ByteDances Seedance springt von 10,8 % auf 25,2 %, Kling hält sich bei 21,9 %.
Wirklich bemerkenswert ist das Zwei-Wochen-Fenster: Vom 22. September bis zum 5. Oktober wurde Qwen Image mit 17,2 % zur meistgenutzten Modellfamilie über alle Kategorien hinweg und verdrängte damit GPT-Text mit 10,9 % und Gemini mit 10,8 %. Eine Familie, die aus offenen Gewichten hervorgegangen ist und sich auf Bildbearbeitung spezialisiert hat, wurde in einem Einstiegspunkt, der Modelle verschiedener Anbieter bündelt, häufiger geöffnet als alle Textmodelle.

Günstig heißt nicht verwendet – die Qwen-Zahlen sagen etwas anderes
Die naheliegendste Erklärung ist der Preis. Overchat AI ergänzt ausdrücklich: Qwen Image und GPT Image 2.5 haben auf der Plattform denselben Preis pro Nutzung und sind beide im kostenlosen Tarif enthalten. Der Preis ist gleich, die Nutzung unterscheidet sich jedoch um etwa das Vierfache. Was hier wirkt, ist also nicht, wer billiger ist, sondern etwas anderes: die Brauchbarkeit der erzeugten Bilder, wie gut beim Bearbeiten das Original erhalten bleibt und ob Nutzer nach dem ersten Versuch einen zweiten wagen wollen.
Eine begleitende Zahl erklärt diese Bindung gut. Bei der Modellwahl neuer Nutzer kommen OpenAI und Anthropic zusammen auf 23,8 %; bei wiederkehrenden Nutzern fällt diese Zahl auf 19,8 %. Gleichzeitig steigt Google von 20,9 % auf 28,0 %, chinesische Anbieter von 36,3 % auf 39,8 %. Die erste Wahl folgt der Vertrautheit, danach der tatsächlichen Erfahrung. Menschen wechseln, und die Richtung des Wechsels geht hin zu visuellen Fähigkeiten.
Die Nutzung ändert sich, die Geräte ebenfalls
Die regionalen Unterschiede sind größer als gedacht. In Japan stammen 74,4 % der KI-Nutzung von Gemini, fast eine Monopolstellung; Spanien und Indonesien neigen deutlich zu Qwen Image. Die USA sind eine Ausnahme: Sie sind der einzige große Markt, in dem Videogenerierung die größte Kategorie ist, mit 36,8 %. Brasilien tendiert am stärksten zu Text, mit 49,3 %.
Mobile Geräte machten etwa 74 % der Sessions aus, wobei Text, Bild und Video fast zu gleichen Teilen vertreten waren, mit jeweils rund 33 %. Desktop tendiert deutlich stärker zu Text, 51,3 %, wobei GPT, Gemini und Claude die führenden Familien sind. Dieser Vergleich verrät eines: Bild- und Videogenerierung wird zu etwas, das man „nebenbei erledigt“; Nutzer probieren es auf dem Smartphone aus, sobald ihnen danach ist, statt es bis vor den Computer aufzusparen und dann ernsthaft zu machen. Die auf Mobilgeräten bevorzugten Familien bestätigen das: Seedream, Grok Imagine, Seedance.
Nutzung nicht mit Produktqualität verwechseln
Auch die Stellen, an denen Zurückhaltung nötig ist, sind klar. Dies ist eine Stichprobe einer einzelnen Plattform; die Nutzerstruktur neigt zu Menschen, die bereit sind, neue Modelle auszuprobieren, und lässt sich nicht direkt auf den gesamten Markt übertragen. Hohe Nutzung bedeutet nur, dass etwas immer wieder geöffnet wird, nicht, dass jedes Bild besser ist. Seedance kostet etwa dreimal so viel wie Grok Imagine 1.5 und konnte seinen Anteil trotzdem mehr als verdreifachen; das zeigt, dass Nutzer nie nur auf den Preis achten.
Doch setzt man diese Stichprobe mit anderen Signalen zusammen, wird die Richtung klar. Im selben Zeitraum gab Alibaba die Gewichte von Qwen-Image frei (wenn auch unter einer auf Forschung beschränkten Lizenz), ByteDance führte für Seedance einen Modus ein, bei dem zuerst ein 480P-Entwurf ausgegeben wird und erst nach Zufriedenheit das fertige Video, und Shengshu Technology drückte den Einführungspreis seines Flaggschiff-Videomodells auf 0,09 Yuan pro Sekunde. All diese Schritte zielen auf dasselbe: „mehrmals ausprobieren“ bezahlbar zu machen.
Zoomt man noch weiter heraus, erklärt diese Datengrundlage auch etwas Makroskopischeres: Die Adoption von Text-zu-Video und Text-zu-Bild wandert von professionellen Studios hinunter zu normalen Menschen. Dass über 70 % der Sessions auf Mobilgeräte entfallen und die drei Inhaltsarten nahezu gleich aufgeteilt sind, bedeutet, dass die meisten nicht an Workflows basteln, sondern einfach ausprobieren. Diese Gruppe bestimmt nicht die Benchmark-Obergrenze von Frontier-Modellen, aber sie bestimmt, wie häufig Modelle genutzt und wie vielen Menschen sie empfohlen werden. Wer „ein Versuch, ein brauchbares Ergebnis“ zuverlässiger hinbekommt, bleibt eher auf dem ersten Bildschirm des Smartphones.
Beim Wettbewerb um Bild und Video geht es am Ende nicht um die Obergrenze eines einzelnen fertigen Ergebnisses, sondern darum, wie oft man mit demselben Budget ausprobieren, wie oft man ändern und wie viele Ergebnisse man behalten möchte. Die Nutzungsdaten schreiben diese schlichte Wahrheit nur mit 30 Millionen Klicks nieder.
Verwandte Artikel
Decagons PACT-Protokoll will Zustimmung zum Standard machen
Decagon hat ein Protokoll offengelegt, das die Identitat eines personlichen Agenten und die vom Kunden erteilten Berechtigungen pruft. Es ist unspektakulare Infrastruktur, und sie entscheidet, ob die Agentenwirtschaft funktioniert.
Die KI-Wiedervereinigungswelle: eine Debatte, die China noch nicht einordnen kann
KI-Hommagefilme brachten Verstorbene zuruck auf chinesische Bildschirme und sammelten Hunderttausende Likes. Dann kam der Widerspruch, und es ging um Zustimmung.
Apple veroffentlichte ein offenes multimodales Modell und sagte es kaum jemandem
Dieser forschungsorientierte Launch glitt an der Offentlichkeit vorbei, doch das feinkornige visuelle Grounding verrat, wohin Apples KI-Stack geht.
OpenCut und der Moment des Open-Source-CapCut
Ein kostenloser Videoeditor unter MIT-Lizenz klettert weiter in den GitHub-Trends, und seine Roadmap enthalt einen MCP-Server fur KI-Agenten. Die Werkzeuge um KI-Medien holen die Modelle ein.