September: Chinesische LLMs starten Open-Source-Offensive – diesmal geht es um „Erschwinglichkeit“

Der September war kaum zur Hälfte vorbei, da kamen die Leute, die Evaluierungen machen, mit dem Update-Tempo der heimischen Large Models schon kaum noch hinterher. Die Neuheiten von Zhipu, Meituan, ModelBest, Tencent und Ant Group fielen fast alle in dasselbe Zeitfenster, und die Bandbreite reichte von universellen Large Models über kleine On-Device-Modelle bis hin zu Bildgenerierung und embodied AI. Jenseits des Trubels ist das wirklich Bemerkenswerte der Weg, den sie alle unisono eingeschlagen haben: Die Parameter wurden nicht einfach immer weiter hochgeschraubt, stattdessen wurde kräftig in die Frage investiert, wie man sie bezahlbar und deploybar macht.
Beginnen wir mit Zhipu. Das im September veröffentlichte GLM-5.3-Flash hat insgesamt 320 Milliarden Parameter, aber pro Inferenz sind nur 18 Milliarden aktive Parameter tatsächlich an der Berechnung beteiligt. Der Ansatz der spärlichen Aktivierung ist denkbar einfach: Man macht das Modell groß und weckt bei einer einzelnen Inferenz nur einen kleinen Teil davon, wodurch sich Kosten und Latenz senken lassen. Es ist unter MIT-Lizenz als Open Source verfügbar, unterstützt nativ Multimodalität und kostet für eine Million Ausgabe-Token etwa 0,25 US-Dollar. Ein noch gewichtigerer Satz in den Versionshinweisen lautet: Der Inferenzdienst läuft durchgängig auf inländischen KI-Chips, die End-to-End-Leistung wurde gegenüber dem ursprünglichen Benchmark um etwa das Dreifache gesteigert, und es wurde ein Volumen von 100 Billionen kostenlosen Token pro Tag erreicht. Für Entwickler wiegt dieser Satz schwerer als jede Zahl in der Parametertabelle.
Meituan hat LongCat-2.0 vorgelegt, mit insgesamt 1,6 Billionen Parametern und nativer Unterstützung für einen Kontext von 1 Million Token. Der Clou liegt nicht in der Größe, sondern im Nährboden des Trainings: Laut offiziellen Angaben ist es das erste Open-Source-LLM mit Billionen Parametern, das den gesamten Trainings- und Inferenzprozess auf einem inländischen Rechencluster der 10.000-GPU-Klasse absolviert hat. Dazu kommen der KI-Business-Workbench CatPaw und der Local-Life-Agent „Xiaotuan“, der kumuliert bereits über 700 Millionen Nutzeranfragen beantwortet hat. Dass ein Unternehmen, das mit Local Life angefangen hat, ein Billionen-Parameter-Modell auf die Bühne bringt, zeigt, dass sich die Kostenstruktur in diesem Feld lockert.
ModelBests MiniCPM5-2B schlägt die entgegengesetzte Richtung ein und drückt die Parameter auf die 2-Milliarden-Marke, um auf die Endgeräte zu zielen. Es führt den bewährten Weg von MiniCPM fort: kleine Parameter, praktisch einsetzbar, läuft auch auf einem Smartphone oder Edge-Gerät. Fast zeitgleich hat MiniMax die Code CLI unter MIT-Lizenz als Open Source freigegeben, und Zhipu hat mit GLM-5.3-FlashX ein auf hohen Durchsatz ausgelegtes Modell nachgelegt, mit einer Inferenzgeschwindigkeit von etwa 200 Token pro Sekunde. On-Device, Inferenzbeschleunigung und Programmierwerkzeuge werden alle drei Linien bedient – diese Kombination zeigt besser als ein einzelnes „Flaggschiff“, wie reif das Ökosystem geworden ist.
Betrachtet man all das zusammen, wird ein Trend deutlich: Open Source wird zum Wettbewerbsmittel, nicht aus Idealismus. MIT, offene Gewichte, kostenlose Kontingente – diese Maßnahmen zielen sehr pragmatisch darauf, wer Entwickler und kleine wie mittlere Unternehmen zuerst in sein Ökosystem holt und damit in der nächsten Runde das Nutzungsvolumen für sich gewinnt. Eine Parameterführerschaft kann eine Produktpräsentation tragen, aber keinen alltäglichen Produktivbetrieb.
Auch die Bildsparte fehlte nicht. Am 4. September veröffentlichte das Bailing-Lab von Ant Group die LLaDA-Image-Reihe als Open Source, bestehend aus einer Base- und einer Turbo-Version mit rund 7 Milliarden Parametern; ein einzelner Checkpoint unterstützt gleichzeitig Text-zu-Bild, referenzbildbasierte Bearbeitung und Textrendering in Chinesisch und Englisch, ohne dass ein zusätzlicher Bearbeitungszweig nötig ist. Das Highlight ist die Turbo-Version: Sie reduziert mit Twin-DMD-Destillation die Sampling-Schritte auf 2 bis 4 und hält dabei Qualität und Geschwindigkeit, wobei die Inferenz nicht auf High-End-GPUs angewiesen ist. Auf Qwen-Image-Bench erzielt sie 53,53 Punkte in englischsprachigen Szenarien und 53,38 Punkte in chinesischsprachigen Szenarien; laut offiziellen Angaben sind beide Werte derzeit Bestwerte. Dass die Schrittzahl von den üblichen 50 auf eine einstellige Zahl sinkt, bedeutet nicht nur Schnelligkeit, sondern vor allem, dass Echtzeitgenerierung auf Consumer-Hardware realisierbar wird.
Im Bereich embodied AI hat Zidong Taichu am 15. September ZDTaichu5.0-9B als Open Source veröffentlicht. Das Modell mit 9 Milliarden Parametern belegte in räumlichem Verständnis und embodied Aufgaben 8 weltweite Spitzenplätze in der gleichen Parameterklasse, erzielte auf MindCube-tiny 78,27 Punkte und liegt damit 20,67 Prozentpunkte über Qwen3.5-9B. Es schließt genau das Segment, in dem es für Roboter nach dem Sehen darum geht, was zu tun ist: Eine Tasse zu erkennen, beantwortet nur die Frage „Was ist das?“, doch erst die Beurteilung, in welche Richtung der Henkel zeigt und ob daneben etwas abgestellt werden kann, kommt der Frage „Was kann ich tun?“ nahe.
Und dann ist da noch Tencent, das man nicht ignorieren kann. Am 22. September veröffentlichte Hunyuan die Vorschauversion von Image 3.5, mit Verbesserungen vor allem bei Textgenerierung, Bildkomposition, Realismus und fortlaufender Bearbeitung; pro Vorgang können bis zu 5 Referenzbilder hochgeladen werden, die Ausgabe beträgt maximal 2K. Der Preis liegt bei 0,15 Yuan pro 2K-Bild, und es wird nur die endgültige Ausgabe berechnet. Auch das Veröffentlichungsdatum war mit Bedacht gewählt: Es fiel genau auf den Eröffnungstag der Alibaba Cloud Apsara-Konferenz. Solche „punktgenauen“ Veröffentlichungen sind in China nichts Neues mehr, aber auf Bildmodelle bezogen bedeutet das, dass der Wettbewerb von der technischen Ebene direkt auf die Ebene von Aufmerksamkeit und Ökosystem-Zugang verlagert wird.
Zieht man diese Aktionen zusammen, lassen sich die September-Schlagzeilen in drei Punkten zusammenfassen: beschleunigte Open-Source-Veröffentlichungen, sinkende Inferenzpreise und Rechenautonomie. Die drei greifen tatsächlich ineinander. Open Source senkt die Einstiegshürde, günstige Inferenz verwandelt die niedrigere Hürde in echte Nutzung, und die Substitution durch inländische Rechenleistung entscheidet wiederum, ob sich dieser niedrige Preis halten lässt. Dass GLM-5.3-Flash MIT plus kostenloses Kontingent wagt und LongCat-2.0 es wagt, Billionen Parameter auf einem inländischen 10.000-GPU-Cluster laufen zu lassen, beruht auf derselben Einschätzung: Nur wenn die Kosten kontrollierbar sind, wagt man es, das Modell herauszugeben.
Für normale Kreative und kleine wie mittlere Unternehmen besteht der unmittelbare Effekt dieser Runde darin, dass sich die Rechnung nun lohnt. Früher bedeutete der Wunsch, modernste Modelle zu nutzen, entweder eine nicht gerade günstige API-Rechnung oder das eigene Zusammenstellen von GPUs – zwei Hürden, an denen die meisten scheiterten. Jetzt drücken 0,15 Yuan pro 2K-Bild, Echtzeit-Bildgenerierung in 2 bis 4 Schritten und On-Device-Modelle, die mit 2 Milliarden Parametern laufen, diese Kosten in einen Bereich, in dem viele es tatsächlich ausprobieren würden. Wenn die Werkzeuge billiger werden, nehmen die Versuche zu, und die Qualität der Ergebnisse entsteht oft genau in diesem wiederholten Ausprobieren.

Es gibt aber auch Punkte, bei denen man nüchtern bleiben sollte. Dass Open-Source-Lizenzen immer großzügiger werden, heißt nicht, dass die kommerzielle Nutzung kostenlos ist: Nichtkommerzielle Klauseln, Datenkonformität und die Kontrollierbarkeit des Modellverhaltens müssen im echten Geschäftsbetrieb noch einzeln überprüft werden. Die dreifache Steigerung der Inferenzleistung auf inländischen Chips beruht auf Vergleichen mit den jeweiligen eigenen Benchmarks, und unabhängige Reproduktionen stehen noch aus; Fälle, in denen Modelle „Open Source“ sind, aber der Trainingscode nicht offengelegt wird, gibt es weiterhin, was Reproduktion und Weiterentwicklung einschränkt. Gute Zahlen sind das eine, stabile Auslieferung das andere.
Das eigentliche Signal dieser dichten Update-Welle im September ist nicht, dass „chinesische Modelle wieder ein paar erste Plätze belegt haben“, sondern dass sich die Kostenlogik auf der gesamten Angebotsseite neu ordnet. Wenn das Modell selbst immer mehr wie Infrastruktur wird, verschiebt sich der Wettbewerb nachgelagert: Wer hat den reibungsloseren Workflow, wer trifft die Anwendungsfälle genauer, wer kann günstige Rechenleistung in stabile Ergebnisse verwandeln. Open Source hat nur den Startschuss abgegeben, vor uns liegt noch eine lange Strecke.
Verwandte Artikel
KI-Videotools erhalten 9 von 10 Punkten für Benutzerfreundlichkeit. Der Compliance-Score ist eine andere Geschichte.
Nutzer lieben KI-Videogeneratoren. Rechtsabteilungen wurden noch nicht gefragt.
InternLumina-U2 vereint Text, Bilder, Video und 3D in einem 16B-Modell und liefert zwei Gewichtssätze
Die Aufgabenliste ist ehrgeizig. Das Veröffentlichungsformat liefert mehr Signal.
HappyOyster verkauft eine Welt, die Sie betreten können, keinen Clip, den Sie ansehen
Die meisten Videomodelle liefern Ihnen eine Datei. Dieses liefert Ihnen einen Raum mit einer Tür darin.
Luma Ray3 Modify bewahrt die Performance und verhandelt die Welt um sie herum neu
Das schwierigste Problem beim KI-Videoschnitt ist nicht der Effekt. Es ist, den Take, für den Sie bereits bezahlt haben, nicht zu ruinieren.