← Zurück zum Blog
Aica. 7 Min. Lesezeit

Zhipus GLM-5.2 wird vollständig offen: 744 Milliarden Parameter, trainiert auf heimischen Chips

Veröffentlicht 7. Okt. 2026
Zhipus GLM-5.2 wird vollständig offen: 744 Milliarden Parameter, trainiert auf heimischen Chips

Zhipu AI, das Pekinger Labor, auch bekannt als Z.AI, startete GLM-5.2 und lieferte die vollständigen offenen Gewichte innerhalb weniger Tage aus. Das Modell verfügt über insgesamt 744 Milliarden Parameter mit etwa 40 Milliarden aktiven pro Token und verwendet eine Mixture-of-Experts-Architektur mit einer besonderen Sparse-Attention-Optimierung namens IndexShare.

Die Lizenz ist MIT. Das ist die Schlagzeile für alle, die darauf aufbauen wollen: keine territorialen Ausnahmen, keine Umsatzschwelle, keine Obergrenze für monatlich aktive Nutzer. Kommerzieller Einsatz, Änderung und Weitergabe erfordern keine zusätzliche Genehmigung.

Was IndexShare Ihnen bringt

Die IndexShare-Architektur verwendet Sparse-Attention-Indexer über mehrere Schichten hinweg wieder, was laut technischen Berichten zu einer 2,9-fachen Reduzierung des Rechenaufwands pro Token bei voller Kontextfenstergröße von einer Million Token führt. Diese Zahl ist weniger als isolierter Benchmark von Bedeutung, sondern vielmehr als ökonomische Tatsache. Langkontext-Agentensitzungen sind der Ort, an dem Token-Kosten anfallen, und eine 2,9-fache Reduzierung am oberen Ende des Kontextfensters verändert, welche Arbeitslasten auf einem bestimmten Cluster rentabel sind.

GLM-5.2 unterstützt nativ eine Million Token und wird als bestes Open-Weight-Modell im Artificial Analysis Intelligence Index geführt. Bei SWE-bench Pro erreichte es 62,1 Prozent und liegt damit vor GPT-5.5 mit 58,6 Prozent. Bei Terminal-Bench 2.1 erzielte es 81,0 – die stärkste gemeldete Punktzahl aller Open-Weight-Modelle.

Die Hardware-Geschichte ist die geopolitische

Der Teil von GLM-5.2, der das Benchmark-Gerede überdauern wird, ist der, wo es läuft. Die gesamte GLM-5-Serie wurde auf Huawei-Ascend-Chips unter Verwendung des MindSpore-Frameworks trainiert. Das ist eine Aussage, die kein westliches Labor treffen kann, und genau deshalb zieht das Modell Aufmerksamkeit von Käufern auf sich, die über Lieferkettenresilienz nachdenken statt über reine Punktzahlen.

Zhipus Veröffentlichungsmaterialien ergänzen, dass die Online-Inferenz auf mehreren heimischen Compute-Plattformen läuft, mit Day-Zero-Kompatibilität für Huawei Ascend, T-Head, Moore Threads, Cambricon, Kunlun, Muxi, Hygon und Biren. Das Unternehmen beschreibt dies als stabilen Betrieb mit hohem Durchsatz, niedriger Latenz und großer Parallelität auf heimischen Chip-Clustern.

Für ein Unternehmen außerhalb Chinas ist die praktische Frage, ob die Gewichte einen selbst gehosteten Weg bieten, der die Kosten pro Token eliminiert. Für ein Unternehmen innerhalb Chinas ist die Frage breiter: ob ein frontier-fähiges Modell gebaut und bereitgestellt werden kann, ohne von Hardware abhängig zu sein, die es nicht zuverlässig kaufen kann.

Was es kostet und was Self-Hosting ändert

Die Preisstufen trennen sich sauber. Der direkte API-Zugang kostet etwa 1,40 $ pro Million Input-Token und 4,40 $ pro Million Output-Token, mit zwischengespeichertem Input zu 0,26 $. Über OpenRouter liegen die Sätze bei etwa 1,00 $ und 4,00 $. Das GLM Coding Plan-Abonnement liegt bei 10 bis 18 $ pro Monat für eine entwicklerorientierte Stufe, die nicht für Produktionsmaßstab gedacht ist.

Self-Hosting ist der Punkt, an dem die Rechnung kippt. On-Premise-Bereitstellung verursacht Infrastrukturkosten und keine Gebühren pro Token. Für eine Arbeitslast, die Millionen von Token pro Tag verarbeitet, ist dieser Unterschied erheblich. Der Kompromiss sind der GPU-Cluster, die Wartung und die Skalierungsarbeit, die eine verwaltete API verbirgt. Die MIT-Lizenz reduziert die rechtlichen Hürden zusätzlich zu den wirtschaftlichen.

Ein offener geometrischer Drahtgitterwürfel aus dünnen Messingstäben, der auf einem hellen Betonsockel ruht

Quantisierung ist der andere Hebel. Mit quantisierten Gewichten läuft das Modell Berichten zufolge auf Hardware für Endverbraucher, was einen selbst gehosteten Weg für datenschutzsensible Anwendungen wie Agenten eröffnet, die mit medizinischen Daten oder proprietären Codebasen umgehen.

Die Sicherheits-Fußnote, die es zu lesen lohnt

Ein Befund verdient Aufmerksamkeit, bevor jemand offene Gewichte als kostenloses Mittagessen betrachtet. Anthropics Red-Team-Bewertung berichtete, dass GLM-5.3 autonome Cyber-Fähigkeiten der Mythos-Klasse mit schwachen Schutzmaßnahmen gegen Missbrauch offener Gewichte aufweist. Offene Gewichte können nicht zurückgerufen werden. Einmal heruntergeladen, verbleibt das Modell auf unbestimmte Zeit im Besitz der einsetzenden Organisation.

Das schafft ein spezifisches Bereitstellungsproblem. Ein Open-Weight-Modell, das in einem Agenten-Framework läuft, benötigt Eindämmungsschichten, die ein geschlossener API-Anbieter auf seiner Seite handhabt. Die MIT-Lizenz beseitigt Anbieterbindung und entfernt auch vom Anbieter bereitgestellte Sicherheitsgarantien. Teams, die GLM-5.2 in einer Agentenschleife einsetzen, sollten Laufzeit-Eindämmung einplanen und es nicht als Problem anderer Leute betrachten.

Warum diese Veröffentlichung anders ankommt

Jeden Monat werden zahlreiche offene Modelle veröffentlicht. GLM-5.2 kommt aus drei Gründen anders an, die sich gegenseitig verstärken.

Die Lizenz ist wirklich permissiv bei einer Parametergröße, bei der das selten ist. Die meisten Open-Weight-Veröffentlichungen der Frontier-Klasse kommen mit einer kommerziellen Bedingung, einer territorialen Beschränkung oder einer Nutzerobergrenze. GLM-5.2 hat nichts davon.

Der Hardware-Pfad ist unabhängig von NVIDIA. Für Käufer, die Lieferkettenrisiken als vorrangiges Anliegen betrachten, ändert das die Auswahlliste unabhängig vom Benchmark-Rang.

Und die Recheneffizienz bei langem Kontext macht nachhaltige mehrstufige Sitzungen auf kleineren Clustern wirtschaftlich rentabel als bei einem Modell wie NVIDIAs Nemotron 3 Ultra, das laut Dokumentation mindestens 8xH100-Knoten benötigt.

GLM-5.2 ist nicht bei jeder Aufgabe das beste Modell, und der Sicherheitsvorbehalt ist real. Aber als Signal dafür, was eine offene Veröffentlichung heute sein kann – frontier-konkurrenzfähig, permissiv lizenziert und ohne in den USA hergestellte GPUs gebaut – ist es das klarste in diesem Zyklus.

Die Familie um das Flaggschiff

Es hilft, GLM-5.2 als oberste Sprosse einer Leiter zu sehen und nicht als eigenständige Veröffentlichung. Die GLM-Familie reicht vom leichten GLM-4.6V-Flash mit 9B, das auf Edge-Bereitstellung abzielt, bis zum 744B-Flaggschiff. Spezialisierte Varianten umfassen GLM-5V-Turbo für multimodale Bildaufgaben und das AutoGLM-Agenten-Framework für komplexe mehrstufige Planung.

Die permissive Lizenz gilt über diese Leiter hinweg, was der Teil ist, der für Teams bei der Auswahl eines Stacks zählt. Ein Unternehmen kann auf dem kleinen Edge-Modell prototypen, zum Flaggschiff skalieren und zwischen ihnen wechseln, ohne die Rechte bei jedem Schritt neu zu verhandeln. Diese Kontinuität ist ungewöhnlich im offenen Ökosystem, wo Lizenzen oft zwischen kleinen und großen Veröffentlichungen eines Labors abweichen.

Was die Effizienzbehauptung in der Praxis bedeutet

Die 2,9-fache Reduzierung des Rechenaufwands pro Token bei vollem Kontext ist eine Zahl, die wie eine Spezifikation klingt, bis man sie an eine Arbeitslast knüpft.

Man betrachte einen Agenten, der über eine große Codebasis oder eine lange Dokumentensammlung nachdenkt. Jeder Schritt liest einen wachsenden Kontext erneut, und die Kosten dieses erneuten Lesens machen lange Sitzungen teuer. Eine Reduzierung um fast das Dreifache am oberen Ende des Kontextfensters senkt den Punkt, an dem eine lang laufende Sitzung nicht mehr lohnenswert ist. Die Sitzung kostet immer noch Geld, aber der Break-even verschiebt sich.

Das ist auch der Grund, warum der Quantisierungspfad wichtig ist. Mit quantisierten Gewichten läuft das Modell Berichten zufolge auf Hardware für Endverbraucher, was einen Langkontext-Agenten von etwas, das einen Cluster benötigt, in etwas verwandelt, das ein kleines Team lokal ausführen kann. Für eine Anwendung, die sensible Daten verarbeitet, wie medizinische Aufzeichnungen oder proprietären Quellcode, ist die lokale Ausführung die einzige Bereitstellung, die den Compliance-Anforderungen entspricht, und die Kosten sind ein sekundärer Vorteil.

Wo der Sicherheitsvorbehalt zubeißt

Der Red-Team-Befund lässt sich leicht als Problem anderer Leute abtun. Das ist er nicht, und der Grund ist struktureller Natur.

Ein geschlossener API-Anbieter kann ein Modell aktualisieren, eine Richtlinie ändern oder einen Missbrauchsfall nachträglich unterbinden. Eine Open-Weight-Veröffentlichung entfernt diesen Hebel. Die Gewichte verbleiben, einmal heruntergeladen, im Besitz der einsetzenden Organisation, und kein Anbieter kann sie widerrufen. Das ist der ganze Sinn offener Gewichte, und es ist auch der Grund, warum die Eindämmung von dem Team aufgebaut werden muss, das sie einsetzt.

In der Praxis bedeutet das, dass ein Agent, der GLM-5.2 ausführt, dieselbe Laufzeitdisziplin benötigt, die ein Team auf jedes mächtige Werkzeug mit Schreibzugriff anwenden würde: abgegrenzte Berechtigungen, eine Sandbox für nicht vertrauenswürdige Aktionen, Protokollierung, die einen Absturz übersteht, und einen Eskalationspfad zu einem Menschen für folgenreiche Entscheidungen. Nichts davon wird von der Lizenz bereitgestellt, und nichts davon ist bei den Gewichten kostenlos dabei. Die MIT-Bedingungen beseitigen Anbieterbindung auf der rechtlichen Seite und entfernen konstruktionsbedingt die vom Anbieter bereitgestellte Sicherheit auf der operativen Seite.

Verwandte Artikel