Alibaba steckt große Modelle in eigene Siliziumchips: Zhenwu V900 dreimal schneller, Qwen 4 bereits im Training

Auf der Apsara Conference Ende September in Hangzhou legte Alibaba drei Dinge auf denselben Tisch: einen neuen Chip, ein Modell im Training und eine Rechnung für Rechenzentren bis 2032. In früheren Jahren spielten auf solchen Konferenzen meist die Modelle die Hauptrolle; in diesem Jahr war es das Silizium, das immer wieder genannt wurde.
Alibabas Chip-Einheit T-Head stellte den AI-Chip Zhenwu V900 vor, der Training und Inferenz in einem vereint. Laut offiziellen Angaben ist seine Rechenleistung dreimal so hoch wie die des Zhenwu M890, mit 216 GB Speicher, 1200 GB/s Inter-Chip-Interconnect-Bandbreite und nativer Unterstützung für die beiden Niedrigpräzisionsformate FP8 und FP4. Der Zhenwu M890 war erst im Mai dieses Jahres vorgestellt worden – nur vier Monate zuvor. Der V900 soll erst im ersten Quartal 2027 in Serie produziert und verkauft werden; auf der Bühne steht derzeit also noch ein Datenblatt, keine bestellbare Ware.
Wirklich bemerkenswert ist die Art der Vernetzung dahinter. T-Head stattet den V900 mit dem selbst entwickelten Interconnect-Chip ICNSwitch aus, der Speichersemantik und einheitliche Speicheradressierung bietet und laut eigenen Angaben über tausend V900 so zusammenarbeiten lässt wie einen einzigen „Superchip“. In dem ebenfalls vorgestellten Supernode-Server stecken neben dem V900 auch die hauseigene SmartNIC und der SSD-Controller-Chip – Rechnen, Speichern und Netzwerk will man selbst in der Hand behalten. Nach den von Alibaba genannten Zahlen lässt sich ein einzelner Cluster auf 500.000 Karten skalieren.

Alibaba hat bereits eine Reihe realer Workloads in der Hand. Supernodes auf Basis des Zhenwu M890 haben zuvor Modelle wie Qwen3.8 und Kimi K3 mit über zwei Billionen Parametern ausgeführt; die Chips der Zhenwu-Reihe haben kumuliert mehr als 650 Unternehmenskunden bedient, in Branchen wie autonomem Fahren, Finanzwesen, Energie und Fertigung. Diese Zahlen erklären, warum Alibaba es wagt, für die nächste Cluster-Generation eine Größe von 500.000 Karten auszurufen.
Noch direkter sind die Schritte auf der Modellseite. Alibaba bestätigt, dass Qwen 4 bereits trainiert wird; Qwen 4.5 und Qwen 5 sollen eine Zielparameterzahl zwischen 5 und 10 Billionen erreichen. Zum Vergleich: Das derzeit stärkste Modell von Alibaba, Qwen3.8-Max, hat 2,4 Billionen Parameter. Größere Parameterzahlen und größere Cluster sind zwei Seiten derselben Sache: Ohne genügend Karten würde sich die Trainingsdauer billionenstarker Modelle so weit verlängern, dass sie ihren Sinn verliert.
Alibaba Cloud hat sich zum Ziel gesetzt, bis 2032 eine globale Rechenzentrumskapazität von über 20 GW zu erreichen. Zugleich will das Unternehmen im kommenden Jahr drei neue Regionen in der Türkei, Finnland und den Niederlanden eröffnen und in Malaysia, Deutschland, den Vereinigten Arabischen Emiraten, Frankreich und anderen Ländern ausbauen. Chips, Modelle und Cloud in einer einzigen Strategie zu erzählen, war die klarste Leitlinie dieser Konferenz.
Schöne Zahlen – doch verglichen wird mit sich selbst
Bei der Bewertung dieser Roadmap sind zwei Punkte zu beachten.
Erstens: Die dreifache Steigerung bezieht sich auf den V900 im Vergleich zum hauseigenen M890 – nicht auf Nvidias Blackwell und auch nicht auf irgendeine Beschleunigerkarte eines Drittanbieters. Speicherkapazität und Interconnect-Bandbreite lassen sich nicht direkt in realen Trainingsdurchsatz, Inferenzlatenz und Kosten pro Token umrechnen. Alibaba hat auch keine Benchmarks aus unabhängigen Dritttests veröffentlicht.
Zweitens: das Software-Ökosystem. Der weltweit vorherrschende Code zum Trainieren großer Modelle ist seit Langem um CUDA herum geschrieben; Treiberbibliotheken, Container und Orchestrierungstools bauen auf jahrelanger Akkumulation auf. Eine Workload, die auf einer Nvidia-Plattform läuft, auf einen neuen Chip zu migrieren, kostet oft nicht wegen der Hardware-Parameter, sondern in den Wochen, in denen Ingenieure Code ändern und Leistung optimieren. Alibaba hat diesmal nicht erläutert, wie schwierig die Migration vom V900 auf die bestehende Nvidia-Toolchain ist, und auch keine Preise, verfügbaren Instanztypen oder regionale Unterstützung genannt.
Das ist kein Problem, das nur Alibaba betrifft. Fertigungskapazität bei fortschrittlichen Prozessknoten, Ausbeute und Leistung pro Watt sind reale Einschränkungen, mit denen in China selbst entwickelte Chips konfrontiert sind. Die Bedeutung des Zhenwu V900 liegt eher darin, die Frage „Kann man es selbst bauen?“ einen Schritt voranzubringen, als bei einem einzelnen Punkt gleichzuziehen.
Warum jetzt?
Der Zeitpunkt verdient eine genauere Betrachtung. In den vergangenen zwei Jahren hat die USA ihre Beschränkungen für den Export fortschrittlicher GPUs nach China kontinuierlich verschärft, sodass chinesische Cloud-Anbieter ihre Investitionen in selbst entwickelte Beschleuniger beschleunigen mussten. Alibaba und Huawei sowie kleinere Player wie Enflame und Iluvatar CoreX ziehen in dieselbe Richtung. Berichten zufolge hat auch Huawei den Veröffentlichungsrhythmus seiner nächsten AI-Chip-Generation vorgezogen. Die öffentlichen Aussagen beider Unternehmen ähneln sich: Nvidias Platz im chinesischen Markt einnehmen, bevor die Regeln weiter zuschnappen.
Für Alibaba selbst hat das eigene Silizium zwei Vorteile. Erstens verringert es die Abhängigkeit von Schwankungen der US-Politik, sodass die Compute-Planung nicht mehr mit den Exportregeln auf und ab geht; zweitens bleibt der Teil der Marge aus Chip plus Cloud, den historisch Nvidia abgeschöpft hat, im eigenen Unternehmen.
Betrachtet man nur die Modellveröffentlichungen, könnte man meinen, in dieser Wettbewerbsrunde gehe es weiterhin darum, wer mehr Parameter hat und wer höhere Benchmarkwerte erzielt. Sieht man Chips, Supernodes, Cloud-Regionen und Modell-Roadmap zusammen, hat sich das Schlachtfeld längst auf die Ebene von Silizium und Rechenzentren verlagert. Modelle sind die Fassade; ob man Karten selbst bauen, selbst vernetzen und selbst mit Strom versorgen kann, entscheidet darüber, wie hoch dieses Gebäude werden kann.
Der Test steht noch bevor
In den nächsten zwölf bis achtzehn Monaten werden drei Dinge Antworten liefern. Erstens: Hält die Aussage von Supernodes mit 500.000 Karten der Prüfung in echten Kundendeployments stand? Zweitens: Können Qwen 4.5 und Qwen 5 tatsächlich eine Größenordnung von annähernd zehn Billionen Parametern erreichen? Und drittens: Lässt sich für das 20-GW-Rechenzentrumsziel die entsprechende Finanzierung und Stromversorgung sichern?
Wenn auch nur eines dieser Ziele zur Hälfte eingelöst wird, würde das schon zeigen, dass Chinas AI-Hardware-Stack den Abstand zu Nvidia verringert. Diese Annäherung zeigt sich nicht unbedingt in der Gleichwertigkeit bei einem einzelnen Kennwert, sondern eher im Deployment-Umfang selbst. Alibaba hat in Hangzhou die Worte gesprochen; den Rest müssen die Serienproduktionslinie und der Stromzähler beantworten.
Verwandte Artikel
Salesforce zahlt 2 Milliarden Dollar für ein Unternehmen, das Ihre Kunden für Sie interviewt
Interviews sind Belege. Digitale Zwillinge sind eine Vorhersage. Die Grenze zwischen ihnen ist der Test.
AMD kauft World Labs von Fei-Fei Li für 8,2 Milliarden US-Dollar, um Physical AI zu besitzen
AMD kauft ein Forschungslabor – und zahlt dafür den Preis eines Chipunternehmens.
Google brachte eine TPU in den Orbit und begann, die Kosten von Weltraum-Rechenzentren zu beziffern
Ein einziger funktionierender Chip beweist, dass die Reise überlebbar ist. Über den Profit sagt er wenig.
Jemand hat 13.000 Arten katalogisiert, wie KI-Texte sich verraten
Die Verräter verschwanden nicht. Sie sind an einen Ort gezogen, der schwerer zu sehen ist.