← Zurück zum Blog
Aica. 6 Min. Lesezeit

Huawei Cloud hat seinen Stack um Agenten herum neu aufgebaut – und dann den Rechnungen ein Datum gegeben

Veröffentlicht 4. Okt. 2026
Huawei Cloud hat seinen Stack um Agenten herum neu aufgebaut – und dann den Rechnungen ein Datum gegeben

Huawei Cloud nutzte seine jährliche Connect-Konferenz im September, um zu erklären, dass sein Enterprise-KI-Portfolio jetzt vollständig am Markt ist und dass Agenten das Designzentrum dieses Portfolios bilden. Der CEO von Huawei Cloud, Zhou Yuefeng, beschrieb den Wandel als Aufbau einer „Agentic Cloud“ für eine Ära industrieller Agenten, und die damit verbundenen Ankündigungen drehten sich überwiegend um die technische Infrastruktur.

Vier Teile dieser Infrastruktur, um genau zu sein. Huawei Cloud beschrieb sein neues Infrastrukturparadigma als effiziente Tokens, erweitertes Gedächtnis, integriertes Scheduling für allgemeine und KI-Workloads sowie sichere Autonomie. Das daraus resultierende Plattformangebot bediene bereits mehr als 3.500 Kunden weltweit, hieß es. Die Formulierung klingt nach Marketing, bis man sich ansieht, worauf jeder einzelne Teil abzielt; denn jeder beantwortet einen Fehler, den Agenten im Produktivbetrieb treffen und Chatbots nicht.

Tokens, Gedächtnis und die Zehn-Minuten-Wiederherstellung

Die Compute-Schicht ist der Cluster-Dienst Lingqu Ascend 950. Huawei Cloud erklärt, er nutze einen fünfstufigen Schnellwiederherstellungsmechanismus mit Full-Link-Observability, Trainingsjobs liefen darauf 40 Tage lang ohne Unterbrechung, und ein Ausfall werde innerhalb von zehn Minuten behoben. Der Token-Durchsatz liege 20 Prozent über dem der vorherigen Generation. Der Dienst ging am 30. September in China kommerziell an den Start, ein Auslandsstart ist für den 30. November geplant.

Ein Bündel leuchtender blauer Glasfaserstränge vor schwarzem Hintergrund

Ein Wiederherstellungsziel von zehn Minuten ist eine andere Spezifikation als ein Benchmark-Wert. Lange Trainingsläufe schlagen fehl, und die Kosten eines Ausfalls messen sich in verlorenen GPU-Stunden und Neustart-Overhead; die Wiederherstellungszeit ist daher die Zahl, die das Finanzteam eines Kunden tatsächlich interessiert.

Die Gedächtnisschicht zielt auf einen spezifischen Fehlermodus lang laufender Agenten. Huawei Cloud nennt das Produkt CMS Memory Storage und beschreibt es als petabytegroßen Gedächtnisspeicher, etwa doppelt so groß wie vergleichbare Angebote, mit Lesegeschwindigkeiten im Terabyte-Bereich für Hochgeschwindigkeitszugriff und einer Leistungsverbesserung um 50 Prozent. Das Argument lautet, dass ein Agent, der an einer langen Aufgabe arbeitet, einen Ort braucht, an dem er Gelerntes aufbewahren kann, der nicht das Kontextfenster ist, denn ein Kontextfenster, das unbegrenzt wächst, ist teuer und unzuverlässig.

Dann gibt es die Modellzugriffsschicht. AgenticMaaS soll Entwicklern ermöglichen, gängige State-of-the-Art-Modelle mit einem Klick und ohne Bereitstellungsaufwand aufzurufen. MiniMax demonstrierte auf derselben Veranstaltung ein multimodales Modell, das auf der Plattform lief – eine Erinnerung daran, dass in China die Modellanbieter und die Cloud-Anbieter oft an denselben Unternehmenskunden verkaufen.

Kommerziell und Open Source, zusammen verkauft

Die Anwendungsschicht ist der Bereich, in dem sich der Ansatz von Huawei Cloud von einem reinen Infrastrukturspiel unterscheidet. Das Unternehmen verfolgt eine Doppelstrategie: die kommerzielle Plattform ZhiGuo AgentArts und ein Open-Source-Pendant namens openJiuwen. Zusammen habe das Unternehmen mehr als 5.000 allgemeine Assets und mehr als 1.000 Branchen-Assets veröffentlicht, also wiederverwendbare Skills, Vorlagen und Konnektoren statt reiner Modelle.

Die Plattform wird bei mehr als hundert Regierungsstellen, Banken, Forschungseinrichtungen und Unternehmen eingesetzt, darunter die Bezirksregierung Longgang in Shenzhen, die Postal Savings Bank of China, China Southern Power Grid und Kingsoft Office. Kingsoft baute auf der Plattform büroorientierte Agenten, indem es sein WPS-365-Dokumentenzentrum mit seinem Comate-Assistenten kombinierte – eine Art Integration, die ein Cloud-Anbieter nicht allein aufbauen und ein Anwendungsanbieter nicht allein hosten kann.

ZhiGuo AgentArts soll am 30. Dezember in Auslandsmärkten kommerziell starten. Die Open-Source-Community rund um openJiuwen meldet mehr als 50.000 Stars und 3,29 Millionen Downloads. Sowohl eine kommerzielle Plattform als auch eine offene Version auszuliefern, ist eine Möglichkeit, eine Entwicklerbasis heranzuziehen, die irgendwann die kostenpflichtige Stufe brauchen wird, und es ist ein Muster, dem mehrere chinesische Anbieter inzwischen folgen.

Das andere Argument für On-Premises

Huawei Cloud ist nicht das einzige Unternehmen, das in China Agenten-Infrastruktur verkauft, und eine ruhigere Reihe von Ereignissen im September zeigt den Rest des Marktes. Mitac veranstaltete zusammen mit AMD Bereitstellungs-Seminare in Wuxi und Guiyang für ein Unternehmens-Agenten-Gerät namens Agent Builder, das auf AMDs Ryzen-AI-Max-Prozessoren basiert und mit Datensouveränität beworben wird. Das Argument ist dort das Gegenteil einer Public Cloud: Modell, Compute, Wissensbasis und Geschäftssysteme im Unternehmen behalten und den Agenten auf einer Box im Büro laufen lassen.

Beide Ansätze reagieren auf denselben Beschaffungseinwand. Unternehmen wollen Agenten, die echte Geschäftsprozesse berühren, und echte Geschäftsprozesse enthalten Daten, die sie nicht ohne Weiteres hinter dem Endpunkt eines anderen unterbringen möchten.

Die vier Zahlen, die ein Käufer ohnehin verfolgt

Die vier Infrastruktursäulen entsprechen vier Kosten. Tokens sind der Preis jeder Inferenz, weshalb die Ankündigung mit dem Durchsatz und nicht mit einem Benchmark-Wert beginnt. Gedächtnis sind die Kosten einer lang laufenden Aufgabe, wenn das Kontextfenster nicht mehr ausreicht. Scheduling ist die Auslastungsstrafe, wenn allgemeine und KI-Workloads auf gemeinsam genutzter Hardware laufen. Sicherheit ist das, wonach eine Compliance-Abteilung fragt, bevor irgendetwas Produktionsdaten berührt.

Huawei Cloud behauptet, alle vier in einem Stack adressiert zu haben und dies tun zu können, weil das Unternehmen das Silizium besitzt. Das ist ein schwerer einzuhaltendes Versprechen für einen Wettbewerber und ein leichter zu überprüfendes für einen Kunden, denn das Ergebnis zeigt sich an drei Stellen, die ein Beschaffungsteam ohnehin misst: Kosten pro Million Tokens, die Rate fehlgeschlagener langer Läufe und der Anteil der GPU-Zeit, in der tatsächlich gearbeitet wird.

Warum die Infrastruktur die Geschichte ist und nicht die Modelle

Die interessante Behauptung aus der diesjährigen chinesischen Agenten-Diskussion lautet, dass die Modellfähigkeiten konvergiert sind und sich der Wert auf das verlagert hat, was sie umgibt. Ein Professor of Practice am Shanghai Advanced Institute of Finance brachte im September auf einem Forum in Shanghai die ökonomische Variante des Arguments: Anders als bei Internetplattformen, bei denen die Grenzkosten gegen null gehen und Netzwerkeffekte stark sind, verbraucht ein großes Modell bei jeder Inferenz Ressourcen, und ein Nutzer kann Modelle in Minuten wechseln. Ein Burggraben, der allein auf dem Modell beruht, ist dünn.

Wenn diese Lesart stimmt, ist die verteidigungsfähige Schicht diejenige, deren Wechsel teuer ist – und das bedeutet Tokens, Gedächtnis, Scheduling und Sicherheit statt Gewichte.

Huaweis Vorteil in dieser Betrachtung ist vertikal. Das Unternehmen besitzt den Chip, die Interconnect-Verbindung, die Cloud und die Modellplattform, weshalb die Ascend-950-Ankündigung mit Wiederherstellungszeit und Token-Durchsatz beginnt und nicht mit einer Platzierung auf einem Leaderboard. Wettbewerber ohne Chipgeschäft verkaufen eine Integrationsgeschichte, und Integrationsgeschichten lassen sich leichter kopieren.

Das Gegenargument lautet, dass Integriertsein einen auch zum Single Point of Failure macht und dass Unternehmen zunehmend eine portable Agentenschicht statt einer anbieterförmigen wollen. Diese Spannung wird sich in den nächsten zwei Quartalen erweisen, beginnend mit dem kommerziellen Start am 30. September in China und dem Auslandsstart Ende November. Die Auslandsfrist ist wichtiger als die inländische, denn ein Stack, der um inländisches Silizium herum gebaut ist, muss beweisen, dass er einen Kunden bedienen kann, dessen Daten seine eigene Gerichtsbarkeit nicht verlassen dürfen.

Verwandte Artikel