Huawei Cloud a reconstruit sa stack autour des agents, puis a fixé une date aux factures

Huawei Cloud a profité de sa conférence annuelle Connect, en septembre, pour annoncer que son portefeuille d'IA d'entreprise est désormais entièrement disponible sur le marché, et que le cœur de conception de ce portefeuille, ce sont les agents. Le PDG de Huawei Cloud, Zhou Yuefeng, a présenté ce virage comme la construction d'un « Agentic Cloud » pour une ère d'agents métier, et les annonces qui l'accompagnaient portaient essentiellement sur la plomberie.
Quatre éléments de plomberie, pour être précis. Huawei Cloud a décrit son nouveau paradigme d'infrastructure en quatre points : des tokens efficaces, une mémoire renforcée, un ordonnancement intégré des charges générales et d'IA, et une autonomie sécurisée. L'entreprise affirme que la plateforme qui en résulte sert déjà plus de 3 500 clients dans le monde. La formule sonne comme du marketing jusqu'à ce qu'on regarde ce que vise chaque élément, car chacun répond à une défaillance que les agents rencontrent en production et que les chatbots ne connaissent pas.
Tokens, mémoire et la reprise en dix minutes
La couche de calcul est le service de clusters Lingqu Ascend 950. Huawei Cloud indique qu'il s'appuie sur un mécanisme de reprise rapide à cinq niveaux avec une observabilité de bout en bout, que des tâches d'entraînement y ont tourné 40 jours sans interruption, et qu'une panne est résolue en dix minutes. Le débit de tokens est annoncé 20 % supérieur à celui de la génération précédente. Le service est commercialisé en Chine depuis le 30 septembre, avec un lancement à l'international prévu le 30 novembre.

Un objectif de reprise en dix minutes est une spécification d'une tout autre nature qu'un score de benchmark. Les longs entraînements échouent, et le coût d'une défaillance se mesure en heures de GPU perdues et en surcoût de redémarrage : le temps de reprise est donc le chiffre qui intéresse réellement l'équipe financière d'un client.
La couche mémoire cible un mode de défaillance spécifique des agents de longue durée. Huawei Cloud appelle ce produit CMS memory storage et le présente comme offrant un espace mémoire à l'échelle du pétaoctet, soit environ le double de la capacité des offres comparables, avec des débits de lecture de l'ordre du téraoctet pour un accès à grande vitesse et une amélioration de performance de 50 %. L'argument : un agent qui travaille sur une tâche longue a besoin d'un endroit, autre que la fenêtre de contexte, où conserver ce qu'il a appris, car une fenêtre de contexte qui croît sans limite est coûteuse et peu fiable.
Vient ensuite la couche d'accès aux modèles. AgenticMaaS permettrait aux développeurs d'appeler les principaux modèles de pointe en un clic, sans aucun travail de déploiement. MiniMax a présenté, lors du même événement, un modèle multimodal fonctionnant sur la plateforme, ce qui rappelle qu'en Chine les fournisseurs de modèles et les fournisseurs de cloud vendent souvent au même acheteur d'entreprise.
Commercial et open source, vendus ensemble
C'est au niveau de la couche applicative que l'approche de Huawei Cloud se distingue d'une pure offre d'infrastructure. L'entreprise mène une double stratégie : la plateforme commerciale ZhiGuo AgentArts et son pendant open source, openJiuwen. Entre les deux, elle affirme avoir publié plus de 5 000 actifs génériques et plus de 1 000 actifs sectoriels, c'est-à-dire des compétences, des gabarits et des connecteurs réutilisables plutôt que des modèles bruts.
La plateforme est utilisée par plus d'une centaine d'organismes publics, de banques, d'instituts de recherche et d'entreprises, dont le gouvernement du district de Longgang à Shenzhen, la Postal Savings Bank of China, China Southern Power Grid et Kingsoft Office. Kingsoft a construit sur la plateforme des agents dédiés à la bureautique en combinant le centre de documents WPS 365 et son assistant Comate : c'est le type d'intégration qu'un fournisseur de cloud ne peut pas bâtir seul et qu'un éditeur applicatif ne peut pas héberger seul.
ZhiGuo AgentArts doit être commercialisé sur les marchés internationaux le 30 décembre. La communauté open source autour d'openJiuwen revendique plus de 50 000 étoiles et 3,29 millions de téléchargements. Proposer à la fois une plateforme commerciale et une version ouverte est une façon d'ensemencer la base de développeurs avec des personnes qui finiront par avoir besoin de l'offre payante : un schéma que suivent désormais plusieurs fournisseurs chinois.
L'autre argument en faveur de l'installation sur site
Huawei Cloud n'est pas la seule entreprise à vendre de l'infrastructure pour agents en Chine, et une série d'événements plus discrets en septembre montre le reste du marché. Mitac, en collaboration avec AMD, a organisé à Wuxi et Guiyang des séminaires de déploiement pour une appliance d'agents d'entreprise baptisée Agent Builder, construite autour des processeurs Ryzen AI Max d'AMD et commercialisée sur l'argument de la souveraineté des données. Le discours y est l'inverse de celui d'un cloud public : garder le modèle, la puissance de calcul, la base de connaissances et les systèmes métier à l'intérieur de l'entreprise, et faire tourner l'agent sur une machine au bureau.
Les deux approches répondent à la même objection d'achat. Les entreprises veulent des agents qui touchent à de vrais processus métier, et ces processus contiennent des données qu'elles ne sont pas à l'aise de placer derrière le point de terminaison d'un tiers.
Les quatre chiffres qu'un acheteur suit déjà
Les quatre piliers de l'infrastructure correspondent à quatre coûts. Les tokens sont le prix de chaque inférence, ce qui explique pourquoi l'annonce met en avant le débit plutôt qu'un score de benchmark. La mémoire, c'est ce que coûte une tâche longue quand la fenêtre de contexte ne suffit plus. L'ordonnancement, c'est la pénalité d'utilisation liée au fait de faire tourner des charges générales et d'IA sur du matériel partagé. La sécurité, c'est ce qu'un service de conformité demande avant que quoi que ce soit ne touche aux données de production.
Huawei Cloud affirme avoir traité ces quatre points dans une seule pile, et pouvoir le faire parce qu'il maîtrise le silicium. C'est une promesse plus difficile à égaler pour un concurrent, et plus facile à vérifier pour un client, car le résultat apparaît à trois endroits qu'une équipe achats mesure déjà : le coût par million de tokens, le taux d'échec des exécutions longues et la part du temps GPU qui fait réellement du travail.
Pourquoi l'infrastructure est le sujet, et non les modèles
L'affirmation intéressante qui ressort des discussions chinoises de cette année sur les agents est que la capacité des modèles a convergé et que la valeur s'est déplacée vers ce qui les entoure. Un professeur de pratique de la Shanghai Advanced Institute of Finance a donné la version économique de l'argument lors d'un forum à Shanghai en septembre : contrairement aux plateformes internet, où le coût marginal tend vers zéro et où les effets de réseau sont puissants, un grand modèle consomme des ressources à chaque inférence, et un utilisateur peut changer de modèle en quelques minutes. Un fossé concurrentiel bâti sur le seul modèle reste étroit.
Si cette lecture est juste, la couche défendable est celle qu'il est coûteux de déplacer, autrement dit les tokens, la mémoire, l'ordonnancement et la sécurité plutôt que les poids.
Dans cette grille de lecture, l'avantage de Huawei est vertical. L'entreprise possède la puce, l'interconnexion, le cloud et la plateforme de modèles, ce qui explique pourquoi l'annonce de l'Ascend 950 met en avant le temps de reprise et le débit de tokens plutôt qu'un rang dans un classement. Les concurrents dépourvus d'une activité de puces vendent une histoire d'intégration, et les histoires d'intégration sont plus faciles à copier.
L'objection est qu'être intégré fait aussi de vous un point de défaillance unique, et que les entreprises veulent de plus en plus une couche d'agents portable plutôt que taillée à la mesure d'un fournisseur. C'est cette tension que testeront les deux prochains trimestres, à commencer par la date de commercialisation du 30 septembre en Chine et le lancement à l'international fin novembre. L'échéance internationale compte davantage que la nationale, car une pile construite autour de silicium national doit prouver qu'elle peut servir un client dont les données ne peuvent pas quitter sa propre juridiction.
Articles associés
Xiaomi publie un modèle omnimodal qui égale la frontière, recette d'entraînement comprise
Les poids permettent d'exécuter un modèle. Les environnements permettent de le réentraîner.
Cadence intègre des agents à la conception de puces et ramène un cycle de vérification de cinq semaines à un jour
Les agents appellent donc davantage les moteurs sous-jacents, et non moins.
Roblox Build a publié 9 000 jeux en six semaines. Le chiffre intéressant, c'est 71
Lisez ce chiffre comme un chiffre de recrutement, non comme un indicateur de qualité.
Deux agents sont passés en production en septembre. Voici ce qu'ils avaient en commun
Les agents qui ont survécu au contact de la production en septembre sont ceux qui se sont intégrés à un processus existant.