Alibaba met ses grands modèles dans ses propres puces : le Zhenwu V900 triple les performances, Qwen 4 déjà en entraînement

Fin septembre, lors de la conférence Yunqi à Hangzhou, Alibaba a réuni trois choses sur la même table : une nouvelle puce, une version de modèle en cours d'entraînement et une facture de centres de données à l'horizon 2032. Les années précédentes, ce type de conférence mettait généralement les modèles à l'honneur ; cette année, c'est le silicium qui a été réellement évoqué à maintes reprises.
T-Head, filiale d'Alibaba, a dévoilé la puce d'IA Zhenwu V900, conçue pour l'entraînement et l'inférence. Selon la version officielle, sa puissance de calcul est trois fois supérieure à celle de la Zhenwu M890, avec 216 Go de mémoire vive et une bande passante d'interconnexion inter-puces de 1200 Go/s, ainsi qu'un support natif des formats basse précision FP8 et FP4. La Zhenwu M890 n'a été lancée qu'en mai dernier, soit seulement quatre mois plus tôt. La V900 ne sera produite en série et commercialisée qu'au premier trimestre 2027 ; ce qui est donc présenté sur scène reste une fiche technique, et non un produit disponible à la commande.
Ce qui mérite vraiment l'attention, c'est le mode d'interconnexion sous-jacent. T-Head a doté la V900 de sa puce d'interconnexion maison ICNSwitch, qui repose sur la sémantique mémoire et l'adressage mémoire unifié, et permettrait à des milliers de V900 de fonctionner de concert comme une « super-puce ». Dans le serveur super-nœud présenté en parallèle, outre la V900, sont également intégrés la carte réseau intelligente et le contrôleur SSD de la maison, avec la volonté de maîtriser le calcul, le stockage et le réseau. Selon les informations communiquées par Alibaba, un seul cluster peut s'étendre à une échelle de 500 000 accélérateurs.

Alibaba dispose déjà d'une série de charges de travail réelles. Les super-nœuds basés sur la Zhenwu M890 ont déjà fait tourner des modèles de plus de 2 000 milliards de paramètres tels que Qwen3.8 et Kimi K3, et les puces de la série Zhenwu ont servi au total plus de 650 entreprises clientes, couvrant des secteurs comme la conduite intelligente, la finance, l'énergie et la fabrication. Ces chiffres expliquent pourquoi Alibaba ose afficher un objectif de 500 000 accélérateurs pour la génération suivante de clusters.
Du côté des modèles, le mouvement est plus direct. Alibaba confirme que Qwen 4 est déjà en cours d'entraînement, et que les tailles cibles de Qwen 4.5 et Qwen 5 se situent entre 5 000 et 10 000 milliards de paramètres. À titre de référence, le Qwen3.8-Max, actuellement le plus puissant d'Alibaba, compte 2 400 milliards de paramètres. L'augmentation du nombre de paramètres et celle de la taille des clusters sont les deux faces d'une même pièce : sans suffisamment de cartes, le cycle d'entraînement de modèles à l'échelle du billion de paramètres s'allonge au point de perdre tout sens.
Alibaba Cloud vise une infrastructure mondiale de centres de données dépassant 20 GW d'ici 2032, et prévoit d'ouvrir trois nouvelles régions en Turquie, en Finlande et aux Pays-Bas au cours de l'année à venir, tout en étendant ses capacités en Malaisie, en Allemagne, aux Émirats arabes unis et en France, entre autres. Présenter puces, modèles et cloud dans une même stratégie constitue le fil conducteur le plus clair de cette conférence.
Des chiffres séduisants, mais une référence comparée à soi-même
Pour juger cette feuille de route, deux points de mesure méritent l'attention.
Premièrement, l'amélioration d'un facteur trois compare la V900 à sa propre M890, et non au Blackwell de Nvidia ni à une quelconque carte d'accélération tierce. La capacité de mémoire et la bande passante d'interconnexion ne se traduisent pas directement en débit d'entraînement réel, en latence d'inférence et en coût par token. Alibaba n'a pas non plus publié de résultats de tests indépendants de tiers.
Deuxièmement, l'écosystème logiciel. Le code d'entraînement des grands modèles mondiaux est longtemps écrit autour de CUDA, et les bibliothèques de pilotes, les conteneurs et les outils d'orchestration reposent sur des années d'accumulation. Migrer une charge de travail fonctionnant sur plateforme Nvidia vers une nouvelle puce a un coût qui ne se lit souvent pas dans les caractéristiques matérielles, mais dans les semaines passées par les ingénieurs à modifier le code et à ajuster les performances. Alibaba n'a pas précisé cette fois la difficulté de migration entre la V900 et la chaîne d'outils Nvidia existante, ni publié de tarifs, de types d'instances disponibles ou de prise en charge régionale.
Ce n'est pas un problème propre à Alibaba. La capacité de production des procédés avancés, le rendement et la performance par watt sont autant de contraintes concrètes auxquelles les puces développées en interne en Chine doivent faire face. La portée de la Zhenwu V900 réside davantage dans le fait d'avoir fait progresser d'un pas la question du « peut-on les fabriquer soi-même » que dans une égalisation sur un point précis.
Pourquoi maintenant
Le moment mérite d'être examiné en détail. Ces deux dernières années, les restrictions américaines sur l'exportation de GPU avancés vers la Chine n'ont cessé de se durcir, contraignant les fournisseurs de cloud chinois à accélérer leurs investissements dans des accélérateurs maison. Alibaba, Huawei, ainsi que des acteurs plus petits comme Enflame et Iluvatar CoreX, poussent tous dans la même direction. À la même période, des reports indiquaient que Huawei accélérait également le calendrier de lancement de sa prochaine génération de puces d'IA. Les deux entreprises tiennent à peu près le même discours public : remplacer la place de Nvidia sur le marché chinois avant d'être davantage bloquées par les règles.
Pour Alibaba elle-même, le silicium maison présente un double bénéfice. D'une part, réduire son exposition aux fluctuations de la politique américaine, afin que la planification de la puissance de calcul ne dépende plus des aléas des règles d'exportation ; d'autre part, conserver en interne la part de profits liée aux puces et au cloud historiquement captée par Nvidia.
Si l'on ne regardait que les annonces de modèles, on croirait que cette manche de la compétition se joue encore à qui a le plus de paramètres et le meilleur score. En considérant ensemble puces, super-nœuds, régions cloud et feuille de route des modèles, le champ de bataille s'est en réalité déplacé au niveau du silicium et des salles de serveurs. Les modèles sont la façade ; c'est la capacité à fabriquer ses propres cartes, à constituer son propre réseau et à s'alimenter en électricité soi-même qui détermine la hauteur à laquelle ce bâtiment peut s'élever.
L'épreuve est à venir
Au cours des douze à dix-huit prochains mois, trois choses apporteront des réponses. La promesse de super-nœuds de 500 000 accélérateurs résistera-t-elle à l'épreuve de déploiements chez de vrais clients ? Qwen 4.5 et Qwen 5 parviendront-ils réellement à approcher l'échelle des 10 000 milliards de paramètres ? Et l'objectif de 20 GW de centres de données obtiendra-t-il les financements et l'électricité correspondants ?
Si ne serait-ce que la moitié de l'un de ces objectifs se réalisait, cela suffirait à montrer que la pile matérielle d'IA chinoise réduit son écart avec Nvidia. Cette réduction ne se traduira pas forcément par l'égalité sur un indicateur donné, mais plus probablement par l'échelle de déploiement elle-même. Alibaba a déjà fait ses annonces à Hangzhou ; le reste devra être tranché par les lignes de production et les compteurs électriques.
Articles associés
13 000 captures d'écran internes se sont retrouvées sur GitHub public, et aucun attaquant ne les y a mises
Un comportement par défaut, répété sur toute une flotte, est le résultat d'une politique.
Amazon veut que des investisseurs détiennent 8 milliards de dollars de puces Nvidia qu'il utilise toujours
Les compagnies aériennes relouent leurs avions depuis des décennies. La même idée s'applique désormais aux GPU.
OpenAI a relié une campagne d'extraction de raisonnement à des personnes liées à Moonshot AI
Le modèle est devenu l'oracle de déchiffrement de son propre raisonnement caché.
Le premier festival de films IA a versé 450 000 $ et donné une leçon sur la narration
Les films lauréats ont utilisé les outils pour servir une idée qui existait déjà.