L'étrange économie des puces IA : les nouveaux racks font baisser les coûts tandis que les anciennes puces deviennent plus chères

Deux choses se sont produites dans le monde du matériel d'IA en septembre, et elles semblent pointer dans des directions opposées. Nvidia a commencé à livrer ses tout nouveaux systèmes à l'échelle du rack aux grands fournisseurs de cloud, promettant une inférence nettement moins coûteuse. Dans le même temps, le prix de location de ses puces H100, vieilles de trois ans, a augmenté. Les deux sont vrais, et ensemble, ils expliquent quelque chose du fonctionnement réel de l'économie de l'IA.
Les nouveaux racks
Nvidia a confirmé que ses systèmes en rack Vera Rubin NVL144 sont livrés en volume, les premiers déploiements majeurs arrivant en ligne chez Microsoft, Google, Amazon et Oracle, et CoreWeave déclarant que ses premiers clusters Rubin seraient disponibles pour les clients avant la fin septembre. Il s'agit de la plus grande transition matérielle que l'industrie ait tentée, remplaçant la génération Blackwell qui a alimenté la majeure partie de l'entraînement des modèles de frontière ces deux dernières années.
L'architecture n'est pas une puce unique. Vera Rubin associe un CPU Vera à deux GPU Rubin par nœud et les relie de sorte qu'un rack entier agisse comme un seul grand processeur. La configuration NVL144 connecte 144 GPU Rubin répartis sur 72 nœuds dans un seul rack, avec pour la première fois de la mémoire HBM4 dans un système de production et environ 13 téraoctets par seconde de bande passante mémoire par GPU. Nvidia revendique environ 3,6 exaflops de performance d'inférence FP4 par rack, soit environ trois fois un rack Blackwell NVL72 comparable. Ce sont des chiffres en conditions idéales, et des estimations indépendantes prudentes situent le gain réel plutôt entre deux et deux fois et demie.
Le chiffre qui compte pour tous ceux qui sont en dehors du centre de données, c'est le coût par token. Les premiers tarifs cloud suggèrent que les instances basées sur Rubin pourraient être 30 à 40 % moins chères que l'inférence Blackwell au lancement, les prix ayant tendance à baisser encore à mesure que la capacité augmente. Ce chiffre se répercute en aval sur le prix d'un appel API, le montant d'un abonnement et la possibilité d'une fonctionnalité de génération vidéo dans une offre à vingt dollars.
Les anciennes puces devenues plus chères
Voici la partie contre-intuitive. En septembre, le prix de location horaire de la H100, la puce qui a alimenté la première vague de produits d'IA, a augmenté de 22 % pour atteindre 3,28 dollars de l'heure. Le directeur général de Nvidia a cité cette hausse comme preuve que le calcul est un actif durable, générateur de revenus, plutôt qu'un élément qui se déprécie selon un calendrier.
La raison tient à l'offre. Les nouvelles puces Blackwell et Rubin sont réservées aux plus gros acheteurs, ce qui laisse les anciens clusters H100 prendre en charge les charges d'inférence quotidiennes. La tension sur l'électricité et la mémoire dans les centres de données maintient le matériel plus ancien occupé et les prix de location élevés. La H100 reste bien moins chère qu'à son lancement, lorsque les grands acteurs du cloud la louaient entre sept et huit dollars de l'heure, mais la récente hausse va à l'encontre de la comptabilité standard, qui amortit la valeur des puces sur cinq à six ans.
Cet écart a attiré l'attention. Des vendeurs à découvert ont soutenu que la durée de vie réelle des puces est plus courte que ne le supposent les calendriers officiels, ce qui signifierait que l'amortissement dans les comptes des fournisseurs de cloud est trop lent. Nvidia a publié en août un chiffre d'affaires trimestriel record de 96,2 milliards de dollars, et la hausse du prix de location offre à l'entreprise un nouvel argument : ses puces continuent de générer des revenus bien après avoir été neuves.
La course à l'échelle des nouveaux racks
La rapidité du déploiement en dit autant que les spécifications. CoreWeave est devenu le premier fournisseur de cloud à exploiter le nouveau matériel à l'échelle de plusieurs racks, mettant en service sept racks Vera Rubin NVL72, soit 504 GPU au total, comme un seul cluster de production réparti sur deux régions le 16 septembre. Le passage d'un rack unique validé à une fabrique multi-racks compte parce que les charges de travail d'IA agentique génèrent de nombreux appels courts et sensibles à la latence, et que les délais s'accumulent au fil des interactions répétées avec les modèles et les outils. Chaque rack NVL72 associe 72 GPU à 36 CPU Vera, et la conception de la fabrique prend en charge environ 128 000 GPU par rail sans refonte, ce qui signifie qu'ajouter de la capacité est un changement de configuration plutôt qu'une reconstruction.
Le schéma d'approvisionnement semble également différent cette fois. Avec la génération Blackwell, la demande dépassait tellement l'offre que les petits fournisseurs de cloud et les programmes nationaux d'IA attendaient six mois ou plus. Nvidia a accéléré plus tôt la production de Rubin, et plusieurs projets d'IA souverains en Europe et au Moyen-Orient figureraient dans la première vague de livraisons plutôt que dans la troisième. Nvidia a aussi annoncé un partenariat avec des opérateurs australiens de cloud et de centres de données pour construire jusqu'à deux gigawatts de capacité d'usine d'IA d'ici 2027. Si cela se confirme, louer du temps de GPU devient sensiblement plus facile, ce qui tire toute la courbe des coûts vers le bas pour tous les acteurs en aval.
Pourquoi les deux choses sont vraies
L'apparente contradiction se résout dès que l'on sépare l'entraînement de l'inférence. L'entraînement exige les clusters les plus récents et les plus grands, et c'est cette demande qui justifie la construction de racks comme Vera Rubin. L'inférence, c'est tout ce qu'un modèle fait après son entraînement : chaque réponse de chatbot, chaque image générée, chaque suggestion de code. À mesure que l'usage croît, le coût récurrent de traitement de ces requêtes peut devenir supérieur à la facture d'entraînement initiale.
C'est pourquoi Nvidia ouvre une partie de son écosystème plutôt que de défendre chaque socket. Le 10 septembre, l'entreprise a annoncé une collaboration avec d-Matrix, une startup qui conçoit des puces spécifiquement pour l'inférence. Aux termes de l'accord, les puces Raptor de nouvelle génération de d-Matrix se connecteront à l'architecture de rack de Nvidia via NVLink Fusion. Raptor est conçue pour l'inférence d'IA, en particulier les tâches à faible latence comme les chatbots, les assistants de code et les agents vocaux, avec une conception centrée sur la mémoire destinée à réduire la latence et le coût. Nvidia ne renonce à rien de ce qu'elle possédait entièrement, puisqu'elle fournit toujours les CPU, le réseau, les commutateurs et les logiciels autour du rack, tout en gagnant une place sur le marché de l'inférence même si elle ne remporte pas tous les accélérateurs.
Il y a une contrainte plus dure sous tout cela. Un seul rack Vera Rubin NVL144 consomme environ 600 kilowatts, soit à peu près la puissance de 500 foyers moyens. L'électricité, et non les puces, devient la limite contraignante de la croissance de l'IA, ce qui explique pourquoi Microsoft, Google et Amazon ont tous signé des accords d'approvisionnement en énergie nucléaire et géothermique au cours de l'année écoulée pour alimenter des clusters comme ceux-ci. Si vous voulez savoir où va la capacité d'IA, surveillez les contrats d'achat d'électricité plutôt que les scores de benchmarks.
Ce que cela signifie pour le prix de l'IA
Pour les utilisateurs, la lecture pratique est que le coût d'exécution d'un modèle devrait continuer de baisser, même si le coût du matériel le plus récent reste élevé. Une inférence moins chère permet à des fonctionnalités trop coûteuses l'an dernier de devenir la norme cette année. Les réponses longues et soignées des chatbots, les assistants de code qui lisent toute une base de code et la génération vidéo à la demande dépendent tous de cette courbe des coûts qui s'infléchit à la baisse.
La question que les investisseurs ne cessent de poser est de savoir si les énormes dépenses en centres de données finiront par être rentabilisées. Rubin fait partie de la réponse. Si le même modèle devient environ deux fois moins cher à exécuter tous les dix-huit mois environ, ces dépenses commencent à ressembler moins à une bulle et plus à de l'infrastructure. Si cette courbe stagne, les sceptiques auront leur moment. Les deux prochains trimestres de tarification cloud diront dans quel sens cela va, et ce chiffre vous parviendra bien avant n'importe quel benchmark, sous la forme du prix de vos outils d'IA.
Articles associés
Salesforce paie 2 milliards de dollars pour une entreprise qui interroge vos clients à votre place
Les entretiens sont des preuves. Les jumeaux numériques sont une prédiction. La ligne de partage entre les deux est le test.
AMD rachète World Labs de Fei-Fei Li pour 8,2 milliards de dollars afin de s'approprier l'IA physique
AMD achète un laboratoire de recherche, et le paie au prix d'un fabricant de puces.
Google a mis un TPU en orbite et commence à calculer le coût des centres de données spatiaux
Une puce fonctionnelle prouve que le voyage est survivable. Elle ne dit presque rien de la rentabilité.
Quelqu'un a catalogué 13 000 façons dont l'écriture IA se trahit
Les signes révélateurs n’ont pas disparu. Ils ont migré vers un endroit plus difficile à voir.