La puce mémoire est désormais le goulot d'étranglement du calcul IA

L'événement le plus révélateur du mois dans le matériel d'IA n'était pas un lancement, mais une réunion : la directrice générale d'AMD, Lisa Su, s'entretenant en personne avec le patron de la division semi-conducteurs de Samsung. Quand deux dirigeants de ce niveau se rencontrent, le sujet sur la table est rarement un partenariat marketing. C'est l'approvisionnement.
Ce dont ils discutaient, selon Bloomberg, c'est la mémoire à haute bande passante. La HBM est la mémoire empilée qui se trouve à côté d'un accélérateur d'IA et lui fournit des données assez vite pour garder le silicium occupé. Elle est produite par trois entreprises, SK Hynix, Samsung et Micron, et SK Hynix détient actuellement la part dominante de l'offre de HBM3E utilisée par Nvidia. Si vous voulez comprendre pourquoi le calcul IA est rare, la réponse tient de moins en moins aux puces logiques et de plus en plus à qui sait empiler la mémoire de manière fiable et à grande échelle.
Pourquoi la HBM détermine le nombre d'unités expédiées
Un accélérateur d'IA n'est utile qu'à la mesure de la bande passante mémoire qui l'accompagne. La génération de tokens est gourmande en mémoire : le système lit de manière répétée les poids du modèle et le cache clé-valeur, de sorte que la SRAM embarquée et la localité mémoire comptent davantage que la densité de calcul brute. C'est pourquoi le chiffre de FLOPS affiché d'une puce en dit moins sur le coût d'inférence que sa configuration mémoire, et pourquoi la feuille de route de Nvidia elle-même s'est orientée vers une bataille sur la capacité mémoire et la gestion thermique.
Le problème de Samsung illustre l'enjeu. L'entreprise a été confrontée à des rendements HBM qui ont retardé sa qualification pour la chaîne d'approvisionnement de Nvidia. Pour AMD, approfondir la relation est une couverture. Si elle parvient à sécuriser une allocation préférentielle de HBM Samsung, sa feuille de route de la série MI obtient un argument concurrentiel qui ne dépend pas du même fournisseur que son rival a déjà accaparé.
Les spécifications montrent à quel point la mémoire est devenue l'essentiel. Le MI450 d'AMD utilise l'architecture CDNA 5 sur le processus 2 nm de TSMC et embarque jusqu'à 432 gigaoctets de HBM4 par puce. Ce chiffre a un poids réel : c'est la différence entre exécuter un grand modèle de mélange d'experts sur un seul accélérateur et devoir le répartir sur plusieurs, ce qui multiplie à la fois la facture matérielle et la complexité réseau.
Pourquoi c'est l'inférence, et non l'entraînement, qui alimente la tension
L'entraînement attire l'attention, mais c'est l'inférence qui fixe la demande de mémoire. Les cycles d'entraînement sont des projets finis qui se terminent, tandis que l'inférence tourne indéfiniment et évolue avec le nombre d'utilisateurs. Générer un token exige de lire depuis la mémoire les poids du modèle et le cache clé-valeur, et ce cache croît avec la longueur du contexte : une longue conversation coûte donc plus de mémoire par utilisateur qu'une courte. Les analystes qui estiment qu'un utilisateur d'IA consomme environ cinq fois plus de tokens qu'un utilisateur d'un service ordinaire décrivent une machine qui doit conserver bien plus d'état par personne.
La réponse de l'industrie de l'architecture est la désagrégation : séparer le prétraitement (prefill), qui traite le prompt, du décodage (decode), qui génère les tokens, afin que chacun tourne sur un matériel adapté à son profil. AMD et Cerebras travailleraient, selon certaines informations, sur un appariement combinant un traitement à haut débit et une génération à faible latence. Cela aide au niveau du rack et ne change rien à l'approvisionnement des puces mémoire dont les deux moitiés ont besoin. Tant que les rendements d'assemblage ne s'améliorent pas chez les trois fournisseurs, chaque astuce architecturale apporte de l'efficacité sans desserrer la contrainte.
AMD a franchi les mille milliards de dollars sur des commandes de matériel
La nouvelle commerciale est arrivée dans la même fenêtre. AMD a clôturé à un record de 633,91 dollars le 2 octobre, portant sa capitalisation boursière au-dessus de mille milliards de dollars et affichant une progression de plus de 180 % sur l'année. Le rallye a une cause précise, et non un motif de sentiment. OpenAI s'est engagé sur un déploiement de six gigawatts, multi-générations, centré sur le MI450, avec un déploiement débutant au second semestre 2026 et un bon de souscription permettant l'achat de jusqu'à 160 millions d'actions AMD lié à des jalons. Oracle s'est joint comme partenaire de lancement d'un supercluster utilisant 50 000 GPU MI450 à partir du troisième trimestre.
Lisez la structure et cela ressemble moins à une commande de puces qu'à un montage financier. Un bon de souscription lié à des jalons de déploiement donne à l'acheteur une participation au capital dans le succès du fournisseur, ce qui est une manière d'aligner les incitations quand les volumes sont assez importants pour inquiéter les deux parties. Nvidia mène un jeu parallèle, prévoyant au moins 10 gigawatts de ses propres systèmes pour OpenAI, avec un investissement potentiel pouvant atteindre 100 milliards de dollars. La dynamique à deux fournisseurs n'est plus une stratégie d'approvisionnement. C'est une structure de coentreprise.
Le trimestre de Micron et l'argument du supercycle
Les résultats de la mémoire ont donné le même signal, de l'autre côté. Les résultats trimestriels de Micron ont largement dépassé les attentes grâce à la demande de HBM et de DRAM portée par l'IA, et plusieurs institutions ont décrit ce moment comme le début d'un supercycle de la mémoire plutôt qu'un pic. Un argument à l'appui est la consommation. Les analystes qui suivent les charges de travail d'inférence estiment la consommation de tokens par utilisateur d'IA à environ cinq fois celle d'un humain naviguant sur un service normal, ce qui replace la mémoire non plus comme un coût de composant mais comme un coût d'exploitation par utilisateur.
Cela compte pour la façon dont la pénurie se résoudra. La capacité de logique peut être ajoutée en construisant des usines, ce qui prend quelques années. La capacité HBM est plus difficile, car elle dépend de l'assemblage avancé et de rendements d'empilement qu'un petit nombre de fournisseurs a appris à maîtriser. Les difficultés de rendement de Samsung ne sont pas tant un échec de gestion qu'une preuve de l'étroitesse de la base de compétences. Ajouter un troisième fournisseur qualifié est un projet pluriannuel, et la courbe de la demande n'attend pas.
La version de bureau de la même histoire
La contrainte se manifeste aussi dans des formats plus petits. Le GB300 Blackwell Ultra de Nvidia a démontré plus de 2,2 milliards de tokens par jour lors de tests en configuration de bureau avec un réseau à 800 Gbps, un chiffre frappant pour une machine qui tient sous un bureau. C'est aussi une machine dont le prix est en partie déterminé par la quantité de mémoire qu'on peut y loger. La même physique qui plafonne une baie de centre de données plafonne une station de travail.
La réponse à plus long terme sur laquelle misent les fournisseurs est architecturale. La plateforme Vera Rubin de Nvidia, dévoilée au CES, associe des GPU Rubin à des CPU Vera, une mise en réseau à montée en charge NVLink et une pile logicielle complète, et l'entreprise pousse vers des indicateurs comme les tokens par seconde par watt plutôt que les FLOPS bruts. Elle a également ouvert son interconnexion via NVLink Fusion, permettant aux partenaires d'intégrer leurs propres CPU et silicium. Un effort de contrôleur mémoire personnalisé serait également en cours, signe que l'entreprise s'attend à ce que l'approvisionnement en mémoire reste une variable stratégique plutôt qu'une marchandise achetée sur étagère.
Ce qu'il faut surveiller
Trois éléments décideront si la contrainte mémoire s'atténue ou se durcit d'ici 2027. Le premier est le calendrier de qualification de Samsung pour la HBM4 auprès d'AMD comme de Nvidia, car un troisième fournisseur véritablement qualifié modifie la dynamique des prix plus que n'importe quel lancement de produit. Le deuxième est de savoir si Micron comble l'écart en tant qu'alternative, ce qui soulagerait les deux fournisseurs coréens. Le troisième est de savoir si l'inférence désagrégée, où le traitement du prompt et la génération de tokens tournent sur des types d'accélérateurs différents, devient assez courante pour réduire la pression mémoire sur une puce donnée.
Aucun de ces éléments ne se résoudra rapidement. En attendant, la lecture pratique pour quiconque achète ou construit sur le calcul IA est que la mémoire, et non le calcul, est le chiffre qui fera bouger vos coûts. La feuille de route de la logique est publique et prévisible. La feuille de route de la mémoire est conditionnée par les rendements d'assemblage, une base de compétences qui se construit sur des années et les plans d'investissement de trois entreprises, et c'est elle qui détermine combien d'accélérateurs sont réellement expédiés.
Articles associés
La musique IA a obtenu une licence. Voici ce qu’elle couvre réellement.
Les morceaux bon marché existent toujours. Ce qui disparaît, c’est l’hypothèse qu’un morceau généré à partir d’un prompt est exempt de revendications, ce qui n’a jamais été vrai et est désormais manifestement faux.
Les studios de Hengdian sont vides tandis que le pipeline de films IA d'Asie tourne à plein
Les plateaux vides de Hengdian sont la preuve que l'industrie a déjà posé son pari, que le public soit d'accord ou non.
Google achète 890 mégawatts de nucléaire pour alimenter ses centres de données
La puissance de calcul est disponible. L'électricité est ce qui doit être organisé, des années à l'avance, comme on organise une chaîne d'approvisionnement.
Meta a réglé le litige sur les livres. La permission a désormais un prix.
Le règlement de Meta retire un point de repère de la carte. Il ne dessine pas le reste, et les prochains accords détermineront si la permission devient un marché ou reste une série d'exceptions.