Trois accords en trois jours ont fait passer Nvidia du statut de choix par défaut à celui d’une option parmi d’autres

Le 2 octobre, Amazon et Synopsys ont annoncé un partenariat pluriannuel d’une valeur de plus d’un milliard de dollars qui accorde à Amazon des licences exclusives sur les outils de conception de puces accélérés par IA de Synopsys. Le même jour, des rapports ont décrit OpenAI déployant des processeurs ASIC Jalapeno aux côtés de CPU AMD EPYC Turin dans des configurations à l’échelle du rack, contournant les puces agentiques hautes performances de Nvidia. Le 3 octobre, General Compute a signé un accord pluriannuel visant à intégrer les processeurs à l’échelle du wafer de Cerebras dans son cloud GPU.
Trois entreprises distinctes, trois voies différentes, une même direction. Les plus grands acheteurs de calcul IA construisent ou achètent des alternatives au fournisseur qui a fourni la quasi-totalité de l’offre.
Rien de tout cela ne signifie que Nvidia perd. Cela signifie que le marché n’est plus approvisionné par un fournisseur unique, et c’est un autre type de risque.
Amazon achète l’outillage derrière la puce
L’accord avec Synopsys est le moins spectaculaire et peut-être le plus lourd de conséquences. Amazon conçoit déjà ses propres puces, notamment les gammes Trainium et Inferentia. Posséder les outils de conception est un pas de plus en amont. Les logiciels de conception de puces déterminent la vitesse à laquelle une entreprise peut itérer, et l’accès exclusif à des outils de conception accélérés par IA raccourcit la boucle entre une idée et un composant testable.
L’exclusivité est le maître mot. Si Amazon détient des licences que ses concurrents ne peuvent pas obtenir, ses cycles de conception internes se cumulent plus vite que les leurs. Cet avantage ne repose pas sur une puce en particulier. Il repose sur le nombre de générations qu’Amazon peut produire pendant qu’un rival en produit une.
Cette approche a un coût. Concevoir des accélérateurs en interne implique de maintenir une pile logicielle, un compilateur et un ensemble de bibliothèques que les développeurs doivent adopter. Le véritable fossé défensif de Nvidia n’a jamais été le silicium seul. C’est CUDA, des années d’outillage construit par-dessus, et l’habitude qu’ont les ingénieurs de se tourner d’abord vers Nvidia. Le milliard de dollars d’Amazon achète de la vitesse de conception. Il n’achète pas cette habitude.
OpenAI contourne délibérément le haut de gamme
Le déploiement de Jalapeno par OpenAI est plus ciblé. Associer des ASIC personnalisés à des CPU AMD EPYC Turin à l’échelle du rack signifie qu’OpenAI n’attend pas la prochaine puce hautes performances de Nvidia. Il assemble de la capacité d’inférence à partir de composants qu’il peut s’approvisionner selon ses propres conditions.
Pour l’inférence, c’est un pari raisonnable. L’entraînement d’un modèle de pointe exige l’interconnexion la plus rapide et les plus grands pools de mémoire, et c’est là que les puces haut de gamme de Nvidia justifient leur prix. Servir un modèle fini à des millions d’utilisateurs est une charge de travail différente, qui récompense davantage le coût par token que la performance brute de pointe. Si un ASIC personnalisé associé à un CPU généraliste peut servir le même trafic à moindre coût, les économies augmentent avec le volume.
OpenAI dispose à la fois du trafic et des effectifs d’ingénierie pour justifier l’investissement. Il a aussi une raison au-delà du coût. Toute dépendance à un fournisseur unique donne à ce fournisseur de l’influence, et aucun laboratoire ne veut que sa feuille de route soit dictée par les décisions d’allocation de quelqu’un d’autre.
Cerebras trouve un canal de distribution
L’accord avec General Compute est le signe le plus clair que les alternatives passent de la recherche à la commercialisation. Cerebras construit des processeurs à l’échelle du wafer, réellement différents d’une baie de GPU. Les intégrer à une plateforme cloud GPU signifie que les clients qui louent déjà du calcul peuvent sélectionner une instance Cerebras comme ils sélectionnent n’importe quel autre type de machine.
Cela compte parce que l’adoption pose un problème de distribution. Un meilleur accélérateur qu’on ne peut pas louer à l’heure reste un projet de recherche. Un accélérateur moins performant qui apparaît dans un menu déroulant est une activité commerciale. General Compute fournit le menu déroulant.
La question de savoir si le silicium à l’échelle du wafer s’impose sur des charges de travail réelles reste ouverte. L’important est que la capacité d’inférence n’a plus besoin de provenir de la gamme d’un seul fournisseur pour atteindre les clients.
Pourquoi le fossé logiciel est plus difficile à acheter
Toute entreprise qui développe un accélérateur alternatif se heurte au même mur, et il n’est pas fait de silicium. L’avantage de Nvidia repose sur une pile de bibliothèques, de compilateurs et d’outils de débogage que les développeurs connaissent déjà. Réécrire un script d’entraînement pour un nouvel accélérateur est une tâche d’un week-end. Réécrire tout un système de production, reformer une équipe et accepter une période de moindres performances est une décision qui doit être justifiée auprès de quelqu’un.
C’est pourquoi les trois accords portent sur différentes couches. Amazon achète de l’outillage de conception, ce qui réduit le coût de production des composants. OpenAI déploie du silicium d’inférence, où la surface logicielle est plus étroite que pour l’entraînement. General Compute ajoute une option au menu, afin que les clients puissent essayer une alternative sans s’engager dans une migration.
La voie la plus probable pour les challengers n’est pas de remplacer l’acteur en place pour l’entraînement. C’est de gagner l’inférence, où les charges de travail sont plus standardisées et où le coût par token est plus facile à mesurer. Une fois qu’un grand volume d’inférence tourne sur des alternatives, l’outillage qui les entoure s’améliore, et l’écart se réduit pour la génération suivante.
Il existe un parallèle historique utile. Linux n’a pas détrôné Unix sur le poste de travail, et il n’en avait pas besoin. Il a gagné les serveurs, où la charge de travail était standardisée et où l’acheteur se souciait du coût par unité de travail. Un écosystème de challengers n’a besoin que d’une seule catégorie de charges de travail pour s’établir avant de pouvoir s’étendre aux autres.
Le schéma est hétérogène, pas anti-Nvidia
Si l’on réunit les trois mouvements, la stratégie n’est pas de remplacer Nvidia. Elle consiste à cesser de dépendre d’une seule courbe d’approvisionnement. Amazon veut de la vélocité de conception. OpenAI veut une économie de l’inférence. General Compute veut un menu différencié. Chaque acheteur optimise pour une contrainte différente, et aucun ne cherche à gagner un benchmark.
C’est ainsi que se comportent les marchés du calcul arrivés à maturité. Les mainframes, x86, puis le mobile se sont tous fragmentés à mesure que les volumes augmentaient et que les acheteurs gagnaient du pouvoir de négociation. Le marché des accélérateurs IA a atteint ce point, et la fragmentation se manifeste dans les achats plutôt que dans les annonces de produits.

Pour Nvidia, l’implication n’est pas une perte de part de marché dès demain. C’est que les prix et les allocations seront négociés plutôt qu’acceptés. Quand un client peut affirmer de manière crédible qu’il dispose d’une alternative fonctionnelle, la conversation change.
Ce qu’il faut surveiller
La question de savoir si les outils de conception d’Amazon produisent des composants que les développeurs externes veulent utiliser. L’exclusivité aide Amazon en interne. Une véritable alternative a besoin d’un écosystème externe, ce qui exige de la documentation, des compilateurs et de la patience.
La question de savoir si les baies Jalapeno d’OpenAI gèrent le trafic de production avec la fiabilité attendue par ses utilisateurs. Le silicium personnalisé est facile à annoncer et difficile à exploiter. Une seule panne très médiatisée ferait reculer d’un an la stratégie alternative.
La question de savoir si d’autres clouds suivent General Compute et référencent des accélérateurs non GPU. La distribution est le goulot d’étranglement de chaque challenger, et chaque vitrine supplémentaire facilite la suivante.
Le détail intéressant, c’est le timing. Ces trois accords sont tombés à environ 72 heures d’intervalle, émanant d’entreprises qui ne se coordonnent pas. Quand des acheteurs indépendants parviennent à la même conclusion dans la même semaine, cette conclusion reflète généralement un vrai changement des conditions sous-jacentes plutôt qu’une coïncidence.
L’approvisionnement en calcul vient de devenir une décision de portefeuille, un changement plus discret que n’importe quel lancement de puce et qui survivra à la prochaine génération de produits.
Articles associés
Le classement des modèles vidéo dont personne ne fait la promotion : où vont réellement les requêtes
Chaque semaine apporte un nouveau classement de génération vidéo, et presque tous sont construits de la même manière.
Ai2 met en open source la pile d'entraînement, pas un autre ensemble de poids
Les poids sont faciles à distribuer, mais difficiles à étudier.
Qwen3.8-Max d'Alibaba affirme pouvoir coder seul pendant une quinzaine de jours
Les décomptes de paramètres ne font plus l'actualité depuis un moment. Douze jours, voilà le chiffre qui mérite examen.
PixelUMM se débarrasse des deux composants dont dépend chaque modèle d'IA visuelle
La diffusion au niveau pixel a déjà été proposée et s'est heurtée à plusieurs reprises au coût de calcul.