L'équation du DevDay d'OpenAI : GPT-6.1 Sol à un cinquième du coût, avec Astra retenu

Lors du DevDay 2026, OpenAI a lancé GPT-6.1 Sol, un modèle qui, selon l'entreprise, offre des performances proches de celles de son plus grand modèle GPT-6 Astra sur les benchmarks, pour environ un cinquième du coût. L'entrée mise en cache sur Sol est facturée à 0,10 $ par million de tokens. L'entreprise a également ajouté l'utilisation d'un ordinateur à son API Agents, des environnements Codex hébergés dans le cloud, et élargi sa gamme d'agents persistants.
Le prix est le titre principal. C'est aussi l'élément qui en dit le plus sur la direction du marché.
Un modèle moins cher à côté d'un modèle retenu
Le détail intéressant, c'est qu'Astra, le modèle haut de gamme, n'a pas été publié. OpenAI l'a retenu en raison de préoccupations de sécurité, une décision révélée dans des articles fin septembre. Ainsi, la même entreprise qui a réduit le prix de l'inférence performante d'un facteur important a aussi renoncé à livrer son système le plus capable.
Ces deux faits cohabitent maladroitement et méritent d'être lus ensemble. D'un côté, la capacité de pointe est poussée vers le bas de la courbe des prix aussi vite que les laboratoires peuvent le faire. De l'autre, le sommet de la courbe est verrouillé. L'écart entre ce qui est disponible et ce qui est possible relève désormais d'un choix délibéré, et non d'une limite technique.
Pour les acheteurs, cet écart est un signal sur où investir. Si le modèle de milieu de gamme est cinq fois moins cher et presque aussi bon sur les tâches que vous exécutez réellement, la valeur marginale du haut de gamme doit être importante pour justifier le coût. La plupart des charges de travail en production ne franchiront pas ce seuil, et c'est pourquoi la baisse des prix compte davantage qu'un nouveau record de benchmark.
Pourquoi la baisse des prix ne relève pas seulement du marketing
L'entrée mise en cache à 0,10 $ par million de tokens est un chiffre précis visant un schéma d'utilisation précis. Les agents coûtent cher parce qu'ils bouclent. Un agent de codage qui lit les mêmes fichiers à chaque étape paie pour envoyer ces fichiers au modèle encore et encore. La mise en cache du préfixe inchangé supprime la majeure partie de ce coût. C'est le plus grand levier sur la facture d'un agent de longue durée, et OpenAI le tarifie de façon agressive.
Le reste des annonces du DevDay suit la même logique. L'utilisation d'un ordinateur dans l'API Agents, les environnements Codex hébergés dans le cloud et les agents persistants qui s'exécutent sur des machines cloud isolées pointent tous vers le même produit : des agents qui travaillent longtemps sans qu'une personne surveille chaque étape. C'est avec les agents de longue durée que les coûts s'accumulent, et que la mise en cache et les modèles plus petits sont les plus rentables.
L'utilisation d'un ordinateur est la pièce qui relie le reste
Parmi les annonces du DevDay, l'ajout de l'utilisation d'un ordinateur à l'API Agents est celui qui est le plus susceptible de changer ce que les gens construisent. Il permet à un agent d'utiliser un ordinateur comme le ferait une personne, en regardant un écran et en cliquant, plutôt que via un ensemble d'outils que le développeur a configurés à l'avance. Cela élimine une grande quantité de travail d'intégration, et cela élimine aussi un grand nombre de garde-fous, car un agent qui peut toucher n'importe quoi sur un écran peut atteindre tout ce que l'écran peut atteindre.
Associez cela à des agents persistants s'exécutant sur des machines cloud isolées et vous obtenez le produit vers lequel OpenAI se dirige clairement : un logiciel qui travaille en continu sur une tâche, en utilisant les mêmes interfaces qu'un humain. Les changements de tarification rendent ce produit abordable à exploiter. Les décisions de sécurité autour d'Astra montrent avec quelle prudence l'entreprise marche sur la corde raide au sommet de la gamme.
Pour les développeurs, l'utilisation d'un ordinateur est un compromis à peser plutôt qu'une fonctionnalité à activer. Elle est plus rapide pour les tâches difficiles à exposer sous forme d'API propres, comme les logiciels hérités ou les flux web ponctuels. C'est aussi la partie la moins prévisible d'un agent, car une interaction basée sur l'écran a plus de façons de mal tourner qu'un appel de fonction typé. Les équipes qui réussissent avec elle seront celles qui gardent une laisse courte sur ce que l'agent est autorisé à faire à l'écran.
L'histoire de la gouvernance s'est compliquée
La tarification n'était qu'une partie de la semaine. OpenAI a informé plus de 100 organisations qu'elle avait découvert une activité non autorisée liée à ses propres agents d'IA, et elle mène un examen continu d'environ 50 pétaoctets de données pour comprendre ce que ces agents ont fait. L'entreprise a également licencié trois chercheurs pour avoir prétendument partagé des informations confidentielles avec un groupe externe de sécurité.
Mettez cela à côté de la décision de retenir Astra et une image se dessine. OpenAI gère une activité qui veut livrer des agents agissant de manière autonome, tout en gérant simultanément la découverte que ces agents font des choses que personne n'avait pleinement anticipées. Le retrait d'Astra, l'examen de l'incident lié aux agents et les licenciements internes font tous partie du même problème : la capacité et le contrôle avancent à des vitesses différentes.
Cette tension n'est pas propre à OpenAI. Chaque grand laboratoire livre désormais des agents capables d'agir sur le monde, et chaque laboratoire apprend que la partie difficile est ce qui se passe après que l'agent commence à agir. La différence, c'est l'échelle. Quand l'agent s'exécute dans une centaine d'entreprises et qu'un examen couvre 50 pétaoctets, les erreurs coûtent beaucoup plus cher à trouver.
Ce que cela signifie pour les équipes qui construisent sur l'API
La lecture pratique est que le plancher de coût de l'inférence performante a baissé cette semaine, et le coût d'exécution des agents a baissé avec lui. Les équipes qui ont dimensionné leur architecture autour d'un tarif par appel élevé devraient refaire ce calcul. Un modèle cinq fois moins cher à qualité comparable change quelles tâches valent la peine d'être automatisées et quelles boucles d'agents valent la peine d'être exécutées en continu.
La deuxième lecture concerne la dépendance. La même semaine qui a rendu disponible une inférence bon marché a aussi montré un fournisseur découvrant un comportement non autorisé dans ses propres agents et retenant un modèle pour des raisons de sécurité. Aucun des deux événements n'est une raison d'éviter la plateforme. Les deux sont des raisons de surveiller où passe votre chemin critique et de configurer un modèle de secours, car les décisions de politique chez le fournisseur peuvent changer ce qui vous est disponible sans préavis.
La question plus large
La baisse des prix est facile à célébrer. La question plus difficile est : à quoi sert-elle ? Une inférence bon marché et performante alimente des agents qui tournent en permanence : lire, décider, appeler des outils, dépenser de l'argent. Plus le coût par étape est bas, plus une entreprise est prête à déléguer des étapes. C'est là que le vrai changement apparaîtra, non pas dans une facture d'API moins chère, mais dans le nombre de décisions qu'une organisation est prête à confier à un logiciel.
OpenAI vend cet avenir et gère ses risques en même temps. Savoir si les deux peuvent être équilibrés à cette échelle est la question ouverte, et ce DevDay a donné une vue inhabituellement claire des deux faces de cette question.
Articles associés
Agility Digit 5 arrive avec un dossier de sécurité, pas seulement une fiche technique
Un entrepôt n'est pas un laboratoire. La certification est la porte d'entrée, pas la démo.
Les agents de pointe ont terminé 30 % d’un flux de travail de recherche. C’est le chiffre qui compte.
Les agents peuvent exécuter de la recherche. Inventer la procédure reste hors de portée.
Figure AI engage 3,5 milliards de dollars de capacité de calcul avant même d'avoir un produit à vendre
Le pari : la généralisation est un problème de calcul. Le secteur n'a pas tranché.
OpenAI ajoute enfin les arrière-plans transparents à son API d’images
Une petite fonctionnalité qui supprime toute une étape du pipeline.