Claude Sonnet 5.5 est 30 % moins cher. C'est une histoire d'achats, pas une histoire de modèle.

Anthropic a publié Claude Sonnet 5.5 dans les premiers jours d'octobre 2026, environ une semaine après Opus 5.5 et moins d'un mois après Fable 5.1. Les chiffres mis en avant sont les suivants : il est environ 30 % plus rapide que son prédécesseur et jusqu'à 30 % moins cher pour la plupart des tâches. Son prix est identique à celui de Sonnet 5, soit 2 $ par million de tokens en entrée et 10 $ par million de tokens en sortie, avec les lectures de cache à 0,20 $, et il dispose d'une fenêtre de contexte d'un million de tokens. Anthropic en a fait le modèle Sonnet par défaut sur son API.
C'est une sortie mesurée. Aucune nouvelle frontière de capacités n'est revendiquée, aucun record de benchmark n'est établi et aucun changement n'est apporté à la grille tarifaire. Ce qui est intéressant, c'est ce pour quoi Anthropic dit que le modèle est conçu, et la manière dont il répartit le travail avec Opus.
La division du travail, voilà l'annonce
La propre description d'Anthropic trace une ligne entre les deux niveaux. Opus 5.5 est conçu pour les travaux complexes qui exigent un jugement minutieux. Sonnet 5.5 est le plus performant sur les tâches quotidiennes bien délimitées, la correction de bugs et la production de documents, de diapositives et de feuilles de calcul soignés. Haiku 5.5 est promis dans les semaines à venir.

C'est une affirmation produit plus précise qu'il n'y paraît. Pendant la majeure partie des deux dernières années, les sorties de modèles étaient décrites en fonction de ce qu'ils savaient faire de nouveau. Celle-ci est décrite en fonction de ce à quoi il est suffisamment fiable pour qu'on lui confie régulièrement du travail, et les exemples sont administratifs. Des documents, des diapositives, des corrections de bugs. Ce sont les tâches qui consomment le plus de tokens dans un compte d'entreprise, et ce sont celles où une réduction de coût de 30 % se cumule le plus vite.
Les chiffres d'Opus 5.5 soulignent eux-mêmes cette séparation. Il mène SimpleBench avec 88,4 % et devance Fable 5.1 sur Terminal-Bench 4.0, FrontierCode et CursorBench, tout en coûtant bien moins de la moitié du prix par token de Fable 5.1. Il passe de 24 % à 62 % sur Terminal-Bench-Science à mesure que l'effort de raisonnement augmente. C'est un modèle pour les cas difficiles. Sonnet 5.5 est le modèle que l'on place en dessous pour que les cas difficiles puissent se permettre d'être difficiles.
Le calendrier de la famille de modèles se remplit derrière tout cela. Opus 5.5 est sorti le 22 septembre. Sonnet 5.5 a suivi début octobre. Haiku 5.5 arrive. Anthropic livre désormais un niveau toutes les quelques semaines, ce qui signifie qu'un acheteur en entreprise fait face à un problème de cadence avant de faire face à un problème de capacités. Si vos schémas d'usage ont été calibrés sur Sonnet 5 en septembre, ils doivent être réévalués en octobre, puis de nouveau quand Haiku arrivera.
Pourquoi être moins cher compte plus qu'être plus intelligent
Le discours ambiant autour des modèles de pointe a tendance à récompenser les annonces de capacités. Les achats, eux, récompensent le coût par unité de travail, et Sonnet 5.5 est résolument une sortie pensée pour les achats.
Imaginez ce que produit une réduction de 30 % dans une entreprise qui fait tourner des workflows agentiques. Anthropic vend elle-même ce discours avec insistance. Claude for Government a atteint la disponibilité générale, couvrant les agences fédérales et étatiques américaines dans des environnements FedRAMP High. L'intégration de Claude Code et de Microsoft 365 est entrée en accès anticipé en parallèle. L'entreprise s'est aussi engagée à consacrer 100 millions de dollars à la formation de 10 000 ingénieurs sur sa propre stack d'ici fin 2027, via la Claude Frontier Academy.
Ce dernier point est révélateur. Constituer une main-d'œuvre certifiée et formée à vos outils, c'est la manière de s'assurer que les contrats signés cette année seront renouvelés, et c'est dans les conversations de renouvellement que le coût par tâche devient le chiffre décisif. Un modèle 30 % moins cher à grille tarifaire identique, positionné comme la valeur par défaut pour le travail bien délimité, donne à l'argumentaire commercial un élément concret à brandir quand un client fait ses calculs face à un concurrent.
Une seconde logique commerciale est à l'œuvre. Les modèles de la classe Sonnet sont là où se trouve le volume. Un modèle de pointe gagne la presse. Un modèle de trait gagne la ligne de consommation, et la capacité d'Anthropic à rendre ce cheval de trait 30 % moins cher sans toucher au prix affiché signifie qu'elle récolte des gains d'efficacité plutôt qu'elle ne consent une remise. C'est une position saine pour le fournisseur, et une raison pour les acheteurs de vérifier réellement cette affirmation sur leurs propres charges de travail plutôt que sur un benchmark général.
Ce que dit le classement du codage
Sonnet 5.5, GPT-6.1 Sol et Gemini 4 Argon occupent le haut du Coding Agent Index d'Anthropic pour le mois, ce qui constitue un instantané raisonnable et qu'il faut aussi manier avec prudence, puisqu'il s'agit de l'instrument du fournisseur lui-même. La tendance qui se dégage des trois est plus instructive que n'importe quel classement individuel. OpenAI a ramené GPT-6.1 Sol à environ 2 $ par million de tokens en entrée et 10 $ par million en sortie, proche des performances d'Astra pour le codage agentique, soit exactement le même point de prix qu'Anthropic maintient. Google a livré Gemini 4 Argon avec un plafond de sortie d'un million de tokens et un accès échelonné qui commence par des professionnels vérifiés de la cybersécurité.
Trois laboratoires ont convergé vers la même fourchette de prix pour le même travail à quelques semaines d'intervalle. Ce n'est pas une coïncidence, et cela vous dit où la concurrence s'est déplacée. Les agents de codage sont devenus la charge de travail commerciale la plus volumineuse pour les modèles de pointe, et dès qu'un laboratoire a fixé le prix d'un modèle quasi-frontière à 2 $ et 10 $, les autres ont dû s'aligner.
Le rythme de publication est un problème en soi
Le calendrier de publication d'Anthropic mérite un second regard, car il crée une difficulté qui n'a rien à voir avec la qualité des modèles.
Opus 5.5 est arrivé le 22 septembre. Sonnet 5.5 a suivi en une semaine et demie environ. Haiku 5.5 est promis dans les semaines à venir. Cela fait trois niveaux en un mois environ, et chacun arrive avec des points forts légèrement différents et une courbe de coût légèrement différente.
Pour un développeur seul qui expérimente, un rythme rapide est un cadeau. Pour une entreprise faisant tourner du trafic de production sur des centaines de workflows, c'est une obligation de maintenance. Chaque changement de modèle impose de réévaluer les modèles de prompt, de revérifier les formats de sortie, de relancer les suites de tests de non-régression et de revalider tout ce qui dépendait du comportement d'un modèle précis. Les équipes qui avaient adopté une politique d'épinglage à une version avec mise à niveau trimestrielle doivent désormais décider si une réduction de coût de 30 % vaut une migration imprévue en plein trimestre.
La même dynamique traverse tout le secteur. OpenAI a livré GPT-6.1 Sol avec une forte baisse de prix, Google a échelonné Gemini 4 Argon avec un accès restreint aux utilisateurs vérifiés, et Anthropic a répondu avec Sonnet 5.5. Un acheteur qui choisit un modèle en octobre 2026 choisit une cible mouvante, et la réponse des entreprises à cela est généralement l'abstraction : placer un routeur devant la couche de modèles, garder la logique propre à chaque fournisseur hors du code applicatif, et traiter tout modèle unique comme remplaçable. Cela représente plus de travail d'ingénierie au départ et bien moins de remous ensuite.
Ce qu'il faut réellement vérifier
Le chiffre de 30 % mérite une réserve. Les affirmations de remise des fournisseurs sont généralement mesurées sur une charge de travail représentative, et la vôtre ne l'est pas. La réduction provient d'un mélange d'inférence plus rapide, de moins de tokens par tâche et de lectures de cache moins chères, et la proportion de chacun varie énormément selon la façon dont vous formulez vos prompts. Un pipeline qui envoie des requêtes courtes et non mises en cache verra un chiffre différent d'un pipeline qui garde un long contexte résident d'un tour à l'autre.
La démarche pratique consiste à mesurer avant de supposer. Prenez une semaine de trafic représentatif, faites-le tourner sur les deux modèles, et comparez les tokens, la latence et la qualité de sortie sur les tâches qui comptent. La fenêtre de contexte d'un million de tokens est utile pour la même raison, et aussi facile à surconsommer, puisqu'un grand contexte qui n'est pas réutilisé est un contexte coûteux.
Personne n'écrira un article dithyrambique sur Sonnet 5.5. Il appartient à la catégorie des sorties qui changent un budget sans changer une manchette, ce qui, dans un compte d'entreprise, est le résultat le plus lourd de conséquences.
Articles associés
HPE vient de vendre 1,2 milliard de dollars de matériel parce que le réseau est devenu l'essentiel
Une commande de 1,2 milliard de dollars dont la répartition entre cinq catégories n'est pas divulguée n'équivaut pas à 1,2 milliard de marge.
Le malware qui soumet sa prochaine action au vote de quatre modèles
L'infrastructure de commande et contrôle se résume à une poignée d'API publiques et à un webhook Discord.
Shopify laisse les agents IA cliquer sur Acheter. Le marchand encaisse toujours le litige.
La plateforme d'agents négocie l'intention. Le marchand porte le risque.
Copier les prompts IA de quelqu'un d'autre, est-ce une contrefaçon ? Un jugement place les prompts hors du champ du droit d'auteur
Une recette n'est pas protégée, mais cela ne signifie pas que le plat réalisé avec cette recette ne l'est pas.