← Zurück zum Blog
Newsca. 7 Min. Lesezeit

Claude Sonnet 5.5 ist 30 Prozent günstiger. Das ist eine Beschaffungsgeschichte, keine Modellgeschichte.

Veröffentlicht 5. Okt. 2026
Claude Sonnet 5.5 ist 30 Prozent günstiger. Das ist eine Beschaffungsgeschichte, keine Modellgeschichte.

Anthropic hat Claude Sonnet 5.5 in den ersten Oktobertagen 2026 veröffentlicht, etwa eine Woche nach Opus 5.5 und weniger als einen Monat nach Fable 5.1. Die zentralen Zahlen: Es läuft rund 30 Prozent schneller als sein Vorgänger und kostet für die meiste Arbeit bis zu 30 Prozent weniger. Es ist identisch zu Sonnet 5 bepreist, mit 2 US-Dollar pro Million Input-Tokens und 10 US-Dollar pro Million Output-Tokens, Cache-Lesevorgänge zu 0,20 US-Dollar, und es hat ein Kontextfenster von einer Million Tokens. Anthropic hat es zum Standard-Sonnet-Modell in seiner API gemacht.

Das ist ein zurückhaltendes Release. Es wird keine neue Fähigkeitsgrenze reklamiert, kein Benchmark-Rekord aufgestellt und nichts am Preisblatt geändert. Interessant ist, wofür das Modell laut Anthropic gedacht ist und wie es sich die Arbeit mit Opus teilt.

Die Arbeitsteilung ist die eigentliche Ankündigung

Anthropics eigene Beschreibung zieht eine Grenze zwischen den beiden Stufen. Opus 5.5 ist für komplexe Arbeit gebaut, die sorgfältiges Urteilsvermögen erfordert. Sonnet 5.5 ist am stärksten bei klar abgegrenzten Alltagsaufgaben, dem Beheben von Fehlern und der Erstellung ausgefeilter Dokumente, Folien und Tabellen. Haiku 5.5 wird für die kommenden Wochen versprochen.

Eine polierte Messingwaage mit zwei leeren Waagschalen auf einem dunklen Holztisch

Das ist ein spezifischeres Produktversprechen, als es aussieht. In den meisten der vergangenen zwei Jahre wurden Modellveröffentlichungen danach beschrieben, was sie Neues können. Diese hier wird danach beschrieben, wofür sie gut genug ist, um routinemäßig damit betraut zu werden, und die Beispiele sind administrativ: Dokumente, Folien, Fehlerbehebungen. Das sind die Aufgaben, die innerhalb eines Unternehmenskontos die meisten Tokens verbrauchen, und die Aufgaben, bei denen sich eine Kostenreduktion von 30 Prozent am schnellsten aufsummiert.

Die eigenen Zahlen von Opus 5.5 unterstreichen die Aufteilung. Es führt SimpleBench mit 88,4 Prozent an und schlägt Fable 5.1 bei Terminal-Bench 4.0, FrontierCode und CursorBench, während es pro Token deutlich unter der Hälfte von Fable 5.1 liegt. Bei Terminal-Bench-Science steigt es von 24 Prozent auf 62 Prozent, wenn der Reasoning-Aufwand zunimmt. Das ist ein Modell für die harten Fälle. Sonnet 5.5 ist das Modell, das man darunterlegt, damit man sich die harten Fälle leisten kann.

Der Modellfamilien-Kalender füllt sich dahinter auf. Opus 5.5 wurde am 22. September ausgeliefert. Sonnet 5.5 folgte Anfang Oktober. Haiku 5.5 kommt. Anthropic liefert jetzt alle paar Wochen eine Stufe aus, was bedeutet, dass ein Unternehmenskäufer zuerst ein Kadenzproblem hat, bevor er ein Fähigkeitsproblem hat. Wenn Ihre Nutzungsmuster im September auf Sonnet 5 abgestimmt wurden, müssen sie im Oktober neu bewertet werden – und erneut, wenn Haiku erscheint.

Warum günstiger wichtiger ist als klüger

Die Rahmenerzählung um Frontier-Modelle belohnt tendenziell Fähigkeitsankündigungen. Beschaffung belohnt Kosten pro Arbeitseinheit, und Sonnet 5.5 ist eindeutig ein Beschaffungs-Release.

Man stelle sich vor, was eine Reduktion um 30 Prozent in einem Unternehmen bewirkt, das agentische Workflows betreibt. Anthropic selbst verkauft diese Geschichte aggressiv. Claude for Government erreichte die allgemeine Verfügbarkeit für US-Bundes- und Bundesstaatsbehörden in FedRAMP-High-Umgebungen. Die Integration von Claude Code und Microsoft 365 ging zeitgleich in den Early Access. Das Unternehmen verpflichtete sich außerdem, bis Ende 2027 über die Claude Frontier Academy 100 Millionen US-Dollar dafür bereitzustellen, 10.000 Ingenieure auf dem eigenen Stack auszubilden.

Der letzte Punkt ist das verräterische Detail. Eine zertifizierte Belegschaft aufzubauen, die auf Ihre Tools geschult ist, ist der Weg, um sicherzustellen, dass die in diesem Jahr abgeschlossenen Verträge verlängert werden, und in Verlängerungsgesprächen werden die Kosten pro Aufgabe zur entscheidenden Zahl. Ein Modell, das auf demselben Preisblatt 30 Prozent günstiger ist und als Standard für klar abgegrenzte Arbeit positioniert wird, gibt dem Vertrieb etwas Konkretes, auf das er zeigen kann, wenn ein Kunde die Rechnung gegenüber einem Wettbewerber aufstellt.

Es gibt eine zweite kommerzielle Logik. Modelle der Sonnet-Klasse sind dort, wo das Volumen liegt. Ein Frontier-Modell gewinnt Presse. Ein Arbeitspferd-Modell gewinnt die Verbrauchszeile, und Anthropics Fähigkeit, das Arbeitspferd 30 Prozent günstiger zu machen, ohne den offiziellen Preis anzutasten, bedeutet, dass es Effizienzgewinne abschöpft, statt einen Rabatt weiterzugeben. Das ist eine gesunde Position für den Anbieter und ein Grund für Käufer, die Behauptung tatsächlich an ihren eigenen Workloads statt an einem allgemeinen Benchmark zu überprüfen.

Was das Coding-Leaderboard sagt

Sonnet 5.5, GPT-6.1 Sol und Gemini 4 Argon führen den monatlichen Coding Agent Index von Anthropic selbst an, was eine plausible Momentaufnahme ist und zugleich mit Vorsicht zu behandeln ist, da es das eigene Instrument des Anbieters ist. Das Muster über die drei hinweg ist aussagekräftiger als jede einzelne Platzierung. OpenAI senkte GPT-6.1 Sol auf ungefähr 2 US-Dollar pro Million Input-Tokens und 10 US-Dollar pro Million Output-Tokens, nahe an Astra-Level-Leistung für agentisches Coding, was derselbe Preispunkt ist, den Anthropic hält. Google lieferte Gemini 4 Argon mit einem Output-Limit von einer Million Tokens und abgestuftem Zugang aus, der mit geprüften Cybersicherheitsfachleuten beginnt.

Drei Labore konvergierten innerhalb weniger Wochen auf dasselbe Preisband für dieselbe Aufgabe. Das ist kein Zufall, und es zeigt, wohin sich der Wettbewerb bewegt hat. Coding-Agenten wurden zur kommerziellen Workload mit dem höchsten Volumen für Frontier-Modelle, und als ein Labor ein Near-Frontier-Modell mit 2 und 10 US-Dollar bepreiste, mussten die anderen nachziehen.

Die Release-Kadenz ist ein eigenes Problem

Anthropics Veröffentlichungsplan verdient einen zweiten Blick, denn er schafft eine Schwierigkeit, die nichts mit Modellqualität zu tun hat.

Opus 5.5 kam am 22. September. Sonnet 5.5 folgte innerhalb von etwa eineinhalb Wochen. Haiku 5.5 wird für die kommenden Wochen versprochen. Das sind drei Stufen innerhalb von ungefähr einem Monat, und jede kommt mit leicht unterschiedlichen Stärken und einer leicht anderen Kostenkurve.

Für einen einzelnen Entwickler, der experimentiert, ist eine schnelle Kadenz ein Geschenk. Für ein Unternehmen, das Produktionsverkehr über Hunderte von Workflows abwickelt, ist sie eine Wartungspflicht. Jeder Modellwechsel erfordert, Prompt-Vorlagen neu zu bewerten, Ausgabeformate erneut zu prüfen, Regression-Suites erneut laufen zu lassen und alles neu zu validieren, was vom Verhalten eines bestimmten Modells abhing. Teams, die die Politik verfolgten, sich auf eine Version festzulegen und vierteljährlich zu aktualisieren, müssen nun entscheiden, ob eine Kostenreduktion von 30 Prozent eine ungeplante Migration mitten im Quartal wert ist.

Dieselbe Dynamik zieht sich durch die Branche. OpenAI brachte GPT-6.1 Sol mit einer starken Preissenkung heraus, Google brachte Gemini 4 Argon mit eingeschränktem Zugang für geprüfte Nutzer an den Start, und Anthropic antwortete mit Sonnet 5.5. Ein Käufer, der im Oktober 2026 ein Modell auswählt, wählt ein bewegliches Ziel, und die Unternehmensantwort darauf ist üblicherweise Abstraktion: einen Router vor die Modellschicht setzen, anbieterspezifische Logik aus dem Anwendungscode heraushalten und jedes einzelne Modell als ersetzbar behandeln. Das bedeutet mehr Ingenieursarbeit im Vorfeld und deutlich weniger Wechselaufwand später.

Was man tatsächlich prüfen sollte

Die 30-Prozent-Zahl verdient eine Einschränkung. Rabattbehauptungen von Anbietern werden üblicherweise an einem repräsentativen Workload gemessen, und Ihr Workload ist nicht repräsentativ. Die Reduktion stammt aus einer Mischung aus schnellerer Inferenz, weniger Tokens pro Aufgabe und günstigeren Cache-Lesevorgängen, und der Anteil jedes Faktors variiert enorm damit, wie Sie Prompts formulieren. Eine Pipeline, die kurze, nicht gecachte Anfragen sendet, wird eine andere Zahl sehen als eine, die über mehrere Turns hinweg einen langen Kontext aktiv hält.

Der praktische Schritt ist, zu messen, bevor man annimmt. Nehmen Sie eine Woche repräsentativen Traffic, lassen Sie ihn gegen beide Modelle laufen und vergleichen Sie Tokens, Latenz und Ausgabequalität bei den Aufgaben, die zählen. Das Kontextfenster von einer Million Tokens ist aus demselben Grund nützlich und man kann dabei auch leicht zu viel ausgeben, da ein großer Kontext, der nicht wiederverwendet wird, ein teurer Kontext ist.

Niemand wird einen atemlosen Beitrag über Sonnet 5.5 schreiben. Es gehört zur Kategorie der Releases, die ein Budget ändern, ohne eine Schlagzeile zu ändern, was in einem Unternehmenskonto das folgenreichere Ergebnis ist.

Verwandte Artikel