Anthropic stellt Ihnen jetzt eine Anfrage in Rechnung, die es nicht beantworten will

Am 24. September um 17:11 UTC veröffentlichte der Entwickler-Account von Anthropic zwei Absätze, die eine Zeile in der Abrechnungsdokumentation änderten. Das Unternehmen wird wieder Gebühren für Anfragen erheben, die seine Schutzmechanismen blockieren, bevor Claude antwortet. Die Änderung gilt nur in drei Kategorien, in denen es niedrige Falsch-Positiv-Raten misst: Biologie, Entwicklung von Frontier-Großmodellen und Reasoning-Extraktion, die der Beitrag als Destillationsangriffe bezeichnet.
Die Mechanik ist einfach und leicht unangenehm. Wenn ein Claude-Klassifikator eine Anfrage ablehnt, bevor überhaupt etwas generiert wird, gibt die API keinen Fehler zurück. Sie gibt ein normales HTTP 200 mit `stop_reason: "refusal"`, einem leeren Content-Array und einem `stop_details`-Objekt zurück, dessen Feld `category` den Richtlinienbereich benennt. Die Ablehnung enthält keinen Inhalt, aber Token-Zahlen erscheinen weiterhin in der Nutzung, und die Anfrage zählt weiterhin gegen Ihre Rate Limits. Nach der neuen Regel wird in diesen drei Kategorien auch die Ablehnung berechnet, zu den Preisen des Modells, das sie ausgeführt hat.
Am 2. Juni hatte Anthropic die Gebühren für Ablehnungen ohne Ausgabe entfernt, rund um den Start seines Produkts Fable. Ablehnungen mitten im Stream, bei denen das Modell mit der Antwort beginnt und dann gestoppt wird, wurden schon immer berechnet. Ablehnungen vor jeglicher Ausgabe in anderen Kategorien, darunter Cybersicherheit und allgemeiner Schaden, bleiben kostenlos. Die Änderung gilt für die Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud und Microsoft Foundry, und die Dokumentation ergänzt eine Warnung, dass sich die berechneten Kategorien erneut ändern können.
Warum die Abrechnung jetzt eine Sicherheitskontrolle ist
Der angegebene Grund des Unternehmens ist, dass es in den vergangenen Wochen koordinierte Angriffe auf seine Systeme beobachtet hat. Eine blockierte Anfrage, die nichts kostet, ist eine kostenlose Sonde. Ein Angreifer, der die Form eines Klassifikators kartieren will, kann Tausende Anfragen senden und aus den Ablehnungen lernen, ohne einen Cent zu bezahlen. Einen Preis auf den blockierten Versuch genau in den drei angegriffenen Kategorien zu setzen, erhöht die Kosten dieser Kartierung, und Anthropic sagt ausdrücklich, dass die Gebühr als eine Verteidigungsschicht und nicht als Einnahmequelle dienen soll.
Zwei Zahlen kamen mit der Ankündigung. In kürzlichen Tests lösten 99,7 Prozent der Konten, die Claude Code, Claude.ai oder Cowork nutzten, keinen der neu kostenpflichtigen Blocks aus. Die dahinterstehenden Klassifikatoren sind auf eine Falsch-Positiv-Rate von unter 0,1 Prozent abgestimmt, und der Beitrag ergänzt, dass die Zahl nicht null ist und dass die Klassifikatoren weiter verbessert werden, damit sie die Arbeit seltener unterbrechen.
Die Klassifikatoren laufen auf vier Claude-Modellen: Fable 5.1, Fable 5, Opus 5.5 und Opus 5. Die Dokumentation nennt fünf Kategorien. Zwei davon, Cybersicherheit und allgemeiner Schaden, werden nicht berechnet. Die drei, die berechnet werden, entsprechen Arbeiten, die die kommerziellen Bedingungen von Anthropic ohnehin einschränken, was der Grund dafür ist, dass die Falsch-Positiv-Rate überhaupt niedrig genug zum Messen ist: Nur wenige legitime Kunden führen Frontier-Modelltraining durch oder bitten ein Modell, sein eigenes internes Reasoning zu reproduzieren.

Destillationsangriffe verdienen eine genauere Erläuterung, denn der Name leistet eine Menge Arbeit. Der Kategorie-Code ist `reasoning_extraction`, und das Verhalten, auf das er abzielt, ist das Auffordern eines Modells, seine internen Schritt-für-Schritt-Überlegungen offenzulegen, damit die Ausgabe zum Trainieren eines konkurrierenden Systems verwendet werden kann. Es ist der Mechanismus hinter mehreren Modell-Diebstahl-Streitigkeiten des vergangenen Jahres, und es ist schwierig, ihn von gewöhnlichen Nutzern zu trennen, die einfach nur wollen, dass das Modell laut denkt.
Die Falsch-Positive sind bereits sichtbar
Offene Issues im GitHub-Repository von claude-code erzählen eine andere Geschichte über die Rate. Ein Nutzer protokollierte 23 Markierungen in der Kategorie Reasoning-Extraktion bei gewöhnlicher Arbeit, darunter Podcast-Texte und Budget-Tabellen, und sagte, sieben davon hätten den Turn beendet. Andere Berichte beschreiben, dass standardmäßige Softwareentwicklungsaufgaben und Claude Codes eigene Workflow-Dokumentation dieselbe Blockierung auslösten. Anthropic hat nicht erklärt, wie eine Rückerstattung für eine Blockierung funktionieren soll, die sich als falsch erweist, außer den Hinweis auf den Befehl `/feedback`.
Diese Lücke ist das praktische Problem. Ein Entwickler kann Ereignisse mit `stop_reason: "refusal"` zählen und es gegen ein Fallback-Modell erneut versuchen, was der dokumentierte Workaround ist, und die Fallback-Gutschriftregelung ist unverändert. Was er nicht ohne Weiteres tun kann, ist im Moment der Berechnung zu sagen, ob die Blockierung korrekt war. Wenn die Antwort später kommt, ist das Geld bereits geflossen, und eine nicht veröffentlichte Rückerstattungsrichtlinie ist nichts, worauf ein Finanzteam seine Budgetplanung stützen kann.
Die Reaktion auf den Beitrag war moderat statt wütend. In etwa drei Stunden sammelte er rund 1.511 Likes, 64 Reposts und 220 Antworten auf X, und die Hacker-News-Einreichung erhielt fünf Punkte und zwei Kommentare. Der Großteil der Diskussion drehte sich um das Prinzip statt um den Betrag, was nahelegt, dass der Betrag klein genug ist, dass ihn nur wenige Teams auf einer Rechnung bemerken werden.
Was ein Team tatsächlich kontrollieren kann
Zwei Dinge in der Dokumentation sind es wert, in eine Pipeline eingebaut zu werden. Das erste ist die Ablehnungskategorie, die als maschinenlesbares Feld ankommt, sodass ein Dienst Ablehnungen in seinen Logs von Fehlern trennen und sie im Laufe der Zeit pro Kategorie zählen kann, statt das Muster erst bei einer Quartalsüberprüfung zu entdecken. Das zweite ist der Fallback-Pfad. Das dokumentierte Muster besteht darin, eine abgelehnte Anfrage gegen ein Fallback-Modell erneut zu versuchen, und Anthropic sagt, die Fallback-Gutschriftregelung sei unverändert, was bedeutet, dass ein erneuter Versuch nicht zweimal für dieselbe Arbeit bezahlt.
Keines von beiden löst das Falsch-Positiv-Problem. Wenn eine legitime Anfrage in einer berechneten Kategorie blockiert wird, zeigt der Datensatz eine Ablehnung mit einem Kategorie-Code und ohne Inhalt, und die Rechnung zeigt eine Gebühr. Ein Team, das dieses Feld nie liest, erfährt die Rate erst, wenn jemand fragt, warum sich die Rechnung verändert hat.
Das Prinzip ist der interessante Teil
Jeder große Modellanbieter führt eine Variante dieser Kalkulation durch. Ablehnungen verbrauchen Rechenleistung, und eine Ablehnung, die ein Kunde nach Belieben auslösen kann, ist ein Hebel, an dem ein Angreifer ziehen kann. Die abgelehnte Anfrage zu berechnen, verlagert die Kosten zurück auf denjenigen, der daran zieht.
Das Problem ist, dass derselbe Hebel auch für Menschen erreichbar ist, die nichts angreifen. Jemand, der eine Biologiearbeit schreibt, oder ein Startup, das an Modell-Destillationstechniken arbeitet, fällt durch die Definition der Arbeit und nicht durch Absicht in die berechneten Kategorien. Anthropics eigene Darstellung ist, dass die Falsch-Positiv-Rate niedrig genug zum Akzeptieren ist, was ein Urteil der Partei ist, die die Gebühr einzieht.
Es gibt ein saubereres Design, und Anthropic hat es teilweise gebaut. Das Feld `stop_details.category` ist maschinenlesbar, sodass ein Team Ablehnungen in ein Log leiten, sie nach Kategorie zählen und sie aggregiert prüfen kann. Abgelehnte Antworten erscheinen außerdem in Nutzungsdatensätzen mit angehängten Token-Zahlen, was bedeutet, dass die Daten, die ein Streitfall bräuchte, bereits aufgezeichnet werden. Ob das ein normaler Teil des Betriebs von Claude in der Produktion wird oder eine Fußnote bleibt, die die meisten Teams nie lesen, entscheidet, wie viel die Abrechnungsänderung über die Rechnungsposition hinaus kostet.
Verwandte Artikel
China hat begonnen, Regeln für Agenten-Identität zu schreiben, und die Frage ist, für wen der Agent arbeitet
Identität ist die leichte Hälfte. Die schwierige Hälfte ist die Zurechnung.
Unit1 sammelt 20 Millionen Dollar ein, um Avatar-Konzerte auf einen Tourbus zu bringen
Die Einschränkung ist eine Unterschrift unter einer Lizenzvereinbarung.
China brachte eine Huangmei-Oper auf den vertikalen Bildschirm – und der Gesang überlebte
Entweder wurde das Modell mit dem echten Material trainiert, oder die Ausgabe klingt für das einzige Publikum falsch, dem es auffallen würde.
13.000 interne Screenshots landeten auf öffentlichem GitHub – und kein Angreifer hat sie dort abgelegt
Ein Standardverhalten, über eine ganze Flotte hinweg wiederholt, ist das Ergebnis einer Richtlinie.