Anthropic ora ti addebiterà una richiesta a cui rifiuta di rispondere

Il 24 settembre, alle 17:11 UTC, l'account sviluppatori di Anthropic ha pubblicato due paragrafi che hanno cambiato una riga nella documentazione di fatturazione. L'azienda riprenderà ad addebitare le richieste che le sue salvaguardie bloccano prima che Claude risponda. La modifica si applica solo a tre categorie in cui misura bassi tassi di falsi positivi: biologia, sviluppo di modelli di frontiera di grandi dimensioni ed estrazione del ragionamento, che il post chiama attacchi di distillazione.
La meccanica è semplice e leggermente scomoda. Quando un classificatore di Claude rifiuta una richiesta prima di generare qualsiasi cosa, l'API non restituisce un errore. Restituisce un normale HTTP 200 con `stop_reason: "refusal"`, un array content vuoto e un oggetto `stop_details` il cui campo `category` indica l'area della policy. Il rifiuto non contiene alcun contenuto, ma i conteggi dei token compaiono comunque nei dati di utilizzo, e la richiesta continua a contare ai fini dei limiti di frequenza. Secondo la nuova regola, in quelle tre categorie, anche il rifiuto viene addebitato, alle tariffe del modello che lo ha eseguito.
Anthropic aveva rimosso gli addebiti per i rifiuti a output zero il 2 giugno, in occasione del lancio del suo prodotto Fable. I rifiuti a metà flusso, in cui il modello inizia a rispondere e poi viene fermato, sono sempre stati fatturati. I rifiuti prima di qualsiasi output in altre categorie, incluse cybersecurity e danni generici, restano gratuiti. La modifica si applica a Claude API, Amazon Bedrock, Claude Platform su AWS, Google Cloud e Microsoft Foundry, e la documentazione aggiunge un avviso che le categorie fatturate potrebbero cambiare di nuovo.
Perché la fatturazione è ora un controllo di sicurezza
La motivazione dichiarata dall'azienda è che nelle ultime settimane ha visto attacchi coordinati ai suoi sistemi. Una richiesta bloccata che non costa nulla è una sonda gratuita. Un attaccante che vuole mappare la forma di un classificatore può inviare migliaia di richieste e imparare dai rifiuti senza pagare un centesimo. Mettere un prezzo sul tentativo bloccato esattamente nelle tre categorie sotto attacco aumenta il costo di quella mappatura, e Anthropic è esplicita sul fatto che l'addebito serve come livello di difesa, non come fonte di ricavi.
All'annuncio sono arrivati due numeri. Nei test recenti, il 99,7 percento degli account che usano Claude Code, Claude.ai o Cowork non ha incontrato nessuno dei blocchi ora fatturabili. I classificatori dietro di essi sono tarati su un tasso di falsi positivi inferiore allo 0,1 percento, e il post aggiunge che la cifra non è zero e che i classificatori continueranno a migliorare, così da interrompere il lavoro meno spesso.
I classificatori girano su quattro modelli Claude: Fable 5.1, Fable 5, Opus 5.5 e Opus 5. La documentazione elenca cinque categorie. Due di esse, cybersecurity e danni generici, non sono fatturate. Le tre fatturate corrispondono ad attività che i termini commerciali di Anthropic già limitano, ed è per questo che il tasso di falsi positivi è abbastanza basso da poter essere misurato: pochi clienti legittimi stanno facendo training di modelli di frontiera o chiedendo a un modello di riprodurre il proprio ragionamento interno.

Vale la pena spiegare bene gli attacchi di distillazione, perché il nome fa molto lavoro. Il codice della categoria è `reasoning_extraction`, e il comportamento preso di mira consiste nel sollecitare un modello a esporre il proprio ragionamento interno passo dopo passo, in modo che l'output possa essere usato per addestrare un sistema concorrente. È il meccanismo dietro diverse dispute sul furto di modelli dell'ultimo anno, ed è difficile distinguerlo dagli utenti comuni che vogliono semplicemente che il modello pensi ad alta voce.
I falsi positivi sono già visibili
Le issue aperte sul repository GitHub di claude-code raccontano una storia diversa sul tasso. Un utente ha registrato 23 flag nella categoria di estrazione del ragionamento su lavoro ordinario, inclusi testi per podcast e fogli di calcolo di budget, e ha detto che sette di essi hanno terminato il turno. Altri report descrivono attività standard di sviluppo software e la stessa documentazione del flusso di lavoro di Claude Code che attivano lo stesso blocco. Anthropic non ha spiegato come funzionerebbe un rimborso per un blocco che si rivela sbagliato, oltre a indicare agli utenti il comando `/feedback`.
Quel vuoto è il problema pratico. Uno sviluppatore può contare gli eventi `stop_reason: "refusal"` e riprovare con un modello di fallback, che è la soluzione documentata, e l'accordo sui crediti di fallback è invariato. Quello che non può fare facilmente è capire, al momento dell'addebito, se il blocco era corretto. Se la risposta arriva dopo, il denaro si è già mosso, e una politica di rimborso non pubblicata non è qualcosa su cui un team finanziario possa fare previsioni.
La reazione al post è stata moderata più che arrabbiata. In circa tre ore ha raccolto circa 1.511 like, 64 repost e 220 risposte su X, e la segnalazione su Hacker News ha ottenuto cinque punti e due commenti. La maggior parte della discussione riguardava il principio più che l'importo, il che suggerisce che l'importo sia abbastanza piccolo che pochi team lo noteranno in fattura.
Cosa può davvero controllare un team
Due cose nella documentazione vale la pena cablare in una pipeline. La prima è la categoria del rifiuto, che arriva come campo leggibile da una macchina, così un servizio può separare i rifiuti dagli errori nei propri log e contarli per categoria nel tempo, invece di scoprire il pattern durante una revisione trimestrale. La seconda è il percorso di fallback. Il pattern documentato è riprovare una richiesta rifiutata con un modello di fallback, e Anthropic afferma che l'accordo sui crediti di fallback è invariato, il che significa che un nuovo tentativo non paga due volte per lo stesso lavoro.
Nessuna delle due risolve il problema dei falsi positivi. Quando una richiesta legittima viene bloccata in una categoria fatturata, il record mostra un rifiuto con un codice di categoria e nessun contenuto, e la fattura mostra un addebito. Un team che non legge mai quel campo scoprirà il tasso solo quando qualcuno chiederà perché la bolletta è cambiata.
Il principio è la parte interessante
Ogni grande fornitore di modelli esegue una qualche versione di questo calcolo. I rifiuti consumano potenza di calcolo, e un rifiuto che un cliente può attivare a piacere è una leva che un attaccante può tirare. Addebitare la richiesta rifiutata riporta il costo su chi la sta tirando.
Il problema è che la stessa leva è raggiungibile da persone che non stanno attaccando nulla. Chi scrive un articolo di biologia, o una startup che lavora su tecniche di distillazione di modelli, rientra nelle categorie fatturate per definizione del lavoro, non per intento. L'inquadramento di Anthropic è che il tasso di falsi positivi è abbastanza basso da essere accettato, il che è un giudizio espresso dalla parte che incassa la tariffa.
Esiste un design più pulito, e Anthropic lo ha in parte costruito. Il campo `stop_details.category` è leggibile da una macchina, così un team può instradare i rifiuti in un log, contarli per categoria e verificarli in aggregato. Le risposte rifiutate compaiono anche nei record di utilizzo con i conteggi dei token allegati, il che significa che i dati che servirebbero a una contestazione sono già registrati. Se questo diventi una parte normale dell'uso di Claude in produzione, o resti una nota a piè di pagina che la maggior parte dei team non legge mai, decide quanto costa davvero la modifica di fatturazione al di là della riga in fattura.
Articoli correlati
La Cina ha iniziato a scrivere le regole per l'identità degli agenti, e la domanda è per chi lavora l'agente
L'identità è la metà facile. La metà difficile è l'attribuzione.
Unit1 ha raccolto 20 milioni di dollari per portare i concerti con avatar su un tour bus
Il vincolo è una firma su un contratto di licenza.
La Cina ha messo un'opera Huangmei su uno schermo verticale, e il canto è sopravvissuto
O il modello è stato addestrato sulla cosa reale, oppure l'output suona sbagliato all'unico pubblico che se ne accorgerebbe.
13.000 screenshot interni sono finiti su GitHub pubblico, e nessun attaccante li ha messi lì
Un comportamento predefinito, ripetuto su una flotta, è una conseguenza delle policy.