Anthropic、回答を拒否したリクエストにも課金へ

9月24日17:11 UTC、Anthropicの開発者アカウントが投稿した2つの段落が、課金ドキュメントの一行を書き換えた。同社は、Claudeが応答する前にセーフガードがブロックしたリクエストについて、再び課金を開始する。この変更が適用されるのは、誤検知率が低いと測定されている3つのカテゴリのみだ。すなわち生物学、フロンティア大規模モデル開発、そして推論抽出——投稿では「蒸留攻撃」と呼んでいる。
仕組みはシンプルで、やや居心地が悪い。Claudeの分類器が何かを生成する前にリクエストを拒否すると、APIはエラーを返さない。通常のHTTP 200と`stop_reason: "refusal"`、空のcontent配列、そして`category`フィールドがポリシー領域を示す`stop_details`オブジェクトを返す。拒否にはコンテンツが含まれないが、トークン数はusageに現れ、リクエストはレート制限にもカウントされる。新しいルールの下では、これら3カテゴリにおいて、拒否にも課金される——実行したモデルの料金で。
Anthropicは6月2日、Fable製品のローンチ前後に、出力ゼロの拒否に対する課金を撤廃していた。モデルが回答を始めた後に停止される途中拒否は、常に課金対象だった。サイバーセキュリティや一般的な危害を含む、その他のカテゴリでの出力前の拒否は無料のままとなる。この変更はClaude API、Amazon Bedrock、AWS上のClaude Platform、Google Cloud、Microsoft Foundryにまたがって適用され、ドキュメントには課金対象カテゴリが再び変わる可能性があるという警告が追加されている。
なぜ課金が今やセキュリティ管理手法なのか
同社が挙げる理由は、ここ数週間、自社システムに対する協調攻撃が確認されたというものだ。コストのかからないブロックされたリクエストは、無料の偵察行為になる。分類器の形を把握したい攻撃者は、何千ものリクエストを送り、一銭も払わずに拒否から学ぶことができる。まさに攻撃を受けている3カテゴリにおいて、ブロックされた試行に値段を付けることで、そのマッピングのコストが上がる。Anthropicは、この課金が収益ではなく防御層として機能することを意図していると明言している。
発表には2つの数字が添えられていた。最近のテストでは、Claude Code、Claude.ai、Coworkを利用するアカウントの99.7%が、新たに課金対象となるブロックに一切引っかからなかった。その背後にある分類器は誤検知率0.1%未満に調整されており、投稿はその数字がゼロではないこと、そして作業を妨げる頻度を下げるために分類器の改善を続けると付け加えている。
分類器は4つのClaudeモデル上で動作する。Fable 5.1、Fable 5、Opus 5.5、Opus 5だ。ドキュメントは5つのカテゴリを挙げている。そのうちサイバーセキュリティと一般的な危害の2つは課金されない。課金される3つは、Anthropicの商用利用規約がすでに制限している作業に対応する。そもそも誤検知率が測定できるほど低いのはそのためだ。正当な顧客でフロンティアモデルのトレーニングを行ったり、モデル自身の内部推論を再現させようとしたりする者はほとんどいない。

蒸留攻撃については明記する価値がある。この名前が多くの役割を担っているからだ。カテゴリコードは`reasoning_extraction`で、対象となる行為は、競合システムのトレーニングに使えるよう、モデルに段階的な内部推論を露出させるよう促すことだ。これは過去1年のモデル窃盗紛争のいくつかの背後にある仕組みであり、単にモデルに声に出して考えてほしいだけの一般ユーザーと区別するのは難しい。
誤検知はすでに見えている
claude-code GitHubリポジトリの未解決issueは、この率について異なる話を語っている。あるユーザーは、ポッドキャストの原稿や予算のスプレッドシートといった通常業務で、reasoning-extractionカテゴリのフラグを23件記録し、そのうち7件がターンを終了させたと述べている。他の報告では、標準的なソフトウェア開発タスクやClaude Code自身のワークフロードキュメントが同じブロックを引き起こしたとされている。Anthropicは、誤ったブロックであることが判明した場合の返金がどう機能するかについて、ユーザーを`/feedback`コマンドに誘導する以上の説明をしていない。
このギャップが実務上の問題だ。開発者は`stop_reason: "refusal"`イベントを数え、ドキュメント化された回避策であるフォールバックモデルに対してリトライできる。フォールバックのクレジットの取り決めも変わっていない。簡単にできないのは、課金の時点でそのブロックが正しかったかどうかを判断することだ。答えが後から届くなら、お金はすでに動いている。公表されていない返金ポリシーは、財務チームが予算を立てる際の拠り所にはならない。
投稿への反応は怒りというより穏やかだった。約3時間でX上で約1,511のいいね、64のリポスト、220の返信を集め、Hacker Newsへの投稿は5ポイントと2件のコメントを得た。議論の大半は金額ではなく原則についてであり、これは金額が小さすぎて請求書で気づくチームはほとんどいないことを示唆している。
チームが実際にコントロールできること
ドキュメントのうち、パイプラインに組み込む価値があるものが2つある。1つ目は拒否カテゴリで、これは機械可読なフィールドとして届くため、サービスはログ内で拒否とエラーを分離し、四半期レビューでパターンに気づくのではなく、カテゴリ別に経時的に数えることができる。2つ目はフォールバック経路だ。ドキュメント化されたパターンは、拒否されたリクエストをフォールバックモデルに対してリトライすることであり、Anthropicはフォールバックのクレジットの取り決めは変更なしだと述べている。つまりリトライで同じ作業に二重に支払うことはない。
どちらも誤検知の問題を解決するわけではない。正当なリクエストが課金対象カテゴリでブロックされると、記録にはカテゴリコード付きの拒否とコンテンツなしが示され、請求書には課金が示される。このフィールドを決して読まないチームは、誰かが請求額が動いた理由を尋ねるまで、その率に気づかない。
興味深いのは原則の部分だ
大手モデルプロバイダーはどこも、この計算の何らかのバージョンを実行している。拒否はコンピュートを消費し、顧客が自由に引き起こせる拒否は、攻撃者が引けるレバーになる。拒否されたリクエストに課金すれば、コストはそれを引いている側に戻る。
厄介なのは、同じレバーが、何も攻撃していない人々にも届くことだ。生物学の論文を書いている人、あるいはモデル蒸留技術に取り組むスタートアップは、意図によってではなく、その仕事の定義によって課金対象カテゴリに位置する。Anthropic自身の説明は、誤検知率が受け入れられるほど低いというものであり、それは手数料を徴収する側が下した判断だ。
もっとクリーンな設計も可能で、Anthropicはそれを部分的に構築している。`stop_details.category`フィールドは機械可読なので、チームは拒否をログに流し、カテゴリ別に数え、集計して監査できる。拒否されたレスポンスはトークン数付きでusageレコードにも現れる。つまり、異議申し立てに必要なデータはすでに記録されている。それがClaudeを本番環境で運用する通常の一部になるのか、ほとんどのチームが決して読まない脚注にとどまるのかが、この課金変更が請求書の一行を超えてどれだけコストがかかるかを決める。