← 返回部落格
News預計閱讀 9 分鐘

Anthropic 現在將對拒絕回答的請求向你收費

發布於 2026年10月4日
Anthropic 現在將對拒絕回答的請求向你收費

9 月 24 日 UTC 17:11,Anthropic 的開發者帳號發布了兩段文字,改變了計費文件中的一行。該公司將恢復對其防護機制在 Claude 回應前就封鎖的請求收費。這項變更僅適用於三類其測得偽陽性率很低的情境:生物學、前沿大型模型開發,以及推論擷取,貼文稱後者為蒸餾攻擊。

機制很簡單,卻讓人有點不舒服。當 Claude 分類器在尚未生成任何內容前就拒絕請求時,API 不會回傳錯誤,而是回傳正常的 HTTP 200,並帶有 `stop_reason: "refusal"`、空的 content 陣列,以及一個 `stop_details` 物件,其 `category` 欄位會標明政策領域。拒答不帶任何內容,但 token 數量仍會出現在用量中,請求也仍會計入你的速率限制。在新規則下,這三類的拒答也會收費,費率依執行該請求的模型而定。

Anthropic 曾在 6 月 2 日、其 Fable 產品推出前後,取消了零輸出拒答的費用。至於中途拒答,也就是模型已開始回答後才被停止的情況,則一向都會收費。在其他類別中,包括網路安全和一般傷害,於任何輸出前的拒答仍維持免費。這項變更適用於 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry;文件也新增警告,表示收費類別可能再次變動。

為什麼計費如今成了一種安全控制

該公司提出的理由是,近幾週在其系統上看到了協同攻擊。一個不花錢的封鎖請求,就是一次免費探測。攻擊者若想描繪分類器的輪廓,可以送出數千個請求,並從拒答中學習,而不用付一毛錢。對正好遭到攻擊的這三類被封鎖嘗試收費,會提高這種測繪的成本;Anthropic 也明確表示,這筆費用是為了作為一層防禦,而不是為了營收。

這項公告附帶了兩個數字。在近期測試中,使用 Claude Code、Claude.ai 或 Cowork 的帳號裡,有 99.7% 沒有遇到任何新增的收費封鎖。其背後的分類器已調整到偽陽性率低於 0.1%,而貼文也補充,這個數字並非零,分類器會持續改進,以減少打斷工作的頻率。

這些分類器運行於四款 Claude 模型:Fable 5.1、Fable 5、Opus 5.5 和 Opus 5。文件列出五個類別。其中兩個,網路安全和一般傷害,不收費。三個收費類別對應到 Anthropic 商業條款原本就已限制的工作,這也是偽陽性率一開始就低到可測量的原因:很少有正當客戶會進行前沿模型訓練,或要求模型重現其自身的內部推理。

一個透明玻璃小瓶,帶有黑色瓶蓋,立於深色反光表面上

蒸餾攻擊值得詳細說明,因為這個名稱承載了很多含義。其類別代碼是 `reasoning_extraction`,它所針對的行為是提示模型暴露逐步的內部推理,以便將輸出用於訓練競爭系統。這是過去一年數起模型竊取爭議背後的機制,也很難與單純想讓模型把思考過程說出來的普通使用者區分開來。

偽陽性已經顯而易見

claude-code GitHub 儲存庫上的未結問題,對這個比率說出了不同的故事。一名使用者記錄到,在普通工作上出現了 23 次 reasoning-extraction 類別的標記,包括播客文案和預算試算表,並表示其中七次終止了該輪對話。其他報告則描述,標準軟體開發任務和 Claude Code 自身的工作流程文件也觸發了同樣的封鎖。Anthropic 除了引導使用者使用 `/feedback` 指令外,並未說明如果某次封鎖後來被證明是錯誤的,退款將如何運作。

這個落差就是實際問題所在。開發者可以計算 `stop_reason: "refusal"` 事件的次數,並改用備援模型重試,這是文件記載的變通做法,而備援額度安排維持不變。他們不容易做到的是,在收費當下判斷該次封鎖是否正確。如果答案之後才出現,錢已經付出去,而尚未公布的退款政策也不是財務團隊能據以編列預算的東西。

外界對這篇貼文的反應溫和,而非憤怒。大約三小時內,它在 X 上獲得約 1,511 個讚、64 次轉貼和 220 則回覆,而 Hacker News 的投稿則得到五點和兩則留言。多數討論關注的是原則,而不是金額,這表示金額小到很少有團隊會在帳單上注意到。

團隊實際上能控制什麼

文件中有兩件事值得接入管線。第一是拒答類別,它會以機器可讀的欄位出現,因此服務可以在日誌中將拒答與錯誤分開,並隨時間按類別計數,而不是等到季度審查時才發現這個模式。第二是備援路徑。文件記載的模式是,針對被拒的請求改用備援模型重試;Anthropic 表示備援額度安排維持不變,這表示重試不會為同一份工作付兩次錢。

這兩者都無法解決偽陽性問題。當一個正當請求在收費類別中被封鎖時,紀錄會顯示一筆帶有類別代碼、但沒有內容的拒答,而帳單則顯示一筆費用。從不讀取那個欄位的團隊,只會在有人問起為什麼帳單變動時,才會發現這個比率。

原則才是有趣的部分

每一家大型模型供應商都會做某種版本的這種盤算。拒答會消耗運算資源,而客戶能隨意觸發的拒答,就是攻擊者可以拉動的槓桿。對被拒的請求收費,會把成本轉回給拉動槓桿的人。

問題在於,同樣的槓桿也能被沒有在攻擊任何東西的人觸及。撰寫生物學論文的人,或正在研究模型蒸餾技術的新創公司,會因為工作的定義、而非意圖,落入收費類別。Anthropic 自己的說法是,偽陽性率低到可以接受,而這是由收取費用的一方所做的判斷。

有一個更乾淨的設計可用,而 Anthropic 已經部分建構了它。`stop_details.category` 欄位是機器可讀的,因此團隊可以將拒答導向日誌、按類別計數,並進行彙總稽核。被拒的回應也會出現在用量紀錄中,並附上 token 數量,這表示爭議所需的資料已經被記錄下來。這會不會成為在生產環境運行 Claude 的正常一環,或仍只是多數團隊從不閱讀的註腳,將決定這項計費變更在帳單明細之外還要付出多少代價。

相關文章