← 返回博客
News预计阅读 8 分钟

Anthropic 现在会就它拒绝回答的请求向你收费

发布于 2026年10月4日
Anthropic 现在会就它拒绝回答的请求向你收费

9月24日17:11 UTC,Anthropic 的开发者账号发布了两段话,改写了计费文档中的一行。该公司将恢复对 Claude 响应前被其安全机制拦截的请求收费。该变更仅适用于它测得误报率较低的三类:生物学、前沿大模型开发,以及推理提取——帖子称之为蒸馏攻击。

机制很简单,也稍显令人不安。当 Claude 的分类器在生成任何内容之前拒绝某个请求时,API 不会返回错误。它会返回正常的 HTTP 200,并带有 `stop_reason: "refusal"`、空的 content 数组,以及一个 `stop_details` 对象,其 `category` 字段标明政策领域。拒绝响应不包含内容,但 token 计数仍会出现在用量中,该请求也仍会计入你的速率限制。根据新规则,在这三个类别中,拒绝也会被收费,按运行它的模型的费率计费。

Anthropic 曾在 6 月 2 日、其 Fable 产品发布前后,取消了对零输出拒绝的收费。流中途拒绝,即模型开始回答后被停止,一直都会计费。其他类别中在任何输出之前的拒绝,包括网络安全和一般危害,仍然免费。该变更适用于 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry,文档还警告称,收费类别可能再次变化。

为什么计费现在是一种安全控制

该公司给出的理由是,近几周其系统遭受了协同攻击。一个不花钱的被拦截请求就是一次免费探测。想要摸清分类器形态的攻击者可以发送数千个请求,并从不付费的情况下从拒绝中学习。对恰好受到攻击的三个类别中的被拦截尝试定价,会提高这种测绘的成本,而 Anthropic 明确表示,这项收费旨在作为一层防御,而非收入来源。

公告还附带两个数字。在近期测试中,使用 Claude Code、Claude.ai 或 Cowork 的账户中,99.7% 没有触发任何新近可计费的拦截。其背后的分类器被调校到误报率低于 0.1%,帖子还补充说,这个数字并非零,分类器会持续改进,以便更少打断工作。

分类器运行在四个 Claude 模型上:Fable 5.1、Fable 5、Opus 5.5 和 Opus 5。文档列出了五个类别。其中两个——网络安全和一般危害——不计费。三个计费类别对应的工作,Anthropic 的商业条款本就加以限制,这也是误报率从一开始就低到可测量的原因:很少有合法客户在进行前沿模型训练,或要求模型复现其自身的内部推理。

一个带有黑色瓶盖的透明玻璃小瓶立在深色反光表面上

蒸馏攻击值得详细说明,因为这个名字承担了很多含义。类别代码是 `reasoning_extraction`,它针对的行为是提示模型暴露逐步内部推理,以便将输出用于训练竞争系统。它是过去一年数起模型窃取纠纷背后的机制,也很难与那些只是想让模型把思考过程说出来的普通用户区分开来。

误报已经显现

claude-code GitHub 仓库上的未关闭 issue 讲述了一个关于该比率的不同故事。一位用户记录了 23 次针对普通工作的推理提取类别标记,包括播客文案和预算电子表格,并称其中七次终止了该轮次。其他报告描述,标准软件开发任务以及 Claude Code 自身的工作流文档触发了同样的拦截。对于最终被证明是错误的拦截将如何退款,Anthropic 除了引导用户使用 `/feedback` 命令外,并未作出解释。

这个缺口才是实际问题。开发者可以统计 `stop_reason: "refusal"` 事件,并针对备用模型重试,这是文档给出的变通方法,备用额度安排也没有变化。他们不容易做到的是,在收费发生的那一刻判断拦截是否正确。如果答案稍后才来,钱已经划走,而一项尚未公布的退款政策不是财务团队能据此做预算的东西。

对这篇帖子的反应是温和的,而非愤怒。在大约三个小时内,它在 X 上获得了约 1,511 个点赞、64 次转发和 220 条回复,Hacker News 上的提交则获得 5 分和 2 条评论。大多数讨论围绕原则而非金额,这表明金额小到很少有团队会在发票上注意到它。

团队实际能控制什么

文档中有两件事值得接入流水线。第一是拒绝类别,它以机器可读字段的形式返回,因此服务可以在日志中将拒绝与错误分开,并按类别随时间进行计数,而不是在季度审查时才发现这种模式。第二是备用路径。文档记载的模式是针对备用模型重试被拒绝的请求,Anthropic 表示备用额度安排没有变化,这意味着重试不会为同一项工作支付两次费用。

这两者都无法解决误报问题。当一个合法请求在计费类别中被拦截时,记录会显示一次带有类别代码且无内容的拒绝,而发票上会显示一笔收费。从不读取该字段的团队,只有在有人问起账单为何变化时,才会发现这个比率。

原则才是有趣的部分

每一家大型模型提供商都会进行某种版本的计算。拒绝会消耗算力,而客户可以随意触发的拒绝,就是攻击者可以拉动的一根杠杆。对被拒绝的请求收费,会把成本转回到拉动这根杠杆的人身上。

麻烦在于,同一根杠杆也会被并未攻击任何东西的人触到。撰写生物学论文的人,或从事模型蒸馏技术研究的初创公司,是因工作本身而非意图被归入计费类别。Anthropic 自己的说法是,误报率低到可以接受,而这是由收取费用的一方作出的判断。

有一种更清晰的设计可用,而 Anthropic 已经部分构建了它。`stop_details.category` 字段是机器可读的,因此团队可以将拒绝路由到日志中,按类别计数,并进行汇总审计。被拒绝的响应也会出现在用量记录中,并附有 token 计数,这意味着争议所需的数据已经在被记录。这会成为在生产环境中运行 Claude 的常规部分,还是停留在大多数团队从不阅读的脚注,决定了这项计费变更在发票行之外还要付出多少成本。

相关文章