OpenAI 将在欧盟为 ChatGPT 文本加水印,其自家数据揭示了这有多脆弱

10 月 5 日,OpenAI 表示将在欧盟为 ChatGPT 和 Codex 生成的文本添加不可见水印,并将在未来几周内向所有套餐的符合条件的用户推出。这种方法名为 textGrain,它不会插入可见符号,也不会插入可通过查找替换删除的隐藏字符。它使用一个密钥,巧妙地影响模型对下一个词的选择,叠加数百次统计上的微调,检测器之后仅凭文本就能恢复出这些痕迹。由于这种模式存在于措辞之中,因此它能经受复制粘贴。
触发因素是监管。《欧盟人工智能法案》第 50 条要求生成式系统提供商以机器可读的形式标记其输出。这些透明度义务于 2026 年 8 月 2 日生效,欧盟委员会已确认,在该日期之前已在市场上销售的系统可最迟于 2026 年 12 月 2 日遵守。委员会于 6 月发布了关于标记和标注 AI 生成内容的《实践准则》,截至 7 月底已有约 190 家组织签署。Anthropic 在 8 月表示将在全球范围内为 Claude 文本添加水印;Google 则有用于文本的 SynthID。OpenAI 正赶上一个它花两年时间回避的截止日期。
该公司公布了自己的失败曲线
这份公告中最有用的部分,是 OpenAI 附上的数字列表。在目标假阳性率为 1% 的情况下,对于来自 ELI5 数据集的英文文本,检测器在约 80% 的 200 个 token 的段落和约 95% 的 400 个 token 的段落中识别出了水印。数学内容得分要低得多,因为模型在选词上的自由度更小。在 400 个 token 的段落中,将 10% 的词语替换为同义词,检测率会从大约 92% 降至 66%。替换 25%,则降至约 17%。
按顺序读完这些数据,情况就很清楚。检测器在篇幅较长、约束较松的散文中效果最好。一封简短电子邮件更接近 200 个 token,而非 400 个 token。代码和数学几乎没有空间隐藏信号。用任何改写工具轻量处理一遍,检测就会变得像掷硬币。

OpenAI 列出了五项限制,值得你在本季度撰写的任何政策文件中引用。水印并不衡量人类贡献。它不确立所有权或责任。它不识别用户,因为没有任何账户、提示词或对话与文本绑定。它不验证准确性,带有水印的段落也可能是虚假的。最后,没有水印并不能证明文本由人类撰写,因为段落可能太短,可能被编辑或翻译过,可能来自不受支持的模型或来自推出之前,也可能只是来自另一家公司的工具。
最后一点在实践中会造成真正的伤害。有人会把学生的论文或求职者的求职信丢进检测器,得到无匹配结果,然后将其视为诚实作业的证明。或者得到匹配结果,然后将其视为作弊的证明。这两种结论都不成立,OpenAI 在自己的文章中也这么说。
为什么检测器不公开
检测工具在推出时仅限经批准的研究人员和专家组织使用,并逐案授予访问权限。这种谨慎是有道理的,因为一个在同义词替换后检测率为 66% 的工具很容易被滥用。这也意味着在系统逐步推出期间,独立验证会很困难,对于一项合规功能来说,这是一个尴尬的起点。
这方面有历史可循。2024 年 8 月,OpenAI 拒绝为 ChatGPT 添加水印,因为一项内部调查发现,近 30% 的用户会因此减少使用。当前安排是一种妥协:起初仅限欧盟,各地 API 客户默认关闭,但可针对部分模型选择开启。在全球范围内,文本水印并非默认开启。
对于任何发布文本的人来说,这改变了什么
对于欧盟的团队来说,实际变化比标题所暗示的要小。员工产出的内容将带有一个无人能看见的信号。它不会识别他们,在 OpenAI 的测量中不会降低模型质量,并且会随着文本进入任何粘贴它的文档或客户邮件中。如果之后有检测器访问权限的人检查那段文本,他们也许能将其标记出来。工作流程本身无需任何改变。
真正的风险位于下游链条,存在于任何将来源检测视为裁决的流程中。招聘、招生、新闻编辑室核查和学术诚信系统是显而易见的候选者,其中每一个都包含一个会忍不住把检测结果当作证据来解读的人。OpenAI 自己的数据反对这样做。一个可被常规改写剥离的标记,也许满足了第 50 条的字面要求,却未能完成该条款旨在完成的任务。
执法让截止日期有了威慑力:违规最高可被处以 1500 万欧元或全球年收入的 3%,以较高者为准。这就是推出水印的原因。但更有趣的问题是,一个在轻度编辑下就会消退的水印,能否承载监管机构赋予它的重量。遗留系统的 12 月 2 日截止日期、检测器最终的公开发布,以及委员会关于可接受检测阈值的任何指导,都是值得关注的里程碑。
目前,对任何团队来说,最安全的规则就是 OpenAI 写在自己文章里的那条:缺少水印不能证明文本由人类撰写,存在水印也不能证明模型写了全部内容。水印可以表明某个系统接触过一段文本。它们无法告诉你,其中有多少思考来自人类。
文本水印究竟如何运作
理解信号为何如此容易丢失会有所帮助。传统水印是附加到文件上的标记,删除它只需找到正确的字段。textGrain 走了另一条路。在生成过程中,一个密钥会使模型在近乎等价的下一词候选中产生偏向,将其推向持有相同密钥的检测器能够识别的子集。在数百次这样的选择中,这种模式在统计上变得可见。由于偏向存在于措辞中,标记会随文本经历复制粘贴、不同编辑器和不同应用。
脆弱性源于同样的设计。任何重写词语的过程,无论是改写工具、翻译还是大量人工编辑,都会扰乱检测器寻找的模式。这就是每个文本水印核心的取舍:一个强到足以在轻度编辑后存活的标记,也会与普通写作明显不同,而这又违背了初衷。OpenAI 选择了一个微妙的标记,并公布了由此产生的检测曲线,这比大多数供应商都要诚实。
各实验室之间的比较很有启发性。Anthropic 在 8 月表示将在全球范围内为 Claude 输出添加水印,此举引发了用户的反对,他们认为指令、上下文和决策来自人,模型只是工具。Google 的 SynthID 也为其自己的文本做类似的事。这三种方法意味着行业在同一个想法上趋同,并且有着相同的局限,这表明该技术已接近当前文本所能达到的上限。
与此同时,更难的问题仍未被触及。标记文本相对容易,因为一段文本包含数百个可供编码信号的选词。图像和音频也有同样的统计空间,OpenAI 已经为它们提供验证。但这些标记都无法回答新闻编辑室或学校真正需要回答的问题:某个具体说法是否真实,以及谁为其背书。来源和准确性是两个不同的问题,而水印只解决第一个。