← 返回博客
News预计阅读 11 分钟

水印已跟不上伪造的步伐

发布于 2026年10月4日
水印已跟不上伪造的步伐

平台如今会自动为AI生成内容加上标签。但一项新审计显示,这些标签仍然漏掉了最要紧的那些伪造内容。

研究人员以欧盟委员会2026年7月的深度伪造指南为参照,对Instagram、TikTok、X和YouTube上的AI标签情况进行了审计。四个平台都会自动施加标签,且由平台自身而非上传者施加的标签占比更高——这相较此前的审计是一大进步。问题出在覆盖范围上。

在系统性风险情境下,由专家识别出的深度伪造内容中,只有33%带有平台施加的AI标签。这些未标注内容的中位播放量达到16万次,意味着大量观众在毫无提示的情况下看到了它们。在带有标准来源信号的AI生成内容受控上传测试中,平台仅对61%的内容加了标签,还完全剥离了39%上传内容中的隐藏信号。

最后这个数字,应当让所有在来源追溯上做文章的人感到担忧。标签只加在表面,而那个能让日后追溯该内容的信号,却在传入的过程中被抹掉了。

信号为何消失

平台会对媒体重新编码:调整尺寸、压缩、剥离元数据、转移托管。每一步都对脆弱的水印不友好,而在生成阶段附加来源信息的系统无法控制之后发生的事。

这正是审计所揭示的张力。生成合成媒体的公司基本上已经完成了为输出内容签名的功课,而分发这些内容的平台却没有做好保留签名的功课——很多时候,它们的常规处理流程在任何人看到帖子之前就已把签名抹去。

结果就是一套这样的标签机制:上传者配合时有效,不配合时失效。希望自己的AI内容被标注的用户通常能得到标签;而希望不被标注的用户只需重新编码文件,平台自己的管线往往还会帮上一把。

水印能做什么,不能做什么

Google DeepMind的SynthID是解决“附着”问题上部署最广的尝试,该实验室于10月1日发布的一期播客异常清晰地阐述了其设计目标。这期节目由Hannah Fry主持,嘉宾包括DeepMind科学副总裁、SynthID的设计者之一Pushmeet Kohli,以及生物安全研究员Jeremy Radcliffe。节目描述了水印之所以有用的几个要素:对人眼不可感知,即便经过编辑和转换也难以去除,并且易于大规模集成和检测。

SynthID的嵌入器和检测器是共同训练的,对抗的是一个会对内容进行裁剪、旋转、缩小和加噪的对手,因此这个标记被设计成恰好能挺过那些会抹掉较弱信号的处理。检测功能内置于Gemini应用中。共享密钥的合作伙伴可通过一项中心化服务接受查验。新闻机构已使用SynthID来核实网上流传的图片。

在抵御无意抹除方面,这是一个强有力的技术立场;但在抵御蓄意抹除方面就不是了,播客对这一局限也直言不讳。标记和元数据可以被剥离或篡改,基于文本的标记可以通过改写来混淆。水印提高的是抹除的成本,而不是让抹除变得不可能。

从图像到蛋白质

节目的后半段转向了更陌生的领域。Radcliffe介绍了SynthID Bio——一个把同样思路应用于AI设计的生物序列的概念验证,从而能区分模型生成的序列与自然界中存在的序列。

其目的是在合成之前实现可追溯性。如果一项设计源自AI系统,为它打上标记意味着在制造出任何实物之前就能确定其来源——这对生物安全的意义,是带水印的照片所不具备的。保护新闻编辑部核查一张流传图片的同一原则,被延伸到了实验室判断某个序列是否应当存在。

这个类比并不完美。蛋白质和DNA序列有着图像所没有的功能约束,而且这一概念验证仍处于早期。但它表明,一旦你接受问题不在于“这是真的吗”,而在于“这是谁签的、什么时候签的”,来源追溯这一理念能走多远。

监管的时钟与信任的鸿沟

规则的追赶速度快于工具。欧盟《人工智能法案》的透明度义务自2026年8月2日起适用,要求对某些AI生成或经操纵的内容加注机器可读标签,并对深度伪造以及部分涉及公共利益的材料向受众作出可见提示。第50条下的罚款最高可达1500万欧元或全球年营业额的3%,以较高者为准。Anthropic已宣布为Claude生成的内容添加水印,加入了一批如今会为输出内容打标的实验室行列。

消费者的期待也变了。在凯捷(Capgemini)2026年对1.2万名消费者开展的一项调查中,67%的人表示,他们期望企业明确标示出向他们展示的广告是AI生成的。对标签的需求并非只来自监管机构。

审计所暗示的是,标签与信任正在渐行渐远。平台可以举出自动标注系统和合规表现。而一位观众看着一条播放量16万、没有任何标签的深度伪造内容时,根本无从得知标签的缺失究竟意味着内容真实,还是标签失灵了。证据的缺失正被解读为真实性的证据,而这恰恰与标签制度本应产生的效果相反。

这个问题的日常版本

审计数字描述的是系统性风险情境,但支配日常内容的却是同一套机制。一张没有标记的AI生成的产品、人物或地点图片在流传时,几乎所有看到它的人都会把它当作照片,而更正——如果真的会来的话——往往在该内容传遍各处之后才姗姗来迟。

另一起事件把这一点展现得更加赤裸。一张AI生成、并不存在的鞋子的图片,被冠以某设计师之名,在匈牙利媒体和社交网络中传播,还被专家评论引用,直到有人确认这款鞋根本不存在。没有人是在洗白什么国家机密,他们只是转发了一张看起来说得通的图片,而核实这一步从未发生,因为核实比转发更费劲。

这正是水印本应解决的实际问题,而它关乎的是默认行为,而非蓄意的对手。大多数人不会去抹掉标记,他们只是会把标记的缺失当成有意义的信息,不管自己是否有意如此。

什么才能真正弥合这一差距

有两项改变对数字的影响会超过水印技术的任何改进。第一是保存:平台需要在自己的处理流程中保留下来的来源信息,而不是把它剥离——这是一项基础设施上的投入,不是模型问题。第二是为标签缺失提供一个公开信号,让未标注的内容被视为未经核实,而非已核实。

C2PA内容凭证(Content Credentials)——这一来源标准背后有横跨Adobe、亚马逊、BBC、谷歌、Meta、微软、OpenAI和索尼的成员支持——最有可能成为第一项改变的载体。它在拍摄或导出时附加一份经过加密签名的清单,并让任何人都能用开放工具加以验证。它无法检测在签名之前就已制造的伪造内容,也不把任何东西归类为真或假。它所做的是建立一条监管链,而这条链恰恰是在通往信息流的路上丢失的东西。

在这条链能挺过上传环节之前,2026年AI标签的诚实总结颇为尴尬:系统是有效的,覆盖不是。而这一空缺,正被观众自行假定的一切填补着。

相关文章