谷歌将其 SynthID 检测器向所有人开放。请细读细则。

10 月 7 日,谷歌将其 SynthID 检测器向公众开放,任何人都可以检查图片、视频或音频文件中是否藏有 AI 水印。位于 synthid.com 的门户网站已在全球上线,界面为英文。使用 Google、OpenAI 或 Apple 账号登录,上传文件即可。
相较以往的状况,这是一次真正的改进:过去,若想在谷歌的受信测试者计划之外检查 SynthID,唯一的方法就是去问 Gemini,然后自行解读它的回答。检测水印本不应需要与施加水印的模型对话。直到本周之前,该检测器一直只向一组测试者开放——他们是去年在 Google I/O 上获得访问权限的记者、媒体从业者和研究人员——而结果往往是一整段文字,可你想要的只是一个比特。
规模化是什么样子
SynthID 背后的数字相当庞大。谷歌表示,自 2023 年推出以来,它已为超过 1800 亿张图片和视频,以及 24 万年的音频内容添加了水印。如今,搜索、Gemini 应用和 Chrome 中运行的验证流程每天要处理超过一百万次请求。
真正有意思的是其机制。SynthID 将信号直接嵌入图片或视频的像素之中,以及音频的频率分量之中,而不是放在可被剥离的元数据里。对于图片和视频,水印在内容生成的那一刻就被写入,并被设计为能经受裁剪、滤镜、帧率变化和有损压缩。对于音频,它则被设计为能承受额外噪声、MP3 压缩和播放速度变化。Gemini 应用的文本水印机制有所不同:它调整模型分配给候选词的概率分数,从而让可见输出保持不变。
信号存放位置的不同,正是 SynthID 能挺过那些会彻底剥离元数据的操作的原因。截图、重新编码和清除元数据都会抹掉来源标签,但它们抹不掉织入像素值本身的图案。代价是,像素级信号也最可能在剧烈变换下退化,这正是检测器要求你上传手头最高质量文件的原因。
支持的格式相当广泛:图片包括 JPG、PNG、WEBP、HEIC 以及其他几种类型;视频包括 MP4、MOV 和 WEBM;音频包括 WAV、MP3、OGG、FLAC、AAC 和 M4A。
真正的扩展在于合作伙伴关系
此前,该检测器只检查谷歌自家的 SynthID。ChatGPT 生成的图片同样带有 SynthID,但谷歌的工具却不会标记它们。这一限制如今已不复存在。检测器现在支持所有 SynthID 合作伙伴的水印,包括 OpenAI、NVIDIA 和 Kakao,Apple 也即将加入。
实际效果是,一次上传就能识别多家主要供应商的输出,而不必到每家公司的验证页面分别检查。OpenAI 仍保留着自己的页面,所以一张疑似 ChatGPT 生成的图片有两个地方可以查。
这些局限同样值得大书特书
该网站明确表示,它并非通用的 AI 检测器,而这句免责声明比功能本身更重要。它只能识别来自已采用 SynthID 的公司的媒体内容。微软和 Meta 运行着各自的水印与验证标准,两家都不在合作伙伴名单上。Meta 的检测器此前已被发现漏检了一些自家生成、经过裁剪的 AI 图片。
接下来是开放权重模型的问题。任何人都可以在自己的硬件上运行开源模型,生成的输出完全不带水印,也没有任何元数据标注。这类内容永远不会出现在检测器中。
因此,阴性结果意味着文件来源不明,而并不意味着文件真实。它可能来自合作伙伴网络之外的模型,也可能因为经过大幅修改,信号已退化到无法检测的程度。网站自身给出的建议是:上传可获得的最高质量版本,并在得出结论前收集多方面的数据点。
网站还提到了相反方向的失效模式,而这受到的关注较少。在极少数情况下,检测器会对完全不含水印的内容误报触发。假阳性比假阴性更具破坏性,因为它会让人指控一张真实照片是合成的。两个方向的错误都存在,而两者都不能替代对文件来源的核实。
访问权限被刻意限制
该工具免费但有门槛。用户每天大约可以进行 10 次图片、视频和音频检查,且必须登录。谷歌工程师表示,设置这一限制是为了防止有人利用这些检查来开发 SynthID 移除工具。配额数字只是大致说法,因为如果你检查大量非常相似的文件,系统可能会更早把你锁在外面——那种行为模式看起来就像有人在调试规避手段。
根据隐私声明,上传的媒体会实时处理,并在结果返回后删除,不过文件的数字签名会保留 24 小时,以执行配额限制。条款禁止逆向工程检测逻辑、自动化发起查询,以及创建多个账号来规避限制。
两种来源溯源理念
SynthID 属于主动式水印:给 AI 内容打标签。另一种思路则相反,是给真实内容打标签——使用 C2PA 之类的加密标准,在拍摄的那一刻就把来源信息签入文件。谷歌的 Pixel 手机是为数不多这样做的设备之一。
两种方式失效的环节不同。水印依赖生成方配合,而开放权重模型没有理由这么做。加密签名依赖拍摄设备配合,这使其仅限于出厂即具备该能力的硬件。两者都无法独自覆盖整个问题,实际建议是两者并用,同时还得做那些不那么光鲜的工作:核查来源、日期和语境。
水印方案之所以率先落地,有其结构性原因。它不需要新硬件,也不需要改变内容的消费方式,还可以通过一次更新被加装到现有模型上。而加密溯源则需要一个由拍摄设备、编辑工具和查看器组成的生态,各方就同一标准达成一致,而这个生态目前基本还停留在愿景阶段。更容易走的路先被修好,而更容易走的路盲区也更大。
此外还有一个没有人能给出好答案的对抗性问题。水印被设计得耐久,但这并不等于不可移除。每一个公开的检测工具,都会为试图破解它的人提供训练信号——这正是谷歌要限制配额并禁止自动化查询的原因。检测器很有用,同时它也是一张为那些想抹掉水印的人绘制的地图。
要点总结
一个有用的思维模型是:SynthID 给你的,是一个强有力的「是」,和一个非常微弱的「否」。阳性匹配指向一组特定的供应商;阴性匹配几乎什么都说明不了。任何把后者当作一张「健康证明」的人,都是在错误地使用这个工具,而谷歌自己的文档对此异常坦诚。
检测工具的更广泛开放,对媒体素养而言是一次实实在在的胜利。但这场胜利比公告听起来要小得多,而真正的用处恰恰在于那些注意事项之中。