深度伪造检测有三道防线,而第一道防线靠自愿

检测工具的表现比大多数人以为的要好,但这并不是它听起来那样令人安心的事实。基于水印的来源溯源在标记存在时能提供接近 100% 的准确率。而当生成器拒绝添加标记时,它就什么都提供不了。
这种不对称正是整个问题的全貌。分层防御确实存在,而其中一层依赖于你正试图检测的那一方的配合。
实际后果是:检测准确率表现为三个数字,描述三种不同的机制,而效果最好的那种机制覆盖面最窄。随时明白自己此刻依赖的是哪种机制,决定了你拥有的是真正的安全态势,还是一种虚假的安全感。
第一道防线:来源溯源,需要获得同意
Google 的 SynthID 所嵌入的信号能经受裁剪、旋转、缩小和添加噪声,因为嵌入器与检测器是共同针对一个恰好会执行这些变换的对手训练出来的。检测功能已内置于 Gemini 应用中,而共享密钥的合作伙伴可通过一项中央服务接受检查。Anthropic 已宣布为 Claude 的输出添加水印。采用 C2PA 内容凭证(Content Credentials)的公司会在文件中附加经过签名的来源数据。
当标记存在时,检测准确率接近 100%,且检查只需几毫秒。技术已经成熟,标准也已存在。
缺口在于采用。欧盟《人工智能法案》自 2026 年 8 月 2 日起,要求某些由 AI 生成或操纵的内容带有机器可读标签,并对深度伪造提供受众可见的提示。合规情况参差不齐,而那些最有动力制作逼真假货的行为者,根本没有理由主动贴上标签。水印和来源溯源能帮助诚实的行动者证明自己诚实,却触及不到那些开展虚假信息宣传的人。
第二道防线:伪影检测,会逐渐退化
基于伪影的检测寻找生成过程留下的痕迹,在它训练过的模型上可达到 85% 至 92% 的准确率。真正重要的数字,是它遇到没见过的模型时会发生什么。在扩散模型或特定声码器上训练的分类器,面对全新架构时性能大约会损失 40%;音频上的等错误率会从域内的 3.8% 跃升至域外的 18.5%。
这种退化是结构性的,无法修复。每一个新的生成模型都会改变检测所依赖的统计特征,因此检测器始终依据的是对上一代工具的描述。商业检测厂商会在重大模型发布后几天内更新指纹,这是一场跑步机式的无尽追逐,而不是解决方案。
像素级取证仍然能抓住真实案例。产品上的光照与背景光照不一致、噪声模式匹配某个已知扩散模型、每分钟眨眼三次而人类平均为十五到二十次、嘴唇动作与音轨相差零点几秒。这些检查确实有效,但面对下一个修复了这些问题的模型,它们就会失效。
第三道防线:网络行为,能抓到宣传行动
第三种方法不再盯着内容,而是开始观察分发模式。协同性的虚假信息宣传会在发帖模式、账号创建时间和分享网络中留下痕迹,网络分析在大规模行动上可达到 70% 至 80% 的准确率。它速度快,能捕捉到伪影检测漏掉的东西。
它在个人层面最关键的情形上却力不从心。一个精心制作的单一假货,通过普通账号传播,模仿自然的人类活动,没有任何网络特征可供发现。
每道防线实际在哪里失效
把三道防线放在同一张表上,问题的全貌就清晰了。来源溯源近乎完美,却出于自愿。伪影检测覆盖面广,却会随每个新模型而衰减。网络分析速度快,却对个案视而不见。

这些失效模式会相互叠加。在模型发布后重新训练过的伪影检测器对该模型准确,对下一个模型则不确定,而厂商的更新周期以天计,模型发布周期却以周计。若一个平台把检测器输出当作主要筛选手段,它就会始终落后对手一步,而对手只需要赢一次。
最常见的实际错误,是把检测分数当作裁决。一个报告“生成可能性 98%”的分类器,报告的其实是与它训练过的模式的相似度。这是强有力的证据,但不是证明,在任何会因指控真人欺诈或捏造而产生后果的场景中,这一区别都至关重要。
误报也有其自身代价。一个把人类乐队的音乐误判为完全由 AI 生成的检测器,等于告诉一位在职艺术家,其作品看起来像机器做的——这是任何准确率统计都无法体现的声誉问题。随着 AI 辅助工作流在创意领域变得普遍,处于临界地带的案例数量会增加,可能被错误标记的人也随之增多。
这在实践中意味着什么
对新闻编辑室或平台而言,可用的原则是分层处理。在接收环节用基于 API 的工具筛查流入的媒体。对任何高风险内容,将自动检测与人工核验结合。维护一个已知 AI 内容农场数据库以提供背景信息。
五角大楼已承认其在追踪 AI 助力的虚假信息宣传方面存在能力缺口,这表明即便是资源充足的政府检测也落后于商业领域。欧盟的监管保障措施被批评为不足以应对会调整策略的国家支持行为者。
审计一套检测技术栈本身就是一门专业。一个会报告自身置信区间、训练数据截止时间和已知失效模式的工具,比只报告单一百分比的工具更有用,因为操作者可以据此判断何时该信任它。公布误报率和更新频率的厂商,比只公布准确率的厂商更有价值。
诚实的总结是:检测是防御中的一层,而不是独立的答案,而最强的那一层恰恰依赖于那些没有动力主动参与的人。这使得来源批判、发布者的声誉以及个体读者的判断,承担的份量超过任何分类器。对于日常消费,对每张图片都做完整核验并不现实,人们每天真正要回答数百次的问题不是“这是真的吗”,而是“我是否信任它的来源”。
美国国家标准与技术研究院(NIST)的研究从另一个方向说明了这一点。信任取决于帮助用户解读系统表现的设计要素,而不仅仅是表现本身。透明性才能让人形成切合实际的预期。而凯捷(Capgemini)2026 年对 12,000 名消费者的调查发现,67% 的人期望公司在广告由 AI 生成时明确标示,这表明受众已准备好接受披露成为默认做法。生成方是否准备好,则是另一个问题。
监管时间线也在并行推进。欧盟《人工智能法案》自 2026 年 8 月 2 日起适用,要求某些 AI 生成内容带有机器可读标签,并对深度伪造及部分公共利益材料提供受众可见的提示。Anthropic 已宣布为 Claude 的输出添加水印。可靠识别文本和视觉 AI 输出的标准仍在制定中,这意味着当下的合规依赖于无法互操作的专有方法。