← 返回博客
News预计阅读 9 分钟

Tavus Griffin 在 48% 的情况下被当作真人,而公司并不打算发布它

发布于 2026年10月7日
Tavus Griffin 在 48% 的情况下被当作真人,而公司并不打算发布它

Tavus 于 10 月 1 日发布了 Griffin,将其描述为首个“人类交互模型”:一个全双工的视频到视频系统,能够实时聆听、反应和说话。在一项实时视频通话研究中,54 名参与者中有 26 人在交谈一分钟后认为 Griffin-Lite 是真人。而上一代系统仅做到 41 人中的 1 人,即 2.4%。

在让人相信合成参与者是真人这一点上,这大约提升了二十倍。Tavus 已明确表示,在安全机制就绪之前,不会向公众开放 Griffin。考虑到该模型的能力以及其失效模式的表现,这一决定比演示视频更值得关注。

技术图景

Griffin 以 720p 和每秒 25 帧运行,音频到视频的延迟约为 0.43 秒。在 NVIDIA VideoFDB 基准测试的感知赛道上,它以 3.73 分位居第一,而人类基线为 4.20。它在唇形同步准确度上排名第二,且响应速度比真人更慢。

真正要紧的是访问门槛。一张照片加上十秒音频,就足以生成一个可用的数字分身。Tavus 的 API 已有约 15 万名开发者和企业注册。

把这两个事实放在一起看,风险状况就不是假设性的了。Surfshark 的数据显示,2025 年深度伪造欺诈造成的损失达 11 亿美元,是 2024 年的三倍。在 2024 年香港 Arup 案中,一名员工参加了一场视频会议,会上除他之外的每位参与者都是 AI 伪造的,公司损失了 2500 万美元。

Griffin 并没有让深度伪造成为可能——这多年来一直可以做到。它让深度伪造变得可交互。预先录制的伪造内容只能回答创作者预想到的问题。实时系统则能回答任何被问到的问题,而对话的另一方还以为自己是在和同事交谈。

当伪造者能够即兴发挥时,什么变了

Arup 案之所以得手,是因为诈骗者准备了一个剧本,而目标接受了它。实时生成消除了准备这一限制。现在,来电者可以即兴应对一个意料之外的问题(询问某个项目细节、提及一次共同参加的会议、对某个玩笑作出反应),并在不到半秒内生成一个听起来合理的回应。

正是在这里,0.43 秒的延迟数字不再只是规格表上的一行参数。人类对话中的轮换间隔大约为 200 毫秒。430 毫秒的 Griffin 明显偏慢,但并未超出网络不佳或在嘈杂房间中的人的表现范围。这一间隔可以被情境掩盖,而这正是其危险之处:用户会把它归因于网络状况,而不是觉得有什么不对劲。

Tavus 不发布产品的决定,反映出对这一点的准确判断。公司正处在两种立场之间。在受控研究中,这项技术已明确证明能够骗过大多数参与者。而相应的对策(来源标记、活体检测、通话中的身份验证)尚未达到该技术所需的规模。

基准测试有人类基线,而这正是关键

值得注意的是,VideoFDB 报告的人类得分为 4.20,而 Griffin 为 3.73。该模型在所有系统中排名第一,却仍低于人类。这一差距就是当前的最先进水平,而它正在以这样的速度缩小,使得“低于人类”带来的安慰越来越有限。

更有用的数字是参与者相信率随时间的变化。该研究测量的是交谈一分钟后的相信率。大多数识别策略依赖于观察者在更长的时间窗口内注意到某些东西:一个重复的手势、一个与对话历史不符的回应、一个被两次回避的问题。一个能撑过第一分钟但在五分钟内逐渐露馅的系统,与一个能维持一小时不露破绽的系统,是不同级别的威胁,而公布的数据只涵盖了前者。

组织现在应该做什么

防御性建议并不光鲜,而且大多是组织层面的。

对任何财务指令仅做基于文本的验证已不再足够,仅靠语音验证同样不够。回拨一个已知号码,比与一位陌生参与者进行视频通话更可靠,因为即便对方身份存疑,通道本身是经过验证的。共享秘密在泄露之前有效——而它们确实会泄露。

更有力的措施是流程性的:高价值指令应要求通过第二个独立渠道确认,而该渠道必须是请求方无法主动发起的。正因如此,这在资金管理业务中已是标准做法,而在任何视频参与者都可能是合成的世界里,它同样适用。

对平台运营方而言,压力集中在活体检测与来源验证上。C2PA 清单和 SynthID 水印能为生成媒体附加来源信息,但两者都无法在重新编码后可靠留存。实时视频则完全没有清单,这意味着验证必须在接收端、在通话过程中进行,依据的是行为信号——而 Griffin 恰恰就是被训练来逼真地产生这些信号的。

这里有一种令人不快的循环,值得点明。人们用来判断视频参与者是否为真人的行为信号(自然的停顿、微表情、对意外内容的恰当反应),正是实时模型被优化去复现的信号。基于这些信号的检测会让防御方永远处于落后位置:当当前一代模型已经学会避免上一代的破绽时,他们还在检查那些破绽。

更难伪造的信号是模型无法控制的那些:身份声明能否通过独立渠道验证、账户是否有历史记录、能否通过不同途径再次联系到同一个人。答案是身份基础设施,而非行为检测。

披露标准才是真正的战场

Tavus 的克制是一个公司决定,而公司决定是可以逆转的。持久的问题是:当一个系统能在大多数短时互动中冒充人类时,默认规则应该是什么。

可作类比的是欧盟《人工智能法案》以及如今在全球陆续生效的合成内容标识制度。这些规则是围绕可在生成后加以标记的媒体设计的,依靠元数据和可见标签。实时合成视频并非如此。没有任何东西可以标注,因为其输出是短暂的、对话式的。披露必须是发起通话的系统本身的一种属性——即自动化参与者拥有一个已注册、可验证的身份,且接收方能够核验。

这是一个可以解决的工程问题,但还没有人真正落地。在有人做到之前,诚实的现状是:一家公司造出了能在视频通话中让大多数人相信机器是人的东西,公布了证明其有效的数据,却拒绝发布它。这比另一种结果要好,但这个决定只在某一家公司愿意维持时才成立。

相关文章