← 返回部落格
News預計閱讀 9 分鐘

Tavus Griffin 在 48% 的時間裡被當成真人,而該公司並未推出它

發布於 2026年10月7日
Tavus Griffin 在 48% 的時間裡被當成真人,而該公司並未推出它

Tavus 於 10 月 1 日發布 Griffin,將其描述為首個「人類互動模型」(Human Interaction Model):一套全雙工視訊對視訊系統,能即時聆聽、反應與說話。在一項即時視訊通話研究中,54 名參與者中有 26 人在交談一分鐘後相信 Griffin-Lite 是真人。前一代系統僅有 41 人中的 1 人,也就是 2.4%。

這大約是說服人們相信合成參與者為真人的能力提升了二十倍。Tavus 已明確表示,在安全機制準備就緒之前,不會將 Griffin 開放給大眾。考量到這套模型的能力以及失效模式可能帶來的後果,這個決定比展示影片更值得關注。

技術概況

Griffin 以 720p 和每秒 25 幀運行,音訊到視訊的延遲約為 0.43 秒。在 NVIDIA 的 VideoFDB 基準測試的感知賽道上,它以 3.73 排名第一,而人類基準為 4.20。它在唇形同步準確度上排名第二,且回應速度比真人慢。

使用門檻才是關鍵所在。一張照片加上十秒音訊,就足以生成一個可用的數位分身。Tavus 的 API 約有 15 萬名開發者和企業註冊。

把這兩件事放在一起看,風險狀況就不是假設性的。Surfshark 的數據顯示,2025 年深偽詐騙損失達 11 億美元,是 2024 年的三倍。在香港 2024 年的 Arup 案中,一名員工加入了一場視訊會議,會議中其他參與者全都是 AI 捏造出來的,該公司因此損失 2,500 萬美元。

Griffin 並非讓深偽成為可能;那在多年前就已辦得到。它讓深偽變得可互動。預錄的假影片只能回答創作者預先設想好的問題。即時系統則能回答任何被問到的問題,讓另一方以為自己正在與同事對話。

當偽造品能即興發揮時,有什麼改變

Arup 案之所以成功,是因為詐騙者準備好了一套情境,而目標對象接受了。即時生成消除了準備上的限制。來電者現在可以針對意料之外的問題即興應對(詢問專案細節、提及共同參加過的會議、對笑話做出反應),並在半秒內生成看似合理的回應。

這就是 0.43 秒延遲數字不再只是規格表項目的地方。人類對話輪替的間隔約為 200 毫秒。在 430 毫秒時,Griffin 明顯偏慢,但並未超出連線不良或身處吵雜環境中的人可能出現的範圍。這個落差可以被情境掩蓋,而這正是它危險的原因:使用者會把它歸因於網路狀況,而不是某個地方出了問題。

Tavus 不推出的決定反映了對此準確的判讀。該公司正處於兩個立場之間。這項技術在受控研究中已明顯能欺騙大多數參與者。反制措施(來源標記、活體偵測、通話中的身分驗證)尚未以這項技術所需的規模到位。

基準測試有人類基準,而這正是重點

值得注意的是,VideoFDB 回報的人類分數為 4.20,而 Griffin 為 3.73。這套模型在系統中排名第一,卻仍低於人類。這個差距就是目前的技術水準,而且它正在縮小,縮小的速度讓「低於人類」這種安慰越來越不可靠。

更有用的數字是參與者隨時間變化的相信比率。該研究測量的是交談一分鐘後的相信程度。大多數偵測策略都依賴觀察者在更長的時間窗口內注意到某些端倪:重複的手勢、與對話歷史不符的回應、同一個問題被迴避兩次。一套能撐過第一分鐘、但在五分鐘內逐漸露餡的系統,與一套能維持一小時的系統是不同的威脅,而公布的數字只涵蓋了前者。

組織現在應該做什麼

防禦建議並不光鮮亮麗,而且大多屬於組織層面。

對任何財務指令進行文字驗證已不再足夠,語音驗證也一樣。回撥到已知號碼,比與未知參與者進行視訊通話更好,因為即使線上那個人可能不是本人,這個管道仍是經過驗證的。共享秘密在洩漏之前有效,而它們確實會洩漏。

更強而有力的措施是程序性的:高價值指令應要求透過第二個獨立管道確認,而且這第二個管道必須是請求者無法主動發起的。這正是資金管理作業的標準做法,而且也能套用到任何視訊參與者都可能是合成人的世界。

對平台營運商而言,壓力在於活體偵測與來源追溯。C2PA 資訊清單和 SynthID 浮水印會為生成的媒體附加來源資訊,但兩者都無法在重新編碼後可靠留存。即時視訊完全沒有資訊清單,這意味著驗證必須在接收端、通話過程中進行,而且得依據行為訊號,而這些訊號正是 Griffin 被訓練來逼真產生的東西。

這裡有個值得指出的令人不快的循環。人們用來判斷視訊參與者是否為真人的行為訊號(自然的停頓、微表情、對意外內容的適當反應),正是即時模型被優化來重現的訊號。基於這些訊號的偵測會讓防禦者永遠處於落後位置,總是在當前一代已學會避免之後,才去檢查上一代的破綻。

更難偽造的訊號,是那些超出模型控制範圍的訊號:身分主張是否能透過獨立管道驗證、該帳號是否有歷史紀錄、同一個人是否能透過不同途徑第二次聯繫上。這是身分基礎設施,而不是行為偵測。

揭露標準才是真正的戰場

Tavus 的克制是公司決定,而公司決定是可以逆轉的。更持久的問題是:當一套系統在大多數簡短互動中都能冒充人類時,預設做法應該是什麼。

可以拿來對比的是歐盟《人工智慧法》以及全球各地正在生效的合成內容標示制度。那些規則的設計前提是媒體可以在生成後被標記,透過中介資料和可見標籤。即時合成視訊並非如此。沒有東西可以標示,因為輸出是短暫且對話式的。揭露必須是撥打這通通話的系統本身的屬性,也就是自動化參與者要有一個已註冊、可驗證的身分,讓接收方可以查核。

這是個可解決的工程問題,而還沒有人推出它。在有人做到之前,誠實的現況是:一家公司打造出能在視訊通話中讓大多數人相信機器是人的東西,公布了顯示它有效的數據,並拒絕發布它。這比另一種結果更好,但這個決定只有在該公司願意的期間內才成立。

相關文章