← 返回部落格
News預計閱讀 11 分鐘

深偽偵測有三道防線,而第一道靠的是自願配合

發布於 2026年10月7日
深偽偵測有三道防線,而第一道靠的是自願配合

這些偵測工具的表現比多數人以為的更好,但這並不像聽起來那麼令人安心。以浮水印為基礎的來源追溯,在標記存在時能達到接近 100% 的準確率;但當生成器拒絕加入標記時,它什麼也做不到。

這種不對稱正是問題的全貌。分層防禦確實存在,而其中一層卻取決於你正試圖偵測的那一方是否願意配合。

實際後果是,偵測準確率會以三個數字呈現,分別描述三種不同的機制,而效果最好的那個機制,涵蓋範圍卻最窄。隨時清楚自己當下依賴的是哪一種機制,正是「真正具備安全態勢」與「只是自以為有」之間的差別。

第一道防線:來源追溯,需要當事人同意

Google 的 SynthID 會嵌入一種訊號,即使經過裁切、旋轉、縮放和加入雜訊仍能存續,因為嵌入器與偵測器是共同訓練的,訓練時的對手正好會執行這些轉換。偵測功能已內建於 Gemini 應用程式中,而願意分享金鑰的合作夥伴則可透過中央服務進行查驗。Anthropic 已宣布為 Claude 的輸出加上浮水印。採用 C2PA 內容憑證(Content Credentials)的公司,則會在檔案中附加經過簽章的來源資料。

當標記存在時,偵測準確率接近 100%,且檢查只需毫秒級的時間。這項技術已經成熟,標準也已存在。

落差在於採用率。歐盟《人工智慧法案》(EU AI Act)自 2026 年 8 月 2 日起,已要求某些 AI 生成或經操縱的內容必須附上機器可讀的標籤,深偽內容還必須向受眾顯示明顯告知。合規情況參差不齊,而那些最有動機製作出逼真假內容的行為者,根本沒有理由主動加上標籤。浮水印與來源追溯能幫助誠實的行為者證明自己誠實,卻觸及不到正在發動假訊息攻勢的人。

第二道防線:偽影偵測,會逐漸失效

以偽影為基礎的偵測會尋找生成過程留下的痕跡,在它訓練過的模型上可達到 85% 到 92% 的準確率。真正關鍵的數字,是它遇到沒見過的模型時會發生什麼事。以擴散模型或特定聲碼器訓練的分類器,面對新架構時大約會損失 40% 的效能;音訊上的等錯誤率(EER)會從領域內的 3.8% 躍升到領域外的 18.5%。

這種效能衰退是結構性的,而非可以修補的。每一個新的生成模型都會改變偵測所依賴的統計特徵,因此偵測器始終只能依據對上一代工具的描述來運作。商業偵測廠商會在某個大型模型發布後幾天內更新指紋,這是一場永無止境的跑步機,而不是解決方案。

像素級的鑑識仍然能抓到真實案例。產品上的光線與背景光照不一致、雜訊模式吻合某個已知的擴散模型、每分鐘眨眼三次(人類平均為十五到二十次)、嘴型與音軌相差不到一秒。這些檢查確實有效,但等到下一個修正這些破綻的模型出現時,它們就會失效。

第三道防線:網路行為,能揪出協同操作

第三種方法不再看內容,而是改看散布模式。協同的假訊息操作會在發文模式、帳號建立時間和分享網路中留下痕跡,網路分析在大規模操作上可達到 70% 到 80% 的準確率。它速度快,也能抓到偽影偵測漏掉的東西。

但它在個人層面上最要緊的那種情況卻使不上力。單一、精心製作的假內容,透過一般帳號散布,模仿自然的人類活動,根本沒有網路特徵可供追查。

每一道防線實際上的破口在哪裡

把三道防線放在同一張表上,問題的輪廓就清楚了。來源追溯近乎完美,但靠自願。偽影偵測涵蓋面廣,卻隨著每個新模型而衰減。網路分析速度快,卻對個人案例視而不見。

Three translucent frosted glass panes standing at slight angles on a pale stone surface, soft daylight passing through them

這些失效模式會彼此疊加。一個在模型發布後重新訓練過的偽影偵測器,對那個模型很準,對下一個模型卻沒把握;而廠商的更新週期以天計算,模型發布週期卻以週計算。一個把偵測器輸出當成主要篩檢依據的平台,永遠慢對手一步,而對手只需要贏一次。

最常見的實務錯誤,是把偵測分數當成判決。一個回報「98% 機率為生成內容」的分類器,實際上是在說它與訓練過的某些模式相似。這是強而有力的證據,但不是證明;在任何可能導致指控真人詐欺或偽造的場合,這個差別都很重要。

偽陽性也有自己的代價。一個把真人樂團的音樂誤判為完全由 AI 生成的偵測器,等於告訴一位仍在線上工作的藝術家,他的作品看起來像是機器做的——這是任何準確率統計都捕捉不到的聲譽問題。隨著 AI 輔助工作流程在創意領域變得常態化,邊界案例的數量會增加,可能被錯誤標記的人數也會隨之上升。

這在實務上代表什麼

對新聞編輯室或平台而言,可行的準則是採取分層做法。在媒體進站的當下,用 API 型的工具先篩檢;對任何高風險的內容,把自動偵測與人工查核配對使用;並維護一份已知 AI 內容農場的資料庫,以掌握背景脈絡。

五角大廈已坦承,其在追蹤 AI 助長的假訊息活動方面存在缺口,這顯示即使是資源充足的政府機構,偵測能力也落後於商業部門。歐盟的監管保障措施則被批評不足以應對會隨時調整戰術的國家支持行為者。

稽核一套偵測技術堆疊本身就是一門專業。一個會回報信賴區間、訓練資料截止時間和已知失效模式的工具,會比只回報單一百分比的工具更有用,因為操作者可以據此推斷何時該信任它。願意公布偽陽性率和更新頻率的廠商,比只公布準確率的廠商更有價值。

誠實的總結是:偵測只是防禦中的一層,而非獨立完整的答案,而最強的那一層,恰恰取決於那些毫無動機主動加入的人。這使得來源批判、發布者的聲譽,以及個別讀者的判斷,承擔了比任何分類器都更重的工作。就日常的資訊消費而言,對每張圖片都做完整查核並不實際,而人們每天實際上要回答幾百次的問題,不是「這是真的嗎」,而是「我信不信任它的來源」。

美國國家標準暨技術研究院(NIST)的研究則從另一個方向印證了這一點:信任取決於能幫助使用者解讀系統效能的設計元素,而不只是效能本身。透明度才能讓人們建立務實的期待。而 Capgemini 於 2026 年對 12,000 名消費者進行的調查發現,67% 的人期望企業在廣告由 AI 生成時明確標示,這顯示受眾已準備好讓揭露成為預設做法。生成方是否也準備好了,則是另一回事。

監管時程正同步推進。歐盟《人工智慧法案》自 2026 年 8 月 2 日起適用,要求某些 AI 生成內容附上機器可讀標籤,深偽及部分涉及公共利益的素材則須向受眾明顯告知。Anthropic 已宣布為 Claude 的輸出加上浮水印。可靠辨識文字與視覺 AI 輸出的標準仍在發展中,這意味著今日的合規仍仰賴彼此無法互通的專有方法。

相關文章