浮水印追不上偽造內容的腳步

各平台現在會自動為 AI 生成的內容加上標籤。但一份最新稽核報告指出,這些標籤仍然漏掉了最要緊的那些偽造內容。
研究人員以歐盟執委會 2026 年 7 月的深偽內容指引為基準,稽核了 Instagram、TikTok、X 與 YouTube 上的 AI 標示。四個平台都會自動套用標籤,而且由平台本身而非上傳者套用的比例更高,相較於先前的稽核是一大進展。問題出在涵蓋範圍。
在系統性風險情境中,由專家辨識出的深偽內容只有 33% 帶有平台套用的 AI 標籤。這些未標示的項目觀看次數中位數達到 16 萬次,意味著大批觀眾在毫無警示的情況下看到了它們。在帶有標準來源訊號的 AI 生成內容受控上傳測試中,平台只為 61% 加註標籤,並且完全移除了其中 39% 上傳內容裡的隱藏訊號。
最後這個數字,應該讓所有以來源追溯為基礎打造產品的人感到憂心。標籤只加在表層。能讓人在日後追溯該項目的訊號,卻在進入平台的過程中就被移除了。
為什麼訊號會消失
平台會重新編碼媒體檔案。它們調整尺寸、壓縮、移除中介資料,並重新託管。上述每一個步驟都對脆弱的浮水印毫不友善,而在生成階段附加來源資訊的系統,根本無法控制之後發生的事。
這正是這份稽核所揭示的張力。生成合成媒體的公司大致已完成為自家輸出簽章的工作。散布這些內容的平台卻沒有做好保全簽章的功夫,而且在許多情況下,它們的常規處理流程在任何人看到貼文之前就把簽章移除了。
結果就是一套只在上傳者願意配合時才有效的標示制度,一旦對方不配合就失效。想讓自己的 AI 內容被標示的使用者,通常都能如願;想讓內容不被標示的使用者,只要重新編碼檔案就行,而平台自家的處理管線往往還會幫上一把。
浮水印能做什麼、不能做什麼
Google DeepMind 的 SynthID 是解決「附加」這個問題最廣泛部署的嘗試,該實驗室於 10 月 1 日發布的 podcast 異常清楚地說明了其設計目標。節目由 Hannah Fry 主持,嘉賓包括 DeepMind 科學副總裁、SynthID 架構師之一 Pushmeet Kohli,以及生物安全研究員 Jeremy Radcliffe。節目描述了浮水印之所以有用的條件:對人而言不可察覺、即使經過編輯與轉換仍難以移除,並且易於大規模整合與偵測。
SynthID 的嵌入器與偵測器是共同訓練的,對抗的是一個會裁剪、旋轉、縮小並加入雜訊的對手,因此這個標記天生就能挺過那些會抹除較弱訊號的處理流程。偵測功能內建於 Gemini 應用程式中。分享金鑰的合作夥伴可透過中央服務進行查驗。新聞機構已使用 SynthID 來驗證網路上流傳的圖片。
在對抗意外移除方面,這是相當強勢的技術立場。但面對刻意移除,它並不強勢,而節目對這個限制也很誠實。標記與中介資料可以被剝除或竄改。以文字為基礎的標記可以透過改寫來混淆。浮水印提高了抹除的成本,卻無法讓抹除變得不可能。
從圖片到蛋白質
節目的後半段轉往一個更奇特的方向。Radcliffe 介紹了 SynthID Bio,這是一項概念驗證,把同樣的概念套用到 AI 設計的生物序列上,讓模型產出的序列能與自然界發現的序列區分開來。
其目的是在合成之前先建立可追溯性。若一項設計源自 AI 系統,為它加上標記就意味著在任何實體被製造出來之前,就能確認其來源;這對生物安全的重要性,遠非一張加上浮水印的照片可比。保護新聞編輯室核查流傳圖片的那套原則,被延伸到了實驗室判斷某個序列是否該存在的情境。
這個類比並不完美。蛋白質與 DNA 序列具有圖像所沒有的功能限制,而且這項概念驗證仍處於早期階段。但它顯示出,一旦你接受問題不是「這是不是真的」,而是「這是誰在何時簽署的」,來源追溯的概念能走得多遠。
法規時鐘與信任落差
法規的腳步比工具更快。歐盟《AI 法》的透明度義務自 2026 年 8 月 2 日起適用,要求特定 AI 生成或經操弄的內容必須具備機器可讀的標籤,深偽內容及部分涉及公共利益的素材則須附上觀眾可見的告知。第 50 條的罰則最高可達 1,500 萬歐元或全球年營業額的 3%,以較高者為準。Anthropic 已宣布為 Claude 產生的內容加上浮水印,加入了一長串如今會標記自家輸出的實驗室行列。
消費者的期待也改變了。在 Capgemini 於 2026 年針對 12,000 名消費者所做的調查中,67% 表示他們期待企業在展示 AI 生成的廣告時能清楚標示。標示的需求並不只來自監管機關。
這份稽核所暗示的是,標籤與信任正在漸行漸遠。平台可以指著一套自動標示系統和法規遵循來說明。但一位看著有 16 萬次觀看、卻沒有任何標籤的深偽內容的觀眾,根本無從得知標籤的缺席代表內容是真的,還是標籤失效了。證據的缺席正被解讀為真實性的證據,而這恰恰與標示制度應該產生的效果相反。
這個問題的日常版本
稽核數字描述的是系統性風險情境,但同樣的機制也主宰著一般內容。一張 AI 生成、關於某個產品、某個人或某個地點的圖片,若在沒有標記的情況下流傳,幾乎每個看到的人都會把它當成照片;而更正——如果真的出現的話——往往在內容早已傳遍各處之後才到來。
另一集節目把這點說得更鮮明。一張 AI 生成、並不存在的鞋款圖片,被冠上某位設計師之名,在匈牙利媒體與社群網路上擴散,並在專家評論中被引用,直到有人確認這件單品根本不存在為止。沒有人是在漂白國家機密。他們只是轉傳了一張看起來合理的圖片,而查證這一步從未發生,因為查證比分享難得多。
這正是浮水印本欲解決的實際問題,而它是一個關於預設值的問題,而非關於死心塌地的對手。大多數人不會去剝除標記。他們只會單純地把標記的缺席當成有意義的訊息,無論他們是否有意如此。
真正能縮小落差的做法
有兩項改變會比任何浮水印技術的改良更能推動數字。第一是保全:平台必須讓來源資訊通過自家的處理流程,而不是把它剝掉——這是基礎設施層面的承諾,不是模型問題。第二是針對標籤缺失提供公開訊號,讓未標示的內容被視為未經驗證,而不是已驗證。
C2PA Content Credentials 是第一個改變最可能的載體。這個來源標準背後有橫跨 Adobe、Amazon、BBC、Google、Meta、Microsoft、OpenAI 與 Sony 的會員支持。它在拍攝或匯出時附加一份以密碼學簽署的清單,讓任何人都能用開放工具驗證。它無法偵測在簽署之前就造出的偽造品,也不會把任何東西歸類為真或假。它所做的,是建立一條保管鏈——而這正是內容送往動態消息途中會流失的東西。
在這條鏈能在上傳過程中存續之前,2026 年 AI 標示的誠實總結其實有點尷尬。系統是可行的。涵蓋範圍卻不行。而這個落差,正由觀眾自行假設的內容填補。