Google 向所有人開放了 SynthID 偵測器。魔鬼藏在細節裡。

Google 於 10 月 7 日向大眾開放 SynthID 偵測器,讓任何人都能檢查圖片、影片或音訊檔案是否含有隱藏的 AI 浮水印。synthid.com 入口網站已在全球上線,目前提供英文版。使用 Google、OpenAI 或 Apple 帳戶登入並上傳檔案。
這比過去的情況確實是一大進步:以往若不在 Google 的受信任測試人員計畫內,想檢查 SynthID 的唯一方法就是詢問 Gemini,再解讀它回覆的內容。偵測浮水印不該需要和套用浮水印的模型對話。直到本週之前,這款偵測器只提供給去年在 Google I/O 取得存取權的記者、媒體專業人士與研究人員測試小組使用,而且答案往往是一整段文字,但你想要的其實只是一個位元。
規模化的實際樣貌
SynthID 背後的數字很龐大。Google 表示,自 2023 年推出以來,已為超過 1,800 億張圖片和影片,以及 24 萬年的音訊內容加上浮水印。如今,在 Google 搜尋、Gemini 應用程式和 Chrome 中執行的驗證,每天處理超過 100 萬次請求。
有趣的部分在於其機制。SynthID 會將訊號直接嵌入圖片或影片的像素中,以及音訊的頻率成分中,而不是放在可被剝除的中繼資料裡。就圖片和影片而言,浮水印會在建立當下寫入,並設計成能承受裁剪、濾鏡、影格速率變更與有損壓縮。就音訊而言,它則能承受加入的雜訊、MP3 壓縮與播放速度變更。Gemini 應用程式的文字浮水印運作方式不同,它會調整模型指派給候選詞的機率分數,讓可見輸出維持不變。
訊號所在位置的不同,正是 SynthID 能挺過直接移除中繼資料的操作的原因。截圖、重新編碼和清除中繼資料都會移除來源標籤,但不會移除織入像素值本身的圖案。取捨之處在於,像素層級的訊號也最可能在激烈轉換下劣化,這就是為什麼偵測器會要求你提供手邊最高品質的檔案。
支援的格式相當廣泛:JPG、PNG、WEBP、HEIC 及其他幾種圖片類型;影片方面支援 MP4、MOV 和 WEBM;音訊方面則支援 WAV、MP3、OGG、FLAC、AAC 和 M4A。
合作夥伴關係才是真正的擴展
這款偵測器先前只檢查 Google 自家的 SynthID。ChatGPT 產生的圖片也帶有 SynthID,但 Google 的工具不會標示它們。這項限制已經消失。偵測器現在支援所有 SynthID 合作夥伴的浮水印,包括 OpenAI、NVIDIA 和 Kakao,Apple 也即將加入。
實務上的效果是,一次上傳就能辨識出來自多家主要供應商的輸出,而不必分別到各家公司自己的驗證頁面逐一檢查。OpenAI 仍維護自己的頁面,因此一張疑似由 ChatGPT 生成的圖片有兩個地方可以查。
限制也應受到同等重視
該網站明確表示,它不是通用的 AI 偵測器,而這項免責聲明比功能本身更重要。它只能辨識已採用 SynthID 的公司的媒體內容。Microsoft 和 Meta 採用自家的浮水印與驗證標準,兩者都不在合作夥伴名單上。Meta 的偵測器已經被抓到漏掉一些自家裁切過的 AI 圖片。
接著是開放權重模型的問題。任何人都可以在自己的硬體上執行開放模型,產出完全沒有浮水印、也沒有中繼資料標記的內容。這類內容永遠不會出現在偵測器中。
因此,陰性結果代表檔案來源不明。這不代表檔案是真實的。它可能來自合作夥伴網路之外的模型,或是經過大量修改,使訊號劣化到無法偵測。該網站自己的指引是:上傳可取得的最高品質版本,並在得出結論前蒐集多個資料點。
該網站也指出另一種較少受到關注的相反失敗模式。在罕見情況下,偵測器可能會對完全沒有浮水印的內容誤觸發。偽陽性比偽陰性更具破壞性,因為它會讓人指控一張真實照片是合成的。兩種方向的錯誤都存在,而兩者都不能取代查核檔案來源。
存取權刻意受到限制
這款工具免費,但需要通過驗證才能使用。使用者每天約有 10 次圖片、影片和音訊檢查額度,而且必須登入。Google 工程師表示,這項限制是為了防止有人利用檢查功能來開發 SynthID 移除工具。額度數字說得寬鬆,因為如果你檢查許多非常相似的檔案,系統可能會提早把你鎖住。那種模式看起來就像有人在調整規避方法。
根據隱私權聲明,上傳的媒體會即時處理,並在結果傳回後刪除,但檔案的數位簽章會保留 24 小時,以執行額度限制。條款禁止逆向工程偵測邏輯、自動化查詢,以及建立多個帳戶來規避限制。
來源追溯的兩種哲學
SynthID 是主動式浮水印:為 AI 內容加上標籤。另一種做法則是改為標記真實內容,使用 C2PA 等密碼學標準,在拍攝當下將來源資訊簽署進檔案中。Google 的 Pixel 手機是少數這麼做的裝置之一。
這兩種做法會以不同方式失效。浮水印取決於生成器是否配合,而開放權重模型沒有誘因這麼做。密碼學簽章取決於拍攝裝置是否配合,因此僅限於出廠即具備此能力的硬體。兩者都無法獨自涵蓋整個問題,實務建議是兩者並用,同時做那些不光鮮的工作:查核來源、日期與情境。
浮水印做法之所以先推出,有結構性原因。它不需要新硬體,也不需要改變內容被消費的方式。它可以透過更新加裝到現有模型上。密碼學來源追溯則需要一個由拍攝裝置、編輯工具和檢視器組成的生態系統,且全都同意採用同一標準,而這個生態系統目前多半還只是理想。較容易的路先被建造出來,而較容易的路也有更大的盲點。
接著是沒有人有好的答案的對抗性問題。浮水印的設計目標是耐用,但耐用不等於無法移除。每一個公開偵測工具都會為想擊敗它的人提供訓練訊號,這正是 Google 限制額度並禁止自動化查詢的原因。偵測器很有用,但對想抹除標記的人來說,偵測器也同時是一張地圖。
重點總結
有用的心智模型是:SynthID 給你一個很強的「是」,和一個非常弱的「否」。陽性比對會指向一組特定的供應商。陰性比對幾乎什麼都沒告訴你。任何人把後者當成健康證明,都是錯誤使用這項工具,而 Google 自家的文件對此異常坦白。
更廣泛地開放偵測工具,對媒體素養來說是真正的勝利。但這場勝利比公告聽起來的更狹窄,而真正的實用價值就藏在那些但書裡。