你還分得出 AI 圖像與真實照片嗎?偵測軍備競賽正變得令人不安

一個名為「你分得出哪些圖像是 AI 生成的嗎?」的小型網頁遊戲,本月以 112 分、85 則留言登上 Hacker News 首頁。遊戲規則很簡單:畫面會連續顯示一系列圖像,你要猜是真實照片還是生成圖像。留言區最後都導向同樣的自白。以圖像為業的人,得分幾乎只比丟硬幣好一點。
幾天後,另一則 HN 討論串介紹了 Pangram,這家新創公司販售文字與圖像的 AI 偵測服務,串中 27 則留言爭辯偵測到底可不可行。這兩則討論串之間,正是這個領域令人不安的現況:分辨生成圖像與真實照片的難度,正以比偵測技術進步更快的速度攀升。
為什麼你的眼睛一直輸
過去管用的破綻,如今不是消失就是幾乎消失了。扭曲的手、融化的文字、不一致的光線、蠟感皮膚:這些問題在一次次模型世代中陸續被修掉。文字渲染長期以來是最可靠的破綻,如今在領先模型中已是解決的問題,這也是圖像基準測試開始大幅加重這項權重的原因之一。留下的是一種更細微的落差。生成圖像往往稍微過於協調,紋理稍微過於均勻,背景稍微過於配合。人類察覺到那種感覺,卻說不出所以然,這正是猜謎遊戲讓所有人難堪的原因。
「Loki 問題」用另一種方式點出同一件事。r/StableDiffusion 上有篇貼文問到,大家是如何產出能精準保留特定演員外貌、並套用於新服裝與場景的 AI 圖像。實際在做的人給出的答案是:以參考圖為基礎的生成,以及微調過的轉接器(adapter),而這些做法如今都不再需要什麼稀奇古怪的工具。幾年前還得靠視覺特效公司花上數年才能做出的神似肖像,現在只是一個下午的專案;而發問的那個人,根本分不出自己動態牆上氾濫的圖像裡,哪些是模型輸出。
偵測作為產品,偵測作為政策
Pangram 的賣點是:只要你用訓練生成器同樣積極的程度來訓練偵測器,偵測就是可行的。HN 討論則以標準且大致正確的反對意見回擊:偵測器對未見過的模型泛化能力很差,會產生誤判而傷害真正的攝影師,而且任何公開發表的偵測器都會成為標靶,被下一次模型發表默默擊敗。另外還有來源追溯(provenance)的做法,也就是 C2PA 式的內容憑證,藉由要求相機與生成器為其輸出簽章,來繞過偵測問題。當所有人都願意配合時,這方法有用。但對於有人重新編碼並移除資訊的圖像,它一點辦法也沒有。
政策無論如何都在往前推進。餐廳使用 AI 食物攝影一事,本月因《華爾街日報》的報導而成為一則小型新聞;反彈的重點與其說是抽象層面的欺騙,不如說是具體的背叛:你點的那個漢堡,就該長得跟廣告裡的漢堡一樣。這是一種社會性偵測機制,也就是群眾外包的信任,而它比任何分類器都更嚴格。
HN 討論串實際上在爭什麼
這兩則 Hacker News 討論把問題切分得很清楚。遊戲那串主要是大家在報分數、交換訣竅;這些訣竅算是不錯的化石紀錄,記錄了過去什麼方法管用:看手、檢查文字、檢視反射、數背景路人手指有幾根。如今在現行模型上,這些檢查幾乎全都會出現偽陰性。尤其是文字渲染,自從領先模型把它列為基準測試重點後,就不再是可靠的破綻;兩年前,生成一間招牌字跡清楚的店面還是新奇事,現在已是預設行為。
Pangram 那串則抱持更多懷疑。留言中的反對意見都是標準那幾套,而且站得住腳:用昨日生成器訓練出來的偵測器抓不到明日的生成器;偽陽性傷害最深的,是作品被標記為合成的真正攝影師;而公開發表偵測器,等於公開邀請下一個模型針對它來訓練。有則留言把這種不對稱具體說了出來:生成器只需要騙過現存的偵測器,而偵測器卻得抓住每一個生成器,包括尚未發表的那些。從結構上來說,這是一場注定輸的競賽,這也是為什麼商業偵測產品主要賣給有內容審核義務的機構,而不是賣給對某張可疑圖像感到好奇的個人。
來源追溯,無聊的替代方案
不斷被提出的替代方案是內容憑證:以密碼學簽章的詮釋資料,採 C2PA 形式,在拍攝或生成時附加上去。相機為感光元件所見簽章。生成器為模型所產出的內容簽章。編輯工具則保留或註記這條鏈。這一切都不需要偵測任何東西,而這正是它最大的優點,因為偵測是一場永無止境的軍備競賽,簽章則是一套基礎管線標準。
它的弱點同樣是結構性的。簽章是自願的,詮釋資料會因為截圖與重新編碼而被移除,而且這條鏈只能證明圖像來自何處,永遠無法證明原始內容是否誠實。一張經過簽章的 AI 圖像,仍然是一張 AI 圖像。但隨著平台開始顯示憑證,一條乾淨的鏈之存在,就會像當年的 HTTPS 一樣成為信任訊號,而它的缺席則開始被解讀為這張圖像無法回答的疑問。
社會層比技術層更嚴格
在偵測與來源追溯之間,存在著本月真正發揮作用的機制:群眾。餐廳那則新聞會傳開,是因為顧客認出了照片中的食物與實際送上的食物之間的落差,而不是因為某個分類器把它標記出來。那些「長輩圖」風格的孫輩圖像會成為話題,是因為群組裡的父母們說了「不行」。Loki 圖像促使某個 Reddit 版面發問它們是怎麼做的,並在一天內得到答案。社群以偵測器做不到的方式進行偵測:靠了解脈絡。
這暗示了一套值得認真看待的分工。機器擅長大規模篩選,把大量上傳的內容標記出來交由人工審查。人類擅長掌握脈絡,能看出廣告裡的漢堡沒有碎屑,因為根本沒有漢堡會那樣。來源追溯則擅長處理源頭,也就是誠實行為者所在之處。沒有任何單一層次能抓住一切,這正是為什麼那個讓所有人難堪的遊戲,仍然是有用的校準工具,而不是最終判決。
對發布圖像的人來說,這代表什麼
如果你會發布或委託製作圖像,從當前情況可以歸結出三個習慣。第一,標註生成內容正逐漸成為信任資產,而不是一種招認。願意揭露的創作者——r/StableDiffusion 討論串中對於如何處理反 AI 留言有明顯分歧——正在建立一群在事先揭露時仍會留下的受眾。第二,保留來源追溯詮釋資料的成本很低,偶爾還具有決定性;平台正開始顯示這些資訊,而保留它的代價不過是一個設定開關。第三,對於任何圖像會構成事實主張的內容(新聞、產品、證據),請假定你的受眾手上有丟硬幣等級的偵測能力和截圖工具。唯一持久的防禦,就是對圖像的真實性質誠實以對。

那個讓所有人難堪的遊戲,還是值得玩一下。花十分鐘面對一副真實與生成圖像混洗的牌組,會把你對自身判斷力的信心重新校準到有用的方向。你猜錯的那些圖像,並不是你注意力不足。它們是新的基準線,而這條基準線每個月都在移動。
相關文章
中國 AI 圖像模型正走向全球,而這個月,風向變了
中國圖像模型正走向全球。這個月,基準測試、留言區與華府如何改變了整個討論。
預測市場正用真金白銀押注誰能贏得圖像 AI,而賠率明顯一面倒
預測市場正在押注誰能贏得圖像 AI。一面倒的賠率實際上衡量了什麼,以及該如何解讀。
Qwen Image 2.1:為何一個 7B 開放權重模型讓 Nano Banana 2.0 不敢小覷
Qwen Image 2.1 是一個 7B 開放權重模型,可與 Nano Banana 2.0 匹敵,還能跑在筆電上。這對圖像生成意味著什麼。
Meta 的 Muse 圖像每張約一美分,瞄準廣告主
每張圖像約一美分,瞄準廣告主:Meta Muse 的定價對廣告素材與雙線圖像市場意味著什麼。