OpenAI 將在歐盟為 ChatGPT 文字加上浮水印。自家數據顯示這有多脆弱

10 月 5 日,OpenAI 表示將在歐盟為 ChatGPT 與 Codex 產生的文字加入不可見的浮水印,並在接下來幾週內向所有方案中符合資格的用戶推出。這套方法稱為 textGrain,它不會插入看得見的符號,也不會加入可以用尋找與取代刪除的隱藏字元。它會利用一組祕密金鑰,微妙地影響模型對下一個字的選擇,疊加數百次統計上的微調,讓偵測器之後僅憑文字就能還原出這個模式。由於模式存在於用字遣詞之中,因此經過複製貼上仍能保留。
導火線是法規。歐盟《人工智慧法案》第 50 條要求生成式系統的提供者,必須以機器可讀的形式標記其輸出內容。這些透明度義務已於 2026 年 8 月 2 日生效,而歐盟執委會已確認,在該日期之前已在市場上的系統,期限為 2026 年 12 月 2 日。執委會於 6 月發布了關於標記與標示 AI 生成內容的實務準則,截至 7 月底已有約 190 個組織簽署。Anthropic 在 8 月表示將在全球為 Claude 的文字加上浮水印;Google 則有針對文字的 SynthID。OpenAI 趕在期限前到位,而這個期限它已經迴避了兩年。
該公司公布了自己的失效曲線
這項公告中最有用的部分,是 OpenAI 並列提出的那組數字。在目標偽陽性率為 1% 的情況下,針對取自 ELI5 資料集的英文文本,偵測器在約 80% 的 200 個 token 段落中辨識出浮水印,在 400 個 token 的段落中則約為 95%。數學內容的得分明顯較低,因為模型在選字上的自由度較小。在 400 個 token 的段落中以同義詞替換 10% 的詞彙,偵測率會從大約 92% 降至 66%。替換 25%,則會降到約 17%。
依序讀完這些數據,情況就很清楚。偵測器在冗長、限制寬鬆的散文上效果最好。一封簡短的電子郵件更接近 200 個 token,而非 400 個。程式碼與數學幾乎沒有藏訊號的空間。只要用任何改寫工具稍微處理過,偵測結果就會趨近於丟銅板。

OpenAI 列出了五項限制,這些都值得你引述進本季撰寫的任何政策文件。浮水印無法衡量人類的貢獻程度。它無法確立所有權或責任歸屬。它無法辨識使用者,因為沒有任何帳號、提示或對話與該段文字綁定。它無法驗證準確性,帶有浮水印的段落也可能是錯誤的。最後,沒有浮水印也無法證明文字是人寫的,因為該段落可能太短、可能經過編輯或翻譯、可能來自不支援的模型或推出前的版本,也可能單純只是來自其他公司的工具。
最後這一點,才是實務上會造成真正傷害的地方。有人會把學生的文章或求職者的求職信丟進偵測器,沒比對到,就把結果當成誠實作業的證明。或是比對到了,就當成作弊的證據。這兩種結論都不成立,而 OpenAI 在自己的文章中也這麼說。
為什麼偵測器不公開
偵測工具在推出之初僅限於獲核准的研究人員與專家組織使用,並採個案審核。這種謹慎有其道理,因為一個在同義詞替換後偵測率只剩 66% 的工具,很容易被誤用。但這也意味著在系統推廣期間,獨立驗證十分困難,對一項合規功能來說,這是個尷尬的起點。
這背後有段歷史。2024 年 8 月,OpenAI 在一份內部調查發現近 30% 的使用者會因此減少使用後,決定不為 ChatGPT 加上浮水印。目前的安排是一項折衷:初期僅限歐盟,全球的 API 客戶則預設關閉,可針對特定模型選擇啟用。在全球範圍內,文字浮水印並非預設功能。
對所有會產出文字的人來說,這改變了什麼
對歐盟的團隊而言,實際上的改變比新聞標題所暗示的還要小。員工的產出會帶有一個沒人看得見的訊號。它不會辨識出他們的身分,在 OpenAI 的測量中也不會降低模型品質,而且會跟著文字進入任何被貼上的文件或客戶電子郵件。如果之後有能取用偵測器的人檢查那段文字,或許能標記出來。工作流程完全不需要改變。
真正的風險位於更下游,在於任何把溯源偵測當成最終判定的流程。招募、入學審查、新聞編輯室查證與學術誠信系統,都是顯而易見的例子,而每一個環節裡都有個人,會忍不住把偵測結果當成證據來解讀。OpenAI 自家的數字正好反駁了這種做法。一個例行改寫就能抹除的標記,或許滿足了第 50 條的字面要求,卻未能達成該條文立意的任務。
執法讓這個期限有了牙齒:違規最高可處 1,500 萬歐元,或全球年營收的 3%,以較高者為準。這就是為什麼會推出這項措施。但更有趣的問題是,一個在輕度編輯下就會淡去的浮水印,是否承擔得起監管機構加諸其上的重量。12 月 2 日針對既有系統的期限、偵測器最終的公開發布,以及執委會對可接受偵測門檻的任何指引,都是值得關注的里程碑。
目前對任何團隊來說,最安全的原則就是 OpenAI 寫進自家文章裡的那一條:缺少浮水印不能證明文字出自人類之手,有浮水印也不能證明整段文字都是模型寫的。浮水印可以指出某個系統曾接觸過某段文字。但它無法告訴你,其中有多少思考是出於人類。
文字浮水印實際上如何運作
先了解為什麼這個訊號這麼容易消失,會很有幫助。傳統浮水印是附加在檔案上的一種標記,只要找到正確的欄位就能刪除。textGrain 走的是不同的路。在生成過程中,一組祕密金鑰會影響模型在幾個幾乎等同的下一個字之間的選擇,把它推向持有相同金鑰的偵測器所能辨識的子集合。經過數百次這樣的選擇,模式在統計上就會變得可見。由於偏誤存在於用字遣詞之中,這個標記會跟著文字歷經複製貼上、經過不同的編輯器與不同的應用程式。
脆弱性也源自同樣的設計。任何改寫文字的過程,無論是改寫工具、翻譯,或大幅的人工編輯,都會擾動偵測器所要尋找的模式。這正是每個文字浮水印的核心取捨:一個強到足以在輕度編輯後存活的標記,也會明顯不同於一般寫作,而這就失去了意義。OpenAI 選擇了微妙的標記,並公布隨之而來的偵測曲線,這比大多數廠商都來得誠實。
跨實驗室的比較很有啟發性。Anthropic 在 8 月表示將在全球為 Claude 的輸出加上浮水印,此舉引來使用者反彈,他們主張指令、脈絡與決策都來自人,模型只是工具。Google 的 SynthID 對自家文字做類似的事。這三種做法等同於整個產業收斂到同一個構想,也帶著同樣的限制,這顯示該技術已接近目前文字領域所能達到的上限。
與此同時,更難的問題仍未被觸及。標記文字相對容易,因為一段文字包含數百個可用來編碼訊號的選字。圖像與音訊也有同樣的統計空間,而 OpenAI 已為它們提供驗證功能。但這些標記都無法回答新聞編輯室或學校真正需要解答的問題:某項具體主張是否為真,以及誰為它背書。溯源與準確性是兩個不同的問題,而浮水印只解決了第一個。