OpenAI 將一起推理擷取行動追溯至與 Moonshot AI 有關的人員

9 月 30 日,OpenAI 發表了一份說明,描述其所稱的一起協同行動,目的是從自家模型中提取受保護的推理內容。該公司表示已阻止這起行動,並將其中的核心活動叢集歸因於與 Moonshot AI(Kimi 模型系列的開發商)有關的個人。
這份揭露篇幅簡短,而且在公司與一群人之間的界線拿捏得相當謹慎。OpenAI 並未指控 Moonshot AI 主導這起行動。它只表示,其指認的人員與該公司有關聯。這項區別具有法律上的作用,也應按字面理解。
這起行動做了什麼
模型蒸餾通常是指用大型模型的輸出訓練一個較小的模型,讓小模型以極低的成本學會模仿大模型。這種做法很常見,且往往合法,這也是為什麼各家實驗室會設法限制它,而非直接禁止。
OpenAI 描述的則是更具對抗性的一種版本。操作者操弄互動過程,讓模型受保護的推理內容以可見形式重現。其中一種手法是複製某段對話中的加密推理內容,再在另一段對話中要求模型將其解密。前沿模型之所以把推理軌跡隱藏起來,是有原因的:這些軌跡會暴露模型如何得出答案,也正是最有利可圖的竊取目標。
該公司描述了迅速升溫的過程。相關活動自 7 月 1 日開始,並在 7 月 24 日與 25 日達到高峰,來自超過 4,000 名使用者的約 16,000 次擷取嘗試請求。另一個涉及超過 15,000 名使用者的相關叢集,則在 7 月 28 日前被完全阻止。
OpenAI 表示,沒有任何加密被破解,也沒有資料庫遭到入侵。它關閉了推理重放的途徑、封禁相關帳號,並透過 Frontier Model Forum 與政府管道分享調查結果。
為何加密推理這個角度很重要
最有趣的技術細節在於跨對話重放。如果實驗室將推理軌跡加密,並讓金鑰遠離使用者,軌跡看起來就安全無虞。這種攻擊並不試圖破解加密,而是把密文搬移到一個全新的脈絡中,實際上等於是要求模型自己去解讀它。模型於是成了自己的解密預言機。
這與其說是一起事件,不如說是一堂設計課。任何系統只要把不該洩露的資料交給模型,又讓同一個模型回答關於這些資料的問題,就存在弱點。解法屬於架構層面:讓受保護的內容完全不出現在任何可被提示模型翻譯的脈絡中。
背後的經濟邏輯
推理軌跡之所以有價值,是因為從零開始訓練一個具競爭力的推理模型既昂貴又耗時。而複製一個已經具備良好推理能力的模型的軌跡,成本低廉許多。這兩者之間的成本落差,就是全部的動機所在。
這也是為什麼偵測困難,而歸因更難。這類行動中的使用者分散於不同帳號、地區與付款方式。要將他們與某家特定公司連結起來,需要的不只是共用工具組這樣的證據;想必這也是 OpenAI 以「有關聯」而非「所屬」來描述這層關係的原因。
中國脈絡
這項歸因正好落在中國模型發布密集的時刻。在國慶假期期間,多家國內企業同時推出新版本:Kimi 的下一代模型出現在某個 API 註冊表中,Step 5 Preview 開放給第三方端點,Kling 則將其影片模型推進 Beta 階段。市場變化迅速,而維持在接近前沿位置的成本持續攀升。
放在這樣的背景下解讀,OpenAI 的揭露只是關於前沿如何被防衛的眾多訊號之一。各家實驗室正把推理擷取視為一個附帶研究預算的安全問題,而不是服務條款裡的一則附註。
還有另一種解讀:這份揭露本身就是一則訊息。透過 Frontier Model Forum 與政府管道發布歸因,等於是提醒其他實驗室,哪些行為會招來公開回應。
業界如何應對
對抗蒸餾的防禦手段大多是技術性的,且大多不怎麼光鮮。實驗室可以對高頻查詢進行速率限制、對流量進行指紋辨識,並監控擷取行為所產生的模式。他們也可以加密推理軌跡——OpenAI 就這麼做了——然後發現:如果模型可以被要求解讀自己的密文,單靠加密於事無補。
還有一層政策面的作用。Frontier Model Forum 存在的部分目的,正是在競爭對手之間協調這類發現,因為它們在讓擷取行為維持高成本這件事上有共同利益。透過政府管道分享則有第二個目的:讓監管機構取得一個具體案例,以便在不必從頭制定全新法律的情況下採取行動。
這些做法都無法讓蒸餾變得不可能,因為一個會回答問題的模型,終究能被一個讀取答案的模型模仿。它們做的是提高成本,而這才是務實的目標。各家實驗室並不打算終結模仿,他們只是不想讓模仿便宜到足以省下訓練費用。
為何歸因是最微妙的部分
點名一群人並將他們與某家公司連結,卻不去指控該公司,是一條狹窄的路,而 OpenAI 刻意走了這條路。用字遣詞之所以重要,是因為其他可能的解讀會帶來截然不同的後果。若是國家支持的行動,那是外交事務。若是一群工程師自行其是,那是公司治理事務。若只是普通使用者群體在模型允許的邊緣試探,則兩者皆非。
這份揭露並未解答哪一種解讀才正確。它所做的,是以其他實驗室能夠佐證的方式將這項發現載入紀錄,並讓監管機構有一個具體事件可以指涉。這往往正是這類揭露的實際目的。與其說它是一則新聞事件,不如說它是一份申報文件。
這其中還有聲譽層面的考量。蒸餾相關的指控已成為前沿競爭中的例行公事,而每一樁指控的解讀方式,取決於提出者是誰。一家會公開證據、點明模式並與同業分享的實驗室,立場會比只發布政策頁面的實驗室更為堅實。
這份說明未能釐清的事
OpenAI 的說明並未指出,這些被擷取的素材是否被用於訓練、若有又是訓練了什麼,也未說明在途徑關閉前有多少內容被取得。除了籠統的「有關聯」之外,它沒有點名任何外部單位。它也沒有談到類似手法是否正被用於對付其他供應商——而這很可能正在發生。
這些空白並不代表背後有什麼邪惡之處。它們是安全揭露的常態形式:公司分享足夠的資訊以警示整個領域,卻不至於發布操作指南或損害調查。
真正會傳遞出去的部分,是那個模式。前沿模型最有價值的產出已不再只是它的答案,而是答案底下的推理;而圍繞這些推理的防禦,如今正被如網路上任何系統一般刻意地測試著。