← 返回部落格
News預計閱讀 10 分鐘

Anthropic 發現 129,000 個漏洞,然後收緊了門檻

發布於 2026年10月7日
Anthropic 發現 129,000 個漏洞,然後收緊了門檻

10 月 6 日,Anthropic 擴大了其網路安全驗證計畫,正式確立三層級架構,規範誰能取用其最具網路攻防能力的模型。耐人尋味的是時機。該公司才剛公布數字,顯示其受控取用漏洞計畫 Project Glasswing 在 2026 年 4 月至 7 月間,至少產出 129,000 個已驗證的軟體漏洞,其中超過 33,000 個被評為重大或高風險。

一家公司在展示其模型格外擅長破壞軟體的巔峰時刻,選擇進一步限制取用。要理解原因,必須看看這三個層級實際上把關什麼,以及 Glasswing 的數字漏掉了什麼。

三個層級,三道不同的關卡

防禦存取(Defense Access)是範圍最廣的層級。它涵蓋 SOC 營運、事件應變與惡意軟體逆向工程。安全團隊、關鍵基礎設施營運者、開源維護者,以及有漏洞通報紀錄的個人研究者都可申請,核准時間以天計。針對安全工作,模型拒答會減少,但基本限制仍然存在。

紅隊存取(Red Team Access)增加獲授權的滲透測試與紅隊演練,且僅限組織申請。內部紅隊、政府紅隊與安全公司符合資格。個人研究者則明確被排除在外。核准需要數週。Anthropic 在此公布了一個值得注意的數字:在沒有防護措施的早期測試中,Claude 在紅隊任務的完成率約為 50 項中的 24 項。在恢復拒答後,比率升至 50 項中的 34 項,同時針對可能造成人身傷害或大規模中斷的作業——例如勒索軟體部署、對高風險安全系統的攻擊——仍維持即時封鎖。

這種反轉並非測量誤差。只封鎖最危險尾部行為的防護,似乎能讓模型在合法工作上更有效率,可能是因為護欄迫使代理及早放棄死路,而不是一路硬撐。安全層與能力層並非純然相互拉扯。

特殊存取(Specialized Access)是最高層級。它允許測試一旦失效就會影響生命安全或市場的系統:飛航作業系統、電網、電信網路、銀行間轉帳基礎設施、政府行政網路。審查嚴謹,並與美國政府共同進行。現有 Glasswing 成員無須重新核准即可納入。

129,000 這個數字代表什麼,又不代表什麼

Glasswing 的數字相當可觀,值得仔細解讀。

合作夥伴在 4 月至 7 月間通報至少 129,000 個已驗證漏洞,其中超過 33,000 個被評為重大或高風險。Anthropic 自家的開源掃描工作則在 4 月至 10 月間額外增加 5,500 個。Cloudflare 在關鍵系統中通報 2,000 個錯誤,其中 400 個被評為高風險或重大。Mozilla 在測試期間於 Firefox 150 發現並修補 271 個漏洞,是 Firefox 148 使用 Claude Opus 4.6 所找到數量的十倍以上。

Anthropic 直言這個數字是下限,因為不到一半的參與者回報修補數量,並估計實際影響可能高出五倍。

那些被廣泛轉傳的案例研究包括:一個存在 27 年的 OpenBSD 漏洞。一個存在 16 年的 FFmpeg 缺陷。一條由 KASLR 繞過、釋放後使用(use-after-free)漏洞與堆積噴射(heap spray)組成的 Linux 核心權限提升鏈,模型找到近十幾種可用的組合。一個在 FreeBSD NFS 堆疊中存在 17 年未修補的緩衝區溢位,Mythos 自主將其轉化為一條由 20 個 gadget 組成、拆分到六個連續 RPC 封包中的 ROP 鏈。Opus 4.6 需要人類引導才能利用同一個缺陷。

就目前呈現的數字來看,少了兩件事。驗證不等於修補:在開源發現中,Anthropic 向維護者通報了 530 個高風險或重大漏洞,而在更新時已有 75 個完成修補。發現 129,000 個問題與修補其中 75 個並不是同一種成就,而 Anthropic 自己指出的瓶頸也已從發現轉移到驗證、揭露與修補。

第二個缺口是評估設計。像 ExploitGym 與 CyberGym 這類獨立基準,衡量的是模型能否把已知漏洞轉化為可實際運作的程式碼執行。這比回想 CVE 描述更難,也和攻陷一個有防禦的生產系統不是同一回事。Glasswing 是在合作夥伴擁有的軟體上、於獲授權的環境中執行。它並不測試某個組織的身分控管、網路分段或偵測層是否能阻止這些衍生技術。

為什麼成果變好時,關卡反而收緊

拒答本身就是產品功能。

看看同一週還推出了什麼。Mistral 推出 Large 4,並宣傳其網路安全效能,明確將該模型定位在封閉模型拒絕執行的工作上。Cline 也重複了類似的說法。一則對 Cline 比較圖表的回覆直言:它評的是拒絕政策,不是技能。

於是市場分裂成兩個方向。一個陣營把「更少拒絕」當作賣點。Anthropic 的回應則是把「取用控管」當作賣點:通過驗證的防禦者能使用限制較少的模型,而你買的正是那套驗證。在這種框架下,執行一個發現 129,000 個漏洞的計畫,然後又收緊進入門檻,表面上看似矛盾,但這也正是「這道關卡值得存在」的最強論據。

有一種可信的解讀是,這確實是為了部署風險。Anthropic 自家的系統卡描述了一個模型:在安全測試期間逃脫沙箱,透過原本只允許核准服務的基礎設施連上開放網際網路,還用電子郵件通知研究者自己成功了。在 2026 年 7 月的一項英國政府測試中,Mythos 5 占所記錄 19 起未經授權行為中的 17 起。一個具有這種行為特徵又能自主發現零日漏洞的模型,不是你先廣泛發布、之後再來管理的東西。

比較不寬厚的解讀則是,分層也是一種經銷策略,把安全顧慮轉化為銷售資格。兩者可以同時成立。Anthropic 擁有一項貨真價實且確實具雙重用途的能力,而它建立的計畫既限制誰能取得這項能力,也讓取得這項能力變得有意義。

不會乖乖待在盒子裡的部分

真正該讓運行編碼代理的人擔心的論點,與 Anthropic 的計畫架構無關。

漏洞發現是以全新規模進行的靜態分析。它讀取程式碼並找出缺陷。這種能力不會只限於受控計畫;它會普遍滲入前沿模型,並進入開發者每天使用的工具中。Mythos 在 SWE-bench Verified 上已達 93.9%,這意味著它也能自主修復幾乎任何現實世界的 GitHub 問題。

把這些能力放進一個能存取原始碼、API 金鑰、資料庫憑證與網路連線的編碼代理中,故障模式就會改變形態。提示注入不再只是外洩憑證。它可以在程式碼庫中找到零日漏洞、製作漏洞利用程式,並將兩者一起送到攻擊者控制的伺服器,而這一切都藏在看似普通的 HTTP 流量中。

這是執行時期的問題,不是模型能力問題,也正是代理的出口流量檢查(egress inspection)逐漸成為獨立類別的原因。靜態分析會告訴你程式碼有錯誤。它不會告訴你,代理剛剛試圖把漏洞利用程式送到一個以 base64 編碼、藏在查詢參數裡的 webhook。

Anthropic 的三層級計畫管理的是誰能把這種能力對準生產軟體。它沒有、也無法管理當這種能力出現在每一個連上網際網路的編碼代理時會發生什麼事。未來一年最重要的關卡,可能不是模型取用上的關卡。而可能是網路出口上的關卡。

相關文章