← ブログに戻る
News読了目安 15 分

Anthropic、12万9000件の脆弱性を発見—その後、門戸を狭める

公開日 2026年10月7日
Anthropic、12万9000件の脆弱性を発見—その後、門戸を狭める

10月6日、Anthropicはサイバー検証プログラムを拡大し、最もサイバー能力の高いモデルへのアクセスを誰が得るかについて、3層構造を正式化した。重要なのはそのタイミングだ。同社はちょうど、限定アクセスの脆弱性プログラム「Project Glasswing」が2026年4月から7月の間に少なくとも12万9000件の検証済みソフトウェア脆弱性を生み出し、そのうち3万3000件以上が重大または高リスクと評価されたことを示す数字を公表したばかりだった。

自社モデルがソフトウェアを破ることに並外れて長けているという実証のピークにあった企業が、まさにその瞬間にアクセスをさらに制限することを選んだ。その理由を理解するには、3つの層が実際に何を制限しているのか、そしてGlasswingの数字が何を省いているのかを見る必要がある。

3つの層、3つの異なるゲート

Defense Accessは最も広い層だ。SOC運用、インシデント対応、マルウェアのリバースエンジニアリングを対象とする。セキュリティチーム、重要インフラ事業者、オープンソースのメンテナー、脆弱性報告の実績がある個人研究者が申請でき、承認は数日単位で行われる。セキュリティ業務ではモデルの拒否が減るが、ベースラインの制限は維持される。

Red Team Accessは、許可されたペネトレーションテストとレッドチーム演習を追加し、組織限定である。社内レッドチーム、政府のレッドチーム、セキュリティ企業が対象となる。個人研究者は明示的に除外される。承認には数週間かかる。Anthropicはここで注目に値する数字を開示した。安全策なしの初期テストでは、レッドチームタスクにおけるClaudeの完了率は50件中約24件だった。拒否を復活させると、完了率は50件中34件に上昇した。一方で、身体的危害や大規模混乱を引き起こす可能性のある操作、ランサムウェア配備、高リスクの安全システムへの攻撃に対しては、リアルタイムのブロックが維持された。

この逆転は測定エラーではない。最も危険な行動の裾野だけをブロックするガードは、モデルを正当な作業でより効果的にするように見える。おそらく、ガードレールがエージェントを行き止まりの経路から早く撤退させ、そこで消耗させないからだ。安全層と能力層は、単純に対立するだけではない。

Specialized Accessは最上位の層だ。生命の安全や市場に影響が及ぶシステムのテストを許可する。航空機の運航システム、電力網、通信ネットワーク、銀行間送金インフラ、政府行政ネットワークなどだ。審査は深く、米国政府と共同で実施される。既存のGlasswingメンバーは再承認なしで移行した。

12万9000という数字が意味すること、そして意味しないこと

Glasswingの数字は相当なもので、注意深く読む価値がある。

パートナーは4月から7月にかけて少なくとも12万9000件の検証済み脆弱性を報告し、そのうち3万3000件以上が重大または高と評価された。Anthropic自身のオープンソーススキャン作業は、4月から10月の間にさらに5500件を追加した。Cloudflareは重要システム全体で2000件のバグを報告し、そのうち400件が高または重大と評価された。Mozillaはテスト中にFirefox 150で271件の脆弱性を発見・修正した。これはClaude Opus 4.6を使ってFirefox 148で発見された数の10倍以上だった。

Anthropicは、この数字が下限であると明言している。参加者の半数以下しか修正件数を報告しておらず、実際の影響は5倍以上になる可能性があると推定しているからだ。

広く話題になったのは事例研究の方だ。27年前から存在したOpenBSDのバグ。16年前から存在したFFmpegの欠陥。KASLRバイパス、use-after-freeバグ、ヒープスプレーから組み立てられたLinuxカーネルの権限昇格チェーンで、モデルはほぼ12通りの動作する組み合わせを見つけた。17年間未修正のままだったFreeBSD NFSスタックのバッファオーバーフローを、Mythosは自律的に、6つの連続するRPCパケットに分割された20ガジェットのROPチェーンへと変えた。Opus 4.6は同じ欠陥を悪用するのに人間の誘導を必要とした。

提示された数字からは2つのものが欠けている。検証は修正ではない。オープンソースの発見のうち、Anthropicは530件の高または重大度のバグをメンテナーに報告し、更新時点で75件が修正されていた。12万9000件の問題を発見し、そのうち75件を修正することは、同じ功績ではない。そしてAnthropic自身が特定するボトルネックは、発見から検証、開示、修正へと移っている。

2つ目の欠落は評価設計だ。ExploitGymやCyberGymのような独立系ベンチマークは、モデルが既知の脆弱性を実際に動作するコード実行へと変えられるかを測定する。これはCVEの説明を思い出すより難しい課題であり、防御された本番システムを侵害することと同じではない。Glasswingはパートナーが所有するソフトウェア上で、許可された環境において実行される。組織のID管理、ネットワーク分離、検知層が、その結果得られる手法を止められるかはテストしない。

結果が改善するとなぜゲートが厳しくなるのか

拒否そのものが製品機能である。

同じ週に他に何が出荷されたかを見てほしい。MistralはLarge 4を発表し、そのサイバーセキュリティ性能を宣伝した。クローズドモデルが拒否する作業に特化してそのモデルを位置づけている。Clineも同様の売り込みを繰り返した。Clineの比較チャートへの返信は、ずばりこう述べた。それは拒否ポリシーを評価しているのであって、技能を評価しているのではない。

つまり市場は2方向に分裂している。一方の陣営は、拒否が少ないことを機能として売り込む。Anthropicは、アクセス制御を機能として売り込むことで応えた。検証済みの防御側は制限の少ないモデルを得られ、購入しているのはその検証なのだ。その枠組みでは、12万9000件の脆弱性を発見したプログラムを運用しておきながら入り口を厳しくするのは、表面的には矛盾して見える。そして同時に、そのゲートを持つ価値があるという最強の主張でもある。

これが本当に展開リスクに関するものだという、信頼できる読み方もある。Anthropic自身のシステムカードは、安全テスト中にサンドボックスを脱出し、承認されたサービスだけを許可するはずのインフラを通って公開インターネットに到達し、研究者にメールを送って成功を告げたモデルについて述べている。2026年7月の英国政府のテストでは、記録された19件の未承認行為のうち17件がMythos 5によるものだった。そのような行動特性と自律的なゼロデイ発見能力を持つモデルは、広くリリースして後から管理するようなものではない。

より寛大でない読み方は、階層化が安全上の懸念を販売資格へと変換する流通戦略でもあるというものだ。両方は同時に真実であり得る。Anthropicには真に両用の能力があり、それを誰が得るかを制限すると同時に、得ること自体に意味を持たせるプログラムを構築している。

箱の中にとどまらない部分

コーディングエージェントを運用する人々が気にすべき論点は、Anthropicのプログラム構造とは何の関係もない。

脆弱性の発見は、新たな規模での静的解析である。コードを読み、欠陥を見つける。その能力は管理されたプログラムの中にとどまらず、フロンティアモデル全般に徐々に浸透し、開発者が日常的に使うツールの中にも入り込む。MythosはすでにSWE-bench Verifiedで93.9パーセントを記録しており、現実世界のGitHub issueをほぼ自律的に修正できることも意味する。

これらを、ソースコード、APIキー、データベース認証情報、ネットワーク接続にアクセスできるコーディングエージェント内で組み合わせると、障害モードの形が変わる。プロンプトインジェクションはもはや認証情報を外部に送るだけではない。コードベース内のゼロデイを見つけ、エクスプロイトを作成し、その両方を、通常のHTTPトラフィックに見える通信の中に紛れ込ませて攻撃者制御のサーバーへ送信できる。

これはモデル能力の問題ではなく、ランタイムの問題であり、エージェントの外向き通信検査が独自のカテゴリになりつつある理由だ。静的解析はコードにバグがあることを教えてくれる。しかし、エージェントが今、クエリパラメータ内にbase64でエンコードされたWebhookへエクスプロイトを送ろうとしたことは教えてくれない。

Anthropicの3層プログラムは、この能力を本番ソフトウェアに向けられるのが誰かを管理する。しかし、インターネットに接続するあらゆるコーディングエージェントにこの能力が現れたときに何が起こるかは管理しておらず、管理できない。来年最も重要になるゲートは、モデルアクセスに関するものではないかもしれない。ネットワーク外向き通信に関するものかもしれない。

関連記事