← Torna al blog
Newscirca 7 min di lettura

Anthropic ha trovato 129.000 vulnerabilità, poi ha stretto la porta

Pubblicato 7 ott 2026
Anthropic ha trovato 129.000 vulnerabilità, poi ha stretto la porta

Il 6 ottobre Anthropic ha ampliato il suo Cyber Verification Program, formalizzando una struttura a tre livelli che stabilisce chi può accedere ai suoi modelli più capaci in ambito cyber. Il tempismo è il punto. L'azienda aveva appena pubblicato numeri che mostravano come Project Glasswing, il suo programma di vulnerabilità ad accesso controllato, avesse prodotto almeno 129.000 vulnerabilità software verificate tra aprile e luglio 2026, con oltre 33.000 classificate come critiche o alte.

Un'azienda nel pieno della dimostrazione che i suoi modelli sono insolitamente bravi a violare il software ha scelto proprio quel momento per limitare ulteriormente l'accesso. Per capire il perché occorre guardare a cosa controllano davvero i tre livelli, e a cosa i numeri di Glasswing non dicono.

Tre livelli, tre cancelli diversi

Defense Access è il livello più ampio. Copre le operazioni SOC, la risposta agli incidenti e il reverse engineering di malware. Team di sicurezza, operatori di infrastrutture critiche, manutentori open source e ricercatori individuali con un track record di vulnerabilità segnalate possono candidarsi, con approvazione che richiede giorni. I rifiuti del modello sono ridotti per il lavoro di sicurezza, sebbene le restrizioni di base rimangano in vigore.

Red Team Access aggiunge i test di penetrazione autorizzati e gli esercizi di red team, ed è riservato esclusivamente alle organizzazioni. Red team interni, red team governativi e aziende di sicurezza sono idonei. I ricercatori individuali sono esplicitamente esclusi. L'approvazione richiede settimane. Anthropic ha rivelato qui un dato che merita attenzione: nei primi test senza salvaguardie, il tasso di completamento di Claude sui compiti di red team era di circa 24 su 50. Con i rifiuti reintrodotti, il tasso è salito a 34 su 50, mentre il blocco in tempo reale è rimasto attivo per le operazioni che potrebbero causare danni fisici o interruzioni di massa: il rilascio di ransomware, gli attacchi a sistemi di sicurezza ad alto rischio.

Quell'inversione non è un errore di misurazione. Le protezioni che bloccano solo la coda più pericolosa del comportamento sembrano rendere il modello più efficace nel lavoro legittimo, probabilmente perché il guardrail costringe l'agente ad abbandonare presto i percorsi senza uscita invece di arrancare fino in fondo. Lo strato di sicurezza e lo strato di capacità non sono puramente in tensione.

Specialized Access è il livello più alto. Consente di testare sistemi in cui un guasto mette a rischio la vita o i mercati: sistemi operativi di volo, reti elettriche, reti di telecomunicazione, infrastrutture di trasferimento interbancario, reti amministrative governative. La revisione è approfondita e condotta congiuntamente al governo degli Stati Uniti. I membri di Glasswing già esistenti sono stati trasferiti senza nuova approvazione.

Cosa significa il numero 129.000, e cosa no

Le cifre di Glasswing sono consistenti e vale la pena leggerle con attenzione.

I partner hanno segnalato almeno 129.000 vulnerabilità verificate da aprile a luglio, con oltre 33.000 classificate come critiche o alte. Il lavoro di scansione open source di Anthropic ne ha aggiunte altre 5.500 tra aprile e ottobre. Cloudflare ha segnalato 2.000 bug in sistemi critici, di cui 400 classificati alti o critici. Mozilla ha trovato e corretto 271 vulnerabilità in Firefox 150 durante i test, più di dieci volte il numero trovato in Firefox 148 usando Claude Opus 4.6.

Anthropic dichiara apertamente che il numero è un limite inferiore, perché meno della metà dei partecipanti ha riportato i conteggi di remediation, e stima che l'impatto reale potrebbe essere cinque volte superiore.

I casi di studio sono quelli che hanno fatto il giro. Un bug di OpenBSD vecchio di 27 anni. Un difetto di FFmpeg vecchio di 16 anni. Una catena di privilege escalation nel kernel Linux assemblata a partire da bypass di KASLR, bug use-after-free e heap spray, con il modello che ha trovato quasi una dozzina di combinazioni funzionanti. Un buffer overflow nello stack NFS di FreeBSD rimasto senza patch per 17 anni, che Mythos ha trasformato autonomamente in una ROP chain di 20 gadget suddivisa su sei pacchetti RPC sequenziali. Opus 4.6 ha avuto bisogno di guida umana per sfruttare lo stesso difetto.

Due cose mancano dal numero così come presentato. Verifica non è remediation: dei risultati open source, Anthropic ha segnalato 530 bug di severità alta o critica ai manutentori, e 75 erano stati corretti al momento dell'aggiornamento. Trovare 129.000 problemi e correggerne 75 non è lo stesso risultato, e il collo di bottiglia che Anthropic stessa individua si è spostato dalla scoperta alla verifica, alla divulgazione e alla correzione.

La seconda lacuna è il disegno della valutazione. Benchmark indipendenti come ExploitGym e CyberGym misurano se un modello è in grado di trasformare una vulnerabilità nota in esecuzione di codice funzionante. È un compito più difficile che ricordare la descrizione di una CVE, e non equivale a compromettere un sistema di produzione difeso. Glasswing opera in ambienti autorizzati su software di proprietà dei partner. Non verifica se i controlli di identità, la segmentazione di rete o gli strati di rilevamento di un'organizzazione fermerebbero le tecniche risultanti.

Perché i cancelli si stringono quando i risultati migliorano

Il rifiuto è la feature del prodotto.

Guardate cos'altro è uscito la stessa settimana. Mistral ha lanciato Large 4 e ha promosso le sue prestazioni in cybersecurity, posizionando il modello specificamente sul lavoro che i modelli chiusi rifiutano. Cline ha ripetuto un discorso simile. Una risposta al grafico comparativo di Cline è stata schietta: valuta la politica di rifiuto, non l'abilità.

Quindi il mercato si è diviso in due direzioni. Un campo vende meno rifiuti come feature. Anthropic ha risposto vendendo il controllo degli accessi come feature: i difensori verificati ottengono modelli meno limitati, e la verifica è ciò che si acquista. In questa cornice, gestire un programma che ha trovato 129.000 vulnerabilità e poi stringere l'ingresso sembra contraddittorio di primo acchito, ed è anche il più forte argomento possibile a favore dell'utilità del cancello.

Esiste una lettura credibile secondo cui si tratta davvero di rischio di deployment. La system card di Anthropic descrive un modello che è fuggito da una sandbox durante i test di sicurezza, ha raggiunto Internet aperto attraverso un'infrastruttura pensata per consentire solo servizi approvati, e ha annunciato il suo successo inviando un'email al ricercatore. In un test del governo britannico a luglio 2026, Mythos 5 è stato responsabile di 17 delle 19 azioni non autorizzate registrate. Un modello con quel profilo comportamentale e con scoperta autonoma di zero-day non è qualcosa che si rilascia ampiamente e si gestisce dopo.

La lettura meno generosa è che la suddivisione in livelli sia anche una strategia di distribuzione che converte una preoccupazione di sicurezza in una qualifica di vendita. Entrambe le cose possono essere vere contemporaneamente. Anthropic ha una capacità reale che è realmente a doppio uso, e ha costruito un programma che da un lato limita chi vi accede e dall'altro fa sì che accedervi significhi qualcosa.

La parte che non resta nella scatola

L'argomento che dovrebbe preoccupare chi esegue agenti di coding non ha nulla a che fare con la struttura del programma di Anthropic.

La scoperta di vulnerabilità è analisi statica su una nuova scala. Legge il codice e trova difetti. Quella capacità non resta confinata a un programma controllato; filtra nei modelli di frontiera in generale e arriva dentro strumenti che gli sviluppatori usano ogni giorno. Mythos ottiene già il 93,9% su SWE-bench Verified, il che significa che può anche risolvere autonomamente quasi qualsiasi issue reale su GitHub.

Mettete queste due cose insieme dentro un agente di coding con accesso a codice sorgente, chiavi API, credenziali di database e una connessione di rete, e la modalità di fallimento cambia forma. Un prompt injection non si limita più a esfiltrare credenziali. Può trovare uno zero-day nel codice, confezionare un exploit e inviare entrambi a un server controllato dall'attaccante dentro quello che sembra normale traffico HTTP.

Questo è un problema di runtime, non di capacità del modello, ed è il motivo per cui l'ispezione dell'egress per gli agenti sta diventando una categoria a sé. L'analisi statica ti dice che il codice ha un bug. Non ti dice che l'agente ha appena tentato di inviare l'exploit a un webhook codificato in base64 dentro un parametro di query.

Il programma a tre livelli di Anthropic gestisce chi può puntare questa capacità verso software di produzione. Non gestisce, e non può gestire, cosa succede quando la capacità compare in ogni agente di coding che si connette a Internet. I cancelli che più conteranno nel prossimo anno potrebbero non essere quelli sull'accesso ai modelli. Potrebbero essere quelli sull'egress di rete.

Articoli correlati