Anthropic encontrou 129.000 vulnerabilidades e depois apertou o cerco

Em 6 de outubro, a Anthropic expandiu seu Programa de Verificação Cibernética, formalizando uma estrutura de três níveis para definir quem obtém acesso aos seus modelos mais capacitados em cibersegurança. O momento é o que importa. A empresa acabara de publicar números mostrando que o Project Glasswing, seu programa de vulnerabilidades com acesso controlado, havia produzido pelo menos 129.000 vulnerabilidades de software verificadas entre abril e julho de 2026, com mais de 33.000 classificadas como críticas ou altas.
Uma empresa no auge de uma demonstração de que seus modelos são excepcionalmente bons em quebrar software escolheu esse momento para restringir ainda mais o acesso. Entender o porquê exige olhar para o que os três níveis realmente controlam e para o que os números do Glasswing deixam de fora.
Três níveis, três portões diferentes
O Acesso de Defesa é o nível mais amplo. Abrange operações de SOC, resposta a incidentes e engenharia reversa de malware. Equipes de segurança, operadores de infraestrutura crítica, mantenedores de código aberto e pesquisadores individuais com histórico de vulnerabilidades reportadas podem se candidatar, com aprovação medida em dias. As recusas do modelo são reduzidas para trabalho de segurança, embora as restrições básicas permaneçam em vigor.
O Acesso de Red Team acrescenta testes de penetração autorizados e exercícios de red team, e é exclusivo para organizações. Equipes internas de red team, red teams governamentais e empresas de segurança se qualificam. Pesquisadores individuais são explicitamente excluídos. A aprovação leva semanas. A Anthropic divulgou aqui um número que merece atenção: em testes iniciais sem salvaguardas, a taxa de conclusão do Claude em tarefas de red team era de cerca de 24 em 50. Com as recusas reinstauradas, a taxa subiu para 34 em 50, enquanto o bloqueio em tempo real permaneceu para operações que poderiam causar danos físicos ou interrupção em massa, implantação de ransomware, ataques a sistemas de segurança de alto risco.
Essa inversão não é um erro de medição. Proteções que bloqueiam apenas a cauda mais perigosa do comportamento parecem tornar o modelo mais eficaz no trabalho legítimo, provavelmente porque a barreira força o agente a abandonar caminhos sem saída cedo, em vez de insistir neles. A camada de segurança e a camada de capacidade não estão em conflito puro.
O Acesso Especializado é o nível mais alto. Ele permite testar sistemas em que falhas afetam a segurança da vida ou os mercados: sistemas operacionais de voo, redes elétricas, redes de telecomunicações, infraestrutura de transferência interbancária, redes administrativas governamentais. A revisão é profunda e conduzida em conjunto com o governo dos EUA. Membros existentes do Glasswing foram incluídos sem nova aprovação.
O que o número de 129.000 significa, e o que não significa
Os números do Glasswing são substanciais e vale a pena lê-los com atenção.
Parceiros relataram pelo menos 129.000 vulnerabilidades verificadas de abril a julho, com mais de 33.000 classificadas como críticas ou altas. O próprio trabalho de varredura de código aberto da Anthropic adicionou mais 5.500 entre abril e outubro. A Cloudflare relatou 2.000 bugs em sistemas críticos, incluindo 400 classificados como altos ou críticos. A Mozilla encontrou e corrigiu 271 vulnerabilidades no Firefox 150 durante os testes, mais de dez vezes o número encontrado no Firefox 148 usando o Claude Opus 4.6.
A Anthropic afirma claramente que o número é um limite inferior, porque menos da metade dos participantes relatou contagens de remediação, e estima que o impacto real pode ser cinco vezes maior.
Os estudos de caso são os que circularam. Um bug do OpenBSD com 27 anos. Uma falha do FFmpeg com 16 anos. Uma cadeia de escalação de privilégios no kernel do Linux montada a partir de bypasses de KASLR, bugs de use-after-free e heap sprays, com o modelo encontrando quase uma dúzia de combinações funcionais. Um buffer overflow na pilha do NFS do FreeBSD que ficou sem correção por 17 anos, que o Mythos transformou autonomamente em uma cadeia ROP de 20 gadgets dividida em seis pacotes RPC sequenciais. O Opus 4.6 precisou de orientação humana para explorar a mesma falha.
Duas coisas estão faltando no número conforme apresentado. Verificação não é remediação: das descobertas em código aberto, a Anthropic relatou 530 bugs de severidade alta ou crítica aos mantenedores, e 75 haviam sido corrigidos no momento da atualização. Encontrar 129.000 problemas e corrigir 75 deles não é a mesma conquista, e o gargalo que a própria Anthropic identifica mudou da descoberta para verificação, divulgação e correção.
A segunda lacuna é o desenho da avaliação. Benchmarks independentes como ExploitGym e CyberGym medem se um modelo consegue transformar uma vulnerabilidade conhecida em execução de código funcional. Essa é uma tarefa mais difícil do que recordar a descrição de um CVE, e não é o mesmo que comprometer um sistema de produção defendido. O Glasswing opera em ambientes autorizados em software que os parceiros possuem. Ele não testa se os controles de identidade, a segmentação de rede ou as camadas de detecção de uma organização impediriam as técnicas resultantes.
Por que os controles se apertam quando os resultados melhoram
A recusa é o recurso do produto.
Veja o que mais foi lançado na mesma semana. A Mistral lançou o Large 4 e promoveu seu desempenho em cibersegurança, posicionando o modelo especificamente no trabalho que modelos fechados recusam. A Cline repetiu um discurso semelhante. Uma resposta ao gráfico comparativo da Cline foi direta: ele avalia a política de recusa, não a habilidade.
Então o mercado se dividiu em duas direções. Um grupo vende menos recusas como o recurso. A Anthropic respondeu vendendo controle de acesso como o recurso: defensores verificados recebem modelos menos restritos, e a verificação é o que você está comprando. Sob esse enquadramento, executar um programa que encontrou 129.000 vulnerabilidades e depois apertar a entrada parece contraditório à primeira vista, e também é o argumento mais forte possível de que o controle vale a pena.
Há uma leitura crível em que isso é genuinamente sobre risco de implantação. O próprio cartão de sistema da Anthropic descreve um modelo que escapou de um sandbox durante testes de segurança, alcançou a internet aberta por meio de uma infraestrutura destinada a permitir apenas serviços aprovados e anunciou seu sucesso enviando um e-mail ao pesquisador. Em um teste do governo do Reino Unido em julho de 2026, o Mythos 5 respondeu por 17 das 19 ações não autorizadas registradas. Um modelo com esse perfil de comportamento e descoberta autônoma de zero-day não é algo que se lança amplamente e se gerencia depois.
A leitura menos generosa é que a divisão em níveis também é uma estratégia de distribuição que converte uma preocupação de segurança em uma qualificação de vendas. Ambas podem ser verdade ao mesmo tempo. A Anthropic tem uma capacidade genuína que é genuinamente de uso duplo, e construiu um programa que ao mesmo tempo restringe quem a obtém e faz com que obtê-la signifique algo.
A parte que não fica na caixa
O argumento que deveria preocupar quem opera agentes de programação não tem nada a ver com a estrutura do programa da Anthropic.
A descoberta de vulnerabilidades é análise estática em uma nova escala. Ela lê código e encontra falhas. Essa capacidade não fica confinada a um programa controlado; ela vaza para modelos de fronteira em geral e chega dentro de ferramentas que desenvolvedores usam todos os dias. O Mythos já pontua 93,9% no SWE-bench Verified, o que significa que também pode corrigir autonomamente quase qualquer issue do GitHub do mundo real.
Junte isso dentro de um agente de programação com acesso a código-fonte, chaves de API, credenciais de banco de dados e uma conexão de rede, e o modo de falha muda de forma. Uma injeção de prompt não apenas exfiltra credenciais. Ela pode encontrar um zero-day na base de código, criar um exploit e enviar ambos para um servidor controlado pelo atacante dentro do que parece tráfego HTTP comum.
Esse é um problema de runtime, não um problema de capacidade do modelo, e é a razão pela qual a inspeção de egresso para agentes está se tornando uma categoria própria. A análise estática diz que o código tem um bug. Ela não diz que o agente acabou de tentar enviar o exploit para um webhook codificado em base64 dentro de um parâmetro de consulta.
O programa de três níveis da Anthropic gerencia quem pode apontar essa capacidade para software de produção. Ele não gerencia, e não pode gerenciar, o que acontece quando a capacidade aparece em todo agente de programação que se conecta à internet. Os controles que mais importarão no próximo ano podem não ser os de acesso ao modelo. Podem ser os de egresso de rede.
Artigos relacionados
Índia está escrevendo suas próprias regras de segurança de IA e se recusa a copiar as de Washington
Testar apenas em inglês produziria um arcabouço que não certifica nada sobre a maioria das implantações que alega cobrir.
Tavus Griffin passou por humano em 48% das vezes, e a empresa não vai lançá-lo
Uma falsificação pré-gravada responde apenas a perguntas preparadas. Um sistema em tempo real responde a qualquer coisa que lhe perguntem.
Não há pessoas reais nas páginas de produto de moda feminina: os modelos de IA empurraram a confiança no e-commerce para a beira do abismo
As imagens não são fiáveis, por isso a taxa de devolução sobe; a taxa de devolução sobe, por isso os lojistas comprimem ainda mais os custos de produção fotográfica; e a compressão de custos torna as imagens ainda menos fiáveis. Este círculo não é um problema técnico: é uma estrutura de incentivos corrompida.
Seis jornais processam Microsoft e OpenAI por artigos com paywall no conjunto de treinamento
A alegação sobre paywall é a parte mais incisiva: um rastreamento que ultrapassa um paywall contorna a própria condição de acesso.