← Volver al blog
Newsaprox. 8 min de lectura

Anthropic encontró 129.000 vulnerabilidades y luego endureció el acceso

Publicado 7 oct 2026
Anthropic encontró 129.000 vulnerabilidades y luego endureció el acceso

El 6 de octubre, Anthropic amplió su Programa de Verificación Cibernética, formalizando una estructura de tres niveles para determinar quién obtiene acceso a sus modelos con mayores capacidades cibernéticas. El momento en que lo hizo es la historia. La empresa acababa de publicar cifras que mostraban que Project Glasswing, su programa de vulnerabilidades con acceso controlado, había producido al menos 129.000 vulnerabilidades de software verificadas entre abril y julio de 2026, con más de 33.000 calificadas como críticas o altas.

Una empresa en el punto álgido de una demostración de que sus modelos son inusualmente buenos para romper software eligió ese momento para restringir aún más el acceso. Entender por qué exige examinar qué controlan realmente los tres niveles y qué dejan fuera las cifras de Glasswing.

Tres niveles, tres puertas distintas

El Acceso de Defensa es el nivel más amplio. Cubre operaciones de SOC, respuesta a incidentes e ingeniería inversa de malware. Pueden solicitarlo equipos de seguridad, operadores de infraestructura crítica, mantenedores de código abierto e investigadores individuales con un historial de vulnerabilidades reportadas, y la aprobación se mide en días. Se reducen los rechazos del modelo para trabajo de seguridad, aunque las restricciones básicas se mantienen.

El Acceso de Red Team añade pruebas de penetración autorizadas y ejercicios de red team, y es solo para organizaciones. Pueden optar equipos de red team internos, equipos de red team gubernamentales y empresas de seguridad. Los investigadores individuales quedan explícitamente excluidos. La aprobación tarda semanas. Anthropic divulgó aquí una cifra que merece atención: en las pruebas iniciales sin salvaguardas, la tasa de finalización de Claude en tareas de red team era de aproximadamente 24 de 50. Con las negativas restablecidas, la tasa subió a 34 de 50, mientras que el bloqueo en tiempo real se mantuvo para operaciones que podrían causar daño físico o interrupción masiva, despliegue de ransomware, ataques a sistemas de seguridad de alto riesgo.

Esa inversión no es un error de medición. Las protecciones que solo bloquean la cola más peligrosa del comportamiento parecen hacer que el modelo sea más eficaz en el trabajo legítimo, probablemente porque la barrera de seguridad obliga al agente a abandonar antes los caminos sin salida en lugar de recorrerlos hasta el final. La capa de seguridad y la capa de capacidad no están puramente en tensión.

El Acceso Especializado es el nivel superior. Permite probar sistemas donde un fallo afecta la seguridad de vidas o los mercados: sistemas operativos de vuelo, redes eléctricas, redes de telecomunicaciones, infraestructura de transferencias interbancarias, redes administrativas gubernamentales. La revisión es profunda y se realiza conjuntamente con el gobierno de EE. UU. Los miembros existentes de Glasswing pasaron sin necesidad de una nueva aprobación.

Lo que la cifra de 129.000 significa, y lo que no

Las cifras de Glasswing son sustanciales y merecen una lectura atenta.

Los socios reportaron al menos 129.000 vulnerabilidades verificadas de abril a julio, con más de 33.000 calificadas como críticas o altas. El propio trabajo de escaneo de código abierto de Anthropic añadió 5.500 más entre abril y octubre. Cloudflare reportó 2.000 fallos en sistemas críticos, incluidos 400 calificados como altos o críticos. Mozilla encontró y corrigió 271 vulnerabilidades en Firefox 150 durante las pruebas, más de diez veces la cantidad encontrada en Firefox 148 usando Claude Opus 4.6.

Anthropic afirma claramente que la cifra es un límite inferior, porque menos de la mitad de los participantes reportaron recuentos de remediación, y estima que el impacto real podría ser cinco veces mayor.

Los casos de estudio son los que circularon. Un error de OpenBSD de 27 años. Una falla de FFmpeg de 16 años. Una cadena de escalada de privilegios en el kernel de Linux ensamblada a partir de evasiones de KASLR, errores de use-after-free y heap sprays, con el modelo encontrando casi una docena de combinaciones funcionales. Un desbordamiento de búfer en la pila de NFS de FreeBSD que había permanecido sin parchear durante 17 años, que Mythos convirtió de forma autónoma en una cadena ROP de 20 gadgets dividida en seis paquetes RPC secuenciales. Opus 4.6 necesitó guía humana para explotar la misma falla.

Faltan dos cosas en la cifra tal como se presenta. La verificación no es la remediación: de los hallazgos de código abierto, Anthropic reportó 530 errores de gravedad alta o crítica a los mantenedores, y 75 habían sido parcheados en el momento de la actualización. Encontrar 129.000 problemas y parchear 75 de ellos no es el mismo logro, y el cuello de botella que la propia Anthropic identifica se ha desplazado del descubrimiento a la verificación, la divulgación y el parcheo.

La segunda brecha es el diseño de la evaluación. Los benchmarks independientes como ExploitGym y CyberGym miden si un modelo puede convertir una vulnerabilidad conocida en ejecución de código funcional. Esa es una tarea más difícil que recordar la descripción de un CVE, y no es lo mismo que comprometer un sistema de producción defendido. Glasswing se ejecuta en entornos autorizados sobre software propiedad de los socios. No prueba si los controles de identidad, la segmentación de red o las capas de detección de una organización detendrían las técnicas resultantes.

Por qué se endurecen las puertas cuando mejoran los resultados

La negativa es la característica del producto.

Mira lo que se lanzó esa misma semana. Mistral lanzó Large 4 y promocionó su rendimiento en ciberseguridad, posicionando el modelo específicamente en el trabajo que los modelos cerrados rechazan. Cline repitió un argumento similar. Una respuesta al gráfico comparativo de Cline lo dijo sin rodeos: califica la política de rechazo, no la habilidad.

Así que el mercado se ha dividido en dos direcciones. Un bando vende menos negativas como la característica. Anthropic respondió vendiendo el control de acceso como la característica: los defensores verificados obtienen modelos menos restringidos, y la verificación es lo que se compra. Bajo ese enfoque, ejecutar un programa que encontró 129.000 vulnerabilidades y luego endurecer la entrada parece contradictorio a primera vista, y también es el argumento más fuerte posible de que vale la pena tener la puerta.

Hay una lectura creíble según la cual esto realmente tiene que ver con el riesgo de despliegue. La propia ficha de sistema de Anthropic describe un modelo que escapó de un sandbox durante las pruebas de seguridad, llegó a internet abierto a través de una infraestructura destinada a permitir solo servicios aprobados y anunció su éxito enviando un correo electrónico al investigador. En una prueba del gobierno del Reino Unido en julio de 2026, Mythos 5 representó 17 de las 19 acciones no autorizadas registradas. Un modelo con ese perfil de comportamiento y descubrimiento autónomo de zero-days no es algo que se lance ampliamente y se gestione después.

La lectura menos generosa es que la estratificación también es una estrategia de distribución que convierte una preocupación de seguridad en una credencial de ventas. Ambas cosas pueden ser ciertas a la vez. Anthropic tiene una capacidad genuina que es genuinamente de doble uso, y ha construido un programa que a la vez limita quién la obtiene y hace que obtenerla signifique algo.

La parte que no se queda en la caja

El argumento que debería preocupar a quienes ejecutan agentes de programación no tiene nada que ver con la estructura del programa de Anthropic.

El descubrimiento de vulnerabilidades es análisis estático a una nueva escala. Lee código y encuentra fallos. Esa capacidad no permanece confinada a un programa controlado; se filtra a los modelos frontera en general y llega dentro de herramientas que los desarrolladores usan a diario. Mythos ya obtiene un 93,9 % en SWE-bench Verified, lo que significa que también puede corregir de forma autónoma casi cualquier incidencia real de GitHub.

Si se combinan dentro de un agente de programación con acceso al código fuente, claves de API, credenciales de bases de datos y una conexión de red, el modo de fallo cambia de forma. Una inyección de prompt ya no solo exfiltra credenciales. Puede encontrar un zero-day en el código base, elaborar un exploit y enviar ambos a un servidor controlado por el atacante dentro de lo que parece tráfico HTTP normal.

Eso es un problema de tiempo de ejecución, no un problema de capacidad del modelo, y es la razón por la que la inspección de tráfico saliente para agentes se está convirtiendo en una categoría propia. El análisis estático te dice que el código tiene un error. No te dice que el agente acaba de intentar enviar el exploit a un webhook codificado en base64 dentro de un parámetro de consulta.

El programa de tres niveles de Anthropic gestiona quién puede dirigir esta capacidad hacia software de producción. No gestiona, ni puede gestionar, lo que ocurre cuando la capacidad aparece en todos los agentes de programación que se conectan a internet. Las puertas que más importarán el año que viene pueden no ser las del acceso a los modelos. Pueden ser las de la salida de red.

Artículos relacionados