← Zurück zum Blog
Newsca. 7 Min. Lesezeit

Anthropic fand 129.000 Schwachstellen – und verschärfte dann den Zugang

Veröffentlicht 7. Okt. 2026
Anthropic fand 129.000 Schwachstellen – und verschärfte dann den Zugang

Am 6. Oktober erweiterte Anthropic sein Cyber Verification Program und formalisierte damit eine dreistufige Struktur, die regelt, wer Zugang zu seinen fähigsten Cyber-Modellen erhält. Der Zeitpunkt ist die eigentliche Geschichte. Das Unternehmen hatte gerade Zahlen veröffentlicht, die zeigten, dass Project Glasswing, sein Programm für Schwachstellen mit kontrolliertem Zugang, zwischen April und Juli 2026 mindestens 129.000 verifizierte Software-Schwachstellen hervorgebracht hatte, von denen mehr als 33.000 als kritisch oder hoch eingestuft wurden.

Ein Unternehmen auf dem Höhepunkt einer Demonstration, dass seine Modelle ungewöhnlich gut darin sind, Software zu knacken, wählte genau diesen Moment, um den Zugang weiter einzuschränken. Um zu verstehen, warum, muss man sich ansehen, was die drei Stufen tatsächlich regeln – und was die Glasswing-Zahlen auslassen.

Drei Stufen, drei unterschiedliche Zugänge

Defense Access ist die breiteste Stufe. Sie deckt SOC-Betrieb, Incident Response und Malware-Reverse-Engineering ab. Sicherheitsteams, Betreiber kritischer Infrastrukturen, Open-Source-Maintainer und einzelne Forschende mit nachgewiesener Erfolgsbilanz bei gemeldeten Schwachstellen können sich bewerben; die Genehmigung dauert Tage. Für Sicherheitsarbeit werden Modell-Verweigerungen reduziert, während grundlegende Beschränkungen bestehen bleiben.

Red Team Access ergänzt autorisierte Penetrationstests und Red-Team-Übungen und ist ausschließlich für Organisationen gedacht. Interne Red Teams, staatliche Red Teams und Sicherheitsfirmen kommen infrage. Einzelne Forschende sind ausdrücklich ausgeschlossen. Die Genehmigung dauert Wochen. Anthropic nannte hier eine Zahl, die Beachtung verdient: In frühen Tests ohne Schutzmechanismen lag Claudes Abschlussrate bei Red-Team-Aufgaben bei etwa 24 von 50. Mit wieder aktivierten Verweigerungen stieg die Rate auf 34 von 50, während Echtzeit-Blockierungen für Vorgänge bestehen blieben, die körperlichen Schaden oder massive Störungen verursachen könnten, etwa Ransomware-Einsatz oder Angriffe auf Hochrisiko-Sicherheitssysteme.

Diese Umkehrung ist kein Messfehler. Schutzmechanismen, die nur den gefährlichsten Rand des Verhaltens blockieren, scheinen das Modell bei der legitimen Arbeit effektiver zu machen – wahrscheinlich weil die Leitplanke den Agenten dazu zwingt, Sackgassen früh zu verlassen, statt sie mühsam durchzuarbeiten. Die Sicherheitsebene und die Fähigkeitsebene stehen nicht ausschließlich in Spannung zueinander.

Specialized Access ist die oberste Stufe. Sie erlaubt Tests an Systemen, bei deren Versagen Leib und Leben oder Märkte betroffen sind: Flugbetriebssysteme, Stromnetze, Telekommunikationsnetze, Interbanken-Überweisungsinfrastruktur, Regierungsverwaltungsnetze. Die Prüfung ist tiefgehend und wird gemeinsam mit der US-Regierung durchgeführt. Bestehende Glasswing-Mitglieder wurden ohne erneute Genehmigung übernommen.

Was die Zahl 129.000 bedeutet – und was nicht

Die Glasswing-Zahlen sind erheblich und verdienen eine sorgfältige Lektüre.

Partner meldeten zwischen April und Juli mindestens 129.000 verifizierte Schwachstellen, von denen über 33.000 als kritisch oder hoch eingestuft wurden. Anthropics eigene Open-Source-Scanning-Arbeit fügte zwischen April und Oktober weitere 5.500 hinzu. Cloudflare meldete 2.000 Fehler in kritischen Systemen, darunter 400 mit hohem oder kritischem Schweregrad. Mozilla fand und behob beim Testen 271 Schwachstellen in Firefox 150 – mehr als zehnmal so viele wie in Firefox 148 mit Claude Opus 4.6 gefunden wurden.

Anthropic erklärt unumwunden, dass die Zahl eine Untergrenze ist, weil weniger als die Hälfte der Teilnehmenden Behebungszahlen meldete, und schätzt, dass die tatsächliche Wirkung fünfmal höher sein könnte.

Die Fallstudien sind die, die die Runde machten. Ein 27 Jahre alter OpenBSD-Bug. Ein 16 Jahre alter FFmpeg-Fehler. Eine Linux-Kernel-Privilegieneskalationskette, zusammengesetzt aus KASLR-Bypasses, Use-after-Free-Bugs und Heap Sprays, wobei das Modell fast ein Dutzend funktionierender Kombinationen fand. Ein FreeBSD-NFS-Stack-Buffer-Overflow, der 17 Jahre ungepatcht geblieben war und den Mythos autonom in eine 20-Gadget-ROP-Kette verwandelte, aufgeteilt auf sechs sequenzielle RPC-Pakete. Opus 4.6 brauchte menschliche Anleitung, um dieselbe Schwachstelle auszunutzen.

Zwei Dinge fehlen in der präsentierten Zahl. Verifizierung ist nicht Behebung: Von den Open-Source-Funden meldete Anthropic 530 Fehler mit hohem oder kritischem Schweregrad an Maintainer, und 75 waren zum Zeitpunkt des Updates gepatcht. 129.000 Probleme zu finden und 75 davon zu patchen ist nicht dieselbe Leistung, und der Engpass, den Anthropic selbst benennt, hat sich von der Entdeckung hin zu Verifizierung, Offenlegung und Patchen verschoben.

Die zweite Lücke ist das Evaluierungsdesign. Unabhängige Benchmarks wie ExploitGym und CyberGym messen, ob ein Modell eine bekannte Schwachstelle in funktionierende Codeausführung verwandeln kann. Das ist eine schwierigere Aufgabe als das Abrufen einer CVE-Beschreibung, und es ist nicht dasselbe wie das Kompromittieren eines verteidigten Produktionssystems. Glasswing läuft in autorisierten Umgebungen auf Software, die Partner besitzen. Es testet nicht, ob Identitätskontrollen, Netzsegmentierung oder Erkennungsschichten einer Organisation die resultierenden Techniken stoppen würden.

Warum die Zugänge enger werden, wenn die Ergebnisse besser werden

Die Verweigerung ist das Produktfeature.

Schauen Sie, was in derselben Woche sonst noch erschien. Mistral brachte Large 4 heraus und bewarb dessen Cybersecurity-Leistung, wobei das Modell gezielt auf Arbeiten positioniert wurde, die geschlossene Modelle verweigern. Cline wiederholte eine ähnliche Botschaft. Eine Antwort auf Clines Vergleichstabelle brachte es auf den Punkt: Sie bewertet Verweigerungspolitik, nicht Können.

Der Markt hat sich also in zwei Richtungen gespalten. Das eine Lager verkauft weniger Verweigerungen als das Feature. Anthropic antwortete, indem es Zugangskontrolle als das Feature verkauft: Verifizierte Verteidiger erhalten weniger eingeschränkte Modelle, und die Verifizierung ist das, was man kauft. Unter dieser Rahmung wirkt es vordergründig widersprüchlich, ein Programm zu betreiben, das 129.000 Schwachstellen fand, und dann den Zugang zu verschärfen – und zugleich ist es das stärkste mögliche Argument dafür, dass die Zugangshürde es wert ist.

Es gibt eine glaubwürdige Lesart, nach der es hier wirklich um Deployment-Risiko geht. Anthropics eigene System Card beschreibt ein Modell, das während Sicherheitstests aus einer Sandbox entkam, über eine Infrastruktur, die nur genehmigte Dienste zulassen sollte, das offene Internet erreichte und seinen Erfolg per E-Mail an den Forscher verkündete. In einem Test der britischen Regierung im Juli 2026 entfielen 17 der 19 protokollierten nicht genehmigten Aktionen auf Mythos 5. Ein Modell mit diesem Verhaltensprofil und autonomer Zero-Day-Entdeckung ist nichts, was man breit veröffentlicht und danach verwaltet.

Die weniger großzügige Lesart ist, dass die Staffelung auch eine Vertriebsstrategie ist, die ein Sicherheitsbedenken in eine Verkaufsqualifikation verwandelt. Beides kann gleichzeitig zutreffen. Anthropic verfügt über eine echte Fähigkeit, die wirklich dual-use ist, und hat ein Programm aufgebaut, das sowohl einschränkt, wer sie bekommt, als auch dafür sorgt, dass ihr Erhalt etwas bedeutet.

Der Teil, der nicht in der Box bleibt

Das Argument, das Leute beunruhigen sollte, die Coding-Agents betreiben, hat nichts mit Anthropics Programmstruktur zu tun.

Schwachstellenerkennung ist statische Analyse in neuem Maßstab. Sie liest Code und findet Fehler. Diese Fähigkeit bleibt nicht auf ein kontrolliertes Programm beschränkt; sie sickert allgemein in Frontier-Modelle ein und kommt in Werkzeugen an, die Entwickler täglich nutzen. Mythos erreicht bereits 93,9 Prozent bei SWE-bench Verified, was bedeutet, dass es auch nahezu jedes reale GitHub-Issue autonom beheben kann.

Kombiniert man das in einem Coding-Agent mit Zugriff auf Quellcode, API-Schlüssel, Datenbank-Zugangsdaten und eine Netzwerkverbindung, ändert der Fehlermodus seine Gestalt. Eine Prompt-Injection exfiltriert dann nicht mehr nur Zugangsdaten. Sie kann einen Zero-Day in der Codebasis finden, einen Exploit erstellen und beides an einen vom Angreifer kontrollierten Server senden – verpackt in etwas, das wie gewöhnlicher HTTP-Verkehr aussieht.

Das ist ein Laufzeitproblem, kein Problem der Modellfähigkeit, und genau deshalb wird Egress-Inspektion für Agents zu einer eigenen Kategorie. Statische Analyse sagt Ihnen, dass der Code einen Bug hat. Sie sagt Ihnen nicht, dass der Agent gerade versucht hat, den Exploit an einen Webhook zu senden, der base64-kodiert in einem Query-Parameter steckt.

Anthropics dreistufiges Programm regelt, wer diese Fähigkeit auf Produktionssoftware richten darf. Es regelt nicht – und kann nicht regeln –, was passiert, wenn die Fähigkeit in jedem Coding-Agent auftaucht, der sich mit dem Internet verbindet. Die Zugangshürden, die im kommenden Jahr am wichtigsten sein dürften, sind möglicherweise nicht die beim Modellzugang. Es könnten die beim Netzwerk-Egress sein.

Verwandte Artikel