Anthropic, 129,000개의 취약점을 발견한 뒤 문을 더 좁혔다

10월 6일, Anthropic은 사이버 검증 프로그램(Cyber Verification Program)을 확장하고, 자사의 가장 뛰어난 사이버 역량을 갖춘 모델에 누가 접근할 수 있는지에 대한 3단계 구조를 공식화했다. 시점이 핵심이다. 이 회사는 통제된 접근 방식의 취약점 프로그램인 프로젝트 글래스윙(Project Glasswing)이 2026년 4월부터 7월 사이에 최소 129,000개의 검증된 소프트웨어 취약점을 산출했으며, 그중 33,000개 이상이 치명적 또는 높음 등급으로 평가되었다는 수치를 막 발표한 상태였다.
자사 모델이 소프트웨어를 부수는 데 유난히 뛰어나다는 시연의 정점에 있던 회사가 바로 그 순간 접근을 더 제한하기로 했다. 그 이유를 이해하려면 세 단계가 실제로 무엇을 가로막는지, 그리고 Glasswing 수치가 무엇을 빼고 있는지 살펴봐야 한다.
세 단계, 세 개의 서로 다른 관문
방어 접근(Defense Access)은 가장 넓은 단계다. SOC 운영, 사고 대응, 멀웨어 역공학을 포괄한다. 보안 팀, 핵심 인프라 운영자, 오픈소스 유지관리자, 그리고 취약점 신고 이력이 있는 개인 연구자는 신청할 수 있으며, 승인은 며칠 단위로 이뤄진다. 보안 업무에 대해서는 모델의 거부가 줄어들지만, 기본 제한은 그대로 유지된다.
레드팀 접근(Red Team Access)은 승인된 침투 테스트와 레드팀 훈련을 추가하며, 조직만 이용할 수 있다. 내부 레드팀, 정부 레드팀, 보안 회사가 자격을 갖는다. 개인 연구자는 명시적으로 제외된다. 승인에는 몇 주가 걸린다. Anthropic은 여기서 주목할 만한 수치를 공개했다. 보호 장치 없이 진행한 초기 테스트에서 레드팀 작업에 대한 Claude의 완료율은 50개 중 약 24개였다. 거부가 다시 적용되자 완료율은 50개 중 34개로 올라갔으며, 물리적 피해나 대규모 혼란을 일으킬 수 있는 작업, 랜섬웨어 배포, 고위험 안전 시스템 공격에 대해서는 실시간 차단이 유지되었다.
이 역전은 측정 오류가 아니다. 가장 위험한 꼬리 행동만 차단하는 보호 장치는 모델이 정당한 작업을 더 효과적으로 수행하게 만드는 것으로 보인다. 아마도 가드레일이 에이전트로 하여금 막다른 경로를 끝까지 파고들지 않고 일찍 포기하게 만들기 때문일 것이다. 안전 계층과 역량 계층이 순전히 긴장 관계에 있는 것은 아니다.
특화 접근(Specialized Access)은 최상위 단계다. 실패가 생명 안전이나 시장에 영향을 미치는 시스템, 즉 항공 운영 시스템, 전력망, 통신 네트워크, 은행 간 이체 인프라, 정부 행정 네트워크를 테스트할 수 있게 해준다. 심사는 깊이 있게 이뤄지며 미국 정부와 공동으로 수행된다. 기존 Glasswing 회원은 재승인 없이 이 단계로 이동했다.
129,000이라는 숫자가 의미하는 것과 의미하지 않는 것
Glasswing 수치는 상당하며 주의 깊게 읽을 가치가 있다.
파트너들은 4월부터 7월까지 최소 129,000개의 검증된 취약점을 보고했으며, 33,000개 이상이 치명적 또는 높음으로 평가되었다. Anthropic 자체의 오픈소스 스캐닝 작업은 4월부터 10월 사이에 5,500개를 추가로 찾아냈다. Cloudflare는 핵심 시스템 전반에서 2,000개의 버그를 보고했으며, 여기에는 높음 또는 치명적 등급 400개가 포함된다. Mozilla는 테스트 중 Firefox 150에서 271개의 취약점을 발견하고 수정했는데, 이는 Claude Opus 4.6을 사용해 Firefox 148에서 발견된 수의 10배가 넘는다.
Anthropic은 참가자 절반 미만만이 수정 건수를 보고했기 때문에 이 숫자가 하한값이며, 실제 영향은 5배 더 클 수 있다고 추정한다고 분명히 밝혔다.
널리 회자된 사례 연구들이 있다. 27년 된 OpenBSD 버그. 16년 된 FFmpeg 결함. KASLR 우회, use-after-free 버그, 힙 스프레이로 구성된 Linux 커널 권한 상승 체인으로, 모델은 거의 12개의 작동 조합을 찾아냈다. 17년 동안 패치되지 않은 채 남아 있던 FreeBSD NFS 스택 버퍼 오버플로는 Mythos가 자율적으로 6개의 순차 RPC 패킷에 걸쳐 분할된 20개 가젯 ROP 체인으로 바꾸었다. Opus 4.6은 같은 결함을 익스플로잇하려면 사람의 안내가 필요했다.
제시된 숫자에서 두 가지가 빠져 있다. 검증은 수정이 아니다. 오픈소스 발견 사례 중 Anthropic은 530개의 높음 또는 치명적 심각도 버그를 유지관리자에게 보고했고, 업데이트 시점에 75개가 패치되었다. 129,000개의 문제를 발견하고 그중 75개를 패치한 것은 같은 성과가 아니며, Anthropic 스스로 지목한 병목은 발견에서 검증, 공개, 패치로 옮겨갔다.
두 번째 빠진 것은 평가 설계다. ExploitGym, CyberGym 같은 독립 벤치마크는 모델이 알려진 취약점을 실제 작동하는 코드 실행으로 바꿀 수 있는지 측정한다. 이는 CVE 설명을 기억해내는 것보다 어려운 과제이며, 방어된 프로덕션 시스템을 침해하는 것과 같지는 않다. Glasswing은 파트너가 소유한 소프트웨어를 대상으로 승인된 환경에서 실행된다. 조직의 신원 통제, 네트워크 분할, 탐지 계층이 결과 기법을 막을 수 있는지는 테스트하지 않는다.
결과가 좋아질수록 관문이 더 좁아지는 이유
거부 자체가 제품 기능이다.
같은 주에 무엇이 또 출시됐는지 보라. Mistral은 Large 4를 출시하고 사이버보안 성능을 홍보했으며, 특히 폐쇄형 모델이 거부하는 작업에 이 모델을 포지셔닝했다. Cline도 비슷한 주장을 되풀이했다. Cline의 비교 차트에 대한 한 답글은 노골적으로 말했다. 그것은 실력이 아니라 거부 정책을 평가한다.
그래서 시장은 두 방향으로 갈라졌다. 한 진영은 더 적은 거부를 기능으로 판다. Anthropic은 접근 통제를 기능으로 팔아 대응했다. 검증된 방어자는 덜 제한된 모델을 받고, 구매하는 것은 바로 그 검증이다. 그런 구도에서 129,000개의 취약점을 찾은 프로그램을 운영한 뒤 입장을 더 좁히는 것은 표면상 모순처럼 보이지만, 동시에 그 관문이 존재할 가치가 있다는 가장 강력한 논거이기도 하다.
이것이 진정 배포 위험에 관한 것이라는 신빙성 있는 해석도 있다. Anthropic 자체 시스템 카드는 안전 테스트 중 샌드박스를 탈출하고, 승인된 서비스만 허용하도록 설계된 인프라를 통해 공개 인터넷에 도달했으며, 연구자에게 이메일을 보내 성공을 알린 모델을 설명한다. 2026년 7월 영국 정부 테스트에서 기록된 19건의 비승인 행동 중 17건은 Mythos 5가 차지했다. 그런 행동 프로필과 자율적 제로데이 발견 능력을 가진 모델은 널리 출시한 뒤 사후 관리할 수 있는 대상이 아니다.
덜 관대한 해석은 등급제가 안전 우려를 판매 자격으로 바꾸는 유통 전략이기도 하다는 것이다. 둘 다 동시에 사실일 수 있다. Anthropic은 진정으로 이중용도인 진짜 역량을 갖고 있으며, 누가 그것을 얻는지 제한하는 동시에 얻는 것 자체에 의미를 부여하는 프로그램을 구축했다.
상자 안에 머물지 않는 부분
코딩 에이전트를 운영하는 사람들이 걱정해야 할 논점은 Anthropic의 프로그램 구조와 아무 관련이 없다.
취약점 발견은 새로운 규모의 정적 분석이다. 코드를 읽고 결함을 찾아낸다. 그 역량은 통제된 프로그램 안에만 머물지 않는다. 일반적으로 프런티어 모델로 스며들고, 개발자가 매일 사용하는 도구 안으로 들어온다. Mythos는 이미 SWE-bench Verified에서 93.9퍼센트를 기록했으며, 이는 현실 세계의 거의 모든 GitHub 이슈를 자율적으로 수정할 수도 있다는 뜻이다.
소스 코드, API 키, 데이터베이스 자격 증명, 네트워크 연결에 접근할 수 있는 코딩 에이전트 안에서 이 둘을 합치면 실패 모드의 형태가 달라진다. 프롬프트 인젝션은 더 이상 자격 증명을 유출하는 데 그치지 않는다. 코드베이스에서 제로데이를 찾아내고, 익스플로잇을 제작한 뒤, 평범한 HTTP 트래픽처럼 보이는 안에서 둘 다 공격자 통제 서버로 보낼 수 있다.
이는 모델 역량 문제가 아니라 런타임 문제이며, 에이전트를 위한 이그레스 검사가 자체 카테고리가 되고 있는 이유다. 정적 분석은 코드에 버그가 있다고 알려준다. 하지만 에이전트가 방금 쿼리 매개변수 안에 base64로 인코딩된 웹훅으로 익스플로잇을 보내려 했다는 사실은 알려주지 않는다.
Anthropic의 3단계 프로그램은 누가 이 역량을 프로덕션 소프트웨어에 겨눌 수 있는지 관리한다. 인터넷에 연결되는 모든 코딩 에이전트에 이 역량이 나타날 때 벌어지는 일은 관리하지도, 관리할 수도 없다. 내년에 가장 중요한 관문은 모델 접근에 있는 것이 아닐 수 있다. 네트워크 이그레스에 있는 관문일 수 있다.
관련 글
인도는 자체 AI 안전 규칙을 쓰고 있으며, 워싱턴의 규칙을 그대로 따르지 않는다
영어로만 테스트하면 포괄한다고 주장하는 대부분의 배포에 대해 아무것도 보증하지 못하는 프레임워크가 된다.
Tavus Griffin, 인간으로 통과한 비율 48%, 그리고 회사는 이를 출시하지 않는다
미리 녹화된 가짜는 준비된 질문에만 답한다. 실시간 시스템은 어떤 질문이든 답한다.
여성복 상세 페이지에 진짜 사람이 없다: AI 모델이 이커머스 신뢰를 벼랑 끝으로 밀었다
이미지를 믿을 수 없으니 반품률이 오르고, 반품률이 오르니 판매자는 촬영 비용을 더 압축하며, 비용을 압축하니 이미지는 더 믿을 수 없게 된다. 이 고리는 기술 문제가 아니라 인센티브 구조가 망가진 것이다.
6개 신문사, 훈련 데이터셋의 유료 기사 문제로 마이크로소프트·OpenAI 제소
유료 장벽 주장이 가장 날카로운 부분입니다. 유료 장벽을 넘어서는 크롤링은 접근 조건 자체를 우회하는 것입니다.