OpenAI, 추론 추출 캠페인을 Moonshot AI와 연관된 인물들로 추적

9월 30일, OpenAI는 자사 모델에서 보호된 추론을 끌어내려는 조직적 캠페인이라고 부른 사안에 대한 설명을 공개했습니다. 회사는 해당 작전을 차단했다고 밝혔으며, 활동의 핵심 집단을 Kimi 모델 제품군을 개발한 Moonshot AI와 연관된 개인들에게 돌렸습니다.
이 공개는 짧으며, 회사와 개인 집단 사이의 경계를 신중하게 다루고 있습니다. OpenAI는 Moonshot AI가 이 캠페인을 주도했다고 비난하지 않았습니다. 다만 자사가 확인한 사람들이 해당 회사와 연관되어 있다고 말했습니다. 이 구분은 법적 의미를 지니며, 쓰인 그대로 읽어야 합니다.
캠페인이 한 일
모델 증류는 일반적으로 더 큰 모델의 출력을 사용해 더 작은 모델을 훈련함으로써, 작은 모델이 훨씬 적은 비용으로 큰 모델을 모방하는 법을 배우게 하는 것을 뜻합니다. 이는 흔하고 종종 합법적이기 때문에, 연구소들은 이를 전면 금지하기보다 제한하는 데 노력을 기울입니다.
OpenAI는 더 적대적인 형태를 설명했습니다. 운영자들은 상호작용을 조작해 모델의 보호된 추론이 가시적인 형태로 재현되도록 했습니다. 한 기법은 한 대화에서 암호화된 추론을 복사한 뒤, 다른 대화의 모델에게 이를 복호화해 달라고 요청하는 것이었습니다. 프런티어 모델이 숨겨 두는 추론 트레이스가 숨겨져 있는 데에는 이유가 있습니다. 그것은 모델이 답에 도달하는 방식을 드러내며, 훔치기에 가장 수익성 높은 대상이기 때문입니다.
회사는 빠른 확대를 설명했습니다. 활동은 7월 1일에 시작되어 7월 24일과 25일에 급증했으며, 4,000명이 넘는 사용자로부터 약 16,000건의 추출 시도 요청이 있었습니다. 15,000명 이상의 사용자가 연루된 관련 클러스터는 7월 28일까지 완전히 차단되었습니다.
OpenAI는 어떤 암호화도 깨지지 않았고 어떤 데이터베이스도 침해되지 않았다고 밝혔습니다. 회사는 추론 재생 경로를 폐쇄하고, 계정을 차단했으며, Frontier Model Forum과 정부 채널을 통해 발견 내용을 공유했습니다.
암호화된 추론이라는 관점이 중요한 이유
흥미로운 기술적 세부 사항은 대화 간 재생입니다. 연구소가 추론 트레이스를 암호화하고 키를 사용자로부터 떨어뜨려 두면, 그 트레이스는 안전해 보입니다. 공격은 암호화를 깨려고 하지 않습니다. 대신 암호문을 새로운 맥락으로 옮겨, 사실상 모델 자체에 그것을 해석해 달라고 요청합니다. 모델이 복호화 오라클이 되는 것입니다.
이는 사건이라기보다 설계 교훈입니다. 모델에게 드러내서는 안 되는 데이터를 건네고, 그런 다음 같은 모델이 그 데이터에 관한 질문에 답하도록 허용하는 모든 시스템에는 약점이 있습니다. 해결책은 구조적입니다. 보호된 콘텐츠를 모델이 번역하도록 유도될 수 있는 어떤 맥락에도 넣지 않는 것입니다.
그 이면의 경제학
추론 트레이스가 가치 있는 이유는 경쟁력 있는 추론 모델을 처음부터 훈련하는 것이 비싸고 느리기 때문입니다. 이미 추론을 잘하는 모델의 트레이스를 복사하는 것은 더 저렴합니다. 이 두 비용의 격차가 동기의 전부입니다.
이것이 탐지가 어렵고 귀속이 더 어려운 이유이기도 합니다. 그러한 캠페인의 사용자들은 여러 계정, 지역, 결제 수단에 흩어져 있습니다. 이들을 특정 회사에 묶으려면 공유된 도구 세트 이상의 증거가 필요하며, 아마도 OpenAI가 그 연결을 소유가 아닌 연관으로 표현한 이유일 것입니다.
중국 맥락
이 귀속은 중국 모델 출시가 붐비는 시점 한가운데에 떨어졌습니다. 국경절 연휴 동안 여러 국내 기업이 동시에 새 버전을 내놓았습니다. Kimi의 차기 모델이 API 레지스트리에 나타났고, Step 5 Preview가 서드파티 엔드포인트에 개방되었으며, Kling은 비디오 모델을 베타로 출시했습니다. 시장은 빠르게 움직이고 있으며, 최전선 근처에 머무는 비용은 계속 오르고 있습니다.
그 배경에 비추어 보면, OpenAI의 공개는 최전선이 어떻게 방어되는지에 관한 여러 신호 중 하나입니다. 연구소들은 추론 추출을 이용약관의 각주가 아니라 연구 예산이 붙은 보안 문제로 다루고 있습니다.
두 번째 해석도 있습니다. 즉, 이 공개 자체가 하나의 메시지라는 것입니다. Frontier Model Forum과 정부 채널을 통해 귀속 내용을 공개하는 것은 어떤 행동이 공개적 대응을 불러올지 다른 연구소들에 경고하는 것입니다.
업계의 대응
증류에 대한 방어는 대부분 기술적이고 대부분 화려하지 않습니다. 연구소들은 공격적인 질의를 속도 제한하고, 트래픽을 핑거프린트하며, 추출이 만들어내는 패턴을 모니터링할 수 있습니다. 또한 추론 트레이스를 암호화할 수 있는데, OpenAI가 그렇게 했으며, 그런 뒤 모델에게 자기 자신의 암호문을 해석하도록 요청할 수 있다면 암호화만으로는 도움이 되지 않는다는 사실을 발견했습니다.
정책 계층도 있습니다. Frontier Model Forum은 부분적으로 경쟁사들 사이에서 바로 이런 종류의 발견을 조율하기 위해 존재하며, 이들은 추출을 비싸게 유지하는 데 공통 이익을 가지고 있습니다. 정부 채널을 통한 공유는 두 번째 목적도 수행하는데, 이는 규제 당국에 완전히 새로운 법을 작성하지 않고도 대응할 수 있는 위험의 구체적인 사례를 제공하는 것입니다.
이 중 어느 것도 증류를 불가능하게 만들지는 않습니다. 질문에 답하는 모델은 그 답을 읽는 모델에 의해 모방될 수 있기 때문입니다. 그것은 비용을 높이며, 이것이 현실적인 목표입니다. 연구소들은 모방을 끝내려는 것이 아닙니다. 모방이 훈련 비용을 건너뛸 만큼 저렴해지지 않도록 하려는 것입니다.
귀속이 왜 민감한 부분인가
회사를 비난하지 않으면서 한 집단의 사람들을 지목하고 그들을 회사와 연결하는 것은 좁은 길이며, OpenAI는 의도적으로 그 길을 걸었습니다. 표현이 중요한 이유는 다른 해석들이 매우 다른 결과를 수반하기 때문입니다. 국가 지원 캠페인이라면 외교적 사안이 됩니다. 엔지니어 집단이 자체적으로 행동한 것이라면 기업 지배구조 문제가 됩니다. 모델이 허용하는 범위의 가장자리를 밀어붙이는 평범한 사용자 기반은 둘 다 아닙니다.
이 공개는 어느 해석이 맞는지 결론 내리지 않습니다. 다만 다른 연구소들이 뒷받침할 수 있는 방식으로 발견 내용을 공식 기록에 남기고, 규제 당국이 지목할 수 있는 구체적인 사건을 제공합니다. 이것이 이런 공개의 실질적 목적인 경우가 많습니다. 이는 뉴스 사건이라기보다 일종의 신고서에 가깝습니다.
평판 차원도 있습니다. 증류 관련 불만은 최전선 경쟁의 일상적인 부분이 되었고, 각 불만은 누가 제기하느냐에 따라 다르게 읽힙니다. 증거를 공개하고 패턴을 명명하며 동료들과 공유하는 연구소는 정책 페이지만 게시하는 연구소보다 더 강한 입장을 가집니다.
이것이 해결하지 못하는 것
OpenAI의 설명은 추출된 자료로 무엇이든 훈련되었는지, 그렇다면 무엇이 훈련되었는지, 또는 경로가 닫히기 전에 얼마나 포착되었는지를 말하지 않습니다. 또한 일반적인 연관성을 넘어 외부 당사자들의 이름을 밝히지 않습니다. 그리고 유사한 기법이 다른 제공업체들을 상대로 사용되고 있는지, 아마 그럴 가능성이 높은데, 이에 대해서도 다루지 않습니다.
그러한 공백은 무엇인가 불길한 것의 증거가 아닙니다. 그것은 보안 공개의 정상적인 형태로, 회사가 방법을 게시하거나 조사를 훼손하지 않으면서 업계에 경고할 만큼 충분히 공유하는 것입니다.
실제로 통용되는 부분은 패턴입니다. 최전선 모델의 가장 가치 있는 출력은 더 이상 단지 답변이 아닙니다. 그것은 답변 밑에 있는 추론이며, 그 추론을 둘러싼 방어는 이제 네트워크상의 어떤 시스템만큼이나 의도적으로 시험되고 있습니다.
관련 글
13,000장의 내부 스크린샷이 공개 GitHub에 올라갔고, 그걸 올린 공격자는 없었다
플릿 전체에서 반복되는 기본 동작은 정책의 결과다.
아마존, 자사가 계속 쓰는 80억 달러어치 엔비디아 칩을 투자자들이 보유하길 원해
항공사들은 수십 년간 항공기를 매각 후 임차해 왔다. 이제 같은 아이디어가 GPU에 적용되고 있다.
첫 AI 영화제, 45만 달러를 지급하며 '이야기'에 대한 교훈을 남기다
수상작들은 이미 존재하는 아이디어를 위해 도구를 활용했다.
Salesforce, 고객을 대신 인터뷰해 주는 기업에 20억 달러 지불
인터뷰는 증거다. 디지털 트윈은 예측이다. 그 사이의 경계가 시험대다.