← 블로그로
News약 13 분 읽기

OpenAI, EU에서 ChatGPT 텍스트에 워터마크 적용 예정. 자체 수치가 그 취약함을 보여준다

게시일 2026년 10월 6일
OpenAI, EU에서 ChatGPT 텍스트에 워터마크 적용 예정. 자체 수치가 그 취약함을 보여준다

10월 5일 OpenAI는 유럽연합에서 ChatGPT와 Codex가 생성한 텍스트에 보이지 않는 워터마크를 추가하겠다고 밝혔다. 향후 몇 주에 걸쳐 모든 요금제의 대상 사용자에게 순차 적용된다. textGrain이라 불리는 이 방식은 눈에 보이는 기호나 찾기 및 바꾸기로 삭제할 수 있는 숨은 문자를 삽입하지 않는다. 비밀 키를 사용해 모델의 다음 단어 선택을 미묘하게 조정하며, 수백 개의 통계적 넛지를 쌓아 올려 탐지기가 나중에 텍스트만으로 이를 복원할 수 있게 한다. 패턴이 문구 자체에 존재하므로 복사해 붙여넣어도 살아남는다.

계기는 규제다. EU AI법 제50조는 생성형 시스템 제공자에게 출력물을 기계 판독 가능한 형태로 표시하도록 요구한다. 이 투명성 의무는 2026년 8월 2일 발효됐고, 유럽위원회는 해당 날짜 이전에 이미 시장에 나와 있던 시스템에는 2026년 12월 2일까지 유예가 있다고 확인했다. 위원회는 6월에 AI 생성 콘텐츠의 표시 및 라벨링에 관한 실무 규범(Code of Practice)을 발표했고, 7월 말까지 약 190개 조직이 서명했다. Anthropic은 8월에 전 세계적으로 Claude 텍스트에 워터마크를 적용하겠다고 밝혔으며, Google은 텍스트용 SynthID를 보유하고 있다. OpenAI는 2년 동안 피해 온 마감 시한에 맞춰 도착한 셈이다.

회사는 자체 실패 곡선을 공개했다

발표에서 가장 유용한 부분은 OpenAI가 옆에 붙인 숫자 목록이다. 오탐률 1%를 목표로 할 때, ELI5 데이터셋에서 가져온 영어 텍스트에서 탐지기는 200토큰 분량 텍스트의 약 80%, 400토큰 분량 텍스트의 약 95%에서 워터마크를 식별했다. 수학은 훨씬 낮은 점수를 기록했는데, 모델이 단어를 선택할 자유가 더 적기 때문이다. 400토큰 분량 텍스트에서 단어 10%를 동의어로 바꾸면 탐지율은 약 92%에서 66%로 떨어진다. 25%를 바꾸면 약 17%로 떨어진다.

그 행들을 순서대로 읽으면 그림은 명확하다. 탐지기는 길고 제약이 느슨한 산문에서 가장 잘 작동한다. 짧은 이메일은 400토큰보다 200토큰에 가깝다. 코드와 수학은 신호를 숨길 여지가 거의 없다. 어떤 바꿔쓰기 도구든 가볍게 한 번만 거치면 탐지율은 동전 던지기 수준으로 밀린다.

빈 종이 위에 든 돋보기

OpenAI는 다섯 가지 한계를 나열하며, 이번 분기에 작성하는 모든 정책 문서에 인용할 가치가 있다. 워터마크는 인간의 기여도를 측정하지 않는다. 소유권이나 책임을 확립하지 않는다. 계정, 프롬프트, 대화가 텍스트에 연결되지 않으므로 사용자를 식별하지 않는다. 정확성을 검증하지 않으며, 워터마크가 있는 텍스트도 거짓일 수 있다. 마지막으로 워터마크가 없다고 해서 인간이 쓴 텍스트임이 증명되지는 않는다. 텍스트가 너무 짧거나, 편집·번역됐거나, 지원되지 않는 모델 또는 적용 이전의 결과물이거나, 단순히 다른 회사의 도구에서 나온 것일 수 있기 때문이다.

마지막 지점이 실제로 큰 피해를 일으킬 부분이다. 누군가는 학생의 에세이나 구직자의 자기소개서를 탐지기에 넣고 일치 결과가 없다는 이유로 정직한 작업의 증거라고 받아들일 것이다. 또는 일치 결과가 나왔다며 부정행위의 증거로 받아들일 것이다. 어느 결론도 따라 나오지 않으며, OpenAI도 자체 게시물에서 그렇게 말한다.

탐지기가 공개되지 않는 이유

탐지 도구에 대한 접근은 출시 시점에 승인된 연구자와 전문 기관으로 제한되며, 사례별로 부여된다. 이런 신중함은 정당화될 수 있다. 동의어를 바꾼 뒤 탐지율이 66%인 도구는 오용되기 쉽기 때문이다. 또한 시스템이 순차 배포되는 동안 독립적 검증이 어렵다는 뜻이기도 하며, 규제 준수 기능이 시작하기에 어색한 위치다.

여기에는 이력이 있다. 2024년 8월 OpenAI는 내부 설문에서 사용자의 약 30%가 워터마크가 적용되면 사용량을 줄이겠다고 답하자 ChatGPT에 워터마크를 넣지 않기로 했다. 현재의 방식은 절충안이다. 처음에는 EU에만 적용되고, 전 세계 API 고객에게는 기본적으로 꺼져 있으며, 선택한 모델에 한해 옵트인할 수 있다. 전 세계적으로 텍스트 워터마킹은 기본값이 아니다.

텍스트를 제공하는 모든 사람에게 이것이 바꾸는 것

EU에 있는 팀에게 실질적 변화는 헤드라인보다 작다. 직원의 출력물에는 아무도 볼 수 없는 신호가 실린다. 직원을 식별하지도 않고, OpenAI의 측정상 모델 품질을 저하시키지도 않으며, 텍스트가 붙여넣어지는 모든 문서나 고객 이메일로 따라간다. 나중에 탐지기 접근 권한이 있는 사람이 그 텍스트를 검사하면 플래그를 지정할 수 있을지도 모른다. 워크플로에서 바뀌어야 할 것은 없다.

진짜 위험은 더 아래 체인, 즉 출처 탐지를 판정으로 취급하는 모든 프로세스에 있다. 채용, 입학, 뉴스룸 검증, 학문적 정직성 시스템이 명백한 후보이며, 각각에는 탐지 결과를 증거로 읽고 싶은 유혹에 빠질 사람이 있다. OpenAI의 자체 수치는 그에 반대한다. 일상적인 바꿔쓰기로 제거될 수 있는 표식은 제50조의 문구는 충족할지 몰라도, 그 조항이 하려던 일은 실패할 수 있다.

집행은 마감 시한에 힘을 실어준다. 위반 시 최대 1,500만 유로 또는 글로벌 연매출의 3% 중 더 큰 금액이 부과될 수 있다. 그래서 이번 배포가 이루어지고 있다. 하지만 더 흥미로운 질문은 가벼운 편집에도 사라지는 워터마크가 규제 당국이 부여하는 무게를 감당할 수 있느냐다. 기존 시스템에 대한 12월 2일 마감, 탐지기의 최종 공개 시점, 허용 가능한 탐지 임계값에 관한 위원회의 지침이 주시해야 할 이정표다.

당장 모든 팀을 위한 가장 안전한 규칙은 OpenAI가 자체 게시물에 쓴 바로 그것이다. 워터마크가 없다고 인간이 텍스트를 작성했음이 증명되지 않고, 있다고 모델이 전부 작성했음이 증명되지 않는다. 워터마크는 어떤 시스템이 해당 텍스트를 건드렸음을 나타낼 수 있다. 사고의 얼마나 많은 부분이 사람의 것인지는 알려주지 못한다.

텍스트 워터마킹은 실제로 어떻게 작동하는가

신호가 왜 그렇게 쉽게 사라지는지 이해하는 데 도움이 된다. 기존 워터마크는 파일에 붙는 표식이며, 삭제는 올바른 필드를 찾는 문제다. textGrain은 다른 경로를 택한다. 생성 중 비밀 키가 거의 동등한 다음 단어들 사이에서 모델의 선택에 편향을 주고, 같은 키를 가진 탐지기가 인식할 수 있는 하위 집합 쪽으로 미묘하게 민다. 수백 개의 그러한 선택에 걸쳐 패턴은 통계적으로 보이게 된다. 편향이 문구에 존재하므로 표식은 복사-붙여넣기, 다른 편집기, 다른 앱을 거쳐도 텍스트와 함께 이동한다.

취약성은 같은 설계에서 따라온다. 바꿔쓰기 도구, 번역, 또는 과도한 인간 편집 등 단어를 다시 쓰는 모든 과정은 탐지기가 찾는 패턴을 흐트러뜨린다. 이것이 모든 텍스트 워터마크의 핵심 트레이드오프다. 가벼운 편집에도 살아남을 만큼 강한 표식은 일반 글쓰기와 눈에 띄게 달라 보이므로 존재 의의가 무너진다. OpenAI는 미묘한 표식을 선택하고 그 결과로 나온 탐지 곡선을 공개했는데, 이는 대부분의 공급업체보다 정직한 태도다.

연구소 간 비교는 시사하는 바가 크다. Anthropic은 8월에 Claude 출력물 전 세계에 워터마크를 적용하겠다고 밝혔고, 그 움직임은 지시, 맥락, 결정은 사람에게서 나오며 모델은 도구 역할을 할 뿐이라는 사용자 반발을 불러일으켰다. Google의 SynthID는 자사 텍스트에 대해 비슷한 일을 한다. 세 가지 접근은 같은 아이디어, 같은 한계로의 업계 수렴을 뜻하며, 이는 이 기술이 현재 텍스트에서 가능한 것의 한계에 가까움을 시사한다.

한편 더 어려운 문제는 손대지 않은 채 남아 있다. 텍스트 표시는 상대적으로 쉽다. 한 구절에 신호를 인코딩할 수백 개의 단어 선택이 있기 때문이다. 이미지와 오디오도 같은 종류의 통계적 여지를 가지며, OpenAI는 이미 이들에 대한 검증을 제공한다. 하지만 이런 표식 중 어느 것도 뉴스룸이나 학교가 실제로 답을 얻어야 하는 질문, 즉 특정 주장이 사실인지 그리고 그 뒤에 누가 있는지에는 답하지 않는다. 출처와 정확성은 별개의 문제이며, 워터마킹은 첫 번째만 다룬다.

관련 글