← 블로그로
News약 15 분 읽기

robots.txt는 종이 장벽이다: 레딧 대 앤스로픽과 호주의 규정 준수 청문회

게시일 2026년 10월 7일
robots.txt는 종이 장벽이다: 레딧 대 앤스로픽과 호주의 규정 준수 청문회

모든 웹사이트에는 robots.txt라는 작은 텍스트 파일이 있다. 이 파일은 자동화된 프로그램에게 어떤 페이지를 읽어도 되는지, 어떤 페이지는 건드리지 말아야 하는지를 알려준다. 그것은 잠기지 않은 문에 붙여 놓은 예의 바른 안내판이다. 그 안내판 뒤에는 잠금장치가 없다.

요청과 집행 메커니즘 사이의 그 간극은 이제 두 개의 별개 싸움의 중심에 있다. 하나는 미국 법원에서, 다른 하나는 호주 의회 청문회에서 벌어진다. 둘 다 서로 다른 각도에서 같은 질문을 던진다. 무시될 때 “크롤링 금지” 신호는 실제로 무엇을 의미하는가?

호주: 옵트아웃할 수 없는 옵트아웃

앤스로픽은 10월 초 호주 인공지능 합동 특별위원회에 출석했다. 이 회사는 호주 콘텐츠에 대한 AI 학습을 위해 이른바 “좁은 형태의 조건부 승인”을 제안했으며, 권리자는 robots.txt에서 크롤러를 차단하는 방식으로 옵트아웃할 수 있게 했다. 이 제출은 호주가 광범위한 텍스트·데이터 마이닝 면제를 거부한 것을 암묵적으로 받아들이고, 그 타협안으로 옵트아웃을 내놓은 것이었다.

공영 방송사들은 이를 받아들이지 않았다. ABC의 콘텐츠 및 법무 운영 책임자인 케이트 길크리스트는 위원회에 저작권 체계가 충분하며 AI 기업들이 필요한 라이선스를 협상할 수 있다고 말했다. 그녀가 옵트아웃에 반대한 이유는 구조적인 것이었다. 그녀는 방송사가 모든 관련 사이트에서 옵트아웃되었는지 확인하기 위해 인터넷 전체를 샅샅이 뒤질 수는 없다고 말했다. “그것은 그냥 작동하지 않는다.”

SBS는 자체 제출서에서 같은 지적을 했다. robots.txt 신호는 일상적으로 우회되며, 잘못을 피할 책임은 AI 기업에 있어야 한다고 썼다.

길크리스트가 설명한 비대칭성이 핵심이다. 권리자는 가능한 모든 스크래핑 경로에서 옵트아웃 신호를 식별하고 감시하고 유지해야 하며, 이는 무기한 이어진다. AI 기업은 신호를 우회하는 데 거의 0에 가까운 기술 비용을 치르며, 구체적인 구제 수단이 존재하기 전까지는 법적 비용도 거의 0에 가깝다. 크롤러는 다른 사용자 에이전트 식별자를 사용하거나, 중개자를 거치거나, 차단이 설정되기 전에 콘텐츠를 이미 수집함으로써 robots.txt를 무시할 수 있다.

그 의심에는 문서화된 근거가 있다. 퍼블리셔와 AI 기업 간 라이선스 거래를 중개하는 스타트업 TollBit는 여러 출처의 AI 에이전트가 콘텐츠를 검색하기 위해 robots.txt 프로토콜을 우회하고 있다는 사실을 발견했다. 이후 비즈니스 인사이더는 OpenAI와 앤스로픽이 이를 존중한다고 공개적으로 주장하면서도 robots.txt 신호를 우회했다고 보도했다.

ABC 자신의 입장에는 주목할 만한 아이러니가 있다. 2026년 7월, 이 방송사는 앤스로픽의 Claude를 자사의 엔터프라이즈 AI 플랫폼으로 선택해 100명의 직원과 함께 라디오 방송을 디지털 기사로 전환하는 시범 운영을 시작했으면서, 동시에 앤스로픽의 제품이 허가 없이 자사 콘텐츠로 학습되었을 가능성이 높다고 주장했다. 두 가지가 동시에 사실일 수 있으며, 바로 그 점이 핵심이다. 한 전선에서의 협력이 다른 전선의 문제를 해결해 주지는 않는다.

미국: 계약 경로

앤스로픽을 상대로 한 레딧 사건은 다른 법적 경로를 택한다. 연방 법원은 레딧의 계약 청구가 진행되도록 허용했고, 이는 플랫폼이 저작권법 바깥에서 데이터 수집에 이의를 제기할 수 있는 경로를 열어 준다.

그 구분은 중요하다. 저작권은 보호되는 자료가 복제되었는지, 그리고 항변이 적용되는지를 묻는다. 계약은 수집자가 접근, 자동 수집, 상업적 이용에 관한 조건을 받아들였는지를 묻는다. 자신이 호스팅하지만 완전히 소유하지는 않는 자료에 가치의 일부를 두는 플랫폼에게는 계약 이론이 더 유용하다.

환송 명령은 앤스로픽이 레딧의 계약을 위반했다고 판단하지 않았다. 그것의 더 넓은 중요성은 오히려 더 좁은 데 있다. 법원은 레딧의 계약상 권리를 저작권과 질적으로 다른 것으로 취급했고, 이에 따라 계약 위반 이론은 진행 중인 분쟁에서 살아남았다.

서비스 약관이 실질적 효력을 얻는 곳에서, 약관은 데이터 거버넌스 인프라가 된다. 기업은 정책이 표면상 명시한 내용을 넘어, 고지, 동의, 접근 조건, 그리고 수집 시점의 관련 약관 버전을 입증해야 한다. 소송은 분쟁이 된 접근 기간에 어떤 약관이 적용되었는지, 그리고 그것이 어떻게 표시되었는지에 따라 좌우될 수 있다.

robots.txt가 결코 버텨낼 수 없었던 이유

이 파일의 역사는 뒤집혀 있다. 1990년대에 robots.txt는 주로 검색 엔진이 서버에 너무 과도한 부하를 주는 것을 막기 위해 존재했다. 사이트들은 색인되기 위해 경쟁했다. 색인된다는 것은 방문자를 의미했기 때문이다. 이후 관계는 뒤집혔다. 이제 같은 파일이 문을 닫는 데 사용된다. 웹을 읽는 새로운 기계들은 아무도 돌려보내지 않기 때문이다.

차단은 차단을 따르는 크롤러에게만 작동한다. 신뢰받는 뉴스 사이트 중 AI 프로그램을 차단하는 비율은 2023년 9월 약 23퍼센트에서 2025년 5월까지 거의 60퍼센트로 뛰었다. 그런데도 OpenAI 자체 크롤러는 2024년 말 해당 고지들을 42퍼센트의 경우 무시한 것으로 관찰되었고, 더 광범위한 테스트에서는 영국 기업 사이트의 72퍼센트에서 위반이 발견되었다.

표지판은 그 뒤에 서 있는 변호사만큼만 강력하며, 대부분의 사이트에는 레딧만한 변호사가 없다.

이것이 빌더에게 의미하는 것

AI 시스템을 구축하는 기업에게 실질적인 교훈은 실사(diligence)에 관한 것이다. 학습 데이터를 구매하거나 수집할 때, 해당 데이터가 출처 플랫폼의 약관과 충돌하는 조건에서 수집되었는지 알아야 한다. 이는 계약 출처(contract provenance)를 자동 준수를 가능하게 해 주어야 하는 기계 판독 가능 신뢰 신호와 연결한다.

불편한 결론은 자발적 프로토콜이 바로 가장 약한 지점에서 시험대에 올랐다는 것이다. 레딧은 페이월을 구축하고, 법적 경고를 보냈고, 한 경쟁사의 답변에서 자사 콘텐츠 인용이 거의 40배 증가하는 것을 지켜본 뒤 소송을 제기했다. 표지판은 요청했다. 게이트는 차단했다. 오직 소송만이 위협한다.

robots.txt가 실효성을 갖게 될지는 레딧의 계약 이론이 어떻게 전개되는지, 그리고 호주가 자국 공영 방송사가 작동하지 않는다고 말하는 신호에 의존하기보다 구제 수단을 입법화하는지에 달려 있다. 그때까지 잠기지 않은 문에 붙은 예의 바른 표지판은 그대로 예의 바른 표지판일 뿐이다.

외부에서는 아무도 답할 수 없는 준수 질문

논쟁이 원칙보다 집행으로 계속 되돌아오는 데는 이유가 있다. 사이트의 접근 약관이 무언가를 의미해야 한다는 점에는 모두가 추상적으로 동의한다. 의견 차이는 그것을 현실로 만드는 비용을 누가 부담하느냐에 있다.

앤스로픽이 제안한 옵트아웃 모델에서는 비용이 권리자에게 있다. 퍼블리셔는 어떤 크롤러가 자사 콘텐츠를 읽고 있는지 파악하고, 올바른 차단을 인코딩하고, 새 크롤러가 등장할 때마다 이를 최신 상태로 유지하고, 위반을 감시해야 한다. 이는 AI 기업 수에 따라 규모가 커지는 지속적 운영 부담이며, 크롤러가 차단을 무시할 때 아무런 구제 수단도 낳지 않는다.

ABC가 주장한 허가 우선 모델에서는 비용이 AI 기업에 있다. 기업은 무엇으로 학습할지 식별하고, 라이선스를 협상하고, 사용이 허용된 내용을 기록으로 남겨야 한다. 이는 익숙한 구도이며, 저작권이 이미 지원하는 바로 그 방식이다.

어두운 슬레이트 위에 똑바로 서 있는 두 개의 창백한 판자 사이로 가느다란 빛줄기가 지나간다

두 모델은 감시 비용을 서로 다른 당사자에게 부과한다. 이는 실질적 파급이 있는 정책 차이이며, 현재 그 비용을 부담하는 당사자는 감당할 수 없다고 말한다. 그렇기 때문에 robots.txt 논쟁은 AI 학습을 입법화하려는 모든 관할권에서 계속 다시 떠오른다. 기술 표준이 애초에 하도록 설계되지 않은 법적 작업을 하도록 요구받고 있기 때문이다.

기술적 해결책이 계속 미흡한 이유

완벽한 옵트아웃 레지스트리조차 근본 문제를 해결하지는 못한다. 신호는 회사가 아니라 크롤러를 식별하기 때문이다. 기업은 중개자를 통해 스크래핑하거나, 다른 사용자 에이전트를 사용하거나, 차단이 설정되기 전에 수집한 콘텐츠에 의존할 수 있다.

역사적 기록은 이를 구체적으로 보여 준다. GPTBot은 그것을 상업적으로 가치 있게 만든 모델들이 이미 학습된 뒤에야 비로소 robots.txt 지침을 공식적으로 준수하기 시작했다. 장래의 차단은 과거의 수집을 되돌릴 수 없고, 하나의 식별자에 대한 차단은 다른 식별자로 자신을 제시할 수 있는 기업을 구속하지 않는다.

그것이 ABC가 권리자 측에서 인터넷 전체를 단속할 수는 없다고 말했을 때 가리킨 간극이다. 신호는 보내는 쪽에는 저렴하고 받는 쪽에는 비싸다. 이는 효과적인 준수 메커니즘이 보통 작동하는 방식과 반대다. 신호를 무시하는 데 구제 수단이 붙기 전까지, 유인은 한 방향으로만 흐른다.

관련 글