← 블로그로
News약 11 분 읽기

AI 보조 논문 쇄도에 arXiv, 월 2편으로 투고 제한

게시일 2026년 10월 2일
AI 보조 논문 쇄도에 arXiv, 월 2편으로 투고 제한

10월 1일부터 arXiv는 모든 투고자가 월 2편, 동시에 3편까지만 투고할 수 있도록 제한한다. 이 제한은 컴퓨터과학뿐 아니라 모든 분야에 적용되며, 플랫폼은 이를 과도기적 조치라고 부른다. 세계 최대 오픈액세스 프리프린트 서버에 대한 속도 제한인 셈인데, 그 이유는 하나의 숫자로 요약된다. 9월에 arXiv가 받은 투고는 40,363편으로 역대 월 최다 기록이다.

그 수치 뒤의 추세는 헤드라인만 보아서는 짐작하기 어려울 만큼 가파르다. 2016년 9월 arXiv가 받은 투고는 9,869편이었다. 2024년 9월에는 20,569편이었다. 2년 뒤에는 다시 두 배로 늘어 40,363편이 됐다. 같은 기간 arXiv 직원과 자원봉사 중재자에게 접수된 지원 요청은 9,000건 가까이로 치솟았다. cs.AI 분야 하나만 2년 만에 6배 이상 커졌고, 다른 분야는 대략 두 배가 됐다. 생성형 AI는 논문을 쓰고 구조를 잡고, 그럴듯해 보이는 연구 자료를 대량으로 만들어내는 일을 훨씬 쉽게 만들었고, 사람이 검토하는 것을 전제로 만들어진 중재 모델이 그 부담을 견디고 있다.

문제의 크기가 아니라 형태

arXiv가 AI를 금지한 것은 아니다. 정책상 저자는 AI 활용을 공개하고 논문이 학술적 가치, 독창성, 품질 기준을 충족하기만 하면 연구 보조 도구로 AI를 쓸 수 있다. 플랫폼이 행동에 나선 이유는 투고되는 것의 성격이 달라졌기 때문이다.

중재자들은 세 가지 유형을 말한다. 내용이 빈약한 협소한 범위의 논문이 있다. 하나의 연구를 여러 편의 개별 투고로 쪼갠 이른바 살라미 논문이 있다. 그리고 기계가 생성한 것으로 읽히는 텍스트 위주의 원고가 있다. arXiv 편집자문위원회 의장인 토머스 디터리히는 소수의 저자가 대량의 저품질 자료를 투고하면 자원봉사자 시간의 불균형적으로 큰 몫을 잡아먹고, 그 결과 검토받을 가치가 있는 논문이 며칠에서 몇 주씩 지연된다고 말한 바 있다.

마지막 지점이 가장 중요하다. arXiv의 중재자는 전임 직원이 아니다. 무보수로 투고를 검토하는 연구자들이다. 소수의 대량 투고자가 대기열을 채우면 그 비용은 나머지 모두에게 돌아가고, 지연되는 논문은 곧바로 통과했을 논문들이다.

왜 속도 제한인가, 그리고 왜 그것이 투박한가

하드 캡은 투박한 도구다. 월 2편은 대부분의 연구자에게 넉넉하고 일부에게는 제한적이며, 진짜로 왕성한 저자와 시스템을 도배하는 사람을 구분해주지도 못한다. arXiv도 이를 알고 있으며 이 제한을 검토 도구와 프로세스를 개선할 시간을 벌어주는 임시방편으로 규정한다. 플랫폼은 이전에는 중재자가 고빈도 투고자를 사안별로 제한하도록 허용했는데, 10월 1일부터 그 재량은 하나의 규칙으로 표준화됐다.

이 사안 전체에서 가장 분명한 신호는 arXiv가 하지 않은 일이다. AI 탐지를 요구하지 않았고, 공개 요건을 바꾸지 않았고, cs.AI 분야를 제한하지도 않았다. 대신 양을 겨냥했다. 양은 측정하기 쉽고 반박하기 어려운 부분이기 때문이다. 그것이 근본 문제를 해결하는지는 별개의 질문이다. 작정한 악의적 이용자는 여전히 한 달에 저품질 논문 두 편을 투고할 수 있고, 품질에 대한 실질적인 검증은 여전히 그것을 읽는 사람 중재자의 몫이다.

속도 제한이 할 수 있는 일과 없는 일

이 상한이 어떤 문제를 다루는지 분명히 할 필요가 있다. 그것은 모든 사람의 투고 속도를 늦춘다. 투고되는 것의 품질을 높이지는 않으며, 좋은 연구와 기계가 만든 채우기를 구별하는 arXiv의 능력을 개선하지도 않는다. 상한은 음량 조절기이고, 품질 문제는 있던 자리에 그대로 있다.

그러면 두 가지 가능성이 남는다. 쏟아짐이 대부분 기회주의 때문이었다면 속도 제한이 즉흥적인 양산을 억제하고 대기열은 회복될 것이다. 아니면 그 쏟아짐이 만들어지는 연구 산출물의 양 자체가 겪는 지속적인 변화를 반영한 것이라면, 상한은 같은 양을 더 여러 달에 걸쳐 분산시킬 뿐이다. 이 제한을 과도기적이라고 부른 arXiv 자신의 표현은 전자를 예상한다는 뜻으로 읽힌다. 솔직한 답은 아직 아무도 모른다는 것이고, 앞으로 몇 달의 투고 데이터가 어느 쪽이든 첫 증거가 될 것이다.

직접적인 효과보다 더 중요할 수 있는 미묘한 효과도 있다. 속도 제한은 경계선상의 투고자에게 주어지는 유인을 바꾼다. 한 달에 두 편을 올릴 수 있다면 살라미 조각들을 한 편의 논문으로 합칠 이유가 생기는데, 그게 애초에 심사자들이 원했던 것이다. 투박한 도구도 근본적인 처리 능력 문제를 해결하지 못하더라도 행동을 유용한 방향으로 밀어줄 수는 있다.

더 넓은 패턴

arXiv는 열린 웹과 그것에 의존하는 시스템 전반으로 번지는 문제의 가장 눈에 띄는 사례다. 이제는 필터링 파이프라인이 이를 직접 측정한다. 한 주요 웹 텍스트 말뭉치의 6~8월 데이터에서 AI가 생성한 토큰의 비중은 필터링 후 27%에서 31%로 올랐다. 열린 웹의 깨끗한 텍스트 가운데 약 3분의 1이 이제 기계 생성물로 추정되며, 그 비중은 계속 오르고 있다.

그 결과는 사람들이 품질을 판단할 때 쓰는 신호들이 서서히 침식되는 것이다. 논문을 만드는 비용이 싸지면 인용 수의 의미는 줄어든다. 말뭉치의 3분의 1이 생성물이면 검색 결과의 의미는 줄어든다. 투고량이 심사자 수를 앞지르면 심사 대기열의 의미는 줄어든다. 텍스트를 만드는 일이 비싸다는 전제 위에 세워진 모든 시스템은 그것이 거의 무료인 세계에 맞춰 다시 지어져야 한다.

여기에는 정당한 반론이 있고, 짚고 넘어갈 가치가 있다. AI를 활용한 글쓰기가 자동으로 나쁜 글쓰기인 것은 아니다. 많은 연구자가 이 도구를 문장을 다듬거나 번역하거나 문헌 검토를 정리하는 데 쓰고, 그 결과는 더 명료한 논문이다. arXiv의 정책도 이를 인정한다. 문제는 도구가 아니라 양이며, 도구는 양을 쉽게 만든다.

이 제한이 보내는 신호

정책의 층위에서 읽으면 arXiv의 상한은 플랫폼이 생성형 AI가 투고를 확장하는 속도만큼 사람 검토를 확장할 수 없다는 조용한 인정이다. 이는 구조적 불일치이며 어떤 속도 제한도 이를 해소하지 못한다. 할 수 있는 최대치는 자원봉사자들이 따라갈 수 있을 만큼 홍수를 늦추는 것이다.

앞으로 벌어질 일을 결정할 두 가지가 있다. 하나는 다른 프리프린트 서버와 학술지가 자체적인 제한을 뒤따라 도입할지 여부인데, 그러면 연구가 공유되는 방식이 파편화될 것이다. 다른 하나는 심사 도구가 따라잡을지 여부인데, 속도 상한은 바로 그것을 위한 시간을 버는 방법이기 때문이다. 도구가 도착하면 arXiv가 말한 대로 제한은 일시적이다. 도착하지 않으면 제한은 영구적이 되고, 오픈액세스 모델은 한 번도 가진 적 없던 제약을 떠안게 된다. 어느 쪽이든 프리프린트 투고의 무제한 시대는 10월 1일에 끝났고, 논문 만들기가 필터 역할을 할 수 없을 만큼 쉬워졌기 때문에 끝났다.

관련 글