OpenAI가 AI에서 도출한 수학 결과 722건을 공개했다. 수학자들은 누가 공을 인정받는지 묻고 있다.

OpenAI가 내부 프런티어 모델이 생성한 수학적 결과물 모음을 공개하며, 다수의 증명에 대한 Lean 형식화와 수정 및 인용 프로토콜을 함께 담은 저장소를 발표했다. 이번 공개는 722건의 결과를 설명하며, 그중 162건은 기계 검증되었다.
반응은 수학이 올바른지보다는 검증이 실제로 무엇을 보장하는지, 그리고 그 결과가 누구에게 속하는지에 더 집중됐다.
Lean이 검사하는 것과 검사하지 않는 것
Lean은 증명 보조기다. 명시된 공리들에 비추어 형식적 논증의 모든 단계를 기계적으로 검증하므로, 검증된 증명에는 논리적 결함이 있을 수 없다. 컴파일된다면 그 논증은 전제들로부터 따라 나온다.
그것은 강력한 보장이지만 범위가 좁다. 증명 보조기는 형식적 명제가 따라 나오는지를 검증한다. 그것이 함께 딸린 산문이 주장하는 내용을 형식적 명제가 말하는지는 검증하지 않는다. 인간은 여전히 162건의 기계 검증된 결과 각각을 읽고 Lean 파일이 누군가 생각하는 정리를 부호화했는지 확인해야 한다. 형식화는 번역 단계이며, 번역은 어긋나기 마련이다.

나머지 560건의 결과에는 그런 검사가 없으므로, 공개된 모음은 매우 다른 두 증거 범주를 섞고 있다. '722건의 결과, 162건 검증'이라고 보고하는 것이 총계를 보고하는 것보다 더 정직하지만, 동시에 헤드라인 숫자가 검증된 부분집합을 약 4.5배 과장한다는 뜻이기도 하다.
공로 문제는 새로운 형태를 띤다
수학자들은 수학이라는 분야가 존재한 이래로 공로 배분을 두고 다퉈 왔으며, 그 논쟁은 대개 누가 질문을 던졌는지, 누가 핵심 단계를 찾았는지, 누가 그것을 글로 썼는지에 관한 것이다. AI가 생성한 결과는 전례 없는 버전의 문제를 도입한다.
모델이 오래된 미해결 문제의 증명을 만들어 낸다면, 저자는 누구인가? 현재 저작권 체계상 법적 저자가 될 수도 없는 모델인가? 모델에 프롬프트를 준 연구자들인가? 문제 목록을 선별한 팀인가? 모델을 훈련했지만 가중치를 공개하지 않는 조직인가?
OpenAI는 기반 모델의 책임 있는 공개를 향해 작업 중이라고 말한다. 그때까지 커뮤니티는 같은 시스템에서 결과를 재현하거나, 훈련 데이터를 검사하거나, 모델의 성공이 훈련 중 관련 문제를 보았던 데 의존했는지 평가할 수 없다. 공개와 재현성은 서로 다른 약속이며, 이번 릴리스는 후자 없이 전자를 내세운다.
수학에 특유한 추가 복잡성이 있다: 이 분야에서 귀속은 이해를 바탕으로 작동한다. 증명은 부분적으로 그것이 도입하는 아이디어 때문에 공로를 인정받고, 수학적 아이디어가 퍼지는 방식은 사람들이 그것을 읽고, 유용하다고 여기고, 확장하는 것을 통한다. 아무도 완전히 파악하지 못하는 기계 생성 증명은 그런 방식으로 전파될 수 없는 결과다. 인용될 수는 있다. 쉽게 그 위에 쌓아 올려지기는 어렵다.
수년간 동료 심사를 복잡하게 만들 실질적 비대칭성도 있다. 결함 있는 증명을 발표한 인간 수학자는 일반적으로 정직한 실수를 했다고 이해된다. 평판상 결과는 비례적이다. 어떤 모델이 722건의 결과를 발표하고 일부는 맞고 일부는 틀리다면, 맞는 것과 틀린 것의 비율 자체가 알려지지 않은 연구 성과물을 만들어 내며, 틀린 것들에 대해 책임을 물을 수 있는 개인도 없다. 학술지는 저자가 분산되어 있고 오류율이 사건이 아니라 분포인 투고를 처리하도록 만들어지지 않았다.
인용 문제는 곧바로 뒤따른다. 수학적 진전은 어떤 선행 결과를 신뢰할 수 있는지 아는 데 달려 있다. Lean에서 기계 검증된 결과는 강력한 후보다. 모델이 주장하고 아무도 검토하지 않은 결과는 그렇지 않으며, 두 범주를 한 릴리스에 섞으면 어느 쪽 위에 쌓아 올리기도 더 어려워진다.
같은 날의 다른 이야기
OpenAI의 수학 공개는 여러 자사 주장과 그리 많지 않은 제3자 검증이 있는 주에 나왔다.
Mistral은 1조 매개변수 모델인 Large 4를 출시하며, 오픈 웨이트 중국 시스템에 대한 서구의 가장 강력한 답변으로 위치시켰다. 그 벤치마크 비교는 한 답글 스레드가 Artificial Analysis의 공개 점수와 한 줄씩 대조한 끝에 부족하다고 평가했는데, 구체적으로는 경쟁사 변형을 선별적으로 골라 비교하고 공개된 제3자 수치를 잘못 진술했다는 비난이었다.
Reflection은 같은 싸움을 겨냥한 오픈 웨이트 모델 Beam을 공개했으며, 가중치는 그달 말에 공개될 예정이다.
그리고 Anthropic은 소프트웨어 취약점을 찾아내는 모델에 대한 접근을 확대했으며, 자체 수치를 내세웠다.
그 주 전체의 패턴은 능력 주장이 그것을 확인할 역량보다 빠르게 도착하고 있다는 것이다. arXiv는 같은 압력의 다른 발현에 대응해 제출자를 월 2편으로 제한했는데, 9월에 기록적인 40,363건의 투고를 받은 뒤였다. 이는 2년 전 수치의 두 배다.
경쟁의 핵심은 주장을 사용 가능하게 만드는 것
AI와 수학 이야기에는 점수판처럼 프레이밍되는 버전이 있다: 모델이 얼마나 많은 미해결 문제를 해결할 수 있는가. 더 유용한 프레이밍은 무엇이 한 연구 커뮤니티에 의해 결과를 사용 가능하게 만드는가에 관한 것이며, 여기에는 모델 릴리스만으로는 제공되지 않는 여러 요소가 관련된다.
검토자는 논증을 이해해야 한다. 귀속은 추적 가능해야 한다. 다른 연구자들은 결과를 다시 도출하지 않고 그 위에 쌓아 올릴 수 있어야 한다. 그리고 더 넓은 커뮤니티는 자체 테스트를 실행할 수 있을 만큼 생성 시스템에 접근할 수 있어야 한다.
마지막 지점에서 이번 공개는 멈춘다. 다른 누구도 실행할 수 없는 시스템이 만들어 낸 결과 모음은 기여라기보다 시연에 가깝다. 무엇이 가능한지는 보여 준다. 하지만 그 분야에 독립적으로 쌓아 올릴 수 있는 무엇도 건네지 않는다.
이 전환에서 어려운 부분은 수학이 아니다. 어려운 부분은 AI 능력이 이제 그것을 검증하기 위해 존재하는 제도들(동료 심사, 벤치마크 재현, 저자 규범, 인용 관행)보다 빠르게 앞서 나가고 있으며, 그 제도들은 인간의 시간 척도로 돌아간다는 점이다. 모델은 한 번의 훈련 실행에서 722건의 결과를 생성할 수 있다. 그중 무엇이 중요한지, 누가 공로를 받아야 하는지, 그로부터 무엇이 따라오는지 밝히는 일은 여전히 수년 단위로 측정된다.
불합리하지 않기에 언급할 가치가 있는 경쟁 관점도 있다. 컴파일되는 형식적 증명은 누가 또는 무엇이 만들어 냈든 증명이다. 수학은 항상 결과의 출처보다 장점에 따라 받아들여 왔고, Lean이 논증을 검증한다면 그 논증은 성립한다. 그 관점에서 공로 논쟁은 이 분야가 평범한 방식으로 해결해야 할 사회학적 문제이며, 재현성에 대한 고집은 인간 수학자에게는 결코 요구된 적 없는 종류의 접근을 요구하는 것이다. 인간 저자에게 사고 과정을 공개하라고 요구하는 사람은 없다.
반론은 인간 저자에게는 자신의 작업을 설명하라고 요구할 수 있으며, 설명이야말로 이해가 사는 곳이라는 것이다. 설명 없이 도착한 증명은 검증된 출력을 우연히 가진 블랙박스다. 그 분야는 그것을 인용할 수는 있지만 가르칠 수는 없으며, 정리가 참이더라도 이는 실제 손실이다.
그 주에서 나온 실용적 조언은 수학에 국한되지 않고 AI 역량을 구매하는 누구에게나 적용된다: 증거, 권한, 그리고 성공적인 시연에서 반복 가능한 작업으로 가는 경로를 보여 달라고 요청하라. 벤치마크 결과와 작동하는 시스템은 서로 다른 산출물이며, 그 사이의 간격에 뜻밖의 일들이 산다.
관련 글
메타, 미드저니의 이미지·영상 기술 라이선스… 그 이유가 말해주는 것
벤치마크는 분기마다 바뀐다. 무엇이 보기 좋은지에 대한 커뮤니티의 판단은 그렇지 않다.
AssemblyAI, 실시간 음성 지연 시간을 91밀리초로 단축했다. 이 숫자가 중요한 이유
음성의 제약은 결코 단어 오류율이 아니었다. 그것은 턴 테이킹이었다.
Google의 Nano Banana 2.1은 플래그십이 아닌 기능 드롭이다
중간 등급 릴리스는 연구소가 대부분의 사용자가 실제로 무엇을 필요로 한다고 생각하는지 알려주며, 이는 플래그십보다 더 유용한 신호다.
동영상 광고 스택은 전문 모델들로 분화했고, Boreal-H3가 그 이유를 보여준다
시네마틱 품질과 반복 처리량은 서로 다른 제품이며, 하나의 생성 레이어가 둘 모두에서 앞설 수는 없다.