← 블로그로
News약 13 분 읽기

OpenAI의 연구 루프는 스스로 닫히기 시작하고 있다

게시일 2026년 10월 2일
OpenAI의 연구 루프는 스스로 닫히기 시작하고 있다

디 인포메이션(The Information)은 9월 21일, OpenAI의 내부 AI 모델들이 새로운 실험 모델의 학습 파이프라인을 상당 부분 자동화했다고 보도했다. 여기에는 GPU 커널 코드 작성과 학습 코드 최적화가 포함된다. 눈에 띈 세부 사항은 그 작업이 어떻게 시작되는가였다. 연구자가 추구해야 할 최적화 사례 하나를 시스템에 제시하면, AI가 몇 주 동안 스스로 유사한 개선을 구현하고 테스트한다.

두 번째 세부 사항은 더 낯설었다. 여러 내부 AI 에이전트가 인간 개입 없이 문제 해결에 협업하기 시작했다. 한때 수년의 엔지니어링이 걸렸던 사례들이 이제 약 일주일 만에 처리된다고 보도됐다.

이 설명이 정확하다면, 흥미로운 점은 AI가 커널 코드를 작성할 수 있다는 것이 아니다. 모델들은 이미 한동안 그렇게 해왔다. 흥미로운 점은 루프의 방향이다. AI가 다음 모델을 더 빠르게 만드는 데 기여하고, 그 더 빠른 모델이 그다음 모델을 만드는 데 기여하면, 개선은 사용자 대면 계층에 머물지 않고 연구 과정 내부에서 복리로 쌓인다.

이것이 코드 작성과 다른 이유

학습 루프를 자동화하는 것은 코딩 작업을 자동화하는 것과 다르며, 그 차이는 정확히 짚을 가치가 있다. 애플리케이션의 기능을 작성하는 일에는 알려진 목표가 있다. 기능이 작동하거나 작동하지 않거나 둘 중 하나다. 반면 학습 실행을 최적화하는 일에는 열린 목표가 있다. 시스템은 모델을 저하시키지 않으면서 학습을 더 빠르거나 더 저렴하게 만드는 변경을 찾아야 하고, 대부분의 변경이 상황을 악화시키는 탐색 공간 전체에서 그것을 해내야 한다.

보도된 워크플로는 어려운 부분이 좁혀졌음을 시사한다. 인간이 최적화의 좋은 사례 하나를 제공하면, 그것이 문제의 형태를 정의한다. AI는 그 형태를 코드베이스의 다른 부분으로 복제한다. 이는 실제 역량이며 동시에 경계가 있는 역량이다. 유망한 방향이 무엇인지 판단하는 것은 여전히 인간이기 때문이다.

바로 그 경계에서 이 주장은 흥미로워진다. 알려진 최적화를 코드베이스 전반에 복제하는 것은 오늘날 강력한 모델이 할 수 있는 일이다. 아무도 찾지 못한 최적화를 발견하는 것은 다른 과제이며, 이 보도는 그런 일이 일어났다고 주장하지 않는다. 보도가 묘사하는 것은 학습 파이프라인에서 광범위한 숙련 노동이 제거되는 것이며, 이는 파이프라인이 스스로를 개선하는 것과 같지 않다. 비록 둘의 경계가 가장자리에서 흐릿하게 겹치더라도.

다중 에이전트 협업 주장은 평가하기 더 어렵다. 인간 없이 함께 일하는 에이전트는 단계적 도약처럼 들리지만, 인간이 설계한 워크플로 안에서 에이전트들이 서로 구조화된 출력을 전달하는 것을 의미할 수도 있다. 둘 다 이 보도와 모순되지 않는다. 둘 사이의 간극은 새로운 종류의 연구 조직과 긴 자동화 스크립트 사이의 차이다.

재귀 논증을 솔직하게 말하자면

재귀적 자기 개선이란 스스로를 개선할 수 있는 지능이 자기 개선을 더 빠르게 해나간다는 개념으로, 평평해 보이다가 갑자기 그렇지 않게 되는 곡선을 만들어낸다. 이 개념은 I. J. 굿이 1965년 지능 폭발에 대해 쓴 이래 존재해 왔지만, 루프가 계속 끊어졌기 때문에 대부분 이론으로 남아 있었다. 코드를 작성하는 모델은 유용하다. 다음 모델을 만들어내는 과정을 개선하는 모델은 또 다른 존재다.

보도된 상황이 주목할 만한 이유는 그 루프에 자연스러운 측정 기준이 있기 때문이다. 학습 효율은 정량화하기 쉽다. AI 지원 학습 작업이 정말로 수년에 걸친 엔지니어링 노력을 일주일로 압축한다면, 그 효과는 OpenAI가 새 모델을 얼마나 자주 출시하는지와 각 모델에 얼마나 많은 컴퓨트가 드는지에 나타난다. 진정으로 닫힌 연구 루프는 관찰 가능한 주기를 만들어내고, 그렇지 않은 연구 루프는 언론 보도 주기만 만들어낸다.

그것이 내가 적용할 기준이다. 보도가 사실인지가 아니라, 앞으로 12개월 동안 비슷한 비용으로 더 빠른 모델 출시가 나타나는지 여부다. 루프가 닫히고 있다면 출시의 리듬이 바뀐다. 그렇지 않다면 그 발표는 반감기가 짧은 또 하나의 역량 주장일 뿐이다.

주기가 주장보다 더 중요한 이유

이 보도의 내용만이 아니라 시점에 관심을 가질 이유가 있다. 최전선 모델 학습은 벽에 부딪혔고, 그 벽은 비용으로 이루어져 있다. 이제 단일 대규모 학습 실행은 전력, 칩, 엔지니어링 시간을 소비하는 규모가 커져서, 10퍼센트의 효율 향상이 새로운 벤치마크 기록보다 더 가치 있다. 그것이 다음 분기에 연구소가 감당할 수 있는 실험의 수를 결정하기 때문이다.

이는 학습 코드를 최적화하는 AI의 가치를 바꾼다. 그것은 SF적 의미에서 스스로를 개선하는 기계로 가는 한 걸음이 아니다. 그것은 연구소가 하는 가장 비싼 일에 대한 배수이며, 가장 비싼 비용 항목에 대한 배수가 바로 연구 우위가 나오는 지점이다. 같은 컴퓨트 예산을 가졌지만 학습 루프가 10퍼센트 더 빠른 두 연구소는 오래 동등하게 머물지 않는다.

그렇게 보면, 이 보도는 의식보다는 자본 효율성에 관한 것이다. 중요한 루프는 모델이 스스로를 개선하는 것이 아니다. 모델이 다음 실험의 비용을 낮춰 연구소가 더 많은 실험을 돌릴 수 있게 하는 것이며, 이는 어떤 기술이든 더 빨라지는 평범한 방식이다.

아무도 확인할 수 없는 부분

이런 종류의 보도에서 솔직히 문제가 되는 것은 검증이다. 논문도, 벤치마크도, 독립적 재현도 없다. 이 주장은 믿겨지고자 하는 유인이 넘치지만 자신의 작업을 공개할 의무는 없는 회사 내부에서 나온다. 그렇다고 해서 거짓이 되는 것은 아니다. 외부인이 가질 수 있는 확신이 출처에 의해 제한된다는 뜻이다.

이것은 OpenAI만의 문제가 아니다. 이제 모든 최전선 연구소가 공개 평가의 범위를 벗어난 내부 자동화에 대한 주장을 하고, 이를 드러내는 보도는 숫자를 확인할 수 없을 때조차 유용한 일을 한다. 패턴은 익숙하다. 역량이 묘사되고, 그 묘사는 그럴듯하며, 증거는 언젠가 도착하거나 도착하지 않는다.

자동화가 무엇을 위한 것인지에 대한 질문도 있다. 알트만은 9월 초 팟캐스트에서 OpenAI가 휴머노이드 로봇을 반드시 만들 것이며, 어려운 부분은 몸체가 아니라 두뇌라고 말했다. 스스로를 가속하는 연구 과정과 그 지능을 물리적 기계에 넣으려는 야심은 같은 논지의 양면이다. 학습 루프는 제품이 아니다. 다음 제품을 가능하게 하는 것이다.

이것이 사실이라면 무엇을 의미하는가

보도된 주기가 실제라고 가정하자. 직접적 효과는 최전선 연구소가 단위 시간당 더 많은 아이디어를 탐색할 수 있다는 것이다. 최적화를 테스트하는 비용이 떨어지기 때문이다. 이는 이미 대규모 컴퓨트와 데이터를 보유한 연구소에 유리하며, 이는 오늘날 선두에 있는 바로 그 연구소 집단이다. 그것은 작은 팀이 따라잡게 해주는 이점이 아니라 기존 강자의 이점이 복리로 쌓이는 것이다.

간접적 효과는 연구 일자리에 있다. 보도가 묘사하는 작업, 즉 커널을 작성하고 학습 코드를 튜닝하는 일은 자동화가 가장 먼저 도달하는, 숙련되었지만 잘 명세된 노동에 정확히 해당한다. 그 일을 하던 사람들은 무엇을 최적화할 가치가 있는지 정의하는 쪽으로 위로 이동하며, 이는 보도가 여전히 인간의 몫으로 남겨둔 부분이다.

그런 해석은 지능 폭발보다 덜 극적이고 계획을 세우는 데 더 유용하다. 보도된 뉴스는 OpenAI가 스스로를 개선하는 기계를 만들었다는 것이 아니다. 학습 파이프라인이 명세하기 가장 쉬운 연구의 일부를 조용히 흡수하고, 판단이 필요한 부분은 있던 자리에 그대로 남겨두었다는 것이다.

관련 글