← 블로그로
Ai약 13 분 읽기

Ai2가 오픈소스로 공개한 것은 또 다른 가중치가 아니라 학습 스택이다

게시일 2026년 10월 5일
Ai2가 오픈소스로 공개한 것은 또 다른 가중치가 아니라 학습 스택이다

앨런 인공지능 연구소(Allen Institute for AI)가 조 단위 파라미터 규모의 전문가 혼합(MoE) 모델을 위한 오픈 학습 인프라인 Olmo-core 3를 공개했다. 대표 벤치마크는 470억 파라미터 MoE가 8개의 B300 GPU에서 이전 구성 대비 약 2.7배의 처리량을 달성한 것이다. 이 수치는 존중할 만하다. 하지만 이것이 이번 공개가 중요한 이유는 아니다.

가중치는 남에게 주기는 쉽지만, 그것으로부터 배우기는 어렵다. 가중치 한 세트를 내려받으면 모델을 실행할 수는 있다. 하지만 사실상 학습 파이프라인을 처음부터 다시 구축하지 않고서는 그 모델을 재현하거나 감사하거나 자신의 데이터로 재학습할 수 없다. Olmo-core 3는 바로 그 파이프라인의 공개다.

계속해서 등장하는 구분

오픈 가중치와 오픈 학습은 서로 다른 산출물이며, 그 둘 사이의 간극에 대부분의 유용한 정보가 있다.

공개된 모델은 한 팀이 무엇을 달성했는지 알려준다. 학습 스택은 그것을 어떻게 달성했는지 알려주며, 직접 해보려는 사람에게 필요한 것은 바로 그 방법이다. 후자는 공개한 조직 외부의 누구에게나 훨씬 유용하고, 훨씬 드물다. 학습 코드와 데이터 파이프라인, 구성 세부사항이야말로 제대로 맞추는 데 가장 오래 걸리는 부분이기 때문이다.

전문가 혼합(MoE)은 이 점을 덜 중요하게 만드는 것이 아니라 더 중요하게 만든다. MoE 모델은 각 토큰을 일부 전문가에게 라우팅하므로, 총 파라미터가 조 단위인 모델도 토큰마다 아주 일부만 활성화할 수 있다. 이 설계는 추론 비용을 줄이지만, 라우팅 결정과 전문가 간 부하 분산, 그리고 장치 간 통신 패턴처럼 조정하기 정말 어려운 문제를 도입한다. 두 팀이 동일한 모델 아키텍처를 갖고도 학습 루프에서의 선택 때문에 매우 다른 처리량을 낼 수 있다.

학습 인프라를 공개한다는 것은 그러한 선택들이 드러난다는 뜻이다. 2.7배 처리량 수치가 의미를 갖는 이유도 여기에 있다. 다른 사람이 실행하고 검증할 수 있는 코드에 그 수치가 붙어 있기 때문이다.

어두운 테이블 위에 납작하게 놓인 그래픽 가속기 보드와 그 옆의 빈 인덱스 카드

MoE 학습이 어려운 부분인 이유

덴스 모델은 예측 가능하게 확장된다. 파라미터를 늘리고 컴퓨트를 늘리면 매끄러운 곡선이 나온다. MoE 모델은 스케줄링 문제를 도입한다. 라우터가 대부분의 토큰을 소수 전문가에게 보내면 그 전문가들이 병목이 되고 나머지 하드웨어는 유휴 상태가 된다. 반대로 토큰을 너무 고르게 분산하면 이 아키텍처를 매력적으로 만든 전문화를 잃는다.

이를 제대로 하려면 대부분의 연구소가 독점 기술로 취급하는 용량 계수(capacity factor), 보조 손실(auxiliary loss), 통신 오버레이가 필요하다. 또한 하드웨어 장애를 견디는 체크포인팅도 필요하다. 이 규모의 학습 실행은 장애를 겪게 마련이고, 처음부터 다시 시작하는 것은 선택지가 아니기 때문이다.

Ai2가 8개의 B300 GPU에서 보고한 처리량 향상은 소규모 결과이며, 그렇게 읽어야 한다. 학습 루프가 단일 노드에서 효율적이라는 것은 노드 간 통신이 지배하는 수백 노드 규모에서도 유지된다는 뜻이 아니다. 그러나 이것은 올바른 첫 결과다. 효율성 문제는 보통 소규모에서 먼저 나타나고, 규모를 키울수록 더 심해지기 때문이다.

8개 GPU에서의 처리량이 올바른 첫 숫자인 이유

소규모의 처리량 결과는 조 단위 파라미터라는 구도 옆에 놓으면 초라해 보이며, 이에 대한 변호가 필요하다. 학습 효율성 문제는 일찍 나타나고 점점 악화되는 경향이 있다. 학습 루프가 단일 노드에서 컴퓨트의 3분의 1을 낭비한다면, 노드 간 통신이 추가될 때 같은 루프는 더 많이 낭비하게 된다. 비효율이 모든 조정 계층마다 누적되기 때문이다.

소규모 숫자를 먼저 공개하는 것은 대규모 클러스터에 대한 주장을 하기 전에 기본기가 탄탄하다고 말하는 방식이다. 또한 올바른 출발점이기도 하다. 소규모 숫자보다 대규모 숫자를 먼저 보고하는 팀은 보통 지속 속도가 아니라 최고 속도를 보고하는 것이다.

이 숫자가 중요한 두 번째 이유가 있다. MoE 처리량은 덴스 모델과 달리 배치 크기와 시퀀스 길이에 민감하며, 8개 GPU에서 효율을 극대화하는 구성은 종종 튜닝을 거쳐 더 큰 클러스터로 일반화된다. 2.7배 향상은 튜닝 세부사항이 아니라 구조적 변화를 반영할 만큼 크기 때문에 주목할 가치가 있다.

이 학습 스택의 수요자는 가중치의 수요자보다 훨씬 적다

오픈 모델을 이야기하는 대부분의 사람은 가중치를 원한다. 추론을 실행하거나, 특정 도메인에 파인튜닝하거나, 제품을 만들고 싶어 한다. 그 집단은 모든 오픈 가중치 공개로 충족된다.

학습 스택을 필요로 하는 집단은 훨씬 작다. 연구소, 국가 컴퓨트 프로그램, 클러스터 접근 권한이 있는 대학, 그리고 모델이 어떻게 만들어졌는지 문서화해야 하는 규제 산업의 기업들이다. 이 사용자들은 제대로 지원받지 못해 왔다. 선택지가 파이프라인을 처음부터 구축하는 것과 특정 벤더의 하드웨어에서만 작동하는 무언가를 사용하는 것 사이에 있었기 때문이다.

오픈 학습 스택은 두 번째 선택지를 바꾼다. 연구소에는 수정할 수 있는 출발점을 주고, 정부 프로그램에는 외국 벤더가 구현 세부사항을 공유하려는 의지에 의존하지 않는 주권 모델로 가는 길을 준다.

이것은 전략적인 공개이며, Ai2는 이 점에서 일관돼 왔다. 이 연구소의 모델들은 데이터, 코드, 학습 로그와 함께 공개돼 왔는데, 이는 가중치와 논문을 공개하는 것보다 더 엄격한 기준이다.

오픈 학습에 관한 조용한 논쟁

오픈 모델 커뮤니티 안에는 개방성이 무엇을 의미해야 하는지에 대한 논쟁이 있고, 이와 같은 공개는 그 논쟁을 앞으로 밀고 나간다.

한 입장은 사람들이 실제로 사용하는 것이 가중치이므로 가중치가 중요하다고 본다. 그 관점에서 모델을 공개하는 것은 선물이고, 학습 세부사항은 기업의 사적인 사업이다. 다른 입장은 학습 스택이 없는 모델은 원래 팀 외부의 누구도 감사하거나 재현하거나 개선할 수 없으며, 그런 공개를 오픈이라고 부르는 것은 제공하는 바를 과장하는 것이라고 본다.

두 번째 입장은 실용적인 이유로 힘을 얻고 있다. 여러 관할권의 규제 기관이 모델 개발자에게 학습 데이터와 출처를 문서화하라고 요구하기 시작했다. 공개된 파이프라인으로 학습한 팀은 그 질문에 답할 수 있다. 빌린 가중치를 파인튜닝한 팀은 답할 수 없다. 그 가중치에 무엇이 들어갔는지 모르기 때문이다.

연구소 입장에서 계산은 간단하다. 스택을 공개하는 데는 엔지니어링 시간이 들 뿐 상업적으로 포기할 것이 없다. 연구소는 API 호출을 판매하지 않기 때문이다. 상업 연구소가 같은 일을 하면 경쟁자에게 선행 기회를 주는 셈이 된다. 이런 비대칭성 때문에 오픈 학습 스택은 기업보다 연구소와 대학에서 훨씬 자주 나오며, 하나가 등장할 때마다 살펴볼 가치가 있다.

지켜볼 것

처리량 결과가 규모에서도 유지되는지다. 흥미로운 테스트는 8개 GPU가 아니라 수백 개 GPU이며, 여기서 Olmo-core 3가 구현한 통신 패턴이 작동하거나 작동하지 않는다.

외부 연구소가 실제로 채택하는지다. 학습 스택은 다른 누군가가 그것으로 모델을 학습해 결과를 공개할 때 퍼진다. 첫 번째 신뢰할 만한 재현이 어떤 벤치마크 표보다 더 많은 정보를 줄 것이다.

오픈 학습이 조달을 바꾸는지다. 모델 출처를 문서화해야 하는 조직은 선택지가 제한적이었다. 허용적인 라이선스 아래 전체 학습 파이프라인을 이용할 수 있다면, 그런 조직 중 일부는 폐쇄형 대안에 비용을 지불하기보다 그 위에 구축할 것이다.

가중치 공개는 누구나 내려받아 시험해 볼 수 있기 때문에 주목을 받는다. 학습 공개는 이 분야의 실제 지식이 이전되는 곳이며, 훨씬 드물게 일어난다. 이번 공개는 면밀히 읽어볼 가치가 있다. 모델에서 이전 가능한 부분은 그 뒤에 있는 과정이기 때문이다.

관련 글