Reflection AI, 중국 연구소에 맞서는 미국의 대안으로 내세운 501B 오픈 웨이트 모델 Beam 출시

10월 5일, Reflection AI는 자사의 첫 오픈 웨이트 모델인 Beam을 공개하며 이번 발표를 명백히 지정학적 용어로 규정했다. 2024년 전 DeepMind 연구원 두 명이 설립한 뉴욕 스타트업은 Beam을 중국 웨이트에 의존하지 않고 최전선급 모델을 실행하고 맞춤화하려는 기업, 정부, 개발자를 위한 주력 모델이라고 부른다.
Beam은 총 5010억 개 파라미터와 작업당 230억 개 활성 파라미터를 갖춘 희소 전문가 혼합(MoE) 시스템이다. Reflection은 이달 말 Apache 2.0 라이선스로 웨이트를 공개하고 기술 보고서와 모델 카드도 함께 낼 계획이다. 현재로서는 모델이 얼리 액세스 상태이며 독립 벤치마크는 공개되지 않았다.
이 마지막 점이 이번 발표를 어떻게 읽어야 하는지를 좌우한다.
숫자가 실제로 말하는 것
회사 자체 비교에 따르면 Beam은 코딩 및 에이전트 작업에서 Z.ai의 GLM-5.2에 근접하고 알리바바의 Qwen 3.8-Max에 다가선다. 파라미터 수로 보면 공정한 비교다. GLM-5.2는 총 약 7440억 개 파라미터에 400억 개 활성 파라미터를 사용하므로, Beam은 토큰당 더 적은 전문가를 활성화하는 더 작은 네트워크다.

더 흥미로운 주장은 효율성이다. CEO 미샤 라스킨은 Semafor에 Beam이 문제를 추론하는 데 비교 가능한 오픈 모델보다 3~4배 적은 컴퓨트가 필요하다고 말했다. 이 주장이 사실로 확인된다면 리더보드 순위보다 더 중요하다. 모델을 실행하는 비용이 누군가 계속 그 모델을 돌릴지를 결정하기 때문이다.
Reflection은 250억 달러의 프리머니 밸류에이션으로 투자를 유치했으며, 엔비디아, 세쿼이아, 씨티그룹 등이 투자자로 참여했다. 엔비디아의 지분은 8억 달러로 보도되었는데, 이는 하드웨어 공급업체를 오픈 웨이트 논쟁의 양쪽에 세워 놓는다. 사람들이 더 많은 모델을 실행할수록 더 많은 칩을 사들이기 때문이다.
미국의 오픈 모델이 왜 하드웨어 이야기이기도 한가
오픈 웨이트는 지난 2년간 중국의 강점이었다. DeepSeek, Qwen, Kimi, GLM은 달러당 성능의 기준을 세웠고, 서구 기업들은 고객 서비스부터 일상적인 코드 생성까지 반복적인 업무를 이들 모델로 돌리기 시작했다. 이러한 채택은 불편한 의존성을 낳았다. 자신이 기반으로 삼은 모델을 검사하거나 자체 호스팅할 수 없는 기업은 자체 스택에 대한 통제력이 제한적이다.
Beam은 바로 그 공백을 겨냥한다. 라스킨이 Semafor에 한 제안은 직설적이었다. 중국 모델을 쓰지 않으려 하거나 쓸 수 없는 주권 AI 시스템을 구축하는 조직들은 “오늘날 사실상 좋은 선택지가 없다”는 것이다.
여기에는 보안 측면도 겹쳐 있다. 미국과 영국 정부 평가자들은 최근 중국 오픈 모델이 공격자의 코드 취약점 악용을 도울 수 있다는 사실을 발견했다. 이 발견이 결정적이든 과장이든, 서구 구매자에게는 자국에서 훈련된 대안에 프리미엄을 지불할 이유가 되고, Reflection에게는 워싱턴에서 할 규제 관련 이야깃거리를 제공한다.
Beam이 진입하는 경쟁 구도
Reflection이 이걸 처음 시도하는 서구 연구소는 아니다. Thinking Machines Lab과 Mistral도 오픈 웨이트 모델을 공개하며 각자의 입지를 구축했다. Beam을 차별화하는 것은 규모와 프레이밍이다. 총 5010억 개 파라미터에 230억 개 활성 파라미터로, 대부분의 서구 오픈 모델이 경쟁하는 효율적 조력자 계층이 아니라 최전선 계층을 겨냥한다.
그 계층의 경제성은 냉혹하다. 이 정도 규모의 모델을 서비스하려면 상당한 비용이 들고, 이를 운영할 기업들은 벤치마크 순위만큼이나 달러당 처리량을 중시한다. 그래서 효율성 주장이 Reflection의 제안에서 핵심이며, 동시에 가장 검증이 필요한 주장이기도 하다. 품질은 GLM-5.2와 맞먹으면서 서비스 비용은 같은 모델이라면, 구매자가 중국 모델에서 갈아탈 주된 이유가 사라진다.
라이선스 선택은 의도를 보여준다. Apache 2.0은 최소한의 의무만으로 상업적 사용, 수정, 재배포를 허용하며, 통제보다 채택이 목표일 때 선택하는 라이선스다. 웨이트를 직접 수익화하려는 연구소라면 더 제한적인 라이선스를 택했을 것이다. Reflection은 인프라 계층에서의 보편성이 결과물을 게이트키핑하는 것보다 더 가치 있다고 보고 있다.
그 밑에는 컴퓨트 이야기도 있다. Reflection은 Colossus 2 데이터센터 용량을 위해 SpaceX와 계약을 맺었고 미국 에너지부와도 파트너십을 체결했다. 이러한 계약은 이 규모의 모델을 훈련하는 기업에 중요하며, 이 스타트업을 중국 웨이트에 대한 자국 대안을 원하는 나름의 이유가 있는 공공 및 민간 기관들과 연결해 준다.
여전히 주장에 불과한 부분
위의 모든 내용은 Reflection 자체 평가에 기반한다. 공개 당시 제3자 벤치마크는 공개되지 않았고 웨이트도 아직 배포되지 않았다. 벤더 테스트에서 경쟁 모델을 앞서는 모델과 실제 프로덕션 파이프라인에서 경쟁 모델을 앞서는 모델은 서로 다른 것이다.
GLM-5.2와의 비교도 프레이밍이 시사하는 것보다 좁다. 코딩 및 에이전트 작업에서 한 중국 모델과 대등하고 같은 축에서 다른 모델에 근접하는 것은 재현된다면 실제 성과다. 이는 매우 다양한 강점, 라이선스, 배포 프로필을 가진 모델들로 이루어진 전체 오픈 웨이트 분야에서의 경쟁적 동등성과는 다르다.
Reflection은 이미 “훨씬 더” 강력한 후속 모델을 훈련 중이라고 말한다. 하기에 합당한 말이지만 검증하기는 어렵다.
타이밍은 우연이 아니다
Beam은 특정한 규제적 시점에 등장한다. 여름 내내 자율 모델과 관련된 일련의 보안 사고가 AI 감독을 정치 의제로 끌어올렸고, 미국의 주요 연구소들은 백악관 회의 이후 자발적 안전 협약에 서명했다. 이 협약은 연방 규칙이 아니라 기업의 자율 규제에 의존하며, 이를 둘러싼 정치적 셈법은 11월 중간선거에 따라 바뀔 수 있다.
Reflection이 지금 이 시점에 오픈 웨이트 사업에 뛰어드는 이유로 밝힌 것은 그 대화에서 한자리를 차지하기 위해서다. 라스킨은 Semafor에 회사가 오픈 모델 구축자들이 규제 논쟁에 기여하기를 바란다고 말했다. 오픈 개발자와 클로즈드 개발자 모두 외부에서 규제받기보다 정부와 협력해야 한다는 논리다. 서구 기업과 기관이 직접 실행할 수 있는 오픈 모델은 정책 보고서와는 달리 그 논쟁에서 구체적인 논거가 된다.
이러한 프레이밍은 회사가 미국 초지능 혁신·표준 진흥 센터(US Center for Advancing Innovation and Standards for Super Intelligence) 및 영국 AI 안전 연구소(UK AI Safety Institute)와 협력해 모델을 평가하려는 이유도 설명한다. 독립적인 안전 평가를 받는 것은 오픈 웨이트에 대한 가장 큰 반대, 즉 공개하면 감독이 사라진다는 주장을 선제적으로 막는 방법이다.
지켜볼 것
세 가지 신호가 이 문제를 판가름할 것이다.
첫째는 웨이트 자체다. Apache 2.0은 상업적 사용과 수정을 거의 제약 없이 허용하며, 생태계를 키우려는 기업이 의도적으로 선택한 관대한 라이선스다. 공개된 결과물이 벤치마크 주장과 일치하는지가 첫 번째 시험이다.
둘째는 제3자 평가다. 효율성 주장의 독립적 재현, 또는 재현 실패는 어떤 출시 글이든 채택을 좌우하는 데 더 큰 영향을 미칠 것이다.
셋째는 기업 행동이다. 기업들은 1년 동안 일상 업무를 저렴한 모델로 돌리고 최전선 모델은 어려운 문제에 아껴 쓰는 법을 익혔다. Beam이 비용과 역량 면에서 두 계층 사이에 자리 잡으면 시장이 있다. 결정적인 품질 우위 없이 비싼 쪽에 더 가깝게 자리 잡으면 지정학이 이를 떠받쳐 주지 못할 것이다.
오픈 웨이트 경쟁은 가격에서는 바닥으로 향하는 경쟁이자 동시에 역량에서는 정상으로 향하는 경쟁이었다. Reflection은 복사를 장려하는 라이선스와 검증을 장려하는 주장을 내걸고 두 경쟁에 뛰어든다. 회사는 옳은 말을 했다. 이제는 웨이트가 그 말을 해야 한다.
관련 글
BOSSFIGHT, 프런티어 모델을 24주간 커피숍 사장으로 돌려보았다. 대부분은 '아무것도 하지 않기'에 졌다.
퀴즈에서 뇌물을 거절하는 것과 실제 분기에서 흔들리지 않는 것은 서로 다른 두 가지 능력이며, 현재의 평가는 더 쉬운 쪽을 측정하는 경향이 있다.
NASA와 IBM, 17년간의 궤도선 데이터로 훈련된 달 파운데이션 모델을 오픈소스로 공개
이 모델은 지형지를 찾고 특성화하는 데 유용하지만, 그것들이 정확히 어디에 있는지 높은 정밀도로 말하는 데는 신뢰할 수 없다.
40단계 대신 4단계: 증류가 오픈 이미지 모델을 소비자용 GPU로 압축하는 방법
저단계 증류는 공짜 점심이 아니라 트레이드오프다. 텍스트 충실도, 편집 정밀도, 다중 참조 일관성이 가장 먼저 희생된다.
이번 주, 에이전트들이 단편 영화를 연출하기 시작했다. 병목은 품질 관리로 옮겨갔다.
생성은 저렴하고, 오케스트레이션이 제품이며, 파이프라인이 유용한지를 결정하는 것은 실패했을 때를 알아차릴 수 있는지 여부다.