샤오미, 프런티어에 맞먹는 옴니모달 모델과 학습 레시피까지 공개

한 휴대폰 회사가 9월 22일 AI 모델을 공개했고, 헤드라인 숫자는 46이었습니다. 이는 Artificial Analysis 인텔리전스 지수에서 샤오미의 MiMo-V2.6 Pro가 기록한 점수로, 회사 측은 공개 시점 기준 오픈소스 모델이 기록한 최고 점수라고 밝혔습니다.
MiMo-V2.6은 두 가지 버전으로 나옵니다. Pro는 대형 모델, Flash는 빠른 모델입니다. 샤오미는 Pro가 대부분의 에이전트 벤치마크에서 Claude Opus 5, GPT-5.6 Sol과 동등한 성능을 낸다고 말하며, 코딩, 컴퓨터 사용, 3D 추론, 창의적 작업에서의 향상을 내세웁니다. 이 모델들은 옴니모달(omnimodal)로, 하나의 가중치 세트를 통해 텍스트와 이미지, 기타 입력을 받아들입니다. 또한 규모를 키운 강화학습(scaled reinforcement learning)으로 학습되었는데, 바로 이 부분이 역량과 공개 방식 모두를 설명해 줍니다.
다운로드에 실제로 담긴 것
대부분의 오픈 가중치 공개는 가중치만 넘겨주고 거기서 멈춥니다. MiMo-V2.6은 가중치, 기술 보고서, 강화학습 환경, 학습 코드를 함께 제공합니다. 샤오미는 라이선스 페이지와 대기자 명단이 있는 모델 허브를 거치게 하는 대신, 네 가지 모두를 자사 사이트에 공개했습니다.
강화학습 환경이 포함된 것이 의미 있는 차이입니다. 가중치는 모델을 실행하게 해줍니다. 환경은 모델을 다시 학습시킬 수 있게 해줍니다. 연구소가 자신이 학습에 사용한 환경을 공개한다는 것은, 행동이 무엇인지만이 아니라 그 행동을 어떻게 얻게 되었는지를 알려주는 것입니다. 결과를 재현하거나 자체 보상 신호에 맞춰 모델을 미세조정하려는 사람에게 환경은 실질적인 산출물입니다.
이는 또한 공개하는 회사의 비용을 높입니다. 환경을 공개하면 학습 신호의 형태가 드러나는데, 이는 체크포인트보다 레시피에 가깝습니다. 경쟁사는 이를 읽고 1년치 시행착오를 건너뛸 수 있습니다. 샤오미는 채용과 신뢰도 측면의 이점이 그보다 크다고 판단한 것으로 보입니다.
왜 기기 회사가 프런티어 연구를 하는가
샤오미는 우연히 휴대폰을 파는 연구소가 아닙니다. 그 반대이며, 이런 방향성은 옴니모달 모델이 무엇에 유용한지에서 드러납니다.
화면을 읽고, 사진을 이해하고, 인터페이스를 조작하고, 음성 대화로 답할 수 있는 어시스턴트에게 휴대폰은 자연스러운 안식처입니다. 그런 관점에서 컴퓨터 사용, 3D 추론, 창의적 생성은 추상적인 벤치마크가 아닙니다. 이들은 누군가 손에 들고 있는 기기에서, 흔히 느린 연결과 보호해야 할 배터리 환경에서 돌아가야 하는 시스템의 구성 요소입니다. 역량을 위한 Pro 등급과 지연 시간을 위한 Flash 등급으로 나뉜 모델 패밀리는 연구 결정이면서 동시에 기기 로드맵 결정입니다.
가중치 공개는 두 가지 목적을 수행합니다. 공개적으로 모델을 개선할 연구자들을 끌어들이고, 역량 주장이 그렇지 않으면 신뢰에 기대어 받아들여지는 시장에서 회사의 위치에 하한선을 만들어 줍니다. 직접 다운로드해 평가할 수 있는 모델은 마케팅이 덜 필요하며, 샤오미는 공개된 결과에 전체 평판을 걸고 있는 연구소들과 개발자 관심을 두고 경쟁하고 있습니다.
옴니모달이 실제로 의미하는 것
이 라벨은 구체적인 엔지니어링 주장을 담고 있습니다. 각 입력 유형을 별도의 전문 모델로 라우팅하는 대신, 하나의 모델이 공유 표현을 통해 여러 종류의 입력을 처리한다는 것입니다. 휴대폰에서는 이것이 중요합니다. 대안은 여러 모델을 돌리고 그 출력을 이어 붙이는 것이며, 핸드셋에서는 메모리와 지연 시간이 모두 부족하기 때문입니다. 샤오미의 Flash 등급도 같은 이유로 존재합니다. 플래그십에서 1초 만에 답하는 모델이 중급 기기나 자동차에서는 쓸 수 없는 물건일 수 있으므로, 이 패밀리는 사실 하나의 공개가 아니라 역량과 지연 시간 곡선 위의 두 지점입니다.

학습 방식이 나머지를 설명합니다. 규모를 키운 강화학습이란 모델이 다음 토큰을 예측하도록만 학습되는 것이 아니라 보상 신호에 맞춰 최적화된다는 뜻이며, 업계 전반에서 최근 에이전트 성능이 급등한 배경에 있는 접근법입니다. 또한 환경이 가중치만큼이나 중요한 이유이기도 합니다. 보상 신호는 그것을 만들어 내는 환경만큼만 좋을 수 있으므로, 환경을 공개하는 것은 결과를 공개하는 것보다 방법을 공개하는 것에 가깝습니다.
기기가 곧 유통 채널
샤오미의 강점은 사용자에게 도달하기 위해 개발자 생태계가 필요 없다는 점입니다. 이 회사는 수천만 명에게 하드웨어를 공급하며, 휴대폰 어시스턴트 안에서 돌아가는 모델은 모델 허브가 1년에 도달하는 것보다 한 분기에 더 많은 사람에게 도달합니다. 그래서 공개 방식이 관대합니다. 가중치와 레시피는 라이선스 수익 손실 측면에서 회사에 상대적으로 적은 비용이 들고, 그렇지 않으면 벤치마크 스크린샷만으로 모델을 판단했을 연구 커뮤니티의 신뢰를 얻어 줍니다.
위험도 강점과 같습니다. 휴대폰 어시스턴트는 매번 작동하는지로 평가받으며, 스무 개 중 하나의 작업에서 실패하는 에이전트는 채팅 창에서는 성가신 정도지만 결제와 사진, 메시지까지 처리하는 기기 안에서는 위험 요소입니다. 역량 벤치마크는 그 격차를 측정하지 못하며, 46이라는 종합 점수도 마찬가지입니다.
같은 화요일에 나온 세 가지 다른 공개
시점이 시사하는 바가 있습니다. 9월 22일 샤오미의 모델은 알리바바가 9월 20일 오픈 가중치로 공개하고 같은 날 자사 윈치(Yunqi) 콘퍼런스에서 선보인 Qwen-Image-2.1, 그리고 텐센트 클라우드 API에서 2K 이미지당 0.15위안에 책정된 전문가용 이미지 모델인 텐센트의 Hy Image 3.5 프리뷰와 나란히 등장했습니다. 유니트리(Unitree)는 같은 시기에 22 자유도를 갖춘 정교한 로봇 손 Dex5-S를 6,500달러부터 시작하는 가격으로 발표했습니다.
알리바바는 또한 이 콘퍼런스를 빌려 Qwen3.8-Max가 Artificial Analysis의 에이전트 리더보드에서 1위, 프런트엔드 프로그래밍 부문 CodeArena에서 1위를 차지했다고 주장하고, Qwen4가 학습 중이며 후속 모델은 5조에서 10조 개 파라미터로 계획되어 있다고 밝혔습니다. Qwen-Image 책임자는 팀의 목표가 파라미터 수를 극대화하는 것이 아니라 작업을 완료하는 비용을 낮추는 것이라고 언급했는데, 이는 MiMo의 2단계 구조가 택한 것과 같은 트레이드오프입니다.
이 발표들 중 어느 것도 조율된 것이 아니었지만 모두 같은 방향을 가리켰습니다. 올가을 중국 AI의 경쟁 질문은 프런티어급 모델이 존재하는지가 아닙니다. 얼마나 많은 부분을 손에 쥘 수 있느냐입니다.
벤치마크에 붙는 단서
46 같은 숫자는 전적으로 그 뒤에 있는 지수에 달려 있으며, Artificial Analysis의 인텔리전스 지수는 여러 종합 지수 중 하나일 뿐입니다. Claude Opus 5, GPT-5.6 Sol과의 비교는 샤오미가, 샤오미가 고른 벤치마크로 한 것이며, ‘대부분의 에이전트 벤치마크’라는 표현은 결과 표가 더 잘해낼 일을 대신하고 있습니다. 특히 에이전트 벤치마크는 스캐폴딩에 민감합니다. 같은 모델도 무엇이 둘러싸고 있느냐에 따라 점수가 크게 달라질 수 있습니다.
이 주장을 마케팅 이상으로 만들어 주는 것은 다운로드입니다. 46을 의심하는 사람은 누구든 모델을 실행하고, 보고서를 읽고, 샤오미가 내놓은 환경에서 다시 학습시킬 수 있습니다. 이는 리더보드 스크린샷보다 더 어려운 시험이며, 회사가 결과와 함께 레시피를 공개하기로 선택했기 때문에만 가능한 일입니다.
관련 글
화웨이 클라우드, 에이전트 중심으로 스택을 재구축하고 청구서에 날짜를 못 박다
모델 역량은 수렴했고, 가치는 이를 둘러싼 요소로 이동했다.
Cadence, 칩 설계에 에이전트를 투입해 5주 검증 주기를 하루로 단축
따라서 에이전트는 하위 엔진을 더 적게가 아니라 더 많이 호출한다.
로블록스 빌드, 6주 만에 9,000개 게임 공개. 흥미로운 숫자는 71
이것은 품질 지표가 아니라 유입 지표로 읽어야 한다.
9월에 두 에이전트가 프로덕션에 투입됐다. 이들이 공통으로 가진 것
9월에 프로덕션과의 접촉에서 살아남은 에이전트는 기존 프로세스에 맞춘 에이전트였다.