유니트리, 6B 휴머노이드 기반 모델을 오픈소스로 공개: 하나의 모델이 손과 발을 동시에 관리, 임바디드 AI가 '직무' 기준으로 계산하기 시작하다

10월 3일, 유니트리 테크놀로지(宇树科技)가 GitHub와 Hugging Face에 차세대 범용 휴머노이드 로봇 기반 모델 UnifoLM-WLA-1.0을 공개했다. 파라미터 규모는 60억 개이며, 약 2,500시간의 실제 로봇 데이터로 파인튜닝했다. 이 소식은 중국 국내 로봇 업계에 그리 늦지 않게 퍼졌지만, 가장 쉽게 지나치기 쉬운 점은 '손을 쓰는 일'과 '걷는 일'을 하나의 모델에 밀어 넣었다는 것이다.
지난 1년간 휴머노이드 로봇의 하이라이트 순간은 대부분 시연 영상에 머물렀다. 공중제비를 돌고, 춤을 추고, 물 한 잔을 나르는 것. 하지만 실제로 공장과 매장, 가정에 들어가려면 시험 문제가 달라진다. 개별 동작이 얼마나 인상적인지는 별개의 문제이고, 하나의 모델이 탁자 위의 정밀 조작과 전신 이동 작업을 동시에 감당할 수 있느냐는 또 다른 문제다. 이번에 유니트리가 제시한 숫자는 64개 태스크로, 그중 전신 태스크 10개, 데스크톱 태스크 54개이며, 평행 그리퍼와 서로 다른 두 가지 구조의 덱스터러스 핸드를 동시에 지원한다.
기술 스택의 노선도 한번 볼 만하다. Qwen3-VL 기반의 임바디드 추론기를 출발점으로 삼고, 옵티컬 플로우와 VQ-VAE 기반의 미래 동적 영역 예측, 잔차 VQ 동작 이산화를 얹은 뒤, 마지막으로 MMDiT 동작 전문가 모듈을 연결한다. 어렵지 않게 풀어 말하자면, 먼저 모델이 화면에서 다음에 무슨 일이 일어날지 읽게 하고, '해야 할 동작'을 재사용 가능한 블록 단위로 쪼갠 다음, 마지막으로 실행을 담당하는 모듈이 이를 조립하게 하는 것이다.

왜 '하나의 모델이 손과 발을 관리한다'는 것이 분수령인가
임바디드 AI의 엔지니어링 실무에서 손과 발은 오랫동안 별개의 팀이었다. 파지, 삽입, 나사 조이기는 고빈도·소폭 동작으로 정밀도와 힘 제어에 대한 요구가 높다. 반면 보행, 회전, 오르막과 내리막은 저빈도·대폭 동작으로 균형과 지형을 다뤄야 한다. 둘을 서로 다른 모델로 쪼개면 각 경로를 극한까지 튜닝할 수 있다는 장점이 있지만, 전환할 때마다 상태를 넘겨줘야 하고 그때마다 정보가 유실되거나 지연이 늘어날 수 있다는 대가를 치른다.
유니트리가 64개 태스크를 하나의 6B 모델에 압축한 것은 본질적으로 '통합 표현'의 이득이 개별 최적화의 이득보다 크다는 데 걸고 있는 것이다. 이 베팅은 범용 GPU 위에서는 결코 저렴하지 않지만, 로봇 위에서는 의미가 있다. 실제 기기에 배포할 때는 메모리, 연산력, 전력 소모에 모두 하드 제약이 걸리므로, 모델을 한 세트 덜 쓰면 그만큼 비용이 줄어든다.
유니트리만 밀고 있는 게 아니다
10월 전후의 몇 가지 일을 연결해 보면, 이것이 고립된 한 번의 발표가 아니라는 것을 알 수 있다.
베이징 지위안(智源) 연구원은 9월 29일 RoboBrain-X0를 오픈소스로 공개하며, 대규모 모델의 능력을 로봇의 인지와 동작 제어로 확장했다. 임바디드 AI 오픈소스 프로젝트는 그동안 대부분 시뮬레이션 환경과 데이터셋 수준에 머물렀는데, 동작 정책을 직접 겨냥하는 모델이 등장했다는 것은 이 노선이 논문에서 재현 가능한 엔지니어링 자산으로 넘어가고 있음을 보여준다.
10월 4일, 저장성 항저우의 딥로보틱스(云深处科技) 휴머노이드 로봇 여러 대가 거리로 나와 교차로 교통 정리, 질서 유지, 관광객 안내를 테스트했다. 테스트 장소는 전시 부스가 아니라 실제 교차로였고, 비 오는 날에도 주행했다. 이런 테스트의 가치는 동작이 얼마나 매끄러운지가 아니라, 휴머노이드 로봇을 자기에게 길을 비켜주지 않는 실제 환경에 집어넣는 데 있다.
더 거슬러 올라가면, 싱가포르국립대학, 칭화대학, 베이징대학 등 7개 대학이 세계-동작 모델 기반 OpenWAM을 공동 오픈소스로 공개했다. 이것이 해결하려는 것은 시뮬레이션과 실제 기기 사이의 오래된 균열이다. 전통적인 시뮬레이터는 물리와 시각을 따로 계산하는 경우가 많았는데, OpenWAM은 모델이 데이터로부터 '동작이 세계를 어떻게 바꾸는가'를 직접 학습하고, 이를 근거로 물체 위치, 장면 의미, 태스크 상태를 예측하게 한다. 공식 README는 약 640GB의 학습 데이터를 권장하며, 포지셔닝은 연구 인프라이지 바로 쓸 수 있는 제품은 아니다.
'움직일 수 있느냐'에서 '일할 수 있느냐'로
임바디드 AI의 서사가 궤도를 바꾸고 있다. 지난 2년간은 로봇 본체가 걸을 수 있는지, 동작이 충분히 멋진지를 겨뤘다면, 이제는 로봇 한 대가 몇 시간 연속으로 문제없이 일할 수 있는지를 겨룬다.
이 전환에는 아주 실질적인 지표가 있다. 바로 두 번의 인간 개입 사이의 평균 시간이다. 한 제조사가 공개한 '신뢰성 산술'이 있다. 세탁 한 사이클은 약 79개의 하위 태스크로 이어지는데, 각 단계의 성공률을 95%로 잡으면 무인 개입 없이 한 바퀴를 완주할 확률은 약 1.7%에 불과하다. 각 하위 태스크의 95%만 보면 이미 높지만, 곱해지는 순간 무너진다. 그래서 업계는 최적화 목표를 단일 태스크 성공률에서 전체 워크플로가 얼마나 버티는지로 바꾸기 시작했다.
이번에 유니트리가 오픈소스로 공개한 6B 기반 모델의 가치도 여기에 있다. 그 의의는 재현 가능한 공통 출발점을 제공한다는 데 있다. 이후 개발자들은 이 베이스 위에서 파인튜닝을 하고, 하드웨어를 바꾸고, 태스크를 추가할 수 있으며, 데이터를 처음부터 모을 필요가 없다. 임바디드 AI의 경쟁은 '움직일 수 있는 본체를 만드는 것'에서 '두뇌가 하드웨어와 태스크를 넘나들며 재사용될 수 있는가'로 옮겨가고 있다.
글을 마치며
60억 파라미터의 휴머노이드 기반 모델을 오픈소스로 공개하는 일은 단기적으로 상업적 보상을 보기 어렵고, 데이터 비용도 부담으로 남는다. 하지만 그것이 해결하는 것은 더 근본적인 일이다. 연구자와 개발자가 서로 기준을 맞출 수 있는 지점을 만들어 준다는 것.
로봇이라는 일에서 최종적으로 통과해야 할 관문은 공장과 매장에서의 그 수천 시간이며, 발표회라는 관문은 서막에 불과하다. '지속적으로 쓸 수 있음'을 실제로 만들어낸 쪽만이 진짜로 판에 들어온 것이다.
업계에 남는 관전 포인트는 아주 구체적이다. 이번 공개가 얼마나 높은 재현율을 보이는지, 실제 프로젝트에서 반복 개선 속도가 얼마나 빠른지, 그리고 반년 뒤에도 얼마나 많은 사람이 그 위에 개선을 제출하고 있는지. 발표 당일의 흥분은 사라지고, 남는 것은 여전히 쓰이고 있는 코드뿐이다.
관련 글
제8순회항소법원, 미네소타 AI 누드화 금지법 일시 중단. 진짜 싸움은 누가 책임을 지는가다.
이번 결정은 해당 법률이 위헌이라는 판단이 아니다. 항소심 계류 중 집행을 잠시 멈춘 것이다.
캘리포니아, 하루에 AI 법안 13개 서명. SB 1000은 백만 사용자 임계값을 삭제했다
너무 작아서 규제받지 않을 것이라 가정했던 한 부류의 스타트업에게, 그 가정은 방금 끝났습니다.
세 회사가 하루 만에 MiniMax H3 기반 비디오 제품을 만들었다. 라이선스는 미국을 제외한다.
미국 기업이 미국 기업 고객에게 판매하는 제품이, 라이선스가 미국을 제외하는 가중치 위에 구축되어 있다는 것은 MiniMax의 성명 한 번이면 정리될 질문이다.
Claude Sonnet 5.5는 30% 더 저렴합니다. 그것은 조달 이야기이지 모델 이야기가 아닙니다.
벤더의 할인 주장은 대개 대표 워크로드를 기준으로 측정되며, 여러분의 워크로드는 대표적이지 않습니다.