← 블로그로
Ai약 12 분 읽기

로봇의 공간 두뇌를 향한 유니트리와 ZDTaichu의 경쟁

게시일 2026년 10월 2일
로봇의 공간 두뇌를 향한 유니트리와 ZDTaichu의 경쟁

로봇은 오래전부터 몸에는 능했다. 휴머노이드는 걷고, 균형을 잡고, 물건을 쥘 수 있다. 로봇이 서툰 부분은 다음에 무엇을 할지 결정하는 부분, 특히 방이 학습 당시의 방이 아닐 때다. 컵 하나를 옮기고, 작업대를 바꾸고, 작업 도중에 로봇에게 일을 넘기면 시연은 무너진다.

9월에 나온 중국의 두 공개 발표가 바로 그 부분을 겨냥했다. 유니트리는 약 2,500시간의 실제 로봇 데이터로 학습한 60억 파라미터 휴머노이드 파운데이션 모델 UnifoLM-WLA-1.0을 선보이며, 임바디드 추론 분야에서 오픈소스 최고 성능(SOTA) 7개를 달성했다고 주장했다. 중국과학원과 우한AI연구원에서 분사한 ZDTaichu는 9월 15일 ZDTaichu5.0-9B를 오픈소스로 공개했다. 90억 파라미터 멀티모달 모델로, 동일 파라미터급 국제 공간 이해 벤치마크 9개 중 8개에서 1위를 차지했다.

둘 다 로봇 자체는 아니다. 둘 다 로봇이 구동되는 두뇌를 만들려는 시도이며, 데모 벽 뒤에 숨겨진 것이 아니라 공개된 결과물이다.

범용성에 건 유니트리의 승부수

유니트리 발표에서 눈에 띄는 숫자는 64다. 단일 모델이 수건 개기와 설거지 정리부터 침대 정리, 쓰레기 버리기, 세탁기 채우기까지 64가지 서로 다른 작업을 조율한다고 주장한다. 이 목록의 핵심은 개별 작업이 아니라, 동일한 가중치가 이 모두를 처리한다는 점이다.

이는 수년간 로보틱스의 핵심 문제였다. 대부분의 시연은 단일 작업, 단일 장면에 과도하게 튜닝되어 있다. 인상적으로 보이지만 전이되지 않는다. 특정 조명 조건에서 수건을 개는 정책은 다른 탁자 위의 다른 색 수건은 개지 못한다. 그런 모델로 로봇 인력을 확장한다는 것은 모든 변형을 일일이 가르쳐야 한다는 뜻이며, 그건 확장이 아니다.

유니트리의 접근법은 UnifoLM-ER-1-4B라는 임바디드 추론 베이스에 기대고 있다. Qwen3-VL-4B 위에 구축했고 500만 개 이상의 임바디드 추론 샘플로 학습했다. 16개 멀티모달 지각·이해 벤치마크 중 7개에서 선두를 달린다. Where2Place와 EmbSpatial 두 공간 테스트에서는 82.0과 88.9를 기록해 GPT-6 Astra의 69.0, 83.3을 앞선다. 폐쇄형 모델과의 구체적 비교라는 점에서, 막연한 우위 주장보다 논쟁하기 쉽다.

유니트리는 모델과 코드, 데이터셋을 모두 공개하겠다고 밝혔다. 중요한 것은 마지막 항목이다. 가중치는 공개했지만 데이터셋이 닫혀 있는 로봇 정책은 재현할 수 없고 사용만 할 수 있다. 데이터를 공개해야 다른 연구실이 주장을 검증하거나 그 위에 쌓을 수 있다.

공간 추론에 건 ZDTaichu의 승부수

ZDTaichu5.0-9B는 지각 측면에서 문제에 접근한다. 텍스트, 단일 이미지, 다중 이미지, 장시간 영상, 임의 해상도를 처리하며, 판매 포인트는 공간 추론이다. 즉 물체가 어디에 있고, 어떻게 관계되며, 시점이 움직일 때 장면이 어떻게 변하는지 이해하는 능력이다.

강조하는 벤치마크 격차는 MindCube-tiny에서 나온다. 78.27점으로 Qwen3.5-9B를 20점 이상, STEP3-VL-10B를 15점 이상 앞선다. 한 시연에서 왼쪽에서 두 번째 은색 상자를 찾으라는 요청에 정확한 좌표를 출력한 반면, 비슷한 크기의 다른 오픈 모델들은 모두 엉뚱한 곳을 가리켰다. 시점 교차 테스트에서는 카메라 각도가 바뀌어도 기준 좌표계를 유지한 모델은 이 모델뿐이었다.

이런 지점이 실제 로봇을 망가뜨리는 실패다. 컵을 인식하는 모델은 그 물체가 무엇인지에 답한 것이다. 손잡이가 어느 쪽을 향하는지, 옆에 내려놓을 공간이 있는지까지 아는 모델은 그것으로 무엇을 할 수 있는지에 답하기 시작한 것이다. 작업이 길어지면 이런 판단이 연쇄해야 한다. 물체 집기, 정체 기억, 용기 열기, 상태 갱신. 한 단계만 놓쳐도 나머지 작업이 어긋난다.

ZDTaichu의 엔지니어링 기법은 적응형 루프 추론이다. 쉬운 질문에는 연산을 적게 쓴다. 공간 변환과 물체 관계처럼 어려운 질문에는 외부 도구 호출 없이 내부 추론을 여러 번 수행해, 대다수를 차지하는 단순 입력에서 토큰 비용이 폭증하지 않게 한다.

이번 발표에서 가장 중요한 부분은 아마도 공개하지 않은 것이 아니라 공개한 것이다. ZDTaichu는 가중치와 함께 사전학습, 지도 미세조정, 강화학습을 아우르는 공간 멀티모달 데이터 생산 파이프라인 전체를 공개했다. 기관과 기업은 이를 재사용해 자체 공장 현장이나 실험실 데이터를 학습 샘플로 바꿀 수 있다. 이는 2년간 오픈 모델 발표를 따라다닌 불만, 즉 가중치는 받지만 레시피가 비공개라 자기 데이터로 적응시킬 수 없다는 문제에 답한다. 이 모델은 베이징, 포산, 칭다오의 임바디드 훈련장에서 가동되고 있다.

같은 격차를 향한 두 갈래 길

두 발표를 나란히 놓으면 차이가 시사하는 바가 크다. 유니트리는 행동 쪽에서 바깥으로 나아간다. 작업을 수행해야 하는 정책을 잡고, 2,500시간의 실제 로봇 동작으로 학습시킨 뒤, 64개 작업에 걸쳐 일반화되는지 측정한다. ZDTaichu는 지각 쪽에서 안으로 들어간다. 장면을 이해해야 하는 멀티모달 모델을 잡고, 공간 벤치마크로 학습시킨 뒤, 시점이 움직여도 기하 구조를 유지하는지 측정한다.

로봇에게는 둘 다 필요하다. 컵이 어디 있는지 알아야 하고, 어떻게 집을지도 알아야 한다. 두 연구소는 같은 격차를 반대쪽 끝에서 공략하고 있으며, 같은 달에 발표했다는 사실은 업계가 그 격차가 무엇인지에 합의했음을 시사한다. 지각이 행동으로 바뀌는 중간 계층, 그리고 8초짜리 작업이 8분짜리로 바뀌는 지점이다.

데이터 문제에서 다시 둘이 갈린다. 유니트리는 수집 비용이 비싸고 희소한 실제 로봇 동작으로 학습했다. ZDTaichu는 데이터 파이프라인과 합성 공간 작업에 기댔는데, 이는 확장 방식이 다르고 위험도 다르다. 모델이 테스트 장면에만 능해지고 거기서 머무를 위험이다. 실제 물류창고와 맞닥뜨려도 살아남는 정책을 어느 쪽이 만들어내느냐에 따라 어느 데이터 소스가 옳은 선택이었는지가 판가름 날 것이다.

업계 맥락

두 발표는 최근 전제를 재편한 분야에 나란히 등장했다. 구글의 Gemini Robotics 2는 '모든 로봇을 위한 하나의 두뇌'를 내세운다. 엔비디아의 짐 팬은 비전-언어-행동 모델은 끝났고 월드 액션 모델이 후계자라고 주장해왔다. 가트너의 9월 중국 AI 트렌드 보고서는 피지컬 AI와 월드 모델을 실험이 아니라 구조적 요구사항이 된 방향으로 꼽았다.

이런 재정의 때문에 대화 점수보다 공간 벤치마크가 더 중요해졌다. 임바디드 AI의 경쟁은 모델이 물리 세계에 대해 얼마나 잘 말하는지에서, 물리 세계에서 행동할 수 있는지로 옮겨갔고 지표도 따라갔다. 좌표 정확도, 시점 일관성, 장면 전반에 걸친 작업 완수가 새로운 점수판이다.

주목할 점

두 발표에 대한 솔직한 단서는 공간 추론에서의 벤치마크 선두가 창고에서 작동하는 로봇과 같지 않다는 점이다. 모델이 테스트 세트에서 물체를 정확히 배치해도, 그리퍼가 걸리거나 조명이 나쁜 실제 로봇 팔에서는 실패할 수 있다. 추론과 행동 사이의 격차는 대부분의 로보틱스 약속이 죽은 곳이다.

이 둘을 주목할 가치가 있는 이유는 오픈 가중치와 오픈 데이터 파이프라인의 조합이다. 유니트리나 ZDTaichu 외부의 연구실이 두 모델 중 하나를 가져다 자체 하드웨어로 재학습시키고 결과를 공개할 수 있다면, 주장은 공개적으로 검증된다. 발표가 벤치마크와 데모에 머무는 동안 경쟁사들이 데이터를 계속 닫아둔다면, 이 분야는 지금까지 있던 곳에 머물 것이다. 인상적인 영상은 넘치는데 화요일에 유용한 일을 하는 로봇은 거의 없는 상태 말이다.

관련 글