바퀴 달린 세미휴머노이드, 도움 없이 한 시간 동안 세탁 마쳐

Dyna Robotics가 새 로봇과 이를 구동하는 시스템을 공개했으며, 시연은 의도적으로 화려함과 거리가 멀다. 호텔 세탁 작업 한 시간을 단 한 번의 연속 촬영으로 담았다.
이 로봇의 이름은 타쿠(Taku)로, 장인을 뜻하는 일본어 '타쿠미(takumi)'에서 따왔다. 사람 형태의 상체와 7자유도 팔 두 개에 접이식 하부 구조를 결합했으며, 전체가 조향 가능한 바퀴 네 개에 장착된다. 소프트웨어는 회사가 '물리적 에이전트'라고 부르는 Dyna-2.1로, 단일 조작 작업이 아니라 전체 워크플로를 위해 만들어졌다.
영상에서 타쿠는 세탁기, 건조기, 개는 작업대, 선반 사이를 오간다. 기계에 세탁물을 넣고 작동시키며, 꺼내고, 수건을 가져와 개고 분류한 뒤 결과물을 쌓는다. 파지에 실패하거나, 수건 두 장을 한꺼번에 집거나, 기계 제어 장치에서 벗어나게 되더라도 사람의 도움을 요청하지 않고 스스로 복구한다. Dyna는 세탁 한 주기가 약 79개의 개별 단계로 이루어진다고 추정한다.

내부를 이루는 세 계층
이 아키텍처는 작업을 세 부분으로 나누는데, 이 분할이 흥미로운 엔지니어링 포인트다.
최상위에는 비전-언어 오케스트레이터가 워크플로를 관찰하고, 지금까지 일어난 일을 텍스트 기반 기억으로 유지하며, 다음에 무엇을 할지 결정한다. 중간에는 Dyna의 월드-액션 모델 개선 버전이 전신 움직임 목표를 생성한다. 최하위에는 NVIDIA Isaac Sim에서 수천 대의 시뮬레이션 로봇을 대상으로 강화학습으로 훈련된 전신 컨트롤러가 이 목표를 100헤르츠로 관절 및 바퀴 명령으로 변환한다.
이 계층 분리가 중요한 이유는 '결정'과 '실행'을 분리하기 때문이다. 오케스트레이터는 언어로 작업을 추론하며, 이는 유연하고 바꾸기 쉽다. 컨트롤러는 어떤 추론 모델도 따라올 수 없는 속도로 저수준의 물리적 현실을 처리한다. 둘 중 어느 쪽도 상대방의 일을 잘할 필요가 없다.
100만 시간의 영상
훈련 데이터는 이 야심을 설명해 주는 부분이다. Dyna에 따르면 사람과 로봇의 움직임을 동일한 형식으로 표현하는 공유 표현을 통해 설명되는, 인간 영상과 자사 로봇 군집에서 가져온 100만 시간의 인간 및 로봇 데이터로 정책을 사전학습했다. 데이터셋은 4,300만 에피소드로 보고되며, 단순한 프레임별 접근보다 저장 공간을 훨씬 작게 만들고 샘플 읽기를 몇 배 더 빠르게 하는 컨테이너에 저장되었다.
훈련 신호의 대부분으로 인간 영상을 사용하는 것은 일반적인 물리적 능력을 행동만이 아니라 관찰을 통해서도 학습할 수 있다는 베팅이다. 로봇 군집만으로는 다양한 현실 경험 100만 시간을 축적하기에 시간이 너무 오래 걸린다. 인간 영상은 풍부하며, 공유 표현은 모델이 사람에게서 본 패턴을 다른 신체를 가진 기계로 전이할 수 있게 해준다.
Dyna는 또한 다리보다 바퀴를 택했는데, 그 이유는 상쾌할 만큼 실용적이다. 목표로 삼은 워크플로는 작업대 사이를 이동하고, 기계 안으로 손을 뻗고, 테이블 높이, 낮은 선반 아래, 머리 위까지 닿아야 한다. 사람처럼 걷는 것은 목록에 없다. 다리는 이 작업에 필요 없는 능력을 위해 비용과 복잡성을 더할 뿐이다.
바뀐 측정 지표
이번 발표에서 가장 많은 것을 말해주는 세부 사항은 Dyna가 무엇을 측정하기로 했는가이다. 개별 작업의 성공률을 보고하는 대신, 회사는 개입 간 평균 시간(MTBI), 즉 사람이 개입해야 하기 전까지 로봇이 작동하는 시간을 최적화했다.
이는 더 어렵고 더 정직한 목표다. 개별 작업은 높은 성공률을 보여도 워크플로는 여전히 실패할 수 있는데, 여러 단계를 연결하면 실패가 누적되기 때문이다. 파지 성공률이 95퍼센트인 로봇도 79단계를 거치면 곧 문제에 부딪힌다. MTBI는 운영자가 실제로 신경 쓰는 것, 즉 기계를 얼마나 오래 혼자 둘 수 있는지를 측정한다.
목표 고객은 연구실이 아니다. Dyna는 서비스형 로봇(RaaS) 모델을 운영하며, 하드웨어, 소프트웨어, 유지보수, 모델 업데이트를 묶어 로봇당 월 요금을 부과한다. 이는 큰 자본 지출을 운영비로 바꾸며, 회사가 공략하는 소규모 사업체에 중요하다. 또한 Dyna에 실제 배포 현장에서 나오는 지속적인 훈련 데이터를 제공한다. 창업자들은 하드웨어가 의도적으로 저렴해서 수십만 달러가 아니라 수만 달러 수준이라고 강조해 왔다.
왜 세탁이 합리적인 시작점인가
세탁을 대표 시연으로 선택한 것은 겉보기보다 영리하다. 호텔 세탁은 반복적이고 물량이 많으며, 인력 이직률이 실제 비용이 될 만큼 불쾌한 작업이다. 또한 고정된 방에서 협조적인 기계, 한정된 객체, 예측 가능한 순서로 이루어진다. 이는 예컨대 어질러진 주방이나 공공 거리보다 훨씬 친화적인 환경이다.
좁은 범위라는 점이 핵심이다. 한 가지 지루한 일을 한 통제된 환경에서 안정적으로 할 수 있는 로봇은, 어디서나 예측 불가능하게 실패하는 범용 로봇보다 오늘날 훨씬 가치 있다. 세탁이 성공하면 같은 아키텍처를 유사한 속성을 가진 다른 제한적 워크플로, 예를 들어 설거지, 리넨 처리, 단순 창고 분류 등에 겨냥할 수 있다. 각각은 그 자체로 사업이며, 모두 같은 데이터 엔진에 공급된다.
주장이 끝나고 현실이 시작되는 지점
이 시연은 독립적인 평가가 아니라 회사 영상이며, 배포 관련 주장은 주의 깊게 읽을 필요가 있다. 보도자료는 Dyna-2.1이 호텔, 세탁소, 레스토랑에 배포되고 있다고 말한다. 더 자세한 연구 게시물은 시스템을 실제 고객 현장에 가져가는 것을 다음 이정표로 설정한다. 타쿠를 운영 중인 고객은 공개적으로 밝혀지지 않았고, 상업적 배포에서 나온 개입 데이터도 공개되지 않았다.
출시 발표와 기술 보고서 사이의 이런 간극은 로보틱스에서 흔하며, 진실은 대개 그곳에 있다. 한 시간 분량의 무편집 영상은 실제 성과다. 동시에 이는 큐레이션된 환경이며, 호텔 세탁은 대부분의 환경보다 더 친화적인 현장이다.
Dyna는 이전에 더 좁은 작업을 위한 로봇을 배포했으며, 그중에는 레스토랑 체인 딘타이펑(Din Tai Fung)과 함께한 냅킨 접기 시범도 있었다. 또한 2025년에는 NVIDIA의 벤처 부문과 아마존의 산업 혁신 펀드 등의 후원으로 1억 2,000만 달러를 조달했다. 회사 자체 설명에 따르면 다음 이정표는 새 시스템을 고객 현장에 투입하고, 그곳에서 일어나는 일을 개선에 활용하는 것이다.
이 사례를 주목할 만한 이유
로보틱스 시연은 만들기는 쉽지만 믿기는 어렵다. 진지한 시스템과 잘 다듬어진 영상을 구분하는 것은 대개 화려하지 않다. 얼마나 우아하게 실패하는지, 얼마나 드물게 도움을 필요로 하는지, 그리고 실험실이 아니라 고객 현장에서 경제성이 성립하는지 여부다.
Dyna가 개입 간 평균 시간을 측정하기로 한 선택, 대규모 인간 영상 활용, 실제 작업을 위한 저렴한 바퀴형 몸체를 만들기로 한 결정은 모두 데모 영상이 아니라 배포에 최적화하는 팀의 신호다. 그 어느 것도 주장을 입증하지는 않는다. 다만 회사가 어려운 부분이 무엇인지 알고 있다는 점은 시사한다.
당신의 심부름을 끝내줄 로봇은 아직 멀었다. 특정하고 지루한 다단계 워크플로를 감독 없이 한 시간 동안 실행할 수 있는 로봇은 훨씬 작은 주장이며, 타쿠가 고객 현장에서 이를 안정적으로 해낼 수 있다면 의미 있는 주장이 된다. 세탁실은 하나의 시험대다. 흥미로운 질문은 그곳을 떠난 뒤 무슨 일이 일어나느냐이다.
관련 글
Agility Digit 5, 단순한 스펙 시트가 아닌 안전성 입증 자료와 함께 출시되다
창고 현장은 실험실이 아니다. 관문은 인증이지 데모가 아니다.
프론티어 에이전트가 연구 워크플로의 30퍼센트를 완료했다. 그 숫자가 핵심이다.
에이전트는 연구를 운영할 수 있다. 절차를 새로 고안하는 일은 아직 요원하다.
Figure AI, 판매할 제품도 없이 35억 달러어치 컴퓨팅을 확보하다
베팅의 핵심은 일반화가 컴퓨팅 문제라는 것이다. 업계는 아직 결론을 내리지 못했다.
OpenAI, 마침내 이미지 API에 투명 배경 추가
파이프라인에서 한 단계를 통째로 없애는 작은 기능.