← 블로그로
Ai약 12 분 읽기

위성 사진이 이제 로봇 훈련 데이터가 되다

게시일 2026년 10월 7일
위성 사진이 이제 로봇 훈련 데이터가 되다

기계에게 새로운 장소를 가르치는 가장 빠른 방법은 그곳으로 직접 몰고 가는 것이 아닐지도 모른다. 이번 달 발표된 두 가지 소식은 서로 반대 방향에서 같은 아이디어를 가리킨다. 하나는 위성 영상을 시뮬레이션 작업 현장으로 바꿔 로봇이 도착하기 전에 미리 연습할 수 있게 한다. 다른 하나는 비디오 월드 모델 아래에 깔린 기하 구조를 바로잡아, 로봇이 상상하는 것이 실제 사물의 위치와 일치하도록 만든다.

농기계와 광산 장비용 자율주행 소프트웨어를 만드는 Bonsai Robotics는 10월 2일 Bonsai World를 공개했다. 이 시스템은 농장, 광산 현장 또는 기타 거친 지형의 위성 영상에서 출발해 그 평면적인 시야를 구조화된 3D 시뮬레이션으로 바꾼다. 그러면 기계는 그 안에서 실제 경로를 리허설할 수 있다. 회사 측은 먼지, 파편, 동물, 차량, 움직이는 지면 등 장비가 물리적으로 마주친 적 없는 조건까지 겹쳐 넣을 수 있다고 말한다.

이를 뒷받침하는 컴퓨팅은 여러 벤더를 아우르는 스택이다. 구글의 Gemini 비전 모델이 위성 이미지를 읽어 구조화된 지도를 만든다. 100만 에이커 이상에서 수집된 5천만 개 이상의 실세계 샘플로 추가 학습된 Bonsai 자체 월드 모델이 지면 수준의 뷰를 생성한다. 학습은 Nvidia A100 GPU를 탑재한 Google A2 가상 머신에서 돌아가고, 온디맨드 환경 생성은 RTX PRO 6000 Blackwell 서버 GPU를 탑재한 Google G4 머신을 사용한다. 그 밑단에는 Nvidia의 Cosmos 모델이 자리한다.

상업적 논점은 도입 시간에 있다. 새로운 작물, 새로운 기계, 새로운 현장에서 자율주행 소프트웨어를 작동시키려면 보통 현장 데이터를 수집하고 위치를 반복 조정해야 하는데, 이는 느리고 비싸다. 시스템이 그럴듯한 재구성을 먼저 상대로 리허설할 수 있다면, 기계는 더 완성에 가까운 상태로 도착한다. Bonsai는 이 접근이 현장 수집을 대체하는 것이 아니라 줄여준다고 말하는데, 이는 주장의 정직한 버전이다.

아무도 보지 못하는 기하학 문제

영상으로부터의 시뮬레이션은 그것이 만들어내는 3D가 진실할 때만 작동한다. 바로 이 지점에서 이번 달 arXiv에 게재된 논문이 흥미로워진다. 체코기술대학교(CTU)와 Inria의 연구팀이 CoRL(Conference on Robot Learning)에 채택된 DepthWorld를 공개했는데, 이 논문은 수많은 데모의 발목을 잡는 사실 하나를 인정하는 것에서 시작한다. 현재의 비디오 월드 모델은 RGB만으로 학습되며, 프레임 단위로는 그럴듯해 보이는 롤아웃을 만들어내지만 일관된 3D 세계로 조합되지는 않는다는 것이다.

이 실패는 상상하기 쉽다. RGB만 쓰는 월드 모델에 열린 옷장이 있는 장면을 주면, 열린 문과 단단한 표면을 구분하지 못해 로봇 팔이 빈 공간에 충돌하는 상황을 시뮬레이션한다. 이 모델로 정책을 평가한다면 이런 종류의 오류는 쓸모없는 것을 넘어 해로운 신호를 만든다. 실제 실패처럼 보이지만 실제 실패가 아니기 때문이다.

연구팀의 첫 번째 해법은 데이터다. 그들은 학습된 스테레오 깊이와 결합 팩터 그래프(joint factor graph)를 결합한 캘리브레이션 파이프라인을 구축해, 동일한 물리적 로봇에서 수집된 모든 에피소드를 모음으로써 각 장면의 카메라 외부 파라미터와 함께 그 로봇의 공통 기구학을 복원할 수 있게 했다. 가장 큰 공개 원격조작 데이터셋인 DROID에 적용한 결과 DROID-3D가 만들어졌다. 7만 개 이상의 에피소드에 걸쳐 조밀한 미터법 깊이와 재보정된 다시점 외부 파라미터를 제공하며, 외부 카메라의 경우 90퍼센트의 에피소드에서 재투영 오차가 0.7픽셀 미만이다.

두 번째 해법은 아키텍처다. 이미 학습된 시각적·운동 사전 지식을 훼손할 위험이 있는 깊이 추가를 위해 사전학습된 비디오 모델을 재초기화하는 대신, RGB와 깊이를 더 넓은 잠재 그리드에 나란히 타일링하고 위치 임베딩을 그에 맞게 확장한다. 사전학습된 구성 요소는 그대로 둔다. 그 대가는 내가 읽으면서 놀랐던 결과다. 깊이를 두 번째 예측 대상으로 추가하자 동일한 학습 예산에서 RGB 예측 자체가 1.48dB PSNR만큼 개선되었다.

그 숫자가 논문 너머로 중요한 이유

월드 모델은 긴 롤아웃에서도 기하 구조가 유지될 때만 계획에 유용하며, 여기서 Nvidia의 PointWorld와의 비교가 흥미로워진다. PointWorld는 짧은 지평선에서 움직이는 물체에 대해 더 정확했지만, DepthWorld는 시간이 지나면서 훨씬 덜 나빠졌다. 전체 장면 오차가 8에서 9밀리미터로 늘어난 반면 다른 쪽은 8에서 18로 늘어났다. 몇 분 앞을 계획하는 시스템에서는 출발점보다 곡선의 모양이 더 중요하다.

Bonsai World와 DepthWorld를 나란히 놓으면 하나의 패턴이 드러난다. 피지컬 AI 학습의 병목은 더 이상 컴퓨팅이나 심지어 모델 성능도 아니었다. 그것은 합성 세계의 품질, 구체적으로 그 안의 기하 구조가 미터법적이고, 캘리브레이션되어 있으며, 안정적인지의 문제가 되었다. 이는 모델링 문제이기 전에 데이터 엔지니어링 문제다. DROID-3D의 기여는 아키텍처가 아니라 파이프라인이다. 애초에 그런 것을 갖도록 설계되지 않은 데이터셋에서 밀리미터 정확도의 카메라 자세를 복원하며, 어느 단일 에피소드도 신뢰하는 대신 에피소드들을 모아서 해낸다.

개선되는 것과 그렇지 않은 것

얻는 것은 실질적이지만 범위는 좁다. Bonsai World는 위성 영상을 구할 수 있고 지형이 지배적 변수인 구조화된 야외 환경에서 작동한다. 농업과 노천 광산은 잘 커버한다. 어수선한 주방이나 병원 복도는 잘 커버하지 못하는데, 그런 공간은 궤도에서 보이지 않고 난이도가 지면이 아니라 사물에서 비롯되기 때문이다. 회사 스스로 내세우는 "험준하고 비구조화된 환경"이라는 표현은 시장 설명인 동시에 적용 범위에 대한 선언이다.

DepthWorld는 반대의 한계를 갖는다. 하나의 로봇에서 나온 많은 에피소드가 있고 그들의 캘리브레이션을 모을 수 있을 때 가장 강력한데, 이는 정확히 연구실의 환경이며 하드웨어가 뒤섞인 실제 배치된 플릿에서는 덜 흔하다. 논문 자체의 벤치마크도 단일 공개 데이터셋이다.

또한 짚고 넘어갈 검증 공백도 있다. Bonsai는 발표와 함께 독립적인 현장 성능 측정치나 공개 모델 가중치를 내놓지 않았다. 월드 모델은 누군가 회사 밖에서 테스트하기 전까지는 하나의 주장일 뿐이다. DepthWorld의 코드와 데이터셋은 정반대의 경우다. 게재된 논문, 채택된 학회, 재현 가능한 파이프라인이 있으며, 그래서 아무도 이 특정 모델을 쓰지 않더라도 다른 팀이 자기 월드 모델을 만드는 방식에 영향을 줄 가능성이 크다.

로보틱스 팀이 걱정해야 할 부분

합성 환경이 자율주행 사전 학습의 기본 방식이 된다면, 시뮬레이션의 품질은 여러 배치에 걸친 단일 실패점이 된다. 조명, 지형, 장애물 분포 등 무엇에 관한 것이든 생성기에 배어든 편향은 그것으로 학습된 모든 기계로 전파되며, 그것도 보이지 않게 퍼진다. 실패한 기계는 그 사실을 드러내러 현장에 나가지 못하기 때문이다.

그것이 합성 버전이 그럴듯해 보여도 현실 세계 수집을 일부 루프 안에 남겨야 하는 이유다. 현장 데이터는 그것이 제공하는 사례를 통해서, 그리고 더 중요하게는 시뮬레이터에 가하는 견제를 통해서 값을 한다. 이번 달의 두 발표는 모두 이 지점에서 분야를 앞으로 밀어낸다. 하나는 시뮬레이션 환경을 값싸게 생성함으로써, 다른 하나는 그 안의 기하 구조를 정직하게 만듦으로써. 어느 쪽도 결국 기계를 밖으로 몰고 나가 어떻게 하는지 확인해야 할 필요를 없애주지는 않는다.

관련 글