← 블로그로
Ai약 13 분 읽기

페이-페이 리의 아틀라스, 사진 한 장을 걸어 다닐 수 있는 방으로 바꾸다

게시일 2026년 10월 2일
페이-페이 리의 아틀라스, 사진 한 장을 걸어 다닐 수 있는 방으로 바꾸다

월드랩스는 9월 1일 아틀라스(Atlas)를 얼리 액세스로 공개했다. 페이-페이 리가 공동 창업한 이 회사는 아틀라스를 공간 지능을 위한 옴니 월드 모델이라고 부른다. 시연의 내용은 평범한 휴대폰으로 찍은 방 사진 몇 장을 입력하면 상호작용 가능한 3D 장면이 나온다는 것이다. 그 안에서 가상 카메라를 어디든 움직일 수 있다. 깊이 정보를 읽어낼 수도 있다. 이 기하 구조를 로봇에 넘겨 연습 공간으로 쓸 수도 있다.

리 교수는 수년간 AI의 다음 개척지가 언어가 아니라 물리적 세계라고 주장해 왔다. 그녀가 쓰는 용어는 공간 지능이며, 텍스트와 평면 이미지만으로 학습한 모델은 근본적인 무언가를 놓치고 있다는 것이 그 주장의 핵심이다. 언어 모델은 자신이 볼 수 없는 세계를 묘사한다. 아틀라스는 그 세계를 볼 수 있는 모델을 만들려는 지금까지의 시도 가운데 가장 명확한 사례다.

아틀라스가 하는 일

월드랩스는 아틀라스를 멀티모달 자기회귀 확산 트랜스포머(multimodal autoregressive diffusion transformer)라고 설명한다. 하나의 공간 프레임워크 안에서 텍스트, 이미지, 영상, 3D 데이터를 입력받아 같은 범주 전반을 생성하는 단일 아키텍처다. 출력 범위는 영상 생성기보다 넓다. 카메라를 제어할 수 있는 이미지와 약 1분 분량의 최대 1440p 영상에 더해, 새로운 시점(novel view), 깊이 맵, 포인트 클라우드, 3D 가우시안 스플랫을 생성한다.

이것을 텍스트-투-비디오 모델과 구분 짓는 것은 바로 볼류메트릭(체적) 출력이다. 영상 생성기는 다음 프레임을 예측한다. 사물이 공간 어디에 자리하는지, 카메라가 한 번도 차지한 적 없는 각도에서 장면이 어떻게 보이는지는 반드시 알지 못한다. 아틀라스는 내부에 3D 표현을 담고 있어, 시청자가 그 안을 이동해도 환경이 일관되게 유지된다. 그럴듯한 클립과 탐색 가능한 공간의 차이가 바로 이 모델을 월드 모델이라고 부르는 이유다.

희소한 입력, 일부 시연에서는 휴대폰으로 찍은 영상 몇 프레임만으로도 모델은 그 안에 가상 카메라를 놓을 수 있을 만큼 장면을 재구성한다. 월드랩스는 희소 시점 재구성 오차가 25.3으로, 최고의 전문 모델인 28.7보다 낮다고 밝혔다. 자사가 의뢰한 블라인드 평가에서 사람 평가자들은 요청한 카메라 무브를 얼마나 잘 따르는지를 기준으로 아틀라스를 MiniMax H3보다 75퍼센트, Gemini Omni Flash보다 81퍼센트, Seedance 2.5보다 94퍼센트의 비율로 선호했다.

이는 회사가 직접 수행한 평가에서 나온 자체 수치이며, 이를 분명히 짚어둘 필요가 있다. 아틀라스는 얼리 액세스 단계이므로 파트너 그룹 외부의 누구도 아직 이 수치를 재현할 수 없다.

리얼-투-심, 그리고 로봇이 주목하는 이유

뻔한 상업적 활용 분야는 시각효과(VFX), 게임, 버추얼 프로덕션이다. 영화 제작자는 촬영이 끝난 뒤에도 장면을 연출할 수 있다. 하지만 월드랩스가 강조하는 프레이밍은 로봇공학이다.

이 워크플로를 리얼-투-심(real-to-sim)이라고 부른다. 실제 공간의 영상을 촬영하면 아틀라스가 이를 3D 시뮬레이션으로 변환하고, 로봇은 실제 환경을 운영할 때 드는 비용과 위험 없이 그 안에서 학습하거나 테스트할 수 있다. 창고 통로의 천 가지 변형이 필요한 로봇공학 팀은 통로를 한 번 스캔한 뒤 각각을 촬영하는 대신 변형들을 생성할 수 있다.

이는 좁지만 실제로 존재하는 문제다. 로봇용 학습 데이터는 수집하려면 로봇을 실제로 돌려야 하므로 비싸다. 시뮬레이션은 저렴하지만 보통 누군가 환경을 직접 만들어야 하고, 그 과정은 느리며 실제 장소와 전혀 닮지 않은 경우도 많다. 실제 방을 시뮬레이션 파일로 바꿔주는 모델은 이 두 가지 값비싼 단계를 하나로 합친다. 엔비디아와 AMD가 투자자라는 사실도 이로써 설명된다. 두 회사 모두 학습과 시뮬레이션이 돌아가는 컴퓨팅 파워를 판다.

공개 정보의 문제

야심과 남겨진 기록 사이에는 간극이 있다. 월드랩스는 아틀라스와 함께 연구 논문도, 모델 카드도, 파라미터 수도, 학습 컴퓨팅 규모도 공개하지 않았다. 가격도 일반 출시일도 밝히지 않았다. 잘 문서화된 경쟁자들을 상대로 비교 우위를 주장하는 시스템치고는 이례적인 누락이며, 이 때문에 블라인드 평가 결과를 검증할 방법이 없다.

회의론자들은 더 날카로운 질문을 제기한다. 아틀라스가 정말로 세계를 시뮬레이션하는지, 아니면 그럴듯한 시점(view)을 렌더링하는지 하는 것이다. 이 둘은 서로 다른 능력이며, 물리학에 의존하는 모든 활용 사례에서 이 구분은 중요하다. 새로운 각도에서 방을 렌더링하는 모델은 영화에는 유용하다. 로봇이 걸어 다니며 학습하는 모델이라면 그 안의 물체가 실제 물체처럼 행동해야 하며, 그렇지 않으면 로봇의 정책(policy)은 그 모델 안에서만 통하는 무언가를 배우게 된다.

월드랩스는 아틀라스가 기존 제품인 마블(Marble)의 향후 버전을 구동할 것이라고 말한다. 덕분에 상업적 안착 지점이 있으며, 이는 대부분의 연구 발표보다 나은 조건이다. 다듬어진 데모를 넘어 이 기하 구조가 버텨낼 수 있는지는 얼리 액세스 파트너들이 가장 먼저 알게 될 것이다.

중국의 대응 주자

도시 규모의 야심을 가진 월드 모델은 아틀라스만이 아니다. 9월 10일 중국 지도 기업 암맵(Amap)은 세계 최초의 3D 네이티브 도시 월드 모델이라고 부르는 ABot-Earth 0.7을 공개했다. 위성 이미지나 텍스트 설명을 입력하면 걸어 다닐 수 있는 상호작용형 3D 장면으로 바꿔주며, 행성 규모부터 거리 수준의 랜드마크까지 여러 스케일을 하나의 모델 안에서 생성한다. 암맵은 소비자용 GPU에서 약 10분 만에 킬로미터 규모의 3D 도시 장면을 3D 가우시안 스플래팅 형식으로 만들 수 있으며, 이 기능이 이미 자사의 플라이트 스트리트 뷰(Flight Street View) 제품에서 구동되고 있다고 밝혔다.

두 모델은 같은 아이디어를 반대 방향에서 가리킨다. 아틀라스는 사진 몇 장에서 위로 올라가며 방을 높은 충실도로 재구성한다. ABot-Earth는 위성 데이터에서 아래로 내려가며 도시를 대규모로 생성한다. 둘을 합치면 공간 모델이 아우를 수 있는 범위가 그려지며, 동시에 두 시장이 얼마나 다르게 제품을 내놓는지도 보여준다. 하나는 공개 벤치마크 없는 파트너 프로그램을 통해서고, 다른 하나는 누구나 결과물을 볼 수 있는 소비자 제품에 내장된 형태다.

공간 모델이 아직 증명해야 할 것

이 분야에는 추진력이 있다. 메타의 V-JEPA 2는 100만 시간이 넘는 영상으로 학습됐다. 구글의 Genie 2는 상호작용형 3D 환경을 생성하고, Gemini Robotics는 물리적 공간에서의 추론과 조작을 다룬다. 기하 구조와 원근이 텍스트에서 추론되는 것이 아니라 모델에 내재해야 한다는 리의 주장은 연구 진영의 입장에서 하나의 제품 카테고리로 이동했다.

그중 어느 것도 일관된 기하 구조를 만들어내는 모델이 물리적 공간을 이해하는 모델과 같은 것인지는 결론 내리지 못했다. 재구성은 측정 가능하다. 시뮬레이션은 더 어렵고, 로봇공학이 실제로 필요로 하는 것은 바로 그쪽이다. 아틀라스는 첫 번째에 대해 강력한 근거를 제시한다. 두 번째가 얼마나 함께 따라오는지는 앞으로 1년간의 파트너 결과가 결정할 것이다.

디자이너와 개발자에게 단기적인 영향은 출시 당시의 화려한 표현보다 완만하다. 사진 세 장으로 방을 재구성하고 그 안에서 카메라를 날려볼 수 있게 해주는 도구는 실제로 유용하며, 로봇 안에 들어가기 전에 창작 소프트웨어 안에 먼저 등장할 것이다. 공간 모델이 대다수 사람에게 처음 닿는 방식이 바로 이것이다. 장면을 탐색하는 작업이 아니라 장면을 만드는 작업을 통해서다.

관련 글