← 블로그로
Ai약 13 분 읽기

사진 한 장, 걸어 다닐 수 있는 세계: InSpatio-World 1.5가 이미지를 공간으로 바꾸다

게시일 2026년 10월 3일
사진 한 장, 걸어 다닐 수 있는 세계: InSpatio-World 1.5가 이미지를 공간으로 바꾸다

대부분의 이미지·영상 모델은 고정된 프레임이나 고정된 클립을 내놓습니다. 보는 사람은 모델이 보여주기로 결정한 것만 보게 되죠. InSpatio라는 중국 기업이 이번 달 공개한 모델은 사진 한 장, 파노라마, 또는 기존 영상 하나를 받아서 걸어 다닐 수 있는 공간으로 바꿔줍니다.

InSpatio-World 1.5는 9월 말 상하이 국제 시청각 예술 카니발에서 공개됐고, 회사는 코드를 Apache 2.0 라이선스로 오픈소스화했습니다. 무엇이 다른지 가장 명확하게 보여주는 건 데모 영상입니다. 영상은 중국 궁궐의 지붕이 있는 복도 안에서 시작합니다. 카메라가 앞으로 밀고 나가 난간과 계단을 지나 안뜰로 들어섭니다. 시점이 움직이면서 기둥 뒤에 가려져 있던 정자가 모습을 드러냅니다. 이 모델이 만든 것은 선택된 카메라 경로를 따라가는 클립이 아니라, 계속 탐험할수록 계속 렌더링되는 공간입니다.

밝은 빛이 들어오는 출입구 쪽으로 이어지는 안개 낀 돌기둥 복도

이번 버전에서 달라진 세 가지

첫째는 모델이 입력으로 받아들이는 대상입니다. 초기 월드 모델은 대부분 이미지 한 장을 원했습니다. 버전 1.5는 이미지 한 장, 여러 장의 이미지, 파노라마, 또는 영상을 받습니다. 이게 중요한 이유는 진입점을 정하기 때문입니다. 사진 한 장은 소비자용 출발점입니다. 여러 장의 이미지 세트와 기존 영상은 영화나 광고 팀이 이미 손에 들고 있는 것이고, 이를 받아들이면 도구를 쓸 수 있는 사람이 넓어집니다.

둘째는 실시간 탐험입니다. 생성된 공간 안에 들어가면 시점을 계속 움직이고, 가려진 부분을 우회하고, 초기 프레임에 없던 영역까지 도달할 수 있습니다. 시점이 바뀔 때마다 모델은 이전에 보이지 않던 장면 부분을 채워 넣어야 하고, 이미 본 것과 일관되게 해야 합니다. 이는 그럴듯한 클립을 생성하는 것보다 어려운 문제입니다. 모델이 그림의 연속이 아니라 장소에 대한 정신적 모델을 유지하도록 요구받기 때문입니다.

셋째는 시공간 일관성으로, 월드 모델과 영상 생성기를 가르는 진짜 경계선입니다. 카메라가 방을 나갔다가 다시 들어와도 방이 스스로 재배치되어 있어서는 안 됩니다. InSpatio는 1.5에서 이를 강화해 더 긴 탐험 경로와 더 복잡한 장면을 지원한다고 말하며, 데모는 새로운 각도에서 여러 번 같은 영역을 다시 방문함으로써 그 주장에 기대고 있습니다.

데모 뒤의 숫자들

InSpatio는 이 모델을 13억 개 파라미터의 콤팩트한 모델이라고 설명하며, WorldScore-Dynamic에서 68.72점을 기록해 평가된 실시간 인터랙티브 방식 중 1위라고 주장합니다. 최대 초당 24프레임입니다. 이는 회사 자체 수치이고 독립적인 재현은 아직 드물기 때문에, 확정된 결과라기보다 출발점으로 봐야 합니다.

기술적 접근에는 언급할 만한 몇 가지 요소가 있습니다. 영상 입력의 경우 파이프라인은 Depth Anything 3를 사용해 누락된 깊이와 프레임별 카메라 내부·외부 파라미터를 추정하는데, 이것이 3D 캡처로 촬영되지 않은 영상에서 장면을 재구성할 수 있게 해줍니다. 시공간 자기회귀 과정은 시점이 바뀌어도 지속적인 세계 상태를 유지하며, 매번 장면을 처음부터 다시 생성하지 않습니다.

걸어 다닐 수 있는 장면이 진가를 발휘하는 곳

가장 즉각적인 용도는 데모가 가리키는 것입니다. 영화와 광고에서 카메라 위치는 보통 촬영하는 순간 고정됩니다. 다른 각도를 원하면 다시 찍어야 하고, 재촬영은 비쌉니다. 월드 모델을 쓰면 팀이 사후에 카메라 위치를 계속 찾아볼 수 있고, 이미 존재하는 영상에서 커버리지를 뽑아낼 수 있습니다. InSpatio는 광고의 불릿타임을 직접적인 예로 듭니다. 피사체 주위에 카메라 리그를 동기화하는 대신, 이미지 세트를 입력하고 같은 피사체를 중심으로 새로운 카메라 경로를 설계하는 것입니다.

두 번째 용도는 로봇용 학습 데이터입니다. 임베디드 AI의 문제 중 하나는 인터넷이 제공하는 대부분의 영상이 3인칭으로 촬영된 반면, 로봇은 세계를 1인칭으로 본다는 점입니다. InSpatio는 이 모델이 어떤 작업의 3인칭 영상을 받아 로봇이 지각할 법한 1인칭 시점에 더 가까운 뷰를 예측할 수 있고, 가림 관계가 바뀐 상태에서 같은 과정을 다른 방향에서 다시 관찰할 수 있다고 말합니다. 이것이 규모 있게 작동한다면, 모든 환경에 대해 새 영상을 촬영하지 않고도 사용 가능한 영상을 로봇 학습 자료로 바꾸는 방법이 됩니다.

그 외에도 회사는 관광 및 문화 체험, 디지털 트윈과 산업 시뮬레이션을 가리키고 있습니다. 공간처럼 작동하는 공간이 공간처럼 보이는 그림보다 더 유용한 분야들입니다.

붐비는 경쟁, 승리의 정의는 제각각

InSpatio만 이걸 좇는 게 아니고, 경쟁 접근법들은 월드 모델이 대체 무엇을 위한 것인지에 대해서도 의견이 갈립니다. 일부 연구소는 시네마틱 결과물에 최적화해, 하나의 서사적 카메라 무브로 아름답고 일관된 1분 분량의 영상을 생성합니다. 다른 곳은 상호작용성을 추구하며, 고정된 경로 없이 자유롭게 움직이고 장면이 반응하는 능력을 우선시합니다. 게임에 더 가까운 세 번째 진영은 세계를 탐험 가능한 장소로 메모리에 담아두는 실시간 엔진을 원합니다.

이 목표들은 서로 다른 방향으로 당깁니다. 시네마틱 품질에 맞춰진 월드 모델은 미리 정해진 시퀀스에 연산을 쏟아 모든 프레임을 제대로 보이게 할 여유가 있습니다. 상호작용에 맞춰진 모델은 사용자가 다음에 보는 무엇이든 렌더링해야 하므로 속도와, 임의의 이동에도 살아남는 장면 기억 쪽으로 밀립니다. InSpatio-World 1.5는 분명히 인터랙티브 진영에 있고, 13억 파라미터의 작은 모델을 선택한 것은 정지 프레임 미인대회에서 이기는 것보다 실시간성을 유지하는 게 더 중요하다는 베팅입니다.

구매자에게 중요한 비교는 다른 탐험 가능한 시스템과의 비교인데, 이 분야는 아직 대부분의 주장이 자기 보고로 이뤄질 만큼 초기 단계입니다. WorldScore-Dynamic 같은 벤치마크는 까다로운 부분, 즉 세계가 이동하는 동안 일관성을 유지하는지를 수치화하려 하지만, 벤치마크는 설계자가 측정하기로 선택한 것만 측정합니다. 긴 탐험에서의 일관성, 원본 사진에 대한 충실도, 프레임 레이트는 모두 서로 상충하며, 모든 시스템은 서로 다른 트레이드오프를 선택할 것입니다.

오픈 릴리스를 지켜봐야 하는 진짜 이유가 바로 이것입니다. 수십 명의 연구자가 각자의 입력으로 모델을 스트레스 테스트하면, 어디서 버티고 어디서 깨지는지에 대한 그림이 출시 데모보다 훨씬 유용할 것이고, 나머지 분야가 경쟁하는 하이라이트 영상이 아니라 공유된 토대 위에서 접근법을 비교할 수 있게 해줄 것입니다.

오픈소스화가 전략이지 공짜 배포가 아닌 이유

InSpatio는 모델과 함께 코드를 공개했고, 초청 테스트용 새 Topos-Pro 1.0을 예고하고 있습니다. 그 논리는 공간 지능 전반에서 나타나는 것입니다. 유용한 애플리케이션은 영화, 관광, 로봇, 디지털 트윈에 흩어져 있고, 어느 한 회사도 그것들을 전부 커버할 수 없습니다. 기본 역량을 공개하면 연구자가 한계를 검증하고 파트너가 그 위에 버티컬 레이어를 구축할 수 있습니다. 건물 전체가 아니라 1층이 되려는 방법입니다.

위험은 이른 오픈 릴리스에서 흔히 있는 것입니다. 데모는 인상적이고 벤치마크는 자기 보고이며, 통제된 데모와 지저분한 실제 입력에서도 견디는 도구 사이의 격차는 종종 큽니다. 독립 연구자와 창작자가 코드를 손에 넣는 앞으로 몇 달이, 약속의 어느 부분이 다른 사람들의 데이터와 접촉한 뒤에도 살아남는지를 보여줄 것입니다.

관련 글