← 블로그로
Ai약 12 분 읽기

PixVerse R2, 비디오 생성을 걸어 다닐 수 있는 세계로 바꾸다

게시일 2026년 10월 2일
PixVerse R2, 비디오 생성을 걸어 다닐 수 있는 세계로 바꾸다

대부분의 비디오 생성 도구는 당신에게 같은 것을 요구합니다: 장면을 설명하고, 기다리고, 클립을 받고, 유지할지 결정하는 것입니다. 결과물은 파일입니다. 매번 똑같이 재생됩니다. 다른 결말을 원한다면 다른 프롬프트를 쓰고 처음부터 다시 시작해야 합니다.

PixVerse 비디오 플랫폼을 만든 회사 AIsphere가 9월 23일에 출시한 PixVerse R2는 다른 전제 위에 세워졌습니다. 고정된 클립을 반환하는 대신, 사용자가 상호작용하는 동안 계속 실행되는 연속적인 시청각 세계를 생성합니다. 텍스트나 이미지로 세계를 만들고, WASD 키로 캐릭터를 움직이고, 카메라를 바꾸고, 프롬프트를 입력해 캐릭터를 교체하거나 사물을 추가하거나 환경을 바꿀 수 있습니다. 장면은 다시 시작되지 않습니다. 이전 행동이 지속되고 다음에 일어날 일을 형성합니다.

마지막 세부 사항이 바로 핵심입니다. 대부분의 생성형 비디오에서 각 요청은 독립적입니다. R2에서는 프롬프트가 세계의 상태를 업데이트합니다. 크리에이터 Xiaolongbao가 제작한 데모 인터랙티브 영화 *Zero Mark*에서 생명체에게 선물을 건네면, 어떤 선물을 골랐는지에 따라 결과가 실시간으로 생성됩니다. 드래곤을 건네든 나뭇잎을 건네든 이야기가 갈라집니다. 또 다른 크리에이터 Jade Wu는 많은 상호작용을 거쳐도 일관된 정체성과 기억을 유지하는 실시간 디지털 캐릭터 Eve를 중심으로 한 시퀀스를 만들었습니다.

녹아내리는 지평선 위에 걸려 있는 빛나는 풍경 포털을 향해 초현실적인 평원을 가로질러 걸어가는 외로운 실루엣의 인물

AIsphere는 R2를 범용 실시간 세계 모델이라고 부르며, world.pixverse.video에서 게임, 인터랙티브 영화, 디지털 휴먼을 위한 데모 공간을 열었습니다. R2는 회사가 1월에 소개한 R1의 뒤를 잇습니다.

R2가 깨려는 트레이드오프

실시간 생성은 항상 선택을 강요해 왔습니다. 작고 빠른 모델은 실시간 상호작용을 따라갈 수 있지만 많은 것을 할 수 없습니다. 크고 유능한 모델은 더 나은 프레임을 만들지만 아무것에도 반응하기에는 너무 느립니다. 팀들은 보통 한쪽을 택하고 한계를 받아들여 왔습니다.

R2는 문제를 두 계층으로 나눕니다. 기반은 Omni Causal AR이라고 불리는 인과적 자기회귀 백본으로, 짧은 비디오와 긴 비디오, 멀티모달 참조, 오디오, 액션 제어에 대해 지속적으로 학습됩니다. 이는 모델, 데이터, 작업, 제어 신호, 시간 지평이라는 다섯 차원으로 확장됩니다. 그 위에 동일한 백본을 실시간으로 실행되는 초소수 스텝 버전으로 증류하는 Real-Time Acceleration 계층이 있습니다.

이 구분은 중요합니다. 상호작용을 처리할 별도의 작은 모델을 학습시키고 그것이 더 약할 것이라는 점을 받아들이는 대신, AIsphere는 자사의 유능한 모델을 더 빠른 형태로 증류합니다. 두 계층은 같은 계보를 공유하므로 빠른 버전이 처음부터 배우는 것이 아닙니다.

지원 기법들이 세부를 채웁니다. 동적 청킹은 서로 다른 시간 규모에서 작동하는 신호를 처리하므로, 모델이 느린 환경 변화와 빠른 캐릭터 움직임을 같은 방식으로 다루도록 강제되지 않습니다. 세 가지 메모리 채널은 지속적인 세계 규칙, 최근 움직임, 객체 상태를 추적합니다. Error Bank는 학습 중 모델 자체의 실패 상태를 재생합니다.

회사에 따르면 Error Bank는 내부 테스트에서 장기 지평 밝기 드리프트 지표를 35.8퍼센트 줄였고, 블록 희소 어텐션은 90퍼센트 이상의 희소성에서도 품질을 거의 그대로 유지합니다. 밝기 드리프트는 화려하지 않지만 많은 것을 말해주는 지표입니다. 긴 시퀀스에서는 오류의 미묘한 누적이 바로 당신이 일관된 장소를 보고 있다는 환상을 깨뜨리는 원인입니다.

R2가 아닌 것

AIsphere는 한계에 대해 솔직합니다. 마케팅이 보통 제품을 앞서는 이 분야에서 상쾌한 태도입니다. 엄격한 실시간 및 지연 제약 아래에서 R2의 단일 패스 출력 품질은 여전히 선도적인 오프라인 비디오 모델에 뒤처집니다. 가능한 한 가장 선명한 클립을 원한다면, 여전히 오프라인으로 생성하고 기다리는 편이 낫습니다.

따라서 가치 제안은 품질이 아닙니다. 연속성과 반응성입니다. 이 모델은 프레임별 완성도를 일부 희생해 세계를 살아 있게 유지하고 입력에 반응하는 능력을 얻으며, 많은 용도가 후자를 더 중요하게 여긴다는 데 베팅합니다.

이러한 구도는 R2가 중국 연구소와 다른 곳에서 등장하는 더 넓은 세계 모델 흐름 속에서 어디에 위치하는지도 설명합니다. 앞서 다룬 HiDream의 HD-V1은 오프라인 생성에서 물리적 일관성과 서사적 일관성을 중심에 둡니다. Google의 인터랙티브 세계 모델은 플레이 가능한 환경 방향으로 나아갔습니다. R2의 제안은 '들어가게 되는 환경'이라는 은유에 가장 강하게 기울어져 있습니다. AIsphere의 창립자 겸 CEO Wang Changhu는 이를 직접적으로 말했습니다: 실시간 인터랙티브 비디오는 세계 모델링의 전부는 아니지만, 사람들이 가장 먼저 경험할 수 있는 경로입니다. 그는 R2가 제작 도구에서 사용자가 언제든 들어갈 수 있는 환경으로 진화할 것으로 기대합니다.

게임 엔진이 중요한 이유

7월에 처음 출시된 PixVerse Game Engine은 이제 R2에서 실행됩니다. 연구 분야 밖의 사람이라면 주목할 만한 부분입니다. 게임 엔진에 연결된 실시간 세계 모델은 비디오 생성기와 매우 다른 제품입니다. 이는 기획된 상호작용, 저장 상태, 그리고 플레이어가 미디어가 아니라 소프트웨어에서 이미 기대하는 세션 지속성을 함축합니다.

데모 사용 사례는 게임, 인터랙티브 영화, 디지털 휴먼이라는 아이디어 주변에 모여 있습니다. 세 가지 모두 관객이 무언가를 하는 형식이며, 고정된 클립으로는 경험을 전달할 수 없습니다. 마지막 대화를 기억하는 디지털 휴먼은 고객 서비스나 동반자 관계에서 일회성 비디오가 결코 할 수 없는 방식으로 유용합니다. 시청자의 선택이 진정으로 분기되는 인터랙티브 영화는 전통적인 비디오 파이프라인이 전혀 만들어낼 수 없는 형식입니다.

데모 공간과 실제 배포 사이에는 현실적인 격차가 있으며, AIsphere는 상업적 출시 일정, 가격, 라이브 R2 세션이 소비하는 연산량을 공개하지 않았습니다. 그 수치들이 이 모델이 플랫폼이 될지 데모로 남을지를 결정할 것입니다.

출시 뒤에 있는 패턴

한 걸음 물러나 보면 R2는 지난 한 해 AI 비디오에서 나타난 알아볼 수 있는 패턴에 들어맞습니다. 최전선은 계속 '더 예쁜 클립 생성'에서 '시간이 지나도 일관된 무언가를 유지'로 이동하고 있습니다. 그것이 5분짜리 내러티브이든, 샷을 넘나들며 일관성을 유지하는 캐릭터이든, R2의 경우처럼 당신이 밀어붙이는 동안 규칙을 유지하는 세계이든 마찬가지입니다.

그 각각은 다른 옷을 입은 동일한 근본 문제입니다: 시간과 상호작용이 쌓일수록 생성 시스템의 상태를 일관되게 유지하는 것. 오프라인 모델은 단일 렌더 안에서 프레임별로 이를 해결합니다. R2는 입력이 계속 도착하는 라이브 세션 전반에서 이를 해결합니다.

R2가 널리 쓰이는 도구가 되든 잘 자금 지원된 실험이 되든, 이 카테고리가 다음 우위가 어디에 있다고 생각하는지를 보여주는 유용한 표지입니다. 실시간 입력 아래에서 일관된 세계를 유지할 수 있는 회사들은 좋은 위치에 서게 될 것입니다. 그것이 생성형 비디오를 당신이 보는 것에서 당신이 사용하는 것으로 바꾸는 능력이기 때문입니다.

관련 글