Utopai, AI 영화 제작이 샷 하나가 아니라 영화 전체를 기억하길 원한다

AI 비디오 도구는 이제 인상적인 단일 클립을 만들어내는 데 능숙해졌다. 30초 장면을 요청하면 여러 모델이 그럴듯한 결과물을 내놓는다. 하지만 같은 캐릭터가 같은 아파트에서 같은 재킷을 입고 있는, 일관된 5분 시퀀스를 구성하는 40개의 샷을 요청하면 도구들은 무너진다. 클립과 영화 사이의 이 간극이 현재 생성형 비디오에 대한 대부분의 전문가적 좌절이 자리하는 지점이다.
Utopai Studios는 9월 30일 PAI 프로덕션 플랫폼과 Utopai X 비디오 모델을 출시했으며, 이 시스템은 바로 그 간극을 겨냥해 만들어졌다. 이 미국 기업은 자체 영화와 TV 프로젝트도 개발·제작한다는 점에서 이례적이어서, 도구가 순수한 소비자용 생성기로 설계되는 대신 실제 제작 현장 안에서 테스트되고 있다.
PAI는 Production Assistive Intelligence의 약자다
이 플랫폼은 각본, 캐릭터, 장소, 샷, 생성된 영상, 그리고 이전의 창작 결정들을 연결하는 작업 공간 역할을 한다. 영화 제작자는 먼저 PAI에 각본을 제공하고, 시스템은 이를 캐릭터, 장면, 장소, 소품 같은 요소로 분해한다. 이러한 세부 정보는 제작 구조로 정리된 뒤 샷과 시각적 자산이 개발되는 동안에도 계속 활용할 수 있다.
중요한 단어는 연속성이다. 제작 과정에서 캐릭터의 생김새, 장소가 어떻게 디자인되었는지, 또는 어떤 버전의 샷이 승인되었는지가 이미 정해졌다면, 그 정보는 프로젝트에 계속 붙어 있다. 다른 영상이 생성될 때마다 이를 다시 설명할 필요가 없다. 겉보기에는 평범한 기능처럼 들리지만, 이는 생성형 비디오의 가장 고질적인 문제 중 하나를 해결한다. 즉 각 생성이 이전 생성에 대한 기억이 없는 고립된 요청이라는 점이다.
PAI에는 기존 프로젝트 정보를 활용해 샷을 계획하고 시각적 대안을 개발하도록 돕는 AI 프로덕션 어시스턴트도 포함되어 있다. 이 회사는 영화 제작자가 작업을 연출하고, 결과물을 검토하며, 어떤 버전을 진행시킬지 결정하는 책임을 계속 진다는 점을 분명히 한다. 이는 마케팅 문구가 아니라 실무적인 요점이다. 독립적인 AI 생성물로 일관된 시퀀스를 구성해 본 사람이라면 무엇이 서로 맞는지에 대한 인간의 결정이 작업의 대부분이라는 것을 안다.
Utopai X와 리더보드 데뷔
Utopai는 PAI와 함께 자체 텍스트-투-비디오 모델인 Utopai X를 선보였으며, 이 모델은 프로덕션 시스템에 직접 내장되어 있다. 이 모델은 9월 29일 Artificial Analysis 텍스트-투-비디오 리더보드(오디오 포함)에서 전 세계 2위로 진입했으며 Elo 점수는 1,150이었다. 또한 해당 순위에서 미국 기반 기업의 모델 중 가장 높은 순위를 기록했다.
리더보드 순위는 모델이 업데이트되고 새로운 경쟁자가 등장하면서 빠르게 바뀐다. 그럼에도 독립적인 순위는 중요하다. 이는 모델이 회사 자체 데모 영상과만 비교해 평가받는 것이 아니라는 뜻이기 때문이다. Artificial Analysis는 동일한 프롬프트로 생성된 영상들 중에서 어느 시스템이 만들었는지 알려주지 않은 채 사람들이 선택하는 블라인드 비교를 사용한다.
PAI는 Utopai X에만 국한되지 않는다. 이 작업 공간은 사용 가능한 모델을 활용한 이미지, 비디오, 오디오 생성을 지원하며, 영화 제작자가 어떤 모델을 언제 사용할지 선택한다. 이는 현명한 설계 선택이다. 자체 모델로만 작동하는 프로덕션 플랫폼은 폐쇄된 정원과 같으며, 전문 스튜디오가 단일 공급업체의 비디오 모델을 중심으로 파이프라인을 재구축하지는 않을 것이다.
각본에서 편집 타임라인까지
PAI에서 가장 흥미로운 부분은 생성을 클립을 완성된 제작물로 바꾸는 덜 화려한 작업과 연결하려 한다는 점이다. 생성된 테이크는 의도된 샷과 연결된 상태로 유지되므로, 영화 제작자는 대안을 비교하고 이전 작업을 잃지 않은 채 이전 버전으로 돌아갈 수 있다. 선택한 클립은 편집 타임라인에 배치해 주변 샷 옆에서 어떻게 어울리는지 확인할 수 있다.
일관성이 왜 그렇게 어려운지 구체적으로 짚어볼 가치가 있다. 생성형 비디오 모델은 게임 엔진처럼 캐릭터에 대한 지속적인 표현을 유지하지 않는다. 매 생성마다 프롬프트와 조건 입력으로부터 캐릭터를 다시 도출하므로, 작은 변형이 스며들어 샷 전반에 누적된다. 프로덕션 플랫폼의 역할은 안정적으로 유지되어야 할 부분을 고정해, 모델이 바뀌어야 할 부분만 새로 만들어내도록 하는 것이다. 이는 모델링 문제라기보다 데이터 관리 문제이며, 더 나은 비디오 모델이 밑에 없더라도 결정을 기억하는 작업 공간이 도움이 될 수 있는 이유다.
제작물은 Adobe Premiere Pro와 DaVinci Resolve를 포함한 기존 소프트웨어에서 마무리할 수 있도록 소재를 내보낼 수 있다. 이는 처음 보이는 것보다 더 중요하다. 전체 제작이 자체 시스템 안에 머물기를 고집하는 도구는 전문가들에게 수년간 숙달한 도구를 버리라고 요구하는 셈이다. 편집자들이 이미 작업하는 곳에서 만나는 것이 훨씬 마찰이 적은 도입 경로다.
더 큰 제작 팀을 겨냥한 기능도 있다. 엔터프라이즈 워크플로는 댓글과 승인을 특정 버전에 붙여 유지할 수 있다. 생성 기록은 스튜디오가 소재의 출처를 추적하고 잠재적인 지식재산권 문제를 검토하는 데 도움을 주기 위한 것이다. 마지막 지점은 점점 더 필요해지고 있다. AI 생성 영상이 상업 제작으로 이동하면서, 모델 출력이 어디서 왔는지, 배포를 위해 라이선스를 받을 수 있는지라는 질문은 기술적 호기심이 아니라 법적 문제가 되고 있다.
실제 영화에 사용되는 이유
Utopai는 다가오는 애니메이션 장편을 포함해 자체 프로젝트에서 이 기술을 테스트하고 있다. 이 회사는 인간 영화 제작자, 아티스트, 애니메이터가 창작 결정에 대한 책임을 계속 지며 AI는 제작 과정의 일부로 사용된다고 말한다. 도구 공급업체이자 제작자이기도 한 것은 Utopai가 순수 소프트웨어 회사라면 고객이 보고하기 전까지 마주하지 못했을 문제를 발견할 수 있는 방법을 제공한다.
PAI는 회사 내부 제작 외에도 개인 구독 옵션과 스튜디오 및 대규모 팀을 위한 엔터프라이즈 액세스로 이용할 수 있다. 즉 영화 제작자는 지금 바로 이 환경을 사용할 수 있으며, 이는 이번 출시를 단순한 기술 시연 이상의 의미로 만든다.
중요한 시험
더 큰 질문은 PAI 같은 시스템이 눈길을 끄는 AI 영상과 완성된 에피소드를 가르는 일관성 문제를 실제로 해결할 수 있느냐다. 몇 초의 그럴듯한 영상을 생성하는 일은 일상이 되어가고 있다. 제작 전체에 걸쳐 캐릭터, 장소, 창작 결정, 수정 사항을 기억하는 것은 훨씬 더 어려운 과제다. 이는 모델 문제만큼이나 데이터 관리 문제이기 때문이다.
이러한 재구성이 이번 출시의 실제 기여다. 한동안 AI 비디오 논의는 어느 모델이 가장 보기 좋은 클립을 만드는가에 관한 것이었다. Utopai는 다음 단계가 화려한 독립적 순간을 생성하는 것보다 각본 첫 페이지부터 최종 편집까지 수백 개의 창작 결정을 연결해 유지하는 것에 더 가깝다고 본다.
그것이 맞다면, AI 영화 제작의 승자는 반드시 최고의 비디오 모델을 가진 연구소가 아닐 것이다. 승자는 제작물이 자신이 결정한 것을 기억하게 만드는 지루하지만 필수적인 문제를 해결하는 쪽이 될 것이다. Utopai만 이 문제를 다루는 회사는 아니지만, 문제 자체가 제품이라고 주장하는 몇 안 되는 회사 중 하나다.
관련 글
바퀴 달린 세미휴머노이드, 도움 없이 한 시간 동안 세탁 마쳐
개별 작업은 성공해도 워크플로는 여전히 실패할 수 있다. Dyna는 측정 지표를 바꿨다.
LTX 2.5, 투박한 블렌더 초안을 완성된 샷으로 렌더링하려 한다
텍스트-투-비디오에서는 무슨 일이 일어날지 통제할 수 없다. 이것이 그 문제를 해결하려 한다.
ServiceNow, 에이전트 실패를 학습 데이터로 전환하다
검증 없는 생성은 잡음이다. 게이트가 제품이다.
언어와 비전을 위한 단일 프레임워크: Horizon의 16억 파라미터 오픈 모델
언어와 비전 사이의 다리는 애초에 필요하지 않았다는 내기.