AI 비디오의 다음 격전은 '세상 이해'를 둘러싸고 벌어진다

지난 2년 대부분 동안 AI 비디오 모델을 평가하는 방식은 단순했다. 프레임이 얼마나 예쁜지 보면 됐다. 하지만 그 기준은 이제 한계에 부딪히고 있다. 여러 모델이 사람이 도시를 걷는 설득력 있는 5초 클립을 모두 만들어낼 수 있게 되면, 이미지 품질은 더 이상 이들을 구분해주지 못한다. 다른 무언가가 필요하다.
9월, 중국 스타트업 HiDream.ai는 HiDream-O1-Video-1.0, 즉 HD-V1을 공개하며 그 '다른 무언가'를 제품의 핵심으로 내세웠다. 이 모델은 단순히 개별 프레임이 어떻게 보여야 하는지가 아니라 사건이 어떻게 전개되어야 하는지를 이해하도록 만들어졌다고 회사는 말한다.
예쁜 프레임의 문제
비디오 생성을 해본 사람이라면 실패 유형을 잘 안다. 한 캐릭터에게 무거운 나무 문을 밀어 열라고 프롬프트하면, 모델은 손은 왼쪽으로 미는데 문은 오른쪽으로 열리는 그림을 그린다. 누군가 5초 동안 한 장소에서 다른 장소로 달리라고 요청하면, 캐릭터는 대사를 마치고, 시간이 부족해지더니 순간이동한다. 클립은 실제로 보기 전까지는 괜찮아 보인다.
반복 재생성은 시간과 크레딧을 태우고, 15초 클립은 예산을 훨씬 초과할 수 있다. 간극은 해상도도 길이도 아니다. 물리와 인과관계다. 모델은 문이 손이 미는 방향으로 열려야 한다거나 두 지점 사이를 이동하는 데 시간이 걸린다는 것을 이해하지 못한 채 각 프레임을 그린다.
HD-V1이 겨냥하는 간극이 바로 이것이다. HiDream에 따르면 이 모델은 생성 전에 행동 지속 시간, 객체 관계, 사건 논리, 시청각 정합성에 대한 이해를 강화해, 결과물이 정지 이미지의 더미가 아니라 하나의 시퀀스로 이어지도록 한다.

네 개의 중국 모델, 세 가지 접근법
이것이 왜 중요한지 이해하려면 리더보드 최상위에 또 누가 있는지 살펴보는 게 도움이 된다. 2026년 9월까지 네 개의 중국 모델이 글로벌 비디오 생성 최전선에 진입했다. 바이트댄스의 Seedance 2.0과 2.5, MiniMax의 H3, 알리바바의 Wan 3.0, 그리고 HiDream의 HD-V1이다. 1년 전만 해도 중국 비디오 모델은 주요 국제 벤치마크에서 거의 존재감이 없었다. 이제는 최상위권에 몰려 있다.
이들은 서로 다른 경로로 그 자리에 올랐다. Seedance는 바이트댄스의 컴퓨팅, 엔지니어링, 제품이라는 완전한 스택에 기댄다. MiniMax H3는 거대한 모델 기반과 사용자 기반 위에서 비디오로 확장한다. Wan 3.0은 Qwen과 알리바바 클라우드라는 알리바바의 더 넓은 생태계에 내장돼 있다. HiDream은 이들 중 이례적이다. 거대 기업의 자원이나 유통망 없이, 이미지, 비디오, 3D 상호작용, 체화된 지능이 하나의 기반을 공유하도록 설계된 '네이티브 옴니모달 월드 모델'이라는 아키텍처에 승부를 건 스타트업이다.
HD-V1은 텍스트, 이미지, 비디오 입력을 지원하고 5~20초 길이의 1080p 비디오를 생성한다. 팀은 이 모델이 두 개의 국제 리더보드에서 좋은 성적을 냈다고 말하며, 특히 눈에 띄는 주장은 '세계 이해'다. 즉 모델이 사건이 어떻게 진행되는지 모델링하기 때문에 더 일관성 있는 시퀀스를 생성한다는 개념이다.
왜 '이해'가 새로운 개척지인가
여러 팀이 같은 품질 기준에 도달할 수 있게 되면 경쟁은 모델이 세상에 대해 무엇을 아는지로 옮겨간다. 해상도와 길이는 차별점이 아니라 기본 기능이 된다. 더 어려운 질문은 이미지 품질이 답할 수 없는 것들이다. 움직이는 물체가 물리 법칙을 따르는지, 행동과 소리가 동기화되는지, 한 사건이 이전 사건에서 이어지는지다.
업계에서는 같은 개념을 다른 이름으로 부른다. 경쟁 제품과 더 넓은 시장은 일관성, 의도 이해, 안정적 전달을 이야기한다. 중국의 한 비디오 기업 ZhiXiang Future는 비디오 에이전트를 위한 5부작 평가 프레임워크까지 공개했는데, 일관성, 의도, 시청각 완성도, 타임라인과 내러티브, 안정적 전달을 다룬다. 이름은 달라도 목표는 같다. 시퀀스를 시작만 하는 게 아니라 끝까지 완성할 수 있다고 신뢰할 수 있는 모델이다.
여기에는 돈이 걸려 있다. 골드만삭스는 글로벌 AI 비디오 생성 시장이 5년 안에 약 10배 성장해 2030년까지 약 290억 달러에 이를 것으로 추정했다. 이런 전망은 다음의 진짜 능력 도약처럼 보이는 쪽으로 투자를 끌어들이며, 현재 그 후보는 '세상을 이해하는 것'이다.
리더보드들은 서로 엇갈린다
비디오 분야를 판단하기 어렵게 만드는 이유 중 하나는 점수판들이 서로 일치하지 않는다는 점이다. 9월에 커뮤니티 아레나는 한 모델군을 1위로 뽑았고, 개별 클립을 평가한 인간 평가자들은 다른 모델을 선호했으며, 사용량으로 투표한 프롬프트 작성자들은 또 다른 모델을 골랐다. 한 커뮤니티 Elo 스냅샷은 구글의 Gemini Omni 라인을 1위로 올렸고, Black Forest Labs의 Flux 3 Video를 오픈 계열 최강 항목으로, 바이트댄스의 Seedance 2.0과 2.5를 바짝 뒤에 두었다. 반면 1~5점 품질 척도로 클립을 평가한 인간 평가자들은 Seedance 2.0을 1위로 뽑아 Kling, Wan, 심지어 자사의 후속 버전보다 앞세웠다. 순수 사용량으로는 Seedance와 구글의 Veo 3가 프롬프트 볼륨을 지배하고, Wan은 로컬 및 오픈 영역을 장악한다.
이 세 데이터셋이 주는 교훈은 '최고의 모델'이 전적으로 무엇을 측정하느냐에 달려 있다는 것이다. Veo는 무음 클립 인간 평가에서 아레나보다 낮은 순위를 기록하는데, 그 강점이 네이티브 오디오와 대화인데 무음 평가 기준은 이를 볼 수 없기 때문이다. Seedance 2.5가 클립별 품질에서 2.0보다 낮은 점수를 받은 것은 최신 버전이 사람들이 실제로 쓰는 프롬프트에서 항상 더 인상적이지는 않다는 것을 상기시킨다. 프로젝트를 위해 도구를 고르는 사람이라면 결정 전에 하나 이상의 보드를 읽고, 자신의 작업과 맞는 보드에 가중치를 둬야 한다.
이 변화가 크리에이터에게 의미하는 것
이 도구들로 실제로 무언가를 만드는 사람에게 실질적인 효과는 무엇이 망가지는지의 변화다. 모델이 사건 논리를 이해하면 실패는 명백한 것에서 미묘한 것으로 옮겨간다. 순간이동하는 캐릭터나 엉뚱한 방향으로 열리는 문과 싸우는 일은 줄고, 더 작은 문제들이 눈에 띄기 시작한다. 행동이 한 박자 너무 길게 지속되거나, 반응이 바로 앞 대사에서 이어지지 않는 식이다. 이런 문제는 원래 인간 감독이 잡아내야 하는 것들이다.
이는 중국의 단편 드라마 붐이 이미 가르쳐준 것과 같은 교훈이다. 이제 AI가 샷을 생성할 수 있지만, 완성된 에피소드에는 어떤 샷이 들어가야 하고, 어떤 순서이며, 왜 그런지를 결정하는 사람이 여전히 필요하다. 모델은 프레임을 점점 더 잘 만든다. 어떤 프레임이 중요한지에 대한 판단은 여전히 인간의 일이며, 낙관론자들이 예상하는 것보다 더 오래 그럴 수 있다.
4자 경쟁은 더 조용한 이유로도 중요하다. 서로 다른 회사가 같은 문제를 다른 방향에서 공격한다. 여기에는 거대 기업의 스택, 저기에는 스타트업의 아키텍처가 있어, 업계가 단일 기술 경로에 의존하는 정도를 낮춘다. 세계 이해가 올바른 목표로 밝혀지면 이제 한 팀 이상이 그 목표를 겨누고 있다. 그리고 잘못된 목표로 밝혀지면, 분야는 위험을 분산한 셈이다.
현재로서 솔직한 평가는 HD-V1이 붐비는 분야에 또 하나의 강력한 참가자이며, 그 주장은 아직 제3자가 검증하지 않았다는 것이다. 의심할 여지가 없는 것은 방향성이다. 다음 라운드에서 승리하는 모델은 가장 예쁜 단일 프레임을 그리는 모델이 아닐 것이다. 20초 동안 무언가 깨지지 않고 이야기를 유지할 수 있는 모델일 것이다. 세상을 이해하는 것은 더 어려운 문제이며, 사상 처음으로 많은 자금력 있는 팀들이 동시에 이 문제를 풀고 있다.
관련 글
Step 5, 버전 번호 네 개를 건너뛰고 오픈 모델 2위에 올랐지만 아무도 호출하지 않는다
벤치마크 위치는 생산자가 모델을 판단하는 데 쓰는 신호다. 호출량은 소비자가 사용함으로써 만들어내는 신호다.
Gemini Omni 1.1 Flash는 네 번의 요청을 연결해 40초짜리 샷을 만들었다. 제품은 바로 워크플로다.
Google은 가격표에 검수 관문을 내장한 제작 파이프라인을 내놓았다.
마이크로소프트가 부분 전사 지연 시간을 100밀리초로 줄였다. 이것은 전사의 용도를 바꾼다.
100밀리초 아래에서는 전사 제품이 누군가 아직 말하는 동안에도 반응할 수 있습니다.
Synthesia는 10년 동안 아바타를 녹화해 왔다. 이제는 그 아바타가 말을 받아치길 원한다
사람들이 자발적으로 반복하는 교육 도구는 누군가 배정해서 마치는 도구와는 다른 제품이다.