← 블로그로
Ai약 14 분 읽기

Vidu Q3, 레퍼런스-투-비디오를 세 가지 제품으로 분할. 이는 모델 결정만큼이나 패키징 결정이다.

게시일 2026년 10월 5일
Vidu Q3, 레퍼런스-투-비디오를 세 가지 제품으로 분할. 이는 모델 결정만큼이나 패키징 결정이다.

대부분의 비디오 모델 출시는 한 번 발표되면 단일 이름으로 어디에나 등장합니다. Vidu는 Q3 레퍼런스-투-비디오 라인에서 정반대로 움직였습니다.

9월 14일, Alibaba Cloud의 Model Studio는 세 가지 별도 Vidu Q3 레퍼런스-투-비디오 모델을 공개했습니다. 첫 번째인 viduq3-mix는 레퍼런스 이미지와 텍스트 프롬프트를 입력받아 해당 이미지의 피사체를 설명된 장면에 합성하는 범용 모델입니다. 두 번째인 viduq3-ad는 광고용으로 구축되어 마케팅 수준의 장면 전환, 카메라 무빙, 직접 오디오 출력을 제공합니다. 제품 이미지를 업로드하면 광고 영상이 나옵니다. 세 번째인 viduq3-drama는 드라마 및 AI 만화 제작을 겨냥하며, 스토리 중심 콘텐츠에 맞춰 조정된 캐릭터 일관성, 모션 효과, 감정 표현을 갖췄습니다.

세 가지 모두 720p 또는 1080p에서 초당 $0.14로 실행되며, 초당 5회 요청 제한이 있습니다. 가격은 세 모델 모두 동일합니다. 이는 차별점이 비용이 아니라 출력 동작에 있음을 보여줍니다.

Vidu가 실제로 해결하려 한 문제

Vidu는 베이징의 Shengshu Technology에서 나왔습니다. Q3 모델은 2026년 1월 30일에 출시되어 곧바로 벤치마크 순위에 올랐습니다. Artificial Analysis는 출시 당시 1241점으로 중국 1위, 전 세계 2위로 평가했으며, Runway Gen-4.5, Google Veo 3.1, OpenAI의 Sora 2보다 앞섰습니다.

그 순위를 뒷받침한 세 가지 기술적 변화는 짚어볼 가치가 있습니다. Q3는 영상과 같은 패스에서 동기화된 대사, 음향 효과, 배경 음악을 생성한 최초의 롱폼 비디오 모델 중 하나였습니다. 사후에 오디오를 붙이는 방식이 아니었습니다. 단일 실행 클립을 16초로 늘렸는데, 당시 주요 모델 중 가장 길었습니다. 또한 캐릭터, 사물 또는 스타일의 이미지 3~7개를 업로드하면 모델이 이후 생성에서 이를 시각적 앵커로 사용하는 레퍼런스-투-비디오 시스템을 구축했습니다.

흥미로운 것은 레퍼런스 시스템입니다. 2026년 대부분의 비디오 모델은 같은 축에서 경쟁합니다. 단일 클립을 인상적으로 보이게 만드는 것입니다. Vidu의 베팅은 달랐습니다. 제안은 결코 “이 멋진 한 장면을 보라”가 아니었습니다. “10개 장면에 걸쳐 같은 캐릭터를 보고, 여전히 같은 인물처럼 보이는지 확인하라”였습니다.

이는 더 어려운 문제이며, 시리즈 콘텐츠가 실제로 의존하는 문제입니다. Runway Gen-4, Kling 3.0, Luma Ray, Pika 2.0, Sora 2와의 비교에서 동일한 캐릭터 프롬프트를 6가지 장면 변형에 걸쳐 사용했을 때, Vidu Q3는 6개 테스트 중 5개에서 얼굴과 의상의 일관성을 유지했습니다.

일관성은 일회성 클립용 도구와 시리즈용 도구를 구분하는 요소입니다. 애니메이션 제작자, 숏드라마 제작자, 그리고 반복 등장하는 캐릭터를 중심으로 브랜드 콘텐츠를 만드는 모든 이에게 이는 가능한 것의 범위를 바꿉니다.

세 가지 SKU가 중요한 이유

하나의 모델 패밀리를 세 가지 이름의 제품으로 나누는 것은 마케팅 선택처럼 보입니다. 하지만 이는 조달 결정에 더 가깝습니다.

반사되는 표면 위에 나란히 서 있는 세 개의 평범한 어두운 원통과 흩어지는 연기

광고 팀과 숏드라마 스튜디오는 기반 트랜스포머가 유사하더라도 같은 것을 구매하지 않습니다. 광고 구매자는 제품 충실도, 깔끔한 장면 전환, 브랜드 보이스 아래에 깔릴 수 있는 오디오를 필요로 합니다. 드라마 구매자는 에피소드와 장면에 걸쳐 정체성을 유지하는 캐릭터, 그리고 연기처럼 읽히는 표정을 필요로 합니다. 이를 별도 모델 ID와 별도 문서로 패키징하면 각 구매자가 범용 기능 목록을 읽고 추측하는 대신 정확히 하나의 작업을 평가하고 예산을 책정할 수 있습니다.

그런 다음 범용 mix 모델은 두 범주 밖의 모든 사용자를 담당합니다. 구매자가 프롬프트를 테스트하는 취미 사용자라기보다 마감이 있는 제작 팀이 되어가는 시장에서 합리적인 구조입니다.

Vidu Claw와 파이프라인 계층

모델을 패키징하는 것은 전략의 절반입니다. 나머지 절반은 조립 계층입니다. Vidu Claw는 오픈소스 OpenClaw 프레임워크를 기반으로 하며 Q3로 구동되는 AI 창작 자동화 엔진입니다. Vidu 토큰을 연결하고 스킬을 정의한 뒤 아이디어에서 완성된 비디오까지의 경로를 자동화할 수 있습니다. “Instagram에서 젊은 여성을 타깃으로 하는 러닝화 숏폼 광고를 만들어줘” 같은 단일 프롬프트만으로도 Vidu Claw는 콘셉트, 스크립트, 스토리보드, 비주얼, 보이스오버, 음악, 최종 편집본을 생성할 수 있습니다.

독립 리뷰는 유용할 정도로 엇갈렸습니다. 제품 광고로 테스트한 한 리뷰어는 이 플랫폼이 학생과 초보자에게 진정으로 무료이고 접근 가능하다고 평가했지만, 정교한 구조적 디테일에는 어려움을 겪는다고 보고했습니다. 한 사례에서는 반복적인 프롬프트 수정 후에도 특정 디테일이 눈에 띄게 렌더링되었고, 출력물에는 눈에 띄는 AI 느낌이 있었으며 조명과 색감은 저렴하게 느껴졌습니다.

이것이 솔직한 트레이드오프입니다. Vidu Claw는 전문 제작 팀을 대체하는 도구라기보다, 콘셉트에서 사용 가능한 초안으로 빠르게 이동해야 하는 1인 창작자와 소규모 마케팅 팀을 위한 생산성 도구입니다. 잘 작동할 때는 5일 걸리는 광고 제작 사이클을 하루로 압축합니다. 그렇지 않을 때는 품질 문제를 간과하기 어렵습니다.

Vidu가 구축하는 주변 생태계

레퍼런스-투-비디오 집중은 유통 이야기와 연결됩니다. 2026년 2월, 소프트웨어 기업 Wondershare는 Shengshu에 대한 전략적 투자를 발표했고, 두 회사는 AI 만화 작업을 함께할 계획입니다. Vidu Q3 모델은 에피소드 전반에 걸쳐 캐릭터, 목소리, 장면의 일관성을 유지하는 데 사용되는 풀체인 AI 만화 제작 플랫폼에 통합되었습니다. Alibaba Cloud의 Bailian 플랫폼도 2026년 5월 Vidu Q3를 서드파티 모델로 추가했습니다.

따라서 이 모델은 최소 세 가지 채널을 통해 이동합니다. 직접 웹 및 API 접근, 만화와 숏드라마를 겨냥한 창작 플랫폼, 그리고 클라우드 모델 마켓플레이스입니다. 각 채널에는 “충분히 좋음”에 대한 정의가 다른 구매자가 있습니다.

돈이 실제로 있는 곳

시리즈 콘텐츠로의 전환은 창작적 선호가 아닙니다. 예산이 있는 곳이 바로 그곳입니다. 숏드라마는 반복 출연진이 있는 다중 에피소드 제품이며, 그 경제성은 단일 광고나 일회성 클립보다 훨씬 많은 분량의 영상을 제작하는 데 달려 있습니다. 모델이 모든 장면에서 캐릭터 외형을 매번 처음부터 다시 잡게 한다면, 생성된 영상으로 얻는 절감 효과는 일관성 수정에 잡아먹힙니다. Vidu의 베팅은 초당 $0.14를 지불할 의향이 있는 팀이 아름다운 단일 장면을 사는 것이 아니라, 전체 시리즈에 걸쳐 같은 인물을 알아볼 수 있게 유지하는 방법을 산다는 것입니다.

이것이 또한 레퍼런스 시스템이 원시 품질 점수보다 더 중요한 이유입니다. 벤치마크에서 전 세계 2위를 차지한 모델은 인상적이지만, 벤치마크는 클립을 측정합니다. 레퍼런스 기능은 시리즈를 측정합니다. 둘은 같은 구매가 아니며, Vidu는 두 번째에 판매하고 있습니다.

아직 충족하지 못하는 부분

레퍼런스 일관성은 완벽하지 않고, 6개 중 5개는 6개 중 6개가 아닙니다. 여섯 번째 사례가 실패한 경우, 도구는 원본에서 벗어난 얼굴과 의상을 출력했으며, 이는 시리즈를 망가뜨리는 바로 그 실패입니다. 비용은 초당 $0.14로 현실적이며, 16초 클립 전체에서 빠르게 누적되고 수백 개의 장면이 등장하는 시리즈 규모에서는 상당해집니다. 파이프라인 계층은 완성된 광고가 아니라 초안을 생성하며, 리뷰어들은 반복적인 프롬프트 수정으로도 구조적 디테일을 안정적으로 수정할 수 없다고 밝혔습니다.

또한 언급할 가치가 있는 구조적 한계가 있습니다. 레퍼런스-투-비디오는 정체성을 고정하지만, 전체 제작의 연속성을 아직 해결하지 못합니다. 일관된 클립 묶음을 하나의 이야기로 만드는 연출 선택은 여전히 누군가가 해야 하며, 모델은 페이싱, 커버리지, 또는 어떤 장면이 존재해야 하는지에 대해 의견이 없습니다.

지켜볼 것

세 가지 SKU 구조는 다른 공급업체들이 따라 할 가능성이 높은 부분입니다. 레퍼런스-투-비디오가 시리즈 콘텐츠 제작의 기본 방식이 된다면, 더 많은 모델 패밀리가 단일 플래그십 대신 작업별 변형을 출시할 것으로 예상할 수 있습니다. 다음으로 중요한 질문은 더 긴 길이와 더 까다로운 카메라 작업에서도 일관성이 유지되는지, 그리고 파이프라인 계층이 1인 창작자가 아닌 스튜디오에 판매할 만큼 좋아지는지입니다.

관련 글