← 블로그로
Ai약 12 분 읽기

Wan 3.0, 비디오 리더보드 1위에 올랐다. 오픈 웨이트의 이야기는 이제 비디오의 이야기다.

게시일 2026년 10월 1일
Wan 3.0, 비디오 리더보드 1위에 올랐다. 오픈 웨이트의 이야기는 이제 비디오의 이야기다.

생성형 AI 붐의 대부분 기간 동안, 오픈 웨이트(open-weights) 논의는 이미지의 것이었습니다. Stable Diffusion은 자체 GPU에서 실제 모델을 돌릴 수 있다는 것을 증명했고, 그 주변으로 LoRA와 ControlNet의 생태계 전체가 성장했습니다. 비디오는 달랐습니다. 최고의 비디오 모델들은 계속 API 뒤에 잠겨 있었고, "오픈 소스 비디오"는 클로즈드 선두 주자들에 뒤처진 작은 모델들을 의미했습니다.

그것이 이번 달에 바뀌었습니다. 알리바바의 비디오 모델인 Wan 3.0이 약 1,000개의 프롬프트에 걸쳐 68,000건 이상의 인간 선호도 투표를 기반으로 구축된 Artificial Analysis의 차세대 AA-Video-T2V v2.0 벤치마크에서 1위를 차지했습니다. Wan 3.0은 Elo 1157을 기록했고 20개 카테고리 순위 중 10개에서 1위를 차지했습니다. 같은 리더보드에서 Wan 3.0은 비디오 편집 부문에서도 1위에 올라, ByteDance의 Seedance와 MiniMax의 H3를 앞섰습니다.

중요한 것은 하나의 숫자라기보다 그것이 의미하는 바입니다. 오픈 웨이트 중국 모델이 이제 Google의 Veo 3.1과 나머지 클로즈드 진영과 경쟁할 수 있게 되었고, 여러 순위에서는 앞서기까지 합니다. 가격도 같은 이야기를 합니다. Wan 3.0은 해상도에 따라 초당 0.05~0.20달러에 제공되는 반면, Veo 3.1은 스탠더드 티어에서 초당 0.40달러입니다. 알리바바는 바로 이 추진을 위해 홍콩 주식 배치로 100억 달러를 조달했고, 그 전략은 명확합니다. 저렴하게 팔고, 점유율을 얻고, 엔터프라이즈 고객을 성장 엔진으로 삼는 것입니다.

기술적으로 Wan 3.0은 일관성과 구조화된 입력을 위해 설계되었습니다. 단일 패스로 최대 30초 클립을 생성하는데, 이는 전작의 15초 한도를 두 배로 늘린 것이며, 최대 1080p에서 동기화된 미세 표정과 다국어 음성을 지원합니다. 더 흥미로운 점은 문서, PDF, PowerPoint, 스프레드시트를 입력으로 받아 슬라이드 덱이나 보고서를 비디오로 바꿔준다는 것입니다. 이 문서-투-비디오(document-to-video) 접근은 개인 크리에이터뿐 아니라 엔터프라이즈 워크플로를 정면으로 겨냥합니다.

문서-투-비디오 기능은 받는 것보다 더 많은 주목을 받을 만합니다. 대부분의 비디오 모델은 텍스트 프롬프트나 이미지를 원합니다. Wan 3.0은 이미 가지고 있는 자산, 즉 이미 만든 덱, 이미 작성한 보고서를 원하고, 그것들을 진실의 원천으로 취급합니다. 문서 속에서 살아가는 비즈니스에게 이는 "보고서가 있다"에서 "비디오가 있다"로 가는 마찰을 거의 0으로 낮춥니다. 엔터프라이즈 문서 파이프라인을 진입 경로로 만든 첫 모델이며, 조용히 영리한 움직임입니다.

비디오 스택을 선택하는 팀에게 이것은 결정의 판을 다시 섞습니다. 클로즈드 모델을 감당할 수 없거나 사용할 수 없을 때 찾는 것이 오픈 모델이라는 오래된 가정은 약해지고 있습니다. 이제 리더보드 1위에 오른 모델을 자체 호스팅할 수 있으며, 이는 품질과는 무관하고 통제와 모든 것이 관련된 경우에 중요합니다. 데이터가 자사 인프라를 떠날 수 없는 고객에게는 자체 호스팅 모델 외에 규정을 준수하는 선택지가 없고, 사상 처음으로 그 선택지가 출력 품질에서 타협이 아닙니다.

열광 속에서 건너뛰게 되는 단서가 있습니다. 가중치가 무료라고 해서 자체 호스팅이 무료인 것은 아닙니다. GPU, 통합 작업, 그리고 실제로 도달하는 작업량에서 파이프라인을 건강하게 유지하는 지속적인 일에 비용을 치릅니다. 모델은 무료지만 엔지니어링은 그렇지 않습니다. 대부분의 소규모 팀에게는 하드웨어를 정당화할 만큼 작업량이 늘어나기 전까지 호스팅 엔드포인트가 총비용에서 여전히 우위에 있습니다.

벤치마크 맥락은 이 승리를 제대로 읽기 위해 중요합니다. AA-Video-T2V v2.0 벤치마크는 인간 선호도 평가의 새로운 세대이며, 모든 모델을 1080p로 평가해 낮은 해상도로 이기는 예전 수법을 제거합니다. Wan 3.0은 20개 카테고리 순위 중 10개에서 1위를 차지하고 1157이라는 전체 최고 Elo를 기록했습니다. 이는 틈새의 승리나 유리한 카테고리가 아니라, 초당 8배나 비싼 모델들을 포함한 전체 경쟁자를 상대로 한 폭넓고 경쟁력 있는 결과입니다. 초당 0.05달러짜리 오픈 모델이 초당 0.40달러짜리 클로즈드 모델을 이길 때, 그 가치 제안은 반박하기 어렵습니다.

무시하기 어려운 정치적 차원도 있습니다. AI 비디오 경쟁은 중국과 미국 연구소 사이의 더 큰 경쟁의 대리전이 되었고, Wan 3.0의 벤치마크 1위는 양국에서 서로 다른 이유로 인용될 만한 결과입니다. 중국에서는 자국 스택이 가격뿐 아니라 품질로도 경쟁할 수 있다는 증거입니다. 미국에서는 컴퓨팅 비용만이 변하는 것이 아니라는 증거입니다. 어느 프레이밍도 실제로 일어나는 일을 온전히 담아내지 못하는데, 그것은 더 낮은 가격과 더 유능한 오픈 모델의 형태로 사용자에게 이익이 되는 진정한 경쟁적 수렴입니다.

비디오로의 오픈 웨이트 전환은 AI의 더 넓은 지정학에도 함의를 갖습니다. 중국 연구소들은 한동안 가격 전쟁에서 이기고 있었고, 이제 벤치마크에서도 이기고 있습니다. 이는 서사를 "값싼 모조품"에서 "진정한 경쟁자"로 바꿉니다. 같은 역학은 Qwen-Image와 Z-Image를 통한 이미지 생성에서, DeepSeek와 Qwen을 통한 언어 모델에서 이미 나타났습니다. 비디오는 서구 클로즈드 연구소들의 마지막 주요 보루였는데, Wan 3.0이 문이 열려 있음을 방금 보여주었습니다.

벤치마크 1위는 헤드라인이지만, 진짜 이야기는 비디오 생성에 이제 신뢰할 만한 열린 길이 생겼다는 것입니다. Stable Diffusion을 뒤따랐던 것과 같은 역학이 여기서도 이어질 가능성이 큽니다. 파인튜닝, 커뮤니티 컨트롤 노드, 지역별 배포, 그리고 API 벤더들이 애초에 신경 쓰지 않았던 롱테일 사용 사례입니다. 파인튜닝된 오픈 모델은 이미 이미지 작업에서 특정 캐릭터나 스타일을 유지하는 표준 방식이며, 비디오 크리에이터들도 자신의 브랜드나 제품으로 학습할 수 있는 같은 능력을 원할 것입니다.

그 생태계가 형성되고 있다는 초기 증거는 이미 있습니다. MiniMax H3 생태계는 오픈소스 프롬프트 빌더와 애니메 및 캐릭터 작업을 겨냥한 커뮤니티 파인튜닝 물결을 만들어냈으며, 이는 Stable Diffusion의 플레이북을 그대로 따릅니다. 오픈 가중치가 벤치마크 1위를 차지할 만큼 좋아지면, 그 주변에 형성되는 커뮤니티는 더 이상 틈새가 아니라 주류가 되며, 그로부터 나오는 혁신—컨트롤 노드, 지역 호스팅, 프라이버시를 보존하는 로컬 추론—은 단일 벤더가 출시할 수 있는 것보다 더 빠르게 도착하는 경향이 있습니다.

팀에게 주는 실질적 함의는 구체적이며 다시 말할 가치가 있습니다. 2026년 말에 비디오 스택을 선택한다면, 이제 질문은 품질의 문제로서의 "오픈이냐 클로즈드냐"가 아닙니다. 통제, 비용, 그리고 이탈 위험의 문제입니다. 오픈 가중치는 첫 번째를 주고 세 번째를 줄여주며, 두 번째를 대가로 치릅니다. 클로즈드 API는 편의를 주고 세 가지 모두를 대가로 치릅니다. 다음 모델 지원 중단을 고통 없이 헤쳐나갈 팀은, 벤더가 서비스 종료를 발표할 때 힘들게 알게 되는 대신 그 트레이드오프에서 자신의 입장이 어디인지 이미 정해둔 팀입니다.

생성형 비디오 위에서 무언가를 만드는 사람이라면, 실질적인 교훈은 오픈 가중치를 대안(fallback)으로 취급하는 것을 그만두라는 것입니다. 그것을 전략적 옵션으로 취급하세요. 다음에 어떤 클로즈드 벤더가 OpenAI가 방금 Sora에 그랬던 것처럼 모델을 지원 중단할 때, 허둥대지 않을 팀은 최소한 한 발을 열린 길에 두고 있던 팀일 것입니다. 오픈 가중치는 예전에는 위로의 상이었습니다. 비디오에서는, 그것이 방금 트로피 진열장이 되었습니다.

관련 글