Wan 3.0, 재구축된 비디오 리더보드 1위… Kling 3.0은 기준점이 되다

Artificial Analysis는 9월 30일 텍스트-투-비디오 리더보드를 재구축했다. 새로운 평가 기준인 AA-Video-T2V v2.0은 모든 모델을 1080p에서 평가하며, 약 1,000개의 프롬프트에 걸쳐 68,000건 이상의 인간 선호도 투표를 반영한다. 프롬프트는 10개의 사용 카테고리와 10개의 역량 축으로 분류된다. Wan 3.0은 오디오 포함 부문에서 Elo 1,156으로 1위에 올랐고, 20개 카테고리 순위 중 10개에서 정상을 차지했다.
시장 상황을 더 잘 보여주는 숫자는 맨 아래에 있다. 1080p의 Kling 3.0은 1,000점에 고정된 기준점(앵커)이다. 척도 자체가 그 지점에 고정되어 있기 때문에 그보다 아래 순위는 존재하지 않는다. 콰이쇼우의 이전 플래그십은 한때 AI 비디오의 국내 표준이었지만, 이 리더보드에서는 다른 모든 모델을 재는 기준점 역할을 한다.
시상대가 아닌 선두 그룹
상위 4개 모델은 오차 범위 약 9~10점 안에서 서로 18점 이내에 몰려 있다. Wan 3.0이 1,156으로 앞선다. MiniMax H3를 기반으로 포스트 트레이닝되었고 공개 API가 없는 Utopai X가 1,148로 2위다. Dreamina Seedance 2.5가 1,142로 뒤를 잇고, 768p의 MiniMax H3가 1,138로 4위다. fal의 H3 Max가 1,134로 이 그룹을 마무리한다.
이 숫자들은 사다리가 아니라 하나의 무리로 읽어야 한다. 선두의 오차 범위 안에 들어오는 모델은 선두보다 측정 가능할 만큼 나쁘다고 할 수 없다. 상위 5개 중 3개가 H3이거나 H3를 기반으로 만들어졌다는 점이 더 흥미롭다. MiniMax가 공개한 오픈 웨이트 기반 모델이 다른 팀들이 포스트 트레이닝을 얹는 토대가 된 것이다. 3년 전 사람들이 Stable Diffusion 위에 무언가를 쌓았던 것과 같은 방식이다.
순위 아래에는 이 리더보드가 처음으로 가시화한 분포에 관한 이야기가 있다. 1년 전만 해도 비디오 리더보드 상위권은 자금력이 탄탄한 몇몇 연구소의 클로즈드 모델 목록이었다. 오늘날 상위 5개에는 오픈 웨이트 기반 모델 하나와, 더 작은 팀들이 그 위에 포스트 트레이닝한 모델 두 개가 포함된다. Utopai X는 공개 API가 없어서, 공개 리더보드에서 2위에 오른 모델이 회사 외부의 누구에게도 손에 닿지 않는다. 이는 새로운 종류의 순위 부산물이며, 잘 설계된 포스트 트레이닝 한 번이 오픈 기반 모델을 얼마나 빠르게 경쟁권으로 끌어올릴 수 있는지를 보여준다.
같은 날 공개된 오디오 없는 부문 리더보드에서는 Wan 3.0이 1,129로 1위를 차지했고 H3와 H3 Max가 2, 3위에 올랐다. 오디오를 제거하면 경쟁 범위가 좁아지는데, 이는 중국 모델들의 우위가 시각적 품질만이 아니라 오디오 처리에서 비롯된다는 것을 시사한다. 또한 리더보드 해석을 뒤집기도 한다. 무음 영상만 필요한 스튜디오는 립싱크 대사가 필요한 스튜디오와 전혀 다른 경쟁 구도를 보게 된다.
가격 열이 말해주는 것
리더보드에는 분당 가격도 함께 표시되는데, 이 열은 Elo 열과는 다른 이야기를 한다. Wan 3.0은 영상 1분당 12달러다. Seedance 2.5는 분당 34.12달러로 상위 10개 중 가장 비싸다. 누구나 다운로드할 수 있는 MiniMax H3는 분당 4.80달러다.

즉, 3위에 오른 오픈 웨이트 모델의 비용은 선두 모델이 받는 요금의 4분의 1, 2위 상용 모델 요금의 7분의 1 수준이다. 제품을 출시하는 팀에게 이 격차는 19점의 Elo보다 더 중요하다. 질문은 '어떤 모델이 최고인가'에서 '분당 요금이 비즈니스 사례를 망가뜨리지 않을 만큼 충분히 좋은 모델은 무엇인가'로 바뀐다. 1년 전이라면 Seedance에 비용을 지불했을 많은 팀에게 H3가 그 답이다.
Seedance 2.5의 분당 34.12달러라는 수치는 다시 볼 필요가 있다. 상위 10개 중 가장 비싼데도 3위에 올랐기 때문이다. 이 가격은 오픈 웨이트 요금의 7배를 지불할 만큼 품질을 중시하는 고객을 상정하며, 그런 고객은 광고와 영화 업계에 존재한다. 리더보드가 보여줄 수 없는 것은 그 프리미엄이 예산이라는 현실과 부딪혔을 때 살아남는지 여부다. 제작에 200개의 샷이 필요하다면, 분당 34달러와 4.80달러의 차이는 프로젝트와 스프레드시트 문제 사이의 차이다.
Wan 3.0의 선두 자리에는 단서가 붙는다. 초대 전용 상용 베타라는 점이다. 오늘 실제로 공개된 가격에 구매할 수 있는 것은 H3다. 접근할 수 없는 모델의 리더보드 순위는 시장이 어디로 향하는지를 알려주는 신호일 뿐, 구매 결정의 근거는 아니다.
비디오 편집 부문 리더보드는 또 다른 차원을 더한다. Wan 3.0이 Elo 1,188로 그곳에서도 1위를 지키며, 8월 데뷔 이후 자리를 지켜온 MiniMax H3로부터 그 카테고리를 가져왔다. 실무 워크플로가 사는 곳은 편집이다. 대부분의 상용 비디오 작업은 이미 존재하는 촬영 소재에서 시작되기 때문이다. 생성에서는 앞서지만 편집에서 뒤처지는 모델은, 둘 다 강한 모델보다 제작 팀에 덜 유용하다. 현재 Wan 3.0이 두 부문 모두에서 앞서고 있으며, 이는 이 리더보드에서 어떤 모델도 가져본 적 없는 가장 강력한 위치다.
스펙 시트로 출시된 Kling 4.0
이 리더보드가 명확히 해주는 또 하나는 최근 Kling 4.0 출시가 얼마나 보도자료 밖에 존재하지 않는가 하는 점이다. 콰이쇼우의 계정은 9월 28일 이 모델을 발표했다. 최대 4K, 10비트 HDR, 멀티모달 레퍼런스 15개, 키프레임 10개, 네이티브 30초 생성, 스테레오 오디오. 출시일은 '이번 10월 예정'이었다.
실제로 출시된 것은 Ultra Yearly 구독자에게 공개된 Kling 4.0 Flash다. 기능 페이지에는 가격도, 날짜도, 해상도 표기도, 10월에 대한 언급도 없다. Artificial Analysis 리더보드에서 가장 최신 Kling 항목은 여전히 3.0이다. Kling이 비용을 지불한 협찬임을 밝힌 한 크리에이터의 게시물에 따르면 출시 버전의 출력은 1080p이며 Seedance보다 저렴한데, 이는 '최대 4K'라는 헤드라인과 상충한다.
그렇다고 해서 발표된 기능이 거짓인 것은 아니다. 발표와 실제 사용 가능한 모델 사이의 간극에 대부분의 작업이 존재하며, 이번 출시는 아직 그 간극을 메우지 못했다는 뜻이다. 4K, HDR, 레퍼런스 15개, 키프레임 10개를 나열한 스펙 시트는, 만약 실제로 출시된다면 공개 시장에서 가장 강력할 기능 집합을 설명한다. 동시에 모든 경쟁자가 한 분기 안에 대응해야 할 기능 목록이기도 하다.
이 패턴은 지난 2년간의 모델 출시에서 익숙하다. 발표는 기대를 설정하고, 일반 공급 전까지의 기간에 실제 제품이 만들어진다. 구매자에게 실용적인 조언은 언제나 같다. 기능 페이지를 기준으로 제작 파이프라인을 계획하지 말고, 오늘 호출할 수 있는 것을 기준으로 계획하라.
앞으로 지켜볼 것
다음 신호는 Wan 3.0이 초대 전용 베타를 벗어나 가격을 공개하는지 여부다. 그렇게 된다면 선두와 오픈 웨이트 그룹 사이의 격차는 이론이 아니라 실제 예산 결정의 문제가 된다.
두 번째 신호는 Kling 4.0 그 자체다. 이전 플래그십이 이 척도의 기준점을 세웠다. 차기 모델은 콰이쇼우 외부의 누구도 실제로 실행해보기 전에 이미 기대치에 가격이 반영되고 있다. 그것이 실제로 등장할 때, 상위 5개 중 3개 자리를 이미 더 저렴한 모델들이 차지하고 있는 리더보드와 맞붙게 된다.
세 번째는 기준점 자체에 벌어질 일이다. Kling 3.0은 정의상 1,000점에 놓여 있다. Kling 4.0이 출시되어 그보다 높은 점수를 받으면, 척도의 고정점이 이동하고 리더보드의 모든 Elo는 새로운 기준선과의 비교가 된다. 그 순간 이 순위표는 9월을 설명하는 것을 멈추고, 올해가 어디로 가는지를 설명하기 시작한다.
관련 글
위성 사진이 이제 로봇 훈련 데이터가 되다
피지컬 AI 학습의 병목은 더 이상 컴퓨팅이나 모델 성능이 아니었다. 그것은 합성 세계의 품질이 되었다.
구글 Gemini 3.5 라이브 번역, 멈춤을 없애다
화자 자신의 목소리로, 이미 주머니에 있는 휴대폰에서 연속 실행되는 번역은 기능을 열어야 하는 것에서 그냥 켜져 있는 것으로 옮긴다.
중국, AI 에이전트 최초의 강제 안전 표준을 제정하다
안전은 홍보하는 기능에서 통과해야 하는 관문으로 바뀐다. 위험 목록은 13개 범주, 97개 항목에 이른다.
AI 생성 콘텐츠, 이제 신분을 밝혀야 한다
이 한 걸음이 모든 문제를 해결하지는 않지만, 'AI 생성'을 숨길 수 있는 선택지에서 반드시 답해야 하는 질문으로 바꿔놓았다.