← Voltar ao blog
Aicerca de 8 min de leitura

Wan 3.0 Lidera o Ranking de Vídeo Reconstruído, e Kling 3.0 se Torna Sua Âncora

Publicado 7 de out. de 2026
Wan 3.0 Lidera o Ranking de Vídeo Reconstruído, e Kling 3.0 se Torna Sua Âncora

A Artificial Analysis reconstruiu seu ranking de texto para vídeo em 30 de setembro. A nova escala, AA-Video-T2V v2.0, avalia todos os modelos em 1080p e se baseia em mais de 68.000 votos de preferência humana em cerca de 1.000 prompts, agrupados em dez categorias de uso e dez eixos de capacidade. O Wan 3.0 fica em primeiro lugar com áudio, com Elo de 1.156, e ocupa o topo em dez dos vinte rankings de categoria.

O número que diz mais sobre o estado do mercado é o que está na parte de baixo. O Kling 3.0 em 1080p é a âncora fixa em 1.000. Ninguém fica abaixo dele porque a escala está fixada nesse ponto. O antigo carro-chefe da Kuaishou costumava ser o padrão doméstico para vídeo com IA; neste ranking, ele é o ponto de referência contra o qual todo o resto é medido.

Um pelotão, não um pódio

Os quatro primeiros modelos estão dentro de 18 pontos uns dos outros, com barras de erro de aproximadamente nove a dez. O Wan 3.0 lidera com 1.156. O Utopai X, que é pós-treinado no MiniMax H3 e não tem API pública, é o segundo com 1.148. Dreamina Seedance 2.5 vem em seguida com 1.142, e MiniMax H3 em 768p é o quarto com 1.138. O H3 Max da fal completa o grupo com 1.134.

Leia esses números como um grupo compacto, não como uma escada. Um modelo que pontua dentro da barra de erro do líder não é mensuravelmente pior que o líder. Três dos cinco primeiros são H3 ou construídos sobre ele, o que é o fato mais interessante: a base de pesos abertos lançada pela MiniMax se tornou o substrato sobre o qual outras equipes fazem pós-treinamento, do mesmo modo que as pessoas construíram sobre o Stable Diffusion há três anos.

Há uma história de distribuição por trás do ranking que o quadro torna visível pela primeira vez. Um ano atrás, o topo de um ranking de vídeo era uma lista de modelos fechados de um punhado de laboratórios bem financiados. Hoje, os cinco primeiros incluem uma base de pesos abertos e dois modelos pós-treinados sobre ela por equipes menores. O Utopai X não tem API pública, então o modelo que ocupa o segundo lugar em um ranking público continua fora do alcance de qualquer pessoa fora da empresa. Esse é um novo tipo de artefato de ranking, e diz algo sobre a rapidez com que uma boa rodada de pós-treinamento pode elevar uma base aberta à disputa.

No ranking complementar sem áudio, lançado no mesmo dia, o Wan 3.0 lidera com 1.129, com H3 e H3 Max em segundo e terceiro. Remover o áudio estreita o campo, o que sugere que a vantagem dos modelos chineses passa pelo tratamento de áudio, e não apenas pelos visuais. Isso também inverte a interpretação do ranking: um estúdio que só precisa de imagens silenciosas está diante de um quadro competitivo diferente de um que precisa de diálogo com sincronia labial.

O que a coluna de preço diz

O ranking também traz um preço por minuto, e essa coluna se lê de forma diferente da coluna de Elo. O Wan 3.0 custa US$ 12 por minuto de vídeo. O Seedance 2.5 é o modelo mais caro entre os dez primeiros, a US$ 34,12 por minuto. O MiniMax H3, que qualquer um pode baixar, sai a US$ 4,80 por minuto.

Um cartão de pontuação branco e vazio repousando sobre uma mesa de carvalho clara, com um único lápis fino deitado diagonalmente sobre ele, o cartão totalmente sem marcações

Então, o modelo de pesos abertos em terceiro lugar custa um quarto do que o líder cobra e um sétimo do que o modelo comercial em segundo lugar cobra. Para uma equipe lançando um produto, essa diferença importa mais do que dezenove pontos de Elo. A pergunta muda de "qual modelo é o melhor" para "qual modelo é bom o suficiente para que a conta por minuto não inviabilize o caso de negócio". O H3 é a resposta para muitas equipes que teriam pagado pelo Seedance um ano atrás.

O valor de US$ 34,12 por minuto do Seedance 2.5 merece uma segunda olhada, porque é a entrada mais cara do top ten e ocupa o terceiro lugar. O preço implica um cliente que valoriza a qualidade o suficiente para pagar sete vezes a tarifa dos pesos abertos, e esses clientes existem na publicidade e no cinema. O que o quadro não consegue mostrar é se esse prêmio sobrevive ao contato com um orçamento. Se uma produção precisa de duzentas tomadas, a diferença entre US$ 34 e US$ 4,80 por minuto é a diferença entre um projeto e um problema de planilha.

A liderança do Wan 3.0 vem com uma ressalva: ele está em beta comercial com acesso por convite. O H3 é o que você pode realmente comprar hoje a um preço publicado. Uma posição no ranking para um modelo que você não pode acessar é um sinal sobre para onde o campo está indo, não uma decisão de compra.

O ranking de edição de vídeo acrescenta uma segunda dimensão. O Wan 3.0 mantém o primeiro lugar ali, com Elo de 1.188, tirando a categoria do MiniMax H3, que a detinha desde sua estreia em agosto. A edição é onde vivem os fluxos de trabalho práticos, porque a maioria dos trabalhos comerciais de vídeo parte de imagens que já existem. Um modelo que lidera em geração, mas fica atrás em edição, é menos útil para uma equipe de produção do que um modelo forte nos dois. Atualmente, o Wan 3.0 lidera nos dois, que é a posição mais forte que qualquer modelo já ocupou neste quadro.

Kling 4.0 foi lançado como uma ficha técnica

A outra coisa que este quadro esclarece é quanto do recente lançamento do Kling 4.0 existe fora de um comunicado à imprensa. A conta da Kuaishou anunciou o modelo em 28 de setembro: até 4K, HDR de 10 bits, 15 referências multimodais, 10 keyframes, geração nativa de 30 segundos, áudio estéreo. A data de lançamento era "chega em outubro".

O que realmente foi lançado é o Kling 4.0 Flash, disponível para assinantes do Ultra Yearly. A página de recursos não traz preço, data, texto sobre resolução nem menção a outubro. A entrada mais recente do Kling em qualquer quadro da Artificial Analysis ainda é a 3.0. Um post de criador que revelou que a Kling pagou por ele diz que a saída do lançamento é 1080p e mais barata que o Seedance, o que entra em conflito com a manchete "até 4K".

Nada disso torna falsas as capacidades anunciadas. Significa que a lacuna entre um anúncio e um modelo utilizável é onde está a maior parte do trabalho, e este lançamento ainda não a fechou. Uma ficha técnica que lista 4K, HDR, quinze referências e dez keyframes descreve um conjunto de capacidades que, se for lançado, seria o mais forte do mercado aberto. Também descreve um conjunto de recursos que todo concorrente precisará responder em até um trimestre.

O padrão é familiar dos últimos dois anos de lançamentos de modelos. Os anúncios criam expectativas, e o intervalo antes da disponibilidade geral é onde o produto real é construído. Para o comprador, o conselho prático é o mesmo de sempre: não planeje um pipeline de produção com base em uma página de recursos. Planeje-o com base no que você pode chamar hoje.

O que observar

O próximo sinal é se o Wan 3.0 sai do beta com acesso por convite e publica um preço. Se isso acontecer, a diferença entre o líder e o grupo de pesos abertos se torna uma decisão orçamentária real, e não teórica.

O segundo sinal é o próprio Kling 4.0. Seu último carro-chefe definiu a âncora nesta escala. O próximo já está sendo precificado nas expectativas antes que alguém fora da Kuaishou o tenha executado. Quando ele chegar, chegará contra um quadro em que três das cinco primeiras posições já estão ocupadas por modelos que custam menos.

O terceiro é o que acontece com a própria âncora. O Kling 3.0 está em 1.000 por definição. Se o Kling 4.0 for lançado e ficar acima dele, o ponto fixo da escala se move e cada Elo no quadro passa a ser uma comparação com uma nova linha de base. Esse é o momento em que este ranking deixa de descrever setembro e começa a descrever para onde o ano está indo.

Artigos relacionados