Wan 3.0 Lidera o Ranking de Vídeo Reconstruído, e Kling 3.0 se Torna Sua Âncora

A Artificial Analysis reconstruiu seu ranking de texto para vídeo em 30 de setembro. A nova escala, AA-Video-T2V v2.0, avalia todos os modelos em 1080p e se baseia em mais de 68.000 votos de preferência humana em cerca de 1.000 prompts, agrupados em dez categorias de uso e dez eixos de capacidade. O Wan 3.0 fica em primeiro lugar com áudio, com Elo de 1.156, e ocupa o topo em dez dos vinte rankings de categoria.
O número que diz mais sobre o estado do mercado é o que está na parte de baixo. O Kling 3.0 em 1080p é a âncora fixa em 1.000. Ninguém fica abaixo dele porque a escala está fixada nesse ponto. O antigo carro-chefe da Kuaishou costumava ser o padrão doméstico para vídeo com IA; neste ranking, ele é o ponto de referência contra o qual todo o resto é medido.
Um pelotão, não um pódio
Os quatro primeiros modelos estão dentro de 18 pontos uns dos outros, com barras de erro de aproximadamente nove a dez. O Wan 3.0 lidera com 1.156. O Utopai X, que é pós-treinado no MiniMax H3 e não tem API pública, é o segundo com 1.148. Dreamina Seedance 2.5 vem em seguida com 1.142, e MiniMax H3 em 768p é o quarto com 1.138. O H3 Max da fal completa o grupo com 1.134.
Leia esses números como um grupo compacto, não como uma escada. Um modelo que pontua dentro da barra de erro do líder não é mensuravelmente pior que o líder. Três dos cinco primeiros são H3 ou construídos sobre ele, o que é o fato mais interessante: a base de pesos abertos lançada pela MiniMax se tornou o substrato sobre o qual outras equipes fazem pós-treinamento, do mesmo modo que as pessoas construíram sobre o Stable Diffusion há três anos.
Há uma história de distribuição por trás do ranking que o quadro torna visível pela primeira vez. Um ano atrás, o topo de um ranking de vídeo era uma lista de modelos fechados de um punhado de laboratórios bem financiados. Hoje, os cinco primeiros incluem uma base de pesos abertos e dois modelos pós-treinados sobre ela por equipes menores. O Utopai X não tem API pública, então o modelo que ocupa o segundo lugar em um ranking público continua fora do alcance de qualquer pessoa fora da empresa. Esse é um novo tipo de artefato de ranking, e diz algo sobre a rapidez com que uma boa rodada de pós-treinamento pode elevar uma base aberta à disputa.
No ranking complementar sem áudio, lançado no mesmo dia, o Wan 3.0 lidera com 1.129, com H3 e H3 Max em segundo e terceiro. Remover o áudio estreita o campo, o que sugere que a vantagem dos modelos chineses passa pelo tratamento de áudio, e não apenas pelos visuais. Isso também inverte a interpretação do ranking: um estúdio que só precisa de imagens silenciosas está diante de um quadro competitivo diferente de um que precisa de diálogo com sincronia labial.
O que a coluna de preço diz
O ranking também traz um preço por minuto, e essa coluna se lê de forma diferente da coluna de Elo. O Wan 3.0 custa US$ 12 por minuto de vídeo. O Seedance 2.5 é o modelo mais caro entre os dez primeiros, a US$ 34,12 por minuto. O MiniMax H3, que qualquer um pode baixar, sai a US$ 4,80 por minuto.

Então, o modelo de pesos abertos em terceiro lugar custa um quarto do que o líder cobra e um sétimo do que o modelo comercial em segundo lugar cobra. Para uma equipe lançando um produto, essa diferença importa mais do que dezenove pontos de Elo. A pergunta muda de "qual modelo é o melhor" para "qual modelo é bom o suficiente para que a conta por minuto não inviabilize o caso de negócio". O H3 é a resposta para muitas equipes que teriam pagado pelo Seedance um ano atrás.
O valor de US$ 34,12 por minuto do Seedance 2.5 merece uma segunda olhada, porque é a entrada mais cara do top ten e ocupa o terceiro lugar. O preço implica um cliente que valoriza a qualidade o suficiente para pagar sete vezes a tarifa dos pesos abertos, e esses clientes existem na publicidade e no cinema. O que o quadro não consegue mostrar é se esse prêmio sobrevive ao contato com um orçamento. Se uma produção precisa de duzentas tomadas, a diferença entre US$ 34 e US$ 4,80 por minuto é a diferença entre um projeto e um problema de planilha.
A liderança do Wan 3.0 vem com uma ressalva: ele está em beta comercial com acesso por convite. O H3 é o que você pode realmente comprar hoje a um preço publicado. Uma posição no ranking para um modelo que você não pode acessar é um sinal sobre para onde o campo está indo, não uma decisão de compra.
O ranking de edição de vídeo acrescenta uma segunda dimensão. O Wan 3.0 mantém o primeiro lugar ali, com Elo de 1.188, tirando a categoria do MiniMax H3, que a detinha desde sua estreia em agosto. A edição é onde vivem os fluxos de trabalho práticos, porque a maioria dos trabalhos comerciais de vídeo parte de imagens que já existem. Um modelo que lidera em geração, mas fica atrás em edição, é menos útil para uma equipe de produção do que um modelo forte nos dois. Atualmente, o Wan 3.0 lidera nos dois, que é a posição mais forte que qualquer modelo já ocupou neste quadro.
Kling 4.0 foi lançado como uma ficha técnica
A outra coisa que este quadro esclarece é quanto do recente lançamento do Kling 4.0 existe fora de um comunicado à imprensa. A conta da Kuaishou anunciou o modelo em 28 de setembro: até 4K, HDR de 10 bits, 15 referências multimodais, 10 keyframes, geração nativa de 30 segundos, áudio estéreo. A data de lançamento era "chega em outubro".
O que realmente foi lançado é o Kling 4.0 Flash, disponível para assinantes do Ultra Yearly. A página de recursos não traz preço, data, texto sobre resolução nem menção a outubro. A entrada mais recente do Kling em qualquer quadro da Artificial Analysis ainda é a 3.0. Um post de criador que revelou que a Kling pagou por ele diz que a saída do lançamento é 1080p e mais barata que o Seedance, o que entra em conflito com a manchete "até 4K".
Nada disso torna falsas as capacidades anunciadas. Significa que a lacuna entre um anúncio e um modelo utilizável é onde está a maior parte do trabalho, e este lançamento ainda não a fechou. Uma ficha técnica que lista 4K, HDR, quinze referências e dez keyframes descreve um conjunto de capacidades que, se for lançado, seria o mais forte do mercado aberto. Também descreve um conjunto de recursos que todo concorrente precisará responder em até um trimestre.
O padrão é familiar dos últimos dois anos de lançamentos de modelos. Os anúncios criam expectativas, e o intervalo antes da disponibilidade geral é onde o produto real é construído. Para o comprador, o conselho prático é o mesmo de sempre: não planeje um pipeline de produção com base em uma página de recursos. Planeje-o com base no que você pode chamar hoje.
O que observar
O próximo sinal é se o Wan 3.0 sai do beta com acesso por convite e publica um preço. Se isso acontecer, a diferença entre o líder e o grupo de pesos abertos se torna uma decisão orçamentária real, e não teórica.
O segundo sinal é o próprio Kling 4.0. Seu último carro-chefe definiu a âncora nesta escala. O próximo já está sendo precificado nas expectativas antes que alguém fora da Kuaishou o tenha executado. Quando ele chegar, chegará contra um quadro em que três das cinco primeiras posições já estão ocupadas por modelos que custam menos.
O terceiro é o que acontece com a própria âncora. O Kling 3.0 está em 1.000 por definição. Se o Kling 4.0 for lançado e ficar acima dele, o ponto fixo da escala se move e cada Elo no quadro passa a ser uma comparação com uma nova linha de base. Esse é o momento em que este ranking deixa de descrever setembro e começa a descrever para onde o ano está indo.
Artigos relacionados
Fotos de satélite agora são dados de treinamento de robôs
O gargalo no treinamento de IA física deixou de ser o poder computacional ou a capacidade do modelo. Passou a ser a qualidade do mundo sintético.
O Gemini 3.5 Live Translate do Google elimina a pausa
Tradução que roda continuamente, na própria voz do falante, em um celular que já está no seu bolso, move o recurso de algo que você abre para algo que simplesmente está ligado.
A China escreveu a primeira norma de segurança obrigatória para agentes de IA
A segurança deixa de ser um recurso que você anuncia para se tornar um portão que você precisa atravessar. O inventário de riscos está em 13 categorias e 97 itens.
Conteúdo gerado por IA agora precisa revelar sua identidade
Esse passo não resolve todos os problemas, mas transforma “gerado por IA” de uma opção que podia ser ocultada em uma pergunta que precisa ser respondida.