O Wan 3.0 Acabou de Liderar o Ranking de Vídeo. A História dos Pesos Abertos Agora É uma História de Vídeo.

Durante a maior parte do boom da IA generativa, a conversa sobre pesos abertos pertenceu às imagens. O Stable Diffusion provou que era possível rodar um modelo de verdade na própria GPU, e todo um ecossistema de LoRAs e ControlNets cresceu ao seu redor. Vídeo era diferente. Os melhores modelos de vídeo permaneciam trancados atrás de APIs, e "vídeo open source" significava modelos pequenos que ficavam atrás dos líderes fechados.
Isso mudou neste mês. O Wan 3.0, modelo de vídeo da Alibaba, assumiu o primeiro lugar no benchmark AA-Video-T2V v2.0 de nova geração da Artificial Analysis, construído a partir de mais de 68.000 votos de preferência humana em cerca de mil prompts. O Wan 3.0 registrou um Elo de 1157 e conquistou o primeiro lugar em 10 dos 20 rankings de categoria. O mesmo ranking também colocou o Wan 3.0 em primeiro em edição de vídeo, à frente do Seedance, da ByteDance, e do H3, da MiniMax.
O significado tem menos a ver com um número e mais com o que ele representa. Um modelo chinês de pesos abertos agora é competitivo com — e, em vários rankings, está à frente de — o Veo 3.1, do Google, e o restante do campo fechado. O preço conta a mesma história. O Wan 3.0 custa de US$ 0,05 a US$ 0,20 por segundo, dependendo da resolução, contra US$ 0,40 do Veo 3.1 no nível padrão. A Alibaba levantou US$ 10 bilhões em uma colocação de ações em Hong Kong para financiar exatamente essa ofensiva, e a estratégia é clara: vender barato, ganhar participação, fazer do cliente corporativo o motor de crescimento.
Tecnicamente, o Wan 3.0 foi construído para consistência e entrada estruturada. Ele gera clipes de até 30 segundos em uma única passada, o dobro do limite de 15 segundos do seu antecessor, a até 1080p, com microexpressões sincronizadas e voz multilíngue. Mais interessante ainda, ele aceita documentos, PDFs, PowerPoints e planilhas como entrada, transformando um deck de slides ou um relatório em vídeo. Esse ângulo de documento para vídeo mira diretamente nos fluxos de trabalho corporativos, não apenas em criadores individuais.
O recurso de documento para vídeo merece mais atenção do que recebe. A maioria dos modelos de vídeo quer um prompt de texto ou uma imagem. O Wan 3.0 quer os seus ativos existentes — o deck que você já fez, o relatório que você já escreveu — e os trata como fonte da verdade. Para um negócio que vive de documentos, isso reduz a fricção de ir de "temos um relatório" para "temos um vídeo" a quase nada. É o primeiro modelo a fazer do pipeline de documentos corporativos o ponto de entrada, e é uma jogada discretamente inteligente.
Para uma equipe escolhendo uma stack de vídeo, isso reembaralha a decisão. A velha suposição de que modelos abertos são aquilo a que você recorre quando não pode pagar ou não pode usar os fechados está se enfraquecendo. Agora você pode hospedar por conta própria um modelo que lidera o ranking, o que importa para os casos que não têm nada a ver com qualidade e tudo a ver com controle. Um cliente cujos dados não podem sair da sua infraestrutura não tem opção em conformidade além de um modelo auto-hospedado, e pela primeira vez essa opção não é um compromisso na qualidade do resultado.
Há uma ressalva que é ignorada no entusiasmo. Auto-hospedar não é gratuito só porque os pesos são. Você paga em GPUs, em trabalho de integração, no esforço contínuo de manter um pipeline saudável em qualquer volume que o seu trabalho realmente alcance. O modelo é gratuito; a engenharia não é. Para a maioria das equipes pequenas, um endpoint hospedado ainda vence no custo total até que o volume justifique o hardware.
O contexto do benchmark importa para ler a vitória corretamente. O benchmark AA-Video-T2V v2.0 é a nova geração de avaliação por preferência humana e julga todos os modelos em 1080p, o que elimina o velho truque de vencer em baixa resolução. O Wan 3.0 ficou em primeiro em dez dos vinte rankings de categoria e registrou o Elo geral mais alto, de 1157. Isso não é uma vitória de nicho nem uma categoria favorável; é um resultado amplo e competitivo contra todo o campo, incluindo os modelos que custam oito vezes mais por segundo. Quando um modelo aberto que custa US$ 0,05 por segundo supera um modelo fechado que custa US$ 0,40, a proposta de valor é difícil de contestar.
Há também uma dimensão política difícil de ignorar. A corrida de vídeo por IA tornou-se um proxy para uma competição maior entre laboratórios chineses e americanos, e a coroa de benchmark do Wan 3.0 é o tipo de resultado citado nos dois países por razões diferentes. Na China, é prova de que a stack doméstica pode competir em qualidade, não só em preço. Nos EUA, é evidência de que o custo de computação não é a única coisa que está mudando. Nenhum dos dois enquadramentos captura plenamente o que está acontecendo, que é uma convergência competitiva genuína que beneficia os usuários na forma de preços mais baixos e modelos abertos mais capazes.
A travessia dos pesos abertos para o vídeo também tem implicações para a geopolítica mais ampla da IA. Os laboratórios chineses vêm ganhando a guerra de preços há um tempo, e agora também estão ganhando em benchmarks, o que muda a narrativa de "imitação barata" para "genuinamente competitivo". A mesma dinâmica já se desenrolou na geração de imagens com o Qwen-Image e o Z-Image, e em modelos de linguagem com o DeepSeek e o Qwen. O vídeo era o último grande reduto dos laboratórios fechados ocidentais, e o Wan 3.0 acabou de mostrar que a porta está aberta.
A coroa do benchmark é a manchete, mas a história real é que a geração de vídeo agora tem um caminho aberto crível. As mesmas dinâmicas que se seguiram ao Stable Diffusion provavelmente se repetirão aqui: fine-tunes, nós de controle da comunidade, implantações regionais e uma cauda longa de casos de uso que os fornecedores de API nunca se deram ao trabalho de atender. Modelos abertos ajustados já são a forma padrão de manter um personagem ou estilo específico no trabalho com imagens, e criadores de vídeo vão querer a mesma capacidade de treinar com a própria marca ou produto.
Já há evidências iniciais desse ecossistema se formando. O ecossistema do MiniMax H3 produziu um construtor de prompts de código aberto e uma onda de fine-tunes da comunidade voltados para anime e personagens, espelhando o manual do Stable Diffusion. Quando os pesos abertos são bons o suficiente para liderar um benchmark, a comunidade que se forma ao redor deles deixa de ser um nicho; é o mainstream, e as inovações que dela surgem — nós de controle, hospedagem regional, inferência local que preserva a privacidade — tendem a chegar mais rápido do que qualquer fornecedor isolado consegue entregar.
A implicação prática para uma equipe é concreta e vale repetir. Se você está escolhendo uma stack de vídeo no fim de 2026, a questão já não é "aberto ou fechado" em termos de qualidade. É uma questão de controle, custo e risco de saída. Pesos abertos lhe dão o primeiro e reduzem o terceiro, ao custo do segundo. APIs fechadas lhe dão conveniência ao custo de todos os três. As equipes que atravessarão a próxima descontinuação de modelo sem dor são aquelas que já decidiram onde se posicionam nesse trade-off, em vez de descobrir da pior forma quando o fornecedor anuncia o encerramento.
Para quem constrói sobre vídeo generativo, a lição prática é parar de tratar pesos abertos como um plano B. Trate-os como uma opção estratégica. Na próxima vez que um fornecedor fechado descontinuar um modelo como a OpenAI acabou de fazer com o Sora, as equipes que não estarão correndo contra o tempo serão aquelas que mantiveram ao menos um pé no caminho aberto. Os pesos abertos costumavam ser o prêmio de consolação. Em vídeo, eles acabaram de se tornar a vitrine de troféus.
Artigos relacionados
O ranking de modelos de vídeo que ninguém divulga: para onde as requisições realmente vão
Toda semana surge um novo ranking de geração de vídeo, e quase todos são construídos da mesma forma.
A Ai2 Tornou Open Source o Stack de Treinamento, e Não Mais um Conjunto de Pesos
Pesos são fáceis de distribuir e difíceis de aprender com eles.
Qwen3.8-Max, da Alibaba, afirma que consegue programar sozinho por uma quinzena
Contagens de parâmetros deixaram de ser novidade há algum tempo. Doze dias é o número que vale examinar.
PixelUMM descarta os dois componentes dos quais todo modelo de IA visual depende
A difusão em nível de pixel já foi proposta antes e repetidamente esbarrou no custo computacional.