← Voltar ao blog
Aicerca de 8 min de leitura

A próxima batalha do vídeo com IA é sobre entender o mundo

Publicado 2 de out. de 2026
A próxima batalha do vídeo com IA é sobre entender o mundo

Durante a maior parte dos últimos dois anos, a forma de avaliar um modelo de vídeo com IA era simples: olhar o quão bonitos os quadros eram. Esse teste está chegando ao limite. Quando vários modelos conseguem produzir um clipe convincente de cinco segundos de uma pessoa caminhando por uma cidade, a qualidade de imagem deixa de diferenciá-los. Algo mais precisa fazer isso.

Em setembro, uma startup chinesa chamada HiDream.ai lançou o HiDream-O1-Video-1.0, ou HD-V1, e fez desse "algo mais" todo o seu discurso de venda. O modelo, segundo a empresa, foi construído para entender como os eventos devem se desenrolar, e não apenas como um único quadro deve parecer.

O problema dos quadros bonitos

Qualquer pessoa que já passou tempo gerando vídeos conhece os modos de falha. Você pede que um personagem empurre uma porta de madeira pesada, e o modelo desenha a mão empurrando para a esquerda enquanto a porta abre para a direita. Você pede que alguém corra de um lugar a outro ao longo de cinco segundos, e o personagem termina o diálogo, fica sem tempo e se teletransporta. O clipe parece bom até você realmente assisti-lo.

Regerar repetidamente consome tempo e créditos, e um clipe de quinze segundos pode custar muito mais do que o orçamento permitia. A lacuna não é resolução nem duração. É física, causa e efeito. O modelo pinta cada quadro sem entender que uma porta precisa girar na direção em que a mão empurra, ou que se deslocar entre dois pontos leva tempo.

É essa lacuna que o HD-V1 mira. A HiDream afirma que o modelo reforça sua compreensão de duração de ações, relações entre objetos, lógica de eventos e alinhamento audiovisual antes de gerar, de modo que o resultado se mantém coeso como uma sequência, e não como um empilhamento de imagens estáticas.

Uma tira de storyboard holográfico mostrando a silhueta de uma figura empurrando uma porta na direção correta

Quatro modelos chineses, três abordagens

Para entender por que isso importa, ajuda olhar quem mais está no topo dos rankings. Em setembro de 2026, quatro modelos chineses haviam chegado à primeira linha da geração de vídeo global: o Seedance 2.0 e 2.5, da ByteDance, o H3, da MiniMax, o Wan 3.0, da Alibaba, e o HD-V1, da HiDream. Um ano antes, modelos chineses de vídeo mal apareciam nos principais benchmarks internacionais. Agora eles se agrupam perto do topo.

Chegaram lá por caminhos diferentes. O Seedance se apoia na pilha completa de computação, engenharia e produto da ByteDance. O MiniMax H3 se baseia em uma grande base de modelo e em uma grande base de usuários, estendendo-se para o vídeo. O Wan 3.0 está embutido no ecossistema mais amplo da Alibaba, com o Qwen e o Alibaba Cloud. A HiDream é a exceção entre eles: uma startup sem os recursos nem a distribuição de um gigante, apostando, em vez disso, em uma arquitetura que chama de modelo de mundo omni-modal nativo, projetada para permitir que imagens, vídeo, interação 3D e inteligência incorporada compartilhem uma mesma base.

O HD-V1 aceita entradas de texto, imagem e vídeo e gera de 5 a 20 segundos de vídeo em 1080p. A equipe afirma que ele teve bom desempenho em dois rankings internacionais, e a alegação que mais se destaca é a da compreensão do mundo: a ideia de que o modelo gera sequências mais coerentes porque modela como os eventos progridem.

Por que a "compreensão" é a nova fronteira

Quando várias equipes conseguem atingir o mesmo patamar de qualidade, a competição se desloca para o que o modelo sabe sobre o mundo. Resolução e duração passam a ser recursos básicos, e não diferenciais. As perguntas mais difíceis são aquelas que a qualidade de imagem não consegue responder: se um objeto em movimento obedece às regras da física, se ação e som permanecem sincronizados, se um evento decorre do anterior.

A indústria tem outros nomes para a mesma ideia. Produtos concorrentes e o mercado em geral falam em consistência, compreensão de intenção e entrega estável. Uma empresa chinesa de vídeo, a ZhiXiang Future, chegou a publicar uma estrutura de avaliação em cinco partes para agentes de vídeo, abrangendo consistência, intenção, completude audiovisual, linha do tempo e narrativa, e entrega estável. Os nomes mudam, o alvo é o mesmo: modelos em que se pode confiar para concluir uma sequência, e não apenas iniciá-la.

Há dinheiro por trás disso. O Goldman Sachs estimou que o mercado global de geração de vídeo por IA crescerá cerca de dez vezes em cinco anos, chegando a aproximadamente 29 bilhões de dólares até 2030. Esse tipo de previsão puxa investimentos para tudo o que pareça o próximo salto real de capacidade, e "entende o mundo" é o candidato atual.

Os rankings discordam entre si

Parte do que torna o campo de vídeo difícil de julgar é que os placares não concordam entre si. Em setembro, a arena da comunidade coroou uma família de modelos, avaliadores humanos pontuando clipes individuais preferiram outra, e quem escreve prompts, votando com o próprio uso, escolheu uma terceira. Um retrato do Elo da comunidade colocou a linha Gemini Omni, do Google, no topo, com o Flux 3 Video, da Black Forest Labs, como a entrada mais forte no que se aproxima do código aberto, e os Seedance 2.0 e 2.5, da ByteDance, logo atrás. Já os avaliadores humanos, pontuando clipes em uma escala de qualidade de um a cinco, colocaram o Seedance 2.0 em primeiro lugar, à frente do Kling, do Wan e até do seu próprio sucessor. Em volume bruto de uso, o Seedance e o Veo 3, do Google, dominam o volume de prompts, enquanto o Wan domina o nicho local e aberto.

A lição desses três conjuntos de dados é que "melhor modelo" depende inteiramente do que se está medindo. O Veo fica mais baixo nas avaliações humanas de clipes silenciosos do que nas arenas, porque sua força está no áudio nativo e no diálogo, que uma rubrica de avaliação sem som não consegue ver. O Seedance 2.5 pontuar abaixo do 2.0 em qualidade por clipe é um lembrete de que versões mais novas nem sempre são mais impressionantes nos prompts que as pessoas realmente escrevem. Quem escolhe uma ferramenta para um projeto deveria ler mais de um placar antes de decidir, e dar mais peso ao placar que combina com o próprio trabalho.

O que essa mudança significa para os criadores

Para quem de fato cria coisas com essas ferramentas, o efeito prático é uma mudança no que quebra. Quando um modelo entende a lógica dos eventos, a falha se desloca do óbvio para o sutil. Você para de brigar com personagens que se teletransportam e portas que abrem para o lado errado, e começa a notar problemas menores: uma ação que dura um instante a mais, uma reação que não decorre da fala anterior. Esses são os problemas que um diretor humano deveria captar.

É a mesma lição que o boom dos dramas curtos na China já ensinou. A IA agora consegue gerar os planos, mas um episódio finalizado ainda precisa de alguém decidindo quais planos pertencem ali, em que ordem e por quê. Os modelos estão ficando melhores no quadro. O julgamento sobre quais quadros importam continua sendo trabalho humano, e pode continuar assim por mais tempo do que os otimistas esperam.

A corrida entre quatro também importa por um motivo mais discreto. Empresas diferentes atacando o mesmo problema a partir de direções diferentes — a pilha de um gigante aqui, a arquitetura de uma startup ali — reduzem a dependência da indústria em relação a um único caminho técnico. Se a compreensão do mundo se revelar o alvo certo, mais de uma equipe está apontada para ele neste momento. E se se revelar o alvo errado, o campo se protegeu.

Por ora, a leitura honesta é que o HD-V1 é mais uma entrada forte em um campo lotado, com alegações que terceiros ainda não testaram. O que não está em dúvida é a direção. Os modelos que vencerem a próxima rodada não serão os que desenham o quadro único mais bonito. Serão os que conseguem sustentar uma história por vinte segundos sem que algo quebre. Entender o mundo é o problema mais difícil e, pela primeira vez, muitas equipes bem financiadas estão trabalhando nele ao mesmo tempo.

Artigos relacionados