← Voltar ao blog
Aicerca de 8 min de leitura

Vidu Q3 dividiu a referência para vídeo em três produtos. Isso é uma decisão de empacotamento tanto quanto de modelo.

Publicado 5 de out. de 2026
Vidu Q3 dividiu a referência para vídeo em três produtos. Isso é uma decisão de empacotamento tanto quanto de modelo.

A maioria dos lançamentos de modelos de vídeo é anunciada uma vez e depois aparece em todos os lugares sob um único nome. A Vidu fez o oposto com sua linha Q3 de referência para vídeo.

Em 14 de setembro, o Model Studio da Alibaba Cloud listou três modelos Vidu Q3 de referência para vídeo separados. O primeiro, viduq3-mix, é um modelo de uso geral que recebe imagens de referência e um prompt de texto e mistura os sujeitos dessas imagens na cena descrita. O segundo, viduq3-ad, é feito para publicidade, com cortes de cena de nível mercadológico, movimento de câmera e saída direta de áudio; você envia imagens de produto e recebe um vídeo publicitário. O terceiro, viduq3-drama, é voltado para produção de drama e mangá com IA, com consistência de personagem, efeitos de movimento e expressão emocional ajustados para conteúdo orientado por história.

Todos os três custam US$ 0,14 por segundo para 720p ou 1080p, com limite de 5 solicitações por segundo. O preço é idêntico entre os três, o que mostra que a diferenciação não está no custo, mas no comportamento da saída.

O problema que a Vidu realmente se propôs a resolver

A Vidu vem da Shengshu Technology, em Pequim. Seu modelo Q3 foi lançado em 30 de janeiro de 2026 e imediatamente entrou no circuito de benchmarks. A Artificial Analysis o classificou em primeiro lugar na China e segundo no mundo no lançamento, à frente de Runway Gen-4.5, Google Veo 3.1 e Sora 2 da OpenAI, com pontuação de 1241.

As três mudanças técnicas por trás dessa classificação merecem ser nomeadas. O Q3 foi um dos primeiros modelos de vídeo de formato longo a produzir diálogo sincronizado, efeitos sonoros e música de fundo na mesma passagem que os visuais, em vez de adicionar áudio na pós-produção. Ele estendeu clipes de uma única execução para 16 segundos, o que era o mais longo entre os principais modelos na época. E construiu um sistema de referência para vídeo no qual os usuários enviam de três a sete imagens de um personagem, objeto ou estilo, e o modelo as usa como âncoras visuais em gerações posteriores.

O sistema de referência é o mais interessante. A maioria dos modelos de vídeo em 2026 compete no mesmo eixo: fazer um único clipe parecer impressionante. A aposta da Vidu foi diferente. O discurso nunca foi "veja esta cena linda". Foi "veja este mesmo personagem em dez cenas e note que ele ainda parece a mesma pessoa".

Esse é um problema mais difícil, e é dele que o conteúdo em série realmente depende. Em uma comparação com Runway Gen-4, Kling 3.0, Luma Ray, Pika 2.0 e Sora 2 usando o mesmo prompt de personagem em seis variações de cena, o Vidu Q3 manteve a consistência facial e de figurino em cinco dos seis testes.

A consistência é o que separa uma ferramenta para clipes isolados de uma ferramenta para séries. Para criadores de anime, produtores de dramas curtos e qualquer pessoa que construa conteúdo de marca em torno de um personagem recorrente, isso muda o que é possível.

Por que três SKUs importam

Dividir uma família de modelos em três produtos nomeados parece uma escolha de marketing. Está mais para uma decisão de aquisição.

Três cilindros escuros simples enfileirados sobre uma superfície reflexiva com fumaça à deriva

Uma equipe de publicidade e um estúdio de dramas curtos não compram a mesma coisa, mesmo que o transformer subjacente seja semelhante. O comprador de anúncios precisa de fidelidade de produto, transições de cena limpas e áudio que possa ficar sob uma voz de marca. O comprador de dramas precisa de um personagem que mantenha a identidade ao longo de episódios e cenas, com expressões que soem como atuação. Empacotar isso como IDs de modelo separados, com documentação separada, permite que cada comprador avalie e orce exatamente para um trabalho, em vez de ler uma lista de recursos de uso geral e adivinhar.

O modelo mix de uso geral, então, atende todos que estão fora das duas caixas, uma estrutura razoável para um mercado em que o comprador é cada vez mais uma equipe de produção com prazo, em vez de um hobista testando prompts.

Vidu Claw e a camada de pipeline

Empacotar os modelos é metade da estratégia. A outra metade é uma camada de montagem. O Vidu Claw é um mecanismo de automação de criação com IA construído sobre o framework open-source OpenClaw e alimentado pelo Q3. Você conecta seus tokens da Vidu, define Skills e automatiza o caminho da ideia ao vídeo finalizado. Um único prompt como "crie um anúncio de formato curto para um tênis de corrida voltado a mulheres jovens no Instagram" basta para o Vidu Claw gerar um conceito, roteiro, storyboard, visuais, narração, música e corte final.

Análises independentes têm sido mistas de uma forma útil. Um avaliador que o testou em um comercial de produto achou a plataforma genuinamente gratuita e acessível para estudantes e iniciantes, mas relatou que ela tinha dificuldades com detalhes estruturais precisos. Em um caso, ela continuou renderizando um detalhe de uma forma que se destacava mesmo após repetidas correções de prompt, e a saída carregava um sabor de IA perceptível, com iluminação e cor que pareciam baratas.

Esse é o trade-off honesto. O Vidu Claw é uma ferramenta de produtividade para criadores solo e pequenas equipes de marketing que precisam passar do conceito a um rascunho usável rapidamente, em vez de uma substituta para uma equipe de produção profissional. Quando funciona, comprime um ciclo de produção publicitária de cinco dias em um dia. Quando não funciona, os problemas de qualidade são difíceis de ignorar.

O ecossistema que a Vidu está construindo

O foco em referência para vídeo se conecta a uma história de distribuição. Em fevereiro de 2026, a empresa de software Wondershare anunciou um investimento estratégico na Shengshu, com as duas planejando trabalhar em mangá com IA. O modelo Vidu Q3 foi integrado a uma plataforma de produção de mangá com IA de cadeia completa, usada para manter personagens, vozes e cenas consistentes entre episódios. A plataforma Bailian, da Alibaba Cloud, também adicionou o Vidu Q3 como modelo de terceiros em maio de 2026.

Assim, o modelo passa por pelo menos três canais: acesso direto via web e API, uma plataforma de criação voltada para mangá e dramas curtos, e um marketplace de modelos em nuvem. Cada canal tem um comprador diferente com uma definição diferente de "bom o suficiente".

Onde o dinheiro realmente está

A mudança para conteúdo em série não é uma preferência criativa. É onde estão os orçamentos. Um drama curto é um produto de vários episódios com um elenco recorrente, e sua economia depende de produzir muito mais filmagem do que um único anúncio ou clipe isolado. Se um modelo força o criador a voltar à estaca zero na aparência do personagem a cada tomada, a economia obtida com a filmagem gerada é consumida por correções de consistência. A aposta da Vidu é que a equipe disposta a pagar US$ 0,14 por segundo não está comprando uma única cena bonita, mas uma forma de manter a mesma pessoa reconhecível ao longo de toda uma produção.

É também por isso que o sistema de referência importa mais do que a pontuação bruta de qualidade. Um modelo que fica em segundo lugar no mundo em um benchmark é impressionante, mas o benchmark mede clipes. O recurso de referência mede séries. Os dois não são a mesma compra, e a Vidu está vendendo para o segundo.

Onde ele ainda não entrega

A consistência de referência não é perfeita, e cinco de seis não é seis de seis. Onde o sexto caso falhou, a ferramenta entregou um rosto e um figurino que se afastaram da fonte, que é exatamente a falha que quebra uma série. O custo é real a US$ 0,14 por segundo, o que soma rapidamente ao longo de um clipe de 16 segundos e se torna significativo em escala de série, em que centenas de tomadas estão em jogo. A camada de pipeline produz rascunhos, não comerciais finalizados, e avaliadores descobriram que ela não consegue corrigir de forma confiável um detalhe estrutural mesmo com repetidas correções de prompt.

Há também um limite estrutural que vale nomear. A referência para vídeo ancora a identidade, mas ainda não resolve a continuidade de toda uma produção. Alguém ainda precisa tomar as decisões de direção que transformam um conjunto de clipes consistentes em uma história, e o modelo não tem opinião sobre ritmo, cobertura ou se uma cena deveria existir.

O que observar

A estrutura de três SKUs é a parte que outros fornecedores provavelmente vão copiar. Se a referência para vídeo se tornar a forma padrão de produzir conteúdo em série, espere que mais famílias de modelos lancem variantes específicas para cada trabalho em vez de um único carro-chefe. As perguntas que importam a seguir são se a consistência se mantém em durações mais longas e trabalhos de câmera mais difíceis, e se a camada de pipeline fica boa o suficiente para vender a um estúdio, em vez de a um criador solo.

Artigos relacionados