← Voltar ao blog
Aicerca de 8 min de leitura

O método dos dois quadros: como a interpolação de primeiro e último quadro mudou o planejamento de vídeo com IA

Publicado 10 de out. de 2026
O método dos dois quadros: como a interpolação de primeiro e último quadro mudou o planejamento de vídeo com IA

O Google atualizou o recurso Primeiro e Último Quadro para Vídeo do Veo 3.1 em 9 de outubro. Você envia duas imagens estáticas, o quadro inicial e o quadro final, e o modelo gera o movimento entre eles. A saída chega a 4K a 60 fps com áudio nativo, oferece suporte a proporção vertical 9:16 e aceita três ou quatro imagens de referência para manter personagens e estilo consistentes.

Isso, por si só, parece uma pequena adição. Na prática, muda a forma como as pessoas planejam um plano, porque coloca as duas decisões que realmente importam de volta no início do processo.

O problema do vídeo baseado apenas em prompts

Durante a maior parte dos últimos dois anos, o vídeo com IA funcionou como um caça-níqueis. Você escrevia um parágrafo, esperava e via algo surgir. O resultado muitas vezes era bom o suficiente para postar e raramente bom o suficiente para veicular. Se o personagem se desviava ou a câmera fazia algo estranho, você reescrevia o prompt e tentava de novo.

Os criadores aprenderam a contornar isso. Geravam uma imagem estática forte e depois pediam que um modelo a animasse, o que é imagem para vídeo. Isso fixava o quadro inicial, mas ninguém controlava onde o plano terminava. Os clipes tendiam a perder o fôlego ou a inventar um final que ninguém pediu.

Definir as duas pontas elimina boa parte desse achismo. Você decide onde o público começa a olhar e onde termina de olhar. O trabalho do modelo fica mais restrito: conectar as duas.

Por que o pensamento em storyboard voltou

Estúdios de animação trabalham assim há um século. Um animador desenha uma pose-chave, depois outra pose-chave, e preenche os desenhos entre elas. O ofício está em escolher as poses, não em desenhar cada quadro. O vídeo com IA está chegando à mesma divisão de trabalho por um caminho diferente.

Isso não é exclusivo do Veo. A corrida por controlabilidade vem crescendo há meses. O Kling 4.0 foi lançado com dez quadros-chave e clipes nativos de 30 segundos. O Seedance 2.5 pode refilmar filmagens existentes a partir de um novo ângulo de câmera. O Wan 3.0 liderou o benchmark AA-Video-T2V v2.0 da Artificial Analysis com um Elo de 1157 a cerca de US$ 12 por minuto. A prévia do Q4 do Vidu, lançada em 7 de outubro, começa em cerca de US$ 0,014 por segundo e aceita até 15 imagens de referência. O que os modelos mais fortes têm em comum tem menos a ver com qualidade bruta e mais com a precisão com que você consegue conduzi-los.

Uma linha do tempo com dois quadros-chave conectados por um arco de movimento brilhante

Como é uma configuração que funciona

O método dos dois quadros só compensa se os dois quadros valerem a pena ser conectados. Alguns hábitos ajudam.

Gere os quadros com um modelo de imagem, em vez de usar um screenshot de um clipe anterior. Você quer controle sobre composição, iluminação e figurino nas duas pontas. O Veo, do Google, aceita imagens de referência justamente para que um rosto ou um produto sobreviva à transição, e isso só funciona se as referências forem consistentes desde o início.

Mantenha o movimento de câmera simples. A interpolação lida bem com uma aproximação, um afastamento, uma revelação ou um deslocamento lento. Ela tem dificuldade quando você pede um corte seco dentro de um único clipe, porque não há corte para interpolar. Se um plano precisa de um corte, faça dois clipes.

Alinhe o plano de áudio ao plano visual. O Veo 3.1 sintetiza áudio nativo, o que é útil para som ambiente e efeitos simples. Se a cena precisa de uma fala específica de diálogo ou de uma faixa licenciada, planeje adicioná-la depois, em vez de brigar com o som gerado.

Reserve o método para planos que carregam uma batida narrativa. Não há motivo para gastar dois quadros bem construídos em uma transição de dois segundos. Use-o onde o público deve notar a mudança.

Quanto custam, de fato, dois quadros extras

Planejar em quadros é uma decisão com preço, e o preço é mais fácil de ler agora do que era um ano atrás. O mercado de vídeo vem numa corrida para baixo no custo por segundo. A prévia do Q4 do Vidu, lançada em 7 de outubro, começa em cerca de US$ 0,014 por segundo e aceita até quinze imagens de referência. O Grok Imagine Video 1.5 Lite, da xAI, adicionado à sua API em 8 de outubro, custa US$ 0,02 por segundo em 480p e sobe para US$ 0,14 em 1080p. O novo modelo geral de vídeo da HeyGen saiu com uma taxa promocional de outubro de um centavo por segundo. O Wan 3.0, que ficou no topo do benchmark de vídeo da Artificial Analysis com um Elo de 1157, está listado em cerca de US$ 12 por minuto, o que dá vinte centavos por segundo.

Duas coisas decorrem disso. Primeiro, a geração em si raramente é a parte cara agora. Alguns segundos de movimento interpolado custam centavos, não dólares. Segundo, o recurso escasso são os quadros. Gerar e selecionar duas imagens estáticas fortes consome o tempo de uma pessoa, e esse tempo não fica mais barato quando a API fica mais barata. A economia recompensa o planejamento, não o volume, o que é o oposto de como as ferramentas baseadas apenas em prompts treinaram as pessoas a se comportar.

Um fluxo de trabalho que se sustenta em um trabalho real

Veja como o método se encaixa em uma produção pequena sem mudar tudo. Comece pelo conceito e decida a única batida que o plano precisa acertar. Construa o quadro inicial e o quadro final como imagens, usando as mesmas referências para que rostos, figurino e objetos combinem. Gere a interpolação e assista uma vez pensando na estrutura e outra nos detalhes. Se o movimento fizer uma curva errada, corrija os quadros em vez do prompt, porque os quadros são o que o modelo realmente está lendo. Adicione ou substitua o áudio conforme o plano. Depois, corte-o na sequência e avalie-o em contexto, porque um clipe que parece impressionante sozinho ainda pode parecer lento ao lado dos vizinhos.

A disciplina aqui é que cada correção é uma decisão sobre a história, não uma jogada de dados. Essa é a parte que as pessoas não percebem quando experimentam o recurso pela primeira vez. Parece um atalho, mas reinstala discretamente a pré-produção que a primeira geração de ferramentas de vídeo com IA fez as pessoas pularem.

Onde uma câmera normal ainda vence

Nada disso defende que filmar ficou obsoleto. A interpolação é mais forte quando as duas pontas são fortes e o movimento entre elas é simples, o que cobre muitos planos de produto, transições, cartelas de título e planos de estabelecimento atmosféricos. Ela é mais fraca quando a realidade está fazendo algo específico e imprevisível: um cavalo de verdade a galope total, uma multidão reagindo, comida sendo preparada de um jeito que precisa parecer real. Para esses casos, uma câmera mais um editor competente ainda encerra a discussão.

Os limites honestos

Interpolação ainda é interpolação. Se os dois quadros sugerem um intervalo fisicamente complicado, como uma pessoa dando uma volta completa ou um líquido mudando de forma, o modelo vai inventar algo e nem sempre vai acertar. Mantenha o movimento implícito dentro do que uma câmera poderia plausivelmente registrar.

Ele também aumenta o custo. Duas imagens estáticas refinadas mais um clipe gerado dão mais trabalho do que um único prompt. Com os preços por segundo que estão no mercado agora, isso é mais acessível do que era um ano atrás, mas o tempo de planejamento é real. O método recompensa quem já pensa em planos.

E ainda não há garantia sobre o meio. O que o recurso realmente vende é um espaço de busca menor, não um problema resolvido. Isso é um avanço significativo. Significa que a diferença entre um clipe utilizável e um memorável agora está principalmente nos quadros que você escolhe, e essa é uma decisão que uma pessoa toma.

O que observar a seguir

Espere que o mesmo padrão se espalhe. Quando um modelo importante passa a tratar os quadros como entrada principal, os concorrentes tendem a seguir, e a pergunta interessante passa a ser qual interpolação parece mais natural nas emendas. Fique de olho em ferramentas que permitam adicionar um quadro-chave intermediário, o que daria aos diretores uma terceira âncora sem sair da linha do tempo.

Por enquanto, a conclusão prática não tem glamour. Se você faz vídeo com IA, pare de tratar o prompt como o principal ato criativo. Construa os quadros primeiro, escolha os dois que contam a história e deixe o modelo cuidar do trajeto entre eles.

Artigos relacionados