Agentes começaram a dirigir curtas-metragens nesta semana. O gargalo passou para o controle de qualidade.

Um desenvolvedor revelou em 5 de outubro que um curta-metragem animado chamado The Clockwork Moth foi produzido de ponta a ponta por um pipeline de 14 agentes rodando em uma única RTX 5090. Cerca de dez minutos de tempo de pipeline cobriram 106 planos em nove cenas, com 19 estados de cena para quatro personagens recorrentes. O controle de qualidade automatizado passou em 102 de 102 verificações. O pacote de assets chegou a 2,4 GB. A cadeia de ferramentas não foi divulgada.
A parte interessante tem pouco a ver com o tempo de execução. O que chama atenção é onde o desenvolvedor disse que estavam os problemas difíceis: manter a identidade dos personagens consistente entre planos e automatizar o controle de qualidade. Não o primeiro frame.
Esse veredito se alinha com um segundo projeto da mesma semana. Um usuário do Reddit lançou DOGNAPPED, uma comédia de três minutos com cachorro falante feita quase inteiramente pelo Claude executando o Claude Code dentro de uma configuração do ComfyUI construída sobre nós open-source do Video Builder. O humano contribuiu com o briefing, fotos de referência de dois cachorros reais e as ferramentas. O Claude escreveu a história, inventou um terceiro cachorro, gerou referências de locação e de personagem, escreveu um roteiro de 22 cenas com direções de planos, renderizou cada cena pelo MiniMax H3 para vídeo, vozes e efeitos sonoros, compôs a trilha com MiniMax Music 3 e editou o filme. A renderização levou cerca de quatro horas e meia.
Depois, o modelo rodou suas próprias refilmagens. O ciclo de QA transcreveu cada fala e comparou com o roteiro, verificou o tom da voz, revisou frames e cortes e executou checagens de sincronia áudio-vídeo com precisão de frame. Onde filhotes balbuciavam ou cachorros encaravam a câmera, ele refilmou as cenas.

Por que o ciclo de QA é a história
Gerar um único plano convincente é um problema suficientemente resolvido a ponto de demos serem rotina. Montar cento e seis deles de modo que o mesmo personagem pareça o mesmo personagem em todos não é.
O drift de identidade é o modo de falha que quebra vídeos de IA de formato longo. Um modelo que renderiza um personagem bem isoladamente ainda vai mudar um rosto, um figurino ou a linha do cabelo entre planos, porque cada geração é uma nova amostragem de uma distribuição. As correções usuais são condicionamento por referência, LoRAs treinadas em um personagem específico e seleção manual. Todas elas adicionam trabalho humano exatamente no ponto em que o pipeline deveria estar removendo isso.
O controle de qualidade automatizado é a outra metade. Um pipeline que produz filmagens mas não consegue distinguir saída boa de ruim transfere o ônus da revisão para uma pessoa, e uma pessoa revisando cem planos é o gargalo que a abordagem inteira deveria eliminar. O fluxo de trabalho do DOGNAPPED resolveu isso transformando o roteiro em um oráculo de verificação: transcrever cada fala, compará-la com o que foi escrito, checar o tom, checar a sincronia, sinalizar falhas, renderizar de novo. Essa é uma definição programática de “aceitável” que não exige que um humano assista a tudo.
O padrão ao longo da semana
Vários projetos chegaram ao mesmo formato. Um usuário com o handle konte transformou o Claude Code em um produtor executivo e gerou um videoclipe de dois minutos e cinquenta e quatro segundos em uma única RTX 5090: 61 planos, 342 tarefas, cerca de duas horas de envolvimento humano e cerca de quatro horas e meia de geração. Os planos foram escritos conforme o tempo e as batidas da música, então os cortes caíam na música.
Outra abordagem ignorou completamente o text-to-video. Claude Opus 5.5 escreveu código para cada frame e cada trecho de música, produzindo um curta chamado I Have Never Seen the Sun, com prompts formulados como uma peça de três a cinco minutos destinada a festivais.
Essa última abordagem aponta para uma divisão real no campo. Movimento gerado por código é determinístico. Se o frame 420 parece errado, você muda o código e renderiza o frame 420 de novo. Vídeo por difusão é estocástico. Se um plano está errado, você roda de novo e torce. Para movimento projetado, como tipografia cinética, animação de UI, gráficos e revelações de logotipo, o caminho determinístico é mais forte. Para humanos fotorrealistas, atuação orgânica e física do mundo real, os modelos de difusão ainda vencem, porque código não consegue simular o que nunca modelou.
As ferramentas por trás da mudança
O fio condutor comum entre esses projetos é um agente de programação conectado a um pipeline de geração. Nós do Video Builder, grafos personalizados do ComfyUI e habilidades de agente que chamam modelos abertos por uma API dão a um modelo de linguagem o mesmo acesso à renderização que um desenvolvedor teria. O modelo não precisa ser ele próprio um modelo de vídeo. Ele precisa ser capaz de escrever e executar o código que controla um.
É por isso que o perfil de custo é como é. Em uma sessão publicada, um criador alimentou mais de 7.000 imagens do Midjourney e uma faixa do Suno no Claude Opus 5.5 e executou uma sessão criativa autônoma que durou cerca de duas horas por aproximadamente US$ 6,80. No projeto DOGNAPPED, o custo dominante foi o tempo de renderização local, e não chamadas de API. Quando os modelos base são de pesos abertos e a orquestração é código, o custo marginal de um experimento despenca.
Há um efeito de segunda ordem sobre as habilidades. O trabalho que resta para uma pessoa mudou: deixou de operar uma timeline ou ficar de olho em uma renderização e passou a especificar o briefing com precisão suficiente para que um verificador automatizado consiga decidir se a saída o atendeu. Todo projeto lançado esta semana codifica seus critérios de aceitação em algum lugar, porque um pipeline não consegue iterar sobre “faça melhor”.
O que ainda não funciona
As demos são honestas sobre seus limites, e os limites são consistentes. A identidade dos personagens se mantém ao longo de algumas cenas e sofre drift ao longo de dezenas, e é por isso que condicionamento por referência e adaptadores por personagem são padrão. A estrutura de longo horizonte é frágil: um filme que parece coerente por trinta segundos pode perder consistência espacial ou temporal no minuto três. E o controle de qualidade automatizado só consegue verificar o que lhe foi dito para verificar, o que significa que um pipeline que valida diálogo e sincronia vai aprovar tranquilamente uma cena com um erro de continuidade para o qual ninguém escreveu uma checagem.
Essas restrições explicam por que os projetos lançados esta semana eram curtas. Uma comédia de três minutos com um elenco pequeno e locações simples é um problema tratável. Um longa com dezenas de personagens, figurino em mudança e encenação complexa não é, pelo menos ainda não, sem que um humano revise muito mais da saída do que a automação deveria poupar.
O que isso muda para orçamentos de produção
A economia está mudando de uma forma específica. Quando um curta-metragem custa alguns dólares de computação e uma tarde de orquestração, a restrição deixa de ser dinheiro e passa a ser a clareza do briefing. A contribuição humana que sobrevive é saber o que você quer e ser capaz de dizer isso com precisão suficiente para que um agente possa verificar.
Isso também levanta uma questão de governança. Um agente que escreve um roteiro, renderiza, julga sua própria saída e refilma as falhas está tomando decisões criativas sem uma pessoa no circuito. O ciclo de QA torna a saída mais confiável e também significa que os padrões do próprio modelo definem como é “concluído”.
Os projetos desta semana são demos, e suas cadeias de ferramentas são parcialmente não divulgadas. Mas a direção é consistente. A geração é barata, a orquestração é o produto, e o que decide se um pipeline é útil é se ele consegue perceber quando falhou.
Artigos relacionados
BOSSFIGHT fez modelos de fronteira atuarem como donos de cafeteria por 24 semanas. A maioria perdeu para o não fazer nada.
Resistir a um suborno em um questionário e recusar-se a ceder em um trimestre real são duas habilidades diferentes, e as avaliações atuais tendem a medir a mais fácil.
NASA e IBM disponibilizam em código aberto um modelo de fundação lunar treinado com 17 anos de dados de orbitadores
O modelo é útil para encontrar e caracterizar feições, e não é confiável para dizer exatamente onde elas estão com alta precisão.
Quatro passos em vez de quarenta: como a destilação está comprimindo modelos de imagem abertos para GPUs de consumidor
A destilação de poucos passos é uma troca, não um almoço grátis. A fidelidade de texto, a precisão de edição e a consistência entre múltiplas referências são as primeiras coisas a sofrer.
Reka Rho-1 coloca compreensão e geração no mesmo cache KV
Os mesmos pesos que preveem uma imagem de câmera também controlam o movimento do robô, porque ambos vivem no mesmo espaço representacional.