Dolphin AI transforma um roteiro em vídeo de vários planos sem perder o figurino

Um clipe longo não é a mesma coisa que uma cena. É nessa distinção que a maioria das ferramentas de vídeo com IA ainda tropeça, e é o problema que um novo entrante está tentando resolver diretamente.
A Dolphin AI, criada pela plataforma social indiana Eloelo, foi apresentada em Mumbai na FICCI FRAMES 2026, em 29 de setembro. Em 4 de outubro, está em acesso antecipado com uma lista de espera pública. A proposta é restrita e específica: envie um roteiro e receba de volta um vídeo de vários planos no qual os personagens, suas roupas e os locais permanecem consistentes de um corte para o outro. Ela produz clipes de até 60 segundos em uma única passagem, com voz, música e pontos de edição sincronizados às imagens.
Por que o multi-shot é a parte difícil
Gerar um único plano bom já está amplamente resolvido para durações curtas. Gerar cinco planos que pertencem à mesma cena não está. Um modelo que renderiza cada plano independentemente não tem memória de como era a jaqueta dois cortes antes, nem de que lado da sala ficava a janela. A continuidade quebra, e o público percebe imediatamente.
A Dolphin aborda isso como um fluxo de trabalho agêntico, em vez de uma única chamada de modelo. Ela planeja a lista de planos a partir do roteiro e então mantém as referências que importam para cada personagem e local travadas ao longo da sequência. A empresa também oferece recasting, para que um intérprete possa ser trocado depois, sem regenerar o vídeo inteiro, e controle de movimento para planos que precisam de um movimento de câmera específico.
A ferramenta oferece suporte a sincronização labial em idiomas indianos, uma escolha deliberada dado o local de lançamento. Modelos genéricos lidam bem com inglês e tratam outros idiomas como detalhe secundário. Uma ferramenta que chega com suporte a idiomas indianos está mirando primeiro o mercado local de criadores.
Como ela se compara
O problema de continuidade não é exclusivo da Dolphin, e vale a pena ser preciso sobre o que as alternativas fazem hoje. O modo Multi-Shot do Runway produz sequências de cerca de dez segundos e muitas vezes vem sem áudio por padrão. O Pika agora oferece suporte a trabalho multi-shot de até cerca de 30 segundos com storyboards e design de som. O Dream Machine, da Luma, normalmente limita clipes à faixa de cinco a dez segundos. A alegação da Dolphin é uma saída mais longa em uma única passagem, com áudio e continuidade tratados em conjunto, o que, se se sustentar fora de um vídeo de demonstração, é um passo além das opções atuais.
Se isso se sustenta é a questão em aberto. Demonstrações da empresa são editadas para mostrar os melhores resultados. Testes independentes mostrarão com que frequência o figurino de um personagem varia depois que a contagem de planos aumenta e a duração se aproxima de um minuto.
O ângulo da integração
A Dolphin expõe um servidor MCP e uma interface de linha de comando, o que permite que outras ferramentas acionem gerações diretamente. Isso importa mais do que parece. Um estúdio que já opera um pipeline de roteirização, gestão de ativos e revisão pode chamar a Dolphin de dentro desse sistema, em vez de exportar arquivos para um aplicativo web e trazê-los de volta. O preço segue um modelo de assinatura mais créditos, com os preços para a Índia ainda não anunciados, e os termos citam os níveis Starter, Pro e Creator.
O enquadramento agêntico também responde a uma queixa de fluxo de trabalho. Um editor precisa de um vídeo e, com a mesma frequência, de uma versão dele que possa ser revisada sem começar de novo. Fazer recasting sem regenerar, e controle de movimento em um único plano, têm como alvo a revisão, e não a primeira geração. É nessa parte do pipeline que o tempo realmente é gasto.
O fluxo de trabalho por trás da continuidade
Manter um personagem consistente entre cortes geralmente significa construir um conjunto de referências. O agente extrai os detalhes que importam do roteiro e do primeiro plano gerado, e então os mantém como restrições para cada plano seguinte. Uma jaqueta tem uma cor e um corte. Uma sala tem uma janela de um lado e uma porta do outro. Uma vez que esses elementos estão fixados, as gerações posteriores têm menos espaço para se desviar, e o vídeo pode ser montado sem regravação.
Os casos difíceis são aqueles em que a própria referência muda. Um personagem que tira o casaco no meio da cena, ou um local mostrado de dois ângulos que nunca foram gerados, força o sistema a decidir o que ainda está consistente e o que mudou de verdade. É aí que a etapa de planejamento se justifica, e onde uma ferramenta mais simples de “gerar cada plano separadamente” desmorona.
A Dolphin também permite que um usuário faça recast de um intérprete após a geração, o que implica que a identidade do personagem é rastreada separadamente da atuação. Essa separação é o que torna a revisão barata. Se identidade e movimento são armazenados independentemente, mudar um não força a reconstrução do outro.

A camada de conformidade
Qualquer coisa voltada a criadores indianos precisa lidar com regras de divulgação, e o material da Dolphin diz isso. O YouTube exige rótulos quando conteúdo realista usa mídia sintética, e a não divulgação repetida acarreta penalidades. O órgão regulador de publicidade da Índia tem regras de rotulagem em rascunho para anúncios gerados por IA, e intermediários devem seguir as Regras de TI do país para conteúdo ilegal. As orientações que acompanham a ferramenta dizem aos usuários para divulgar planos sintéticos, obter permissões de semelhança, rastrear licenças de modelos e manter registros de prompts para auditorias.
Essa orientação é a parte menos glamourosa do lançamento e provavelmente a de maiores consequências. Criadores que a ignoram são os que têm suas contas restringidas.
Por que o lançamento na Índia importa
A Índia é um dos maiores mercados de criadores do mundo, e a maior parte de sua produção está em idiomas que os modelos globais de vídeo tratam mal. Uma ferramenta construída localmente, com suporte a idiomas locais e preços locais, está abordando uma lacuna que os grandes estúdios não priorizaram. Se a continuidade da Dolphin se sustentar, ela poderá conquistar uma fatia significativa de um mercado que tem sido mal atendido.
A questão de preço ainda está em aberto. Os preços para a Índia não foram anunciados, e os níveis citados até agora são genéricos. O que um criador paga por minuto finalizado decidirá se a ferramenta é uma opção profissional ou de amador. Ferramentas globais comparáveis cobram por créditos por segundos gerados, e o custo efetivo por plano utilizável, depois das tentativas repetidas, costuma ser várias vezes o preço anunciado. A Dolphin será julgada com base nos mesmos critérios.
Há também um aspecto de talento. O próprio material da empresa aponta funções que se beneficiam: editores de vídeo com IA, produtores de histórias guiados por prompts, narradores de marcas e criativos de agências, com orientação para montar reels que demonstrem consistência em vários planos. Isso é um sinal de que a ferramenta está sendo vendida para pessoas que a usarão em trabalhos para clientes, onde uma continuidade quebrada significa uma regravação e um prazo perdido.
O que observar
Dois sinais mostrarão se a Dolphin é mais do que um lançamento regional. O primeiro é o teste independente de continuidade em clipes que se aproximam dos 60 segundos completos. O segundo é se as integrações MCP e CLI serão adotadas por estúdios que já têm um pipeline, já que essa é a diferença entre um brinquedo e uma ferramenta.
O ângulo do mercado indiano, porém, é real. Uma ferramenta local, com suporte a idiomas locais e orientação local de conformidade, tem uma vantagem que um modelo global que lança um produto prioritariamente em inglês não tem. Se essa vantagem sobrevive ao contato com um setor em rápida evolução é o que os próximos meses dirão.
Artigos relacionados
Agility Digit 5 chega com um caso de segurança, não apenas uma ficha técnica
Um piso de armazém não é um laboratório. A certificação é o portão, não a demonstração.
Agentes de fronteira concluíram 30% de um workflow de pesquisa. Esse é o número.
Agentes conseguem executar pesquisa. Inventar o procedimento ainda está fora de alcance.
Figure AI garantiu US$ 3,5 bilhões em capacidade de computação antes mesmo de ter um produto para vender
A aposta é que a generalização é um problema de computação. O setor ainda não decidiu isso.
OpenAI finalmente coloca fundos transparentes na API de imagens
Um recurso pequeno que elimina uma etapa inteira do pipeline.