Gemini Omni 1.1 Flash Encadeou Quatro Requisições em uma Tomada de 40 Segundos. O Fluxo de Trabalho É o Produto.

O Gemini Omni 1.1 Flash do Google é um produto estranho de avaliar, porque o modelo em si não é novo. Ele chegou à disponibilidade geral em 27 de agosto de 2026 sob o id gemini-omni-1.1-flash, e o endpoint de pré-visualização mais antigo foi desativado em 30 de setembro. Tudo ao redor da geração mudou; a qualidade da geração está basicamente onde estava.
A lista de recursos parece uma checklist de produção. A extensão de cena agora analisa até dez segundos de contexto anterior, o que o Google descreve como um salto em relação a modelos anteriores, que só faziam referência ao último segundo. Os vídeos se estendem em incrementos de dez segundos até um teto cumulativo de quarenta segundos. O controle de primeiro e último quadro permite que os desenvolvedores especifiquem as duas extremidades de uma tomada e gerem o movimento entre elas, voltado para órbitas de câmera, transições de zoom e loops sem costura visível. Um modo de rascunho em 360p gera até 60% mais rápido, a um terço do custo do 720p padrão. A saída final é escalada para 1080p ou 4K. Até três segundos de vídeo podem ser fornecidos como material de referência para consistência de personagem e de cena.
Leia o recurso de extensão com atenção, porque o marketing o arredonda. Um clipe Omni de quarenta segundos são quatro requisições encadeadas, cada uma usando os últimos dez segundos como contexto, e não uma única passagem de quarenta segundos. As gerações individuais ainda ficam entre três e dez segundos. Essa distinção importa para quem está orçando latência e custo de inferência contra uma entrega, e é o tipo de detalhe que decide se uma tomada de quarenta segundos é prática ou apenas possível.

A precificação foi pensada para fazer você iterar
A estrutura de preços do Google recompensa o rascunho. O preço da API é de US$ 1,50 por milhão de tokens de entrada e US$ 17,50 por milhão de tokens de saída de vídeo, cobrados a 5.792 tokens por segundo de vídeo em 720p, o que dá cerca de US$ 0,10 por segundo ou US$ 6 por minuto. Por clipe de dez segundos, a escada de faixas vai de cerca de US$ 0,30 em 360p, a US$ 1,00 em 720p, a US$ 1,50 em 1080p, a US$ 3,00 em 4K.
Esse gradiente não é acidental. A diferença entre um rascunho em 360p e um master em 4K é de uma ordem de magnitude, o que empurra as equipes para um método de trabalho em que se itera barato em uma faixa de baixa resolução e só se paga pela tomada final. Compare isso com o hábito que a maioria das pessoas trouxe para a geração de vídeo, que era escrever um prompt, esperar, olhar o resultado, reescrever o prompt e pagar o preço cheio por cada jogada de dados. O Google está precificando o segundo comportamento para fora do fluxo de trabalho.
Compare também as superfícies de acesso, porque a distribuição é desigual. O Google apresenta o conjunto completo de recursos como voltado a desenvolvedores e disponível via API: cinco recursos chegam aos desenvolvedores por meio do AI Studio, da Gemini API e da Gemini Enterprise Agent Platform, enquanto o lançamento para consumidores no app Gemini está restrito apenas à extensão de cena. O mesmo modelo está dentro do Google Flow para assinantes AI Plus, Pro e Ultra, e é gratuito dentro do YouTube Shorts Remix e do app YouTube Create. Um modelo, cinco níveis de acesso, quatro dos quais não recebem os recursos interessantes.
A aritmética de uma tomada de quarenta segundos
O encadeamento de extensões muda o custo de uma tomada, e a mudança não é linear.
Uma única geração de três a dez segundos é barata e rápida. Uma sequência de quarenta segundos são quatro requisições em série, e cada uma delas falha de forma independente. Se a terceira requisição produz uma tomada que quebra a continuidade, você não regenera quarenta segundos. Você regenera a partir do primeiro quadro do segmento quebrado, e depois reencadeia tudo o que vem depois, e o custo de um erro se multiplica com a posição na sequência. Os primeiros dez segundos são baratos de refazer. Os últimos dez segundos são caros, porque refazê-los significa refazer tudo o que está a jusante deles.
Esse é o argumento prático para o controle de keyframes. Poder especificar um quadro inicial e um final transforma cada segmento em um problema delimitado, com uma etapa de verificação nas duas pontas. Em vez de julgar uma sequência inteira assistindo a ela e torcendo para que a continuidade tenha se mantido, uma equipe pode verificar se o segmento terminou no quadro em que deveria terminar. Para uma órbita de câmera ou uma transição de zoom, essa é uma unidade de trabalho muito mais testável do que um prompt livre.
A faixa de rascunho em 360p segue a mesma lógica. Prototipar uma sequência de quarenta segundos a cerca de um dólar em vez de seis dólares torna a iteração acessível, e o upscale para 1080p ou 4K se torna uma etapa separada e deliberada. O que o Google efetivamente lançou é um pipeline de produção com um portão de revisão embutido na precificação.
O que os benchmarks dizem agora
O Gemini Omni 1.1 Flash lidera o quadro de texto para vídeo da Arena com 1516, logo à frente do seu próprio antecessor, o Gemini Omni Flash, com 1513, e a própria faixa de classificação da Arena para o modelo mais novo vai de um a quatro, o que é uma forma educada de dizer que os dois estão empatados dentro do intervalo de confiança.
O panorama dos leaderboards em outros lugares é menos lisonjeiro do que a cobertura de lançamento sugeriu. O modelo varreu os quatro quadros da Artificial Analysis até meados de julho de 2026. Essa varredura acabou. No quadro de texto para vídeo reconstruído, no início de outubro, o Gemini Omni Flash 1.1 está em oitavo com áudio e em oitavo sem áudio, e no quadro de imagem para vídeo da Arena ele fica em segundo, atrás do MiniMax H3. A Artificial Analysis não avaliou o 1.1 Flash diretamente em seu quadro de texto para vídeo, onde o modelo Flash mais antigo lidera e o Wan 3.0, da Alibaba, e o MiniMax H3 vêm logo atrás.
Esse é um resultado normal em uma categoria que se move rápido, e não desqualifica as adições ao fluxo de trabalho. Mas significa que o enquadramento honesto deste lançamento é que o Google está competindo em controlabilidade e faixas de preço, e não em qualidade bruta de saída, e o leaderboard não é mais o lugar onde ele vence.
Duas coisas que o lançamento não resolve
Áudio nativo sincronizado não está confirmado. Os materiais de lançamento do Google não detalham a geração de trilha sonora junto com o vídeo, e a saída de áudio está listada como chegando em versões posteriores. A entrada de áudio está limitada a referências de voz no lançamento. Para uma família de modelos any-to-any com esse nome, a ausência de saída de áudio é a lacuna que chama atenção, especialmente para equipes que produzem conteúdo de formato curto, em que o som é metade da entrega.
A segunda é a duração. Quarenta segundos montados a partir de quatro requisições encadeadas é uma capacidade real, e também é um teto que um formato de vídeo narrativo atinge rapidamente. O Google provocou um Gemini Omni Pro de nível superior, sem data de lançamento, e a mecânica de extensão sugere que o caminho para tomadas mais longas passa por um melhor tratamento de contexto, e não por uma única geração mais longa.
Cada saída carrega marca d'água SynthID e C2PA Content Credentials por padrão, e o endpoint de pré-visualização desativado não aparece mais na lista de modelos do Google. O Google agora recomenda o Omni 1.1 em vez dos endpoints de pré-visualização do Veo 3.1, o que é uma transição interna notável. O Veo 3.1 continua sendo o Veo carro-chefe atual, e nenhum Veo 4 foi anunciado.
Com o que realmente construir
A forma útil de ler este lançamento é como uma mudança no que o produto é. Um modelo de vídeo que produz um clipe de dez segundos é um gerador de novidades. Um modelo que analisa dez segundos de contexto anterior, aceita um quadro inicial e um final, faz rascunhos em 360p por um terço do preço e escala para 4K é um componente que você pode colocar dentro de uma timeline.
Essa é a versão de vídeo generativo com a qual equipes de produção podem planejar, e é a versão em que a engenharia interessante se desloca da escrita de prompts para o design de pipelines. Neste lançamento, a montagem importa mais do que o clipe.
Artigos relacionados
A Guerra de Preços do Vídeo com IA: Luma Cortou as Tarifas do Seedance em até 73%, e a Runway Passou a Vender Rivais
Os motores estão próximos o suficiente hoje para que a fatura seja um guia melhor do que o ranking.
Um modelo de imagem de 260M superou um rival 6,5x maior ao repetir os mesmos blocos
Adicionar parâmetros ainda funciona. O trabalho mais ativo é fazer um determinado modelo fazer mais com menos.
Dois modelos de voz acabaram de redefinir o padrão: 50 ms até o primeiro áudio e um modelo de 99M em uma CPU de notebook
A qualidade convergiu, e a competição passou para onde o modelo roda, quão rápido ele começa e quanto custa por chamada.
Kimi K2.6 da Moonshot executa mil agentes de uma vez e construiu um compilador em dez horas
Mil agentes que precisam cada um de supervisão multiplicam a supervisão, não a capacidade.