← Volver al blog
Aiaprox. 8 min de lectura

Gemini Omni 1.1 Flash encadenó cuatro solicitudes en una toma de 40 segundos. El flujo de trabajo es el producto.

Publicado 5 oct 2026
Gemini Omni 1.1 Flash encadenó cuatro solicitudes en una toma de 40 segundos. El flujo de trabajo es el producto.

Gemini Omni 1.1 Flash de Google es un producto extraño de evaluar, porque el modelo en sí no es nuevo. Alcanzó la disponibilidad general el 27 de agosto de 2026 con el ID gemini-omni-1.1-flash, y el endpoint de vista previa anterior se retiró el 30 de septiembre. Todo lo que rodea a la generación cambió; la calidad de la generación está en gran medida donde estaba.

La lista de capacidades se lee como una lista de verificación de producción. La extensión de escena ahora analiza hasta diez segundos de contexto previo, lo que Google describe como un salto respecto a modelos anteriores que solo hacían referencia al último segundo. Los vídeos se extienden en incrementos de diez segundos hasta un límite acumulativo de cuarenta segundos. El control de primer y último fotograma permite a los desarrolladores especificar ambos extremos de una toma y generar el movimiento entre ellos, orientado a órbitas de cámara, transiciones de zoom y bucles sin costura visible. Un modo borrador 360p genera hasta un 60 por ciento más rápido y a un tercio del coste del 720p estándar. La salida final se escala a 1080p o 4K. Se pueden proporcionar hasta tres segundos de vídeo como material de referencia para la consistencia de personajes y escenas.

Lee con atención la función de extensión, porque el marketing la redondea. Un clip Omni de cuarenta segundos son cuatro solicitudes encadenadas, cada una usando los últimos diez segundos como contexto, no una única pasada de cuarenta segundos. Las generaciones individuales siguen situándose entre tres y diez segundos. Esa distinción importa para cualquiera que presupueste latencia y coste de inferencia frente a un entregable, y es el tipo de detalle que decide si una toma de cuarenta segundos es práctica o meramente posible.

Un único carrete de película metálico en posición vertical sobre una mesa oscura con luz cálida atravesándolo

El precio está diseñado para hacerte iterar

La estructura de precios de Google recompensa el borrador. El precio de la API es de $1,50 por millón de tokens de entrada y $17,50 por millón de tokens de salida de vídeo, facturados a 5.792 tokens por segundo de vídeo 720p, lo que equivale a aproximadamente $0,10 por segundo o $6 por minuto. Por clip de diez segundos, la escalera de niveles va de unos $0,30 en 360p, a $1,00 en 720p, a $1,50 en 1080p, y a $3,00 en 4K.

Ese gradiente no es accidental. La diferencia entre un borrador 360p y un máster 4K es de un orden de magnitud, lo que empuja a los equipos hacia un método de trabajo en el que se itera de forma barata en un nivel de baja resolución y solo se paga por la toma final. Compáralo con la costumbre que la mayoría traía a la generación de vídeo, que era escribir un prompt, esperar, mirar el resultado, reescribir el prompt y pagar el precio completo por cada tirada de dados. Google está sacando ese segundo comportamiento del flujo de trabajo mediante el precio.

Compara también las superficies, porque la distribución es desigual. Google presenta el conjunto completo de capacidades como orientado a desarrolladores y disponible vía API: cinco capacidades llegan a los desarrolladores a través de AI Studio, la API de Gemini y Gemini Enterprise Agent Platform, mientras que el despliegue para consumidores en la app Gemini se limita solo a la extensión de escena. El mismo modelo está dentro de Google Flow para suscriptores de AI Plus, Pro y Ultra, y es gratis dentro de YouTube Shorts Remix y la app YouTube Create. Un modelo, cinco niveles de acceso, cuatro de los cuales no reciben las funciones interesantes.

La aritmética de una toma de cuarenta segundos

La extensión encadenada cambia lo que cuesta una toma, y el cambio no es lineal.

Una única generación de tres a diez segundos es barata y rápida. Una secuencia de cuarenta segundos son cuatro solicitudes en serie, y cada una falla de forma independiente. Si la tercera solicitud produce una toma que rompe la continuidad, no regeneras cuarenta segundos. Regeneras desde el primer fotograma del segmento roto, luego vuelves a encadenar todo lo que viene después, y el coste de un error se multiplica con la posición en la secuencia. Los primeros diez segundos son baratos de rehacer. Los últimos diez segundos son caros, porque rehacerlos significa rehacer todo lo que va después de ellos.

Ese es el argumento práctico a favor del control de fotogramas clave. Poder especificar un fotograma inicial y final convierte cada segmento en un problema acotado con un paso de verificación en ambos extremos. En lugar de juzgar toda una secuencia viéndola y esperando que la continuidad se mantuviera, un equipo puede comprobar si el segmento terminó en el fotograma en el que debía terminar. Para una órbita de cámara o una transición de zoom, esa es una unidad de trabajo mucho más comprobable que un prompt de forma libre.

El nivel de borrador 360p encaja en la misma lógica. Prototipar una secuencia de cuarenta segundos a aproximadamente un dólar en lugar de seis dólares hace que iterar sea asequible, y el escalado a 1080p o 4K se convierte en un paso separado y deliberado. Lo que Google ha lanzado efectivamente es un pipeline de producción con un control de revisión incorporado en el precio.

Lo que dicen ahora los benchmarks

Gemini Omni 1.1 Flash lidera la tabla de texto a vídeo de Arena con 1516, justo por delante de su propio predecesor, Gemini Omni Flash, con 1513, y la propia banda de clasificación de Arena para el modelo más nuevo abarca del uno al cuatro, que es una forma educada de decir que los dos están empatados dentro del intervalo de confianza.

El panorama en otras tablas de clasificación es menos halagador de lo que implicaba la cobertura del lanzamiento. El modelo arrasó en las cuatro tablas de Artificial Analysis a mediados de julio de 2026. Ese dominio absoluto ya terminó. En la tabla reconstruida de texto a vídeo, a principios de octubre, Gemini Omni Flash 1.1 ocupa el octavo puesto con audio y el octavo sin audio, y en la tabla de imagen a vídeo de Arena va segundo, por detrás de MiniMax H3. Artificial Analysis no ha evaluado directamente 1.1 Flash en su tabla de texto a vídeo, donde el modelo Flash anterior lidera y Wan 3.0 de Alibaba y MiniMax H3 están muy cerca detrás.

Ese es un resultado normal en una categoría que avanza rápido, y no resta valor a las incorporaciones de flujo de trabajo. Sí significa que el encuadre honesto de este lanzamiento es que Google compite en controlabilidad y niveles de precio en lugar de en calidad de salida bruta, y la tabla de clasificación ya no es el lugar donde gana.

Dos cosas que el lanzamiento no arregla

El audio sincronizado nativo no está confirmado. Los materiales de lanzamiento de Google no detallan la generación de banda sonora junto con el vídeo, y la salida de audio figura como algo que llegará en versiones posteriores. El audio de entrada se limita a referencias de voz en el lanzamiento. Para una familia de modelos any-to-any con ese nombre, la salida de audio ausente es la brecha que más destaca, en particular para equipos que producen contenido de formato corto, donde el sonido es la mitad del entregable.

La segunda es la duración. Cuarenta segundos ensamblados a partir de cuatro solicitudes encadenadas es una capacidad real, y también es un techo que un formato de vídeo narrativo alcanza rápidamente. Google ha insinuado un Gemini Omni Pro de gama más alta sin fecha de lanzamiento, y la mecánica de extensión sugiere que el camino hacia tomas más largas pasa por un mejor manejo del contexto en lugar de por una única generación más larga.

Cada salida lleva marca de agua SynthID y credenciales de contenido C2PA por defecto, y el endpoint de vista previa retirado ya no aparece en la lista de modelos de Google. Google ahora recomienda Omni 1.1 por encima de los endpoints de vista previa de Veo 3.1, lo cual es un traspaso interno notable. Veo 3.1 sigue siendo el Veo insignia actual, y no se ha anunciado ningún Veo 4.

Con qué construir en la práctica

La forma útil de leer este lanzamiento es como un cambio en lo que es el producto. Un modelo de vídeo que produce un clip de diez segundos es un generador de novedades. Un modelo que analiza diez segundos de contexto previo, acepta un fotograma inicial y final, hace borradores en 360p por un tercio del precio y escala a 4K es un componente que puedes poner dentro de una línea de tiempo.

Esa es la versión del vídeo generativo con la que los equipos de producción pueden planificar, y es la versión en la que la ingeniería interesante se traslada de escribir prompts al diseño de pipelines. En este lanzamiento, el ensamblaje importa más que el clip.

Artículos relacionados