← Retour au blog
AiEnviron 8 min de lecture

Gemini Omni 1.1 Flash a enchaîné quatre requêtes en un plan de 40 secondes. Le workflow est le produit.

Publié le 5 oct. 2026
Gemini Omni 1.1 Flash a enchaîné quatre requêtes en un plan de 40 secondes. Le workflow est le produit.

Gemini Omni 1.1 Flash de Google est un produit étrange à évaluer, car le modèle lui-même n'est pas nouveau. Il est passé en disponibilité générale le 27 août 2026 sous l'identifiant gemini-omni-1.1-flash, et l'ancien point de terminaison preview a été retiré le 30 septembre. Tout ce qui entoure la génération a changé ; la qualité de génération, elle, est globalement restée au même niveau.

La liste des capacités ressemble à une checklist de production. L'extension de scène analyse désormais jusqu'à dix secondes de contexte précédent, ce que Google décrit comme un bond par rapport aux modèles précédents qui ne référençaient que la dernière seconde. Les vidéos s'étendent par incréments de dix secondes jusqu'à un plafond cumulé de quarante secondes. Le contrôle de la première et de la dernière image permet aux développeurs de spécifier les deux extrémités d'un plan et de générer le mouvement entre elles, pour les orbites de caméra, les transitions de zoom et les boucles sans couture visible. Un mode brouillon 360p génère jusqu'à 60 % plus vite pour un tiers du coût de la 720p standard. La sortie finale est suréchantillonnée en 1080p ou 4K. Jusqu'à trois secondes de vidéo peuvent être fournies comme matériau de référence pour la cohérence des personnages et des scènes.

Lisez attentivement la fonction d'extension, car le marketing l'enjolive. Un clip Omni de quarante secondes correspond à quatre requêtes enchaînées, chacune utilisant les dix dernières secondes comme contexte, et non à une seule passe de quarante secondes. Les générations individuelles durent toujours entre trois et dix secondes. Cette distinction compte pour quiconque budgétise la latence et le coût d'inférence par rapport à un livrable, et c'est le genre de détail qui détermine si un plan de quarante secondes est pratique ou simplement possible.

Une seule bobine de film métallique debout sur une table sombre, traversée par une lumière chaude

La tarification est conçue pour vous faire itérer

La structure tarifaire de Google récompense le brouillon. La tarification API est de 1,50 $ par million de jetons d'entrée et de 17,50 $ par million de jetons de sortie vidéo, facturés à 5 792 jetons par seconde de vidéo 720p, ce qui revient à environ 0,10 $ par seconde, soit 6 $ par minute. Par clip de dix secondes, l'échelle des paliers va d'environ 0,30 $ en 360p, à 1,00 $ en 720p, à 1,50 $ en 1080p, puis à 3,00 $ en 4K.

Ce gradient n'est pas accidentel. L'écart entre un brouillon 360p et un master 4K est d'un ordre de grandeur, ce qui pousse les équipes vers une méthode de travail où l'on itère à faible coût dans un palier basse résolution et où l'on ne paie que pour la prise finale. Comparez cela à l'habitude que la plupart des gens avaient adoptée pour la génération vidéo : écrire un prompt, attendre, regarder le résultat, réécrire le prompt et payer plein tarif à chaque tentative. Google tarifie la seconde pratique pour l'éliminer du workflow.

Comparez aussi les surfaces, car la distribution est inégale. Google présente l'ensemble complet des capacités comme destiné aux développeurs et disponible via API : cinq capacités sont livrées aux développeurs via AI Studio, l'API Gemini et la Gemini Enterprise Agent Platform, tandis que le déploiement grand public dans l'application Gemini se limite à l'extension de scène. Le même modèle est intégré à Google Flow pour les abonnés AI Plus, Pro et Ultra, et il est gratuit dans YouTube Shorts Remix et l'application YouTube Create. Un modèle, cinq niveaux d'accès, dont quatre ne reçoivent pas les fonctionnalités intéressantes.

L'arithmétique d'un plan de quarante secondes

L'extension enchaînée change le coût d'un plan, et ce changement n'est pas linéaire.

Une génération unique de trois à dix secondes est bon marché et rapide. Une séquence de quarante secondes, c'est quatre requêtes en série, et chacune échoue indépendamment. Si la troisième requête produit une prise qui brise la continuité, vous ne régénérez pas quarante secondes. Vous régénérez à partir de la première image du segment cassé, puis vous réenchaînez tout ce qui suit, et le coût d'une erreur se multiplie avec la position dans la séquence. Les dix premières secondes sont peu coûteuses à refaire. Les dix dernières sont coûteuses, car les refaire signifie refaire tout ce qui se trouve en aval.

C'est l'argument pratique en faveur du contrôle des keyframes. Pouvoir spécifier une image de début et de fin transforme chaque segment en un problème borné avec une étape de vérification aux deux extrémités. Au lieu de juger toute une séquence en la regardant et en espérant que la continuité ait tenu, une équipe peut vérifier si le segment s'est terminé sur l'image sur laquelle il était censé se terminer. Pour une orbite de caméra ou une transition de zoom, c'est une unité de travail bien plus testable qu'un prompt libre.

Le palier brouillon 360p s'inscrit dans la même logique. Prototyper une séquence de quarante secondes pour environ un dollar au lieu de six rend l'itération abordable, et la montée en résolution vers 1080p ou 4K devient une étape distincte et délibérée. Ce que Google a effectivement livré, c'est un pipeline de production avec une étape de validation intégrée à la tarification.

Ce que disent les benchmarks maintenant

Gemini Omni 1.1 Flash mène le classement texte-vers-vidéo d'Arena avec 1516, juste devant son propre prédécesseur Gemini Omni Flash à 1513, et la fourchette de classement d'Arena pour le modèle plus récent s'étend de un à quatre, ce qui est une façon polie de dire que les deux sont à égalité à l'intérieur de l'intervalle de confiance.

Le paysage des classements ailleurs est moins flatteur que ne le laissait entendre la couverture du lancement. Le modèle a balayé les quatre tableaux d'Artificial Analysis à la mi-juillet 2026. Cette domination est terminée. Sur le classement texte-vers-vidéo reconstruit, début octobre, Gemini Omni Flash 1.1 se situe à la huitième place avec audio et à la huitième place en silencieux, et sur le classement image-vers-vidéo d'Arena, il est deuxième derrière MiniMax H3. Artificial Analysis n'a pas évalué directement 1.1 Flash sur son classement texte-vers-vidéo, où l'ancien modèle Flash mène et où Wan 3.0 d'Alibaba et MiniMax H3 suivent de près.

C'est un résultat normal dans une catégorie qui évolue vite, et cela ne remet pas en cause les ajouts de workflow. Cela signifie que la présentation honnête de cette version est que Google rivalise sur la contrôlabilité et les paliers de prix plutôt que sur la qualité brute de sortie, et que le classement n'est plus l'endroit où il gagne.

Deux choses que cette version ne corrige pas

L'audio synchronisé natif n'est pas confirmé. Les documents de lancement de Google ne détaillent pas la génération de bande sonore en même temps que la vidéo, et la sortie audio est annoncée pour des versions ultérieures. L'audio en entrée se limite à des références vocales au lancement. Pour une famille de modèles any-to-any portant ce nom, l'absence de sortie audio est la lacune qui saute aux yeux, en particulier pour les équipes qui produisent du contenu court où le son représente la moitié du livrable.

La seconde est la durée. Quarante secondes assemblées à partir de quatre requêtes enchaînées est une vraie capacité, et c'est aussi un plafond qu'un format vidéo narratif atteint rapidement. Google a laissé entendre la sortie d'un Gemini Omni Pro plus haut de gamme sans date de sortie, et la mécanique d'extension suggère que la voie vers des plans plus longs passe par une meilleure gestion du contexte plutôt que par une seule génération plus longue.

Chaque sortie porte par défaut le tatouage SynthID et les Content Credentials C2PA, et le point de terminaison preview retiré n'apparaît plus dans la liste des modèles de Google. Google recommande désormais Omni 1.1 plutôt que les points de terminaison preview de Veo 3.1, ce qui constitue un passage de relais interne notable. Veo 3.1 reste le fleuron actuel de Veo, et aucun Veo 4 n'a été annoncé.

Avec quoi construire réellement

La façon utile de lire cette version est d'y voir un changement de nature du produit. Un modèle vidéo qui produit un clip de dix secondes est un générateur de nouveauté. Un modèle qui analyse dix secondes de contexte précédent, accepte une image de début et de fin, fait des brouillons en 360p pour un tiers du prix et monte en 4K est un composant que l'on peut insérer dans une timeline.

C'est la version de la vidéo générative autour de laquelle les équipes de production peuvent planifier, et c'est la version où l'ingénierie intéressante passe de l'écriture de prompts à la conception de pipelines. Dans cette version, l'assemblage compte plus que le clip.

Articles associés