← Retour au blog
AiEnviron 9 min de lecture

La méthode des deux images : comment l’interpolation entre première et dernière image a transformé la planification vidéo par IA

Publié le 10 oct. 2026
La méthode des deux images : comment l’interpolation entre première et dernière image a transformé la planification vidéo par IA

Google a mis à jour la fonctionnalité First and Last Frame to Video de Veo 3.1 le 9 octobre. Vous téléversez deux images fixes, l’image d’ouverture et l’image de fermeture, et le modèle génère le mouvement entre les deux. La sortie va jusqu’à la 4K à 60 ips avec audio natif, elle prend en charge le format vertical 9:16, et elle accepte trois ou quatre images de référence pour garder les personnages et le style cohérents.

Pris isolément, cela ressemble à un petit ajout. En pratique, cela change la façon dont on planifie un plan, parce que cela remet au début du processus les deux décisions qui comptent vraiment.

Le problème de la vidéo pilotée uniquement par prompt

Pendant la majeure partie des deux dernières années, la vidéo par IA a fonctionné comme une machine à sous. Vous écriviez un paragraphe, vous attendiez, et vous regardiez quelque chose sortir. Le résultat était souvent assez bon pour être publié, et rarement assez bon pour être retenu. Si le personnage dérivait ou si la caméra faisait quelque chose d’étrange, vous réécriviez le prompt et vous recommenciez.

Les créateurs ont appris à contourner cela. Ils généraient une image fixe forte, puis demandaient à un modèle de l’animer, ce qu’on appelle l’image vers vidéo. Cela figeait l’image d’ouverture, mais personne ne contrôlait où le plan se terminait. Les clips avaient tendance soit à s’essouffler, soit à inventer une fin que personne n’avait demandée.

Définir les deux extrémités élimine une bonne part de ce tâtonnement. Vous décidez où le public commence à regarder et où il finit de regarder. Le travail du modèle est plus étroit : relier les deux.

Pourquoi la pensée en storyboard est de retour

Les studios d’animation travaillent ainsi depuis un siècle. Un animateur dessine une pose clé, puis une autre pose clé, et remplit les dessins entre les deux. Le savoir-faire réside dans le choix des poses, pas dans le dessin de chaque image. La vidéo par IA arrive à la même répartition du travail par un autre chemin.

Ce n’est pas propre à Veo. La course à la contrôlabilité s’intensifie depuis des mois. Kling 4.0 est sorti avec dix images clés et des clips natifs de 30 secondes. Seedance 2.5 peut refilmer des séquences existantes sous un nouvel angle de caméra. Wan 3.0 a pris la tête du benchmark AA-Video-T2V v2.0 d’Artificial Analysis avec un Elo de 1157, pour environ 12 $ par minute. L’aperçu Q4 de Vidu, publié le 7 octobre, démarre à environ 0,014 $ par seconde et accepte jusqu’à 15 images de référence. Ce que les modèles les plus forts ont en commun tient moins à la qualité brute qu’à la précision avec laquelle on peut les piloter.

Une chronologie avec deux images clés reliées par un arc de mouvement lumineux

À quoi ressemble une configuration qui fonctionne

La méthode des deux images ne porte ses fruits que si les deux images valent la peine d’être reliées. Quelques habitudes aident.

Générez les images avec un modèle d’image plutôt qu’à partir d’une capture d’écran d’un clip précédent. Vous voulez contrôler la composition, l’éclairage et les costumes aux deux extrémités. Veo de Google accepte des images de référence précisément pour qu’un visage ou un produit survive à la transition, et cela ne fonctionne que si les références sont cohérentes au départ.

Gardez un mouvement de caméra simple. L’interpolation gère bien un travelling avant, un travelling arrière, une révélation ou une lente dérive. Elle peine quand vous demandez une coupe franche à l’intérieur d’un même clip, parce qu’il n’y a pas de coupe à interpoler. Si un plan a besoin d’une coupe, faites deux clips.

Alignez le plan audio sur le plan. Veo 3.1 synthétise l’audio natif, ce qui est utile pour les sons d’ambiance et les effets simples. Si la scène a besoin d’une réplique précise ou d’une piste sous licence, prévoyez de l’ajouter après coup plutôt que de lutter contre le son généré.

Réservez la méthode aux plans qui portent un moment narratif. Il n’y a aucune raison de dépenser deux images bien construites sur une transition de deux secondes. Utilisez-la là où le public est censé remarquer le changement.

Ce que coûtent vraiment deux images supplémentaires

Planifier en images est une décision qui a un prix, et ce prix est plus facile à lire aujourd’hui qu’il y a un an. Le marché de la vidéo n’a cessé de faire baisser le coût par seconde. L’aperçu Q4 de Vidu, publié le 7 octobre, démarre à environ 0,014 $ par seconde et accepte jusqu’à quinze images de référence. Grok Imagine Video 1.5 Lite de xAI, ajouté à son API le 8 octobre, est annoncé à 0,02 $ par seconde en 480p et monte à 0,14 $ en 1080p. Le nouveau modèle vidéo généraliste d’HeyGen est sorti à un tarif promotionnel d’octobre d’un cent par seconde. Wan 3.0, qui a pris la première place du benchmark vidéo d’Artificial Analysis avec un Elo de 1157, est annoncé autour de 12 $ par minute, ce qui revient à vingt cents par seconde.

Deux conséquences en découlent. Premièrement, la génération elle-même est rarement la partie coûteuse aujourd’hui. Quelques secondes de mouvement interpolé coûtent des cents, pas des dollars. Deuxièmement, la ressource rare, ce sont les images. Générer et sélectionner deux images fixes fortes prend du temps humain, et ce temps ne devient pas moins cher quand l’API devient moins chère. L’économie récompense la planification, pas le volume, ce qui est l’inverse de ce que les outils uniquement par prompt ont appris aux gens à faire.

Un flux de travail qui tient sur un vrai projet

Voici comment la méthode s’intègre à une petite production sans tout changer. Commencez par le concept et décidez du seul temps fort que le plan doit marquer. Construisez l’image d’ouverture et l’image de fermeture sous forme d’images, en utilisant les mêmes références pour que les visages, les costumes et les accessoires concordent. Générez l’interpolation, puis regardez-la une fois pour la structure et une fois pour les détails. Si le mouvement dévie, corrigez les images plutôt que le prompt, car ce sont les images que le modèle lit réellement. Ajoutez ou remplacez l’audio selon le plan. Puis montez-le dans la séquence et jugez-le en contexte, car un clip qui impressionne seul peut encore paraître lent à côté de ses voisins.

La discipline ici, c’est que chaque correction est une décision sur l’histoire, pas un coup de dés. C’est ce que les gens manquent lorsqu’ils essaient la fonctionnalité pour la première fois. Elle donne l’impression d’un raccourci, mais elle réintroduit discrètement la préproduction que la première génération d’outils vidéo par IA avait poussé les gens à sauter.

Là où une caméra classique gagne encore

Rien de tout cela ne dit que le tournage est obsolète. L’interpolation est la plus forte lorsque les deux extrémités sont fortes et que le mouvement entre elles est simple, ce qui couvre beaucoup de plans produit, de transitions, de cartons de titre et d’images d’ambiance établissant un lieu. Elle est la plus faible quand la réalité fait quelque chose de précis et d’imprévisible : un vrai cheval au galop, une foule qui réagit, de la nourriture cuisinée d’une manière qui doit paraître vraie. Pour cela, une caméra et un monteur compétent tranchent encore le débat.

La position raisonnable est ennuyeuse. Utilisez l’interpolation là où le contrôle compte et où le mouvement est prévisible, et utilisez une caméra là où la scène doit être réelle. La plupart des créateurs qui travaillent finissent par avoir les deux dans le même projet, et ce mélange n’est pas un compromis. C’est simplement de la production.

Les limites honnêtes

L’interpolation reste de l’interpolation. Si les deux images impliquent un entre-deux physiquement compliqué, comme une personne qui fait un tour complet ou un liquide qui change de forme, le modèle inventera quelque chose et ce ne sera pas toujours juste. Gardez le mouvement implicite dans les limites de ce qu’une caméra pourrait plausiblement filmer.

Cela fait aussi monter le coût. Deux images fixes peaufinées plus un clip généré, c’est plus de travail qu’un seul prompt. Aux prix par seconde actuellement pratiqués sur le marché, c’est plus abordable qu’il y a un an, mais le temps de planification est bien réel. La méthode récompense les personnes qui pensent déjà en plans.

Et il n’y a toujours aucune garantie sur le milieu. Ce que la fonctionnalité vend vraiment, c’est un espace de recherche plus petit, pas un problème résolu. C’est un pas significatif. Cela signifie que la différence entre un clip utilisable et un clip mémorable tient désormais surtout aux images que vous choisissez, une décision qui revient à une personne.

Ce qu’il faut surveiller ensuite

Attendez-vous à ce que le même schéma se répande. Dès qu’un modèle majeur traite les images comme entrée principale, les concurrents ont tendance à suivre, et la question intéressante devient de savoir quelle interpolation paraît la plus naturelle aux jonctions. Surveillez les outils qui permettent d’ajouter une image clé intermédiaire, ce qui donnerait aux réalisateurs un troisième point d’ancrage sans quitter la timeline.

Pour l’instant, la conclusion pratique est peu glamour. Si vous faites de la vidéo par IA, cessez de traiter le prompt comme l’acte créatif principal. Construisez d’abord les images, choisissez les deux qui racontent l’histoire, et laissez le modèle gérer le trajet entre elles.

Articles associés