← Retour au blog
AiEnviron 9 min de lecture

Vibe Video : le modèle de codage qui réalise des films en écrivant du code frontend

Publié le 10 oct. 2026
Vibe Video : le modèle de codage qui réalise des films en écrivant du code frontend

Au cours du mois écoulé, la vidéo IA la plus commentée au monde n'a pas été créée par un modèle vidéo. Elle a été créée par un modèle de codage qui a écrit du code frontend jusqu'à ce qu'une animation apparaisse.

Les clips provenaient de Claude Opus 5.5. Dans un cas largement partagé, un créateur a utilisé un prompt de référence, un accès à Midjourney et un mood board pour produire un court métrage dystopique cinématographique en une douzaine d'heures. La publication a dépassé les 20 millions de vues. Un autre créateur a généré une pièce de deux minutes et seize secondes sur l'histoire de la civilisation avec une seule instruction ; elle a franchi les dix millions de vues en deux jours. Une collection GitHub de vidéos Opus 5.5 a rassemblé plus de 400 entrées, la plupart avec des prompts et du code publics.

Les gens ont commencé à l'appeler Vibe Video. Le nom est maladroit, mais la technique mérite d'être comprise, car c'est une voie véritablement différente vers l'image en mouvement que celle que tout le monde emprunte.

Le code comme moteur de rendu

Le pipeline habituel de vidéo IA est un modèle de diffusion qui prédit des pixels. Vous lui fournissez un prompt ou une image fixe, il renvoie des images. Le modèle est entraîné sur de la vidéo, et son sens du mouvement est appris à partir de ces données.

Le rendu par code fonctionne différemment. Un modèle de langage écrit du HTML, du CSS, du SVG ou du JavaScript qui dessine une animation, et un navigateur la rend. Rien n'est prédit image par image. Le mouvement vient d'un code qui décrit explicitement la position, le timing et l'accélération.

Cette distinction compte parce qu'elle rend faciles certaines choses que la diffusion trouve difficiles. Des graphiques précis, de la typographie, des diagrammes, un mouvement géométrique et des transitions entre écrans sont triviaux lorsqu'ils sont du code. Ce sont exactement les éléments qui ressortent flous d'un modèle vidéo. La contrepartie est que le rendu par code ne peut pas produire un visage humain photoréaliste en mouvement. Il dessine ce que le code peut décrire.

Un panneau d'éditeur de code à gauche alimentant une image d'animation nette à droite

Pourquoi les créateurs se sont rués dessus

Deux propriétés expliquent l'engouement. La première est la reproductibilité. Un clip de diffusion est un échantillon ; relancez-le et vous obtenez un cousin, pas un jumeau. Une animation codée est un programme. Changez une valeur et vous savez ce qui se passe. Cela rend la révision bon marché, et c'est dans la révision que réside en réalité l'essentiel du travail.

La seconde est que la sortie est déjà dans un format que le reste d'un flux de travail peut utiliser. Une animation de navigateur peut être capturée, intégrée à un site ou connectée à une source de données. Elle s'insère naturellement dans une page produit ou un tableau de bord, ce qui est précisément l'origine d'une grande partie de la demande commerciale de mouvement.

Il y a aussi une raison liée à l'offre. Claude Opus 5.5 a été lancé le 22 septembre avec une fiche système de 230 pages et un tarif API de quatre dollars par million de jetons d'entrée et vingt par million de sortie. Il s'est classé près du précédent modèle phare sur la plupart des tâches, à un coût nettement inférieur. Des modèles de pointe moins chers rendent la génération de code longue et itérative praticable pour les particuliers, ce qu'exigent réellement les constructions de douze heures.

L'autre voie

La même semaine, un autre modèle généraliste s'avançait dans la vidéo par une direction différente. GPT-6 Astra aurait agi comme une sorte de réalisateur IA, gérant la planification du storyboard et la prévisualisation en modèle blanc, et allant dans Blender, Unreal Engine et DaVinci Resolve pour construire des scènes, bloquer les plans et gérer les montages.

Rapprochez les deux et un schéma apparaît. Les modèles polyvalents ne cherchent pas à battre Seedance, Kling ou MiniMax sur le mouvement photoréaliste. Ils remontent en amont, vers la planification et le pipeline de production, et latéralement, vers un mouvement programmatique plutôt que photographique. Cela laisse aux modèles vidéo spécialisés le soin de continuer à pousser le réalisme, tandis que les modèles généralistes prennent les parties du processus qui ressemblent à du logiciel.

Comment le flux de travail fonctionne réellement

Le processus décrit par les créateurs qui obtiennent de bons résultats ressemble davantage au développement logiciel qu'à la réalisation cinématographique. Vous écrivez un prompt qui définit l'ambiance et les contraintes, le modèle produit du code, le code est rendu dans un navigateur, et vous regardez le résultat. Puis vous changez une chose et relancez. La boucle est courte et la sortie est inspectable, ce qui explique pourquoi des constructions de douze heures sont possibles. Douze heures à confier un paragraphe à un modèle vidéo produiraient du bruit. Douze heures à modifier du code produisent une pièce finie.

Le mood board et le modèle de référence comptent pour une raison qui n'a rien à voir avec la composition. Ils donnent aux images fixes une palette et un sujet cohérents, afin que, lorsque le code les place et anime autour d'elles, les éléments semblent appartenir à un même film. Le code fournit le mouvement et la typographie. Les images fixes fournissent le monde. Aucune des deux moitiés ne fonctionne sans l'autre.

Où se situe réellement le coût

Il est tentant de penser que la vidéo rendue par code est gratuite, car le rendu se fait dans un navigateur sur votre propre machine. Les appels au modèle, eux, ne sont pas gratuits, et la boucle est longue. Chaque réécriture est une requête payante, et une pièce avec des centaines de modifications représente des centaines de requêtes avec un large contexte attaché. La baisse de prix d'Anthropic à quatre dollars par million de jetons d'entrée est ce qui a rendu cette boucle abordable pour les particuliers, et pas seulement pour les studios. Moins le modèle est cher, plus un créateur peut itérer librement, et l'itération est toute la méthode.

Cela a une conséquence étrange. Le goulot d'étranglement de ce style n'est pas la puissance de calcul pour le rendu. C'est la revue. Quelqu'un doit regarder chaque rendu et décider quoi changer, et cette attention ne diminue pas avec un prix d'API plus bas. Les créateurs qui réussissent avec Vibe Video sont, fonctionnellement, des réalisateurs qui fixent les rushes et donnent des notes, sauf que les notes vont dans un diff.

Rendu par code et vidéo générée, côte à côte

Il est utile d'être précis sur ce que fait chaque style. Le rendu par code est reproductible, bon marché à réviser, net sur les graphiques et le texte, et à l'aise avec les données. Il ne peut pas générer un acteur photoréaliste, une foule ou un moment pris sur le vif. La vidéo de diffusion fait cela bien et traite tout le reste comme une approximation. Un logo rendu par un modèle vidéo sort presque juste. Un logo rendu par du code est exact.

Cette séparation suggère que les deux coexisteront plutôt qu'ils ne se concurrenceront. Une pièce peut s'ouvrir sur un plan d'ensemble généré, passer à un graphique animé codé, et se conclure sur des images générées. La question créative intéressante cesse d'être quel outil utiliser et devient où basculer. Les équipes qui comprennent ces coutures produiront un travail qui semble délibéré.

Là où ça ne fonctionne pas

Le rendu par code n'est pas un remplacement de la génération vidéo, et le traiter comme tel décevra. Il ne peut pas filmer un acteur. Il ne peut pas produire une image documentaire ou une foule crédible. Il est fort en design, mouvement abstrait, information et interface, et faible sur tout ce qui doit donner l'impression qu'une caméra était là.

Il a aussi un profil de coût dont personne ne parle. Vous pouvez brûler beaucoup de jetons de modèle avant qu'une seule image soit correcte, car la boucle est écrire, rendre, inspecter, réécrire. Des modèles moins chers réduisent ce coût, mais ne l'éliminent pas. Les créateurs qui obtiennent des résultats frappants ne se contentent pas de prompter ; ils examinent du code.

Ce que cela nous dit du domaine

Ce qui est intéressant avec Vibe Video, ce n'est pas qu'un modèle de codage puisse produire un joli clip. C'est que la frontière entre « génération vidéo » et « logiciel qui fait bouger les choses » s'est révélée plus poreuse que quiconque ne l'imaginait. Quand un modèle de langage peut écrire directement l'animation, une partie de la demande de vidéo générative trouve réponse dans le code.

Pour les personnes qui créent des visuels, la question pratique n'est plus de savoir s'il faut choisir un seul outil. Elle est de savoir quelles parties d'une pièce sont mieux servies par une image prédite et lesquelles le sont par une image écrite. Les équipes qui le comprennent dès maintenant sont celles dont le travail semblera délibéré plutôt que simplement généré.

Articles associés