← Retour au blog
AiEnviron 9 min de lecture

Kling VIDEO O1 transforme la génération vidéo en un système de référence

Publié le 7 oct. 2026
Kling VIDEO O1 transforme la génération vidéo en un système de référence

--- title: Kling VIDEO O1 transforme la génération vidéo en un système de référence slug: kling-video-o1-turns-video-generation-into-a-reference-system meta_title: Kling VIDEO O1 : les références comme interface meta_description: Kling VIDEO O1 de Kuaishou accepte du texte, des images, de la vidéo, des images clés et des références dans n’importe quelle combinaison, puis vous permet de puiser des éléments d’un clip dans un autre. category: ai tags: Kling VIDEO O1,Kuaishou,génération vidéo,système de référence,images clés,multimodal,Veo 3.1,Runway Aleph,cohérence ---

La branche vidéo de Kuaishou a passé le mois dernier à livrer des nouveautés. Kling 4.0 s’est ouvert aux testeurs, puis a bénéficié d’une fenêtre de lancement plus large. Aujourd’hui, VIDEO O1 arrive comme quelque chose de plus proche d’un changement de catégorie : un modèle qui prend en entrée du texte, des images, des clips vidéo, des images clés et des références de personnages, et les traite tous comme des pièces interchangeables d’une même requête.

L’étiquette utilisée par l’entreprise est « multimodal unifié ». La version pratique est plus simple à énoncer. Vous pouvez joindre trois clips et écrire : prenez le personnage de la vidéo une, le mouvement de caméra de la vidéo deux, intégrez les deux dans la vidéo trois, et passez le style en pixel art.

Il y a un an, cette seule requête aurait nécessité trois outils distincts et une exportation minutieuse de fichiers intermédiaires, chaque étape ajoutant une passe de compression et une chance que le personnage dérive.

Ce que la référence tout-en-un vous apporte réellement

La cohérence des personnages et des accessoires a été le problème tenace de la vidéo IA. Les contournements précédents enchaînaient les modèles, ce qui impliquait de payer chaque étape et d’accepter la dérive qui s’accumulait entre elles. L’approche de Kling replie cette chaîne en une seule génération, de sorte que les images de référence, les images clés et la direction stylistique soient résolues en même temps.

Les chiffres de Kling placent O1 à un taux de victoire de 247 pour cent face à la fonctionnalité « Ingredients to Video » de Veo 3.1 de Google sur les tâches de référence d’image, et de 230 pour cent face à Runway Aleph sur les tâches de transformation. Ce sont des évaluations internes, à prendre comme indicatives. L’affirmation de capacité est plus vérifiable : les scènes de groupe, où plusieurs sujets doivent rester individuellement verrouillés, sont gérées par sujet plutôt que comme une moyenne fusionnée.

La durée vidéo va de trois à dix secondes, ajustable, ce qui vous permet de rythmer un plan plutôt que d’accepter ce que le modèle décide. Sous le capot, l’entreprise décrit un transformeur multimodal doté d’un long contexte multimodal, ainsi qu’un nouveau format interne qu’elle appelle un langage visuel multimodal, qui mélange les signaux textuels, visuels et audio à l’intérieur même du transformeur. Un raisonnement en chaîne de pensée intégré est censé maintenir le réalisme physique du mouvement généré.

Les types de génération répertoriés ressemblent à une liste de tout ce que la catégorie a fragmenté en outils distincts : texte-vers-vidéo, image-vers-vidéo, vidéo-vers-vidéo, image clé-vers-vidéo, plusieurs images-vers-vidéo et référence-vers-vidéo-vers-vidéo. Chacun d’entre eux était autrefois un produit. O1 affirme qu’il s’agit de modes d’un seul système.

Pourquoi l’interface compte plus que le benchmark

Le plus intéressant est qu’O1 remporte une comparaison, tout en ayant une surface d’entrée qui constitue le changement le plus important. C’est désormais une bibliothèque d’éléments réutilisables. Un personnage construit sous plusieurs angles devient un élément que l’on joint par son nom au lieu de le redécrire dans chaque prompt. Le mouvement de caméra devient quelque chose que l’on emprunte à un clip plutôt que de l’approximer avec des adjectifs.

Un clap de cinéma en bois vide posé sur une surface en lin pâle, son panneau d’ardoise complètement vierge et sans inscription

Cela change la forme du flux de travail. La chaîne linéaire modèle d’image, puis modèle vidéo, puis éditeur, avec un coût à chaque étape, se réduit à moins d’étapes. Cela change aussi le public visé : les équipes de post-production reçoivent des instructions en langage naturel à la place des passes de suivi et de masquage, et les équipes publicitaires obtiennent un moyen de remplacer un tournage sans reconstruire chaque plan de zéro.

Le vocabulaire est l’autre moitié de l’interface. Joindre un élément par son nom signifie qu’une équipe peut s’accorder sur le nom d’un personnage avant même d’écrire le prompt d’un seul plan, puis réutiliser ce nom tout au long d’une campagne. Approximer la même chose avec des adjectifs fonctionne une fois, puis devient plus difficile à chaque révision, car rien ne consigne la combinaison d’adjectifs qui a produit la version que tout le monde a aimée.

La documentation du fournisseur décrit les cas d’usage professionnels en des termes similaires. La création de films par IA s’appuie sur la bibliothèque d’éléments pour maintenir la cohérence des personnages et des accessoires tout au long d’un tournage. La publicité et la mode l’utilisent comme substitut au travail en extérieur, y compris pour des podiums virtuels. La post-production l’utilise pour apporter des modifications qui nécessitaient auparavant un rotoscoping image par image.

Il y a ici un effet d’auto-sélection. Un modèle avec autant de types d’entrée n’est pas plus convivial pour les débutants ; il est plus convivial pour les personnes qui savent déjà ce qu’elles veulent. C’est un changement significatif pour une catégorie qui a passé deux ans à optimiser l’expérience de première utilisation.

Ce que le système de référence remplace

La façon la plus claire de comprendre ce changement est de regarder ce qu’une équipe construisait autour d’un modèle faible. Les pipelines de cohérence étaient des chaînes de montage : générer une planche de personnage, l’injecter dans chaque plan comme prompt d’image, générer un animatique, puis régénérer chaque plan avec une image de départ issue de l’animatique. Chaque étape existait parce que la précédente ne pouvait pas transporter suffisamment de contexte.

Le système de référence d’O1 cible la raison d’être de ces étapes. Si le modèle peut maintenir l’identité d’un personnage à travers une scène de groupe tout en reprenant le mouvement de caméra d’un clip séparé, alors certaines de ces étapes deviennent optionnelles plutôt qu’obligatoires. C’est dans les étapes optionnelles que les budgets bougent réellement, car un pipeline construit autour d’une limitation ne disparaît pas simplement parce que la limitation s’atténue.

La même logique s’applique au séquençage des plans. Les programmes qui génèrent le plan précédent ou suivant à partir de séquences existantes transforment une bibliothèque de clips en quelque chose de plus proche d’une scène. Les monteurs qui travaillent déjà en timeline reconnaîtront la valeur : le coût d’essayer un angle alternatif passe d’un nouveau tournage à une génération.

Le compromis est réel

Kling indique qu’O1 a une courbe d’apprentissage plus abrupte que Sora 2 ou Veo 3.1, car il y a davantage de capacités à comprendre avant que l’une d’elles soit utile. C’est le coût standard d’une interface plus expressive. Un modèle qui accepte n’importe quoi comme référence vous demande de décider ce qui doit être référencé.

L’entreprise n’a pas résolu le son dans O1. Kling 2.6 est le modèle qui porte la génération audio pour la plateforme, avec dialogues synchronisés, musique et effets sonores. Une production complète signifie donc encore associer deux modèles, l’un pour le langage visuel et l’autre pour la bande-son. Le marketing de Kling pour 2.6 s’appuie sur l’idée de voir le son et d’entendre le visuel, ce qui décrit bien une capacité qui vit en dehors d’O1.

La tarification reflète aussi la position que la plateforme veut occuper. Les crédits par seconde publiés par Kling passent de six crédits en 720p sans audio à douze en 1080p avec audio, et la plateforme met en avant une politique d’utilisation commerciale qui s’étend aux générations gratuites. Pour un modèle positionné sur les flux de travail professionnels, le point d’entrée reste suffisamment bas pour qu’une petite équipe puisse le tester avant de s’engager.

Ce qu’il faut surveiller

La question est de savoir si le système de référence d’O1 tient la route en dehors des démos contrôlées. Les affirmations de cohérence ont tendance à survivre aux clips courts et aux sessions courtes, puis à se dégrader quand un projet dure des semaines et accumule des dizaines d’éléments. Le concept de bibliothèque d’éléments n’est rentable que si les éléments restent stables sur cette durée.

Kuaishou a déjà annoncé que 4.0 apporte une génération native de 30 secondes et jusqu’à 10 images clés. Si la couche de référence d’O1 se combine avec ces limites plutôt que d’entrer en concurrence avec elles, le duo couvre à la fois la question de la « durée » et celle du « visage ». C’est cette combinaison que les studios attendaient.

Le paysage concurrentiel à court terme compte aussi. Gemini Omni 1.1 Flash occupe la première place du classement texte-vers-vidéo sur Arena avec 1516, MiniMax H3 menant l’image-vers-vidéo, et Wan 3.0 dominant le tableau vidéo d’Artificial Analysis. O1 n’arrive pas dans un champ vide. Sa différenciation réside dans la surface d’entrée plutôt que dans une position au classement, ce qui est plus difficile à déloger une fois que les équipes construisent des bibliothèques d’éléments autour d’elle.

Articles associés