← Retour au blog
AiEnviron 9 min de lecture

Kling 4.0 est disponible : dix images clés, trente secondes et la fin du montage à la machine à sous

Publié le 7 oct. 2026
Kling 4.0 est disponible : dix images clés, trente secondes et la fin du montage à la machine à sous

Kling 4.0 de Kuaishou a ouvert ses tests internes le 28 septembre, la déclinaison légère Kling 4.0 Flash étant déployée auprès des membres le soir même et le modèle complet promis pour octobre. L'entreprise mène une guerre des spécifications avec Seedance de ByteDance depuis près d'un an, et cette sortie est sa déclaration la plus claire à ce jour sur ce qui est réellement en jeu dans ce combat.

Les chiffres phares sont simples. La génération native en un seul passage double, passant des 15 secondes de Kling 3.0 à 30 secondes, avec une extension vidéo promettant jusqu'à deux minutes sur plusieurs passages. La sortie atteint la 4K et la 1080p en HDR 10 bits, ainsi qu'un cadre ultra-large 21:9. L'audio passe en stéréo deux canaux, et la dérive de synchronisation labiale qui a handicapé la génération précédente est le défaut spécifique que les notes de version affirment avoir corrigé. L'entrée de prompt monte à 8 000 tokens.

Aucun de ces chiffres n'est le plus intéressant.

Dix images clés, c'est une autre catégorie de produit

Kling 3.0 acceptait une image de début et une image de fin. Deux images, et le modèle interpolait tout ce qui se trouvait entre elles. Quiconque a essayé de tourner une vidéo produit de cette manière sait ce que cela donne : vous pouvez définir les extrémités, puis vous regardez ce que vous obtenez. Les créateurs chinois ont un mot pour cela, 抽卡, « tirer des cartes », le même terme que les jeux gacha emploient pour les tirages aléatoires.

Kling 4.0 accepte jusqu'à dix images clés. Cela ressemble à un changement de quantité. Ce n'est pas le cas.

Avec dix points de contrôle, vous pouvez décrire une séquence de moments dans une seule génération : le personnage entre, marche vers le comptoir, la caméra avance, le produit tourne, une main le saisit, coupe vers un cadre plus large. Chacun de ces moments a sa propre image d'ancrage, de sorte que le modèle ne devine plus la forme de l'arc entre deux points d'arrivée. Il comble les intervalles entre dix d'entre eux.

Pour une équipe qui produit en volume des vidéos commerciales courtes, cela change l'unité de livraison. Auparavant, un spot produit de 30 secondes impliquait un tournage ou un montage de stock-shots, la génération par IA étant limitée à quelques secondes de remplissage. Désormais, toute la timeline peut être produite à partir d'un script, avec des images clés associées aux temps forts du plan. Le travail passe de « générer et espérer » à « storyboarder, puis générer ».

Cinq cartes de storyboard en laiton vierges alignées en rangée nette sur une table en noyer foncé, à côté d'une fine règle en acier

La section commentaires de l'annonce de Kuaishou elle-même vaut la peine d'être lue, car la question la plus votée n'avait rien à voir avec les capacités, et tout à voir avec le prix. C'est un signal assez honnête de l'endroit où se situe la contrainte en 2026 : le plafond de capacités ne cesse de monter, et le plancher des coûts n'a pas évolué aussi vite.

Ce que les références multimodales contrôlent réellement

Kling 4.0 prend en charge jusqu'à 15 références multimodales dans une seule tâche, jusqu'à 10 images, 5 clips vidéo et 7 combinaisons de sujets. Kuaishou a baptisé cela Omni Reference, et cela permet aussi d'ajouter, de modifier ou de supprimer des sujets et des arrière-plans dans des séquences existantes.

Relisez cette liste et elle commence à ressembler moins à une fonctionnalité de génération qu'à un contrat de cohérence. Le mode de défaillance récurrent dans la vidéo IA n'a jamais été l'image unique, c'est le quatrième plan, où le visage de l'acteur a dérivé, la veste a changé de teinte et l'étiquette du produit s'est transformée en quelque chose qui ne survivrait pas à un examen juridique. Verrouiller l'identité sur 15 emplacements de référence pendant une génération de 30 secondes est une tentative de répondre directement à cela.

Il y a une véritable contrainte de production cachée ici. Le matériel de référence doit exister avant de pouvoir être utilisé, et construire une fiche de personnage, une rotation produit et un échantillon vocal est en soi un travail de production. Les équipes qui tireront de la valeur de Kling 4.0 seront celles qui possèdent déjà cette bibliothèque constituée, ou qui ont fait de son assemblage une partie de leur pipeline.

Vitesse, coût et la position réelle de Kling

Kling 4.0 Flash est la déclinaison haute fréquence : génération plus rapide, coût plus faible, limitée à 720p pendant l'accès anticipé. Le modèle complet est la déclinaison professionnelle pour le cinéma et la publicité.

Il vaut la peine d'être précis sur le paysage concurrentiel plutôt que de répéter le cadrage de Kuaishou. Sur le classement text-to-video d'Artificial Analysis, Kling 3.0 se situait autour de la douzième place, derrière Gemini Omni Flash de Google, Wan 3.0 d'Alibaba et H3 Max de MiniMax. Kling 4.0 constitue un sérieux bond de capacités, et savoir s'il comble cet écart de classement reste une question ouverte tant que des évaluations indépendantes ne sont pas publiées.

Le contexte de marché compte davantage que le classement. Kuaishou a annoncé environ 3 milliards de dollars de financement indépendant en juillet 2026, sur une valorisation post-money d'environ 18 milliards de dollars, avec, selon les informations disponibles, un engagement de cotation à cinq ans. L'analyse de Citigroup, rapportée par Securities Times, s'articule autour de deux questions : Kling peut-il reconquérir des utilisateurs face à Seedance, qui détiendrait plus de 80 % du marché national, et le prix est-il suffisamment compétitif pour compter.

La question du prix n'est pas accessoire. La même semaine où Kling 4.0 a été annoncé, HeyGen a lancé un modèle vidéo universel à un cent par seconde, Creatify a livré un dérivé post-entraîné de MiniMax H3 à quatre cents par seconde, et SpaceXAI a poussé une déclinaison lite de Grok Imagine Video via des plateformes tierces, en affirmant être quatre fois moins cher que l'option précédente. La couche de génération est en voie de banalisation depuis plusieurs directions à la fois, et un modèle qui mène sur la sortie 4K HDR se bat sur une dimension que ses rivaux ont décidé de ne pas mener.

Cela recadre la finalité de Kling 4.0. L'ambition est d'être le générateur auquel une équipe de production peut confier un brief et obtenir un livrable, ce qui est une promesse différente et plus difficile à tarifer.

Le flux de travail est la véritable amélioration

La partie peu glamour de cette sortie est peut-être la plus déterminante : text-to-video, image-to-video, génération par référence, extension vidéo et montage vidéo résident désormais dans un seul flux de travail multimodal natif. Les références d'images, de vidéo et d'audio peuvent être combinées dans un seul champ de saisie. La page de génération prend en charge la prévisualisation et le montage sur timeline, les dispositions en grille et en liste, ainsi que ce que Kuaishou appelle une expérience canvas Agent.

Les outils de vidéo IA ont passé deux ans à être une collection d'étapes déconnectées : générer ici, upscaler là, monter dans une troisième application, synchroniser l'audio dans une quatrième. Consolider cela en une seule surface est ce qui rend une timeline de 30 secondes pratique. C'est aussi là que l'outil commence à chevaucher le monteur, ce qui est un combat concurrentiel différent de celui contre Seedance.

La consolidation a son propre coût. Un outil qui maîtrise la génération, le montage et la revue sur timeline est un outil qui veut posséder le fichier de projet, et les équipes qui disposent déjà d'une chaîne de post-production établie devront décider quelle part de leur pipeline confier. Kuaishou construit dans cette direction depuis un moment, avec le support MCP et CLI pour la création par lots pilotée par agents, et le cadrage « canvas » suggère que l'entreprise voit l'orchestration comme le produit, et non le clip.

Où le goulot d'étranglement se déplace réellement

Le cadrage que Kuaishou met en avant est celui d'une vidéo IA qui passe de la machine à sous au storyboard. C'est une description juste de ce que dix images clés permettent. Cela déplace aussi le goulot d'étranglement : les équipes qui avaient du mal à produire une pièce cohérente de 30 secondes auront désormais du mal à écrire un script cohérent de 30 secondes. L'outil a transféré le contrôle du storyboard. Savoir s'il existe un storyboard à lui confier est une autre question, et ce n'est pas une question à laquelle une sortie de modèle peut répondre.

Il y a une version de cela qui est une véritable bonne nouvelle et une version qui est un piège. La bonne version : les équipes disposant d'un script et d'une liste de plans obtiennent un multiplicateur de production, parce que la partie coûteuse de leur processus (coordonner un tournage) s'effondre en une passe de génération. La version piège : les équipes dépourvues de l'un comme de l'autre génèrent beaucoup plus de contenu de même qualité, à un volume supérieur, et découvrent que la contrainte n'a jamais été le rendu.

La réponse de Kling 4.0 à cela est essentiellement un pari : le marché a déjà opéré cette transition. Dix images clés, 15 références et des prompts de 8 000 tokens sont des fonctionnalités pour ceux qui ont quelque chose de précis à dire. Demander autant de contrôle ne vaut la peine que si vous savez à quoi vous voulez que le plan ressemble avant d'appuyer sur générer.

Articles associés