← Retour au blog
AiEnviron 8 min de lecture

Kandinsky 6.0 ouvre ses poids vidéo qui génèrent le son en une seule passe

Publié le 6 oct. 2026
Kandinsky 6.0 ouvre ses poids vidéo qui génèrent le son en une seule passe

--- title: Kandinsky 6.0 ouvre ses poids vidéo qui génèrent le son en une seule passe meta_title: Kandinsky 6.0 ouvre le code source d'une vidéo avec audio natif meta_description: Kandinsky Lab a publié des modèles vidéo 3B et 29B qui génèrent un audio synchronisé en une seule passe, sous licence MIT, avec un support vLLM-Omni dès le premier jour. ---

La plupart des systèmes ouverts de génération de texte en vidéo traitent le son comme le problème de quelqu'un d'autre. Vous générez des images muettes, puis vous greffez une bande-son après coup, et le mouvement des lèvres tombe rarement là où se trouve le dialogue. La réponse de Kandinsky Lab, publiée cette semaine sur fal, consiste à modéliser les deux en même temps.

Kandinsky 6.0 Video est proposé en deux tailles : un modèle Pro de 29B orienté rendu cinématographique et une version Lite de 3B pour des itérations rapides. Le code et les poids sont publiés sous licence MIT, ce qui compte davantage que le nombre de paramètres pour quiconque envisage un usage commercial.

Ce que les deux niveaux offrent réellement

Les deux modèles visent la génération de formats courts. Les clips durent jusqu'à environ cinq secondes, et l'audio est produit à un taux d'échantillonnage de 44 kHz. Pro est le niveau de qualité ; Lite est positionné pour les équipes qui ont besoin d'itérer rapidement et acceptent d'échanger de la fidélité contre de la vitesse et du coût.

La capacité phare est la génération conjointe. Langage, vision et audio sont modélisés ensemble plutôt que dans un pipeline, de sorte que les pas, les effets ambiants et les mouvements de bouche s'alignent avec ce qui se passe à l'écran. Ce type de synchronisation native a surtout été le domaine de systèmes commerciaux fermés, et c'est ce qui rend une publication ouverte remarquable.

Ondulations translucides qui se chevauchent dans une eau sombre, éclairées par une lumière ambrée chaude et bleu-vert froide

vLLM-Omni assure une prise en charge de l'inférence dès le premier jour. Cela compte au-delà du simple confort. Quand une pile d'inférence prend en charge un modèle le jour de sa sortie plutôt que des semaines plus tard, les équipes peuvent l'évaluer par rapport à leur propre charge de travail avant que l'enthousiasme initial ne retombe.

Sur fal, le modèle est fourni avec un upscaling intégré et un outil autonome de super-résolution vidéo. Le pipeline pratique est donc : texte ou image en entrée, clip de cinq secondes en sortie, puis upscale.

La licence mérite une lecture attentive

Voici le point qui mérite attention. Les articles sur cette sortie la décrivent comme MIT, et l'annonce de Kandinsky Lab elle-même indique que le code et les poids sont fournis sous licence MIT. Un traqueur de modèles indépendant, cependant, classe la licence comme personnalisée plutôt que comme permissive standard.

Cette divergence mérite d'être résolue avant que quiconque construise un produit sur ces poids. Une licence véritablement permissive signifie usage commercial, modification et rediffusion sans accord séparé. Une licence personnalisée peut sembler tout aussi ouverte au premier regard et comporter malgré tout des restrictions qui apparaissent plus tard, souvent autour du territoire, de l'échelle ou de la redistribution en aval.

Le schéma cette année a été que les laboratoires chinois publient des poids ouverts avec des noms à consonance permissive et des exceptions enfouies dans les conditions. La licence H3 de MiniMax, par exemple, exclut les États-Unis, l'Union européenne, le Royaume-Uni et la Corée du Sud. Quiconque passe d'une fiche de modèle à un plan de déploiement devrait lire les conditions réelles.

Des poids vidéo sous licence MIT constitueraient une avancée significative s'ils tiennent la promesse décrite. Les licences vidéo permissives sont plus rares que les licences permissives de modèles de langage, en partie parce que les modèles vidéo posent des questions de provenance plus complexes autour des données d'entraînement, et en partie parce que les laboratoires qui les produisent sont plus souvent commerciaux. Un modèle vidéo véritablement ouvert qui gère aussi l'audio offrirait aux petits studios une voie qui ne nécessite pas de contrat d'API.

Pourquoi l'audio synchronisé est le problème le plus difficile

Générer un mouvement plausible à partir d'une invite textuelle est suffisamment résolu pour que le travail intéressant se soit déplacé ailleurs. La partie insatisfaisante de la génération vidéo ouverte a été l'audio.

Considérez ce que la génération muette impose à l'utilisateur. Un personnage parle, mais la mâchoire bouge selon son propre calendrier. Quelqu'un marche, mais les pas doivent être ajoutés en post-production, calés image par image à la main. Une porte se ferme, mais il n'y a pas de son, et insérer un effet de banque de sons tombe rarement sur la bonne image. Ce sont de petits problèmes pris individuellement, et une taxe constante collectivement, parce que chacun exige l'attention d'un monteur.

La modélisation conjointe change la forme de la tâche. Le modèle gère le timing en interne, de sorte que le résultat ressemble davantage à un clip fini. Pour le contenu court, les publicités sociales et l'animation de personnages, c'est la différence entre une démo et un livrable.

Savoir si Pro atteint réellement une synchronisation serrée est une question distincte de celle de savoir si l'architecture le permet, et les évaluations indépendantes qui trancheraient ne sont pas encore disponibles. Cette sortie avance la promesse et fournit des démonstrations ; les considérer comme des preuves serait prématuré.

Où il se situe dans la cohorte de la vidéo ouverte

Des clips courts de cinq secondes placent Kandinsky 6.0 en plein dans le champ actuel de la génération vidéo open source, plutôt qu'en tête de celui-ci. Wan 3.0 d'Alibaba occupe la première place du tableau texte-vers-vidéo reconstruit d'Artificial Analysis avec un Elo de 1157, et les options à poids ouverts qui valent la peine d'être exécutées soi-même, notamment MiniMax H3, sont déjà établies.

Le cadrage juste est donc compétitif plutôt que révolutionnaire. Ce que Kandinsky 6.0 apporte, c'est de l'audio natif sous une licence ouverte et une gamme de tailles couvrant un niveau de qualité sérieux et un niveau léger. Le modèle Lite de 3B, en particulier, ouvre la porte aux équipes qui n'auraient jamais pu justifier d'héberger un modèle de diffusion de 29B.

La structure à deux niveaux donne aussi aux équipes un compromis à arbitrer explicitement. Utilisez Lite pendant l'itération sur les invites et les storyboards, là où un clip de cinq secondes doit exister mais n'a pas besoin d'être beau. Passez à Pro une fois la séquence verrouillée. C'est une forme de flux de travail que les fournisseurs fermés prennent en charge depuis un moment et dont les poids ouverts ont largement manqué.

Ce qu'il faut surveiller

Trois choses vous diraient si cette sortie compte dans six mois.

Premièrement, les termes de la licence. S'ils s'avèrent véritablement permissifs, le modèle devient une option par défaut pour le travail vidéo ouvert commercial. Si les restrictions sont significatives, l'adoption se concentrera dans les territoires où elles ne mordent pas.

Deuxièmement, les benchmarks indépendants. Artificial Analysis reconstruit son tableau image-vers-vidéo sur une nouvelle échelle, et chaque Elo bouge quand il arrive. Tant que Kandinsky 6.0 n'apparaît pas sur un tel tableau, les affirmations de qualité reposent sur les démonstrations du fournisseur. Le classement actuel texte-vers-vidéo place Wan 3.0 en tête avec un Elo de 1157 et un coût de 12 $ par minute, avec 10 victoires sur 20 catégories, ce qui donne une idée de l'encombrement du haut du classement. Kandinsky 6.0 ne concourt pas à ce niveau, et la question honnête est de savoir si c'est nécessaire.

Troisièmement, si l'audio tient bon sous examen. La synchronisation est facile à montrer dans un clip de cinq secondes d'une personne qui parle face caméra, et difficile à montrer dans une scène bondée aux sons qui se chevauchent. Les démos publiées jusqu'ici sont la version facile.

Une considération supplémentaire s'applique à toute équipe qui prévoit de bâtir là-dessus. Les modèles de génération vidéo sont coûteux à exécuter, et un modèle de diffusion de 29B est un déploiement sérieux. Louer de la capacité via fal supprime cette charge, mais supprime aussi le principal avantage des poids ouverts, à savoir les exécuter soi-même. Le niveau Lite de 3B est l'option la plus intéressante pour la plupart des équipes, parce que c'est celui qui peut plausiblement tourner sur du matériel qu'un petit studio possède déjà.

Pour l'instant, le fait intéressant est structurel. Un modèle ouvert qui produit image et son ensemble, sous une licence qui peut être ou non pleinement permissive, avec un support d'inférence arrivant le jour même. L'écart entre la génération vidéo ouverte et fermée s'est réduit cette semaine, et la question de la licence déterminera quelle part de cet écart reste fermée.

Articles associés