Vidu Q3 a scindé la génération vidéo par référence en trois produits. C'est autant une décision de packaging qu'une décision de modèle.

La plupart des sorties de modèles vidéo sont annoncées une fois, puis apparaissent partout sous un seul nom. Vidu a fait l'inverse avec sa gamme Q3 de génération vidéo par référence.
Le 14 septembre, Model Studio d'Alibaba Cloud a référencé trois modèles Vidu Q3 distincts de génération vidéo par référence. Le premier, viduq3-mix, est un modèle polyvalent qui prend des images de référence et un prompt textuel et intègre les sujets de ces images à la scène décrite. Le deuxième, viduq3-ad, est conçu pour la publicité, avec des découpes de scènes de qualité marketing, des mouvements de caméra et une sortie audio directe ; vous téléversez des images de produit et obtenez une vidéo publicitaire. Le troisième, viduq3-drama, cible la production de dramas et de mangas IA, avec une cohérence des personnages, des effets de mouvement et une expression émotionnelle adaptés aux contenus narratifs.
Les trois fonctionnent à 0,14 $ par seconde en 720p ou 1080p, avec une limite de débit de 5 requêtes par seconde. La tarification est identique pour les trois, ce qui indique que la différenciation ne se situe pas dans le coût, mais dans le comportement de sortie.
Le problème que Vidu cherchait réellement à résoudre
Vidu est développé par Shengshu Technology, à Pékin. Son modèle Q3 a été lancé le 30 janvier 2026 et a immédiatement fait son entrée dans le circuit des benchmarks. Artificial Analysis l'a classé premier en Chine et deuxième au niveau mondial lors de son lancement, devant Runway Gen-4.5, Google Veo 3.1 et Sora 2 d'OpenAI, avec un score de 1241.
Les trois évolutions techniques derrière ce classement méritent d'être nommées. Q3 a été l'un des premiers modèles vidéo long format à produire des dialogues synchronisés, des effets sonores et de la musique de fond dans la même passe que les visuels, plutôt que d'ajouter l'audio en post-production. Il a porté les clips générés en une seule fois à 16 secondes, soit la durée la plus longue parmi les grands modèles à l'époque. Et il a mis en place un système de génération vidéo par référence où les utilisateurs téléversent trois à sept images d'un personnage, d'un objet ou d'un style, et le modèle les utilise comme ancrages visuels dans les générations suivantes.
Le système de référence est le plus intéressant. La plupart des modèles vidéo en 2026 rivalisent sur le même axe : rendre un seul clip impressionnant. Le pari de Vidu était différent. Son argument n'a jamais été « regardez cette magnifique prise ». Il était : « regardez ce même personnage sur dix plans et remarquez qu'il ressemble toujours à la même personne. »
C'est un problème plus difficile, et c'est celui dont dépend réellement le contenu en série. Dans une comparaison avec Runway Gen-4, Kling 3.0, Luma Ray, Pika 2.0 et Sora 2, utilisant le même prompt de personnage sur six variations de scène, Vidu Q3 a maintenu la cohérence du visage et de la tenue dans cinq des six tests.
La cohérence est ce qui sépare un outil pour clips ponctuels d'un outil pour séries. Pour les créateurs d'anime, les producteurs de dramas courts et tous ceux qui construisent du contenu de marque autour d'un personnage récurrent, elle change ce qui est possible.
Pourquoi trois SKU comptent
Scinder une même famille de modèles en trois produits nommés ressemble à un choix marketing. C'est plutôt une décision d'approvisionnement.

Une équipe publicitaire et un studio de dramas courts n'achètent pas la même chose, même si le transformer sous-jacent est similaire. L'acheteur de publicité a besoin de fidélité produit, de transitions de scène propres et d'un audio qui peut se placer sous une voix de marque. L'acheteur de dramas a besoin qu'un personnage conserve son identité d'un épisode et d'un plan à l'autre, avec des expressions qui se lisent comme du jeu. Conditionner ces cas en identifiants de modèles distincts avec une documentation distincte permet à chaque acheteur d'évaluer et de budgéter exactement une tâche, plutôt que de lire une liste de fonctionnalités polyvalentes et de deviner.
Le modèle mix polyvalent sert alors tous ceux qui sortent de ces deux cases, une structure raisonnable pour un marché où l'acheteur est de plus en plus une équipe de production avec une échéance, plutôt qu'un amateur qui teste des prompts.
Vidu Claw et la couche de pipeline
Le conditionnement des modèles représente la moitié de la stratégie. L'autre moitié est une couche d'assemblage. Vidu Claw est un moteur d'automatisation de création IA construit sur le framework open source OpenClaw et propulsé par Q3. Vous connectez vos jetons Vidu, définissez des Skills et automatisez le chemin de l'idée à la vidéo finie. Un seul prompt comme « créer une publicité courte pour une chaussure de running ciblant les jeunes femmes sur Instagram » suffit à Vidu Claw pour générer un concept, un script, un storyboard, des visuels, une voix off, une musique et un montage final.
Les avis indépendants sont mitigés d'une manière utile. Un critique qui l'a testé sur une publicité produit a trouvé la plateforme réellement gratuite et accessible pour les étudiants et les débutants, mais a rapporté qu'elle avait du mal avec les détails structurels précis. Dans un cas, elle continuait à rendre un détail d'une manière qui ressortait, même après plusieurs corrections de prompt, et le résultat avait une empreinte IA perceptible, avec un éclairage et des couleurs qui semblaient bas de gamme.
C'est le compromis honnête. Vidu Claw est un outil de productivité pour les créateurs solo et les petites équipes marketing qui doivent passer rapidement du concept à une ébauche utilisable, plutôt qu'un remplacement pour une équipe de production professionnelle. Quand ça marche, il compresse un cycle de production publicitaire de cinq jours en une journée. Quand ça ne marche pas, les problèmes de qualité sont difficiles à ignorer.
L'écosystème que Vidu construit autour
L'accent mis sur la génération vidéo par référence s'inscrit dans une histoire de distribution. En février 2026, l'éditeur de logiciels Wondershare a annoncé un investissement stratégique dans Shengshu, les deux prévoyant de travailler sur le manga IA. Le modèle Vidu Q3 a été intégré à une plateforme de production de mangas IA de bout en bout, utilisée pour maintenir la cohérence des personnages, des voix et des scènes d'un épisode à l'autre. La plateforme Bailian d'Alibaba Cloud a également ajouté Vidu Q3 comme modèle tiers en mai 2026.
Le modèle circule donc par au moins trois canaux : l'accès direct via le web et l'API, une plateforme de création destinée au manga et aux dramas courts, et une place de marché de modèles cloud. Chaque canal a un acheteur différent avec une définition différente de « suffisamment bon ».
Où se trouve réellement l'argent
Le passage au contenu en série n'est pas une préférence créative. C'est là que sont les budgets. Un drama court est un produit multi-épisodes avec une distribution récurrente, et son économie dépend de la production de bien plus de séquences qu'une publicité unique ou un clip ponctuel. Si un modèle force le créateur à repartir de zéro sur l'apparence du personnage pour chaque plan, les économies réalisées sur les images générées sont absorbées par les corrections de cohérence. Le pari de Vidu est que l'équipe prête à payer 0,14 $ par seconde n'achète pas un seul beau plan, mais un moyen de garder la même personne reconnaissable sur toute une série.
C'est aussi pourquoi le système de référence compte plus que le score de qualité brut. Un modèle classé deuxième au niveau mondial sur un benchmark est impressionnant, mais le benchmark mesure des clips. La fonction de référence mesure des séries. Les deux ne correspondent pas au même achat, et Vidu vend pour le second cas.
Là où il ne délivre pas encore
La cohérence de référence n'est pas parfaite, et cinq sur six n'est pas six sur six. Là où le sixième cas a échoué, l'outil a produit un visage et une tenue qui s'écartaient de la source, exactement le type d'échec qui casse une série. Le coût est bien réel à 0,14 $ par seconde, ce qui s'accumule vite sur un clip de 16 secondes et devient significatif à l'échelle d'une série, où des centaines de plans sont en jeu. La couche de pipeline produit des ébauches plutôt que des publicités finies, et les critiques ont constaté qu'elle ne peut pas corriger de manière fiable un détail structurel, même après plusieurs corrections de prompt.
Il y a aussi une limite structurelle qu'il vaut la peine de nommer. La génération vidéo par référence ancre l'identité, mais elle ne résout pas encore la continuité pour toute une production. Quelqu'un doit encore faire les choix de réalisation qui transforment un ensemble de clips cohérents en histoire, et le modèle n'a aucune opinion sur le rythme, la couverture ou l'opportunité même qu'une scène existe.
Ce qu'il faut surveiller
La structure à trois SKU est la partie que les autres fournisseurs vont probablement copier. Si la génération vidéo par référence devient la façon par défaut de produire du contenu en série, attendez-vous à ce que davantage de familles de modèles proposent des variantes spécifiques à chaque tâche plutôt qu'un seul modèle phare. Les questions qui comptent ensuite sont de savoir si la cohérence tient sur des durées plus longues et des mouvements de caméra plus difficiles, et si la couche de pipeline devient assez bonne pour être vendue à un studio plutôt qu'à un créateur solo.
Articles associés
Les outils vidéo IA obtiennent 9 sur 10 pour leur facilité d’utilisation. Le score de conformité, c’est une autre histoire.
Les utilisateurs adorent les générateurs vidéo IA. Les services juridiques, eux, n’ont pas encore été consultés.
InternLumina-U2 réunit texte, images, vidéo et 3D dans un seul modèle 16B, puis livre deux jeux de poids
La liste des tâches est ambitieuse. Le format de publication porte davantage de signal.
HappyOyster vend un monde dans lequel on entre, pas un clip que l'on regarde
La plupart des modèles vidéo vous remettent un fichier. Celui-ci vous remet une pièce avec une porte.
Luma Ray3 Modify préserve la performance et renégocie le monde qui l'entoure
Le problème le plus difficile dans le montage vidéo IA n'est pas l'effet. C'est de ne pas saccager la prise que vous avez déjà payée.