← Retour au blog
AiEnviron 8 min de lecture

Le prochain combat de la vidéo IA porte sur la compréhension du monde

Publié le 2 oct. 2026
Le prochain combat de la vidéo IA porte sur la compréhension du monde

Pendant la majeure partie des deux dernières années, juger un modèle de vidéo IA était simple : il suffisait de regarder la beauté des images. Ce critère arrive à bout de souffle. Quand plusieurs modèles produisent tous un clip convaincant de cinq secondes montrant une personne marchant dans une ville, la qualité d'image ne les départage plus. Autre chose doit le faire.

En septembre, une startup chinoise nommée HiDream.ai a publié HiDream-O1-Video-1.0, ou HD-V1, et a fait de cet « autre chose » tout son argumentaire. Selon l'entreprise, le modèle est conçu pour comprendre comment les événements doivent se dérouler, et pas seulement à quoi une image isolée doit ressembler.

Le problème des belles images

Quiconque a passé du temps à générer de la vidéo connaît les modes de défaillance. Vous demandez à un personnage de pousser une lourde porte en bois, et le modèle dessine la main qui pousse vers la gauche tandis que la porte s'ouvre vers la droite. Vous demandez à quelqu'un de courir d'un endroit à un autre en cinq secondes, et le personnage termine son dialogue, n'a plus le temps, et se téléporte. Le clip a l'air correct… jusqu'à ce qu'on le regarde vraiment.

Régénérer sans cesse consume du temps et des crédits, et un clip de quinze secondes peut coûter bien plus que le budget prévu. Le problème n'est ni la résolution ni la durée. C'est la physique, la cause et l'effet. Le modèle peint chaque image sans comprendre qu'une porte doit s'ouvrir dans la direction où la main pousse, ou que se déplacer entre deux points prend du temps.

C'est ce fossé que HD-V1 vise. HiDream affirme que le modèle renforce sa compréhension de la durée des actions, des relations entre objets, de la logique événementielle et de la synchronisation audio-visuelle avant de générer, de sorte que le résultat tient debout comme une séquence plutôt que comme un empilement d'images fixes.

Une bande de storyboard holographique montrant une silhouette qui pousse une porte dans la bonne direction

Quatre modèles chinois, trois approches

Pour comprendre pourquoi cela compte, il est utile de regarder qui d'autre occupe le sommet des classements. En septembre 2026, quatre modèles chinois s'étaient hissés dans le premier rang de la génération vidéo mondiale : Seedance 2.0 et 2.5 de ByteDance, H3 de MiniMax, Wan 3.0 d'Alibaba et HD-V1 de HiDream. Un an plus tôt, les modèles vidéo chinois étaient à peine présents sur les grands benchmarks internationaux. Aujourd'hui, ils se regroupent près du sommet.

Ils y sont arrivés par des chemins différents. Seedance s'appuie sur la pile complète de ByteDance en matière de calcul, d'ingénierie et de produit. MiniMax H3 part d'une vaste base de modèles et d'une large base d'utilisateurs, puis s'étend à la vidéo. Wan 3.0 est intégré à l'écosystème plus large d'Alibaba, avec Qwen et Alibaba Cloud. HiDream fait figure d'exception : une startup sans les ressources ni la distribution d'un géant, qui mise au contraire sur une architecture qu'elle appelle un modèle du monde omni-modal natif, conçue pour faire partager un même socle aux images, à la vidéo, à l'interaction 3D et à l'intelligence incarnée.

HD-V1 prend en charge des entrées texte, image et vidéo et génère de 5 à 20 secondes de vidéo en 1080p. L'équipe affirme qu'il a obtenu de bons résultats sur deux classements internationaux, et l'argument qui ressort est celui de la compréhension du monde : l'idée que le modèle génère des séquences plus cohérentes parce qu'il modélise la façon dont les événements progressent.

Pourquoi la « compréhension » est la nouvelle frontière

Quand plusieurs équipes atteignent le même niveau de qualité, la compétition se déplace vers ce que le modèle sait du monde. La résolution et la durée deviennent des caractéristiques de base plutôt que des facteurs de différenciation. Les questions les plus difficiles sont celles auxquelles la qualité d'image ne peut pas répondre : un objet en mouvement respecte-t-il les lois de la physique, l'action et le son restent-ils synchronisés, un événement découle-t-il du précédent ?

L'industrie donne d'autres noms à la même idée. Les produits concurrents et le marché au sens large parlent de cohérence, de compréhension de l'intention et de livraison stable. Une entreprise chinoise de vidéo, ZhiXiang Future, a même publié un cadre d'évaluation en cinq volets pour les agents vidéo, couvrant la cohérence, l'intention, la complétude audio-visuelle, la chronologie et la narration, et la livraison stable. Les noms diffèrent, l'objectif est le même : des modèles auxquels on peut faire confiance pour terminer une séquence, pas seulement pour en commencer une.

Il y a de l'argent derrière tout cela. Goldman Sachs estimait que le marché mondial de la génération vidéo par IA sera multiplié par dix environ en cinq ans, pour atteindre près de 29 milliards de dollars d'ici 2030. Ce genre de prévision attire les investissements vers ce qui ressemble au prochain vrai saut de capacités, et « comprendre le monde » est le candidat actuel.

Les classements ne sont pas d'accord entre eux

Une partie de ce qui rend le domaine vidéo difficile à juger, c'est que les tableaux de scores ne concordent pas. En septembre, l'arène communautaire a couronné une famille, les évaluateurs humains notant des clips isolés en ont préféré une autre, et les rédacteurs de prompts votant par leur usage en ont choisi une troisième. Un instantané Elo de la communauté plaçait la gamme Gemini Omni de Google en tête, Flux 3 Video de Black Forest Labs comme la meilleure entrée proche de l'open source, et Seedance 2.0 et 2.5 de ByteDance juste derrière. Les évaluateurs humains notant les clips sur une échelle de qualité de un à cinq plaçaient en revanche Seedance 2.0 en premier, devant Kling, Wan et même son propre successeur. En termes d'usage brut, Seedance et Veo 3 de Google dominent le volume de prompts, tandis que Wan règne sur le créneau local et open source.

La leçon de ces trois jeux de données, c'est que le « meilleur modèle » dépend entièrement de ce que l'on mesure. Veo se classe moins bien dans les notations humaines sur clips muets que dans les arènes, parce que sa force réside dans l'audio natif et le dialogue, ce qu'une grille de notation muette ne peut pas percevoir. Que Seedance 2.5 obtienne un score inférieur à 2.0 en qualité par clip rappelle que les versions plus récentes ne sont pas toujours plus impressionnantes sur les prompts que les gens écrivent réellement. Quiconque choisit un outil pour un projet devrait consulter plus d'un classement avant de décider, et accorder plus de poids à celui qui correspond à son propre travail.

Ce que ce basculement signifie pour les créateurs

Pour quiconque fabrique réellement des choses avec ces outils, l'effet pratique est un déplacement de ce qui casse. Quand un modèle comprend la logique événementielle, la défaillance passe de l'évident au subtil. Vous cessez de vous battre contre des personnages qui se téléportent et des portes qui s'ouvrent dans le mauvais sens, et vous commencez à remarquer des problèmes plus petits : une action qui dure un temps de trop, une réaction qui ne découle pas de la réplique précédente. Ce sont les problèmes qu'un réalisateur humain est censé repérer.

C'est la même leçon que le boom des mini-séries en Chine a déjà enseignée. L'IA peut désormais générer les plans, mais un épisode fini a encore besoin de quelqu'un pour décider quels plans garder, dans quel ordre, et pourquoi. Les modèles s'améliorent sur l'image. Le jugement sur les images qui comptent reste un travail humain, et il pourrait le rester plus longtemps que ne l'attendent les optimistes.

Cette course à quatre compte aussi pour une raison plus discrète. Des entreprises différentes attaquant le même problème par des directions différentes, la pile d'un géant ici, l'architecture d'une startup là, réduit la dépendance de l'industrie à une seule voie technique. Si la compréhension du monde s'avère être la bonne cible, plus d'une équipe est désormais pointée vers elle. Et si elle s'avère être la mauvaise, le domaine s'est couvert.

Pour l'instant, la lecture honnête est que HD-V1 est une entrée forte de plus dans un domaine encombré, avec des affirmations que des tiers n'ont pas encore testées. Ce qui n'est pas en doute, c'est la direction. Les modèles qui gagneront la prochaine manche ne seront pas ceux qui dessinent la plus belle image isolée. Ce seront ceux capables de tenir une histoire pendant vingt secondes sans que quelque chose casse. Comprendre le monde est le problème le plus difficile, et pour la première fois, beaucoup d'équipes bien financées y travaillent en même temps.

Articles associés