← Retour au blog
AiEnviron 8 min de lecture

Wan 3.0 vient de prendre la tête du classement vidéo. L'histoire des poids ouverts est désormais une histoire de vidéo.

Publié le 1 oct. 2026
Wan 3.0 vient de prendre la tête du classement vidéo. L'histoire des poids ouverts est désormais une histoire de vidéo.

Pendant la majeure partie de l'essor de l'IA générative, la conversation sur les poids ouverts appartenait aux images. Stable Diffusion a prouvé qu'on pouvait faire tourner un vrai modèle sur son propre GPU, et tout un écosystème de LoRA et de ControlNet s'est développé autour. La vidéo, c'était différent. Les meilleurs modèles vidéo restaient enfermés derrière des API, et « vidéo open source » désignait de petits modèles à la traîne des leaders fermés.

Cela a changé ce mois-ci. Wan 3.0, le modèle vidéo d'Alibaba, a pris la première place du benchmark nouvelle génération AA-Video-T2V v2.0 d'Artificial Analysis, construit à partir de plus de 68 000 votes de préférence humaine sur environ un millier de prompts. Wan 3.0 a obtenu un Elo de 1157 et décroché la première place dans 10 des 20 classements par catégorie. Le même classement plaçait aussi Wan 3.0 en tête pour le montage vidéo, devant Seedance de ByteDance et H3 de MiniMax.

L'importance tient moins à un chiffre qu'à ce qu'il représente. Un modèle chinois à poids ouverts est désormais compétitif avec Google Veo 3.1 et le reste du peloton fermé, et même devant dans plusieurs classements. La tarification raconte la même histoire. Wan 3.0 coûte entre 0,05 et 0,20 dollar par seconde selon la résolution, contre 0,40 dollar pour Veo 3.1 en offre standard. Alibaba a levé 10 milliards de dollars lors d'un placement d'actions à Hong Kong pour financer précisément cette offensive, et la stratégie est lisible : vendre bon marché, gagner des parts de marché, faire du client entreprise le moteur de croissance.

Techniquement, Wan 3.0 est conçu pour la cohérence et les entrées structurées. Il génère des clips allant jusqu'à 30 secondes en une seule passe, doublant la limite de 15 secondes de son prédécesseur, jusqu'à 1080p avec micro-expressions synchronisées et voix multilingue. Plus intéressant, il accepte des documents, PDF, PowerPoint et tableurs en entrée, transformant un diaporama ou un rapport en vidéo. Cet angle document-vers-vidéo vise directement les flux de travail d'entreprise, pas seulement les créateurs individuels.

La fonctionnalité document-vers-vidéo mérite plus d'attention qu'elle n'en reçoit. La plupart des modèles vidéo veulent un prompt texte ou une image. Wan 3.0 veut vos actifs existants, la présentation que vous avez déjà faite, le rapport que vous avez déjà écrit, et il les traite comme la source de vérité. Pour une entreprise qui vit dans les documents, cela réduit presque à néant la friction entre « nous avons un rapport » et « nous avons une vidéo ». C'est le premier modèle à faire du pipeline documentaire d'entreprise la porte d'entrée, et c'est un choix discrètement intelligent.

Pour une équipe qui choisit une stack vidéo, cela rebat les cartes. L'ancienne hypothèse, selon laquelle les modèles ouverts sont ce vers quoi on se tourne quand on ne peut pas se permettre ou utiliser les modèles fermés, s'affaiblit. Vous pouvez désormais auto-héberger un modèle qui domine le classement, ce qui compte pour les cas qui n'ont rien à voir avec la qualité et tout à voir avec le contrôle. Un client dont les données ne peuvent pas quitter son infrastructure n'a aucune option conforme autre qu'un modèle auto-hébergé, et pour la première fois cette option ne sacrifie pas la qualité de sortie.

Il y a une mise en garde que l'enthousiasme fait sauter. L'auto-hébergement n'est pas gratuit simplement parce que les poids le sont. Vous payez en GPU, en travail d'intégration, en maintenance continue pour garder un pipeline sain quel que soit le volume réellement atteint. Le modèle est gratuit ; l'ingénierie ne l'est pas. Pour la plupart des petites équipes, un endpoint hébergé reste gagnant en coût total tant que le volume ne justifie pas le matériel.

Le contexte du benchmark compte pour lire correctement cette victoire. Le benchmark AA-Video-T2V v2.0 est la nouvelle génération d'évaluation par préférence humaine, et il juge chaque modèle en 1080p, ce qui élimine l'ancienne astuce de gagner en basse résolution. Wan 3.0 s'est classé premier dans dix des vingt catégories et a décroché le meilleur Elo global à 1157. Ce n'est pas une victoire de niche ni une catégorie favorable ; c'est un résultat large et compétitif face à tout le peloton, y compris les modèles qui coûtent huit fois plus par seconde. Quand un modèle ouvert qui coûte 0,05 dollar la seconde bat un modèle fermé qui coûte 0,40 dollar, la proposition de valeur est difficile à contester.

Il y a aussi une dimension politique difficile à ignorer. La course à la vidéo IA est devenue un proxy d'une compétition plus large entre laboratoires chinois et américains, et la couronne de Wan 3.0 sur ce benchmark est le genre de résultat cité dans les deux pays pour des raisons différentes. En Chine, c'est la preuve que la stack nationale peut rivaliser sur la qualité, pas seulement sur le prix. Aux États-Unis, c'est la preuve que le coût du calcul n'est pas la seule chose qui évolue. Aucun des deux cadrages ne saisit pleinement ce qui se passe, à savoir une véritable convergence concurrentielle qui bénéficie aux utilisateurs sous forme de prix plus bas et de modèles ouverts plus performants.

Le passage des poids ouverts à la vidéo a aussi des implications pour la géopolitique plus large de l'IA. Les laboratoires chinois gagnent la guerre des prix depuis un moment, et ils gagnent désormais aussi sur les benchmarks, ce qui fait passer le récit de « l'imitation bon marché » à « véritablement compétitif ». La même dynamique s'est déjà jouée en génération d'images avec Qwen-Image et Z-Image, et en modèles de langage avec DeepSeek et Qwen. La vidéo était le dernier grand bastion des laboratoires occidentaux fermés, et Wan 3.0 vient de montrer que la porte est ouverte.

La couronne sur le benchmark fait les gros titres, mais la vraie histoire est que la génération vidéo dispose désormais d'une voie ouverte crédible. Les mêmes dynamiques qui ont suivi Stable Diffusion devraient se reproduire ici : fine-tunes, nœuds de contrôle communautaires, déploiements régionaux et une longue traîne de cas d'usage que les fournisseurs d'API n'ont jamais pris la peine de servir. Les modèles ouverts fine-tunés sont déjà la méthode standard pour conserver un personnage ou un style précis en travail d'image, et les créateurs vidéo voudront la même capacité d'entraîner sur leur propre marque ou produit.

Il y a déjà des signes précoces de la formation de cet écosystème. L'écosystème MiniMax H3 a produit un générateur de prompts open source et une vague de fine-tunes communautaires orientés anime et personnages, reproduisant le manuel de Stable Diffusion. Quand les poids ouverts sont assez bons pour dominer un benchmark, la communauté qui se forme autour d'eux n'est plus une niche ; c'est le courant dominant, et les innovations qui en sortent — nœuds de contrôle, hébergement régional, inférence locale préservant la vie privée — ont tendance à arriver plus vite qu'aucun fournisseur ne peut les livrer.

L'implication pratique pour une équipe est concrète et mérite d'être répétée. Si vous choisissez une stack vidéo fin 2026, la question n'est plus « ouvert ou fermé » sur le plan de la qualité. C'est une question de contrôle, de coût et de risque de sortie. Les poids ouverts vous donnent le premier et réduisent le troisième, au prix du deuxième. Les API fermées vous offrent la commodité au prix des trois. Les équipes qui traverseront la prochaine dépréciation de modèle sans douleur sont celles qui ont déjà décidé où elles se situent sur ce compromis, au lieu de le découvrir à leurs dépens quand leur fournisseur annonce un arrêt.

Pour quiconque construit sur la vidéo générative, la leçon pratique est d'arrêter de traiter les poids ouverts comme une solution de repli. Traitez-les comme une option stratégique. La prochaine fois qu'un fournisseur fermé dépréciera un modèle comme OpenAI vient de le faire avec Sora, les équipes qui ne seront pas en panique seront celles qui ont gardé au moins un pied sur la voie ouverte. Les poids ouverts étaient autrefois le lot de consolation. En vidéo, ils viennent de devenir la vitrine des trophées.

Articles associés