← Retour au blog
AiEnviron 8 min de lecture

SparkDiffusion réduit la génération vidéo 720p de 79 minutes à 18 secondes

Publié le 2 oct. 2026
SparkDiffusion réduit la génération vidéo 720p de 79 minutes à 18 secondes
Une vidéo 720p qui prenait environ 4 769 secondes à générer ne prend plus qu'environ 18 secondes sur une seule RTX 5090. L'équipe à l'origine du résultat, des chercheurs de l'Université de Pékin, de Tsinghua et d'Alibaba, a publié le code en open source sous le nom de SparkDiffusion, et l'accélération d'environ 265 fois est le genre de chiffre qui change ce qu'un pipeline peut faire, plutôt que simplement sa vitesse d'exécution. Cette affirmation mérite d'être vérifiée au regard de la manière dont elle a été obtenue, car une accélération aussi importante cache généralement un bémol. SparkDiffusion combine trois techniques qui ont chacune mûri séparément : l'attention parcimonieuse, la distillation en quelques étapes et la quantification FP8. L'attention parcimonieuse évite de calculer la matrice d'attention complète sur laquelle les modèles vidéo de diffusion passent normalement la plupart de leur temps. La distillation en quelques étapes entraîne le modèle à atteindre un bon échantillon en bien moins d'étapes de débruitage que la douzaine habituelle. FP8 réduit la précision numérique du calcul. En les combinant, l'arithmétique par vidéo s'effondre.
Très gros plan sur une plaquette de silicium avec des traînées de lumière bleue et blanche qui la traversent à toute vitesse, suggérant une très grande accélération

Pourquoi le bémol compte encore

L'attention parcimonieuse et la distillation en quelques étapes échangent toutes deux un peu de qualité contre beaucoup de vitesse, et la question honnête pour quiconque déploie cela est de savoir où se situe la qualité. Un chiffre de 265x sur une seule carte grand public est impressionnant, et les mêmes méthodes qui le produisent peuvent adoucir les détails fins ou réduire la cohérence du mouvement. L'article rapporte l'accélération ; savoir si la sortie résiste à un examen professionnel est le test qu'un studio ferait avant de lui faire confiance. Même avec ce bémol, la direction est significative. La génération vidéo a été tarifée comme une charge de travail de centre de données. Un clip 720p qui nécessite un cluster pour être rendu dans un délai raisonnable force chaque équipe à passer par une API, ce qui met le modèle de coût entre les mains de quelqu'un d'autre. Ramenez le temps de rendu à quelques secondes sur un seul GPU et l'économie change. L'itération devient bon marché, et une itération bon marché est ce qui transforme un générateur en un outil avec lequel on peut réellement explorer.

La même histoire sous un autre angle

SparkDiffusion n'est pas seul à s'attaquer au coût de la vidéo. Le projet Sana de NVIDIA a publié SoL-Refiner, un modèle de raffinement vidéo en une étape qui prend la sortie basse résolution de n'importe quel générateur et la transforme en vidéo nette 2K ou 4K, avec un gain de vitesse de 8,91 fois de bout en bout. La conception est complémentaire de ce que fait SparkDiffusion. SparkDiffusion accélère la génération ; SoL-Refiner accélère la finition. Ensemble, ils indiquent un pipeline en deux étapes où le modèle coûteux en fait moins et un raffineur bon marché nettoie le résultat. Pendant ce temps, la frontière de la qualité continue de reculer. Artificial Analysis a lancé son benchmark AA-Video-T2V v2.0, construit à partir de plus de 68 000 votes de préférence humaine sur environ 1 000 prompts, jugeant chaque modèle en 1080p. Wan 3.0 domine le classement avec un Elo de 1157 à 12 $ la minute, prenant la première place dans 10 des 20 catégories. Ce chiffre de 12 $ constitue l'autre moitié de l'histoire. Un modèle peut être le meilleur au monde et rester inutilisable à grande échelle si chaque minute coûte une fraction significative du tarif d'un freelance.

Ce que signifie générer une vidéo en 18 secondes

La différence entre 79 minutes et 18 secondes n'est pas une meilleure version du même flux de travail. C'est un flux de travail différent. À 79 minutes, un créateur planifie soigneusement, s'engage sur un prompt et attend. L'itération est suffisamment coûteuse pour qu'on la fasse avec parcimonie. À 18 secondes, on essaie des choses. On génère dix variantes, on les regarde côte à côte et on en garde deux. L'outil passe de quelque chose que l'on instruit à quelque chose avec lequel on converse, et ce changement d'interaction est généralement ce qui libère la qualité, pas le modèle de base. La même chose s'est produite dans la génération d'images. Quand une bonne image prenait des minutes, les gens écrivaient des prompts soignés et traitaient chaque génération comme une décision. Quand cela est tombé à quelques secondes, ils ont commencé à écrire des prompts à la va-vite, à générer largement et à sélectionner. Le plafond de qualité n'a pas beaucoup augmenté, mais le plancher de la sortie utilisable si, parce que la sélection absorbe beaucoup de variance. Si SparkDiffusion fait pour la vidéo ce que les échantillonneurs rapides ont fait pour les images, l'effet se manifestera d'abord dans la fréquence à laquelle une équipe génère, pas dans le fait qu'un clip donné soit radicalement meilleur. Il y a une réserve matérielle, et elle n'est pas mince. Le chiffre de 18 secondes est obtenu sur une RTX 5090, une carte grand public haut de gamme. Exécuter le même pipeline sur le GPU de milieu de gamme que la plupart des studios possèdent réellement sera plus lent, et l'accélération par rapport à la ligne de base peut sembler moins spectaculaire. Mais c'est la direction qui compte pour la planification, car le prix du matériel sous-jacent baisse en même temps que l'efficacité du logiciel augmente. Les deux forces poussent dans la même direction.

La vraie compétition est l'économie à la seconde

Si l'on réunit les deux moitiés, la course à la génération vidéo ressemble moins à un concours de qualité pure qu'à une compétition de coûts. D'un côté, les modèles ne cessent de s'améliorer et de devenir plus chers à la seconde. De l'autre, une communauté de recherche ne cesse de trouver des moyens d'exécuter le même travail sur un silicium moins cher en moins de temps. Le vainqueur dans la plupart des projets réels est celui des deux camps qui avance le plus vite par rapport à l'autre. Il y a ici un schéma qui fait écho au monde de la génération d'images. Un modèle de pointe arrive, obtient un score élevé et est facturé au prix fort. Puis un projet à poids ouverts montre que la même tâche est essentiellement une question d'ingénierie, et le prix s'effondre. La vidéo a mis plus de temps à suivre cette courbe parce que les besoins en calcul sont plus élevés, mais SparkDiffusion et SoL-Refiner sont les premiers signes crédibles que cela commence. La conséquence pratique pour une équipe de contenu est que la décision de construire ou d'acheter en matière de génération vidéo n'est plus évidente. Il y a six mois, payer une API était la seule voie abordable. Si un seul GPU peut rendre une vidéo 720p utilisable en quelques secondes, alors pour les équipes avec un volume régulier, posséder le pipeline commence à avoir du sens, du moins pour les passes grossières qui ne sont envoyées à un service payant que lorsqu'elles doivent être finalisées.

Ce qu'il faut surveiller

Trois choses décideront de l'importance de tout cela. Premièrement, si la qualité de la sortie accélérée tient la route lors de tests indépendants plutôt que dans les propres échantillons d'un article. Deuxièmement, si le code open source s'exécute aussi proprement sur les cartes grand public que la plupart des équipes possèdent réellement que sur la RTX 5090 des résultats. Troisièmement, si les laboratoires de pointe répondent en pratiquant des prix plus agressifs, car s'ils le font, l'incitation à exécuter en local se réduit à nouveau. Pour l'instant, le changement significatif est conceptuel. La génération vidéo est reclassée de service à logiciel que l'on peut exécuter soi-même. Cette reclassification est la même que celle qui a transformé les modèles d'images d'un appel API en un flux de travail ComfyUI local, et elle a tendance à se terminer de la même manière : avec la frontière au sommet et une large couche bon marché et suffisamment bonne en dessous qui fait la plupart du travail.

Articles associés