← Zurück zum Blog
Aica. 6 Min. Lesezeit

SparkDiffusion verkürzt die 720p-Videogenerierung von 79 Minuten auf 18 Sekunden

Veröffentlicht 2. Okt. 2026
SparkDiffusion verkürzt die 720p-Videogenerierung von 79 Minuten auf 18 Sekunden

Ein 720p-Video, dessen Generierung früher ungefähr 4.769 Sekunden dauerte, braucht jetzt auf einer einzelnen RTX 5090 etwa 18 Sekunden. Das Team hinter dem Ergebnis – Forscher der Peking-Universität, von Tsinghua und Alibaba – hat den Code als SparkDiffusion als Open Source veröffentlicht, und die ungefähr 265-fache Beschleunigung ist die Art von Zahl, die verändert, was eine Pipeline leisten kann, nicht nur wie schnell sie fertig wird.

Die Behauptung sollte man gegen die Art und Weise prüfen, wie sie erreicht wurde, denn eine so große Beschleunigung verbirgt meist ein Sternchen. SparkDiffusion kombiniert drei Techniken, die sich jeweils separat weiterentwickelt haben: Sparse Attention, Few-Step-Distillation und FP8-Quantisierung. Sparse Attention vermeidet die Berechnung der vollständigen Attention-Matrix, für die Diffusions-Videomodelle normalerweise den größten Teil ihrer Zeit aufwenden. Few-Step-Distillation trainiert das Modell darauf, in weit weniger Denoising-Schritten als den üblichen Dutzenden eine gute Probe zu erreichen. FP8 senkt die numerische Präzision der Berechnung. Stapelt man sie, kollabiert die Arithmetik pro Video.

Extreme Nahaufnahme eines Siliziumwafers mit Spuren aus blauem und weißem Licht, die darüber rasen, was auf eine sehr große Beschleunigung hindeutet

Warum das Sternchen trotzdem wichtig ist

Sparse Attention und Few-Step-Distillation tauschen beide ein wenig Qualität gegen viel Geschwindigkeit, und die ehrliche Frage für alle, die dies einsetzen, ist, wo die Qualität landet. Eine 265-fache Zahl auf einer einzelnen Karte der Consumer-Klasse ist beeindruckend, und dieselben Methoden, die sie hervorbringen, können feine Details aufweichen oder die Bewegungskohärenz verringern. Das Paper berichtet die Beschleunigung; ob die Ausgabe einer professionellen Prüfung standhält, ist der Test, den ein Studio durchführen würde, bevor es ihr vertraut.

Selbst mit diesem Vorbehalt ist die Richtung bedeutsam. Videogenerierung wurde als Data-Center-Workload bepreist. Ein 720p-Clip, der einen Cluster braucht, um in angemessener Zeit gerendert zu werden, zwingt jedes Team in eine API, was das Kostenmodell in die Hände von jemand anderem legt. Bringt man die Renderzeit auf einer GPU auf Sekunden herunter, ändert sich die Ökonomie. Iteration wird billig, und billige Iteration ist das, was einen Generator in ein Werkzeug verwandelt, mit dem man tatsächlich explorieren kann.

Dieselbe Geschichte aus einem anderen Blickwinkel

SparkDiffusion ist nicht allein dabei, die Kosten von Video anzugehen. NVIDIAs Sana-Projekt hat SoL-Refiner veröffentlicht, ein Ein-Schritt-Video-Verfeinerungsmodell, das niedrig aufgelöste Ausgaben eines beliebigen Generators nimmt und in scharfes 2K- oder 4K-Video verwandelt, mit Berichten von 8,91-mal schnellerer Ende-zu-Ende-Leistung. Das Design ergänzt das, was SparkDiffusion tut. SparkDiffusion beschleunigt die Generierung; SoL-Refiner beschleunigt den Feinschliff. Zusammen weisen sie auf eine zweistufige Pipeline hin, in der das teure Modell weniger tut und ein günstiger Verfeinerer bereinigt.

Unterdessen bewegt sich die Qualitätsgrenze weiter. Artificial Analysis hat seinen AA-Video-T2V-v2.0-Benchmark gestartet, der aus mehr als 68.000 menschlichen Präferenzstimmen zu etwa 1.000 Prompts erstellt wurde und jedes Modell mit 1080p bewertet. Wan 3.0 führt die Bestenliste mit einem Elo von 1157 bei 12 US-Dollar pro Minute an und belegt in 10 von 20 Kategorierankings den ersten Platz. Diese 12-Dollar-Zahl ist die andere Hälfte der Geschichte. Ein Modell kann das beste der Welt sein und trotzdem im großen Maßstab unbrauchbar sein, wenn jede Minute einen erheblichen Bruchteil des Stundensatzes eines Freelancers kostet.

Was es bedeutet, Video in 18 Sekunden zu generieren

Der Unterschied zwischen 79 Minuten und 18 Sekunden ist keine bessere Version desselben Workflows. Es ist ein anderer Workflow. Bei 79 Minuten plant ein Creator sorgfältig, legt sich auf einen Prompt fest und wartet. Iteration ist teuer genug, dass man sie sparsam einsetzt. Bei 18 Sekunden probiert man Dinge aus. Man generiert zehn Varianten, schaut sie sich nebeneinander an und behält zwei. Das Werkzeug wandelt sich von etwas, das man anweist, zu etwas, mit dem man sich unterhält, und diese Verschiebung der Interaktion ist normalerweise das, was Qualität freisetzt, nicht das Basismodell.

Dasselbe geschah in der Bildgenerierung. Als ein gutes Bild Minuten dauerte, schrieben die Leute sorgfältige Prompts und behandelten jede Generierung als Entscheidung. Als es auf Sekunden sank, begannen sie, nachlässig zu prompten, breit zu generieren und auszuwählen. Die Obergrenze der Qualität stieg nicht viel, aber die Untergrenze der brauchbaren Ausgabe schon, weil Auswahl eine Menge Varianz auffängt. Wenn SparkDiffusion für Video das tut, was schnelle Sampler für Bilder getan haben, wird sich der Effekt zuerst darin zeigen, wie oft ein Team generiert, und nicht darin, dass ein einzelner Clip dramatisch besser ist.

Es gibt einen Hardware-Vorbehalt, und er ist nicht klein. Die 18-Sekunden-Zahl bezieht sich auf eine RTX 5090, eine Spitzenkarte der Consumer-Klasse. Dieselbe Pipeline auf der Mittelklasse-GPU auszuführen, die die meisten Studios tatsächlich besitzen, wird langsamer sein, und die Beschleunigung relativ zur Baseline mag weniger dramatisch aussehen. Aber die Richtung ist entscheidend für die Planung, denn der Preis der zugrunde liegenden Hardware sinkt zur selben Zeit, in der die Effizienz der Software steigt. Beide Kräfte wirken in dieselbe Richtung.

Der eigentliche Wettbewerb ist die Ökonomie pro Sekunde

Fügt man die beiden Hälften zusammen, sieht das Rennen der Videogenerierung weniger wie ein reiner Qualitätswettbewerb als vielmehr wie ein Kostenwettbewerb aus. Auf der einen Seite werden Modelle immer besser und pro Sekunde teurer. Auf der anderen Seite findet die Forschungsgemeinschaft immer wieder Wege, dieselbe Arbeit auf günstigerem Silizium in kürzerer Zeit zu erledigen. Der Gewinner in den meisten realen Projekten ist die Seite, die sich relativ zur anderen schneller bewegt.

Hier gibt es ein Muster, das die Welt der Bildgenerierung widerspiegelt. Ein Frontier-Modell erscheint, erhält eine hohe Bewertung und wird als Premium bepreist. Dann zeigt ein Open-Weights-Projekt, dass dieselbe Aufgabe hauptsächlich eine Frage des Engineerings ist, und der Preis bricht ein. Video ist diesem Bogen langsamer gefolgt, weil die Compute-Anforderungen höher sind, aber SparkDiffusion und SoL-Refiner sind die ersten glaubwürdigen Anzeichen dafür, dass es beginnt.

Die praktische Konsequenz für ein Content-Team ist, dass die Entscheidung zwischen Eigenbau und Kauf bei der Videogenerierung nicht mehr offensichtlich ist. Vor sechs Monaten war es der einzig bezahlbare Weg, für eine API zu bezahlen. Wenn eine einzelne GPU brauchbares 720p in Sekunden rendern kann, beginnt es für Teams mit stetigem Volumen Sinn zu ergeben, die Pipeline selbst zu besitzen, zumindest für die groben Durchläufe, die nur dann an einen kostenpflichtigen Dienst geschickt werden, wenn sie final sein müssen.

Worauf man achten sollte

Drei Dinge werden entscheiden, wie sehr das zählt. Erstens, ob die Qualität der beschleunigten Ausgabe in unabhängigen Tests standhält und nicht nur in den eigenen Samples eines Papers. Zweitens, ob der Open-Source-Code auf den Consumer-Karten, die die meisten Teams tatsächlich besitzen, genauso sauber läuft wie auf der RTX 5090 in den Ergebnissen. Drittens, ob die Frontier-Labs reagieren, indem sie aggressiver bepreisen, denn wenn ja, schrumpft der Anreiz, lokal zu arbeiten, wieder.

Vorerst ist die bedeutsame Verschiebung konzeptioneller Natur. Videogenerierung wird von einem Dienst zu einem Stück Software neu eingeordnet, das man selbst ausführen kann. Diese Neueinordnung ist dieselbe, die Bildmodelle von einem API-Aufruf in einen lokalen ComfyUI-Workflow verwandelt hat, und sie endet tendenziell auf dieselbe Weise: mit der Frontier an der Spitze und einer breiten, günstigen, gut genug funktionierenden Schicht darunter, die den Großteil der Arbeit erledigt.

Verwandte Artikel