Wan 3.0 setzt sich an die Spitze des Video-Leaderboards. Die Open-Weights-Story ist jetzt eine Video-Story.

Während des größten Teils des Generative-AI-Booms gehörte die Open-Weights-Diskussion den Bildern. Stable Diffusion bewies, dass man ein echtes Modell auf der eigenen GPU betreiben konnte, und rundherum entstand ein ganzes Ökosystem aus LoRAs und ControlNets. Bei Video war das anders. Die besten Videomodelle blieben hinter APIs verschlossen, und „Open-Source-Video“ bedeutete kleine Modelle, die den geschlossenen Marktführern hinterherliefen.
Das hat sich in diesem Monat geändert. Wan 3.0, Alibabas Videomodell, eroberte Platz eins im Benchmark AA-Video-T2V v2.0 der nächsten Generation von Artificial Analysis, der auf mehr als 68.000 menschlichen Präferenzstimmen zu rund tausend Prompts basiert. Wan 3.0 erreichte einen Elo-Wert von 1157 und belegte in 10 von 20 Kategorie-Rankings den ersten Platz. Dieselbe Bestenliste setzte Wan 3.0 auch bei Videobearbeitung auf Platz eins, vor ByteDances Seedance und MiniMax' H3.
Die Bedeutung liegt weniger in einer einzelnen Zahl als in dem, wofür sie steht. Ein chinesisches Open-Weights-Modell ist jetzt konkurrenzfähig mit Google Veo 3.1 und dem Rest des geschlossenen Felds – und in mehreren Rankings sogar voraus. Die Preisgestaltung erzählt dieselbe Geschichte. Wan 3.0 kostet je nach Auflösung 0,05 bis 0,20 US-Dollar pro Sekunde, gegenüber 0,40 US-Dollar bei Veo 3.1 in der Standardstufe. Alibaba sammelte im Rahmen einer Aktienplatzierung in Hongkong 10 Milliarden US-Dollar ein, um genau diesen Vorstoß zu finanzieren, und die Strategie ist klar erkennbar: billig verkaufen, Marktanteile gewinnen, den Enterprise-Kunden zum Wachstumsmotor machen.
Technisch ist Wan 3.0 auf Konsistenz und strukturierte Eingaben ausgelegt. Es erzeugt Clips von bis zu 30 Sekunden in einem einzigen Durchlauf und verdoppelt damit das 15-Sekunden-Limit seines Vorgängers, in bis zu 1080p mit synchronisierten Mikroexpressionen und mehrsprachiger Stimme. Interessanter ist, dass es Dokumente, PDFs, PowerPoints und Tabellen als Eingabe akzeptiert und so eine Präsentation oder einen Bericht in Video verwandelt. Dieser Document-to-Video-Ansatz zielt direkt auf Enterprise-Workflows, nicht nur auf einzelne Creator.
Die Document-to-Video-Funktion verdient mehr Aufmerksamkeit, als sie bekommt. Die meisten Videomodelle wollen einen Text-Prompt oder ein Bild. Wan 3.0 will Ihre vorhandenen Assets – die Präsentation, die Sie bereits erstellt haben, den Bericht, den Sie bereits geschrieben haben – und behandelt diese als Quelle der Wahrheit. Für ein Unternehmen, das in Dokumenten lebt, senkt das die Hürde von „Wir haben einen Bericht“ zu „Wir haben ein Video“ fast auf null. Es ist das erste Modell, das die unternehmensinterne Dokumenten-Pipeline zum Einstiegspunkt macht, und das ist ein leise kluger Schachzug.
Für ein Team, das einen Video-Stack auswählt, mischt das die Entscheidung neu. Die alte Annahme, dass offene Modelle die Notlösung sind, wenn man sich die geschlossenen nicht leisten kann oder sie nicht nutzen darf, bröckelt. Man kann jetzt ein Modell selbst hosten, das die Bestenliste anführt, was für die Fälle zählt, in denen es überhaupt nicht um Qualität geht, sondern ausschließlich um Kontrolle. Ein Kunde, dessen Daten seine Infrastruktur nicht verlassen dürfen, hat außer einem selbst gehosteten Modell keine konforme Option – und zum ersten Mal ist diese Option kein Kompromiss bei der Ausgabequalität.
Es gibt einen Vorbehalt, der in der Begeisterung gern übersprungen wird. Selbst-Hosting ist nicht kostenlos, nur weil die Gewichte frei sind. Man zahlt in GPUs, in Integrationsarbeit und in der laufenden Aufgabe, eine Pipeline gesund zu halten – egal, welches Volumen die eigene Arbeit tatsächlich erreicht. Das Modell ist kostenlos; das Engineering nicht. Für die meisten kleinen Teams gewinnt ein gehosteter Endpunkt in den Gesamtkosten weiterhin, bis das Volumen die Hardware rechtfertigt.
Der Benchmark-Kontext ist wichtig, um den Sieg richtig einzuordnen. Der Benchmark AA-Video-T2V v2.0 ist die neue Generation der Human-Preference-Evaluierung und bewertet jedes Modell bei 1080p, was den alten Trick entfernt, mit niedriger Auflösung zu gewinnen. Wan 3.0 belegte in zehn von zwanzig Kategorie-Rankings den ersten Platz und erzielte mit 1157 den besten Gesamt-Elo-Wert. Das ist kein Nischen-Sieg und keine günstige Kategorie; es ist ein breites, wettbewerbsfähiges Ergebnis gegen das gesamte Feld, einschließlich der Modelle, die pro Sekunde achtmal so viel kosten. Wenn ein offenes Modell, das 0,05 US-Dollar pro Sekunde kostet, ein geschlossenes Modell schlägt, das 0,40 US-Dollar kostet, ist das Wertversprechen schwer zu widerlegen.
Es gibt außerdem eine politische Dimension, die schwer zu ignorieren ist. Das KI-Video-Rennen ist zu einem Stellvertreter für einen größeren Wettbewerb zwischen chinesischen und amerikanischen Laboren geworden, und Wan 3.0s Benchmark-Krone ist die Art von Ergebnis, die in beiden Ländern aus unterschiedlichen Gründen zitiert wird. In China ist es der Beweis, dass der heimische Stack nicht nur beim Preis, sondern auch bei der Qualität konkurrieren kann. In den USA ist es ein Beleg dafür, dass nicht nur die Compute-Kosten im Wandel sind. Keine der beiden Rahmungen erfasst vollständig, was geschieht: eine echte wettbewerbliche Konvergenz, die Nutzern in Form niedrigerer Preise und leistungsfähigerer offener Modelle zugutekommt.
Der Übergang von Open Weights ins Video hat auch Auswirkungen auf die breitere Geopolitik der KI. Chinesische Labore gewinnen den Preiskrieg schon seit eine Weile, und jetzt gewinnen sie auch bei Benchmarks, was die Erzählung von „billiger Nachahmung“ zu „echt konkurrenzfähig“ verschiebt. Dieselbe Dynamik hat sich bereits in der Bildgenerierung mit Qwen-Image und Z-Image gezeigt und bei Sprachmodellen mit DeepSeek und Qwen. Video war die letzte große Bastion der geschlossenen westlichen Labore, und Wan 3.0 hat gerade gezeigt, dass die Tür offen ist.
Die Benchmark-Krone ist die Schlagzeile, aber die eigentliche Geschichte ist, dass die Videogenerierung jetzt einen glaubwürdigen offenen Weg hat. Dieselbe Dynamik, die auf Stable Diffusion folgte, wird sich wahrscheinlich auch hier einstellen: Fine-Tunes, Community-Control-Nodes, regionale Deployments und ein langer Schwanz von Anwendungsfällen, die die API-Anbieter nie bedienen wollten. Feinabgestimmte offene Modelle sind bei Bildarbeiten bereits der Standard, um eine bestimmte Figur oder einen Stil zu halten, und Video-Creator werden dieselbe Möglichkeit wollen, auf ihre eigene Marke oder ihr Produkt zu trainieren.
Es gibt bereits erste Anzeichen dafür, dass sich dieses Ökosystem bildet. Das MiniMax-H3-Ökosystem hat einen Open-Source-Prompt-Builder und eine Welle von Community-Fine-Tunes hervorgebracht, die auf Anime- und Character-Arbeit ausgerichtet sind – ganz nach dem Stable-Diffusion-Playbook. Wenn die offenen Gewichte gut genug sind, um einen Benchmark anzuführen, ist die Community, die sich um sie bildet, keine Nische mehr; sie ist der Mainstream, und die Innovationen, die daraus hervorgehen – Control-Nodes, regionales Hosting, datenschutzfreundliche lokale Inferenz –, treffen tendenziell schneller ein, als es ein einzelner Anbieter ausliefern kann.
Die praktische Implikation für ein Team ist konkret und es lohnt sich, sie zu wiederholen. Wenn man Ende 2026 einen Video-Stack auswählt, lautet die Frage nicht mehr „offen oder geschlossen“ als Qualitätsfrage. Es geht um Kontrolle, Kosten und Exit-Risiko. Offene Gewichte geben Ihnen das Erste und reduzieren das Dritte – auf Kosten des Zweiten. Geschlossene APIs bieten Bequemlichkeit auf Kosten aller drei. Die Teams, die die nächste Modell-Abschaltung ohne Schmerzen überstehen, sind diejenigen, die bereits entschieden haben, wie sie zu diesem Trade-off stehen, statt es auf die harte Tour herauszufinden, wenn ihr Anbieter eine Abschaltung ankündigt.
Für alle, die auf generativem Video aufbauen, lautet die praktische Lektion: Hören Sie auf, offene Gewichte als Notlösung zu behandeln. Behandeln Sie sie als strategische Option. Wenn ein geschlossener Anbieter das nächste Mal ein Modell abschaltet, so wie OpenAI es gerade mit Sora getan hat, werden die Teams nicht in Hektik verfallen, die mindestens einen Fuß auf dem offenen Weg behalten haben. Offene Gewichte waren früher der Trostpreis. Im Video sind sie gerade zur Trophäenvitrine geworden.
Verwandte Artikel
Das Video-Modell-Ranking, das niemand bewirbt: Wohin die Anfragen wirklich gehen
Jede Woche erscheint ein neues Ranking zur Videogenerierung, und fast alle sind nach demselben Muster aufgebaut.
Ai2 hat den Trainings-Stack als Open Source veröffentlicht – nicht nur ein weiteres Set Gewichte
Gewichte sind leicht weiterzugeben und schwer daraus zu lernen.
Alibabas Qwen3.8-Max behauptet, zwei Wochen lang selbstständig programmieren zu können
Parameterzahlen sind schon vor einer Weile keine Neuigkeit mehr. Zwölf Tage ist die Zahl, die es zu untersuchen lohnt.
PixelUMM verwirft die zwei Komponenten, auf die jedes visuelle KI-Modell angewiesen ist
Diffusion auf Pixelebene wurde schon früher vorgeschlagen und ist immer wieder an Rechenleistung gescheitert.