Wan 3.0 führt die neu aufgebaute Video-Bestenliste an, und Kling 3.0 wird ihr Anker

Artificial Analysis hat seine Text-zu-Video-Bestenliste am 30. September neu aufgebaut. Die neue Skala, AA-Video-T2V v2.0, bewertet jedes Modell bei 1080p und stützt sich auf mehr als 68.000 menschliche Präferenzstimmen über rund 1.000 Prompts, gruppiert in zehn Anwendungskategorien und zehn Fähigkeitsachsen. Wan 3.0 liegt mit Audio mit einem Elo von 1.156 auf dem ersten Platz und belegt in zehn der zwanzig Kategorierankings den Spitzenplatz.
Die Zahl, die mehr über den Zustand des Marktes aussagt, ist die am unteren Ende. Kling 3.0 bei 1080p ist der feste Anker bei 1.000. Niemand wird darunter eingestuft, weil die Skala dort festgenagelt ist. Kuaishous früheres Flaggschiff galt einst als der Standard im Inland für KI-Video; auf dieser Bestenliste ist es der Referenzpunkt, an dem alles andere gemessen wird.
Ein Feld, kein Podium
Die vier besten Modelle liegen innerhalb von 18 Punkten zueinander, bei Fehlerbalken von etwa neun bis zehn. Wan 3.0 führt mit 1.156. Utopai X, das auf MiniMax H3 nachtrainiert ist und keine öffentliche API hat, liegt mit 1.148 auf Platz zwei. Dreamina Seedance 2.5 folgt mit 1.142, und MiniMax H3 bei 768p ist mit 1.138 Vierter. fal's H3 Max rundet die Gruppe mit 1.134 ab.
Lesen Sie diese Zahlen als ein Feld, nicht als Leiter. Ein Modell, das innerhalb eines Fehlerbalkens des Spitzenreiters liegt, ist nicht messbar schlechter als der Spitzenreiter. Drei der fünf besten sind H3 oder darauf aufgebaut, was die interessantere Tatsache ist: Die von MiniMax veröffentlichte Open-Weight-Basis ist zum Substrat geworden, auf dem andere Teams nachtrainieren, so wie vor drei Jahren auf Stable Diffusion aufgebaut wurde.
Unter dem Ranking verbirgt sich eine Verteilungsgeschichte, die die Bestenliste erstmals sichtbar macht. Vor einem Jahr war die Spitze einer Video-Bestenliste eine Liste geschlossener Modelle aus einer Handvoll gut finanzierter Labore. Heute umfassen die fünf besten eine Open-Weight-Basis und zwei darauf von kleineren Teams nachtrainierte Modelle. Utopai X hat keine öffentliche API, sodass das Modell, das auf einer öffentlichen Bestenliste Platz zwei belegt, für alle außerhalb des Unternehmens unerreichbar bleibt. Das ist eine neue Art von Ranking-Artefakt und sagt etwas darüber aus, wie schnell ein guter Post-Training-Durchlauf eine offene Basis konkurrenzfähig machen kann.
Auf der begleitenden Ohne-Audio-Bestenliste, die am selben Tag startete, führt Wan 3.0 mit 1.129, während H3 und H3 Max die Plätze zwei und drei belegen. Das Entfernen von Audio verengt das Feld, was darauf hindeutet, dass der Vorteil der chinesischen Modelle über ihre Audiobehandlung und nicht allein über ihre visuelle Leistung läuft. Es verändert auch die Interpretation der Bestenliste: Ein Studio, das nur stummes Material benötigt, betrachtet ein anderes Wettbewerbsbild als eines, das lippensynchronen Dialog braucht.
Was die Preisspalte aussagt
Die Bestenliste enthält außerdem einen Preis pro Minute, und diese Spalte liest sich anders als die Elo-Spalte. Wan 3.0 kostet 12 US-Dollar pro Minute Video. Seedance 2.5 ist mit 34,12 US-Dollar pro Minute das teuerste Modell in den Top Ten. MiniMax H3, das jeder herunterladen kann, liegt bei 4,80 US-Dollar pro Minute.

Das Open-Weight-Modell auf Platz drei kostet also ein Viertel dessen, was der Spitzenreiter verlangt, und ein Siebtel dessen, was das kommerzielle Modell auf Platz zwei verlangt. Für ein Team, das ein Produkt ausliefert, ist diese Lücke wichtiger als neunzehn Elo-Punkte. Die Frage verschiebt sich von „Welches Modell ist das beste?“ zu „Welches Modell ist gut genug, dass die Rechnung pro Minute den Business Case nicht zunichtemacht?“ H3 ist die Antwort für viele Teams, die vor einem Jahr für Seedance bezahlt hätten.
Der Wert von 34,12 US-Dollar pro Minute für Seedance 2.5 verdient einen zweiten Blick, denn er ist der teuerste Eintrag in den Top Ten und rangiert auf Platz drei. Die Preisgestaltung impliziert einen Kunden, der Qualität so sehr schätzt, dass er das Siebenfache des Open-Weight-Preises zahlt, und solche Kunden gibt es in Werbung und Film. Was die Bestenliste nicht zeigen kann, ist, ob dieser Aufpreis den Kontakt mit einem Budget übersteht. Wenn eine Produktion zweihundert Einstellungen braucht, ist der Unterschied zwischen 34 und 4,80 US-Dollar pro Minute der Unterschied zwischen einem Projekt und einem Tabellenkalkulationsproblem.
Wan 3.0s Führung hat einen Vorbehalt: Es befindet sich in einer einladungsbeschränkten kommerziellen Beta. H3 ist das Modell, das man heute tatsächlich zu einem veröffentlichten Preis kaufen kann. Eine Bestenlistenposition für ein Modell, auf das man nicht zugreifen kann, ist ein Signal dafür, wohin sich das Feld entwickelt, keine Kaufentscheidung.
Die Videobearbeitungs-Bestenliste fügt eine zweite Dimension hinzu. Wan 3.0 hält dort mit einem Elo von 1.188 den ersten Platz und nimmt MiniMax H3 die Kategorie ab, die es seit seinem Debüt im August gehalten hatte. Bearbeitung ist der Bereich, in dem die praktischen Workflows leben, denn die meiste kommerzielle Videoarbeit beginnt mit bereits vorhandenem Filmmaterial. Ein Modell, das bei der Generierung führt, bei der Bearbeitung aber zurückliegt, ist für ein Produktionsteam weniger nützlich als ein Modell, das bei beidem stark ist. Wan 3.0 führt derzeit bei beidem, was die stärkste Position ist, die ein Modell auf dieser Bestenliste je gehalten hat.
Kling 4.0 erschien als Datenblatt
Die andere Sache, die diese Bestenliste klärt, ist, wie viel vom jüngsten Kling-4.0-Launch außerhalb einer Pressemitteilung existiert. Der Kuaishou-Account kündigte das Modell am 28. September an: bis zu 4K, 10-Bit-HDR, 15 multimodale Referenzen, 10 Keyframes, native 30-Sekunden-Generierung, Stereo-Audio. Das Veröffentlichungsdatum war „kommt diesen Oktober“.
Was tatsächlich erschienen ist, ist Kling 4.0 Flash, verfügbar für Ultra-Jahresabonnenten. Die Funktionsseite enthält keinen Preis, kein Datum, keine Auflösungsangabe und keine Erwähnung von Oktober. Der neueste Kling-Eintrag auf irgendeiner Artificial-Analysis-Bestenliste ist weiterhin 3.0. Ein Creator-Post, der offenlegte, dass Kling dafür bezahlt hat, besagt, die Launch-Ausgabe sei 1080p und günstiger als Seedance, was mit der Schlagzeile „bis zu 4K“ kollidiert.
Nichts davon macht die angekündigten Fähigkeiten unecht. Es bedeutet, dass die Lücke zwischen einer Ankündigung und einem nutzbaren Modell der Ort ist, an dem der Großteil der Arbeit liegt, und dieser Launch hat sie noch nicht geschlossen. Ein Datenblatt, das 4K, HDR, fünfzehn Referenzen und zehn Keyframes auflistet, beschreibt eine Funktionspalette, die, wenn sie erscheint, die stärkste auf dem offenen Markt wäre. Es beschreibt auch eine Reihe von Funktionen, auf die jeder Wettbewerber innerhalb eines Quartals antworten muss.
Das Muster ist aus den letzten zwei Jahren der Modell-Launches vertraut. Ankündigungen wecken Erwartungen, und das Intervall bis zur allgemeinen Verfügbarkeit ist der Zeitraum, in dem das eigentliche Produkt entsteht. Für einen Käufer ist der praktische Rat derselbe wie immer: Planen Sie keine Produktionspipeline um eine Funktionsseite herum. Planen Sie sie um das herum, was Sie heute aufrufen können.
Was zu beobachten ist
Das nächste Signal ist, ob Wan 3.0 die einladungsbeschränkte Beta verlässt und einen Preis veröffentlicht. Wenn ja, wird die Lücke zwischen dem Spitzenreiter und dem Open-Weight-Feld zu einer echten Budgetentscheidung statt zu einer theoretischen.
Das zweite Signal ist Kling 4.0 selbst. Sein letztes Flaggschiff setzte den Anker auf dieser Skala. Das nächste wird in die Erwartungen eingepreist, bevor irgendjemand außerhalb von Kuaishou es ausprobiert hat. Wenn es dann ankommt, trifft es auf eine Bestenliste, auf der drei der fünf besten Plätze bereits von Modellen besetzt sind, die weniger kosten.
Das dritte ist, was mit dem Anker selbst passiert. Kling 3.0 liegt per Definition bei 1.000. Wenn Kling 4.0 erscheint und darüber landet, verschiebt sich der Fixpunkt der Skala, und jedes Elo auf der Bestenliste wird zu einem Vergleich mit einer neuen Basis. Das ist der Moment, in dem dieses Ranking aufhört, den September zu beschreiben, und beginnt zu beschreiben, wohin das Jahr geht.
Verwandte Artikel
Satellitenbilder sind jetzt Trainingsdaten für Roboter
Der Engpass beim Training physischer KI ist nicht mehr die Rechenleistung oder die Modellfähigkeit. Er wurde die Qualität der synthetischen Welt.
Googles Gemini 3.5 Live Translate beseitigt die Pause
Übersetzung, die kontinuierlich läuft, in der Stimme der sprechenden Person, auf einem Telefon, das ohnehin schon in der Tasche steckt, macht das Feature von etwas, das man öffnet, zu etwas, das einfach an ist.
China hat den ersten verbindlichen Sicherheitsstandard für KI-Agenten geschrieben
Sicherheit wird von einem Feature, mit dem man wirbt, zu einer Hürde, die man passieren muss. Das Risikoinventar umfasst 13 Kategorien und 97 Punkte.
KI-generierte Inhalte müssen jetzt ihre Identität offenlegen
Dieser Schritt löst nicht alle Probleme, aber er macht „KI-generiert“ von einer Option, die man verbergen konnte, zu einer Frage, die beantwortet werden muss.