← Zurück zum Blog
Aica. 7 Min. Lesezeit

Der nächste Kampf im KI-Video dreht sich um das Verständnis der Welt

Veröffentlicht 2. Okt. 2026
Der nächste Kampf im KI-Video dreht sich um das Verständnis der Welt

Fast zwei Jahre lang war die Beurteilung eines KI-Videomodells einfach: Man schaute, wie schön die einzelnen Bilder aussahen. Dieser Test stößt an seine Grenzen. Wenn mehrere Modelle überzeugende Fünf-Sekunden-Clips einer Person, die durch eine Stadt geht, erzeugen können, trennt die Bildqualität sie nicht mehr. Etwas anderes muss es tun.

Im September veröffentlichte ein chinesisches Startup namens HiDream.ai HiDream-O1-Video-1.0, kurz HD-V1, und machte genau dieses „etwas anderes“ zum Kern seines Angebots. Das Modell, so das Unternehmen, sei darauf ausgelegt zu verstehen, wie sich Ereignisse entfalten sollten – und nicht nur, wie ein einzelnes Bild aussehen sollte.

Das Problem mit schönen Einzelbildern

Wer schon einmal Videos generiert hat, kennt die typischen Fehler. Man gibt einem Charakter die Anweisung, eine schwere Holztür aufzustoßen, und das Modell zeichnet die Hand, die nach links drückt, während die Tür nach rechts schwingt. Man bittet jemanden, in fünf Sekunden von einem Ort zum anderen zu rennen, und die Figur beendet den Dialog, die Zeit läuft ab, und sie teleportiert sich. Der Clip sieht gut aus, bis man ihn sich tatsächlich ansieht.

Wiederholtes Neu-Generieren kostet Zeit und Guthaben, und ein fünfzehnsekündiger Clip kann weit mehr kosten, als das Budget erlaubt. Die Lücke ist keine Frage der Auflösung und auch nicht der Länge. Es geht um Physik sowie Ursache und Wirkung. Das Modell malt jedes Bild, ohne zu verstehen, dass eine Tür in die Richtung schwingen muss, in die die Hand drückt, oder dass eine Bewegung zwischen zwei Punkten Zeit braucht.

Genau diese Lücke will HD-V1 schließen. HiDream sagt, das Modell stärke vor der Generierung sein Verständnis von Handlungsdauer, Objektbeziehungen, Ereignislogik und audiovisueller Abstimmung, damit die Ausgabe als Sequenz zusammenhält und nicht als Stapel von Standbildern.

Ein holografischer Storyboard-Streifen, der eine Silhouette zeigt, die eine Tür in die richtige Richtung aufstößt

Vier chinesische Modelle, drei Ansätze

Um zu verstehen, warum das wichtig ist, hilft ein Blick darauf, wer sonst noch an der Spitze der Ranglisten steht. Bis September 2026 hatten sich vier chinesische Modelle in die Spitzengruppe der globalen Videogenerierung vorgeschoben: ByteDances Seedance 2.0 und 2.5, MiniMax’ H3, Alibabas Wan 3.0 und HiDreams HD-V1. Ein Jahr zuvor waren chinesische Videomodelle auf den großen internationalen Benchmarks kaum vertreten. Jetzt drängen sie sich nahe der Spitze.

Sie haben dorthin auf unterschiedlichen Wegen gefunden. Seedance stützt sich auf ByteDances kompletten Stack aus Rechenleistung, Engineering und Produkt. MiniMax H3 baut auf einer großen Modellbasis und einer großen Nutzerbasis auf und erweitert sie ins Video. Wan 3.0 ist in Alibabas breiteres Ökosystem aus Qwen und Alibaba Cloud eingebettet. HiDream ist unter ihnen der Außenseiter: ein Startup ohne die Ressourcen oder Vertriebskraft eines Giganten, das stattdessen auf eine Architektur setzt, die es ein natives omni-modales Weltmodell nennt und die Bilder, Video, 3D-Interaktion und verkörperte Intelligenz eine gemeinsame Grundlage teilen lassen soll.

HD-V1 unterstützt Text-, Bild- und Videoeingaben und generiert 5 bis 20 Sekunden 1080p-Video. Das Team sagt, es habe auf zwei internationalen Ranglisten gut abgeschnitten, und die Behauptung, die heraussticht, ist das Weltverständnis: die Idee, dass das Modell kohärentere Sequenzen erzeugt, weil es modelliert, wie Ereignisse voranschreiten.

Warum „Verstehen“ die neue Grenze ist

Wenn mehrere Teams dieselbe Qualitätslatte erreichen, verschiebt sich der Wettbewerb darauf, was das Modell über die Welt weiß. Auflösung und Dauer werden zu Basisfunktionen statt zu Unterscheidungsmerkmalen. Die schwierigeren Fragen sind jene, die Bildqualität nicht beantworten kann: ob ein sich bewegendes Objekt die Regeln der Physik befolgt, ob Handlung und Ton synchron bleiben, ob ein Ereignis aus dem vorherigen folgt.

Die Branche hat andere Namen für dieselbe Idee. Konkurrenzprodukte und der breitere Markt sprechen von Konsistenz, Intentionsverständnis und stabiler Umsetzung. Ein chinesisches Videounternehmen, ZhiXiang Future, hat sogar ein fünfteiliges Bewertungsframework für Video-Agenten veröffentlicht, das Konsistenz, Intention, audiovisuelle Vollständigkeit, Zeitlinie und Narration sowie stabile Umsetzung abdeckt. Die Namen unterscheiden sich, das Ziel ist dasselbe: Modelle, denen man zutrauen kann, eine Sequenz zu Ende zu bringen und nicht nur zu beginnen.

Dahinter steckt Geld. Goldman Sachs schätzte, dass der globale Markt für KI-Videogenerierung in fünf Jahren um etwa das Zehnfache wachsen wird, auf rund 29 Milliarden Dollar bis 2030. Eine solche Prognose zieht Investitionen dorthin, wo der nächste echte Fähigkeitssprung vermutet wird, und „versteht die Welt“ ist der aktuelle Kandidat.

Die Ranglisten widersprechen sich

Ein Teil dessen, was das Videofeld schwer beurteilbar macht, ist, dass die Ranglisten nicht übereinstimmen. Im September kürte die Community-Arena eine Familie, menschliche Bewerter, die einzelne Clips bewerteten, bevorzugten eine andere, und Prompt-Autoren, die mit ihrer Nutzung abstimmten, wählten eine dritte. Ein Community-Elo-Schnappschuss setzte Googles Gemini-Omni-Reihe an die Spitze, mit Black Forest Labs’ Flux 3 Video als stärkstem open-nahen Eintrag und ByteDances Seedance 2.0 und 2.5 dicht dahinter. Menschliche Bewerter, die Clips auf einer Qualitätsskala von eins bis fünf bewerteten, setzten dagegen Seedance 2.0 auf Platz eins, vor Kling, Wan und sogar dessen eigenen Nachfolger. Nach reiner Nutzung dominieren Seedance und Googles Veo 3 das Prompt-Volumen, während Wan die lokale und offene Nische besitzt.

Die Lehre aus diesen drei Datensätzen ist, dass „bestes Modell“ vollständig davon abhängt, was man misst. Veo schneidet bei menschlichen Bewertungen stummer Clips schlechter ab als in Arenen, weil seine Stärke native Audio- und Dialogfähigkeit ist, die ein stummes Bewertungsschema nicht sehen kann. Dass Seedance 2.5 bei der Qualität pro Clip unter 2.0 liegt, erinnert daran, dass neuere Versionen bei den Prompts, die Menschen tatsächlich schreiben, nicht immer beeindruckender sind. Wer ein Tool für ein Projekt auswählt, sollte vor der Entscheidung mehr als eine Rangliste lesen und die Rangliste stärker gewichten, die zur eigenen Arbeit passt.

Was die Verschiebung für Kreative bedeutet

Für alle, die mit diesen Tools tatsächlich etwas erschaffen, besteht der praktische Effekt in einer Veränderung dessen, was kaputtgeht. Wenn ein Modell Ereignislogik versteht, verschiebt sich das Scheitern vom Offensichtlichen zum Subtileren. Man kämpft nicht mehr gegen teleportierende Figuren und Türen, die in die falsche Richtung aufgehen, und beginnt stattdessen, kleinere Probleme zu bemerken: eine Handlung, die einen Takt zu lange dauert, eine Reaktion, die nicht aus der vorherigen Zeile folgt. Das sind die Probleme, die ein menschlicher Regisseur eigentlich erkennen soll.

Das ist dieselbe Lektion, die der Kurzdrama-Boom in China bereits gelehrt hat. KI kann inzwischen die Einstellungen generieren, aber eine fertige Episode braucht noch immer jemanden, der entscheidet, welche Einstellungen dazugehören, in welcher Reihenfolge und warum. Die Modelle werden besser bei einzelnen Bildern. Das Urteilsvermögen darüber, welche Bilder zählen, bleibt weiterhin menschliche Arbeit – und das könnte länger so bleiben, als Optimisten erwarten.

Das Rennen zwischen vier Anbietern ist auch aus einem leiseren Grund wichtig. Verschiedene Unternehmen greifen dasselbe Problem aus unterschiedlichen Richtungen an – hier der Stack eines Giganten, dort die Architektur eines Startups – und verringern so die Abhängigkeit der Branche von einem einzigen technischen Weg. Wenn sich das Weltverständnis als richtiges Ziel erweist, zielen jetzt mehr als ein Team darauf. Und wenn es sich als falsches Ziel erweist, hat sich das Feld abgesichert.

Der ehrliche Befund ist derzeit, dass HD-V1 ein weiterer starker Eintrag in einem überfüllten Feld ist, mit Behauptungen, die Dritte noch nicht getestet haben. Was nicht infrage steht, ist die Richtung. Die Modelle, die die nächste Runde gewinnen, werden nicht diejenigen sein, die das schönste Einzelbild zeichnen. Es werden diejenigen sein, die eine Geschichte zwanzig Sekunden lang zusammenhalten können, ohne dass etwas kaputtgeht. Die Welt zu verstehen, ist das schwierigere Problem, und zum ersten Mal arbeiten viele gut finanzierte Teams gleichzeitig daran.

Verwandte Artikel