Vidu Q3 teilte Reference-to-Video in drei Produkte auf. Das ist ebenso eine Packaging-Entscheidung wie eine Modellentscheidung.

Die meisten Video-Modell-Veröffentlichungen werden einmal angekündigt und tauchen dann überall unter einem einzigen Namen auf. Vidu hat mit seiner Q3-Reference-to-Video-Reihe das Gegenteil gemacht.
Am 14. September listete Alibaba Clouds Model Studio drei separate Vidu Q3 Reference-to-Video-Modelle auf. Das erste, viduq3-mix, ist ein Allzweckmodell, das Referenzbilder und einen Text-Prompt entgegennimmt und die Subjekte aus diesen Bildern in die beschriebene Szene einfügt. Das zweite, viduq3-ad, ist für Werbung konzipiert, mit werbetauglichen Szenenübergängen, Kamerabewegung und direkter Audioausgabe; Sie laden Produktbilder hoch und erhalten ein Werbevideo. Das dritte, viduq3-drama, zielt auf Drama- und KI-Manga-Produktion ab, mit Charakterkonsistenz, Bewegungseffekten und emotionalem Ausdruck, abgestimmt auf story-getriebene Inhalte.
Alle drei laufen mit 0,14 US-Dollar pro Sekunde für 720p oder 1080p, mit einem Ratenlimit von 5 Anfragen pro Sekunde. Der Preis ist bei allen drei identisch, was zeigt, dass die Differenzierung nicht in den Kosten, sondern im Ausgabeverhalten liegt.
Das Problem, das Vidu tatsächlich lösen wollte
Vidu stammt von Shengshu Technology in Peking. Sein Q3-Modell wurde am 30. Januar 2026 eingeführt und landete sofort auf der Benchmark-Szene. Artificial Analysis stufte es beim Start auf Platz eins in China und Platz zwei weltweit ein, vor Runway Gen-4.5, Google Veo 3.1 und OpenAI's Sora 2, mit einer Punktzahl von 1241.
Die drei technischen Veränderungen hinter diesem Ranking sind es wert, benannt zu werden. Q3 gehörte zu den ersten Langform-Videomodellen, die synchronisierten Dialog, Soundeffekte und Hintergrundmusik im selben Durchgang wie die Bilder erzeugten, anstatt Audio in der Postproduktion anzufügen. Es erweiterte Clips aus einem Durchlauf auf 16 Sekunden, was damals das längste unter den großen Modellen war. Und es baute ein Reference-to-Video-System auf, bei dem Nutzer drei bis sieben Bilder einer Figur, eines Objekts oder eines Stils hochladen und das Modell diese als visuelle Anker in späteren Generierungen verwendet.
Das Referenzsystem ist das Interessante. Die meisten Videomodelle im Jahr 2026 konkurrieren auf derselben Achse: einen einzelnen Clip beeindruckend aussehen zu lassen. Vidus Wette war anders. Der Pitch war nie „Schau dir diese eine wunderschöne Einstellung an.“ Er war „Schau dir dieselbe Figur über zehn Einstellungen hinweg an und bemerke, dass sie immer noch wie dieselbe Person aussieht.“
Das ist ein schwierigeres Problem, und es ist dasjenige, von dem Serieninhalte tatsächlich abhängen. In einem Vergleich mit Runway Gen-4, Kling 3.0, Luma Ray, Pika 2.0 und Sora 2, bei dem derselbe Charakter-Prompt über sechs Szenenvariationen hinweg verwendet wurde, behielt Vidu Q3 in fünf der sechs Tests die Konsistenz von Gesicht und Outfit bei.
Konsistenz ist das, was ein Werkzeug für einmalige Clips von einem Werkzeug für eine Serie unterscheidet. Für Anime-Schöpfer, Kurzdrama-Produzenten und jeden, der Markeninhalte rund um eine wiederkehrende Figur aufbaut, verändert sie, was möglich ist.
Warum drei SKUs wichtig sind
Eine Modellfamilie in drei benannte Produkte aufzuteilen, sieht wie eine Marketingentscheidung aus. Es ist eher eine Beschaffungsentscheidung.

Ein Werbeteam und ein Kurzdrama-Studio kaufen nicht dasselbe, auch wenn der zugrunde liegende Transformer ähnlich ist. Der Werbekäufer braucht Produkttreue, saubere Szenenübergänge und Audio, das unter einer Markenstimme liegen kann. Der Drama-Käufer braucht eine Figur, die über Episoden und Einstellungen hinweg ihre Identität behält, mit Ausdrücken, die wie schauspielerische Leistung wirken. Diese als separate Modell-IDs mit separater Dokumentation zu verpacken, ermöglicht es jedem Käufer, genau für einen Job zu evaluieren und zu budgetieren, anstatt eine allgemeine Funktionsliste zu lesen und zu raten.
Das Allzweck-Mix-Modell bedient dann alle außerhalb beider Boxen, eine vernünftige Struktur für einen Markt, in dem der Käufer zunehmend ein Produktionsteam mit einer Deadline ist statt ein Hobbyist, der Prompts testet.
Vidu Claw und die Pipeline-Ebene
Die Modelle zu verpacken, ist die eine Hälfte der Strategie. Die andere Hälfte ist eine Assemblierungsebene. Vidu Claw ist eine KI-Kreativ-Automatisierungs-Engine, die auf dem Open-Source-Framework OpenClaw aufbaut und von Q3 angetrieben wird. Sie verbinden Ihre Vidu-Tokens, definieren Skills und automatisieren den Weg von der Idee zum fertigen Video. Ein einzelner Prompt wie „Erstelle eine Kurzwerbung für einen Laufschuh, die sich auf Instagram an junge Frauen richtet“ reicht aus, damit Vidu Claw ein Konzept, ein Skript, ein Storyboard, visuelle Elemente, Voiceover, Musik und einen Final Cut generiert.
Unabhängige Bewertungen waren auf nützliche Weise gemischt. Ein Reviewer, der es an einer Produktwerbung testete, fand die Plattform für Studenten und Anfänger wirklich kostenlos und zugänglich, berichtete jedoch, dass sie mit präzisen strukturellen Details zu kämpfen hatte. In einem Fall rendete sie ein Detail immer wieder so, dass es selbst nach wiederholten Prompt-Korrekturen auffiel, und die Ausgabe trug einen merklichen KI-Beigeschmack, mit Beleuchtung und Farbe, die billig wirkten.
Das ist der ehrliche Kompromiss. Vidu Claw ist ein Produktivitätswerkzeug für Solo-Kreative und kleine Marketingteams, die schnell vom Konzept zu einem brauchbaren Entwurf kommen müssen, und kein Ersatz für ein professionelles Produktionsteam. Wenn es funktioniert, komprimiert es einen fünftägigen Werbeproduktionszyklus auf einen Tag. Wenn nicht, sind die Qualitätsprobleme schwer zu übersehen.
Das Ökosystem, das Vidu aufbaut
Der Reference-to-Video-Fokus hängt mit einer Vertriebsgeschichte zusammen. Im Februar 2026 kündigte das Softwareunternehmen Wondershare eine strategische Investition in Shengshu an, wobei beide planen, an KI-Manga zu arbeiten. Das Vidu Q3-Modell wurde in eine durchgängige KI-Manga-Produktionsplattform integriert, die dazu dient, Charaktere, Stimmen und Szenen über Episoden hinweg konsistent zu halten. Alibaba Clouds Bailian-Plattform nahm Vidu Q3 im Mai 2026 ebenfalls als Drittanbieter-Modell auf.
Das Modell durchläuft also mindestens drei Kanäle: direkten Web- und API-Zugang, eine Kreationsplattform für Manga und Kurzdrama sowie einen Cloud-Modellmarktplatz. Jeder Kanal hat einen anderen Käufer mit einer anderen Definition von „gut genug“.
Wo das Geld tatsächlich liegt
Die Verschiebung hin zu Serieninhalten ist keine kreative Vorliebe. Es ist der Ort, an dem die Budgets liegen. Ein Kurzdrama ist ein mehrteiliges Produkt mit einer wiederkehrenden Besetzung, und seine Wirtschaftlichkeit hängt davon ab, weit mehr Filmmaterial zu produzieren als eine einzelne Werbung oder ein Einzelclip. Wenn ein Modell den Creator dazu zwingt, bei jeder Einstellung die Charaktererscheinung von Null neu aufzubauen, werden die Einsparungen durch das generierte Filmmaterial durch Konsistenzkorrekturen aufgezehrt. Vidus Wette ist, dass das Team, das bereit ist, 0,14 US-Dollar pro Sekunde zu zahlen, nicht eine einzelne schöne Einstellung kauft, sondern eine Möglichkeit, dieselbe Person über eine gesamte Serie hinweg erkennbar zu halten.
Das ist auch der Grund, warum das Referenzsystem mehr zählt als die reine Qualitätsbewertung. Ein Modell, das weltweit den zweiten Platz in einem Benchmark belegt, ist beeindruckend, aber der Benchmark misst Clips. Die Referenzfunktion misst Serien. Die beiden sind nicht derselbe Kauf, und Vidu verkauft an den zweiten.
Wo es noch nicht liefert
Die Referenzkonsistenz ist nicht perfekt, und fünf von sechs sind nicht sechs von sechs. Wo der sechste Fall fehlschlug, lieferte das Tool ein Gesicht und ein Outfit, die von der Quelle abwichen, genau das Versagen, das eine Serie zunichtemacht. Die Kosten sind real bei 0,14 US-Dollar pro Sekunde, was sich über einen 16-sekündigen Clip schnell summiert und in Seriengröße, wo Hunderte von Einstellungen im Spiel sind, erheblich wird. Die Pipeline-Ebene produziert Entwürfe statt fertiger Werbespots, und Reviewer haben festgestellt, dass sie ein strukturelles Detail selbst mit wiederholten Prompt-Korrekturen nicht zuverlässig beheben kann.
Es gibt auch eine strukturelle Grenze, die es wert ist, benannt zu werden. Reference-to-Video verankert Identität, löst aber noch nicht die Kontinuität für eine ganze Produktion. Jemand muss immer noch die Regieentscheidungen treffen, die aus einer Reihe konsistenter Clips eine Geschichte machen, und das Modell hat keine Meinung zu Tempo, Coverage oder ob eine Szene überhaupt existieren sollte.
Was zu beobachten ist
Die Drei-SKU-Struktur ist der Teil, den andere Anbieter wahrscheinlich kopieren werden. Wenn Reference-to-Video die Standardmethode wird, mit der Serieninhalte erstellt werden, ist damit zu rechnen, dass mehr Modellfamilien aufgabenspezifische Varianten statt eines einzelnen Flaggschiffs auf den Markt bringen. Die nächsten wichtigen Fragen sind, ob die Konsistenz bei längeren Laufzeiten und schwierigerer Kameraführung hält und ob die Pipeline-Ebene gut genug wird, um an ein Studio statt an einen Solo-Creator zu verkaufen.
Verwandte Artikel
KI-Videotools erhalten 9 von 10 Punkten für Benutzerfreundlichkeit. Der Compliance-Score ist eine andere Geschichte.
Nutzer lieben KI-Videogeneratoren. Rechtsabteilungen wurden noch nicht gefragt.
InternLumina-U2 vereint Text, Bilder, Video und 3D in einem 16B-Modell und liefert zwei Gewichtssätze
Die Aufgabenliste ist ehrgeizig. Das Veröffentlichungsformat liefert mehr Signal.
HappyOyster verkauft eine Welt, die Sie betreten können, keinen Clip, den Sie ansehen
Die meisten Videomodelle liefern Ihnen eine Datei. Dieses liefert Ihnen einen Raum mit einer Tür darin.
Luma Ray3 Modify bewahrt die Performance und verhandelt die Welt um sie herum neu
Das schwierigste Problem beim KI-Videoschnitt ist nicht der Effekt. Es ist, den Take, für den Sie bereits bezahlt haben, nicht zu ruinieren.