← Zurück zum Blog
Aica. 7 Min. Lesezeit

Vibe Video: Das Coding-Modell, das Filme durch das Schreiben von Frontend-Code erstellt

Veröffentlicht 10. Okt. 2026
Vibe Video: Das Coding-Modell, das Filme durch das Schreiben von Frontend-Code erstellt

Im vergangenen Monat wurde das weltweit meistdiskutierte KI-Video nicht von einem Videomodell erstellt. Es wurde von einem Coding-Modell erstellt, das so lange Frontend-Code schrieb, bis eine Animation entstand.

Die Clips stammten von Claude Opus 5.5. In einem viel geteilten Fall nutzte ein Creator einen Referenz-Prompt, Zugang zu Midjourney und ein Moodboard, um in etwa zwölf Stunden einen cineastischen dystopischen Kurzfilm zu produzieren. Der Beitrag überschritt 20 Millionen Aufrufe. Ein anderer Creator erzeugte mit einer einzigen Anweisung ein Stück über die Geschichte der Zivilisation von zwei Minuten und sechzehn Sekunden; es erreichte in zwei Tagen zehn Millionen Aufrufe. Eine GitHub-Sammlung von Opus-5.5-Videos hat mehr als 400 Einträge gesammelt, die meisten mit öffentlichen Prompts und Code.

Die Leute begannen, es Vibe Video zu nennen. Der Name ist unbeholfen, aber die Technik ist es wert, verstanden zu werden, denn sie ist ein wirklich anderer Weg zu bewegten Bildern als der, den alle anderen gehen.

Code als Rendering-Engine

Die übliche KI-Video-Pipeline ist ein Diffusionsmodell, das Pixel vorhersagt. Man gibt ihm einen Prompt oder ein Standbild, und es liefert Frames zurück. Das Modell wird auf Video trainiert, und sein Gespür für Bewegung wird aus diesen Daten gelernt.

Code-Rendering funktioniert anders. Ein Sprachmodell schreibt HTML, CSS, SVG oder JavaScript, das eine Animation zeichnet, und ein Browser rendert sie. Nichts wird Frame für Frame vorhergesagt. Die Bewegung kommt von Code, der Position, Timing und Easing explizit beschreibt.

Dieser Unterschied ist wichtig, weil er einige Dinge einfach macht, die Diffusion schwer findet. Präzise Grafiken, Typografie, Diagramme, geometrische Bewegung und Übergänge zwischen Bildschirmen sind trivial, wenn sie Code sind. Genau diese Dinge kommen aus einem Videomodell unscharf heraus. Der Preis dafür ist, dass Code-Rendering kein fotorealistisches menschliches Gesicht in Bewegung erzeugen kann. Es zeichnet, was Code beschreiben kann.

Ein Code-Editor-Panel auf der linken Seite, das rechts einen gestochen scharfen Animationsframe speist

Warum Creator sich darauf stürzten

Zwei Eigenschaften erklären die Begeisterung. Die erste ist Reproduzierbarkeit. Ein Diffusionsclip ist eine Stichprobe; wenn man ihn erneut ausführt, bekommt man einen Cousin, keinen Zwilling. Eine codierte Animation ist ein Programm. Ändere einen Wert, und du weißt, was passiert. Das macht Überarbeitung billig, und Überarbeitung ist der Ort, an dem die meiste Arbeit tatsächlich stattfindet.

Die zweite ist, dass die Ausgabe bereits in einem Format vorliegt, das der Rest eines Workflows nutzen kann. Eine Browser-Animation kann aufgezeichnet, in eine Website eingebettet oder an eine Datenquelle angebunden werden. Sie sitzt natürlich in einer Produktseite oder einem Dashboard, und genau daher kommt ein Großteil der kommerziellen Nachfrage nach Bewegung.

Es gibt auch einen angebotsseitigen Grund. Claude Opus 5.5 wurde am 22. September mit einer 230-seitigen System Card und API-Preisen von vier Dollar pro Million Input-Tokens und zwanzig pro Million Output-Tokens eingeführt. Bei den meisten Aufgaben erreichte es Benchmarks nahe dem vorherigen Flaggschiff zu deutlich niedrigeren Kosten. Günstigere Frontier-Modelle machen lange, iterative Code-Generierung für Einzelpersonen praktikabel, und genau das erfordern die Zwölf-Stunden-Builds tatsächlich.

Die andere Spur

In derselben Woche bewegte sich ein anderes allgemeines Modell aus einer anderen Richtung in den Videobereich. GPT-6 Astra soll als eine Art KI-Regisseur fungieren, Storyboard-Planung und White-Model-Previsualisierung übernehmen und in Blender, Unreal Engine und DaVinci Resolve hineinreichen, um Szenen zu bauen, Shots zu blocken und Schnitte zu erledigen.

Fügt man die beiden zusammen, zeigt sich ein Muster. Allzweckmodelle versuchen nicht, Seedance, Kling oder MiniMax bei fotorealistischer Bewegung zu schlagen. Sie bewegen sich stromaufwärts, in die Planung und die Produktionspipeline, und seitwärts, in Bewegung, die programmatisch statt fotografisch ist. Das lässt den spezialisierten Videomodellen die Aufgabe, weiter auf Realismus zu drängen, während die allgemeinen Modelle die Teile des Prozesses übernehmen, die wie Software aussehen.

Wie der Workflow tatsächlich abläuft

Der Prozess, den die Creator mit guten Ergebnissen beschreiben, ähnelt eher Softwareentwicklung als Filmemachen. Man schreibt einen Prompt, der die Stimmung und die Einschränkungen festlegt, das Modell erzeugt Code, der Code wird im Browser gerendert, und man schaut sich das Ergebnis an. Dann ändert man eine Sache und führt es erneut aus. Die Schleife ist kurz und die Ausgabe ist inspizierbar, weshalb Zwölf-Stunden-Builds überhaupt möglich sind. Zwölf Stunden damit, einem Videomodell einen Absatz zu übergeben, würden Rauschen erzeugen. Zwölf Stunden Code-Bearbeitung ergeben ein fertiges Stück.

Das Moodboard und das Referenzmodell sind aus einem Grund wichtig, der nichts mit Komposition zu tun hat. Sie geben den Standbildern eine konsistente Farbpalette und ein konsistentes Motiv, sodass die Teile, wenn der Code sie platziert und um sie herum animiert, so aussehen, als gehörten sie zu einem Film. Der Code liefert die Bewegung und die Typografie. Die Standbilder liefern die Welt. Keine der beiden Hälften funktioniert ohne die andere.

Wo die Kosten wirklich landen

Es ist verlockend zu glauben, code-gerendertes Video sei kostenlos, weil das Rendering in einem Browser auf dem eigenen Rechner stattfindet. Die Modellaufrufe sind nicht kostenlos, und die Schleife ist lang. Jede Umschreibung ist eine bezahlte Anfrage, und ein Stück mit Hunderten von Änderungen sind Hunderte von Anfragen mit einem großen Kontext. Die Preissenkung von Anthropic auf vier Dollar pro Million Input-Tokens machte diese Schleife für Einzelpersonen statt nur für Studios erschwinglich. Je günstiger das Modell, desto freier kann ein Creator iterieren, und Iteration ist die gesamte Methode.

Das hat eine seltsame Konsequenz. Der Engpass für diesen Stil ist nicht Rechenleistung für das Rendering. Es ist die Überprüfung. Jemand muss jedes Rendering ansehen und entscheiden, was geändert wird, und diese Aufmerksamkeit skaliert nicht mit einem niedrigeren API-Preis. Die Creator, die mit Vibe Video Erfolg haben, sind funktional Regisseure, die auf Rushes starren und Notizen geben, außer dass die Notizen in einen Diff gehen.

Code-Rendering und generiertes Video, Seite an Seite

Es hilft, präzise zu sein, welcher Stil was leistet. Code-Rendering ist reproduzierbar, billig zu überarbeiten, scharf bei Grafiken und Text und fühlt sich bei Daten wohl. Es kann keinen fotorealistischen Schauspieler, keine Menge und keinen ungestellten Moment erzeugen. Diffusionsvideo kann das gut und behandelt alles andere als Annäherung. Ein von einem Videomodell gerendertes Logo kommt fast richtig heraus. Ein von Code gerendertes Logo ist exakt.

Diese Aufteilung deutet darauf hin, dass die beiden eher zusammenleben als konkurrieren werden. Ein Stück könnte mit einem generierten Establishing Shot eröffnen, zu einem codierten animierten Diagramm schneiden und mit generiertem Material schließen. Die interessante kreative Frage ist nicht mehr, welches Tool verwendet wird, sondern wo gewechselt wird. Die Teams, die diese Nahtstellen herausfinden, werden Arbeit machen, die bewusst wirkt.

Wo es nicht funktioniert

Code-Rendering ist kein Ersatz für Videogenerierung, und es als solchen zu behandeln, wird Menschen enttäuschen. Es kann keinen Schauspieler filmen. Es kann keinen dokumentarischen Frame oder eine glaubwürdige Menge erzeugen. Es ist stark bei Design, abstrakter Bewegung, Information und Interface und schwach bei allem, was aussehen muss, als wäre eine Kamera dort gewesen.

Es hat außerdem ein Kostenprofil, über das niemand spricht. Man kann viele Modell-Tokens verbrennen, bevor ein einzelner Frame richtig aussieht, denn die Schleife lautet: schreiben, rendern, prüfen, umschreiben. Günstigere Modelle senken diese Kosten, aber sie beseitigen sie nicht. Die Creator, die die beeindruckenden Ergebnisse erzielen, prompten nicht nur; sie überprüfen Code.

Was es uns über das Feld verrät

Das Interessante an Vibe Video ist nicht, dass ein Coding-Modell einen schönen Clip machen kann. Es ist, dass die Grenze zwischen „Videogenerierung“ und „Software, die Dinge in Bewegung bringt“ weicher ist als allgemein angenommen. Wenn ein Sprachmodell die Animation direkt schreiben kann, wird ein Teil der Nachfrage nach generativem Video stattdessen durch Code beantwortet.

Für Menschen, die Visuals erstellen, lautet die praktische Frage nicht mehr, ob sie ein Tool wählen sollen. Sie lautet, welche Teile eines Stücks am besten durch einen vorhergesagten Frame und welche am besten durch einen geschriebenen bedient werden. Die Teams, die das jetzt herausfinden, sind diejenigen, deren Arbeit bewusst statt bloß generiert wirken wird.

Verwandte Artikel