Agenten begannen diese Woche, Kurzfilme zu inszenieren. Der Engpass verlagerte sich zur Qualitätskontrolle.

Ein Entwickler gab am 5. Oktober bekannt, dass ein animierter Kurzfilm namens The Clockwork Moth vollständig von einer Pipeline aus 14 Agenten produziert wurde, die auf einer einzelnen RTX 5090 lief. Etwa zehn Minuten Pipeline-Zeit deckten 106 Einstellungen in neun Szenen ab, mit 19 Szenenzuständen für vier wiederkehrende Figuren. Automatisierte QA bestand 102 von 102 Prüfungen. Das Asset-Bundle umfasste 2,4 GB. Die Toolchain wurde nicht offengelegt.
Der interessante Teil hat wenig mit der Laufzeit zu tun. Auffällig ist, wo der Entwickler die schwierigen Probleme verortete: die Identität von Figuren über Einstellungen hinweg konsistent zu halten und die Qualitätskontrolle zu automatisieren. Nicht das erste Bild.
Dieses Urteil deckt sich mit einem zweiten Projekt aus derselben Woche. Ein Reddit-Nutzer veröffentlichte DOGNAPPED, eine drei Minuten lange Komödie mit sprechenden Hunden, die fast vollständig von Claude erstellt wurde, indem Claude Code in einem ComfyUI-Setup lief, das auf Open-Source-Video-Builder-Nodes basierte. Der Mensch steuerte das Briefing, Referenzfotos von zwei echten Hunden und das Tooling bei. Claude schrieb die Geschichte, erfand eine dritte Hunde-Figur, erzeugte Orts- und Figurenreferenzen, schrieb ein Drehbuch mit 22 Szenen samt Einstellungsanweisungen, rendierte jede Szene über MiniMax H3 für Video, Stimmen und Soundeffekte, komponierte die Musik mit MiniMax Music 3 und schnitt den Film. Das Rendering dauerte ungefähr viereinhalb Stunden.
Dann führte das Modell seine eigenen Nachdrehs durch. Die QA-Schleife transkribierte jede Zeile und glich sie mit dem Drehbuch ab, prüfte die Tonhöhe der Stimmen, begutachtete Frames und Schnitte und führte framegenaue Audio-Video-Synchronprüfungen durch. Wo Welpen brabbelten oder Hunde in die Kamera starrten, wurden die Szenen neu gedreht.

Warum die QA-Schleife die eigentliche Geschichte ist
Eine einzelne überzeugende Einstellung zu generieren, ist ein ausreichend gelöstes Problem, sodass Demos Routine sind. 106 davon so zusammenzusetzen, dass dieselbe Figur in allen wie dieselbe Figur aussieht, ist es nicht.
Identitätsdrift ist der Fehlermodus, der langformatiges KI-Video zunichtemacht. Ein Modell, das eine Figur isoliert gut rendert, wird über Einstellungen hinweg trotzdem ein Gesicht, ein Kostüm oder den Haaransatz verändern, weil jede Generierung eine neue Ziehung aus einer Verteilung ist. Die üblichen Korrekturen sind Referenzkonditionierung, auf eine bestimmte Figur trainierte LoRAs und manuelle Auswahl. Alle fügen menschliche Arbeit genau an dem Punkt hinzu, an dem die Pipeline sie eigentlich entfernen soll.
Automatisierte QA ist die andere Hälfte. Eine Pipeline, die Filmmaterial produziert, aber guten Output nicht von schlechtem unterscheiden kann, verlagert die Prüflast auf eine Person, und eine Person, die hundert Einstellungen prüft, ist genau der Engpass, den der gesamte Ansatz beseitigen sollte. Der DOGNAPPED-Workflow löste dies, indem er das Drehbuch in ein Verifikations-Orakel verwandelte: jede Zeile transkribieren, mit dem Geschriebenen vergleichen, Tonhöhe prüfen, Sync prüfen, Fehler markieren, neu rendern. Das ist eine programmatische Definition von „akzeptabel“, die keinen Menschen erfordert, der alles ansieht.
Das Muster über die Woche
Mehrere Projekte landeten bei derselben Form. Ein Nutzer mit dem Handle konte machte Claude Code zum Executive Producer und generierte ein zwei Minuten und vierundfünfzig Sekunden langes Musikvideo auf einer einzelnen RTX 5090: 61 Einstellungen, 342 Aufgaben, etwa zwei Stunden menschliche Beteiligung und etwa viereinhalb Stunden Generierung. Die Einstellungen wurden auf Tempo und Beats des Songs geschrieben, sodass die Schnitte auf der Musik landeten.
Ein anderer Weg übersprang Text-zu-Video vollständig. Claude Opus 5.5 schrieb Code für jedes Einzelbild und jedes Musikstück und erzeugte einen Kurzfilm namens I Have Never Seen the Sun, wobei die Prompts als drei- bis fünfminütiges, für Festivals gedachtes Werk formuliert waren.
Dieser letzte Ansatz verweist auf eine echte Spaltung im Feld. Codegenerierte Bewegung ist deterministisch. Wenn Frame 420 falsch aussieht, ändert man den Code und rendert Frame 420 neu. Diffusionsvideo ist stochastisch. Wenn eine Einstellung falsch ist, würfelt man neu und hofft. Für gestaltete Bewegung wie kinetische Typografie, UI-Animationen, Diagramme und Logo-Reveals ist der deterministische Weg stärker. Für fotorealistische Menschen, organisches Schauspiel und reale Physik gewinnen Diffusionsmodelle weiterhin, weil Code nicht simulieren kann, was er nie modelliert hat.
Das Tooling hinter dem Wandel
Der rote Faden über diese Projekte hinweg ist ein Coding-Agent, der in eine Generierungspipeline eingebunden ist. Video-Builder-Nodes, benutzerdefinierte ComfyUI-Graphen und Agent-Skills, die offene Modelle über eine API aufrufen, geben einem Sprachmodell denselben Zugriff auf Rendering, den ein Entwickler hätte. Das Modell muss selbst kein Videomodell sein. Es muss in der Lage sein, den Code zu schreiben und auszuführen, der ein solches steuert.
Deshalb sieht das Kostenprofil so aus, wie es aussieht. In einer veröffentlichten Session fütterte ein Creator Claude Opus 5.5 mit mehr als 7.000 Midjourney-Bildern und einem Suno-Track und ließ eine autonome kreative Session laufen, die etwa zwei Stunden dauerte und ungefähr 6,80 US-Dollar kostete. Im DOGNAPPED-Projekt waren die dominanten Kosten lokale Renderzeit und nicht API-Aufrufe. Wenn die Basismodelle Open Weight sind und die Orchestrierung aus Code besteht, kollabieren die Grenzkosten eines Experiments.
Es gibt einen Effekt zweiter Ordnung auf Fähigkeiten. Die Arbeit, die für einen Menschen übrig bleibt, hat sich davon weg verlagert, eine Timeline zu bedienen oder einen Render zu beäugen, und hin dazu, das Briefing so präzise zu spezifizieren, dass ein automatisierter Prüfer entscheiden kann, ob der Output es erfüllt hat. Jedes Projekt, das diese Woche ausgeliefert wurde, kodiert seine Akzeptanzkriterien irgendwo, weil eine Pipeline nicht auf „mach es besser“ iterieren kann.
Was noch immer nicht funktioniert
Die Demos sind ehrlich über ihre Grenzen, und die Grenzen sind konsistent. Figurenidentität hält über eine Handvoll Einstellungen und driftet über Dutzende, weshalb Referenzkonditionierung und Adapter pro Figur Standard sind. Langhorizont-Struktur ist brüchig: Ein Film, der dreißig Sekunden lang kohärent aussieht, kann bis Minute drei seine räumliche oder zeitliche Konsistenz verlieren. Und automatisierte QA kann nur prüfen, was ihr zu prüfen aufgetragen wurde, das heißt, eine Pipeline, die Dialog und Sync verifiziert, wird eine Szene mit einem Kontinuitätsfehler problemlos durchwinken, für den niemand eine Prüfung geschrieben hat.
Diese Einschränkungen erklären, warum die Projekte, die diese Woche ausgeliefert wurden, Kurzfilme waren. Eine drei Minuten lange Komödie mit kleinem Cast und einfachen Schauplätzen ist ein handhabbares Problem. Ein Spielfilm mit Dutzenden Figuren, wechselnder Garderobe und komplexer Inszenierung ist es nicht, zumindest noch nicht, ohne dass ein Mensch weit mehr des Outputs prüft, als die Automatisierung einsparen sollte.
Was das für Produktionsbudgets ändert
Die Ökonomie verschiebt sich auf eine bestimmte Weise. Wenn ein Kurzfilm ein paar Dollar Compute und einen Nachmittag Orchestrierung kostet, ist die Einschränkung nicht mehr Geld, sondern die Klarheit des Briefings. Der menschliche Beitrag, der überlebt, ist zu wissen, was man will, und es präzise genug sagen zu können, dass ein Agent es verifizieren kann.
Das wirft auch eine Governance-Frage auf. Ein Agent, der ein Drehbuch schreibt, es rendert, seinen eigenen Output bewertet und Fehlschläge neu dreht, trifft kreative Entscheidungen ohne einen Menschen im Loop. Die QA-Schleife macht den Output zuverlässiger, und sie bedeutet auch, dass die eigenen Standards des Modells definieren, wie „fertig“ aussieht.
Die Projekte dieser Woche sind Demos, und ihre Toolchains sind teilweise nicht offengelegt. Aber die Richtung ist konsistent. Generierung ist billig, Orchestrierung ist das Produkt, und was entscheidet, ob eine Pipeline nützlich ist, ist, ob sie erkennen kann, wann sie versagt hat.
Verwandte Artikel
BOSSFIGHT ließ Frontier-Modelle 24 Wochen lang als Cafébesitzer antreten. Die meisten verloren gegen Nichtstun.
Eine Bestechung in einem Quiz abzulehnen und sich in einem laufenden Quartal nicht verbiegen zu lassen, sind zwei verschiedene Fähigkeiten, und aktuelle Evaluationen neigen dazu, die einfachere zu messen.
NASA und IBM haben ein lunares Foundation-Modell als Open Source veröffentlicht, das mit 17 Jahren Orbiter-Daten trainiert wurde
Das Modell ist nützlich, um Merkmale zu finden und zu charakterisieren, und unzuverlässig, wenn es darum geht, mit hoher Präzision genau anzugeben, wo sie sich befinden.
Vier Schritte statt vierzig: Wie Destillation offene Bildmodelle auf Consumer-GPUs quetscht
Low-Step-Destillation ist ein Kompromiss, kein kostenloses Mittagessen. Texttreue, Bearbeitungspräzision und Multi-Referenz-Konsistenz leiden zuerst.
Reka Rho-1 vereint Verständnis und Generierung im selben KV-Cache
Dieselben Gewichte, die ein Kamerabild vorhersagen, steuern auch die Roboterbewegung, weil beide im selben Repräsentationsraum leben.