← Zurück zum Blog
Aica. 7 Min. Lesezeit

Die Zwei-Frame-Methode: Wie First- und Last-Frame-Interpolation die KI-Videoplanung verändert hat

Veröffentlicht 10. Okt. 2026
Die Zwei-Frame-Methode: Wie First- und Last-Frame-Interpolation die KI-Videoplanung verändert hat

Google hat die First- und Last-Frame-to-Video-Funktion von Veo 3.1 am 9. Oktober aktualisiert. Du lädst zwei Standbilder hoch, den Startframe und den Endframe, und das Modell erzeugt die Bewegung dazwischen. Die Ausgabe geht bis zu 4K bei 60 fps mit nativem Audio, unterstützt 9:16 vertikal und akzeptiert drei oder vier Referenzbilder, um Charaktere und Stil konsistent zu halten.

Für sich genommen klingt das nach einer kleinen Ergänzung. In der Praxis verändert es, wie Menschen eine Einstellung planen, denn es stellt die zwei Entscheidungen, auf die es wirklich ankommt, wieder an den Anfang des Prozesses.

Das Problem mit reinen Prompt-Videos

In den meisten der letzten zwei Jahre funktionierte KI-Video wie ein Spielautomat. Man schrieb einen Absatz, wartete und sah zu, was herauskam. Das Ergebnis war oft gut genug zum Posten und selten gut genug, um verwendet zu werden. Wenn die Figur abdriftete oder die Kamera etwas Seltsames tat, schrieb man den Prompt neu und versuchte es erneut.

Creator lernten, das zu umgehen. Sie generierten ein starkes Standbild und ließen es dann von einem Modell animieren, also Image-to-Video. Das fixierte den Startframe, aber niemand kontrollierte, wo die Einstellung endete. Clips verloren entweder die Energie oder erfanden ein Ende, nach dem niemand gefragt hatte.

Beide Enden zu definieren, nimmt einen Teil dieses Rätselratens heraus. Du entscheidest, wo das Publikum zu schauen beginnt und wo es zu schauen aufhört. Die Aufgabe des Modells ist enger: die beiden zu verbinden.

Warum Storyboard-Denken zurückkam

Animationsstudios arbeiten seit einem Jahrhundert so. Ein Animator zeichnet eine Schlüsselpose, dann eine weitere Schlüsselpose, und füllt die Zeichnungen dazwischen. Die Kunst liegt darin, die Posen auszuwählen, nicht darin, jedes Einzelbild zu zeichnen. KI-Video erreicht dieselbe Arbeitsteilung auf einem anderen Weg.

Das ist nicht auf Veo beschränkt. Das Rennen um Kontrollierbarkeit läuft seit Monaten. Kling 4.0 erschien mit zehn Keyframes und 30-sekündigen nativen Clips. Seedance 2.5 kann vorhandenes Material aus einem neuen Kamerawinkel neu drehen. Wan 3.0 setzte sich mit einem Elo von 1157 bei etwa 12 US-Dollar pro Minute an die Spitze des AA-Video-T2V-v2.0-Benchmarks von Artificial Analysis. Vidus Q4-Vorschau, veröffentlicht am 7. Oktober, startet bei etwa 0,014 US-Dollar pro Sekunde und akzeptiert bis zu 15 Bildreferenzen. Was die stärksten Modelle gemeinsam haben, hat weniger mit Rohqualität zu tun und mehr damit, wie präzise man sie steuern kann.

Eine Zeitachse mit zwei Keyframes, die durch einen leuchtenden Bewegungsbogen verbunden sind

Wie ein funktionierender Aufbau aussieht

Die Zwei-Frame-Methode zahlt sich nur aus, wenn die beiden Frames es wert sind, verbunden zu werden. Ein paar Gewohnheiten helfen.

Generiere die Frames mit einem Bildmodell statt mit einem Screenshot aus einem früheren Clip. Du willst an beiden Enden Kontrolle über Komposition, Licht und Garderobe. Googles Veo akzeptiert Referenzbilder genau deshalb, damit ein Gesicht oder ein Produkt den Übergang übersteht, und das funktioniert nur, wenn die Referenzen von Anfang an konsistent sind.

Halte die Kamerabewegung einfach. Die Interpolation meistert einen Push-in, einen Pull-back, eine Enthüllung oder eine langsame Drift gut. Sie tut sich schwer, wenn du einen harten Schnitt innerhalb eines einzelnen Clips verlangst, denn es gibt keinen Schnitt zu interpolieren. Wenn eine Einstellung einen Schnitt braucht, mache zwei Clips.

Passe den Audio-Plan an die Einstellung an. Veo 3.1 synthetisiert natives Audio, was für Umgebungsgeräusche und einfache Effekte nützlich ist. Wenn die Szene eine bestimmte Dialogzeile oder einen lizenzierten Track braucht, plane, ihn danach hinzuzufügen, statt gegen den generierten Ton anzukämpfen.

Reserviere die Methode für Einstellungen, die einen Story-Beat tragen. Es gibt keinen Grund, zwei gut gebaute Frames für einen zwei Sekunden langen Übergang auszugeben. Setze sie dort ein, wo das Publikum die Veränderung bemerken soll.

Was zwei zusätzliche Frames tatsächlich kosten

Die Planung in Frames ist eine Entscheidung mit Preisschild, und der Preis ist heute leichter zu lesen als noch vor einem Jahr. Der Videomarkt ist bei den Kosten pro Sekunde nach unten gerast. Vidus Q4-Vorschau, veröffentlicht am 7. Oktober, startet bei etwa 0,014 US-Dollar pro Sekunde und akzeptiert bis zu fünfzehn Bildreferenzen. xAIs Grok Imagine Video 1.5 Lite, am 8. Oktober in die API aufgenommen, wird mit 0,02 US-Dollar pro Sekunde bei 480p gelistet und steigt bei 1080p auf 0,14 US-Dollar. HeyGens neues allgemeines Videomodell startete im Oktober mit einem Aktionspreis von einem Cent pro Sekunde. Wan 3.0, das mit einem Elo von 1157 den Spitzenplatz im Video-Benchmark von Artificial Analysis belegte, wird mit etwa 12 US-Dollar pro Minute gelistet, was zwanzig Cent pro Sekunde entspricht.

Daraus folgen zwei Dinge. Erstens ist die Generierung selbst heute selten der teure Teil. Ein paar Sekunden interpolierter Bewegung kosten Cent, nicht Dollar. Zweitens sind die knappe Ressource die Frames. Zwei starke Standbilder zu generieren und auszuwählen kostet die Zeit eines Menschen, und diese Zeit wird nicht billiger, wenn die API billiger wird. Die Ökonomie belohnt Planung, nicht Volumen, was das Gegenteil davon ist, wie reine Prompt-Tools Menschen antrainiert haben, sich zu verhalten.

Ein Workflow, der bei einem echten Job standhält

Hier ist, wie die Methode in eine kleine Produktion passt, ohne alles zu verändern. Beginne mit dem Konzept und entscheide den einen Beat, den die Einstellung treffen muss. Baue den Startframe und den Endframe als Bilder, mit denselben Referenzen, damit Gesichter, Garderobe und Requisiten zusammenpassen. Generiere die Interpolation und sieh sie dir einmal für die Struktur und einmal für die Details an. Wenn die Bewegung falsch verläuft, korrigiere die Frames statt den Prompt, denn die Frames sind das, was das Modell tatsächlich liest. Füge Audio hinzu oder ersetze es je nach Einstellung. Schneide sie dann in die Sequenz ein und beurteile sie im Kontext, denn ein Clip, der allein beeindruckend aussieht, kann neben seinen Nachbarn trotzdem langsam wirken.

Die Disziplin hierbei ist, dass jede Korrektur eine Entscheidung über die Geschichte ist, kein Würfelwurf. Das ist der Teil, den Menschen übersehen, wenn sie die Funktion zum ersten Mal ausprobieren. Sie fühlt sich wie eine Abkürzung an, stellt aber still und leise die Vorproduktion wieder her, die die erste Generation von KI-Video-Tools Menschen überspringen ließ.

Wo eine normale Kamera weiterhin gewinnt

Nichts davon besagt, dass Drehen überflüssig ist. Die Interpolation ist am stärksten, wenn die beiden Enden stark und die Bewegung dazwischen einfach ist, was viele Produktaufnahmen, Übergänge, Titelbilder und atmosphärische Establishing-Frames abdeckt. Am schwächsten ist sie, wenn die Realität etwas Bestimmtes und Unvorhersehbares tut: ein echtes Pferd im vollen Galopp, eine reagierende Menge, Essen, das so zubereitet wird, dass es echt wirken muss. Für solche Fälle beendet eine Kamera plus ein kompetenter Editor die Diskussion.

Die ehrlichen Grenzen

Interpolation bleibt Interpolation. Wenn die beiden Frames ein physisch kompliziertes Dazwischen implizieren, etwa eine Person, die sich einmal ganz herumdreht, oder eine Flüssigkeit, die ihre Form ändert, erfindet das Modell etwas, und es wird nicht immer richtig sein. Halte die implizierte Bewegung im Rahmen dessen, was eine Kamera plausibel aufnehmen könnte.

Es treibt außerdem die Kosten nach oben. Zwei ausgefeilte Standbilder plus ein generierter Clip sind mehr Arbeit als ein Prompt. Bei den aktuellen Preisen pro Sekunde auf dem Markt ist das erschwinglicher als noch vor einem Jahr, aber die Planungszeit ist real. Die Methode belohnt Menschen, die bereits in Einstellungen denken.

Und für die Mitte gibt es weiterhin keine Garantie. Was die Funktion wirklich verkauft, ist ein kleinerer Suchraum, kein gelöstes Problem. Das ist ein bedeutender Schritt. Er bedeutet, dass der Unterschied zwischen einem brauchbaren und einem einprägsamen Clip jetzt vor allem von den Frames abhängt, die du auswählst, und das ist eine Entscheidung, die ein Mensch trifft.

Worauf man als Nächstes achten sollte

Erwarte, dass sich dasselbe Muster verbreitet. Sobald ein großes Modell Frames als primäre Eingabe behandelt, folgen Wettbewerber in der Regel, und die interessante Frage wird, wessen Interpolation an den Übergängen am natürlichsten aussieht. Achte auf Tools, mit denen du einen mittleren Keyframe hinzufügen kannst, was Regisseuren einen dritten Anker gäbe, ohne die Timeline zu verlassen.

Für den Moment ist die praktische Erkenntnis wenig glamourös. Wenn du KI-Videos machst, höre auf, den Prompt als den wichtigsten kreativen Akt zu behandeln. Baue zuerst die Frames, wähle die beiden aus, die die Geschichte erzählen, und lass das Modell die Reise dazwischen übernehmen.

Verwandte Artikel