Gemini Omni 1.1 Flash verkettete vier Anfragen zu einer 40-Sekunden-Aufnahme. Der Workflow ist das Produkt.

Googles Gemini Omni 1.1 Flash ist ein seltsames Produkt zu bewerten, denn das Modell selbst ist nicht neu. Es erreichte die allgemeine Verfügbarkeit am 27. August 2026 unter der ID gemini-omni-1.1-flash, und der ältere Preview-Endpunkt wurde am 30. September eingestellt. Alles rund um die Generierung hat sich geändert; die Generierungsqualität ist weitgehend dort geblieben, wo sie war.
Die Funktionsliste liest sich wie eine Produktions-Checkliste. Die Szenenerweiterung analysiert jetzt bis zu zehn Sekunden vorherigen Kontext, was Google als Sprung gegenüber früheren Modellen beschreibt, die nur die letzte Sekunde referenzierten. Videos werden in Zehn-Sekunden-Schritten bis zu einer kumulativen Obergrenze von vierzig Sekunden erweitert. Die Steuerung von erstem und letztem Frame ermöglicht Entwicklern, beide Enden einer Aufnahme festzulegen und die Bewegung dazwischen zu generieren, ausgerichtet auf Kameraumkreisungen, Zoom-Übergänge und Loops ohne sichtbare Naht. Ein 360p-Entwurfsmodus generiert bis zu 60 Prozent schneller zu einem Drittel der Kosten von Standard-720p. Die endgültige Ausgabe wird auf 1080p oder 4K hochskaliert. Bis zu drei Sekunden Video können als Referenzmaterial für Konsistenz von Charakter und Szene bereitgestellt werden.
Lesen Sie die Erweiterungsfunktion sorgfältig, denn das Marketing rundet sie ab. Ein vierzigsekündiger Omni-Clip sind vier verkettete Anfragen, von denen jede die letzten zehn Sekunden als Kontext verwendet, und nicht ein einzelner vierzigsekündiger Durchlauf. Einzelne Generierungen liegen weiterhin zwischen drei und zehn Sekunden. Dieser Unterschied ist wichtig für alle, die Latenz und Inferenzkosten gegen ein Lieferergebnis kalkulieren, und es ist die Art von Detail, die entscheidet, ob eine vierzigsekündige Aufnahme praktikabel oder bloß möglich ist.

Die Preisgestaltung ist darauf ausgelegt, Sie zum Iterieren zu bringen
Googles Preisstruktur belohnt das Entwerfen. Die API-Preise liegen bei 1,50 $ pro Million Eingabe-Tokens und 17,50 $ pro Million Video-Ausgabe-Tokens, abgerechnet mit 5.792 Tokens pro Sekunde 720p-Video, was ungefähr 0,10 $ pro Sekunde oder 6 $ pro Minute entspricht. Pro zehnsekündigem Clip geht die Tarifleiter von etwa 0,30 $ bei 360p über 1,00 $ bei 720p und 1,50 $ bei 1080p bis zu 3,00 $ bei 4K.
Dieser Gradient ist nicht zufällig. Der Unterschied zwischen einem 360p-Entwurf und einem 4K-Master beträgt eine Größenordnung, was Teams zu einer Arbeitsweise drängt, bei der man kostengünstig in einer niedrig aufgelösten Stufe iteriert und nur für den finalen Take bezahlt. Vergleichen Sie das mit der Gewohnheit, die die meisten an die Videogenerierung herangebracht haben: einen Prompt schreiben, warten, das Ergebnis ansehen, den Prompt umschreiben und für jeden Würfelwurf den vollen Preis bezahlen. Google preist das zweite Verhalten aus dem Workflow heraus.
Vergleichen Sie auch die Oberflächen, denn die Verteilung ist ungleichmäßig. Google rahmt das vollständige Funktionsset als entwicklerorientiert und API-verfügbar: Fünf Funktionen werden für Entwickler über AI Studio, die Gemini API und die Gemini Enterprise Agent Platform bereitgestellt, während der Consumer-Rollout in der Gemini-App nur auf Szenenerweiterung beschränkt ist. Dasselbe Modell steckt in Google Flow für AI-Plus-, Pro- und Ultra-Abonnenten, und es ist kostenlos in YouTube Shorts Remix und der YouTube Create App. Ein Modell, fünf Zugriffsstufen, von denen vier nicht die interessanten Funktionen erhalten.
Die Arithmetik einer vierzigsekündigen Aufnahme
Verkettete Erweiterung verändert, was eine Aufnahme kostet, und die Veränderung ist nicht linear.
Eine einzelne drei- bis zehnsekündige Generierung ist günstig und schnell. Eine vierzigsekündige Sequenz besteht aus vier Anfragen in Serie, und jede einzelne kann unabhängig fehlschlagen. Wenn Anfrage drei einen Take erzeugt, der die Kontinuität bricht, generieren Sie nicht vierzig Sekunden neu. Sie generieren ab dem ersten Frame des defekten Segments neu, verketten dann alles danach erneut, und die Kosten eines Fehlers vervielfachen sich mit der Position in der Sequenz. Die ersten zehn Sekunden sind günstig zu wiederholen. Die letzten zehn Sekunden sind teuer, denn sie neu zu machen bedeutet, alles, was ihnen nachgelagert ist, neu zu machen.
Das ist das praktische Argument für die Keyframe-Steuerung. Ein Start- und Endframe festlegen zu können, verwandelt jedes Segment in ein begrenztes Problem mit einem Verifikationsschritt an beiden Enden. Statt eine ganze Sequenz zu beurteilen, indem man sie ansieht und hofft, dass die Kontinuität gehalten hat, kann ein Team prüfen, ob das Segment auf dem Frame gelandet ist, auf dem es landen sollte. Für eine Kameraumkreisung oder einen Zoom-Übergang ist das eine weitaus besser testbare Arbeitseinheit als ein freier Prompt.
Die 360p-Entwurfsstufe passt zur selben Logik. Das Prototyping einer vierzigsekündigen Sequenz für ungefähr einen Dollar statt sechs Dollar macht Iteration erschwinglich, und das Upscaling auf 1080p oder 4K wird zu einem separaten, bewussten Schritt. Was Google effektiv ausgeliefert hat, ist eine Produktionspipeline mit einem Review-Gate, das in die Preisgestaltung eingebaut ist.
Was die Benchmarks jetzt sagen
Gemini Omni 1.1 Flash führt Arenas Text-to-Video-Board mit 1516 an, knapp vor seinem eigenen Vorgänger Gemini Omni Flash mit 1513, und Arenas eigene Rangspanne für das neuere Modell reicht von eins bis vier, was eine höfliche Art zu sagen ist, dass die beiden innerhalb des Konfidenzintervalls gleichauf liegen.
Das Leaderboard-Bild anderswo ist weniger schmeichelhaft, als die Launch-Berichterstattung implizierte. Das Modell räumte bis Mitte Juli 2026 alle vier Artificial-Analysis-Boards ab. Dieser Sweep ist vorbei. Auf dem neu aufgebauten Text-to-Video-Board liegt Gemini Omni Flash 1.1 Anfang Oktober mit Audio auf Platz acht und ohne Audio auf Platz acht, und auf Arenas Image-to-Video-Board läuft es auf Platz zwei hinter MiniMax H3. Artificial Analysis hat 1.1 Flash nicht direkt auf seinem Text-to-Video-Board bewertet, wo das ältere Flash-Modell führt und Alibabas Wan 3.0 und MiniMax H3 dicht dahinter liegen.
Das ist ein normales Ergebnis in einer sich schnell bewegenden Kategorie, und es untergräbt die Workflow-Ergänzungen nicht. Es bedeutet jedoch, dass die ehrliche Einordnung dieses Releases ist, dass Google eher über Kontrollierbarkeit und Preisstufen als über rohe Ausgabequalität konkurriert, und das Leaderboard ist nicht mehr der Ort, an dem es gewinnt.
Zwei Dinge, die das Release nicht behebt
Native synchronisiertes Audio ist nicht bestätigt. Googles Launch-Materialien beschreiben keine Soundtrack-Generierung zusammen mit Video, und Audioausgabe wird als in späteren Releases kommend aufgeführt. Audioeingabe ist zum Start auf Stimmreferenzen beschränkt. Für eine Any-to-Any-Modellfamilie mit diesem Namen ist die fehlende Audioausgabe die Lücke, die heraussticht, insbesondere für Teams, die Kurzform-Inhalte produzieren, bei denen Ton die Hälfte des Lieferergebnisses ausmacht.
Die zweite ist die Dauer. Vierzig Sekunden, aus vier verketteten Anfragen zusammengesetzt, sind eine echte Fähigkeit, und es ist auch eine Obergrenze, die ein narratives Videoformat schnell erreicht. Google hat ein höherwertiges Gemini Omni Pro angeteasert, ohne Veröffentlichungsdatum, und die Erweiterungsmechanik legt nahe, dass der Weg zu längeren Aufnahmen über besseres Kontext-Handling führt und nicht über eine einzelne längere Generierung.
Jede Ausgabe trägt standardmäßig SynthID-Wasserzeichen und C2PA Content Credentials, und der eingestellte Preview-Endpunkt erscheint nicht mehr in Googles Modellliste. Google empfiehlt jetzt Omni 1.1 gegenüber den Veo 3.1 Preview-Endpunkten, was eine bemerkenswerte interne Übergabe ist. Veo 3.1 bleibt das aktuelle Flaggschiff-Veo, und kein Veo 4 wurde angekündigt.
Womit man tatsächlich bauen sollte
Die nützliche Art, dieses Release zu lesen, ist als Verschiebung dessen, was das Produkt ist. Ein Videomodell, das einen zehnsekündigen Clip produziert, ist ein Neuheiten-Generator. Ein Modell, das zehn Sekunden vorherigen Kontext analysiert, einen Start- und Endframe akzeptiert, in 360p zu einem Drittel des Preises entwirft und auf 4K hochskaliert, ist eine Komponente, die Sie in eine Timeline einfügen können.
Das ist die Version generativen Videos, um die Produktionsteams planen können, und es ist die Version, in der die interessante Ingenieursarbeit vom Prompt-Schreiben zum Pipeline-Design wandert. Bei diesem Release zählt die Montage mehr als der Clip.
Verwandte Artikel
Step 5 übersprang vier Versionsnummern, landete auf Platz zwei unter offenen Modellen – und niemand ruft es ab
Die Benchmark-Position ist ein Signal, das Produzenten nutzen, um ein Modell zu beurteilen. Das Aufrufvolumen ist ein Signal, das Nutzer durch seine Nutzung erzeugen.
Microsoft senkt die Latenz für Teiltranskripte auf 100 Millisekunden. Das verändert, wofür Transkription da ist.
Unterhalb von 100 Millisekunden kann ein Transkriptionsprodukt reagieren, während jemand noch spricht.
Synthesia hat ein Jahrzehnt lang Avatare aufgezeichnet. Jetzt sollen sie zurücksprechen.
Ein Trainingswerkzeug, das Menschen freiwillig wiederholen, ist ein anderes Produkt als eines, das sie abschließen, weil es ihnen zugewiesen wurde.
Ein Modell, das sich weigert, Sätze zu schreiben, verarbeitet jetzt eine Billion Token pro Tag
Ein Klassifikator mit einer viel besseren Schnittstelle, ausgerichtet auf die Arbeit, die Software schon immer strukturiert haben wollte.