Kling VIDEO O1 verwandelt Videogenerierung in ein Referenzsystem

--- title: Kling VIDEO O1 verwandelt Videogenerierung in ein Referenzsystem slug: kling-video-o1-turns-video-generation-into-a-reference-system meta_title: Kling VIDEO O1 macht Referenzen zur Schnittstelle meta_description: Kuaishous Kling VIDEO O1 akzeptiert Text, Bilder, Videos, Keyframes und Referenzen in beliebiger Kombination und lässt Sie dann Elemente aus einem Clip in einen anderen übernehmen. category: ai tags: Kling VIDEO O1,Kuaishou,Videogenerierung,Referenzsystem,Keyframes,multimodal,Veo 3.1,Runway Aleph,Konsistenz ---
Der Videobereich von Kuaishou hat im vergangenen Monat viel ausgeliefert. Kling 4.0 wurde für Tester geöffnet und erhielt danach ein breiteres Startfenster. Jetzt erscheint VIDEO O1 als etwas, das eher einem Kategorienwechsel gleicht: ein Modell, das Text, Bilder, Videoclips, Keyframes und Charakterreferenzen als Eingabe akzeptiert und alle als austauschbare Bestandteile einer einzigen Anfrage behandelt.
Das Label, das das Unternehmen verwendet, lautet „unified multimodal“. Die praktische Variante lässt sich leichter beschreiben. Sie können drei Clips anhängen und schreiben: Nimm die Figur aus Video eins, die Kamerabewegung aus Video zwei, setze beides in Video drei ein und ändere den Stil auf Pixel Art.
Diese einzelne Anfrage hätte vor einem Jahr drei separate Tools und einen sorgfältigen Export von Zwischendateien erfordert, wobei jeder Schritt einen Komprimierungsdurchlauf und die Chance hinzufügte, dass die Figur abdriftet.
Was die All-in-One-Referenz tatsächlich bringt
Die Konsistenz von Figuren und Requisiten war das hartnäckige Problem im KI-Video. Frühere Workarounds verketteten Modelle miteinander, was bedeutete, für jeden Schritt zu zahlen und jede Drift zu akzeptieren, die sich dazwischen ansammelte. Klings Ansatz faltet diese Kette in eine einzige Generierung zusammen, sodass die Referenzbilder, die Keyframes und die Stilrichtung alle auf einmal aufgelöst werden.
Klings eigene Zahlen setzen O1 auf eine Gewinnrate von 247 Prozent gegenüber Google Veo 3.1 „Ingredients to Video“ bei Bildreferenzaufgaben und auf 230 Prozent gegenüber Runway Aleph bei Transformationsaufgaben. Das sind interne Bewertungen, behandeln Sie sie also als richtungsweisend. Die Fähigkeitsbehauptung ist besser überprüfbar: Gruppenszenen, in denen mehrere Subjekte individuell fixiert bleiben müssen, werden pro Subjekt behandelt statt als ein verschmolzener Durchschnitt.
Die Videolänge reicht von drei bis zehn Sekunden und ist anpassbar, sodass Sie das Tempo einer Einstellung bestimmen können, statt zu akzeptieren, was das Modell entscheidet. Unter der Haube beschreibt das Unternehmen einen multimodalen Transformer mit langem multimodalen Kontext sowie ein neues internes Format namens multimodale visuelle Sprache, das Text-, visuelle und Audiosignale im Transformer selbst vermischt. Eingebaute Chain-of-Thought-Reasoning soll die erzeugte Bewegung physikalisch plausibel halten.
Die aufgeführten Generierungstypen lesen sich wie eine Checkliste all dessen, was die Kategorie in separate Tools aufgespalten hat: Text-zu-Video, Bild-zu-Video, Video-zu-Video, Keyframe-zu-Video, Mehrere-Bilder-zu-Video und Referenz-zu-Video-zu-Video. Jede davon war früher ein eigenes Produkt. O1 behauptet, dass sie Modi eines Systems sind.
Warum die Schnittstelle mehr zählt als der Benchmark
Das Interessante ist, dass O1 überhaupt einen Vergleich gewinnt, während die Eingabeoberfläche des Modells die wichtigere Veränderung ist. Sie ist jetzt eine Bibliothek wiederverwendbarer Assets. Eine aus mehreren Winkeln erstellte Figur wird zu einem Element, das Sie per Namen anhängen, statt sie in jedem Prompt neu zu beschreiben. Kamerabewegung wird zu etwas, das Sie aus einem Clip ausleihen, statt es mit Adjektiven anzunähern.

Das verändert die Form des Workflows. Die lineare Kette aus Bildmodell, dann Videomodell, dann Editor, mit Kosten bei jedem Schritt, schrumpft auf weniger Schritte. Es ändert auch, an wen sich das Tool richtet: Postproduktionsteams erhalten natürlichsprachliche Anweisungen anstelle von Tracking- und Maskierungsdurchgängen, und Werbeteams erhalten eine Möglichkeit, einen Dreh zu ersetzen, ohne jede Einstellung von Grund auf neu aufzubauen.
Das Vokabular ist die andere Hälfte der Schnittstelle. Ein Element per Namen anzuhängen bedeutet, dass ein Team sich darauf einigen kann, wie eine Figur heißt, bevor ein einziger Shot-Prompt geschrieben wird, und diesen Namen dann in einer Kampagne wiederverwenden kann. Dasselbe mit Adjektiven anzunähern funktioniert einmal und wird bei jeder Überarbeitung schwieriger, weil es keine Aufzeichnung darüber gibt, welche Adjektivkombination die Version erzeugt hat, die allen gefiel.
Die Herstellerdokumentation beschreibt die professionellen Anwendungsfälle in ähnlichen Worten. KI-Filmproduktion stützt sich auf die Elementbibliothek, um Figuren und Requisiten über einen Dreh hinweg konsistent zu halten. Werbung und Mode nutzen sie als Ersatz für Location-Dreharbeiten, einschließlich virtueller Laufstege. Die Postproduktion nutzt sie, um Änderungen vorzunehmen, die zuvor Bild-für-Bild-Rotoscoping erforderten.
Hier gibt es einen Selbstselektionseffekt. Ein Modell mit so vielen Eingabetypen ist nicht anfängerfreundlicher; es ist freundlicher für Menschen, die bereits wissen, was sie wollen. Das ist eine bedeutsame Verschiebung für eine Kategorie, die zwei Jahre damit verbracht hat, das Erlebnis beim ersten Ausprobieren zu optimieren.
Was das Referenzsystem ersetzt
Der klarste Weg, die Verschiebung zu verstehen, ist zu betrachten, was ein Team früher um ein schwaches Modell herum gebaut hat. Konsistenz-Pipelines waren Fließbänder: ein Charakterblatt generieren, es als Bild-Prompt in jede Einstellung einspeisen, ein Animatic generieren und dann jede Einstellung mit einem Startframe aus dem Animatic neu generieren. Jede Stufe existierte, weil die vorherige nicht genug Kontext weitertragen konnte.
O1s Referenzsystem zielt auf den Grund, warum diese Stufen existierten. Wenn das Modell die Identität einer Figur über eine Gruppenszene hinweg halten kann und gleichzeitig die Kamerabewegung aus einem separaten Clip übernimmt, werden einige dieser Stufen optional statt verpflichtend. Optionale Stufen sind der Ort, an dem sich Budgets tatsächlich bewegen, denn eine Pipeline, die um eine Einschränkung herum gebaut wurde, verschwindet nicht einfach, nur weil die Einschränkung nachlässt.
Dieselbe Logik gilt für die Einstellungsabfolge. Programme, die auf Basis vorhandenen Materials die vorherige oder nächste Einstellung generieren, verwandeln eine Clipbibliothek in etwas, das einer Szene näher kommt. Editoren, die bereits in Timelines arbeiten, werden den Wert erkennen: Die Kosten für das Ausprobieren eines alternativen Winkels sinken von einem Nachdreh auf eine Generierung.
Der Trade-off ist real
Kling sagt, O1 habe eine steilere Lernkurve als Sora 2 oder Veo 3.1, weil es mehr Fähigkeiten zu verstehen gibt, bevor irgendeine davon nützlich ist. Das sind die üblichen Kosten einer ausdrucksstärkeren Schnittstelle. Ein Modell, das alles als Referenz akzeptiert, verlangt von Ihnen zu entscheiden, worauf referenziert werden soll.
Das Unternehmen hat Ton in O1 nicht gelöst. Kling 2.6 ist das Modell, das die Audiogenerierung für die Plattform trägt, komplett mit synchronisiertem Dialog, Musik und Soundeffekten. Eine vollständige Produktion bedeutet also weiterhin, zwei Modelle zu kombinieren: eines für die visuelle Sprache und eines für den Soundtrack. Klings eigenes Marketing für 2.6 setzt auf die Idee, den Ton zu sehen und das Visuelle zu hören, was eine faire Beschreibung einer Fähigkeit ist, die außerhalb von O1 liegt.
Die Preisgestaltung spiegelt ebenfalls wider, wo die Plattform sich positionieren will. Klings veröffentlichte Credits pro Sekunde steigen von sechs Credits bei 720p ohne Audio auf zwölf bei 1080p mit Audio, und die Plattform bewirbt eine Richtlinie für kommerzielle Nutzung, die bis zu kostenlosen Generierungen reicht. Für ein Modell, das auf professionelle Workflows ausgerichtet ist, bleibt der Einstieg niedrig genug, dass ein kleines Team es testen kann, bevor es sich festlegt.
Worauf man achten sollte
Ob O1s Referenzsystem außerhalb kontrollierter Demos standhält. Konsistenzversprechen überleben tendenziell kurze Clips und kurze Sitzungen, verschlechtern sich dann, wenn ein Projekt Wochen läuft und Dutzende Elemente ansammelt. Das Konzept der Elementbibliothek zahlt sich nur aus, wenn die Elemente über diese Zeitspanne stabil bleiben.
Kuaishou hat bereits gesagt, dass 4.0 eine native 30-Sekunden-Generierung und bis zu 10 Keyframes bringt. Wenn sich O1s Referenzebene mit diesen Grenzen kombinieren lässt, statt mit ihnen zu konkurrieren, deckt das Paar sowohl die Frage „wie lange“ als auch die Frage „wessen Gesicht“ ab. Diese Kombination ist es, worauf Studios gewartet haben.
Auch das kurzfristige Wettbewerbsbild ist wichtig. Gemini Omni 1.1 Flash hält mit 1516 den Spitzenplatz für Text-zu-Video auf Arena, MiniMax H3 führt bei Bild-zu-Video, und Wan 3.0 steht an der Spitze des Video-Boards von Artificial Analysis. O1 betritt kein leeres Feld. Seine Differenzierung ist die Eingabeoberfläche und nicht eine Platzierung im Leaderboard, was schwerer zu verdrängen ist, sobald Teams Elementbibliotheken darum herum aufbauen.
Verwandte Artikel
Satellitenbilder sind jetzt Trainingsdaten für Roboter
Der Engpass beim Training physischer KI ist nicht mehr die Rechenleistung oder die Modellfähigkeit. Er wurde die Qualität der synthetischen Welt.
Googles Gemini 3.5 Live Translate beseitigt die Pause
Übersetzung, die kontinuierlich läuft, in der Stimme der sprechenden Person, auf einem Telefon, das ohnehin schon in der Tasche steckt, macht das Feature von etwas, das man öffnet, zu etwas, das einfach an ist.
China hat den ersten verbindlichen Sicherheitsstandard für KI-Agenten geschrieben
Sicherheit wird von einem Feature, mit dem man wirbt, zu einer Hürde, die man passieren muss. Das Risikoinventar umfasst 13 Kategorien und 97 Punkte.
KI-generierte Inhalte müssen jetzt ihre Identität offenlegen
Dieser Schritt löst nicht alle Probleme, aber er macht „KI-generiert“ von einer Option, die man verbergen konnte, zu einer Frage, die beantwortet werden muss.