← Zurück zum Blog
Aica. 7 Min. Lesezeit

Kandinsky 6.0 veröffentlicht Video-Gewichte als Open Source, die Ton im selben Durchlauf erzeugen

Veröffentlicht 6. Okt. 2026
Kandinsky 6.0 veröffentlicht Video-Gewichte als Open Source, die Ton im selben Durchlauf erzeugen

--- title: Kandinsky 6.0 veröffentlicht Video-Gewichte als Open Source, die Ton im selben Durchlauf erzeugen meta_title: Kandinsky 6.0 veröffentlicht Video mit nativem Audio als Open Source meta_description: Kandinsky Lab hat 3B- und 29B-Videomodelle veröffentlicht, die synchronisierten Ton in einem Durchlauf erzeugen, unter einer MIT-Lizenz, mit vLLM-Omni-Unterstützung ab dem ersten Tag. ---

Die meisten offenen Text-zu-Video-Systeme betrachten Ton als Problem von jemand anderem. Man erzeugt stummes Material, schraubt anschließend einen Soundtrack daran, und die Lippenbewegung landet selten dort, wo der Dialog es tut. Die Antwort von Kandinsky Lab, diese Woche auf fal veröffentlicht, besteht darin, beides gleichzeitig zu modellieren.

Kandinsky 6.0 Video gibt es in zwei Größen: ein 29B-Pro-Modell für kinoreife Ausgabe und eine 3B-Lite-Version für schnelle Iteration. Code und Gewichte sind unter einer MIT-Lizenz verfügbar, was für alle, die eine kommerzielle Nutzung planen, wichtiger ist als die Parameterzahlen.

Was die beiden Stufen tatsächlich leisten

Beide Modelle zielen auf Kurzform-Generierung. Clips laufen bis zu etwa fünf Sekunden, und Audio wird mit einer Abtastrate von 44 kHz ausgegeben. Pro ist die Qualitätsstufe; Lite ist für Teams positioniert, die schnell iterieren müssen und bereit sind, Qualität gegen Geschwindigkeit und Kosten einzutauschen.

Die zentrale Fähigkeit ist die gemeinsame Generierung. Sprache, Vision und Audio werden zusammen statt in einer Pipeline modelliert, sodass Schritte, Umgebungseffekte und Mundformen mit dem übereinstimmen, was auf dem Bildschirm passiert. Diese Art nativer Synchronisation war bisher größtenteils Domäne geschlossener kommerzieller Systeme, was eine offene Veröffentlichung bemerkenswert macht.

Überlappende durchscheinende Wellen in dunklem Wasser, beleuchtet von warmem Bernstein- und kühlem Türkislicht

vLLM-Omni bietet Inferenz-Unterstützung ab Tag eins. Das ist mehr als nur praktisch. Wenn ein Inferenz-Stack Unterstützung am Veröffentlichungstag statt Wochen später liefert, können Teams ein Modell gegen ihre eigene Workload evaluieren, bevor die anfängliche Begeisterung nachlässt.

Auf fal wird das Modell mit integriertem Upscaling und einem eigenständigen Video-Super-Resolution-Tool gebündelt. Die praktische Pipeline ist also: Text oder Bild hinein, fünfsekündiger Clip heraus, dann Upscale.

Die Lizenzierung erfordert eine sorgfältige Prüfung

Hier ist der Teil, der Aufmerksamkeit verdient. Berichte über die Veröffentlichung beschreiben sie als MIT, und Kandinskys eigene Ankündigung sagt, Code und Gewichte würden unter einer MIT-Lizenz bereitgestellt. Ein unabhängiger Modell-Tracker listet die Lizenzierung jedoch als individuell statt als standardmäßig permissiv.

Diese Diskrepanz sollte geklärt werden, bevor jemand ein Produkt auf diesen Gewichten aufbaut. Eine wirklich permissive Lizenz bedeutet kommerzielle Nutzung, Modifikation und Weitergabe ohne separate Vereinbarung. Eine individuelle Lizenz kann auf den ersten Blick ebenso offen wirken und dennoch Einschränkungen enthalten, die später auftauchen, oft in Bezug auf Territorium, Umfang oder Weiterverbreitung.

Das Muster in diesem Jahr war, dass chinesische Labore offene Gewichte mit permissiv klingenden Namen veröffentlichen und Ausnahmen in den Bedingungen vergraben. Die H3-Lizenz von MiniMax beispielsweise schließt die Vereinigten Staaten, die Europäische Union, das Vereinigte Königreich und Südkorea aus. Wer von einer Modellkarte zu einem Deployment-Plan übergeht, sollte die tatsächlichen Bedingungen lesen.

MIT-lizenzierte Video-Gewichte wären ein bedeutender Schritt, wenn sie sich wie beschrieben bewähren. Permissive Videolizenzen sind seltener als permissive Sprachmodell-Lizenzen, teils weil Videomodelle komplexere Herkunftsfragen in Bezug auf Trainingsdaten aufwerfen, teils weil die Labore, die sie produzieren, häufiger kommerziell sind. Ein wirklich offenes Videomodell, das auch Audio verarbeitet, würde kleineren Studios einen Weg eröffnen, der keinen API-Vertrag erfordert.

Warum synchronisierter Ton das schwierigere Problem ist

Die Erzeugung plausibler Bewegung aus einem Text-Prompt ist so weit gelöst, dass die interessante Arbeit sich woandershin verlagert hat. Der unbefriedigende Teil der offenen Videogenerierung war Audio.

Man betrachte, was die stumme Generierung den Nutzern aufbürdet. Eine Figur spricht, aber der Kiefer bewegt sich nach eigenem Zeitplan. Jemand geht, aber die Schritte müssen in der Postproduktion hinzugefügt und von Hand bildgenau angepasst werden. Eine Tür schließt sich, aber es gibt keinen Ton, und ein Stock-Effekt trifft selten das richtige Bild. Einzeln sind das kleine Probleme, in der Summe eine stetige Belastung, weil jedes die Aufmerksamkeit eines Editors erfordert.

Gemeinsame Modellierung verändert die Form der Aufgabe. Das Modell übernimmt das Timing intern, sodass die Ausgabe eher wie ein fertiger Clip ankommt. Für Kurzform-Inhalte, Social Ads und Charakteranimation ist das der Unterschied zwischen einer Demo und einem lieferbaren Ergebnis.

Ob Pro tatsächlich eine enge Synchronisation erreicht, ist eine andere Frage als die, ob die Architektur sie unterstützt, und die unabhängigen Bewertungen, die das klären würden, liegen noch nicht vor. Die Veröffentlichung erhebt den Anspruch und liefert Demonstrationen; sie als Beweis zu behandeln, wäre verfrüht.

Wo es in der offenen Video-Kohorte steht

Kurze Fünf-Sekunden-Clips verorten Kandinsky 6.0 mitten im aktuellen Feld der Open-Source-Videogenerierung und nicht an dessen Spitze. Alibabas Wan 3.0 hält mit einer Elo von 1157 den Spitzenplatz auf dem neu aufgebauten Text-zu-Video-Board von Artificial Analysis, und die Open-Weight-Optionen, die es wert sind, selbst betrieben zu werden, insbesondere MiniMax H3, sind bereits etabliert.

Die faire Einordnung ist also wettbewerbsfähig statt revolutionär. Was Kandinsky 6.0 hinzufügt, ist natives Audio unter einer offenen Lizenz und eine Größenbandbreite, die eine ernsthafte Qualitätsstufe und eine leichte abdeckt. Besonders das 3B-Lite-Modell öffnet Teams die Tür, die ein 29B-Diffusionsmodell niemals rechtfertigen könnten.

Die zweistufige Struktur gibt Teams außerdem einen Trade-off, über den sie explizit nachdenken können. Lite einsetzen, während an Prompts und Storyboards iteriert wird, wo ein Fünf-Sekunden-Clip existieren muss, aber nicht schön sein muss. Zu Pro wechseln, sobald die Sequenz fixiert ist. Das ist eine Workflow-Form, die geschlossene Anbieter seit einiger Zeit unterstützen und die offenen Gewichten weitgehend fehlte.

Worauf zu achten ist

Drei Dinge würden zeigen, ob diese Veröffentlichung in sechs Monaten von Bedeutung ist.

Erstens, die Lizenzbedingungen. Wenn sie sich als wirklich permissiv erweisen, wird das Modell zur Standardoption für kommerzielle offene Videoarbeit. Wenn die Einschränkungen relevant sind, wird sich die Akzeptanz auf Territorien konzentrieren, in denen sie nicht greifen.

Zweitens, unabhängige Benchmarks. Artificial Analysis baut sein Image-to-Video-Board in neuem Maßstab um, und jede Elo verschiebt sich, wenn es erscheint. Bis Kandinsky 6.0 auf einem solchen Board auftaucht, beruhen die Qualitätsansprüche auf Anbieter-Demonstrationen. Das aktuelle Text-zu-Video-Leaderboard hat Wan 3.0 an der Spitze mit einer Elo von 1157 und Kosten von 12 US-Dollar pro Minute, mit 10 von 20 Kategoriesiegen, was ein Gefühl dafür gibt, wie überfüllt die Spitze des Feldes ist. Kandinsky 6.0 konkurriert nicht auf diesem Niveau, und die ehrliche Frage ist, ob es das muss.

Drittens, ob das Audio einer genauen Prüfung standhält. Synchronisation ist in einem Fünf-Sekunden-Clip einer Person, die in die Kamera spricht, leicht zu zeigen und in einer überfüllten Szene mit sich überlagerndem Ton schwer. Die bisher veröffentlichten Demos sind die leichte Version.

Ein weiterer Aspekt gilt für jedes Team, das darauf aufbauen will. Videogenerierungsmodelle sind teuer im Betrieb, und ein 29B-Diffusionsmodell ist ein ernsthaftes Deployment. Kapazität über fal zu mieten, nimmt diese Last ab, entfernt aber auch den Hauptvorteil offener Gewichte, nämlich sie selbst zu betreiben. Die 3B-Lite-Stufe ist für die meisten Teams die interessantere Option, weil sie diejenige ist, die plausibel auf Hardware läuft, die ein kleines Studio bereits besitzt.

Vorerst ist die interessante Tatsache struktureller Natur. Ein offenes Modell, das Bild und Ton zusammen erzeugt, unter einer Lizenz, die möglicherweise vollständig permissiv ist oder auch nicht, mit Inferenz-Unterstützung, die am selben Tag erscheint. Die Lücke zwischen offener und geschlossener Videogenerierung hat sich diese Woche verkleinert, und die Lizenzfrage wird entscheiden, wie viel von dieser Lücke geschlossen bleibt.

Verwandte Artikel