← Volver al blog
Aiaprox. 8 min de lectura

Kandinsky 6.0 libera como código abierto pesos de vídeo que generan sonido en la misma pasada

Publicado 6 oct 2026
Kandinsky 6.0 libera como código abierto pesos de vídeo que generan sonido en la misma pasada

--- title: Kandinsky 6.0 libera como código abierto pesos de vídeo que generan sonido en la misma pasada meta_title: Kandinsky 6.0 libera vídeo de código abierto con audio nativo meta_description: Kandinsky Lab lanzó modelos de vídeo de 3B y 29B que generan audio sincronizado en una sola pasada, bajo licencia MIT, con soporte vLLM-Omni desde el primer día. ---

La mayoría de los sistemas abiertos de texto a vídeo tratan el sonido como un problema de otro. Generas metraje silencioso, luego le añades una banda sonora a posteriori, y el movimiento de labios rara vez coincide con el diálogo. La respuesta de Kandinsky Lab, lanzada esta semana en fal, es modelar ambos a la vez.

Kandinsky 6.0 Video se distribuye en dos tamaños: un modelo Pro de 29B orientado a resultados cinematográficos y una versión Lite de 3B para iteración rápida. El código y los pesos están disponibles bajo una licencia MIT, lo cual importa más que el número de parámetros para cualquiera que planee uso comercial.

Qué ofrecen realmente los dos niveles

Ambos modelos apuntan a la generación de formato corto. Los clips duran hasta unos cinco segundos y el audio sale a una frecuencia de muestreo de 44 kHz. Pro es el nivel de calidad; Lite está posicionado para equipos que necesitan iterar rápido y están dispuestos a cambiar fidelidad por velocidad y costo.

La capacidad estrella es la generación conjunta. Lenguaje, visión y audio se modelan juntos en lugar de en un pipeline, por lo que los pasos, los efectos ambientales y las formas de la boca coinciden con lo que ocurre en pantalla. Ese tipo de sincronización nativa ha sido principalmente dominio de sistemas comerciales cerrados, lo que hace que un lanzamiento abierto sea notable.

Ondas translúcidas superpuestas en agua oscura iluminadas por luz ámbar cálida y verde azulado frío

vLLM-Omni proporciona soporte de inferencia desde el primer día. Eso importa más allá de la comodidad. Cuando una pila de inferencia incluye soporte el día del lanzamiento en lugar de semanas después, los equipos pueden evaluar un modelo con su propia carga de trabajo antes de que se desvanezca el entusiasmo inicial.

En fal, el modelo viene con escalado integrado y una herramienta independiente de superresolución de vídeo. Así, el flujo práctico es texto o imagen de entrada, clip de cinco segundos de salida y luego escalado.

La licencia requiere una lectura cuidadosa

Aquí está la parte que merece atención. La cobertura del lanzamiento lo describe como MIT, y el propio anuncio de Kandinsky Lab dice que el código y los pesos se proporcionan bajo una licencia MIT. Sin embargo, un rastreador de modelos independiente la clasifica como personalizada en lugar de permisiva estándar.

Esa discrepancia vale la pena resolverla antes de que alguien construya un producto sobre estos pesos. Una licencia genuinamente permisiva significa uso comercial, modificación y redistribución sin un acuerdo aparte. Una licencia personalizada puede parecer igualmente abierta a primera vista y aun así conllevar restricciones que aparecen después, a menudo en torno a territorio, escala o redistribución posterior.

El patrón de este año ha sido que los laboratorios chinos publiquen pesos abiertos con nombres que suenan permisivos y excepciones enterradas en los términos. La licencia H3 de MiniMax, por ejemplo, excluye Estados Unidos, la Unión Europea, el Reino Unido y Corea del Sur. Cualquiera que pase de una ficha de modelo a un plan de despliegue debería leer los términos reales.

Unos pesos de vídeo con licencia MIT serían un paso significativo si se mantienen como se describe. Las licencias permisivas de vídeo son más raras que las de modelos de lenguaje permisivos, en parte porque los modelos de vídeo tienen cuestiones de procedencia más complejas en torno a los datos de entrenamiento y en parte porque los laboratorios que los producen son más a menudo comerciales. Un modelo de vídeo genuinamente abierto que además maneje audio daría a los estudios más pequeños una vía que no requiere un contrato de API.

Por qué el audio sincronizado es el problema más difícil

Generar movimiento verosímil a partir de un prompt de texto está lo bastante resuelto como para que el trabajo interesante se haya trasladado a otro lugar. La parte insatisfactoria de la generación de vídeo abierta ha sido el audio.

Pensemos en lo que la generación silenciosa le impone al usuario. Un personaje habla, pero la mandíbula se mueve a su propio ritmo. Alguien camina, pero los pasos hay que añadirlos en postproducción, sincronizados fotograma a fotograma a mano. Una puerta se cierra, pero no hay sonido, y colocar un efecto de archivo rara vez cae en el fotograma correcto. Son problemas pequeños individualmente y un impuesto constante en conjunto, porque cada uno requiere la atención de un editor.

El modelado conjunto cambia la forma de la tarea. El modelo gestiona el timing internamente, así que la salida llega como algo más cercano a un clip terminado. Para contenido de formato corto, anuncios sociales y animación de personajes, esa es la diferencia entre una demo y un entregable.

Si Pro realmente logra una sincronización precisa es una cuestión aparte de si la arquitectura la admite, y las evaluaciones independientes que lo resolverían aún no están. El lanzamiento hace la afirmación y ofrece demostraciones; tratarlas como prueba sería prematuro.

Dónde se ubica en el grupo de vídeo abierto

Los clips cortos de cinco segundos colocan a Kandinsky 6.0 justo en el campo actual de generación de vídeo de código abierto en lugar de por delante de él. El Wan 3.0 de Alibaba ocupa el primer puesto en la tabla reconstruida de texto a vídeo de Artificial Analysis con un Elo de 1157, y las opciones de pesos abiertos que vale la pena ejecutar uno mismo, en particular MiniMax H3, ya están establecidas.

Así que el encuadre justo es competitivo más que revolucionario. Lo que Kandinsky 6.0 añade es audio nativo con una licencia abierta y un rango de tamaños que abarca un nivel de calidad serio y uno ligero. El modelo Lite de 3B, en particular, abre la puerta a equipos que nunca podrían justificar alojar un modelo de difusión de 29B.

La estructura de dos niveles también da a los equipos un compromiso para razonar explícitamente. Ejecuta Lite mientras iteras en prompts y guiones gráficos, donde un clip de cinco segundos necesita existir pero no necesita ser hermoso. Pasa a Pro una vez que la secuencia está bloqueada. Esa es una forma de flujo de trabajo que los proveedores cerrados han admitido desde hace tiempo y de la que los pesos abiertos en gran medida han carecido.

Qué hay que observar

Tres cosas te dirían si este lanzamiento importa dentro de seis meses.

Primero, los términos de la licencia. Si resultan genuinamente permisivos, el modelo se convierte en una opción predeterminada para el trabajo comercial de vídeo abierto. Si las restricciones son significativas, la adopción se concentrará en territorios donde no afecten.

Segundo, los benchmarks independientes. Artificial Analysis está reconstruyendo su tabla de imagen a vídeo en una nueva escala, y cada Elo se mueve cuando eso llega. Hasta que Kandinsky 6.0 aparezca en una tabla así, las afirmaciones de calidad se basan en demostraciones del proveedor. La tabla actual de líderes de texto a vídeo tiene a Wan 3.0 en la cima con un Elo de 1157 y un costo de $12 por minuto, con 10 de 20 victorias por categoría, lo que da una idea de lo concurrida que está la cima del campo. Kandinsky 6.0 no compite a ese nivel, y la pregunta honesta es si necesita hacerlo.

Tercero, si el audio resiste el escrutinio. La sincronización es fácil de mostrar en un clip de cinco segundos de una persona hablando a cámara, y difícil de mostrar en una escena concurrida con sonido superpuesto. Las demos publicadas hasta ahora son la versión fácil.

Una consideración más se aplica a cualquier equipo que planee construir sobre esto. Los modelos de generación de vídeo son caros de ejecutar, y un modelo de difusión de 29B es un despliegue serio. Alquilar capacidad a través de fal elimina esa carga, pero también elimina la principal ventaja de los pesos abiertos, que es ejecutarlos uno mismo. El nivel Lite de 3B es la opción más interesante para la mayoría de los equipos, porque es el que plausiblemente puede ejecutarse en hardware que un estudio pequeño ya posee.

Por ahora, el hecho interesante es estructural. Un modelo abierto que produce imagen y sonido juntos, bajo una licencia que puede o no ser totalmente permisiva, con soporte de inferencia llegando el mismo día. La brecha entre la generación de vídeo abierta y la cerrada se estrechó esta semana, y la cuestión de la licencia decidirá cuánto de esa brecha permanece cerrada.

Artículos relacionados