Kling 4.0 se lanza: diez fotogramas clave, treinta segundos y el fin del montaje de tragaperras

Kling 4.0 de Kuaishou abrió sus pruebas internas el 28 de septiembre, con el nivel ligero Kling 4.0 Flash llegando a los miembros esa misma noche y el modelo completo prometido para octubre. La compañía lleva casi un año librando una guerra de especificaciones con Seedance, de ByteDance, y este lanzamiento es su declaración más clara hasta ahora sobre qué se disputa realmente en esa batalla.
Las cifras principales son claras. La generación nativa en una sola pasada se duplica de los 15 segundos de Kling 3.0 a 30, y la extensión de vídeo promete hasta dos minutos en varias pasadas. La salida alcanza 4K y 1080p en HDR de 10 bits, además de un encuadre ultrapanorámico de 21:9. El audio pasa a estéreo de dos canales, y la deriva de sincronización labial que lastró a la generación anterior es el defecto concreto que, según las notas de la versión, se ha corregido. La entrada de prompts aumenta a 8000 tokens.
Ninguno de esos números es el interesante.
Diez fotogramas clave son otra categoría de producto
Kling 3.0 aceptaba un fotograma inicial y uno final. Dos imágenes, y el modelo interpolaba todo lo que había entre ellas. Cualquiera que haya intentado rodar un vídeo de producto así sabe lo que se siente: puedes fijar los extremos y luego mirar lo que te toca. Los creadores chinos tienen una palabra para esto: 抽卡, sacar cartas, el mismo término que usan los juegos gacha para las tiradas aleatorias.
Kling 4.0 acepta hasta diez fotogramas clave. Eso suena a un cambio de cantidad. No lo es.
Con diez puntos de control puedes describir una secuencia de momentos dentro de una sola generación: el personaje entra, camina hacia el mostrador, la cámara se acerca, el producto gira, la mano lo alcanza, corte a un encuadre más amplio. Cada uno de esos momentos tiene su propia imagen de anclaje, así que el modelo ya no adivina la forma del arco entre dos extremos. Rellena los huecos entre diez de ellos.
Para un equipo que produce vídeo comercial corto en volumen, eso cambia la unidad de entrega. Antes, un anuncio de producto de 30 segundos implicaba un rodaje o un montaje con metraje de archivo, con la generación por IA limitada a unos pocos segundos de relleno. Ahora toda la línea de tiempo puede producirse a partir de un guion con fotogramas clave asignados a momentos del plano. El trabajo pasa de "generar y esperar" a "hacer el storyboard y luego generar".

La sección de comentarios del propio anuncio de Kuaishou merece la pena leerla, porque la pregunta más votada no tenía nada que ver con la capacidad, sino que tenía todo que ver con el precio. Es una señal bastante honesta de dónde está la restricción en 2026: el techo de capacidad no deja de subir, y el suelo de costes no se ha movido ni de lejos tan rápido.
Qué controlan realmente las referencias multimodales
Kling 4.0 admite hasta 15 referencias multimodales en una sola tarea: hasta 10 imágenes, 5 clips de vídeo y 7 combinaciones de sujetos. Kuaishou ha bautizado esto como Omni Reference, y también permite añadir, modificar o eliminar sujetos y fondos dentro de metraje existente.
Vuelve a leer esa lista y empieza a parecer menos una función de generación y más un contrato de consistencia. El modo de fallo recurrente en el vídeo con IA nunca ha sido el fotograma individual, sino el cuarto plano, donde la cara del actor se ha desviado, la chaqueta ha cambiado de tono y la etiqueta del producto se ha transformado en algo que no superaría una revisión legal. Fijar la identidad a 15 ranuras de referencia a lo largo de una generación de 30 segundos es un intento de responder a eso directamente.
Aquí se esconde una restricción de producción real. El material de referencia tiene que existir antes de poder usarlo, y crear una hoja de personaje, una rotación de producto y una muestra de voz es en sí mismo un trabajo de producción. Los equipos que obtengan valor de Kling 4.0 serán los que ya tengan esa biblioteca montada, o los que hayan hecho de montarla parte de su flujo de trabajo.
Velocidad, coste y dónde está realmente Kling
Kling 4.0 Flash es el nivel de alta frecuencia: generación más rápida, menor coste y limitado a 720p durante el acceso anticipado. El modelo completo es el nivel profesional para trabajo de cine y publicidad.
Merece la pena ser precisos sobre el panorama competitivo en lugar de repetir el planteamiento de Kuaishou. En la clasificación de texto a vídeo de Artificial Analysis, Kling 3.0 estaba alrededor del duodécimo puesto, por detrás de Gemini Omni Flash de Google, Wan 3.0 de Alibaba y H3 Max de MiniMax. Kling 4.0 es un avance serio de capacidad, y si cierra esa brecha en la clasificación es una incógnita hasta que lleguen evaluaciones independientes.
El contexto de mercado importa más que la clasificación. Kuaishou informó de unos 3.000 millones de dólares en financiación independiente en julio de 2026, con una valoración post-money de aproximadamente 18.000 millones de dólares, según se dice a cambio de un compromiso de cotización a cinco años. La lectura de Citigroup, según Securities Times, se centra en dos preguntas: si Kling puede recuperar usuarios de Seedance, que según los informes controla más del 80 por ciento del mercado nacional, y si el precio es lo bastante competitivo como para ser relevante.
La cuestión del precio no es incidental. La misma semana en que se anunció Kling 4.0, HeyGen lanzó un modelo de vídeo universal a un centavo por segundo, Creatify puso en el mercado un derivado de MiniMax H3 post-entrenado a cuatro centavos por segundo, y SpaceXAI sacó un nivel lite de Grok Imagine Video a través de plataformas de terceros con la afirmación de ser cuatro veces más barato que la opción anterior. La capa de generación se está convirtiendo en una commodity desde varias direcciones a la vez, y un modelo que lidera en salida 4K HDR compite en una dimensión en la que sus rivales han decidido no liderar.
Eso replantea para qué sirve Kling 4.0. La ambición es ser el generador al que un equipo de producción pueda entregar un brief y recibir un entregable, lo cual es una afirmación distinta y más difícil de poner precio.
El flujo de trabajo es la verdadera mejora
La parte menos glamurosa del lanzamiento puede ser la más trascendental: texto a vídeo, imagen a vídeo, generación por referencia, extensión de vídeo y edición de vídeo ahora están en un único flujo de trabajo multimodal nativo. Las referencias de imagen, vídeo y audio pueden combinarse en un solo campo de entrada. La página de generación admite vista previa y edición de línea de tiempo, diseños de cuadrícula y lista, y lo que Kuaishou llama una experiencia de Agent en lienzo.
Las herramientas de vídeo con IA han pasado dos años siendo una colección de pasos desconectados: genera aquí, mejora la resolución allí, edita en una tercera aplicación, sincroniza el audio en una cuarta. Consolidarlos en una sola superficie es lo que hace práctica una línea de tiempo de 30 segundos. También es donde la herramienta empieza a solaparse con el editor, lo cual es una lucha competitiva distinta a la que mantiene contra Seedance.
La consolidación conlleva su propio coste. Una herramienta que domina la generación, la edición y la revisión de la línea de tiempo es una herramienta que quiere adueñarse del archivo del proyecto, y los equipos que ya tienen un stack de postproducción establecido tendrán que decidir cuánto de su flujo de trabajo entregar. Kuaishou lleva un tiempo construyendo en esta dirección con soporte de MCP y CLI para la creación por lotes impulsada por agentes, y el enfoque del lienzo sugiere que la compañía ve la orquestación como el producto, no el clip.
Dónde se mueve realmente el cuello de botella
El planteamiento que impulsa Kuaishou es que el vídeo con IA pasa de la máquina tragamonedas al storyboard. Es una descripción justa de lo que permiten diez fotogramas clave. También mueve el cuello de botella: los equipos que tenían dificultades para producir una pieza coherente de 30 segundos ahora tendrán dificultades para escribir un guion coherente de 30 segundos. La herramienta ha cedido el control del storyboard. Si hay un storyboard que darle es una pregunta aparte, y no una que pueda responder un lanzamiento de modelo.
Hay una versión de esto que es genuinamente una buena noticia y una versión que es una trampa. La buena: los equipos con un guion y una lista de planos obtienen un multiplicador de producción, porque la parte cara de su proceso (coordinar un rodaje) se reduce a una pasada de generación. La versión trampa: los equipos que no tienen ni lo uno ni lo otro generan mucho más contenido de la misma calidad, a mayor volumen, y descubren que la restricción nunca fue el render.
La respuesta de Kling 4.0 a eso es esencialmente una apuesta a que el mercado ya ha hecho la transición. Diez fotogramas clave, 15 referencias y prompts de 8000 tokens son funciones para gente que tiene algo específico que decir. Pedir tanto control solo vale la pena si sabes cómo quieres que se vea el plano antes de pulsar generar.
Artículos relacionados
Meta licencia la tecnología de imagen y vídeo de Midjourney, y la razón es reveladora
Los benchmarks se mueven cada trimestre. El juicio de una comunidad sobre lo que se ve bien, no.
AssemblyAI redujo la latencia del habla en tiempo real a 91 milisegundos. Esta es la razón por la que esa cifra importa
La restricción en la voz nunca ha sido la tasa de error de palabras. Ha sido la toma de turnos.
Nano Banana 2.1 de Google es una actualización de funciones, no un buque insignia
Un lanzamiento de gama media te dice lo que un laboratorio cree que la mayoría de sus usuarios realmente necesita, lo cual es una señal más útil que un producto insignia.
El stack de anuncios de video se dividió en especialistas, y Boreal-H3 muestra por qué
La calidad cinematográfica y el rendimiento de iteración son productos diferentes, y una sola capa de generación no puede liderar en ambos.