Kling VIDEO O1 convierte la generación de video en un sistema de referencias

--- title: Kling VIDEO O1 convierte la generación de video en un sistema de referencias slug: kling-video-o1-turns-video-generation-into-a-reference-system meta_title: Kling VIDEO O1 hace de las referencias la interfaz meta_description: El Kling VIDEO O1 de Kuaishou acepta texto, imágenes, video, fotogramas clave y referencias en cualquier combinación, y luego te permite extraer elementos de un clip y llevarlos a otro. category: ai tags: Kling VIDEO O1,Kuaishou,generación de video,sistema de referencias,fotogramas clave,multimodal,Veo 3.1,Runway Aleph,consistencia ---
El brazo de video de Kuaishou ha pasado el último mes lanzando productos. Kling 4.0 se abrió a los probadores y luego tuvo una ventana de lanzamiento más amplia. Ahora llega VIDEO O1 como algo más cercano a un cambio de categoría: un modelo que acepta texto, imágenes, clips de video, fotogramas clave y referencias de personajes como entrada, y trata todos ellos como piezas intercambiables de una única solicitud.
La etiqueta que usa la empresa es “multimodal unificado”. La versión práctica es más fácil de enunciar. Puedes adjuntar tres clips y escribir: toma el personaje del video uno, el movimiento de cámara del video dos, coloca ambos en el video tres y cambia el estilo a pixel art.
Esa única solicitud habría requerido tres herramientas separadas y una exportación cuidadosa de archivos intermedios hace un año, y cada salto añadía una pasada de compresión y una oportunidad de que el personaje se desviara.
Qué te aporta realmente la referencia todo en uno
La consistencia de personajes y utilería ha sido el problema obstinado del video con IA. Las soluciones alternativas anteriores encadenaban modelos, lo que significaba pagar por cada paso y aceptar la deriva que se acumulara entre ellos. El enfoque de Kling pliega esa cadena en una sola generación, de modo que las imágenes de referencia, los fotogramas clave y la dirección de estilo se resuelven a la vez.
Los propios números de Kling sitúan a O1 en una ratio de victorias del 247 por ciento frente a la función “Ingredients to Video” de Veo 3.1 de Google en tareas de referencia de imágenes, y del 230 por ciento frente a Runway Aleph en tareas de transformación. Son evaluaciones internas, así que tómalas como orientativas. La afirmación sobre su capacidad es más comprobable: las escenas grupales, donde varios sujetos deben permanecer bloqueados individualmente, se gestionan por sujeto en lugar de como un promedio combinado.
La duración del video va de tres a diez segundos, ajustable, lo que te permite marcar el ritmo de un plano en lugar de aceptar lo que decida el modelo. Internamente, la empresa describe un transformer multimodal con un contexto multimodal largo, además de un nuevo formato interno que llama lenguaje visual multimodal, que combina señales de texto, visuales y de audio dentro del propio transformer. El razonamiento de cadena de pensamiento integrado está pensado para mantener el movimiento generado físicamente plausible.
Los tipos de generación enumerados se leen como una lista de verificación de todo lo que la categoría ha ido dividiendo en herramientas separadas: texto a video, imagen a video, video a video, fotograma clave a video, varias imágenes a video y referencia a video a video. Cada uno de esos solía ser un producto. La afirmación de O1 es que son modos de un solo sistema.
Por qué la interfaz importa más que el benchmark
La parte interesante es que O1 gane una comparación, mientras que la superficie de entrada del modelo es el cambio que más importa. Ahora es una biblioteca de recursos reutilizables. Un personaje construido desde múltiples ángulos se convierte en un elemento que adjuntas por nombre en lugar de volver a describirlo en cada prompt. El movimiento de cámara se convierte en algo que tomas prestado de un clip en lugar de aproximarlo con adjetivos.

Eso cambia la forma del flujo de trabajo. La cadena lineal de modelo de imagen, luego modelo de video, luego editor, con un coste en cada salto, se reduce a menos saltos. También cambia a quién va dirigida la herramienta: los equipos de postproducción reciben instrucciones en lenguaje natural en lugar de pasadas de seguimiento y enmascaramiento, y los equipos de publicidad obtienen una forma de reemplazar un rodaje sin reconstruir cada plano desde cero.
El vocabulario es la otra mitad de la interfaz. Adjuntar un elemento por nombre significa que un equipo puede acordar cómo se llama un personaje antes de escribir un solo prompt de plano y luego reutilizar ese nombre en toda una campaña. Aproximar lo mismo con adjetivos funciona una vez y se vuelve más difícil en cada revisión, porque no hay registro de qué combinación de adjetivos produjo la versión que a todos gustó.
La documentación del proveedor describe los casos de uso profesionales en términos similares. La realización cinematográfica con IA se apoya en la biblioteca de elementos para mantener personajes y utilería consistentes a lo largo de un rodaje. La publicidad y la moda la usan como sustituto del trabajo en locación, incluidas pasarelas virtuales. La postproducción la usa para hacer cambios que antes requerían rotoscopia fotograma a fotograma.
Aquí hay un efecto de autoselección. Un modelo con tantos tipos de entrada no es más amigable para principiantes; es más amigable para quienes ya saben lo que quieren. Eso es un cambio significativo para una categoría que ha pasado dos años optimizando la experiencia de primera ejecución.
Qué reemplaza el sistema de referencias
La forma más clara de entender el cambio es mirar lo que un equipo solía construir alrededor de un modelo débil. Los pipelines de consistencia eran líneas de montaje: generar una hoja de personaje, introducirla en cada plano como prompt de imagen, generar un animatic y luego regenerar cada plano con un fotograma inicial tomado del animatic. Cada etapa existía porque la anterior no podía llevar suficiente contexto hacia adelante.
El sistema de referencias de O1 ataca la razón por la que existían esas etapas. Si el modelo puede mantener la identidad de un personaje a lo largo de una escena grupal y además tomar el movimiento de cámara de un clip aparte, algunas de esas etapas pasan a ser opcionales en lugar de obligatorias. Las etapas opcionales son donde los presupuestos realmente se mueven, porque un pipeline construido alrededor de una limitación no desaparece solo porque la limitación se haya reducido.
La misma lógica se aplica a la secuenciación de planos. Los programas que generan el plano anterior o siguiente a partir del metraje existente convierten una biblioteca de clips en algo más parecido a una escena. Los editores que ya trabajan en líneas de tiempo reconocerán el valor: el coste de probar un ángulo alternativo baja de una regrabación a una generación.
La contrapartida es real
Kling dice que O1 tiene una curva de aprendizaje más pronunciada que Sora 2 o Veo 3.1, porque hay más capacidades que entender antes de que cualquiera de ellas sea útil. Ese es el coste estándar de una interfaz más expresiva. Un modelo que acepta cualquier cosa como referencia te pide que decidas qué debería referenciarse.
La empresa no ha resuelto el sonido en O1. Kling 2.6 es el modelo que lleva la generación de audio para la plataforma, con diálogo sincronizado, música y efectos de sonido. Así que una producción completa sigue significando emparejar dos modelos, uno para el lenguaje visual y otro para la banda sonora. El propio marketing de Kling para 2.6 se apoya en la idea de ver el sonido y oír lo visual, que es una descripción justa de una capacidad que vive fuera de O1.
El precio también refleja dónde quiere posicionarse la plataforma. Los créditos por segundo publicados por Kling suben de seis créditos a 720p sin audio a doce a 1080p con audio, y la plataforma promociona una política de uso comercial que se extiende a las generaciones gratuitas. Para un modelo posicionado en flujos de trabajo profesionales, el punto de entrada sigue siendo lo bastante bajo como para que un equipo pequeño pueda probarlo antes de comprometerse.
Qué hay que observar
Si el sistema de referencias de O1 resiste fuera de las demos controladas. Las afirmaciones de consistencia tienden a sobrevivir a clips cortos y sesiones cortas, y luego se degradan cuando un proyecto se extiende durante semanas y acumula docenas de elementos. El concepto de biblioteca de elementos solo compensa si los elementos se mantienen estables a lo largo de ese periodo.
Kuaishou ya ha dicho que 4.0 trae generación nativa de 30 segundos y hasta 10 fotogramas clave. Si la capa de referencias de O1 se compone con esos límites en lugar de competir con ellos, el par cubre tanto la pregunta de “cuánto dura” como la de “de quién es la cara”. Esa combinación es lo que los estudios han estado esperando.
El panorama competitivo a corto plazo también importa. Gemini Omni 1.1 Flash ocupa el primer puesto de texto a video en Arena con 1516, MiniMax H3 lidera imagen a video y Wan 3.0 encabeza la tabla de video de Artificial Analysis. O1 no entra en un campo vacío. Su diferenciación es la superficie de entrada más que una posición en la clasificación, algo que es más difícil de desplazar una vez que los equipos construyen bibliotecas de elementos alrededor de ella.
Artículos relacionados
Las imágenes satelitales ahora son datos de entrenamiento para robots
El cuello de botella en el entrenamiento de IA física dejó de ser la computación o la capacidad del modelo. Pasó a ser la calidad del mundo sintético.
Gemini 3.5 Live Translate de Google elimina la pausa
La traducción que se ejecuta de forma continua, con la propia voz del hablante, en un teléfono que ya llevas en el bolsillo, traslada la función de algo que abres a algo que simplemente está activado.
China redactó la primera norma de seguridad obligatoria para agentes de IA
La seguridad pasa de ser una característica que anuncias a una puerta que debes cruzar. El inventario de riesgos consta de 13 categorías y 97 elementos.
El contenido generado por IA ya tiene que revelar su identidad
Este paso no resuelve todos los problemas, pero convierte «generado por IA» de una opción que se podía ocultar en una pregunta a la que hay que responder.