← Volver al blog
Aiaprox. 8 min de lectura

Vibe Video: El modelo de codificación que crea películas escribiendo código frontend

Publicado 10 oct 2026
Vibe Video: El modelo de codificación que crea películas escribiendo código frontend

Durante el último mes, el video de IA más comentado del mundo no fue hecho por un modelo de video. Fue hecho por un modelo de codificación que escribió código frontend hasta que apareció una animación.

Los clips provinieron de Claude Opus 5.5. En un caso ampliamente compartido, un creador usó un prompt de referencia, acceso a Midjourney y un mood board para producir un corto distópico cinematográfico en unas doce horas. La publicación superó los 20 millones de visualizaciones. Otro creador generó una pieza de dos minutos y dieciséis segundos sobre la historia de la civilización con una sola instrucción; superó los diez millones de visualizaciones en dos días. Una colección de videos de Opus 5.5 en GitHub ha reunido más de 400 entradas, la mayoría con prompts y código públicos.

La gente empezó a llamarlo Vibe Video. El nombre es torpe, pero la técnica vale la pena entenderla, porque es un camino genuinamente distinto hacia las imágenes en movimiento del que todos los demás están siguiendo.

El código como motor de renderizado

El pipeline habitual de video con IA es un modelo de difusión que predice píxeles. Le das un prompt o una imagen fija, y devuelve fotogramas. El modelo está entrenado con video, y su sentido del movimiento se aprende de esos datos.

El renderizado por código funciona de otra manera. Un modelo de lenguaje escribe HTML, CSS, SVG o JavaScript que dibuja una animación, y un navegador la renderiza. No se predice nada fotograma a fotograma. El movimiento proviene de código que describe explícitamente posición, sincronización y easing.

Esa distinción importa porque facilita algunas cosas que la difusión encuentra difíciles. Gráficos precisos, tipografía, gráficos de datos, movimiento geométrico y transiciones entre pantallas son triviales cuando son código. Son exactamente las cosas que salen turbias de un modelo de video. La contrapartida es que el renderizado por código no puede producir una cara humana fotorrealista en movimiento. Dibuja lo que el código puede describir.

Un panel de editor de código a la izquierda alimentando un fotograma de animación nítido a la derecha

Por qué los creadores se engancharon

Dos propiedades explican el entusiasmo. La primera es la reproducibilidad. Un clip de difusión es una muestra; si lo ejecutas de nuevo, obtienes un primo, no un gemelo. Una animación codificada es un programa. Cambia un valor y sabes qué ocurrirá. Eso abarata la revisión, y la revisión es donde vive realmente la mayor parte del trabajo.

La segunda es que la salida ya está en un formato que el resto de un flujo de trabajo puede usar. Una animación de navegador se puede capturar, incrustar en un sitio o conectar a una fuente de datos. Encaja naturalmente dentro de una página de producto o un panel, que es de donde viene en realidad gran parte de la demanda comercial de movimiento.

También hay una razón del lado de la oferta. Claude Opus 5.5 se lanzó el 22 de septiembre con una tarjeta de sistema de 230 páginas y precios de API de cuatro dólares por millón de tokens de entrada y veinte por millón de salida. Se midió cerca del anterior buque insignia en la mayoría de las tareas a un costo significativamente menor. Los modelos frontera más baratos hacen que la generación de código larga e iterativa sea práctica para individuos, que es lo que realmente requieren las construcciones de doce horas.

El otro carril

La misma semana, otro modelo general se estaba adentrando en el video desde una dirección diferente. Se informó que GPT-6 Astra actuaba como una especie de director de IA, encargándose de la planificación de storyboards y la previsualización con modelos blancos, y llegando a Blender, Unreal Engine y DaVinci Resolve para construir escenas, bloquear planos y gestionar ediciones.

Junta los dos y aparece un patrón. Los modelos de propósito general no están tratando de superar a Seedance, Kling o MiniMax en movimiento fotorrealista. Se están moviendo aguas arriba, hacia la planificación y el pipeline de producción, y hacia los lados, hacia un movimiento que es programático en lugar de fotográfico. Eso deja a los modelos de video especializados seguir empujando en realismo mientras los modelos generales se llevan las partes del proceso que se parecen al software.

Cómo funciona realmente el flujo de trabajo

El proceso descrito por los creadores que obtienen buenos resultados se parece más al desarrollo de software que a la realización cinematográfica. Escribes un prompt que establece el ambiente y las restricciones, el modelo produce código, el código se renderiza en un navegador y miras el resultado. Luego cambias una cosa y lo ejecutas de nuevo. El bucle es corto y la salida es inspeccionable, que es por lo que las construcciones de doce horas son posibles. Doce horas de entregar un párrafo a un modelo de video producirían ruido. Doce horas de editar código producen una pieza terminada.

El mood board y el modelo de referencia importan por una razón que no tiene nada que ver con la composición. Le dan a las imágenes fijas una paleta y un sujeto consistentes, de modo que cuando el código las coloca y anima a su alrededor, las piezas parecen pertenecer a una misma película. El código aporta el movimiento y la tipografía. Las imágenes fijas aportan el mundo. Ninguna mitad funciona sin la otra.

Dónde recae realmente el costo

Es tentador pensar que el video renderizado por código es gratis, porque el renderizado ocurre en un navegador en tu propia máquina. Las llamadas al modelo no son gratis, y el bucle es largo. Cada reescritura es una solicitud pagada, y una pieza con cientos de ediciones son cientos de solicitudes con un contexto grande adjunto. El recorte de precios de Anthropic a cuatro dólares por millón de tokens de entrada es lo que hizo ese bucle asequible para individuos en lugar de solo para estudios. Cuanto más barato es el modelo, más libremente puede iterar un creador, y la iteración es todo el método.

Eso tiene una consecuencia extraña. El cuello de botella para este estilo no es el cómputo para renderizar. Es la revisión. Alguien tiene que ver cada render y decidir qué cambiar, y esa atención no escala con un precio de API más bajo. Los creadores que triunfan con Vibe Video son, funcionalmente, directores mirando dailies y dando notas, excepto que las notas van a un diff.

Renderizado por código y video generado, lado a lado

Ayuda ser precisos sobre qué estilo hace qué. El renderizado por código es reproducible, barato de revisar, nítido en gráficos y texto, y cómodo con datos. No puede generar un actor fotorrealista, una multitud ni un momento espontáneo. El video de difusión hace eso bien y trata todo lo demás como una aproximación. Un logo renderizado por un modelo de video sale casi bien. Un logo renderizado por código es exacto.

Esa división sugiere que los dos convivirán en lugar de competir. Una pieza puede abrir con un plano de establecimiento generado, cortar a un gráfico animado codificado y cerrar con metraje generado. La pregunta creativa interesante deja de ser qué herramienta usar y pasa a ser dónde cambiar. Los equipos que descifren esas costuras harán un trabajo que se lea como deliberado.

Dónde no funciona

El renderizado por código no es un reemplazo para la generación de video, y tratarlo como tal decepcionará a la gente. No puede filmar a un actor. No puede producir un fotograma documental ni una multitud creíble. Es fuerte en diseño, movimiento abstracto, información e interfaz, y débil en todo lo que necesite parecer que una cámara estuvo allí.

También tiene un perfil de costos del que nadie habla. Puedes quemar muchos tokens de modelo antes de que un solo fotograma se vea bien, porque el bucle es escribir, renderizar, inspeccionar, reescribir. Los modelos más baratos bajan ese costo, pero no lo eliminan. Los creadores que obtienen resultados llamativos no solo están haciendo prompting; están revisando código.

Qué nos dice sobre el campo

Lo interesante de Vibe Video no es que un modelo de codificación pueda hacer un lindo clip. Es que la frontera entre "generación de video" y "software que hace que las cosas se muevan" resultó ser más difusa de lo que cualquiera suponía. Cuando un modelo de lenguaje puede escribir la animación directamente, parte de la demanda de video generativo se responde con código.

Para las personas que hacen visuales, la pregunta práctica ya no es si elegir una sola herramienta. Es qué partes de una pieza se sirven mejor con un fotograma predicho y cuáles con uno escrito. Los equipos que lo están descifrando ahora son aquellos cuyo trabajo se verá deliberado en lugar de meramente generado.

Artículos relacionados