Los agentes empezaron a dirigir cortometrajes esta semana. El cuello de botella se trasladó al control de calidad.

Un desarrollador reveló el 5 de octubre que un cortometraje animado llamado The Clockwork Moth fue producido de principio a fin por un pipeline de 14 agentes ejecutándose en una sola RTX 5090. Unos diez minutos de tiempo de pipeline abarcaron 106 planos repartidos en nueve escenas, con 19 estados de escena para cuatro personajes recurrentes. El QA automatizado pasó 102 de 102 comprobaciones. El paquete de activos alcanzó los 2,4 GB. La cadena de herramientas no se reveló.
La parte interesante tiene poco que ver con el tiempo de ejecución. Lo que destaca es dónde dijo el desarrollador que estaban los problemas difíciles: mantener la identidad de los personajes consistente entre planos y automatizar el control de calidad. No el primer fotograma.
Ese veredicto concuerda con un segundo proyecto de la misma semana. Un usuario de Reddit publicó DOGNAPPED, una comedia de tres minutos con perros parlantes hecha casi en su totalidad por Claude ejecutando Claude Code dentro de una configuración de ComfyUI construida sobre nodos de Video Builder de código abierto. El humano aportó el brief, fotos de referencia de dos perros reales y las herramientas. Claude escribió la historia, inventó un tercer personaje canino, generó referencias de localizaciones y personajes, escribió un guion de 22 escenas con indicaciones de plano, renderizó cada escena con MiniMax H3 para vídeo, voces y efectos de sonido, compuso la banda sonora con MiniMax Music 3 y editó la película. El renderizado tardó aproximadamente cuatro horas y media.
Luego, el modelo realizó sus propias regrabaciones. El bucle de QA transcribió cada línea contra el guion, comprobó el tono de voz, revisó fotogramas y cortes, y ejecutó comprobaciones de sincronización audio-vídeo con precisión de fotograma. Donde los cachorros balbuceaban o los perros miraban fijamente a la cámara, volvió a rodar las escenas.

Por qué el bucle de QA es la historia
Generar un único plano convincente es un problema lo bastante resuelto como para que las demos sean rutinarias. Ensamblar 106 de ellos para que el mismo personaje parezca el mismo personaje en todos no lo es.
La deriva de identidad es el modo de fallo que rompe el vídeo de IA de formato largo. Un modelo que renderiza bien a un personaje de forma aislada seguirá cambiando una cara, un vestuario o el nacimiento del cabello entre planos, porque cada generación es una nueva muestra de una distribución. Las soluciones habituales son el condicionamiento por referencia, las LoRA entrenadas con un personaje específico y la selección manual. Todas ellas añaden trabajo humano justo en el punto donde se supone que el pipeline debe eliminarlo.
El QA automatizado es la otra mitad. Un pipeline que produce metraje pero no puede distinguir la salida buena de la mala traslada la carga de revisión a una persona, y una persona revisando cien planos es el cuello de botella que todo el enfoque debía eliminar. El flujo de trabajo de DOGNAPPED abordó esto convirtiendo el guion en un oráculo de verificación: transcribir cada línea, compararla con lo escrito, comprobar el tono, comprobar la sincronización, marcar fallos, volver a renderizar. Esa es una definición programática de “aceptable” que no requiere que una persona lo vea todo.
El patrón a lo largo de la semana
Varios proyectos coincidieron en la misma forma. Un usuario con el alias konte convirtió Claude Code en un productor ejecutivo y generó un vídeo musical de dos minutos y cincuenta y cuatro segundos en una sola RTX 5090: 61 planos, 342 tareas, unas dos horas de participación humana y unas cuatro horas y media de generación. Los planos se escribieron al tempo y los beats de la canción, de modo que los cortes cayeron sobre la música.
Otra ruta se saltó por completo el texto a vídeo. Claude Opus 5.5 escribió código para cada fotograma y cada pieza musical, produciendo un corto llamado I Have Never Seen the Sun, con prompts planteados como una pieza de tres a cinco minutos destinada a festivales.
Ese último enfoque apunta a una división real en el campo. El movimiento generado por código es determinista. Si el fotograma 420 se ve mal, cambias el código y vuelves a renderizar el fotograma 420. El vídeo por difusión es estocástico. Si un plano está mal, vuelves a lanzar los dados y esperas. Para movimiento diseñado, como tipografía cinética, animación de interfaz, gráficos y revelados de logotipos, la ruta determinista es más fuerte. Para humanos fotorrealistas, actuación orgánica y física del mundo real, los modelos de difusión siguen ganando, porque el código no puede simular lo que nunca ha modelado.
Las herramientas detrás del cambio
El hilo común entre estos proyectos es un agente de programación conectado a un pipeline de generación. Los nodos de Video Builder, los grafos personalizados de ComfyUI y las habilidades de agente que llaman a modelos abiertos a través de una API le dan a un modelo de lenguaje el mismo acceso al renderizado que tendría un desarrollador. El modelo no necesita ser en sí mismo un modelo de vídeo. Necesita poder escribir y ejecutar el código que impulsa uno.
Por eso el perfil de costes es como es. En una sesión publicada, un creador alimentó a Claude Opus 5.5 con más de 7000 imágenes de Midjourney y una pista de Suno, y ejecutó una sesión creativa autónoma de unas dos horas por unos 6,80 dólares. En el proyecto DOGNAPPED, el coste dominante fue el tiempo de renderizado local, más que las llamadas a la API. Cuando los modelos base son de pesos abiertos y la orquestación es código, el coste marginal de un experimento se desploma.
Hay un efecto de segundo orden sobre las habilidades. El trabajo que queda para una persona se ha desplazado de operar una línea de tiempo o supervisar un render a especificar el brief con la suficiente precisión como para que un verificador automatizado pueda decidir si la salida lo cumplió. Todos los proyectos que se lanzaron esta semana codifican en algún lugar sus criterios de aceptación, porque un pipeline no puede iterar sobre “hazlo mejor”.
Lo que todavía no funciona
Las demos son honestas sobre sus límites, y los límites son consistentes. La identidad de los personajes se mantiene durante un puñado de planos y se desvía a lo largo de docenas, por lo que el condicionamiento por referencia y los adaptadores por personaje son estándar. La estructura de horizonte largo es frágil: una película que parece coherente durante treinta segundos puede perder consistencia espacial o temporal al minuto tres. Y el QA automatizado solo puede comprobar lo que se le dijo que comprobara, lo que significa que un pipeline que verifica el diálogo y la sincronización dejará pasar sin problema una escena con un error de continuidad para el que nadie escribió una comprobación.
Lo que esto cambia para los presupuestos de producción
La economía está cambiando de una manera específica. Cuando un cortometraje cuesta unos pocos dólares de cómputo y una tarde de orquestación, la restricción deja de ser el dinero y pasa a ser la claridad del brief. La contribución humana que sobrevive es saber lo que quieres y ser capaz de decirlo con la suficiente precisión como para que un agente pueda verificarlo.
Eso también plantea una cuestión de gobernanza. Un agente que escribe un guion, lo renderiza, juzga su propia salida y vuelve a rodar los fallos está tomando decisiones creativas sin una persona en el bucle. El bucle de QA hace que la salida sea más fiable, y también significa que los propios estándares del modelo definen cómo se ve “terminado”.
Los proyectos de esta semana son demos, y sus cadenas de herramientas no se han revelado por completo. Pero la dirección es consistente. La generación es barata, la orquestación es el producto, y lo que decide si un pipeline es útil es si puede saber cuándo ha fallado.
Artículos relacionados
BOSSFIGHT hizo que modelos frontera dirigieran cafeterías durante 24 semanas. La mayoría perdió frente a no hacer nada.
Resistir un soborno en un cuestionario y negarse a ceder en un trimestre real son dos habilidades distintas, y las evaluaciones actuales tienden a medir la más fácil.
La NASA e IBM publicaron como código abierto un modelo fundacional lunar entrenado con 17 años de datos de orbitadores
El modelo es útil para encontrar y caracterizar características, y poco fiable para decir exactamente dónde están con alta precisión.
Cuatro pasos en lugar de cuarenta: cómo la destilación está comprimiendo los modelos de imagen abiertos para que quepan en las GPU de consumo
La destilación de pocos pasos es un intercambio, no un almuerzo gratis. La fidelidad del texto, la precisión de edición y la consistencia con múltiples referencias son las primeras cosas que se resienten.
Reka Rho-1 pone la comprensión y la generación en la misma caché KV
Los mismos pesos que predicen una imagen de cámara también impulsan el movimiento del robot, porque ambos viven en el mismo espacio de representación.