El método de los dos fotogramas: cómo la interpolación de primer y último fotograma cambió la planificación del video con IA

Google actualizó la función First and Last Frame to Video de Veo 3.1 el 9 de octubre. Subes dos imágenes fijas, el fotograma inicial y el fotograma final, y el modelo genera el movimiento intermedio. La salida llega hasta 4K a 60 fps con audio nativo, admite formato vertical 9:16 y acepta tres o cuatro imágenes de referencia para mantener la coherencia de personajes y estilo.
Por sí sola, parece una pequeña adición. En la práctica, cambia cómo se planifica un plano, porque devuelve al inicio del proceso las dos decisiones que de verdad importan.
El problema del video basado solo en prompts
Durante la mayor parte de los últimos dos años, el video con IA funcionó como una tragamonedas. Escribías un párrafo, esperabas y veías salir algo. El resultado solía ser suficientemente bueno para publicar y rara vez lo bastante bueno para incluirlo en un montaje. Si el personaje se desviaba o la cámara hacía algo extraño, reescribías el prompt y lo intentabas de nuevo.
Los creadores aprendieron a sortearlo. Generaban una buena imagen fija y luego pedían a un modelo que la animara, es decir, imagen a video. Eso fijaba el fotograma inicial, pero nadie controlaba dónde terminaba el plano. Los clips tendían a quedarse sin energía o a inventar un final que nadie había pedido.
Definir ambos extremos elimina buena parte de esa conjetura. Tú decides dónde empieza a mirar la audiencia y dónde termina de mirar. El trabajo del modelo es más acotado: conectar los dos.
Por qué volvió el pensamiento de storyboard
Los estudios de animación han trabajado así durante un siglo. Un animador dibuja una pose clave, luego otra pose clave, y rellena los dibujos intermedios. El oficio está en elegir las poses, no en dibujar cada fotograma. El video con IA está llegando a la misma división del trabajo por una ruta distinta.
Esto no es exclusivo de Veo. La carrera por la controlabilidad lleva meses gestándose. Kling 4.0 llegó con diez fotogramas clave y clips nativos de 30 segundos. Seedance 2.5 puede volver a rodar metraje existente desde un nuevo ángulo de cámara. Wan 3.0 encabezó el benchmark AA-Video-T2V v2.0 de Artificial Analysis con un Elo de 1157 a unos $12 por minuto. La vista previa de Vidu para el cuarto trimestre, publicada el 7 de octubre, empieza en torno a $0.014 por segundo y acepta hasta 15 referencias de imagen. Lo que comparten los modelos más potentes tiene menos que ver con la calidad bruta y más con la precisión con la que puedes dirigirlos.

Cómo se ve una configuración que funciona
El método de los dos fotogramas solo da resultado si vale la pena conectar los dos fotogramas. Algunos hábitos ayudan.
Genera los fotogramas con un modelo de imagen en lugar de usar una captura de pantalla de un clip anterior. Quieres controlar la composición, la iluminación y el vestuario en ambos extremos. Veo de Google acepta imágenes de referencia específicamente para que una cara o un producto sobrevivan a la transición, y eso solo funciona si las referencias son coherentes desde el principio.
Mantén simple el movimiento de cámara. La interpolación maneja bien un acercamiento, un alejamiento, una revelación o una deriva lenta. Le cuesta cuando pides un corte seco dentro de un solo clip, porque no hay corte que interpolar. Si un plano necesita un corte, crea dos clips.
Ajusta el plan de audio al plano. Veo 3.1 sintetiza audio nativo, lo que resulta útil para sonido ambiente y efectos simples. Si la escena necesita una línea de diálogo específica o una pista con licencia, planifica añadirla después en lugar de pelearte con el sonido generado.
Reserva el método para planos que llevan un beat narrativo. No hay razón para emplear dos fotogramas bien construidos en una transición de dos segundos. Úsalo donde se supone que la audiencia debe notar el cambio.
Cuánto cuestan de verdad dos fotogramas extra
Planificar en fotogramas es una decisión con precio, y el precio es más fácil de leer ahora que hace un año. El mercado del video ha estado bajando a toda velocidad el costo por segundo. La vista previa del cuarto trimestre de Vidu, publicada el 7 de octubre, empieza en torno a $0.014 por segundo y acepta hasta quince imágenes de referencia. Grok Imagine Video 1.5 Lite de xAI, añadido a su API el 8 de octubre, marca $0.02 por segundo a 480p y sube a $0.14 a 1080p. El nuevo modelo general de video de HeyGen salió con una tarifa promocional de octubre de un centavo por segundo. Wan 3.0, que se llevó el primer puesto en el benchmark de video de Artificial Analysis con un Elo de 1157, aparece alrededor de $12 por minuto, lo que equivale a veinte centavos por segundo.
De esto se desprenden dos cosas. Primero, la generación en sí rara vez es la parte cara ahora. Unos segundos de movimiento interpolado cuestan centavos, no dólares. Segundo, el recurso escaso son los fotogramas. Generar y seleccionar dos imágenes fijas potentes consume tiempo de una persona, y ese tiempo no se abarata cuando la API se abarata. La economía premia la planificación, no el volumen, que es lo contrario de la conducta que fomentaron las herramientas basadas solo en prompts.
Un flujo de trabajo que resiste en un trabajo real
Así encaja el método en una producción pequeña sin cambiarlo todo. Empieza por el concepto y decide el único beat que el plano debe lograr. Construye el fotograma inicial y el fotograma final como imágenes, usando las mismas referencias para que coincidan caras, vestuario y utilería. Genera la interpolación y mírala una vez para evaluar la estructura y otra para los detalles. Si el movimiento se curva mal, corrige los fotogramas en lugar del prompt, porque los fotogramas son lo que el modelo realmente está leyendo. Añade o reemplaza el audio según el plano. Luego córtalo en la secuencia y júzgalo en contexto, porque un clip que impresiona por sí solo puede seguir sintiéndose lento junto a los que tiene al lado.
La disciplina aquí es que cada corrección es una decisión sobre la historia, no una tirada de dados. Eso es lo que la gente pasa por alto cuando prueba la función por primera vez. Parece un atajo, pero reinstaura silenciosamente la preproducción que la primera generación de herramientas de video con IA hizo que la gente se saltara.
Dónde sigue ganando una cámara normal
Nada de esto defiende que rodar haya quedado obsoleto. La interpolación es más fuerte cuando los dos extremos son fuertes y el movimiento entre ellos es simple, lo que cubre muchos planos de producto, transiciones, rótulos y planos de establecimiento atmosféricos. Es más débil cuando la realidad hace algo específico e impredecible: un caballo real a galope tendido, una multitud reaccionando, comida cocinándose de una forma que tiene que percibirse como verdadera. Para esos casos, una cámara más un editor competente todavía zanja la discusión.
Los límites honestos
La interpolación sigue siendo interpolación. Si los dos fotogramas implican un intermedio físicamente complicado, como una persona girando por completo o un líquido cambiando de forma, el modelo inventará algo y no siempre será correcto. Mantén el movimiento implícito dentro de lo que una cámara podría grabar de forma plausible.
También hace subir el costo. Dos imágenes fijas pulidas más un clip generado es más trabajo que un solo prompt. Con los precios por segundo que hay ahora en el mercado, es más asequible que hace un año, pero el tiempo de planificación es real. El método premia a quienes ya piensan en planos.
Y sigue sin haber garantía sobre el intermedio. Lo que la función vende de verdad es un espacio de búsqueda más pequeño, no un problema resuelto. Eso es un paso significativo. Significa que la diferencia entre un clip usable y uno memorable ahora depende sobre todo de los fotogramas que eliges, que es una decisión que toma una persona.
Qué observar a continuación
Es de esperar que el mismo patrón se extienda. Una vez que un modelo importante trata los fotogramas como la entrada principal, los competidores suelen seguirlo, y la pregunta interesante pasa a ser qué interpolación se ve más natural en las costuras. Estate atento a herramientas que permitan añadir un fotograma clave intermedio, lo que daría a los directores un tercer ancla sin salir de la línea de tiempo.
Por ahora, la conclusión práctica no tiene nada de glamurosa. Si haces video con IA, deja de tratar el prompt como el acto creativo principal. Construye primero los fotogramas, elige los dos que cuentan la historia y deja que el modelo se encargue del trayecto entre ellos.
Artículos relacionados
El protocolo PACT de Decagon quiere que el consentimiento sea un estandar
Decagon abrio un protocolo para verificar la identidad de un agente personal y los permisos que un cliente le concedio. Es fontaneria, y decide si la economia de los agentes funciona.
La ola de reencuentros con IA: un debate que China aun no sabe como sentir
Peliculas homenaje hechas con IA devolvieron a figuras fallecidas a las pantallas chinas y reunieron cientos de miles de me gusta. Luego llego la reaccion, y era sobre el consentimiento.
Apple publico un modelo multimodal abierto y casi no lo conto
Este lanzamiento centrado en la investigacion paso desapercibido, pero su anclaje visual de grano fino dice mucho de hacia donde va la pila de IA de Apple.
OpenCut y el momento del CapCut de codigo abierto
Un editor de video gratuito con licencia MIT sigue subiendo en las tendencias de GitHub, y su hoja de ruta incluye un servidor MCP para agentes de IA. Las herramientas en torno a los medios con IA alcanzan a los modelos.