← Volver al blog
Aiaprox. 8 min de lectura

La próxima batalla en el video con IA es por entender el mundo

Publicado 2 oct 2026
La próxima batalla en el video con IA es por entender el mundo

Durante la mayor parte de los últimos dos años, la forma de juzgar un modelo de video con IA era simple: mirar qué tan bonitos eran los fotogramas. Esa prueba se está quedando sin espacio. Cuando varios modelos pueden producir un clip convincente de cinco segundos de una persona caminando por una ciudad, la calidad de imagen deja de separarlos. Algo más tiene que hacerlo.

En septiembre, una startup china llamada HiDream.ai lanzó HiDream-O1-Video-1.0, o HD-V1, e hizo de ese «algo más» todo su argumento de venta. El modelo, dice la compañía, está construido para entender cómo deberían desarrollarse los eventos, no solo cómo debería verse un fotograma individual.

El problema con los fotogramas bonitos

Cualquiera que haya pasado tiempo generando video conoce los modos de fallo. Le pides a un personaje que empuje una pesada puerta de madera y el modelo dibuja la mano empujando hacia la izquierda mientras la puerta se abre hacia la derecha. Le pides a alguien que corra de un lugar a otro durante cinco segundos, y el personaje termina el diálogo, se queda sin tiempo y se teletransporta. El clip se ve bien hasta que realmente lo miras.

Regenerar repetidamente quema tiempo y créditos, y un clip de quince segundos puede costar mucho más de lo que permitía el presupuesto. La brecha no es la resolución ni la duración. Es la física y la causa y efecto. El modelo pinta cada fotograma sin entender que una puerta tiene que girar en la dirección en que la empuja la mano, o que moverse entre dos puntos lleva tiempo.

Esa es la brecha que HD-V1 busca cerrar. HiDream dice que el modelo refuerza su comprensión de la duración de las acciones, las relaciones entre objetos, la lógica de los eventos y la alineación audiovisual antes de generar, de modo que la salida se mantiene coherente como una secuencia en lugar de una pila de imágenes fijas.

Una tira de storyboard holográfica que muestra una figura en silueta empujando una puerta en la dirección correcta

Cuatro modelos chinos, tres enfoques

Para entender por qué esto importa, ayuda mirar quién más está en lo más alto de las tablas de clasificación. Para septiembre de 2026, cuatro modelos chinos habían llegado al primer nivel de la generación de video global: Seedance 2.0 y 2.5 de ByteDance, H3 de MiniMax, Wan 3.0 de Alibaba y HD-V1 de HiDream. Un año antes, los modelos de video chinos apenas estaban presentes en los principales benchmarks internacionales. Ahora se agrupan cerca de la cima.

Llegaron allí por rutas diferentes. Seedance se apoya en la pila completa de cómputo, ingeniería y producto de ByteDance. MiniMax H3 se construye sobre una gran base de modelo y una gran base de usuarios, extendiéndose al video. Wan 3.0 está integrado en el ecosistema más amplio de Alibaba de Qwen y Alibaba Cloud. HiDream es la excepción entre ellos, una startup sin los recursos ni la distribución de un gigante, que apuesta en cambio por una arquitectura que llama un modelo de mundo omnimodal nativo, diseñado para que imágenes, video, interacción 3D e inteligencia encarnada compartan una misma base.

HD-V1 admite entradas de texto, imagen y video y genera de 5 a 20 segundos de video en 1080p. El equipo dice que tuvo un buen desempeño en dos tablas de clasificación internacionales, y la afirmación que más destaca es la comprensión del mundo: la idea de que el modelo genera secuencias más coherentes porque modela cómo progresan los eventos.

Por qué «entender» es la nueva frontera

Cuando varios equipos pueden alcanzar el mismo nivel de calidad, la competencia se desplaza a lo que el modelo sabe sobre el mundo. La resolución y la duración se vuelven características básicas en lugar de diferenciadores. Las preguntas más difíciles son las que la calidad de imagen no puede responder: si un objeto en movimiento obedece las reglas de la física, si la acción y el sonido se mantienen sincronizados, si un evento se deriva del anterior.

La industria tiene otros nombres para la misma idea. Los productos competidores y el mercado en general hablan de consistencia, comprensión de intenciones y entrega estable. Una compañía china de video, ZhiXiang Future, incluso publicó un marco de evaluación de cinco partes para agentes de video, que abarca consistencia, intención, completitud audiovisual, línea temporal y narrativa, y entrega estable. Los nombres difieren, el objetivo es el mismo: modelos en los que se pueda confiar para terminar una secuencia, no solo para empezarla.

Hay dinero detrás de esto. Goldman Sachs estimó que el mercado global de generación de video con IA crecerá aproximadamente diez veces en cinco años, hasta unos 29 mil millones de dólares para 2030. Ese tipo de pronóstico atrae inversión hacia lo que parezca el próximo salto real de capacidad, y «entiende el mundo» es el candidato actual.

Las tablas de clasificación no coinciden entre sí

Parte de lo que hace difícil juzgar el campo del video es que los marcadores no coinciden. En septiembre, la arena comunitaria coronó a una familia, los evaluadores humanos que puntuaban clips individuales prefirieron otra, y los escritores de prompts que votaban con su uso eligieron una tercera. Una instantánea del Elo comunitario puso la línea Gemini Omni de Google en la cima, con Flux 3 Video de Black Forest Labs como la entrada más fuerte cercana al código abierto, y Seedance 2.0 y 2.5 de ByteDance justo detrás. Los evaluadores humanos que puntuaban clips en una escala de calidad de uno a cinco, en cambio, pusieron a Seedance 2.0 primero, por delante de Kling, Wan e incluso de su propio sucesor. Por uso bruto, Seedance y Veo 3 de Google dominan el volumen de prompts, mientras que Wan posee el nicho local y abierto.

La lección de esos tres conjuntos de datos es que «el mejor modelo» depende por completo de qué se esté midiendo. Veo queda más abajo en las valoraciones humanas de clips sin audio que en las arenas, porque su fortaleza es el audio nativo y el diálogo, que una rúbrica de evaluación sin audio no puede ver. Que Seedance 2.5 puntúe por debajo de 2.0 en calidad por clip es un recordatorio de que las versiones más nuevas no siempre son más impresionantes en los prompts que la gente realmente escribe. Cualquiera que elija una herramienta para un proyecto debería leer más de una tabla antes de decidir, y debería dar más peso a la tabla que coincida con su propio trabajo.

Qué significa el cambio para los creadores

Para cualquiera que realmente haga cosas con estas herramientas, el efecto práctico es un cambio en lo que se rompe. Cuando un modelo entiende la lógica de los eventos, el fallo pasa de lo obvio a lo sutil. Dejas de pelear con personajes que se teletransportan y puertas que se abren al revés, y empiezas a notar problemas más pequeños: una acción que dura un instante demasiado, una reacción que no se deriva de la línea anterior. Esos son los problemas que se supone que debe detectar un director humano.

Esta es la misma lección que ya enseñó el auge de los dramas cortos en China. La IA ahora puede generar los planos, pero un episodio terminado todavía necesita a alguien que decida qué planos pertenecen, en qué orden y por qué. Los modelos están mejorando en el fotograma. El juicio sobre qué fotogramas importan sigue siendo un trabajo humano, y puede que siga siéndolo más tiempo de lo que esperan los optimistas.

La carrera a cuatro bandas también importa por una razón más silenciosa. Diferentes compañías atacando el mismo problema desde direcciones distintas, la pila de un gigante aquí, la arquitectura de una startup allá, reduce la dependencia de la industria de cualquier camino técnico único. Si la comprensión del mundo resulta ser el objetivo correcto, ahora hay más de un equipo apuntando a él. Y si resulta ser el objetivo equivocado, el campo ha cubierto sus apuestas.

Por ahora, la lectura honesta es que HD-V1 es una entrada fuerte más en un campo abarrotado, con afirmaciones que terceros aún no han probado. Lo que no está en duda es la dirección. Los modelos que ganen la próxima ronda no serán los que dibujen el fotograma individual más bonito. Serán los que puedan mantener una historia unida durante veinte segundos sin que algo se rompa. Entender el mundo es el problema más difícil y, por primera vez, muchos equipos bien financiados están trabajando en él a la vez.

Artículos relacionados