← Volver al blog
Aiaprox. 8 min de lectura

Vidu Q3 dividió la referencia a video en tres productos. Es una decisión de empaquetado tanto como de modelo.

Publicado 5 oct 2026
Vidu Q3 dividió la referencia a video en tres productos. Es una decisión de empaquetado tanto como de modelo.

La mayoría de los lanzamientos de modelos de video se anuncian una vez y luego aparecen por todas partes bajo un solo nombre. Vidu hizo lo contrario con su línea Q3 de referencia a video.

El 14 de septiembre, Model Studio de Alibaba Cloud incluyó tres modelos Vidu Q3 de referencia a video separados. El primero, viduq3-mix, es un modelo de propósito general que toma imágenes de referencia y un prompt de texto y combina los sujetos de esas imágenes en la escena descrita. El segundo, viduq3-ad, está diseñado para publicidad, con cortes de escena de nivel comercial, movimiento de cámara y salida de audio directa; subes imágenes de productos y obtienes un video publicitario. El tercero, viduq3-drama, se dirige a la producción de drama y manga con IA, con consistencia de personajes, efectos de movimiento y expresión emocional ajustados para contenido narrativo.

Los tres funcionan a $0.14 por segundo para 720p o 1080p, con un límite de 5 solicitudes por segundo. El precio es idéntico en los tres, lo que indica que la diferenciación no está en el costo sino en el comportamiento de salida.

El problema que Vidu realmente se propuso resolver

Vidu proviene de Shengshu Technology en Beijing. Su modelo Q3 se lanzó el 30 de enero de 2026 y de inmediato llegó al circuito de benchmarks. Artificial Analysis lo clasificó primero en China y segundo a nivel mundial en el lanzamiento, por delante de Runway Gen-4.5, Google Veo 3.1 y Sora 2 de OpenAI, con una puntuación de 1241.

Los tres cambios técnicos detrás de esa clasificación merecen ser nombrados. Q3 fue uno de los primeros modelos de video de formato largo en producir diálogo sincronizado, efectos de sonido y música de fondo en la misma pasada que las imágenes, en lugar de añadir audio en postproducción. Extendió los clips de una sola ejecución a 16 segundos, que era el más largo entre los modelos principales en ese momento. Y construyó un sistema de referencia a video donde los usuarios suben de tres a siete imágenes de un personaje, objeto o estilo y el modelo las usa como anclas visuales en generaciones posteriores.

El sistema de referencia es el interesante. La mayoría de los modelos de video en 2026 compiten en el mismo eje: hacer que un solo clip se vea impresionante. La apuesta de Vidu fue diferente. El argumento nunca fue "mira esta toma magnífica". Fue "mira este mismo personaje en diez tomas y observa que todavía parecen la misma persona".

Ese es un problema más difícil, y es del que realmente depende el contenido de series. En una comparación contra Runway Gen-4, Kling 3.0, Luma Ray, Pika 2.0 y Sora 2 usando el mismo prompt de personaje en seis variaciones de escena, Vidu Q3 mantuvo la consistencia facial y de vestuario en cinco de las seis pruebas.

La consistencia es lo que separa una herramienta para clips puntuales de una herramienta para una serie. Para creadores de anime, productores de drama corto y cualquiera que construya contenido de marca en torno a un personaje recurrente, cambia lo que es posible.

Por qué importan tres SKU

Dividir una familia de modelos en tres productos con nombre parece una elección de marketing. Está más cerca de una decisión de compra.

Tres cilindros oscuros simples en fila sobre una superficie reflectante con humo a la deriva

Un equipo de publicidad y un estudio de drama corto no compran lo mismo, aunque el transformer subyacente sea similar. El comprador de anuncios necesita fidelidad del producto, transiciones de escena limpias y audio que pueda colocarse bajo una voz de marca. El comprador de drama necesita un personaje que mantenga su identidad a lo largo de episodios y tomas, con expresiones que se lean como actuación. Empaquetarlos como IDs de modelo separados con documentación separada permite a cada comprador evaluar y presupuestar exactamente un trabajo, en lugar de leer una lista de características de propósito general y adivinar.

El modelo mixto de propósito general luego sirve a todos los que están fuera de ambas casillas, una estructura razonable para un mercado donde el comprador es cada vez más un equipo de producción con una fecha límite en lugar de un aficionado probando prompts.

Vidu Claw y la capa de pipeline

Empaquetar los modelos es la mitad de la estrategia. La otra mitad es una capa de ensamblaje. Vidu Claw es un motor de automatización de creación con IA construido sobre el framework de código abierto OpenClaw y potenciado por Q3. Conectas tus tokens de Vidu, defines Skills y automatizas el camino desde la idea hasta el video terminado. Un solo prompt como "crea un anuncio de formato corto para una zapatilla de running dirigido a mujeres jóvenes en Instagram" es suficiente para que Vidu Claw genere un concepto, guion, storyboard, visuales, voz en off, música y un corte final.

Las reseñas independientes han sido mixtas de una manera útil. Un reseñador que lo probó en un comercial de producto encontró que la plataforma era genuinamente gratuita y accesible para estudiantes y principiantes, pero informó que tenía dificultades con detalles estructurales precisos. En un caso, seguía renderizando un detalle de una manera que destacaba incluso después de repetidas correcciones del prompt, y la salida llevaba un sabor a IA notable, con iluminación y color que se sentían baratos.

Ese es el compromiso honesto. Vidu Claw es una herramienta de productividad para creadores individuales y pequeños equipos de marketing que necesitan pasar del concepto a un borrador utilizable rápidamente, más que un reemplazo para un equipo de producción profesional. Cuando funciona, comprime un ciclo de producción publicitaria de cinco días en uno. Cuando no, los problemas de calidad son difíciles de pasar por alto.

El ecosistema que Vidu está construyendo

El enfoque en referencia a video se conecta con una historia de distribución. En febrero de 2026, la empresa de software Wondershare anunció una inversión estratégica en Shengshu, y ambos planean trabajar en manga con IA. El modelo Vidu Q3 se integró en una plataforma de producción de manga con IA de cadena completa utilizada para mantener la consistencia de personajes, voces y escenas a lo largo de los episodios. La plataforma Bailian de Alibaba Cloud también agregó Vidu Q3 como modelo de terceros en mayo de 2026.

Así, el modelo viaja a través de al menos tres canales: acceso directo por web y API, una plataforma de creación dirigida al manga y drama corto, y un mercado de modelos en la nube. Cada canal tiene un comprador diferente con una definición diferente de "suficientemente bueno".

Dónde está realmente el dinero

El cambio hacia contenido de series no es una preferencia creativa. Es donde están los presupuestos. Un drama corto es un producto de múltiples episodios con un elenco recurrente, y su economía depende de producir mucho más metraje que un solo anuncio o un clip puntual. Si un modelo obliga al creador a volver a cero en la apariencia del personaje para cada toma, los ahorros del metraje generado se los comen las correcciones de consistencia. La apuesta de Vidu es que el equipo dispuesto a pagar $0.14 por segundo no está comprando una sola toma hermosa, sino una forma de mantener a la misma persona reconocible a lo largo de toda una serie.

Eso también explica por qué el sistema de referencia importa más que la puntuación de calidad bruta. Un modelo que ocupa el segundo lugar a nivel mundial en un benchmark es impresionante, pero el benchmark mide clips. La función de referencia mide series. Las dos no son la misma compra, y Vidu está vendiendo a la segunda.

Dónde aún no cumple

La consistencia de referencia no es perfecta, y cinco de seis no es seis de seis. Donde falló el sexto caso, la herramienta entregó una cara y un atuendo que se desviaron de la fuente, que es exactamente el fallo que rompe una serie. El costo es real a $0.14 por segundo, que se acumula rápidamente en un clip de 16 segundos y se vuelve significativo a escala de serie, donde hay cientos de tomas en juego. La capa de pipeline produce borradores en lugar de comerciales terminados, y los reseñadores han encontrado que no puede arreglar de manera confiable un detalle estructural incluso con repetidas correcciones del prompt.

También hay un límite estructural que vale la pena nombrar. La referencia a video ancla la identidad, pero aún no resuelve la continuidad de toda una producción. Alguien todavía tiene que tomar las decisiones de dirección que convierten un conjunto de clips consistentes en una historia, y el modelo no tiene opinión sobre el ritmo, la cobertura o si una escena debería existir siquiera.

Qué observar

La estructura de tres SKU es la parte que otros proveedores probablemente copiarán. Si la referencia a video se convierte en la forma predeterminada de hacer contenido de series, espera que más familias de modelos lancen variantes específicas para cada trabajo en lugar de un único buque insignia. Las preguntas que importan a continuación son si la consistencia se mantiene en duraciones más largas y trabajos de cámara más difíciles, y si la capa de pipeline se vuelve lo suficientemente buena como para venderse a un estudio en lugar de a un creador individual.

Artículos relacionados