← Volver al blog
Aiaprox. 5 min de lectura

Vidu Q4 Preview abarata el video con muchas referencias

Publicado 11 oct 2026
Vidu Q4 Preview abarata el video con muchas referencias

Shengshu Technology puso Vidu Q4 Preview en vista previa publica el 7 de octubre de 2026, y el numero que llama la atencion es el precio. El precio de lanzamiento arranca cerca de 1,4 centavos por segundo, lo que la empresa describe como hasta cinco veces mas de salida por el mismo presupuesto en condiciones comparables. Es una afirmacion del proveedor, y la letra pequena dice que el precio es promocional y varia por plan y region. La trayectoria sigue clara: el coste de un segundo de video generado baja, y baja mas rapido donde es mas dificil de defender.

Si el unico argumento fuera el precio, este lanzamiento no mereceria un examen detenido. Lo hace interesante que la baratura llegue acompanada de controles que antes vivian en la gama cara.

Quince referencias, tres pistas de audio

Q4 Preview acepta hasta 15 referencias de imagen y hasta 3 de audio en una sola tarea. La salida llega a 2K o 4K con 10 bits, y los niveles disponibles empiezan en 540p para quien quiera comprobar antes una composicion. Shengshu situa el modelo en tres cosas: como actuan los personajes, como habla la camara y como se sostienen los efectos complejos.

El numero de referencias es lo que los creadores notaran primero. Guiar un modelo de video con una sola imagen es una herramienta tosca. Puede fijar una cara o un estilo, pero le cuesta sostener varias cosas a la vez. Dar muchas referencias permite fijar por separado la cara, el vestuario, un objeto y un escenario, y luego pedir al modelo que los mantenga coherentes mientras el plano se mueve. Esa es la diferencia entre generar un clip y planificar una escena.

Las referencias de audio responden a una logica parecida. Si puedes dar al modelo una voz y una base musical, te acercas a un plano terminado en una sola pasada en lugar de coser imagen y sonido despues. La empresa lo presenta como una bajada de barrera para personas, equipos y estudios pequenos que no pueden costear un equipo de produccion completo.

{{INLINE1}}

Por que los laboratorios chinos bajan los precios

Vidu no esta solo. El movimiento de Shengshu cae en la misma ventana que el nivel Lite mas barato de xAI y el trabajo continuo de ByteDance en tomas unicas mas largas. Lo comun de los laboratorios chinos de video es una carrera a la baja de precios combinada con un empuje en controlabilidad. Dos fuerzas lo explican.

Primero, la eficiencia de inferencia ha mejorado lo suficiente para que un precio por segundo mas bajo siga teniendo sentido en el lado del proveedor. Segundo, el mercado que paga precios altos es pequeno. Unos pocos estudios y agencias pagaran por la mejor salida, pero el volumen viene de todos los demas: vendedores de comercio electronico que prueban creatividades, equipos de miniseries, agencias que iteran conceptos y educadores que producen contenidos explicativos. Ese publico es sensible al precio por intento, porque su flujo de trabajo se basa en probar muchas versiones y quedarse con la que funciona.

Cuando Shengshu habla de cinco veces mas salida por el mismo presupuesto, en realidad habla de intentos. Un creador que ayer podia permitirse diez generaciones hoy puede permitirse cincuenta, y mas intentos significan mas posibilidades de dar con un plano utilizable. El coste de una toma descartada es la linea oculta de todo presupuesto de video con IA, y las generaciones baratas la reducen.

Que comprobar antes de cambiarse

La etiqueta de vista previa merece respeto. Q4 se describe como la primera mirada publica a un buque insignia de nueva generacion, lanzado antes del modelo completo, lo que significa que la version estable podria diferir en calidad, velocidad y precio. Las afirmaciones sobre coherencia y sincronizacion labial vienen de los propios materiales de la empresa, y las pruebas independientes a esta escala aun no son publicas. Quien planee montar una cadena de produccion sobre ello deberia probar primero con su propio material.

El otro punto a mirar es lo que la baratura no cubre. Las tareas con muchas referencias cuestan mas de procesar que las de una sola imagen, y la salida 4K no es el mismo producto que un borrador a 540p. Leer una tarifa por su cifra mas baja dice muy poco. La comparacion util es el coste de un plano terminado y aceptado, despues de los intentos que hayan hecho falta.

Hay un factor que no figura en la tarifa: cambiar de modelo significa reaprender a escribir prompts. Un modelo que se apoya en imagenes de referencia quiere otro tipo de instruccion que uno que se apoya en texto. Quien ha pasado meses desarrollando intuicion para un sistema paga un impuesto real al migrar, y por eso el precio solo rara vez gana un mercado. Los modelos que retienen a los usuarios son los que hacen que el flujo de referencias parezca obvio, de modo que saltar de una herramienta a otra no cueste una semana de reeducacion.

El verdadero giro es quien puede iterar

Durante la mayor parte de los ultimos dos anos, la generacion de video de alta calidad fue una herramienta para quien tenia presupuesto y una razon. Lo interesante de la actual ola de recortes de precios es que acerca la herramienta a cualquiera con una idea y un portatil. Eso cambia el tipo de trabajo que se produce. Los equipos dejan de racionar las generaciones y las usan como un boceto: baratas, desechables, rapidas.

La propia formulacion de Shengshu es reveladora. Su consejero delegado habla de convertir las ganancias de eficiencia en una barrera mas baja en lugar de un margen mas alto, y de resolver problemas reales en entornos reales. Si la vista previa cumple esa promesa es una pregunta abierta. Pero si el precio aguanta y los controles funcionan, el resultado mas importante no es un modelo mas barato. Es un numero mayor de personas que pueden permitirse fabricar lo que imaginan.

Artículos relacionados