← Volver al blog
Aiaprox. 7 min de lectura

SparkDiffusion reduce la generación de video en 720p de 79 minutos a 18 segundos

Publicado 2 oct 2026
SparkDiffusion reduce la generación de video en 720p de 79 minutos a 18 segundos

Un video en 720p que tardaba unos 4.769 segundos en generarse ahora tarda unos 18 segundos en una sola RTX 5090. El equipo detrás del resultado, investigadores de la Universidad de Pekín, Tsinghua y Alibaba, publicó el código como código abierto bajo el nombre SparkDiffusion, y la aceleración de aproximadamente 265 veces es el tipo de cifra que cambia lo que puede hacer un pipeline, no solo lo rápido que termina.

Vale la pena contrastar la afirmación con cómo se logró, porque una aceleración tan grande suele esconder un asterisco. SparkDiffusion combina tres técnicas que han ido madurando por separado: atención dispersa, destilación de pocos pasos y cuantización FP8. La atención dispersa evita calcular la matriz de atención completa en la que los modelos de video de difusión normalmente pasan la mayor parte del tiempo. La destilación de pocos pasos entrena al modelo para alcanzar una buena muestra en muchos menos pasos de eliminación de ruido que las docenas habituales. FP8 reduce la precisión numérica del cómputo. Al apilarlas, la aritmética por video se derrumba.

Primer plano extremo de una oblea de silicio con estelas de luz azul y blanca cruzándola a toda velocidad, lo que sugiere una aceleración muy grande

Por qué el asterisco sigue importando

Tanto la atención dispersa como la destilación de pocos pasos intercambian un poco de calidad por mucha velocidad, y la pregunta honesta para cualquiera que despliegue esto es dónde queda la calidad. Una cifra de 265x en una sola tarjeta de gama de consumo es impresionante, y los mismos métodos que la producen pueden suavizar el detalle fino o reducir la coherencia del movimiento. El artículo informa de la aceleración; si el resultado sobrevive a una revisión profesional es la prueba que haría un estudio antes de confiar en él.

Incluso con esa salvedad, la dirección es significativa. La generación de video se ha tarificado como una carga de trabajo de centro de datos. Un clip en 720p que necesita un clúster para renderizarse en un tiempo razonable obliga a todos los equipos a usar una API, lo que pone el modelo de costes en manos de otro. Reduce el tiempo de renderizado a segundos en una GPU y la economía cambia. La iteración se abarata, y la iteración barata es lo que convierte un generador en una herramienta con la que realmente puedes explorar.

La misma historia desde otro ángulo

SparkDiffusion no está solo en atacar el coste del video. El proyecto Sana de NVIDIA lanzó SoL-Refiner, un modelo de refinamiento de video de un solo paso que toma la salida de baja resolución de cualquier generador y la convierte en video nítido en 2K o 4K, con una mejora reportada de 8,91 veces más rápido de extremo a extremo. El diseño es complementario a lo que hace SparkDiffusion. SparkDiffusion acelera la generación; SoL-Refiner acelera el pulido. Juntos apuntan a un pipeline de dos etapas donde el modelo caro hace menos y un refinador barato se encarga de limpiar.

Mientras tanto, la frontera de calidad sigue avanzando. Artificial Analysis lanzó su benchmark AA-Video-T2V v2.0, construido a partir de más de 68.000 votos de preferencia humana en alrededor de 1.000 prompts, y juzga cada modelo a 1080p. Wan 3.0 encabeza la clasificación con un Elo de 1157 a 12 dólares por minuto, y ocupa el primer lugar en 10 de 20 rankings por categoría. Esa cifra de 12 dólares es la otra mitad de la historia. Un modelo puede ser el mejor del mundo y seguir siendo inutilizable a escala si cada minuto cuesta una fracción significativa de la tarifa de un freelancer.

Qué significa generar video en 18 segundos

La diferencia entre 79 minutos y 18 segundos no es una mejor versión del mismo flujo de trabajo. Es un flujo de trabajo distinto. A 79 minutos, un creador planifica con cuidado, se compromete con un prompt y espera. La iteración es lo bastante cara como para hacerla con moderación. A 18 segundos, pruebas cosas. Generas diez variantes, las miras lado a lado y te quedas con dos. La herramienta pasa de ser algo que instruyes a algo con lo que conversas, y ese cambio en la interacción suele ser lo que desbloquea la calidad, no el modelo base.

Lo mismo ocurrió en la generación de imágenes. Cuando una buena imagen tardaba minutos, la gente escribía prompts cuidadosos y trataba cada generación como una decisión. Cuando bajó a segundos, empezaron a escribir prompts de cualquier manera, a generar en amplitud y a seleccionar. El techo de calidad no subió mucho, pero el suelo de la salida utilizable sí, porque la selección absorbe mucha varianza. Si SparkDiffusion hace por el video lo que los muestreadores rápidos hicieron por las imágenes, el efecto se notará primero en la frecuencia con la que genera un equipo, no en que un clip concreto sea drásticamente mejor.

Hay una salvedad de hardware, y no es pequeña. La cifra de 18 segundos corresponde a una RTX 5090, una tarjeta de consumo de gama alta. Ejecutar el mismo pipeline en la GPU de gama media que la mayoría de los estudios realmente tiene será más lento, y la aceleración respecto a la línea base puede parecer menos espectacular. Pero la dirección es lo que importa para planificar, porque el precio del hardware subyacente cae al mismo tiempo que sube la eficiencia del software. Ambas fuerzas empujan en la misma dirección.

La verdadera contienda es la economía por segundo

Si juntamos las dos mitades, la carrera de la generación de video parece menos una contienda de calidad pura que una de costes. Por un lado, los modelos siguen mejorando y encareciéndose por segundo. Por otro, una comunidad de investigación sigue encontrando formas de ejecutar el mismo trabajo en silicio más barato y en menos tiempo. El ganador en la mayoría de los proyectos reales es el lado que se mueve más rápido en relación con el otro.

Hay un patrón aquí que resuena con el mundo de la generación de imágenes. Llega un modelo de frontera, obtiene una puntuación alta y se tarifica como premium. Luego un proyecto de pesos abiertos demuestra que la misma tarea es en gran medida una cuestión de ingeniería, y el precio se derrumba. El video ha tardado más en seguir ese arco porque las demandas de cómputo son mayores, pero SparkDiffusion y SoL-Refiner son las primeras señales creíbles de que está empezando.

La consecuencia práctica para un equipo de contenido es que la decisión de construir frente a comprar en generación de video ya no es obvia. Hace seis meses, pagar una API era la única ruta asequible. Si una sola GPU puede renderizar 720p utilizable en segundos, entonces, para equipos con volumen constante, tener el pipeline propio empieza a tener sentido, al menos para las pasadas preliminares que solo se envían a un servicio de pago cuando necesitan ser finales.

Qué hay que observar

Tres cosas decidirán cuánto importa esto. Primero, si la calidad de la salida acelerada se mantiene en pruebas independientes en lugar de en las muestras del propio artículo. Segundo, si el código abierto se ejecuta en las tarjetas de consumo que la mayoría de los equipos realmente tiene con la misma limpieza que en la RTX 5090 de los resultados. Tercero, si los laboratorios de frontera responden con precios más agresivos, porque si lo hacen, el incentivo para ejecutar en local se reduce de nuevo.

Por ahora, el cambio significativo es conceptual. La generación de video está siendo reclasificada de un servicio a una pieza de software que puedes ejecutar tú mismo. Esa reclasificación es la misma que convirtió los modelos de imagen de una llamada a una API en un flujo de trabajo local de ComfyUI, y suele terminar de la misma manera: con la frontera arriba y una capa amplia, barata y suficientemente buena debajo haciendo la mayor parte del trabajo.

Artículos relacionados