← Torna al blog
Aicirca 6 min di lettura

SparkDiffusion riduce la generazione video 720p da 79 minuti a 18 secondi

Pubblicato 2 ott 2026
SparkDiffusion riduce la generazione video 720p da 79 minuti a 18 secondi

Un video 720p che richiedeva circa 4.769 secondi per essere generato ora richiede circa 18 secondi su una singola RTX 5090. Il team dietro il risultato, ricercatori della Peking University, della Tsinghua University e di Alibaba, ha rilasciato il codice come open source con il nome SparkDiffusion, e l'accelerazione di circa 265 volte è il tipo di numero che cambia ciò che una pipeline può fare, non solo quanto velocemente termina.

L'affermazione va verificata rispetto a come è stata ottenuta, perché un'accelerazione così grande di solito nasconde un asterisco. SparkDiffusion combina tre tecniche che sono maturate ciascuna separatamente: attenzione sparsa, distillazione a pochi passi e quantizzazione FP8. L'attenzione sparsa evita di calcolare la matrice di attenzione completa su cui i modelli video di diffusione normalmente trascorrono la maggior parte del tempo. La distillazione a pochi passi addestra il modello a raggiungere un buon campione in molti meno passaggi di denoising rispetto alle solite decine. FP8 riduce la precisione numerica del calcolo. Mettile insieme e l'aritmetica per video crolla.

Primissimo piano di un wafer di silicio con scie di luce blu e bianca che lo attraversano, suggerendo un'accelerazione molto elevata

Perché l'asterisco conta ancora

L'attenzione sparsa e la distillazione a pochi passi scambiano entrambe un po' di qualità con molta velocità, e la domanda onesta per chiunque voglia implementare questa tecnologia è dove si attesta la qualità. Un valore di 265x su una singola scheda di classe consumer è impressionante, e gli stessi metodi che lo producono possono ammorbidire i dettagli fini o ridurre la coerenza del movimento. Il paper riporta l'accelerazione; se l'output superi una revisione professionale è il test che uno studio eseguirebbe prima di fidarsi.

Anche con questo avvertimento, la direzione è significativa. La generazione video è stata prezzata come un carico di lavoro da data center. Una clip 720p che richiede un cluster per essere renderizzata in tempi ragionevoli costringe ogni team a ricorrere a un'API, il che mette il modello di costo nelle mani di qualcun altro. Porta il tempo di rendering a pochi secondi su una singola GPU e l'economia cambia. L'iterazione diventa economica, e l'iterazione economica è ciò che trasforma un generatore in uno strumento con cui puoi davvero esplorare.

La stessa storia da un'altra angolazione

SparkDiffusion non è l'unico ad attaccare il costo del video. Il progetto Sana di NVIDIA ha rilasciato SoL-Refiner, un modello di raffinamento video in un solo passaggio che prende l'output a bassa risoluzione da qualsiasi generatore e lo trasforma in video nitido 2K o 4K, riportando una velocità end-to-end 8,91 volte superiore. Il design è complementare a ciò che fa SparkDiffusion. SparkDiffusion accelera la generazione; SoL-Refiner accelera la rifinitura. Insieme indicano una pipeline a due stadi in cui il modello costoso fa meno e un modello di rifinitura economico pulisce.

Nel frattempo la frontiera della qualità continua a spostarsi. Artificial Analysis ha lanciato il suo benchmark AA-Video-T2V v2.0, costruito da oltre 68.000 voti di preferenza umana su circa 1.000 prompt, valutando ogni modello a 1080p. Wan 3.0 guida la classifica con un Elo di 1157 a 12 dollari al minuto, conquistando il primo posto in 10 delle 20 classifiche di categoria. Quel dato di 12 dollari è l'altra metà della storia. Un modello può essere il migliore al mondo e comunque inutilizzabile su larga scala se ogni minuto costa una frazione significativa della tariffa di un freelance.

Cosa significa generare video in 18 secondi

La differenza tra 79 minuti e 18 secondi non è una versione migliore dello stesso flusso di lavoro. È un flusso di lavoro diverso. A 79 minuti, un creator pianifica con attenzione, si impegna su un prompt e aspetta. L'iterazione è abbastanza costosa da farla con parsimonia. A 18 secondi, provi le cose. Generi dieci varianti, le guardi fianco a fianco e ne tieni due. Lo strumento cambia da qualcosa a cui dai istruzioni a qualcosa con cui conversi, e questo cambiamento nell'interazione è di solito ciò che sblocca la qualità, non il modello di base.

La stessa cosa è successa nella generazione di immagini. Quando una buona immagine richiedeva minuti, le persone scrivevano prompt accurati e trattavano ogni generazione come una decisione. Quando è scesa a pochi secondi, hanno iniziato a scrivere prompt in modo approssimativo, generare in modo ampio e selezionare. Il tetto della qualità non è salito molto, ma il livello minimo dell'output utilizzabile sì, perché la selezione assorbe molta varianza. Se SparkDiffusion fa per il video ciò che i campionatori veloci hanno fatto per le immagini, l'effetto si vedrà prima nella frequenza con cui un team genera, non in una singola clip dramaticamente migliore.

C'è un avvertimento sull'hardware, e non è piccolo. Il dato di 18 secondi è su una RTX 5090, una scheda consumer di fascia alta. Eseguire la stessa pipeline sulla GPU di fascia media che la maggior parte degli studi possiede effettivamente sarà più lento, e l'accelerazione rispetto alla baseline potrebbe sembrare meno drammatica. Ma la direzione è ciò che conta per la pianificazione, perché il prezzo dell'hardware sottostante sta calando nello stesso momento in cui l'efficienza del software sta aumentando. Entrambe le forze spingono nella stessa direzione.

La vera sfida è l'economia al secondo

Metti insieme le due metà e la corsa alla generazione video appare meno come una gara puramente sulla qualità e più come una gara sui costi. Da un lato, i modelli continuano a migliorare e a costare di più al secondo. Dall'altro, una comunità di ricerca continua a trovare modi per eseguire lo stesso lavoro su silicio più economico in meno tempo. Il vincitore nella maggior parte dei progetti reali è il lato che si muove più velocemente rispetto all'altro.

C'è uno schema qui che riecheggia il mondo della generazione di immagini. Arriva un modello di frontiera, ottiene un punteggio elevato e viene prezzato come premium. Poi un progetto open-weights mostra che lo stesso compito è in gran parte una questione di ingegneria, e il prezzo crolla. Il video ha seguito più lentamente quella traiettoria perché le richieste di calcolo sono maggiori, ma SparkDiffusion e SoL-Refiner sono i primi segnali credibili che stia iniziando.

La conseguenza pratica per un team di contenuti è che la decisione se costruire o acquistare sulla generazione video non è più ovvia. Sei mesi fa, pagare un'API era l'unica strada accessibile. Se una singola GPU può renderizzare 720p utilizzabile in pochi secondi, allora per i team con volume costante, possedere la pipeline inizia ad avere senso, almeno per le versioni grezze che vengono inviate a un servizio a pagamento solo quando devono essere definitive.

Cosa tenere d'occhio

Tre cose decideranno quanto questo conta. Primo, se la qualità dell'output accelerato regge in test indipendenti anziché nei campioni dello stesso paper. Secondo, se il codice open source funziona in modo altrettanto pulito sulle schede consumer che la maggior parte dei team possiede effettivamente, come fa sulla RTX 5090 nei risultati. Terzo, se i laboratori di frontiera risponderanno con prezzi più aggressivi, perché se lo faranno, l'incentivo a eseguire localmente si ridurrà di nuovo.

Per ora, il cambiamento significativo è concettuale. La generazione video viene riclassificata da servizio a pezzo di software che puoi eseguire da solo. Questa riclassificazione è la stessa che ha trasformato i modelli di immagini da una chiamata API a un flusso di lavoro locale in ComfyUI, e tende a finire allo stesso modo: con la frontiera in cima e uno strato ampio, economico e sufficientemente buono sotto che fa la maggior parte del lavoro.

Articoli correlati