← Voltar ao blog
Aicerca de 7 min de leitura

SparkDiffusion reduz a geração de vídeo em 720p de 79 minutos para 18 segundos

Publicado 2 de out. de 2026
SparkDiffusion reduz a geração de vídeo em 720p de 79 minutos para 18 segundos

Um vídeo em 720p que levava cerca de 4.769 segundos para ser gerado agora leva aproximadamente 18 segundos em uma única RTX 5090. A equipe por trás do resultado — pesquisadores da Universidade de Pequim, de Tsinghua e da Alibaba — disponibilizou o código como open source sob o nome SparkDiffusion, e o ganho de velocidade de cerca de 265 vezes é o tipo de número que muda o que um pipeline pode fazer, e não apenas a rapidez com que ele termina.

A promessa merece ser confrontada com a forma como foi alcançada, porque um ganho de velocidade tão grande costuma esconder um asterisco. O SparkDiffusion combina três técnicas que vinham amadurecendo separadamente: atenção esparsa, destilação de poucos passos e quantização FP8. A atenção esparsa evita calcular a matriz de atenção completa, na qual os modelos de vídeo por difusão normalmente gastam a maior parte do tempo. A destilação de poucos passos treina o modelo para alcançar uma boa amostra em muito menos etapas de remoção de ruído do que as costumeiras dezenas. O FP8 reduz a precisão numérica do cálculo. Empilhe as três e a aritmética por vídeo desmorona.

Close extremo de uma pastilha de silício com rastros de luz azul e branca correndo por ela, sugerindo um ganho de velocidade muito grande

Por que o asterisco ainda importa

Tanto a atenção esparsa quanto a destilação de poucos passos trocam um pouco de qualidade por muita velocidade, e a pergunta honesta para quem for implantar isso é onde a qualidade acaba parando. Um número de 265x em uma única placa de classe consumidor é impressionante, e os mesmos métodos que o produzem podem suavizar detalhes finos ou reduzir a coerência de movimento. O artigo relata o ganho de velocidade; se o resultado sobrevive a uma avaliação profissional é o teste que um estúdio faria antes de confiar nele.

Mesmo com essa ressalva, a direção é significativa. A geração de vídeo sempre foi precificada como uma carga de trabalho de data center. Um clipe em 720p que precisa de um cluster para renderizar em tempo razoável empurra toda equipe para uma API, o que deixa o modelo de custos nas mãos de outra pessoa. Reduza o tempo de renderização para segundos em uma única GPU e a economia muda. A iteração fica barata, e iteração barata é o que transforma um gerador em uma ferramenta com a qual você realmente pode explorar.

A mesma história por outro ângulo

O SparkDiffusion não está sozinho no ataque ao custo do vídeo. O projeto Sana, da NVIDIA, lançou o SoL-Refiner, um modelo de refinamento de vídeo em um único passo que pega a saída de baixa resolução de qualquer gerador e a transforma em vídeo nítido em 2K ou 4K, com relato de 8,91 vezes mais rapidez de ponta a ponta. O design é complementar ao que o SparkDiffusion faz. O SparkDiffusion acelera a geração; o SoL-Refiner acelera o acabamento. Juntos, apontam para um pipeline de dois estágios em que o modelo caro faz menos e um refinador barato limpa o resultado.

Enquanto isso, a fronteira da qualidade continua avançando. A Artificial Analysis lançou o benchmark AA-Video-T2V v2.0, construído a partir de mais de 68.000 votos de preferência humana em cerca de 1.000 prompts, avaliando todos os modelos em 1080p. O Wan 3.0 lidera a tabela com um Elo de 1157 a 12 dólares por minuto, conquistando o primeiro lugar em 10 das 20 categorias de ranking. Esse valor de 12 dólares é a outra metade da história. Um modelo pode ser o melhor do mundo e ainda assim ser inviável em escala se cada minuto custa uma fração relevante do valor cobrado por um freelancer.

O que significa gerar vídeo em 18 segundos

A diferença entre 79 minutos e 18 segundos não é uma versão melhor do mesmo fluxo de trabalho. É um fluxo de trabalho diferente. A 79 minutos, o criador planeja com cuidado, assume um prompt e espera. A iteração é cara o bastante para que você a faça com parcimônia. A 18 segundos, você experimenta. Gera dez variações, olha todas lado a lado e mantém duas. A ferramenta deixa de ser algo que você instrui para se tornar algo com que você conversa, e essa mudança de interação costuma ser o que destrava a qualidade, não o modelo-base.

O mesmo aconteceu na geração de imagens. Quando uma boa imagem levava minutos, as pessoas escreviam prompts cuidadosos e tratavam cada geração como uma decisão. Quando o tempo caiu para segundos, começaram a escrever prompts de qualquer jeito, gerar em grande quantidade e selecionar. O teto de qualidade não subiu muito, mas o piso da produção utilizável subiu, porque a seleção absorve muita variância. Se o SparkDiffusion fizer pelo vídeo o que os samplers rápidos fizeram pelas imagens, o efeito vai aparecer primeiro na frequência com que uma equipe gera, e não em um clipe isolado dramaticamente melhor.

Há uma ressalva de hardware, e ela não é pequena. O número de 18 segundos é obtido em uma RTX 5090, uma placa de consumidor topo de linha. Rodar o mesmo pipeline na GPU intermediária que a maioria dos estúdios realmente possui será mais lento, e o ganho em relação à linha de base pode parecer menos dramático. Mas, para planejamento, a direção é o que importa, porque o preço do hardware subjacente está caindo ao mesmo tempo que a eficiência do software aumenta. As duas forças empurram no mesmo sentido.

A verdadeira disputa é a economia por segundo

Junte as duas metades e a corrida da geração de vídeo parecerá menos uma disputa pura de qualidade e mais uma disputa de custo. De um lado, os modelos ficam cada vez melhores e mais caros por segundo. Do outro, uma comunidade de pesquisa segue encontrando formas de executar o mesmo trabalho em silício mais barato e em menos tempo. Em quase todos os projetos reais, vence o lado que se move mais rápido em relação ao outro.

Há aqui um padrão que ecoa o mundo da geração de imagens. Um modelo de fronteira chega, obtém uma pontuação alta e recebe preço de produto premium. Então um projeto de pesos abertos mostra que a mesma tarefa é, em grande parte, uma questão de engenharia, e o preço desaba. O vídeo demorou mais para seguir esse arco porque as demandas de processamento são maiores, mas o SparkDiffusion e o SoL-Refiner são os primeiros sinais críveis de que isso está começando.

A consequência prática para uma equipe de conteúdo é que a decisão entre construir e comprar na geração de vídeo já não é óbvia. Seis meses atrás, pagar por uma API era a única rota acessível. Se uma única GPU consegue renderizar 720p utilizável em segundos, então, para equipes com volume constante, passar a ter o pipeline próprio começa a fazer sentido — ao menos para as passagens mais grosseiras, que só vão para um serviço pago quando precisam ficar finais.

O que observar

Três coisas vão decidir o quanto isso importa. Primeiro, se a qualidade do resultado acelerado se sustenta em testes independentes, e não apenas nas amostras do próprio artigo. Segundo, se o código aberto roda tão bem nas placas de consumidor que a maioria das equipes realmente possui quanto roda na RTX 5090 dos resultados. Terceiro, se os laboratórios de fronteira vão responder com preços mais agressivos, porque, se o fizerem, o incentivo para rodar localmente encolhe de novo.

Por ora, a mudança significativa é conceitual. A geração de vídeo está sendo reclassificada de serviço para um software que você mesmo pode rodar. Essa reclassificação é a mesma que transformou modelos de imagem de uma chamada de API em um fluxo de trabalho local no ComfyUI, e costuma terminar do mesmo jeito: com a fronteira no topo e uma camada ampla, barata e suficientemente boa por baixo fazendo a maior parte do trabalho.

Artigos relacionados