← Voltar ao blog
Aicerca de 7 min de leitura

Destile uma vez, conecte-se a 54 modelos: LongLive-Plug da NVIDIA para vídeo

Publicado 3 de out. de 2026
Destile uma vez, conecte-se a 54 modelos: LongLive-Plug da NVIDIA para vídeo

Todo modelo de vídeo especializado tende a pagar o mesmo imposto. Você começa com um grande modelo de difusão, faz fine-tuning para algo específico, digamos um gerador condicionado por profundidade ou um simulador de robótica, e depois o destila para que ele rode rápido o suficiente para ser útil. A etapa de destilação é cara e, até agora, você pagava por ela de novo a cada novo modelo que criava. O LongLive-Plug da NVIDIA pergunta se essa etapa pode ser paga uma única vez.

O artigo, arXiv 2609.38154, foi publicado em 29 de setembro junto com seis arquivos de adaptador no Hugging Face. Ele vem do grupo Efficient-Large-Model da NVIDIA em colaboração com o MIT, e descreve um framework que os autores chamam de destilação once-for-all.

Para que serve a destilação de fato

Modelos de difusão para vídeo geram ao remover ruído de um latente ao longo de muitos passos. Trinta a cinquenta passos é o típico para os modelos deste artigo, e cada passo é uma passagem forward completa por um transformer de vários bilhões de parâmetros. O número de passos é a latência, então reduzi-lo é a alavanca de velocidade mais direta que existe.

Dois outros custos ficam ao lado disso. O classifier-free guidance, a técnica que aguça o quão fielmente uma amostra segue seu prompt, normalmente executa o modelo duas vezes por passo, uma condicionada ao prompt e outra sem, e então extrapola entre as duas. Isso dobra o custo computacional de cada passo. E modelos de vídeo autorregressivos, que geram um clipe longo pedaço por pedaço, acumulam erro à medida que avançam, então quadros tardios ficam borrados a menos que algo corrija o desvio.

Cada um desses três problemas tem sua própria receita de treinamento. O fluxo de trabalho usual executa a receita certa novamente em cada checkpoint especializado. A aposta do LongLive-Plug é que as receitas produzem algo reutilizável, então você não deveria precisar fazer isso.

A jogada: tratar uma capacidade destilada como uma LoRA

A ideia é congelar um modelo base para uma família de backbone, destilar uma capacidade uma vez em parâmetros LoRA e então anexar essa LoRA a qualquer modelo downstream compatível na família, sem mais treinamento. O adaptador foi ajustado ao comportamento do modelo base, e a alegação é que os descendentes da família compartilham esse comportamento de forma suficientemente próxima para que a mesma atualização funcione.

O LongLive-Plug divide o trabalho em três adaptadores separados por backbone. Um adaptador few-step reduz os passos de amostragem, treinado com destilação por correspondência de distribuição sob um professor guiado por CFG. Um adaptador CFG incorpora o guidance em uma única passagem condicional. Um adaptador de contexto longo corrige o acúmulo de erro em rollouts causais. A escolha de design importante é que eles são arquivos separados, em vez de um único módulo embutido, porque uma única LoRA treinada em uma escala de guidance fica presa ali. Separados, o peso do CFG vira um botão: aumentá-lo fortalece atributos do prompt sem executar novamente o ramo incondicional. A proporção recomendada no artigo é few-step para CFG de 1 para 0,5. Escalar uma única LoRA acoplada faz algo diferente e pior, movendo a atualização e a contagem de passos juntas e degradando a saída.

Os adaptadores também são construídos para sobreviver às mudanças que um modelo downstream faz. Adicionar ramos de condicionamento ou expandir canais de saída não os invalida, então o mesmo conjunto de arquivos se anexa a fine-tunes completos, LoRAs de tarefa e modelos com módulos de controle extras.

O que foi lançado e quanto custa testar

A coleção lançada contém seis adaptadores: um arquivo few-step e um CFG para cada MiniMax H3, Wan2.1-T2V-14B e Wan2.2-TI2V-5B. O arquivo few-step do Wan2.1-14B é o mais fácil de testar, porque é exportado com a nomenclatura lightx2v que os loaders de LoRA Wan do ComfyUI já leem. Coloque-o na pasta loras como qualquer outra LoRA de velocidade e ele funciona. Os adaptadores do MiniMax H3 são exportações PEFT, então precisam de uma etapa de conversão antes que o ComfyUI os carregue, e os model cards dizem para usar os arquivos few-step e CFG separadamente por enquanto, em vez de combiná-los.

A alegação de validação é o número de destaque: implantação sem treinamento em 54 modelos downstream, abrangendo três famílias de backbone e oito categorias de tarefa, incluindo modelagem de mundo, robótica, edição e geração multimodal. A comparação de custos do artigo coloca a destilação de base compartilhada em cerca de 80 horas de GPU, e o argumento é que tudo depois disso evita uma execução de treinamento por alvo.

Duas ressalvas honestas acompanham os resultados. A suposição de transferibilidade, de que uma LoRA destilada na base continua válida em descendentes que ganharam novos ramos, é verificada empiricamente nesses 54 modelos em vez de derivada da teoria. E assume-se que a composição aditiva dos adaptadores CFG e few-step treinados separadamente não interfere, com apoio dos resultados de transferência, mas sem prova. Esse é o tipo de suposição que tende a se sustentar em um benchmark e ocasionalmente falha em produção.

O que você pode realmente rodar hoje

O lançamento é pequeno o suficiente para valer a pena ser concreto sobre o que um usuário recebe. Seis arquivos, dois por backbone. Para o Wan2.1-T2V-14B, o adaptador few-step é exportado com a nomenclatura lightx2v que os loaders de LoRA Wan do ComfyUI já entendem, então funciona como uma LoRA de velocidade drop-in junto com fluxos de trabalho existentes. Esse é o ponto de entrada de menor atrito, e provavelmente é como a maioria das pessoas vai experimentar a ideia pela primeira vez.

Os outros dois backbones precisam de mais trabalho. Os adaptadores do MiniMax H3 vêm como exportações PEFT, o que significa uma etapa de conversão antes que o ComfyUI os carregue, e os model cards aconselham usar os arquivos few-step e CFG separadamente, em vez de empilhados, por enquanto. O Wan2.2-TI2V-5B também vem com a nomenclatura de adaptador PEFT. Nada disso é uma barreira para uma equipe confortável com as ferramentas, mas significa que o framework está mais próximo de um lançamento de pesquisa do que de um plug-in finalizado.

A pergunta mais interessante é o que os adaptadores reutilizáveis viabilizam além da velocidade. Se uma capacidade destilada pode se mover entre um modelo base e seus descendentes, então um simulador de robótica, um gerador condicionado por profundidade e um modelo de talking-head construídos sobre o mesmo backbone poderiam herdar o mesmo comportamento few-step e o mesmo controle de guidance sem que cada um pague por sua própria destilação. A verificação do artigo em 54 modelos em oito categorias de tarefa, de modelagem de mundo a edição, é a evidência para essa alegação. Se isso se sustentar em produção, o efeito prático é que um laboratório pode levar um novo especialista a uma velocidade utilizável em dias, e não semanas, porque a parte cara já foi feita uma vez.

Por que esta é a direção interessante

As LoRAs já mudaram como a comunidade de imagem e vídeo trabalha ao transformar fine-tuning em algo portátil. Você baixa um arquivo, anexa-o a um modelo base e obtém uma nova capacidade sem treinar nada. O LongLive-Plug aplica a mesma lógica um nível acima, à própria etapa de destilação. Se adaptadores de capacidade realmente transferem entre uma família, então a economia de lançar um modelo de vídeo especializado muda. Em vez de orçar uma execução de destilação por modelo, um laboratório orça uma por backbone e a reutiliza.

Isso importa mais onde os especialistas estão se multiplicando. Modelos de mundo, simuladores de robótica, controle condicionado por profundidade, geradores de talking-head e pipelines de edição são todos extensões de um pequeno número de backbones de vídeo. Cada um costumava carregar seu próprio imposto de velocidade. Tratar o imposto como um componente reutilizável é o próximo passo natural, e é o tipo de trabalho de infraestrutura pouco glamouroso que decide quão rápido o resto da área pode avançar.

Artigos relacionados