Quatro passos em vez de quarenta: como a destilação está comprimindo modelos de imagem abertos para GPUs de consumidor

A distância entre um modelo de imagem aberto forte e uma placa de vídeo de consumidor vem se fechando há meses. O mecanismo é a redução do número de passos de desruído. Um modelo que antes precisava de quarenta passagens para transformar ruído em imagem agora chega lá em quatro, seis ou oito, se você acoplar o adaptador certo.
Dois lançamentos no início de outubro moveram essa fronteira novamente, em direções opostas: um artigo de pesquisa que repensa como a destilação é treinada, e uma LoRA de produção que aplica a ideia a um modelo aberto amplamente usado.
O DMAD transforma a correspondência de distribuições em um problema de classificação
O artigo é o DMAD, abreviação de Distribution Matching as Adversarial Distillation, de pesquisadores da Texas A&M e da ByteDance. Ele foi publicado pela primeira vez em 1º de outubro e aborda um custo bem conhecido da destilação.
A receita padrão funciona assim. Um modelo professor gera amostras de alta qualidade ao longo de muitos passos. Um modelo aluno precisa aproximar a mesma distribuição em um a quatro passos. Para orientar o aluno, treina-se um modelo de difusão auxiliar que continua se ajustando à distribuição atual do aluno, e então se usa a diferença entre o escore do professor e o escore do aluno para atualizar o aluno. O problema é que o aluno está sempre mudando, então o modelo auxiliar precisa ficar perseguindo-o. Memória e computação aumentam.
O DMAD reescreve o objetivo como classificação. Sobre um backbone de características compartilhado ficam duas cabeças discriminadoras. Uma separa dados reais de amostras do aluno. A outra separa amostras do professor de amostras do aluno. Em condições ótimas, o escore de saída do discriminador corresponde a um logaritmo da razão de densidades, o que significa que o aluno pode atualizar segundo um objetivo linear derivado do escore do discriminador. Nenhum modelo de escore auxiliar separado é necessário.
O segundo ingrediente é a supervisão dependente do nível de ruído. Um professor está próximo da distribuição real em alguns níveis de ruído e visivelmente desviado em outros. O DMAD mede a diferença empírica de escore entre amostras reais e amostras do professor com a primeira cabeça discriminadora, e então repondera o treinamento do aluno de acordo, de modo que o aluno herda menos do viés do professor nos níveis de ruído em que o professor é mais fraco. Isso converte uma suposição — “o professor está sempre certo” — em algo mensurável.
Os resultados abrangem três escalas. No treinamento de classificação de imagens no ImageNet, a geração de 64x64 em um passo alcançou FID de 1,04. O FID mede o quão diferente a distribuição gerada é da real, e quanto menor, melhor.
A versão de produção já está sendo distribuída
A mesma ideia chega aos usuários por meio de adaptadores LoRA, e não de artigos. A Alibaba PAI publicou os Qwen-Image-2.1-Fun-Acc-LoRAs no Hugging Face, aplicando destilação por decodificação paralela para reduzir a inferência das 40 avaliações de função neural do professor para 4, tanto para texto-para-imagem quanto para edição baseada em instruções. O adaptador é de rank 64 com alpha de rede 64 em BF16, e o cartão do modelo fornece scripts de início rápido para Diffusers e VideoX-Fun.
O cartão do modelo é franco quanto aos trade-offs. Textos pequenos e densos degradam em comparação com o professor, e as edições de imagem saem ligeiramente mais desfocadas ou mais escuras. Para um pôster com um parágrafo de letras miúdas, quatro passos não é a ferramenta certa. Para imagens em formato de redes sociais, onde o texto é curto e grande, é.
Um segundo adaptador vai além em qualidade. O Qwen-Image-2.1 Turbo v0.2.1 é uma LoRA de rank 128 e seis passos, de cerca de 648 megabytes, que comprime a longa ODE de fluxo de probabilidade do modelo base de flow matching em um cronograma sigma que vai de 1,0 a 0,25. Seis passos é um ajuste intermediário: passagens suficientes para manter o detalhe, poucas o bastante para continuar rápido.
Destilações da comunidade preenchem o resto da escada. Um adaptador turbo da Viggle mira quatro passos. Os adaptadores da PrunaAI miram cinco ou oito. Ambos são honestos ao dizer que são trabalhos em andamento, e as notas da Pruna dizem que a versão de poucos passos ainda não iguala o modelo base em composição com múltiplas referências, trocas de rosto e edições com várias restrições.
O Krea 2 Turbo seguiu outro caminho no licenciamento. Seus adaptadores de destilação em dois e quatro passos agora vêm com workflows Apache-2.0 para o Comfy Cloud, o ComfyUI local e o Apple MLX, com troca automática de passos. Apache-2.0 na camada de workflow importa para quem quer construir um produto em cima sem passar por revisão jurídica.
O que de fato muda para quem roda isso
O efeito prático é que o mesmo hardware produz mais imagens, e as configurações que importam mudam. Tópicos da comunidade sobre o Qwen 2.1 recomendam CFG de 2,0 a 3,0 e 40 passos quando uma LoRA está carregada, junto com um VAE de correção de textura de cerca de 676 megabytes. Outros relatam que o workflow padrão a 2,0 megapixels sem LoRA agora produz uma qualidade de renderização que modelos abertos anteriores raramente alcançavam.
A leitura honesta é que a destilação de poucos passos é uma troca, não um almoço grátis. A fidelidade de texto, a precisão de edição e a consistência entre múltiplas referências são as primeiras coisas a sofrer, porque essas são as tarefas que precisam do maior número de passagens para se resolver. A aderência ao prompt em um único tema claro se mantém bem.

Isso sugere um fluxo de trabalho, e não uma configuração única. Faça um rascunho em quatro passos, escolha a composição que você quer e então re-renderize o quadro escolhido com a contagem total de passos. Os adaptadores de destilação tornam a exploração barata e deixam a passagem final em qualidade total.
O que a pesquisa acrescenta além dos adaptadores
As LoRAs que os usuários baixam são a ponta visível desse trabalho, mas o artigo do DMAD explica por que a próxima geração de adaptadores deve ser melhor. A receita antiga precisava de um modelo auxiliar ativo para acompanhar a distribuição cambiante do aluno, e essa sobrecarga crescia a cada passo de treinamento. Recortar o objetivo como um par de discriminadores elimina o modelo auxiliar, o que significa que o mesmo orçamento de GPU pode treinar um aluno mais forte.
A ideia de reponderação é a contribuição mais duradoura. Tratar o professor como uniformemente correto é a suposição que limita o quão bom um aluno destilado pode ser, porque um aluno treinado contra os piores momentos do professor herda esses erros. Medir onde o professor diverge dos dados reais e reduzir o peso dessas regiões é uma técnica geral, e deve se transferir para difusão de vídeo, áudio e qualquer outra modalidade generativa em que a destilação é usada para cortar o custo de inferência.
Como decidir se um adaptador destilado é suficiente
A decisão se resume ao tipo de tarefa. Adaptadores de poucos passos lidam bem com composições de tema único, bem iluminadas e em formato grande. Eles têm dificuldade com qualquer coisa que precise de muitas passagens para se resolver: parágrafos de texto pequeno, tipografia fina, edições que devem preservar a identidade em múltiplas referências e instruções que empilham várias restrições ao mesmo tempo. Esses são exatamente os casos sobre os quais os cartões de modelo alertam, e os avisos são consistentes entre os fornecedores.
O licenciamento é a outra variável. Alguns desses adaptadores carregam termos de pesquisa ou de outra forma restritos, e a questão do uso comercial nem sempre está resolvida no cartão do modelo. O lançamento da Alibaba PAI lista sua licença como “other”, sem declarar os termos comerciais, o que significa que uma equipe que o implanta em um produto tem lição de casa a fazer antes de lançar. Os workflows Apache-2.0 da Krea são a exceção, e essa permissividade provavelmente importará para quem constrói um serviço comercial em cima.
A direção do movimento é clara. Modelos de imagem abertos estão sendo comprimidos para o hardware que as pessoas já têm, e a compressão acontece em público, com pesos, cartões de modelo e limitações declaradas. Essa abertura é útil por si só, porque permite que um comprador julgue as trocas antes de se comprometer. Um fornecedor fechado pode cortar qualidade em uma atualização e chamar isso de melhoria de velocidade. Um adaptador publicado com um cartão de modelo que nomeia seus pontos fracos não pode.
Uma nota sobre o que medir
Alegações de velocidade nesse espaço são fáceis de exagerar, porque a contagem de passos é apenas uma das entradas da latência. Resolução, tamanho do lote, sampler e o número de imagens geradas por prompt mudam o tempo de relógio de parede muito mais do que a contagem de passos manchete sugere. Um adaptador de quatro passos em alta resolução numa placa intermediária pode ser mais lento que uma execução de quarenta passos em resolução de rascunho no mesmo hardware.
A comparação que importa para um comprador é imagens por minuto na qualidade que ele realmente precisa, no hardware que ele realmente possui. Os cartões de modelo raramente relatam esse número, então ele precisa ser medido localmente. Os adaptadores tornam a medição barata, e esse é o verdadeiro benefício. Quatro passos é rápido o suficiente para rodar o experimento que diz se quatro passos foi suficiente.
O que observar a seguir
Os adaptadores e o artigo apontam na mesma direção. O custo de inferência para modelos de imagem abertos continua caindo, e cada nova destilação estreita a distância entre uma placa de consumidor e um acelerador alugado. A pergunta que vale acompanhar é se a próxima rodada de adaptadores fecha a lacuna de renderização de texto e fidelidade de referência, ou se esses limites acabam sendo intrínsecos à própria geração de poucos passos. Até que isso se resolva, a postura sensata é tratar a contagem de passos como um botão entre vários, e medir imagens por minuto no hardware que você realmente possui.
Artigos relacionados
BOSSFIGHT fez modelos de fronteira atuarem como donos de cafeteria por 24 semanas. A maioria perdeu para o não fazer nada.
Resistir a um suborno em um questionário e recusar-se a ceder em um trimestre real são duas habilidades diferentes, e as avaliações atuais tendem a medir a mais fácil.
NASA e IBM disponibilizam em código aberto um modelo de fundação lunar treinado com 17 anos de dados de orbitadores
O modelo é útil para encontrar e caracterizar feições, e não é confiável para dizer exatamente onde elas estão com alta precisão.
Agentes começaram a dirigir curtas-metragens nesta semana. O gargalo passou para o controle de qualidade.
A geração é barata, a orquestração é o produto, e o que decide se um pipeline é útil é se ele consegue perceber quando falhou.
Reka Rho-1 coloca compreensão e geração no mesmo cache KV
Os mesmos pesos que preveem uma imagem de câmera também controlam o movimento do robô, porque ambos vivem no mesmo espaço representacional.