← Voltar ao blog
Aicerca de 7 min de leitura

Um modelo de imagem de 260M superou um rival 6,5x maior ao repetir os mesmos blocos

Publicado 6 de out. de 2026
Um modelo de imagem de 260M superou um rival 6,5x maior ao repetir os mesmos blocos

Um novo artigo propõe uma maneira diferente de escalar modelos de texto para imagem, e o resultado é o tipo de número que faz as pessoas olharem duas vezes. Ao executar repetidamente um conjunto de blocos Transformer compartilhados dentro de cada etapa de remoção de ruído, em vez de adicionar novos parâmetros, um modelo de 260 milhões de parâmetros teria superado um rival 6,5 vezes maior usando cerca de 4,9 vezes menos computação. A técnica é chamada de Looped Diffusion Transformer, e a ideia por trás dela é antiga o suficiente para ser familiar de outros campos do aprendizado de máquina.

Por que importa onde os parâmetros ficam

Contagem de parâmetros e computação costumam ser discutidas juntas, mas restringem coisas diferentes. Os parâmetros determinam quanta memória o modelo ocupa e, muitas vezes, se ele cabe no hardware que uma pessoa realmente possui. A computação determina quanto tempo uma geração leva e quanto custa para servir.

Um design que troca uma contagem de loops por parâmetros mira a primeira restrição sem ignorar a segunda. A economia de computação de 4,9 vezes relatada sugere que a troca é favorável nesse benchmark, embora resultados em um artigo não sejam o mesmo que resultados em um checkpoint lançado, e a estabilidade de treinamento de arquiteturas com loop tem sido uma preocupação recorrente em trabalhos anteriores.

A corrida de modelos de imagem abertos agora é sobre pegada de memória

O momento é relevante porque a comunidade de modelos de imagem abertos passou o último ano competindo em um eixo diferente. A pegada de memória tornou-se uma meta declarada, com modelos anunciados pela pouca VRAM de que precisam e técnicas de destilação que reduzem o número de etapas de amostragem. Abordagens que reduzem etapas e abordagens que reduzem parâmetros atacam o problema por duas pontas do mesmo pipeline. O Looped Diffusion Transformer fica na ponta dos parâmetros.

Um resultado relacionado do Stanford NLP segue uma direção comparável. Um método chamado UniEvo-VL usa autodestilação on-policy, na qual um único modelo atua como professor e aluno, para elevar a pontuação GenEval de um modelo de imagem baseado em Qwen de 0,747 para 0,808 sem um modelo professor externo. A linha condutora é a mesma: obter mais capacidade de um dado modelo em vez de treinar um modelo maior.

Isso é mais do que um gosto de pesquisa. O topo do ranking de modelos de texto para imagem de pesos abertos é um grupo apertado em um tamanho modesto. O Qwen-Image-2.1 lidera com cerca de 1.036 Elo com um componente de geração de 7 bilhões de parâmetros, à frente do FLUX.2 dev e do HunyuanImage 3.0 Instruct. O melhor modelo aberto ainda fica atrás do GPT Image 2.5 Sunburst, da OpenAI, que está perto de 1.197, por uma margem ampla. Se a fronteira está fora de alcance em tamanho, truques de eficiência se tornam a forma de laboratórios menores permanecerem na conversa.

As ressalvas honestas

Primeiro, a comparação principal é um único benchmark. Um rival 6,5 vezes maior perdendo para um modelo com loop em uma avaliação não significa que a técnica vence em todos os lugares, e a qualidade da imagem é notoriamente sensível a escolhas de prompt e amostrador. Segundo, vitórias autorrelatadas nesse campo costumam encolher sob testes independentes, especialmente quando a inferência não é executada em hardware e configurações idênticos. Terceiro, o loop troca simplicidade de treinamento por eficiência de inferência, e os modos de falha quando a contagem de loops é definida incorretamente não são óbvios a partir de um resumo de lançamento.

Nada disso desfaz a direção. A pergunta interessante para um criador que trabalha com isso não é se um modelo de 260M supera um rival 6,5x em uma tabela. É se o design aparece em checkpoints baixáveis que rodam em uma GPU de consumidor sem quatro horas de configuração. Esse tem sido o padrão com técnicas de eficiência: começam como artigos, são absorvidas em ajustes finos da comunidade e, em alguns meses, tornam-se uma expectativa em vez de um recurso.

O que observar

Fique de olho se designs com loop ou com pesos compartilhados aparecem em pesos lançados, e não apenas em artigos, e se a economia de computação sobrevive em resoluções mais altas, onde o custo de atenção domina. Observe os rankings após a próxima rodada de lançamentos abertos, já que uma técnica que reduz o piso de parâmetros tende a aparecer como vários modelos novos chegando de uma vez na mesma faixa de eficiência.

A lição mais ampla deste lote de pesquisas é que a conversa sobre escala na geração de imagens amadureceu. Adicionar parâmetros ainda funciona. Mas o trabalho mais ativo é fazer um dado modelo render mais com menos, e esse é o tipo de progresso que chega a um laptop mais cedo do que a um data center.

Por que o loop é uma ideia antiga com nova tração

O compartilhamento de pesos ao longo da profundidade não é novo. Ele aparece em redes recorrentes de anos atrás e em vários modelos de linguagem que reutilizam um bloco de camadas em vez de empilhar camadas únicas. O que o torna interessante para difusão agora é a estrutura do processo de geração. Produzir uma imagem acontece ao longo de muitas etapas de remoção de ruído, e cada etapa já executa a rede inteira. Fazer loop dentro de uma etapa adiciona um segundo eixo de repetição, o que significa que o multiplicador de computação e o ganho de qualidade podem ser ajustados de forma relativamente independente.

Os trade-offs são reais. Reutilizar pesos torna o treinamento mais difícil, porque gradientes de cada loop precisam fluir de volta pelos mesmos parâmetros, e um modelo que faz loop agressivamente demais pode perder detalhes finos. O resultado relatado usa uma contagem de loops específica que um artigo pode se dar ao luxo de ajustar; um checkpoint lançado precisa funcionar com prompts de uma ampla variedade de usuários, o que é um teste mais rigoroso.

Há também uma razão prática para a comunidade se importar mais do que o benchmark sugere. Quase todo modelo de imagem aberto em circulação é julgado em parte por quanta pouca VRAM ele precisa, porque as pessoas que os executam usam uma ou duas GPUs de consumidor, não um cluster. Um design que reduz o piso de parâmetros sem uma perda proporcional de qualidade fala diretamente a esse público, e esse público agora é grande o suficiente para moldar quais técnicas são adotadas.

A corrida armamentista da eficiência tem duas frentes

Ajuda separar as duas alavancas que costumam ser agrupadas como "eficiência". A destilação de etapas, que reduz o número de passagens de remoção de ruído, diminui principalmente o tempo de geração e o custo por imagem. A redução de parâmetros, que é o alvo de um design com loop, reduz principalmente a memória e o tamanho do download. Um modelo pode ser rápido e grande, ou lento e pequeno, e o melhor ajuste depende da máquina.

O último ano de lançamentos de modelos de imagem abertos pressionou fortemente a primeira alavanca, com variantes de quatro e dois passos se tornando a norma para qualquer coisa destinada a rodar de forma interativa. A segunda alavanca avançou mais lentamente, e é por isso que um resultado sobre eficiência de parâmetros se destaca. Se ele se mantiver, espere vê-lo combinado com um amostrador destilado, produzindo modelos que são pequenos o suficiente para caber e rápidos o suficiente para usar, que é mais ou menos onde a história da geração de imagens no dispositivo vem se encaminhando há algum tempo.

Nada disso é garantido por um único artigo. Mas a direção é clara, e o retorno é tangível para qualquer um que já esperou em uma fila para gerar uma única imagem.

Artigos relacionados