← Voltar ao blog
Aicerca de 8 min de leitura

Um modelo de imagem aberto que roda em quatro passos é mais importante do que parece

Publicado 2 de out. de 2026
Um modelo de imagem aberto que roda em quatro passos é mais importante do que parece

Em 4 de setembro, o laboratório Bailing do Ant Group lançou o LLaDA-Image, uma família de modelos abertos de geração e edição de imagens, e publicou os pesos e o código de inferência junto com ele. A manchete será lida como mais um lançamento de código aberto em um mês movimentado. O detalhe que importa está enterrado na arquitetura: a versão Turbo roda em dois a quatro passos de amostragem.

Se você já usou um modelo de imagem de difusão, sabe o que esse número significa. A maioria deles faz amostragem em dezenas de passos, e cada passo é uma passagem pela rede. Cinquenta passos é comum para uma imagem de qualidade. Reduzir isso para dois ou quatro não é uma pequena otimização. Isso muda para que o modelo pode ser usado.

O que o modelo realmente é

O LLaDA-Image vem em duas versões. A versão Base usa 50 passos de amostragem e visa geração de alta fidelidade. A versão Turbo usa destilação Twin-DMD para comprimir a amostragem em poucos passos, mantendo a qualidade próxima. Ambas compartilham uma única arquitetura, e a equipe diz que um único checkpoint lida com geração de texto para imagem, edição de imagem de referência e renderização de texto em chinês e inglês sem um backbone de edição separado. A contagem de parâmetros é de cerca de 7 bilhões, e pesos BF16 e FP8 são fornecidos para que o modelo possa ser implantado em diferentes hardwares.

A abordagem de treinamento é por estágios. A equipe primeiro pré-treina apenas com imagens para aprender priors visuais, depois adiciona supervisão de linguagem pareada e treinamento conjunto de geração-edição. A ideia é deixar o modelo compreender a estrutura visual antes de alinhá-la com a linguagem, o que a equipe diz melhorar tanto a qualidade da geração quanto a consistência da edição. O código de treinamento foi prometido para depois, o que significa que a alegação de "receita totalmente aberta" ainda não está completa.

No Qwen-Image-Bench, o modelo reporta uma pontuação de 53,53 para inglês e 53,38 para chinês, que a equipe descreve como estado da arte. Iluminação natural, detalhes finos, coerência de cena e geração criativa de pôsteres são destacados como pontos fortes. A verificação independente levará tempo, e o modelo é novo o suficiente para que a comunidade ainda não tenha testado exaustivamente esses números.

Por que menos passos muda o caso de uso

A contagem de passos não é um benchmark abstrato. Ela se mapeia diretamente para a latência, e a latência decide se um recurso pode existir.

Um modelo de 50 passos em uma GPU de ponta leva segundos por imagem. Isso é aceitável para uma ferramenta de desktop em que o usuário espera com uma barra de progresso. Não é aceitável para nada que precise parecer instantâneo. Um modelo de quatro passos pode plausivelmente retornar uma imagem em bem menos de um segundo no mesmo hardware, o que abre um conjunto diferente de produtos: ferramentas de design ao vivo que se atualizam enquanto você arrasta um controle deslizante, efeitos de câmera no aplicativo, pipelines em lote que processam milhares de ativos sem fila, e edição interativa em que cada alteração é renderizada imediatamente.

O design Turbo também reduz a computação necessária por imagem, o que importa para o custo. Se você executa um serviço que gera imagens em escala, a conta de GPU escala com passos e tokens. Cair de 50 passos para quatro é uma grande redução no custo de atender cada requisição, antes de qualquer mudança no hardware. Essa é a mesma pressão econômica à qual os modelos fechados vêm respondendo com suas próprias camadas baratas e rápidas.

Há um segundo benefício, mais discreto. Um modelo que roda em poucos passos em hardware de consumidor pode rodar localmente. Todo o argumento dos pesos abertos sempre foi sobre controle: seus dados ficam na sua máquina, seus custos são fixos em vez de medidos, e nenhum fornecedor pode mudar o preço ou desligar a API. Um modelo de quatro passos está muito mais perto do ponto em que um laptop ou uma GPU de médio porte pode hospedá-lo para trabalho real em vez de como uma demonstração. O próprio enquadramento da equipe diz que o design de poucos passos reduz a dependência de GPUs de ponta e torna a geração em tempo real possível em hardware de consumidor.

A onda mais ampla de modelos de imagem abertos

O LLaDA-Image não chegou sozinho. Setembro foi um mês movimentado para modelos de imagem abertos, e o momento importa. A Alibaba lançou o Qwen-Image-2.1 como pesos abertos, um modelo de 7B com dois checkpoints de reescrita de prompt de 9B, embora sob uma licença de pesquisa não comercial em vez dos termos permissivos que a linha usava antes. A ByteDance continuou impulsionando seus modelos Seedream no lado fechado, enquanto o Hunyuan Image 3.5 da Tencent seguiu a rota de aluguel por meio de uma API de nuvem.

Nesse contexto, o interessante no lançamento da Ant é para o que ele otimiza. A maior parte do setor está competindo em qualidade no topo: melhor renderização de texto, consistência de assunto mais forte, detalhes mais ricos em uma única imagem principal. O LLaDA-Image-Turbo compete na base. Todo o seu design é sobre tornar um modelo de imagem capaz, barato e rápido o suficiente para caber dentro de um produto cotidiano em vez de uma demonstração. Esse é um alvo menos glamouroso, e é o que tende a decidir quais ferramentas as pessoas realmente usam.

Há também um ângulo de renderização de texto que vale a pena notar. O modelo suporta geração de texto em chinês e inglês no mesmo checkpoint, o que aborda uma lacuna de longa data. Modelos de imagem abertos têm sido historicamente fortes em sinalização em línguas ocidentais e fracos em caracteres chineses, uma limitação que os tornava difíceis de usar para pôsteres, embalagens e infográficos voltados para mercados de língua chinesa. Uma única arquitetura que lida com ambos, segundo a equipe, é um passo significativo para qualquer pessoa que construa para esse público, e é o tipo de detalhe que não aparece em um benchmark de manchete, mas decide se uma ferramenta é utilizável na prática.

A questão do licenciamento

O lançamento é genuinamente aberto no sentido de que os pesos são baixáveis, o que o coloca na extremidade permissiva de um espectro que vem mudando o ano todo. Mas ele chega no meio de uma discussão mais ampla sobre licenciamento. Na mesma época, o Qwen-Image-2.1 da Alibaba foi lançado como pesos abertos sob uma licença de pesquisa não comercial, afastando-se de uma abordagem permissiva anterior. Essa divisão vale a pena observar. "Pesos abertos" agora cobre uma gama que vai de totalmente permissivo a somente pesquisa, e a diferença entre essas posições é a diferença entre um modelo no qual você pode construir um negócio e um no qual não pode.

Para desenvolvedores, a lição de setembro é ler a licença antes do benchmark. Um modelo que roda em quatro passos e tem uma boa pontuação em um benchmark de imagem é empolgante. Se você pode distribuí-lo dentro de um produto comercial é uma pergunta separada com uma resposta separada, e muitas vezes é a que decide o projeto.

Onde isso se encaixa

A tendência de modelos de imagem eficientes não está acontecendo isoladamente. Ela corresponde ao que está acontecendo em todo o setor. O Hunyuan Image 3.5 da Tencent cobra pela imagem final e impulsiona a edição multiturno, apostando que a iteração, não a primeira renderização, é onde está o valor. A OpenAI dividiu seu carro-chefe em um modelo rápido e um preciso, pedindo explicitamente que os desenvolvedores escolham com base na carga de trabalho. O LLaDA-Image-Turbo da Ant ataca o mesmo problema pelo lado aberto, reduzindo a computação por imagem em vez do preço por chamada.

O fio condutor é que a qualidade bruta de geração se tornou o mínimo esperado. Melhor iluminação e textura mais nítida não vencem mais sozinhas. A competição mudou para quanto custa executar, quão rápido responde e se você pode controlá-lo. Um modelo aberto de quatro passos é uma aposta nessa mudança, e é uma aposta que só faz sentido se o hardware e o licenciamento cooperarem. Se cooperarem, as ferramentas de imagem interessantes do próximo ano podem não ser as que têm a maior fazenda de renderização por trás delas. Podem ser as que são baratas o suficiente para rodar na máquina à sua frente.

Artigos relacionados