← Voltar ao blog
Aicerca de 7 min de leitura

Ming-Image, do Ant Group, projeta em camadas, não em imagens planas

Publicado 2 de out. de 2026
Ming-Image, do Ant Group, projeta em camadas, não em imagens planas

A maioria dos modelos de imagem é avaliada pela qualidade de uma única imagem. O Ant Group lançou em 22 de setembro dois modelos que propõem um teste diferente: se aquilo que você recebe de volta ainda pode ser editado depois que você terminar de olhar para ele.

O laboratório inclusionAI, da Ant, publicou o Ming-Image-0.1-Design e o Ming-Image-0.1-Design-Layer no Hugging Face, ambos com seis bilhões de parâmetros sob a licença MIT. Essa licença importa mais do que o habitual aqui, porque permite que uma empresa use o resultado comercialmente sem negociar nada antes. A dupla é voltada para trabalho de design, não para fotografia. Telas de interface, infográficos, pôsteres e o tipo de layout em que as palavras realmente precisam ser legíveis.

Textos pequenos são onde os modelos de imagem abertos costumam desmoronar. O Ming-Image-0.1-Design gera toda a composição, texto incluído, e consegue escrever arquivos RGBA, então o fundo sai transparente em vez de um retângulo branco chapado. O model card sugere 2048 por 2048, ou 1024 por 1024 se você quiser mais velocidade, com 12 passos de amostragem e escala CFG de 1,0. Doze passos é pouco para um modelo de difusão. Depois que os pesos carregam, o resultado sai rápido. Roda na biblioteca diffusers padrão e oferece suporte a vLLM-Omni para serving.

O segundo modelo é o interessante. O Ming-Image-0.1-Design-Layer pega um design finalizado e achatado e o divide de volta em camadas transparentes, seguindo um plano de camadas que você fornece, indicando quantas peças você quer. O que você obtém se parece mais com um arquivo de design em edição do que com um único PNG chapado.

Um design gráfico chapado se dividindo em cinco painéis transparentes empilhados no espaço tridimensional, cada um contendo um elemento visual diferente

Essa lacuna é a razão pela qual a maioria dos modelos de imagem fica aquém do trabalho de design de verdade. Se um cliente quer o título movido e o logotipo trocado, um PNG chapado obriga a uma regeneração completa, e tudo o mais na tela vai junto. Camadas permitem mudar apenas aquela coisa. A Ant avalia isso no conjunto de testes Crello, medindo o quão próxima cada camada recuperada está em cor e em forma.

Os números que a Ant não publicou

Não há nenhum número que você possa citar. O model card aponta para o leaderboard de UI/UX Design da Artificial Analysis e para os resultados do Crello, mas ambos aparecem apenas como imagens de gráficos. Nenhum número no texto, nenhum concorrente nomeado. Não dá para saber pelo lançamento como o Ming-Image-0.1-Design se compara ao Qwen-Image, ao Seedream ou a qualquer modelo comercial, e nenhuma das alegações pode ser verificada sem refazer a avaliação por conta própria.

A orientação de hardware também tem uma lacuna. A Ant validou o modelo de 6B em uma única GPU CUDA com 80 GiB de VRAM, o que é muito mais folga do que a contagem de parâmetros sugere. O card não dá nenhuma orientação para placas de consumo de 24 GB, mesmo que quantizações da comunidade feitas exatamente para essas placas tenham aparecido em poucas horas. Builds INT4, INT8, FP8, GGUF e ComfyUI surgiram todos no mesmo dia.

Vale a pena parar nesse último detalhe. Um laboratório de modelos publica um requisito de 80 GiB, e a comunidade responde fazendo o modelo rodar em uma placa com um terço desse tamanho. O número oficial descreve o que a Ant testou, não o que o modelo precisa. Qualquer equipe avaliando a adoção deve tratar a configuração validada como ponto de partida e verificar o que os builds quantizados realmente fazem no próprio hardware.

Por que camadas mudam o fluxo de trabalho

Trabalho de design não é uma sequência de imagens finalizadas. É uma sequência de revisões. O cliente vê um rascunho, pede o título maior e o fundo mais frio, depois decide que o logotipo deveria ficar do outro lado. Cada um desses pedidos é pequeno. Em uma imagem chapada, cada um também é caro, porque mudar um elemento significa regenerar uma composição que já havia sido aprovada em todo o resto.

A saída em camadas inverte isso. Uma vez que o design existe como peças separadas, uma revisão mexe na peça a que se refere e deixa o resto em paz. Para uma agência que cobra por hora, a diferença aparece na margem. Para um designer autônomo, aparece em se a ferramenta é mais rápida do que fazer à mão.

O outro lugar em que as camadas compensam é na entrega. Um PNG achatado é um beco sem saída. Qualquer pessoa a jusante que precise ajustá-lo começa do zero. Um arquivo em camadas pode migrar para as ferramentas que uma equipe de design já usa, e essa é a diferença entre uma ferramenta de IA que fica ao lado de um fluxo de trabalho e uma que se integra a ele.

A corrida de edição da qual isso faz parte

A Ant não está lançando isso no vazio. Em todo o mercado de imagens, a edição se tornou o ponto em que os modelos se diferenciam. O GPT Image 2.5 Sunburst está no topo dos leaderboards de edição, com seu irmão Flare logo atrás. O Nano Banana Pro continua sendo o caminho fácil para travar identidade sem fine-tuning, e mistura até catorze imagens e cinco pessoas. O Seedream 5.0 combina edição com busca na web ao vivo, o que ajuda quando uma edição precisa de uma referência real. No lado aberto, o FLUX.1 Kontext cuida de edições que preservam o layout e que você mesmo executa, e o Qwen-Image-Edit lidera os rankings de edição com pesos abertos.

Diante desse cenário, o Ming-Image faz uma aposta estreita. Ele não está tentando vencer a arena geral de edição. Está apostando que design com muito texto é uma fatia grande o bastante do mercado para sustentar um modelo especializado, e que a decomposição em camadas é um recurso que os modelos gerais não vão se dar ao trabalho de construir porque não aparece em um vídeo de demonstração.

Essa aposta tem uma história por trás. Os modelos de imagem abertos passaram dois anos perseguindo o fotorrealismo, e a diferença de qualidade entre pesos abertos e fechados diminuiu muito. O que não diminuiu foi a distância entre um modelo que produz uma imagem e um modelo que produz um ativo. Uma imagem está pronta quando parece certa. Um ativo está pronto quando pode ser entregue a outra pessoa e modificado. O Ming-Image mira a segunda categoria, que é uma coisa mais difícil de demonstrar em um post de lançamento e uma coisa mais útil de se ter em uma terça-feira à tarde.

Para quem isso realmente serve

Se você produz ativos de design em volume e o texto dentro deles precisa ser legível, vale testar agora. Uma pequena equipe de marketing que produz cards para redes sociais, variações de anúncios e apresentações internas é o encaixe mais claro, e a licença MIT não coloca nada nos termos entre você e o uso comercial.

O modelo de camadas é por onde eu começaria, porque a saída em camadas é justamente o que sua ferramenta de imagem atual quase certamente não faz. Todo o resto aqui, um modelo texto-para-imagem que renderiza tipografia legível, tem concorrência. A capacidade de pegar um design chapado finalizado e devolver um arquivo editável, não.

O primeiro teste que vale rodar é a renderização de texto em tamanhos pequenos em um idioma que não seja o inglês. É aí que os modelos dessa classe costumam falhar, e o lançamento não diz nada sobre isso. Tipografia multilíngue é o requisito oculto por trás da maior parte do trabalho de design real, e um modelo que só lida bem com escrita latina é um modelo com teto.

Se o seu resultado é fotográfico e não tipográfico, nada disso se aplica. O Ming-Image não está tentando competir com os modelos que renderizam pessoas e paisagens bonitas. Ele mira a metade nada glamourosa do design, a parte em que um pôster precisa de um título no lugar certo e um card de produto precisa de um preço que um humano consiga ler. Essa metade espera há um tempo por um modelo que a leve a sério.

Artigos relacionados