← Voltar ao blog
News7 min

Qwen-Image 2.1 vs Nano Banana 2.0: Um Modelo Aberto de 7B Acabou de Chegar nos Calcanhares do Google

Publicado 27 de set. de 2026
Qwen-Image 2.1 vs Nano Banana 2.0: Um Modelo Aberto de 7B Acabou de Chegar nos Calcanhares do Google

A Alibaba lançou o Qwen-Image 2.1 em 20 de setembro, e a conversa sobre benchmarks não foi mais a mesma desde então. Um gerador de imagens de 7 bilhões de parâmetros com pesos baixáveis agora está à frente do Nano Banana 2.0 do Google no ranking da própria Alibaba, e perto o suficiente em leaderboards independentes para que as pessoas olhem duas vezes. A thread no Hacker News sobre o lançamento atraiu mais de 700 pontos e quase 200 comentários em um dia, o que mostra quanta atenção reprimida essa categoria tem.

Os números, e por que eles importam

No Qwen-Image-Bench da Alibaba, o novo modelo pontua 60,28 contra 59,82 do Nano Banana 2.0. Essa é uma vantagem de meio ponto, que importa menos como afirmação técnica e mais como um sinal: a Alibaba agora está nomeando o Google como o benchmark que pretende superar. O único modelo de pesos abertos com menos parâmetros, o LongCat-Image de 6B da Meituan, fica atrás com cerca de 54 pontos. Para comparação, o GPT Image 2.5 Sunburst da OpenAI lidera o ranking da Alibaba com 67, e o Muse Image fica em 62,34, ambos fechados.

O AI Arena, que realiza votações cegas entre humanos, conta uma história mais modesta. O Nano Banana 2.0 mantém 1260 Elo contra 1228 do Qwen-Image 2.1, com o GPT Image Sunburst no topo com 1423 e o Muse com 1276. O modelo aberto ainda não está vencendo essa disputa. No entanto, está classificado em primeiro lugar entre todos os modelos de pesos abertos tanto na Image Edit Arena quanto na Text-to-Image Arena, que é a categoria que muitas pessoas realmente se importam. A própria conta da Qwen o descreveu como "o modelo de código aberto número um", e nessa afirmação mais restrita, os dados independentes os respaldam.

A transparência é o recurso que todos mencionam. O Qwen-Image 2.1 gera imagens RGBA nativamente, então você pode solicitar um fundo transparente e obter um recorte limpo sem uma segunda passagem por uma ferramenta de remoção de fundo. Para vendedores de adesivos, lojas de impressão sob demanda e qualquer pessoa que componha ativos em um design maior, isso elimina uma etapa real. O modelo também pode editar uma camada transparente sem achatá-la, o que costumava exigir um modelo em camadas separado.

A edição com até dez imagens de referência é o outro destaque. Forneça uma foto de uma pessoa e algumas imagens de roupas, e ele compõe a pessoa vestindo essas roupas. Mescle seis retratos em uma foto de grupo. Monte dez imagens de móveis em um único ambiente. Você pode indicar a região a ser editada de três maneiras: desenhar círculos coloridos, pintar sobre a área ou passar o original mais uma máscara separada. A rota da máscara é a que deve ser usada quando você não pode se dar ao luxo de sobrescrever os pixels originais.

Depois, há a velocidade em hardware modesto. Os primeiros usuários relatam uma imagem de 1 megapixel em cerca de cinco segundos em uma RTX 4090, cerca de 25 segundos em placas da série 50, e aproximadamente 50 segundos para uma imagem 2K em uma RTX 3060 com 64GB de RAM do sistema. Um comentarista do Hacker News disse que converteu uma imagem de 1MP em cerca de cinco segundos em uma 4090. Um usuário no r/StableDiffusion relatou imagens de 1MP em cerca de 25 segundos em uma 5070 ou 5080, observando que a edição é a operação mais lenta e que acumular imagens de referência aumenta a latência de forma perceptível. Isso não é rápido como a nuvem, mas é rápido o suficiente para deixar de ser uma desculpa.

Cronômetro ao lado de uma miniatura de imagem em renderização, simbolizando a velocidade de geração local

Aqui está a parte que dividiu a comunidade. Modelos de imagem Qwen anteriores eram distribuídos sob Apache 2.0, o que permitia fazer fine-tune e vender o que você construísse. O Qwen-Image 2.1 é distribuído sob uma licença apenas para pesquisa, que proíbe o uso comercial dos pesos sem um acordo separado com a Alibaba. A thread no HN acendeu por causa da ambiguidade, e a conta da Alibaba interveio para esclarecer: os pesos são restritos, mas as imagens que você gera com eles são suas, inclusive para uso comercial.

Essa distinção parece pequena, mas importa muito. Se você só quer gerar imagens para clientes, produtos ou seus próprios projetos, você está tranquilo, e a Alibaba confirmou que os resultados não carregam obrigações de licenciamento. Se você queria fazer fine-tune e redistribuir o modelo, você é quem fica negociando. A maioria das pessoas se encaixa no primeiro grupo, e é por isso que a reação foi alta, mas, em última análise, contida.

A linha interessante aqui não é a pontuação bruta. É a eficiência. O Qwen-Image 2.1 chega a poucos pontos Elo de modelos que são muitas vezes maiores e totalmente fechados. O gerador tem 32 camadas Single-Stream DiT, lê prompts através de um codificador de texto Qwen3-VL 8B, e renderiza nativamente em 2K até 2752 por 2752 pixels. No campo da eficiência, prova que a destilação arquitetônica e dados de treinamento mais limpos podem fechar a maior parte da lacuna que todos assumiam exigir escala.

Isso pressiona o modelo de assinatura de uma forma que um slide de marketing nunca poderia. Se uma GPU de consumidor pode renderizar resultados de qualidade de estúdio em segundos, "geramos as melhores imagens" deixa de ser motivo suficiente para pagar mensalmente. Google e OpenAI ainda lideram nas tarefas mais difíceis de raciocínio semântico e espacial, onde avaliações cegas continuam dando vantagem a eles. O Qwen-Image 2.1 não fechou essa lacuna. Apenas fez a lacuna parecer opcional para uma grande parte do trabalho cotidiano, e isso é uma disrupção maior do que qualquer pontuação de benchmark única.

A avaliação prática da comunidade

Os argumentos de benchmark só levam você até certo ponto. O sinal mais fundamentado é o que as pessoas realmente relatam depois de executá-lo por conta própria, e os relatos desta semana são excepcionalmente consistentes. No r/StableDiffusion, um usuário postou uma comparação lado a lado de 192 imagens geradas comparando o Qwen-Image 2.1 com o Krea 2, classificadas por categoria, como geração de texto e anatomia humana. A conclusão foi que o modelo aberto se saiu bem em estrutura, mas teve que contornar um codificador de texto quantizado para encaixar o denoiser em uma 5090.

Outro usuário conseguiu executar o modelo em um MacBook Pro M1 Max com 32GB de memória, gerando uma imagem de 512 por 512 em cerca de 24 segundos usando um runtime nativo do Apple Silicon. Isso é lento para os padrões de desktop, mas prova que o modelo não está preso ao hardware Nvidia, o que importa para uma grande parte dos usuários casuais. Um terceiro construiu um estúdio local no estilo Fooocus em torno dele, adicionando máscaras, anotações, outpainting e referências de pose OpenPose, e pediu críticas honestas em vez de elogios.

Os recursos de edição atraíram o maior entusiasmo. Um post descreveu a geração de folhas de design de personagens sem quaisquer LoRAs, usando a edição de imagens de referência do modelo para manter um personagem consistente entre poses e roupas. Isso costumava exigir uma pilha de modelos ajustados e muita limpeza manual. O fato de um único modelo de 7B fazer isso pronto para uso é a manchete silenciosa que a maioria dos gráficos de benchmark não captura.

O que observar a seguir

Os resultados iniciais ainda estão se estabilizando. A Qwen criou seu próprio benchmark e não divulgou os prompts ou pontuações por categoria, então os números internos são mais uma afirmação do que uma medição. Os números independentes do AI Arena são mais confiáveis e ligeiramente menos lisonjeiros. A leitura honesta agora é que o Qwen-Image 2.1 é o melhor modelo de imagem de pesos abertos disponível, um degrau abaixo dos líderes fechados, e um ponto de prova genuíno de que pequeno e aberto pode ser competitivo. As próximas semanas de testes independentes dirão se a vantagem de meio ponto sobre o Nano Banana 2.0 é duradoura ou foi apenas uma fatia lisonjeira do benchmark.

Artigos relacionados