Tongyi Wanxiang Qwen-Image 2.1 é open source: por que 7B parâmetros ousam desafiar Google e OpenAI

Em 20 de setembro, a equipe Tongyi da Alibaba lançou discretamente uma “pequena bomba nuclear” — o Qwen-Image 2.1. Um modelo de texto para imagem com apenas 7 bilhões de parâmetros, mas que em sua própria avaliação superou o Nano Banana 2.0 do Google, forçando os modelos de código fechado da OpenAI e da Meta a olharem para trás. Assim que a notícia saiu, Bilibili, Zhihu, e os internacionais Hacker News e Reddit explodiram.
Por que dizem que ele é “pequeno, mas poderoso”
Os modelos de geração de imagem cresceram cada vez mais nos últimos anos; os de código fechado chegam facilmente a dezenas ou centenas de bilhões de parâmetros e exigem uma placa de vídeo profissional para rodar. O Qwen-Image 2.1 fez o contrário: comprimiu a parte de geração para 7B e, com isso, alcançou 60,28 pontos no seu próprio ranking Qwen-Image-Bench. O que esse número representa no ranking geral? O Nano Banana 2.0 do Google ficou com 59,82 pontos, superado por uma pequena margem; no campo open source, o segundo colocado é o LongCat-Image (6B) da Meituan, com pouco mais de 54 pontos. Ou seja, entre todos os modelos com pesos disponíveis para download, ele é o mais forte atualmente.
O veredito da avaliação independente de terceiros AI Arena é um pouco mais sóbrio. Lá, o Nano Banana 2.0 marcou 1260 pontos, o Qwen-Image 2.1 ficou com 1228, e o fechado GPT Image 2.5 Sunburst chegou a 1423 pontos. A diferença ainda existe, mas já é pequena o suficiente para “morder o calcanhar”. Para um modelo open source, essa posição por si só já é uma vitória.
Três recursos realmente úteis
O primeiro é o fundo transparente nativo. Antes, para fazer adesivos, personalização para impressão ou esboços de design, depois que a IA gerava a imagem ainda era preciso recortá-la manualmente. O Qwen-Image 2.1 gera diretamente imagens RGBA com canal alfa; um único modelo faz tanto a geração quanto a edição, e as camadas transparentes podem ser editadas diretamente sem serem mescladas. Para quem trabalha com produtos culturais e criativos e derivados, isso economiza muito trabalho.
O segundo é a edição simultânea com dez imagens de referência. Você insere uma foto de uma pessoa e fornece algumas imagens de roupas, e ele consegue sintetizar “esta pessoa vestindo estas roupas”. Também é possível combinar seis retratos em uma foto de grupo, ou juntar dez imagens de móveis em um mesmo ambiente. No Bilibili, alguns criadores já demonstraram “consistência de personagem + troca de roupa”, e a seção de comentários ficou cheia de “isso é natural demais”.
O terceiro é ser leve o suficiente para rodar em placas domésticas. No RTX 4090, uma imagem de 1 megapixel leva cerca de 5 segundos; nas placas da série 50, cerca de 25 segundos; há até quem rode imagens 2K com uma RTX 3060 e 64 GB de RAM, levando 50 segundos por imagem. A configuração mínima oficial da Alibaba exige 6 GB de VRAM, e tutoriais de “pacote tudo-em-um com um clique” já começaram a aparecer em fila no Bilibili.

O que mais chama atenção não é o desempenho, é o licenciamento
O que realmente fez a comunidade discutir foi a licença. A série Qwen-Image anterior usava Apache 2.0, permitindo uso comercial livre. Desta vez, mudou para a Qwen Research License, “apenas para fins de pesquisa”; para uso comercial, é preciso negociar separadamente com a Alibaba. No Reddit e no HN, a discussão pegou fogo: alguns acham que isso é andar para trás, enquanto outros consideram que “os pesos são disponibilizados para download e você pode usar as imagens como quiser” já é generoso o bastante.
A Alibaba esclareceu rapidamente em uma frase: os pesos do modelo não podem ser redistribuídos comercialmente, mas as imagens que você gera com ele são suas, e o uso comercial não tem problema. Essa distinção é crucial — para a grande maioria das pessoas que só querem criar imagens, o impacto não é tão grande assim.
O significado maior disso
O Qwen-Image 2.1 provou uma coisa: com destilação de arquitetura e dados de treinamento mais limpos, modelos pequenos podem alcançar o nível de geração de imagem dos grandes modelos. O título do vídeo do criador do Bilibili “爱分享的剑二十七” (“Jian Ershiqi, que adora compartilhar”) foi direto: “o modelo de pintura com IA open source da Alibaba dá uma surra em várias ferramentas pagas”. O exagero existe, mas a direção está correta.
Quando uma imagem pode ficar pronta em segundos em uma placa de vídeo doméstica, a pergunta sobre continuar pagando uma assinatura mensal se torna uma conta que todo criador precisa recalcular. Os fornecedores de código fechado terão de provar que valem esse dinheiro com velocidade, integração de fluxos de trabalho e colaboração multimodal, e não apenas com o argumento de que “a minha geração é bonita”.
Para o público em geral, a boa notícia é: o teto da geração de imagem open source subiu mais um pouco neste mês.
Artigos relacionados
Você ainda consegue distinguir uma imagem de IA de uma real? A resposta honesta é não.
Os sinais reveladores sumiram e os detectores são pouco confiáveis. A resposta honesta para identificar imagens de IA é não, e a solução está a montante dos seus olhos.
A silenciosa mudança no licenciamento que pode mudar as imagens de IA de código aberto
Pesos abertos não significam mais o que significavam há um ano. As letras miúdas do licenciamento estão ficando mais complicadas justamente quando os modelos ficam melhores.
O Aperto dos Modelos Locais: Por que Criadores Continuam Perseguindo Modelos de Imagem Irrestritos
Toda semana outro criador pede um modelo irrestrito. A demanda diz mais sobre as ferramentas de nuvem do que sobre as pessoas que pedem.
A pilha de código aberto para imagens de IA está sendo reconstruída, um fluxo de trabalho por vez
Workflow1111 recria o AUTOMATIC1111 com 73 nós e 11 pipelines. O que a reconstrução da comunidade significa para a geração local de imagens.