← Voltar ao blog
Aicerca de 7 min de leitura

A corrida armamentista dos modelos de imagem: Midjourney, Nano Banana e a ascensão silenciosa dos pesos abertos

Publicado 1 de out. de 2026
A corrida armamentista dos modelos de imagem: Midjourney, Nano Banana e a ascensão silenciosa dos pesos abertos

Se você se afastou da geração de imagens por IA por alguns meses, o cenário com o qual você se depara ao voltar é quase irreconhecível. Os grandes nomes mudaram de versão, um antigo queridinho dos consumidores está sendo aposentado, e o campo dos pesos abertos ficou muito mais forte. Veja onde as coisas estão no outono de 2026.

O Midjourney passou para o V8, e o V8.2 se tornou o padrão em julho. Ele ainda é a ferramenta que as pessoas procuram quando o objetivo é direção de arte, e não capacidade bruta, o modelo que interpreta atmosfera e iluminação como um diretor humano faria. Saída nativa em 2K sem upscaling, melhor leitura de prompts e um sistema de personalização que aprende seu gosto com as imagens que você escolhe. Os trade-offs não mudaram: nenhum plano gratuito, três ações judiciais ativas por direitos autorais e renderização de texto que é melhor, mas ainda pouco confiável para tipografia complexa.

O Nano Banana, do Google, passou pelo arco mais confuso. O original foi discretamente substituído pelo Nano Banana 2, construído sobre o Gemini 3.1 Flash, em fevereiro de 2026, e ele se tornou o padrão no aplicativo Gemini. O antigo Gemini 2.5 Flash Image está sendo descontinuado e será encerrado em 2 de outubro. O apelido da comunidade esconde o fato de que o Nano Banana não é um produto independente. É a geração de imagens embutida no Gemini, o que é conveniente ou frustrante dependendo de você querer uma interface de chat ou uma ferramenta dedicada. Seus pontos fortes são reais: edição multiturno que lembra o contexto e uma capacidade testada de manter até cinco pessoas e quatorze objetos consistentes entre edições.

O truque com o Nano Banana, como diz um guia da comunidade, é dar a cada imagem de referência uma função: uma para identidade, uma para pose, uma para estilo. Se você amontoar tudo em uma única referência, o resultado fica confuso. É uma pequena disciplina que importa mais do que a maioria dos truques de prompt, e é o mesmo princípio por trás da edição com múltiplas referências em todo o setor.

A linha GPT Image, da OpenAI, está impulsionando a edição com escopo de instrução com até dezesseis imagens de referência, e suas variantes mais recentes, Sunburst e Flare, estão no topo da arena de edição de imagem da LMArena, que agora acumulou mais de 30 milhões de votos entre 57 modelos. O Grok Imagine Image 2.0, da xAI, transformou edições precisas e renderização nítida de texto em seu argumento de venda, posicionando-se como a opção pronta para produção depois que o escândalo anterior de deepfakes forçou uma revisão de suas salvaguardas.

A história que mais importa para o longo prazo está acontecendo nos pesos abertos. O FLUX.2, da Black Forest Labs, agora lidera o campo dos modelos abertos editáveis de alta resolução, com uma variante klein 4B e uma variante turbo para velocidade. Z-Image, Qwen-Image e Ideogram 4.0 completam as opções licenciadas sob Apache 2.0, e a qualidade de renderização dos pesos abertos do Ideogram fez os desenvolvedores a chamarem de primeira linha. O licenciamento se tornou o verdadeiro diferencial: o FLUX.2 dev é não comercial, enquanto FLUX.2 klein, Z-Image e Qwen-Image permitem uso comercial sob a licença Apache 2.0. Escolher um modelo base agora começa pela licença, não pelo benchmark.

O ponto sobre licenciamento merece ênfase porque é onde a maioria das pessoas tropeça. Dois modelos podem ter a mesma pontuação em um benchmark e serem completamente diferentes quanto ao que você tem permissão para fazer com o resultado. Um modelo que você pode ajustar com fine-tuning e implantar para clientes vale mais do que um modelo ligeiramente melhor que você só pode usar para pesquisa. O campo aberto se dividiu exatamente nessa linha, e a camada comercialmente utilizável, Apache 2.0 ou equivalente, é onde o ecossistema de fato está sendo construído.

A mudança por baixo de tudo isso é que a edição substituiu a geração como fronteira. Um ano atrás, a corrida era para ver quem conseguia renderizar a imagem mais fotorrealista a partir de texto. Agora todo mundo consegue. A nova corrida é para ver quem permite mudar uma coisa sem regenerar tudo, quem consegue manter um personagem ao longo de cem imagens, quem consegue colocar texto nítido e correto em um pôster. Os modelos que estão vencendo são os otimizados para iteração, não para o encanto da primeira geração.

A história do hardware corre em paralelo a tudo isso. Os modelos abertos ficaram pequenos o suficiente para que um modelo da classe 7B rode em uma GPU de consumidor, e a comunidade respondeu com pacotes de integração de um clique que prometem geração local para pessoas que nunca querem tocar em um terminal. O benchmark "roda em uma placa de 6 GB" se tornou uma alegação de marketing tanto quanto qualquer pontuação de leaderboard, porque é o que determina se um modelo é uma curiosidade ou uma ferramenta.

Há também uma mudança silenciosa na forma como as pessoas pensam sobre consistência, que se tornou o verdadeiro campo de batalha. Um modelo que renderiza uma imagem bonita é o mínimo esperado. Um modelo que renderiza o mesmo personagem ao longo de cem imagens, ou o mesmo produto de uma dúzia de ângulos, é o que conquista um lugar em um fluxo de trabalho real. A abordagem baseada em referência, anexar de uma a quatorze imagens de um personagem e deixar o modelo reproduzi-lo, é o começo rápido. O treinamento de LoRA, um pequeno adaptador ajustado com suas próprias imagens curadas, é o martelo mais pesado para quando as referências se desviam. O trade-off é controle versus tempo de configuração, e a resposta honesta é que nenhum método garante um rosto estável, e é por isso que todo criador sério testa contra uma lista fixa de planos antes de se comprometer.

A categoria também desenvolveu um vocabulário útil para o leigo. Edição multiturno significa que o modelo lembra o que fez e itera com você. Edição com escopo de instrução significa que você pode dizer exatamente o que mudar e ele deixa o resto em paz. Composição com múltiplas referências significa fornecer várias imagens e dizer a função de cada uma. Nada disso é exótico; agora são recursos padrão, e os modelos competem em quão bem os executam, e não em se eles existem.

Para quem está escolhendo uma ferramenta hoje, o conselho honesto não mudou e provavelmente não vai mudar. Combine o modelo com a tarefa. Midjourney para estética, Nano Banana para edição multiturno dentro do ecossistema do Google, GPT Image ou Grok para edições de produção com escopo de instrução, pesos abertos quando você precisa de controle, residência de dados ou um personagem ajustado que você pode manter para sempre. Os dias em que um único modelo era a resposta certa para tudo terminaram silenciosamente, e ninguém realmente anunciou isso. O que os substituiu é um mercado em que a resposta certa depende inteiramente do que você está tentando criar, e as pessoas que se saem melhor são as que pararam de perseguir um único vencedor e aprenderam a comparar opções.

A única constante em todas essas mudanças é que o diferencial deixou de ser a qualidade bruta da imagem e passou a ser o fluxo de trabalho em torno do modelo. Consistência, editabilidade, clareza de licença e integração com as ferramentas que você já usa. É isso que de fato determina se um modelo aparece no seu trabalho diário ou em uma pasta de demos impressionantes que você nunca revisita. A corrida armamentista é real, mas os vencedores não são os modelos com o melhor benchmark. São os que se encaixam na forma como as pessoas realmente trabalham, e isso é uma coisa mais difícil de medir e um preditor muito melhor do que permanece.

Artigos relacionados