A OpenAI dividiu seu modelo de imagem principal em dois. Isso diz mais do que o benchmark.

Em 8 de setembro, a OpenAI lançou o ChatGPT Images 2.5, e escondida dentro do anúncio estava uma decisão que importa mais do que qualquer número de velocidade. A empresa pegou o único modelo de imagem principal e o dividiu em dois.
Para desenvolvedores, a API agora oferece o GPT-Image-2.5 Flare e o GPT-Image-2.5 Sunburst. O Flare é o rápido. A OpenAI diz que ele roda de duas a quatro vezes mais rápido que o GPT-Image 2, e a parceira de primeira hora Manus corroborou isso com seus próprios testes, além de uma saída melhor de fundos transparentes. O Sunburst é o lento e preciso. Ele foi construído para edições que precisam manter todo o resto exatamente como estava. Os dois custam o mesmo: US$ 8 por milhão de tokens de entrada e US$ 30 por milhão de tokens de saída.
Esse detalhe de preço é a parte interessante. Quando dois modelos fazem trabalhos diferentes mas custam exatamente o mesmo, o fornecedor não está te vendendo mais poder de processamento. Ele está pedindo que você decida do que realmente precisa, o que é um tipo diferente de conversa de produto do que “aqui está nosso melhor modelo, use para tudo”.

O que realmente mudou
Do lado do consumidor, o número que chama atenção é a latência. A OpenAI afirma que o atraso de geração caiu até 50% em comparação com o Images 2.0, enquanto nitidez, iluminação natural e detalhes de textura melhoraram. Essa combinação é incomum. Normalmente você troca uma coisa pela outra.
A história da edição é onde o Sunburst faz jus ao nome. A proposta é que o modelo entende o que não deve mudar. A Higgsfield AI, uma das parceiras citadas pela OpenAI, colocou assim, e é um bom resumo do que a atualização realmente significa. Os editores de imagem anteriores eram bons em seguir uma instrução e ruins em deixar o resto do quadro intacto. Você pedia uma cor nova em uma jaqueta e recebia um rosto sutilmente diferente, um horizonte deslocado, uma fonte de luz alterada. O Sunburst mira exatamente esse modo de falha, mantendo rostos, produtos e elementos de marca estáveis ao longo de várias rodadas de edição.
Há três novas ferramentas no aplicativo do ChatGPT. O Sketch permite digitar @Sketch e desenhar um layout ou silhueta aproximada dentro do chat, tratando seu rabisco como referência para a renderização final. Os Templates oferecem um ponto de partida para formatos comuns, como pôsteres e produtos de merchandising. Os Comments (comentários) permitem fixar uma observação em um ponto da imagem, para você dizer “apague isto” ou “deixe isto azul” sem reescrever o prompt.
A OpenAI também se apoiou em uma estatística de segurança. O Sunburst gera conteúdo inseguro a uma taxa de 1,09%, o Flare a 1,41% e o modelo anterior a 1,64%. A direção é boa, embora sejam dados autorreportados e um argumento de venda, não uma garantia.
O movimento da Adobe
No mesmo dia, a Adobe anunciou que havia integrado o GPT-Image-2.5 ao Firefly. Isso não é uma nota menor de parceria. A Adobe passou dois anos reposicionando o Firefly como uma camada de orquestração, um lugar onde modelos do Google, da Runway e de outros são conectados a um fluxo de trabalho profissional. Adicionar o mais novo modelo de imagem da OpenAI já no primeiro dia é essa estratégia funcionando conforme planejado.
Matt Chotin, da Adobe, apresentou isso como uma forma de dar aos criadores flexibilidade da ideia à entrega. Na prática, significa que a disputa saiu da qualidade bruta do modelo. Os dois lados agora se distribuem mutuamente. Mais de 70 ferramentas da Adobe estão incorporadas dentro do ChatGPT, então um designer pode acionar recursos do Photoshop, Premiere ou Firefly de dentro da interface da OpenAI. Cada empresa se torna um canal para a outra, e nenhuma consegue dominar sozinha o início da tarefa criativa.
Os números por trás do lançamento
Há um motivo para este lançamento ser lido como um movimento de estratégia de produto, e não como um salto puro de capacidade. Quando o GPT Image 2 foi lançado em abril de 2026, ele ocupava o primeiro lugar no ranking de text-to-image da Artificial Analysis, com Elo de 1178, e o segundo lugar no ranking de edição. O Images 2.5 é um incremento sobre essa base e, nos dias seguintes ao lançamento, nenhum dos dois novos modelos de API tinha entrada no ranking da Artificial Analysis, e nenhum terceiro havia publicado um benchmark reproduzível. As melhorias de velocidade e qualidade são todas autorreportadas, ou relatadas pelas parceiras citadas: Adobe, Manus e Higgsfield. Isso não as torna falsas, mas significa que qualquer julgamento sobre se a divisão entrega o que promete deve esperar por testes independentes.
O que não é autorreportado é o preço. Os dois modelos ficam em oito dólares por milhão de tokens de entrada de imagem e trinta dólares por milhão de tokens de saída, idênticos entre si. A faixa de resolução de saída vai de 1024 por 1024 até 3840 por 2160, com contagem total de pixels limitada entre 655.360 e 8.294.400. Para um desenvolvedor, a decisão sobre um determinado recurso agora se resume a uma única pergunta: essa carga de trabalho precisa ser rápida, ou precisa que a quarta edição deixe o sujeito intacto? O modelo que responde a essa pergunta leva a tarefa, e o fato de os dois custarem o mesmo elimina o preço como desculpa para escolher errado.
Por que a bifurcação é a verdadeira história
A geração de imagens deixou de ser um experimento. A OpenAI diz que a plataforma produz mais de três bilhões de imagens por semana, e esse número é a pista. Nesse volume, a pergunta interessante já não é “ela consegue fazer uma imagem bonita”, mas “que tipo de trabalho está sendo pedido a ela”.
Equipes de marketing que produzem centenas de variações para redes sociais se importam com a produtividade. Uma equipe de marca finalizando o visual-chave de uma campanha se importa com se o logotipo se desvia depois da quarta edição. Esses dois trabalhos puxam em direções opostas, e um único modelo força um deles a ceder. Dividir a linha é admitir que a base de clientes também se dividiu.
A resposta dos concorrentes já foi moldada por isso. O Midjourney ainda vence em um certo acabamento cinematográfico, mas não tem interação nativa por chat e tem uma curva de aprendizado mais íngreme. O Adobe Firefly se apoia no licenciamento comercial e em seu ecossistema de software, mas sua criação conversacional autônoma é fraca. O modelo de imagem integrado do Google é forte em algumas tarefas e inconsistente no controle em nível de marca. Ninguém domina o tabuleiro inteiro.
Para quem está escolhendo uma ferramenta, a conclusão prática é parar de procurar um único melhor modelo de imagem e começar a combinar o modelo com a tarefa. Iteração em alto volume e finalização de precisão agora são compras separadas, mesmo quando vêm da mesma empresa pelo mesmo preço. Os rankings de benchmark vão continuar mudando, e vão importar cada vez menos. O que importa é se o fluxo de trabalho em torno do modelo sobrevive ao próximo lançamento, porque o modelo por baixo dele será substituído de novo em alguns meses.
Vale a pena refletir sobre esse último ponto. O Images 2.5 chegou cerca de cinco meses depois do Images 2, e ambos substituíram uma versão que era o estado da arte no ano passado. As equipes que constroem um processo durável, com seus próprios prompts, referências de estilo e etapas de revisão, são as que conseguem absorver essa rotatividade. As equipes que fixam um único modelo em seu pipeline herdam cada desligamento e cada mudança de preço dele. Nesse aspecto, o lançamento de dois modelos é um lembrete útil vindo do fornecedor mais barulhento da sala: até o líder está dizendo para você não depender de um único modelo.
Artigos relacionados
Um semihumanoide sobre rodas concluiu uma hora de lavanderia sem ajuda
Tarefas individuais podem ter sucesso enquanto um fluxo de trabalho ainda falha. A Dyna mudou a métrica.
O LTX 2.5 quer renderizar seu esboço em blocos do Blender como uma tomada finalizada
Você não controla o que acontece em texto para vídeo. Isto tenta corrigir isso.
ServiceNow transforma falhas de agentes em dados de treinamento
Geração sem verificação é ruído. Os portões são o produto.
Um único framework para linguagem e visão: o modelo aberto de 1,6 bilhão da Horizon
Uma aposta de que as pontes entre linguagem e visão nunca foram necessárias.