← Voltar ao blog
Aicerca de 7 min de leitura

FLUX 3 Image transformou a geração de imagens em um arquivo de layout

Publicado 3 de out. de 2026
FLUX 3 Image transformou a geração de imagens em um arquivo de layout

A Black Forest Labs lançou o FLUX 3 Image em 1º de outubro, e a maior parte da cobertura abriu pela resolução: saída nativa de até 4K, cerca de 16,8 megapixels, sem upscaler no processo. Isso é um upgrade de verdade. Também é a coisa menos interessante do lançamento.

A parte que vale a pena ler na documentação é o formato de entrada. O FLUX 3 Image não quer um parágrafo e um desejo. Ele quer uma tabela.

Todo elemento ganha um endereço

Uma solicitação de geração é um array JSON de elementos. Cada elemento carrega um ID único, uma caixa delimitadora escrita como `[y_min, x_min, y_max, x_max]` em uma grade normalizada de 0 a 1000, e uma descrição em linguagem natural do que pertence ali. Um bloco de fundo abrange toda a tela. Um produto fica em `[400, 200, 950, 800]`. Um logotipo vive no canto superior esquerdo. O prompt de cena ainda existe, mas agora é uma entrada entre várias, e não o briefing inteiro.

A grade é independente de resolução. O mesmo JSON de layout renderiza a mesma composição com 768 pixels de largura ou em 4K nativo, o que significa que o layout que você testou em um rascunho barato é o layout que você recebe no final caro.

Isso soa como um recurso de conveniência. Na prática, muda quem pode chamar o modelo. A BFL projetou a tabela de elementos para que um modelo de linguagem possa escrevê-la a partir de um briefing de uma linha e uma proporção de aspecto alvo. Um agente não precisa traduzir a intenção em prosa e torcer pelo melhor. Ele pode dispor a imagem como dispõe uma planilha, e os IDs dos elementos sobrevivem como identificadores que ele pode referenciar em turnos posteriores.

Uma folha de papel em branco presa com fita em uma grade uniforme sobre uma mesa de madeira, com alguns pequenos objetos abstratos apoiados em alguns dos quadrados

Há também uma consequência mais barata. Como a grade é independente de resolução, um layout pode ser validado a 768 pixels por uma fração do preço e depois renderizado em 4K com a composição intacta. Iteração e entrega final deixam de brigar por orçamento, o que importa para quem produz dezenas de imagens a partir do mesmo template.

Bloqueio de pixels e o problema do desvio

A edição segue a mesma lógica. Você especifica uma caixa delimitadora de origem e uma de destino, escolhe o elemento a mover, substituir ou remover, e os pixels fora dessa região devem permanecer exatamente onde estavam. A medição da própria BFL coloca as áreas intocadas em 67,8% a 89,7% de fidelidade bit a bit, um intervalo que depende da complexidade da edição.

A parte honesta é a redação. A demo de lançamento promete edições 'sem alterar nenhum outro pixel'. A documentação da API diz que os pixels intocados 'geralmente' permanecem inalterados, e a BFL reconhece que as edições podem extrapolar a caixa especificada. Artefatos de borda são reais. Qualquer equipe que coloque isso em um pipeline deve criar um teste de aceitação em vez de confiar na demo.

Ainda assim, a comparação com o inpainting comum não é nem de longe equilibrada. O inpainting tradicional deixa um desvio sutil mesmo nas regiões que recebeu ordem de deixar em paz. Em uma única edição, ninguém percebe. Ao longo de um ciclo de aprovação de dez etapas, o fundo mudou, a tipografia amoleceu e a composição já não corresponde ao que o cliente aprovou três rodadas atrás. Essa acumulação é o que torna cadeias longas de edição inutilizáveis, e é justamente isso que as caixas delimitadoras pretendem impedir.

O que os criadores realmente descobriram

Um criador que rodou as mesmas instruções de edição no Midjourney, no Ideogram 4.5 e no FLUX 3 Image publicou uma comparação útil. Em um teste que pedia uma peça de roupa recolorida em seda rosa com flores brancas e um laço amarelo-creme, e depois closes macro do rosto e das mãos, o Midjourney deu conta dos closes, mas errou as flores brancas e o tom exato. O Ideogram 4.5 acertou as mudanças na roupa, embora a iluminação nas fotos macro parecesse errada. O FLUX 3 Image acertou as mudanças na roupa e recebeu elogios pela iluminação e pelo contexto nos closes. Em um teste separado, ele manteve uma edição de coluna minúscula restrita aos objetos pretendidos, enquanto os outros dois espalharam a mudança mais adiante.

A thread de um criador não é um benchmark. Trate-a como um sinal de onde o modelo é forte, o que parece ser o seguimento de instruções de detalhe fino, e não a estilização ampla.

O que as caixas delimitadoras não resolvem

Posicionamento e desvio são dois problemas, não todos eles. Uma caixa diz ao modelo onde algo vai. Ela não diz ao modelo como a coisa deve parecer, e não impede que um elemento de referência mude de estilo depois de posicionado. Equipes que geram um único produto contra trinta fundos diferentes ainda precisam manter o próprio produto consistente, e esse trabalho vive nas imagens de referência e no prompt, não nas coordenadas.

A renderização de texto é a outra costura aberta. As próprias imagens de demonstração da BFL vêm de um prompt que um humano selecionou. Se um modelo de layout posiciona de forma confiável tipografia legível dentro de uma caixa pequena, em uma fonte específica, é uma questão separada, e o material de lançamento não a responde. Para trabalhos de layout de revista e de e-commerce, que é o público-alvo deste lançamento, esse é o detalhe que decide a adoção.

Uma entrada estruturada também não torna o modelo menos uma caixa-preta no que diz respeito à estética. Você pode especificar que um logotipo vai no canto superior esquerdo. Não pode especificar que a composição deve parecer calma.

Os trade-offs que ninguém colocou na manchete

Caixas delimitadoras custam mais preparação do que digitar 'deixe o fundo azul'. Você precisa saber onde as coisas vão. Para uma imagem avulsa, essa sobrecarga provavelmente não vale a pena. Para um pipeline que regenera o mesmo layout em vinte fotos de produto, ou um agente que precisa posicionar um logotipo de forma confiável, o retorno vem rápido.

O preço de lançamento está com 50% de desconto até 8 de outubro: cerca de US$ 0,0205 por uma imagem de 768 pixels até US$ 0,3035 para 4K, com referências e prompts incluídos e gerações com falha não cobradas. Pesos comerciais auto-hospedados estão disponíveis entrando em contato com a BFL, e uma edição de pesos abertos está prometida para as próximas semanas.

O tratamento de referências merece uma nota à parte. Uma única chamada aceita até 10 imagens de referência, e cada elemento pode receber a indicação de qual referência ele vem e onde pertence. Dez referências sozinhas não são incomuns. Dez referências que cada uma mapeia para uma caixa específica na tela configuram um fluxo de trabalho para montar uma composição a partir de ativos existentes, o que está mais próximo de como um designer trabalha do que de como um prompt funciona. Combine isso com a grade de layout e o modelo começa a parecer menos um pintor e mais um compositor que tem opiniões.

O quadro mais amplo é que as APIs de imagem foram otimizadas por anos em torno de uma pergunta: quão boa é a aparência da imagem? O FLUX 3 Image adiciona uma segunda pergunta com a qual os agentes se importam mais. Você consegue endereçar uma parte da imagem, alterá-la e deixar todo o resto em paz? Assim que a resposta é sim, a geração de imagens deixa de ser um caça-níqueis e começa a se comportar como um arquivo que você pode editar.

Essa distinção é o motivo pelo qual a comparação com o Midjourney e o Ideogram importa menos do que parece à primeira vista. Esses modelos competem em quão bonita é uma imagem nova, e continuam muito bons nisso. A BFL compete em se uma imagem gerada pode ser tratada como um documento com regiões estáveis, e essa é uma disputa diferente, com um vencedor diferente. A primeira disputa está quase resolvida e a segunda acabou de começar, que é mais ou menos onde uma aposta em infraestrutura quer estar.

Artigos relacionados