Do slop de IA à transparência nativa: um ano de geração de imagens, em quatro mudanças

Há um ano, a palavra mais barulhenta na conversa sobre imagens de IA era “slop”. Ela descrevia a enxurrada de imagens de baixo esforço e estranhas que enchia feeds sociais e fazendas de conteúdo, o tipo de imagem que parecia quase certa e de algum modo errada ao mesmo tempo, um rosto com dentes demais, uma mão com seis dedos, uma paisagem que se dissolvia em ruído nas bordas. O termo pegou porque nomeava algo real, uma tecnologia que tinha ficado boa o suficiente para produzir mediocridade em massa, mas ainda não boa o suficiente para fazer diferença.
Doze meses depois, a mesma tecnologia está entregando transparência nativa, edição de dez imagens e modelos locais que rodam em uma GPU de médio porte. A era do “slop” não terminou tanto quanto ficou complicada. As ferramentas que produziam lixo são as mesmas que agora produzem ativos que profissionais realmente usam. A diferença não é um único avanço, mas quatro mudanças que aconteceram gradualmente, e se você quer entender para onde a geração de imagens está indo, precisa ver as quatro ao mesmo tempo.
A primeira mudança é de novidade para fluxo de trabalho. Os primeiros geradores de imagens faziam uma única imagem e paravam. Os novos são construídos em torno de edição, composição e produção de ativos que se encaixam em um processo maior. Um logotipo com um canal alfa limpo não é uma obra finalizada, é um componente. Um modelo que consegue combinar dez referências não está fazendo uma imagem, está montando uma composição. A categoria de produto mudou de “gerador de imagens” para “ferramenta de imagem”, e essa mudança importa porque ferramentas são julgadas por como se encaixam no trabalho, não por quão impressionante é uma única saída.
A segunda mudança é de fechado para aberto. Os melhores modelos costumavam ficar atrás de APIs. Este ano, os modelos abertos alcançaram o suficiente para que um modelo de 7 bilhões de parâmetros rodando localmente consiga lidar com tarefas que antes exigiam uma API paga. O Qwen-Image 2.1 é o marco atual, mas faz parte de uma tendência mais longa. Pesos abertos, licenças de pesquisa e uma comunidade de criadores de pacotes de integração fizeram da geração de imagens competente algo que você pode rodar no hardware que possui. O tutorial “roda em uma placa de 6 GB” é o símbolo dessa mudança, o momento em que o acesso deixou de ser o gargalo.
A terceira mudança é de irrestrito para responsável. A crise de deepfakes do Grok foi a versão mais aguda disso, mas o movimento subjacente já estava em andamento. Reguladores pararam de tratar geradores de imagens como ferramentas neutras e começaram a tratá-los como produtos cujos desenvolvedores têm responsabilidade pelo que lançam. Proveniência de conteúdo, segurança no próprio modelo em vez de adicionada depois, e responsabilidade por imagens não consensuais passaram das margens para o centro da conversa. Uma ferramenta que podia gerar qualquer coisa já foi um recurso. Agora é um risco jurídico.
A quarta mudança é de escassez de computação para eficiência computacional. O treinamento ficou mais rápido, a inferência ficou mais barata, e a história do hardware ganhou uma segunda via com alternativas como o Ascend da Huawei. Nada disso é um único avanço, mas o efeito cumulativo é que a geração de imagens deixou de ser algo que só os maiores laboratórios podiam pagar e se tornou algo que uma equipe pequena ou um criador solo consegue realmente incluir no orçamento. Artigos de eficiência como o ganho de velocidade de treinamento de 3,6x são o motor silencioso dessa mudança.
O interessante dessas quatro mudanças é que elas estão em tensão umas com as outras. A mudança de responsabilidade empurra para a cautela e a restrição, lançamentos mais lentos, mais salvaguardas. As mudanças de abertura e eficiência empurram para acesso e velocidade, mais modelos, mais liberdade. A era do “slop” foi o que aconteceu quando o acesso correu à frente da qualidade, quando todos podiam gerar, mas poucos conseguiam gerar bem, e o resultado foi uma enxurrada de produção medíocre. O próximo ano será definido por se o campo consegue sustentar as quatro ao mesmo tempo, tornando a geração de imagens aberta e barata sem torná-la, de novo, majoritariamente lixo.
Existe um risco real de que não consiga. Os modelos abertos agora são bons o suficiente para que o problema do “slop” possa piorar antes de melhorar, porque as ferramentas para produzir imagens de baixo esforço agora são gratuitas e locais. Os mecanismos de responsabilidade ainda estão correndo atrás, e os precedentes legais estão sendo definidos em tempo real pelos casos do Grok. É inteiramente possível imaginar um mundo em que a capacidade melhora mais rápido que as salvaguardas, e o resultado é mais “slop”, mais abuso e mais reação negativa. As quatro mudanças não apontam numa direção limpa, elas puxam umas contra as outras.
Mas também há uma leitura mais esperançosa. A mudança de fluxo de trabalho, a passagem de imagens finalizadas para ativos composáveis, empurra contra o “slop” por sua própria natureza. Uma camada transparente que um designer pode entregar, uma composição de dez referências para uma campanha, um modelo local rodando as fotos de produto de uma pequena loja, são o oposto do “slop”. É a mesma tecnologia voltada para o ofício. A questão não é se a geração de imagens vai produzir lixo, ela sempre vai, mas se o lixo continuará sendo a impressão dominante.
A palavra “slop” provavelmente vai continuar, porque ainda há muita produção de baixo esforço, e talvez sempre haja. Mas não é mais a história inteira. Os mesmos modelos subjacentes agora geram camadas transparentes que um designer pode entregar, compõem dez referências em uma imagem de campanha e rodam em uma placa que você pode comprar no varejo. A tecnologia não escapou da era do “slop” tanto quanto cresceu ao redor dela, adicionando um andar superior produtivo enquanto o lixo se acumulava embaixo.
O que mudou em um ano não é que os modelos pararam de fazer imagens ruins. É que eles começaram a fazer imagens boas, em formatos que se encaixam em como as pessoas realmente trabalham. Esse é um marco mais silencioso do que qualquer lançamento único de modelo, e é o que importará mais no longo prazo. As demonstrações chamativas vêm e vão, mas a capacidade de entregar a um designer um ativo transparente limpo, ou a um pequeno vendedor um modelo local que roda suas fotos de produto, é o tipo de progresso que se acumula. Daqui a um ano, a palavra “slop” provavelmente ainda estará por aí, mas descreverá uma fatia cada vez menor do que essas ferramentas realmente fazem.
Se você quiser um único quadro para o ano inteiro, é este: a geração de imagens cresceu. A tecnologia passou de um truque de festa que produzia uma imagem impressionante por vez para uma capacidade industrial que produz ativos, nos formatos certos, sob as restrições certas, a um preço que uma pessoa comum pode pagar. As quatro mudanças, fluxo de trabalho, abertura, responsabilidade e eficiência, são quatro maneiras de dizer a mesma coisa. A ferramenta deixou de ser sobre o modelo e passou a ser sobre o trabalho.
É por isso que as duas maiores histórias do ano parecem tão diferentes na superfície. O Qwen-Image 2.1, com suas camadas transparentes e edição de múltiplas imagens, é a ferramenta crescendo na direção produtiva, rumo ao ofício. A crise de deepfakes do Grok é a ferramenta crescendo na direção perigosa, rumo à responsabilidade, o momento em que as consequências adultas de uma ferramenta irrestrita se tornaram impossíveis de ignorar. Ambas são a mesma maturação subjacente, vistas de lados opostos, e um campo que antes era definido inteiramente pelo que os modelos conseguiam fazer agora é definido tanto por como são feitos, quem pode usá-los e o que acontece quando são usados de forma indevida.
A palavra “slop” provavelmente vai continuar, porque ainda há muita produção de baixo esforço, e talvez sempre haja. Mas não é mais a história inteira. Os mesmos modelos subjacentes agora geram camadas transparentes que um designer pode entregar, compõem dez referências em uma imagem de campanha e rodam em uma placa que você pode comprar no varejo. A tecnologia não escapou da era do “slop” tanto quanto cresceu ao redor dela, adicionando um andar superior produtivo enquanto o lixo se acumulava embaixo. Há um ano, esse andar superior não existia. Agora existe, e é a coisa mais importante sobre a geração de imagens que a maioria das pessoas não percebeu.
Artigos relacionados
“Roda em uma placa de 6 GB” é o novo padrão que a comunidade aberta de imagens exige
A nova métrica de adoção não são as pontuações de benchmark, e sim o piso de hardware. Um modelo 7B que roda em uma placa de 6 GB está mudando quem pode usar a geração de imagens por IA.
Avós estão criando imagens de IA de seus netos. Os pais não estão felizes.
A imagem de IA mais fofa do ano também é uma disputa de privacidade. Os avós apertam o botão, os pais leem os termos de serviço.
O “AI Slop” Tornou-se Aquilo de Que Ele Zombava
O rótulo deveria nomear conteúdo de baixo esforço. Agora, descarta tudo, o que o torna exatamente aquilo de que reclamava.
Seu vídeo de IA atingiu 500 mil visualizações e os comentários ficaram hostis: um guia prático para a nova rejeição aos criadores
Um guia prático para a nova rejeição aos criadores de IA, cobrindo criadores, famílias e empresas, além do momento da divulgação.