Iris-3B gera pixels sem VAE

Quase todos os geradores de imagens populares funcionam igual por baixo do capo. Eles nao desenham os pixels diretamente. Primeiro comprimem a imagem numa representacao abstrata menor por meio de um componente chamado autoencoder variacional, ou VAE, geram nesse espaco comprimido e depois decodificam o resultado de volta para pixels. Esse desenho em duas etapas e eficiente, e e dai que vem tambem muitos defeitos pequenos. Texto fino borra. Linhas finas ondulam. Detalhes se perdem na ida e volta.
Em outubro de 2026, um pequeno laboratorio chamado Speridlabs publicou o Iris-3B, um modelo de 3 bilhoes de parametros que pula a ida e volta por completo. Ele gera pixels diretamente. Os pesos sao abertos sob licenca Apache 2.0, e o conjunto se apoia num transformer de flow matching. Nao e o modelo de imagem maior nem mais vistoso do mes. E, provavelmente, o mais interessante pelo que diz sobre a direcao do campo.
Por que abrir mao do VAE importa
O VAE existe para baratear a geracao. Trabalhar num espaco latente comprimido reduz muito o computo necessario, e por isso quase todo modelo de difusao usa um. O compromisso e que o codificador descarta informacao antes de a geracao comecar, e o decodificador precisa adivinha-la. Em baixa resolucao a perda e invisivel. Em alta resolucao, ou em imagens com texto denso e bordas precisas, ela aparece como a papa que os geradores costumam deixar em volta dos detalhes pequenos.
Gerar no espaco de pixels remove esse gargalo, porque nenhum estagio de compressao pode perder algo. O preco e que agora se trabalha numa grade de valores muito maior, o que e caro. O argumento do Iris-3B e que ele e pequeno o bastante para tornar esse gasto gerenciavel. Se aguenta na pratica, a comunidade vai testar, mas a direcao e clara: quanto melhor a eficiencia, mais fraca a razao para aceitar a penalidade de qualidade do VAE.
{{INLINE1}}
O segundo truque: um prior generativo para visao
A parte mais incomum do Iris-3B e o que ele faz alem disso. O modelo aplica seu prior generativo a tarefas de visao sensiveis ao detalhe, incluindo estimativa de profundidade e restauracao de imagem. Em termos claros: um modelo treinado para produzir imagens tambem pode ser encarregado de extrair informacao delas, estimar a que distancia estao as coisas ou limpar uma foto degradada.
E uma combinacao significativa, porque aponta para uma tendencia mais ampla. Por um tempo, geracao e compreensao foram tratadas como dois problemas com dois modelos. Ultimamente elas estao se fundindo. Um sistema capaz de produzir uma imagem plausivel ja entende muito sobre como as cenas se estruturam, como a luz cai e como os objetos se relacionam no espaco. Reutilizar essa compreensao em tarefas de analise custa menos do que treinar um modelo dedicado para cada uma.
O que flow matching significa
O Iris-3B se apoia num transformer de flow matching, e a ideia e mais simples do que o nome. Modelos de imagem anteriores aprendem invertendo um processo que adiciona ruido aleatorio a uma imagem, passo a passo, ate ela sumir. A geracao percorre esse processo ao contrario, removendo ruido passo a passo ate surgir uma imagem. O flow matching pega um caminho mais direto. Aprende uma rota quase reta do ruido ate a imagem em vez de uma sinuosa, o que em teoria exige menos passos e menos computo para um bom resultado.
Isso importa especialmente para um modelo em espaco de pixels. Trabalhar sobre pixels crus e caro, e o jeito habitual de controlar esse custo e tornar cada passo eficiente. Um caminho mais reto significa menos passos, e isso explica em parte como um modelo de 3 bilhoes de parametros pode tentar uma tarefa que outros maiores resolvem com o atalho do VAE. Escolha de arquitetura e tamanho andam juntos. Nenhum dos dois bastaria sozinho.
Testes independentes vao decidir se a troca compensa. Se a geracao em espaco de pixels empatar com a latente a custo parecido, o VAE deixa de ser o padrao e passa a ser uma opcao. Se nao, o Iris-3B continua sendo um dado util sobre onde esta o muro.
Para que serve de verdade um modelo aberto pequeno
O Iris-3B nao vai superar nenhum gigante num ranking. Tres bilhoes de parametros sao uma fracao do que os lideres comerciais rodam, e um modelo generalista desse tamanho perdera nos prompts mais dificeis. Julga-lo por esse criterio e perder o ponto.
Modelos abertos desse tamanho ganham seu lugar de tres formas. Rodam em hardware que as pessoas ja tem, entao nao ha fatura por imagem nem dados saindo do predio. Podem ser ajustados para uma tarefa estreita, e e ai que modelos pequenos costumam vencer os grandes: um modelo treinado especificamente com a fotografia de produto de uma empresa superara um generalista naquela tarefa exata. E sao inspecionaveis, o que importa para equipes que precisam explicar de onde veio uma saida.
A licenca Apache 2.0 e o detalhe que torna as tres coisas possiveis. Uma licenca permissiva permite a uma startup construir um produto sobre o Iris-3B sem negociar condicoes nem temer mudanca de preco. Para um laboratorio que quer ver sua arquitetura adotada, e o caminho mais rapido ate a relevancia. O modelo nao precisa ganhar o ranking. Precisa ser aquilo com que os outros constroem.
Um aviso valido para toda publicacao aberta
Um aviso se aplica a todo modelo aberto, e o Iris-3B nao e excecao. Uma licenca permissiva cobre os pesos, nao os dados de treinamento nem as saidas. Equipes que querem entregar comercialmente ainda precisam pensar do que o modelo aprendeu e que direitos acompanham uma imagem gerada. E uma questao juridica que a licenca nao resolve, e e a mesma pergunta que todo modelo aberto levanta. A liberdade de rodar o modelo sozinho e real e valiosa. Nao e a mesma coisa que ausencia de responsabilidade.
O quadro maior
O campo da imagem em outubro de 2026 parece lotado visto de cima. Nano Banana 2.1, GPT Image 2.5, FLUX 3 e Seedream 5.0 entregaram atualizacoes recentes, e os ganhos na fronteira se medem em margens pequenas. Por baixo, o movimento mais interessante e arquitetural. A geracao em espaco de pixels questiona uma suposicao mantida desde os primeiros modelos de difusao: a de que e preciso comprimir antes de criar. E os pequenos modelos abertos seguem provando que o jeito mais rapido de espalhar uma ideia pelo campo e doa-la.
O Iris-3B pode acabar como nota de rodape, ou virar a versao que outros copiam. De qualquer modo, as duas perguntas que ele levanta merecem atencao. Da para gerar imagens em detalhe total sem um estagio intermediario com perda, e um modelo pode criar e analisar ao mesmo tempo? Se as respostas virarem sim, a proxima geracao de ferramentas de imagem sera construida sobre uma base diferente da anterior.
Artigos relacionados
O protocolo PACT da Decagon quer tornar o consentimento um padrao
A Decagon abriu um protocolo para verificar a identidade de um agente pessoal e as permissoes que um cliente concedeu. E encanamento, e decide se a economia dos agentes funciona.
A onda de reencontros com IA: um debate que a China ainda nao sabe como sentir
Filmes de homenagem feitos com IA trouxeram figuras falecidas de volta as telas chinesas e renderam centenas de milhares de curtidas. Depois veio a reacao, e era sobre consentimento.
A Apple publicou um modelo multimodal aberto e quase nao avisou
Este lancamento voltado a pesquisa passou despercebido, mas seu ancoramento visual de grao fino diz muito sobre para onde vai a pilha de IA da Apple.
OpenCut e o momento do CapCut de codigo aberto
Um editor de video gratuito com licenca MIT continua subindo nas tendencias do GitHub, e seu roteiro inclui um servidor MCP para agentes de IA. As ferramentas em torno da midia com IA estao alcancando os modelos.