← Voltar ao blog
Aicerca de 7 min de leitura

PixelUMM descarta os dois componentes dos quais todo modelo de IA visual depende

Publicado 5 de out. de 2026
PixelUMM descarta os dois componentes dos quais todo modelo de IA visual depende

Em 1º de outubro, um desenvolvedor que publica como CongWei1230 lançou o PixelUMM, um modelo multimodal sem encoder que lida com a compreensão e a geração de imagens e vídeos diretamente no espaço de pixels. O código e os pesos treinados são públicos. A parte interessante é o que o modelo não contém.

A maioria dos sistemas de IA visual construídos nos últimos anos compartilha dois componentes. Um autoencoder variacional comprime uma imagem em uma representação latente compacta, e o modelo generativo trabalha nesse espaço comprimido em vez de nos pixels brutos. Separadamente, os vision transformers transformam uma imagem em patches sobre os quais um modelo de linguagem pode raciocinar. O PixelUMM descarta ambos. Ele remove o espaço latente usado para geração e o encoder de patches usado para compreensão, e processa os pixels diretamente.

Essa alegação é arquitetural, e vale a pena entender por que quase todos os outros mantiveram esses componentes.

O que os dois componentes faziam

Um VAE existe para tornar a geração acessível. Uma fotografia de 1024 por 1024 com três canais de cor tem cerca de três milhões de números. Executar um processo de difusão sobre três milhões de valores a cada passo é caro, então o VAE comprime a imagem em uma grade latente menor, e o modelo remove o ruído ali. A contrapartida é que o VAE introduz um gargalo com perdas. Detalhes finos e a renderização precisa de texto muitas vezes perdem informação na compressão, o que é uma das razões pelas quais os primeiros modelos de imagem tinham dificuldades com textos pequenos.

O ViT existe para tornar a compreensão possível. Modelos de linguagem consomem tokens, e um ViT converte uma imagem em uma sequência de embeddings de patches que se parecem com tokens. É assim que um modelo multimodal consegue responder perguntas sobre uma imagem. A contrapartida é que a grade de patches é fixa, e as informações nas fronteiras entre os patches podem ficar embaralhadas.

Um campo denso de minúsculas células quadradas de luz que passam do azul frio ao âmbar quente

A aposta do PixelUMM é que, ao descartar ambos, ele pode unificar compreensão e geração em um único framework e evitar os artefatos que cada componente introduz.

Por que isso é difícil

A difusão em nível de pixel já foi proposta antes e repetidamente esbarrou no custo computacional. Se um modelo latente remove ruído de uma grade latente de 128 por 128, um modelo de pixels remove ruído de uma grade de imagem de 1024 por 1024, que tem aproximadamente 64 vezes mais posições por passo. Os comprimentos de sequência explodem, os custos de atenção escalam com o quadrado do comprimento da sequência, e o resultado é uma conta de treinamento e inferência que a maioria dos laboratórios não vai pagar por um ganho moderado de qualidade.

A compreensão sem encoder tem um problema diferente. Treinar um modelo para raciocinar diretamente sobre pixels brutos significa que o modelo precisa aprender características visuais do zero, em vez de partir de um encoder de visão pré-treinado. Isso representa uma quantidade enorme de supervisão a ser recuperada, e não é óbvio que o benefício supere o custo.

O PixelUMM é uma aposta de que a simplicidade arquitetural e a fidelidade valem o custo computacional. Os pesos divulgados são a evidência para avaliá-lo. Se ele vence em qualidade por dólar é uma questão em aberto que será resolvida pelas pessoas que o executarem, e não pelo post de lançamento. Esse é o ciclo de vida normal de uma proposta arquitetural: interessante até alguém fazer um benchmark, depois útil ou esquecida.

A parte que é genuinamente nova

O que torna o lançamento digno de atenção é a alegação de unificação. A maioria das stacks de produção para imagem e vídeo é montada a partir de peças projetadas separadamente: um VAE treinado para um propósito, um diffusion transformer para outro, um encoder de visão para um terceiro. Cada junção entre elas é um lugar onde o comportamento pode diferir entre treinamento e implantação, e onde os erros se acumulam.

Um único framework que lida com geração e compreensão na mesma representação elimina essas junções. Se funcionar, depurar um pipeline multimodal se torna mais simples, porque há uma representação e um conjunto de modos de falha em vez de quatro.

Há também uma questão de dados. Um modelo que nunca comprime não herda um artefato de compressão, então, em princípio, pode preservar detalhes exatos, incluindo texto e textura fina, sem uma etapa separada de refinamento. Isso é relevante para quem constrói pipelines de documentos, interfaces ou imagens de produtos, onde pequenos erros são eliminatórios.

O timing não é acidental

O PixelUMM chegou na mesma semana em que vários sistemas comerciais fizeram da preservação de detalhes seu recurso de destaque. A Black Forest Labs lançou o FLUX 3 Image com saída em 4K e edições regionais que preservam pixels, e as variantes do Imagen 4 do Google chegaram a uma plataforma hospedada. O mercado claramente está recompensando modelos que mantêm o que o usuário tinha, mudando apenas o que o usuário pediu para mudar.

A geração no espaço de pixels é a resposta de um pesquisador para a mesma questão que esses produtos respondem com engenharia industrial. A rota comercial adiciona resolução e controles de edição sobre uma arquitetura latente. A rota de pesquisa remove a arquitetura latente e paga por isso em poder computacional. Ambas tentam chegar ao ponto em que o detalhe gerado sobrevive ao escrutínio, e serão julgadas pelos mesmos usuários.

Por que alguém lançou isso agora

O lançamento também é um comentário sobre onde está o ecossistema aberto. Por dois anos, a comunidade de modelos abertos competiu principalmente em escala, publicando modelos cada vez maiores e treinados com mais dados. Essa competição produziu sistemas genuinamente capazes, e também produziu muitas arquiteturas muito semelhantes, já que quase todas usam o mesmo design de difusão latente e a mesma família de encoders de visão.

Lançar um modelo sem encoder é uma forma de competir em estrutura em vez de tamanho. É mais barato tentar uma arquitetura diferente do que gastar mais que os maiores laboratórios em dados de treinamento, e é uma contribuição mais útil se funcionar. Uma comunidade que apenas escala designs existentes converge para uma única abordagem. Uma comunidade que testa alternativas mantém mais opções vivas.

Essa é a leitura benevolente, e provavelmente é a correta. Os pesos divulgados dão à abordagem uma audiência justa, o que é mais do que a maioria das propostas arquiteturais recebe.

O que contaria como sucesso

Os pesos foram disponibilizados, então os testes são baratos de executar e difíceis de falsificar.

Olhe para a renderização de texto. A geração sem encoder deveria lidar com tipos pequenos melhor do que um modelo latente com o mesmo orçamento, ou não há razão para aceitar o custo computacional.

Olhe para memória e latência em um único acelerador de consumidor. Se o modelo precisa de hardware de data center para produzir uma imagem modesta, ele continua sendo um artefato de pesquisa. Se ele roda a uma velocidade útil em uma placa de workstation de alto desempenho, ele se torna uma ferramenta.

Olhe para o caminho de vídeo. O lançamento afirma lidar de forma unificada com imagem e vídeo, e o vídeo é onde o argumento computacional morde mais forte, porque o comprimento da sequência temporal multiplica tudo. Um clipe curto crível gerado no espaço de pixels seria a evidência mais forte a favor da abordagem.

Espere resultados mistos. Arquiteturas novas geralmente são assim, e os primeiros benchmarks públicos raramente contam a história completa. Um lançamento como este importa porque torna explícitas as premissas do design dominante, e essas premissas foram tratadas como resolvidas por tempo suficiente para que seja útil ver alguém testá-las diretamente.

Artigos relacionados