← Volver al blog
Aiaprox. 7 min de lectura

PixelUMM descarta los dos componentes de los que depende todo modelo visual de IA

Publicado 5 oct 2026
PixelUMM descarta los dos componentes de los que depende todo modelo visual de IA

El 1 de octubre, un desarrollador que publica como CongWei1230 lanzó PixelUMM, un modelo multimodal sin codificador que maneja la comprensión y la generación de imágenes y video directamente en el espacio de píxeles. El código y los pesos entrenados son públicos. Lo interesante es lo que el modelo no contiene.

La mayoría de los sistemas visuales de IA construidos en los últimos años comparten dos componentes. Un autoencoder variacional comprime una imagen en una representación latente compacta, y el modelo generativo trabaja en ese espacio comprimido en lugar de sobre píxeles sin procesar. Por separado, los transformers de visión convierten una imagen en parches sobre los que un modelo de lenguaje puede razonar. PixelUMM descarta ambos. Elimina el espacio latente usado para la generación y el codificador de parches usado para la comprensión, y procesa los píxeles directamente.

Esa afirmación es arquitectónica, y vale la pena entender por qué casi todos los demás conservaron esos componentes.

Qué hacían los dos componentes

Un VAE existe para hacer que la generación sea asequible. Una fotografía de 1024 por 1024 con tres canales de color tiene unos tres millones de números. Ejecutar un proceso de difusión sobre tres millones de valores en cada paso es caro, así que el VAE comprime la imagen a una cuadrícula latente más pequeña, y el modelo elimina ruido allí. La contrapartida es que el VAE introduce un cuello de botella con pérdida. El detalle fino y el renderizado preciso de texto a menudo pierden información en la compresión, lo cual es una razón por la que los primeros modelos de imagen tenían problemas con texto pequeño.

El ViT existe para hacer posible la comprensión. Los modelos de lenguaje consumen tokens, y un ViT convierte una imagen en una secuencia de embeddings de parches que se parecen a tokens. Así es como un modelo multimodal puede responder preguntas sobre una imagen. La contrapartida es que la cuadrícula de parches es fija, y la información en los límites entre parches puede volverse confusa.

Un campo denso de diminutas celdas cuadradas de luz que cambian de azul frío a ámbar cálido

La apuesta de PixelUMM es que, al descartar ambos, puede unificar la comprensión y la generación en un solo marco y evitar los artefactos que introduce cada componente.

Por qué esto es difícil

La difusión a nivel de píxeles se ha propuesto antes y se ha topado repetidamente con el cómputo. Si un modelo latente elimina ruido de una cuadrícula latente de 128 por 128, un modelo de píxeles elimina ruido de una cuadrícula de imagen de 1024 por 1024, que es aproximadamente 64 veces más posiciones por paso. Las longitudes de secuencia se disparan, los costos de atención escalan con el cuadrado de la longitud de secuencia, y el resultado es una factura de entrenamiento e inferencia que la mayoría de los laboratorios no pagará por una ganancia moderada de calidad.

La comprensión sin codificador tiene un problema diferente. Entrenar un modelo para razonar directamente sobre píxeles sin procesar significa que el modelo debe aprender características visuales desde cero en lugar de partir de un codificador de visión preentrenado. Esa es una gran cantidad de supervisión por recuperar, y no es obvio que el beneficio supere el costo.

PixelUMM es una apuesta a que la simplicidad arquitectónica y la fidelidad valen el cómputo. Los pesos publicados son la evidencia para evaluarlo. Que gane en calidad por dólar es una pregunta abierta que resolverán las personas que lo ejecuten, no la publicación de lanzamiento. Ese es el ciclo de vida normal de una propuesta arquitectónica: interesante hasta que alguien la evalúa con benchmarks, y luego útil u olvidada.

La parte que es genuinamente nueva

Lo que hace que el lanzamiento merezca atención es la afirmación de unificación. La mayoría de los stacks de producción para imagen y video se ensamblan a partir de piezas que fueron diseñadas por separado: un VAE entrenado para un propósito, un transformer de difusión para otro, un codificador de visión para un tercero. Cada unión entre ellas es un lugar donde el comportamiento puede diferir entre entrenamiento y despliegue, y donde los errores se acumulan.

Un único marco que maneja la generación y la comprensión en la misma representación elimina esas uniones. Si funciona, depurar un pipeline multimodal se vuelve más simple, porque hay una representación y un conjunto de modos de fallo en lugar de cuatro.

También hay una historia de datos. Un modelo que nunca comprime no hereda un artefacto de compresión, así que en principio puede preservar detalles exactos, incluidos texto y textura fina, sin una etapa de refinamiento separada. Eso es relevante para cualquiera que construya canalizaciones de documentos, interfaces de usuario o imágenes de productos donde los pequeños errores son descalificantes.

El momento no es accidental

PixelUMM llegó la misma semana en que varios sistemas comerciales hicieron de la preservación de detalles su característica principal. Black Forest Labs lanzó FLUX 3 Image con salida 4K y ediciones regionales que preservan píxeles, y las variantes de Imagen 4 de Google llegaron a una plataforma alojada. El mercado claramente está recompensando a los modelos que conservan lo que el usuario tenía mientras cambian solo lo que el usuario pidió cambiar.

La generación en espacio de píxeles es la respuesta de un investigador a la misma pregunta que esos productos responden con ingeniería industrial. La ruta comercial añade resolución y controles de edición sobre una arquitectura latente. La ruta de investigación elimina la arquitectura latente y lo paga en cómputo. Ambas intentan llegar al punto en que el detalle generado sobreviva al escrutinio, y serán juzgadas por los mismos usuarios.

Por qué alguien lanzó esto ahora

El lanzamiento también es un comentario sobre dónde está el ecosistema abierto. Durante dos años, la comunidad de modelos abiertos ha competido principalmente en escala, publicando modelos cada vez más grandes entrenados con más datos. Esa competencia ha producido sistemas genuinamente capaces, y también ha producido muchas arquitecturas muy similares, ya que casi todas usan el mismo diseño de difusión latente y la misma familia de codificadores de visión.

Lanzar un modelo sin codificador es una forma de competir en estructura en lugar de tamaño. Es más barato probar una arquitectura diferente que gastar más que los laboratorios más grandes en datos de entrenamiento, y es una contribución más útil si funciona. Una comunidad que solo escala diseños existentes converge en un enfoque. Una comunidad que prueba alternativas mantiene más opciones vivas.

Esa es la lectura caritativa, y probablemente sea la correcta. Los pesos publicados le dan a este enfoque una audiencia justa, que es más de lo que reciben la mayoría de las propuestas arquitectónicas.

Qué contaría como éxito

Los pesos ya están fuera, así que las pruebas son baratas de ejecutar y difíciles de falsear.

Mira el renderizado de texto. La generación sin codificador debería manejar tipografía pequeña mejor que un modelo latente con el mismo presupuesto, o no hay razón para aceptar el costo de cómputo.

Mira la memoria y la latencia en un único acelerador de consumo. Si el modelo necesita hardware de centro de datos para producir una imagen modesta, sigue siendo un artefacto de investigación. Si se ejecuta a una velocidad útil en una tarjeta de estación de trabajo de gama alta, se convierte en una herramienta.

Mira la ruta de video. El lanzamiento afirma un manejo unificado de imagen y video, y el video es donde el argumento del cómputo muerde más fuerte, porque la longitud de secuencia temporal multiplica todo. Un clip corto creíble generado en espacio de píxeles sería la evidencia más fuerte para el enfoque.

Espera que los resultados sean mixtos. Las arquitecturas nuevas normalmente lo son, y los primeros benchmarks públicos rara vez cuentan toda la historia. Un lanzamiento como este importa porque hace explícitas las suposiciones del diseño dominante, y esas suposiciones se han tratado como resueltas durante suficiente tiempo como para que sea útil ver a alguien ponerlas a prueba directamente.

Artículos relacionados