← Volver al blog
Aiaprox. 8 min de lectura

PixelUMM y Sana apuntan a la misma idea: eliminar el andamiaje de los modelos de visión

Publicado 7 oct 2026
PixelUMM y Sana apuntan a la misma idea: eliminar el andamiaje de los modelos de visión

Dos lanzamientos de investigación de NVIDIA aparecieron con pocos días de diferencia, y comparten una tesis. PixelUMM apareció sin fanfarria en Hugging Face el 1 de octubre a las 21:40 UTC, un checkpoint de 15,2 mil millones de parámetros sin entrada de blog, sin comunicado de prensa, sin diapositiva de presentación. Sana, de investigadores de NVIDIA, MIT y Tsinghua, lleva más tiempo público y adopta el enfoque opuesto al mismo problema de infraestructura.

PixelUMM: un modelo unificado sin codificador

El nombre del repositorio dice lo que es el proyecto: nv-tlabs/PixelUMM, descrito en su propio resumen de una línea como "comprensión y generación unificadas de imágenes y video sin codificador". Se asienta sobre un backbone Qwen3-8B con una licencia de repositorio Apache-2.0.

La parte "sin codificador" es la afirmación interesante. La mayoría de los sistemas de IA visuales actuales encadenan componentes separados: un codificador de visión para convertir una imagen en tokens que un modelo de lenguaje pueda leer, un VAE para comprimir datos de píxeles en un espacio latente en el que pueda trabajar un modelo de difusión, y un transformer visual para manejar la secuencia. PixelUMM se construyó para operar sin esas etapas intermedias, y por eso su propia página de proyecto todavía dice "preview" mientras los pesos se pueden descargar.

Esa brecha entre un artefacto que existe y un proveedor que no ha dicho nada es toda la historia del lanzamiento. Hay un repositorio de GitHub, un preprint de arXiv numerado 2609.38597 con fecha del 29 de septiembre y autores de NVIDIA y la Universidad de Waterloo, y un checkpoint dividido en 128 archivos con un índice oculto sin el cual los cargadores se niegan a ejecutarlo. Si NVIDIA considera que PixelUMM está anunciado es una pregunta que la compañía no ha respondido.

El patrón de lanzamiento importa para cualquiera que siga este campo. La investigación que antes llegaba con una entrada de blog, una página de demostración y un ciclo de prensa coordinado ahora a veces llega como un repositorio y un artículo. El artefacto es público y citable mientras la comunicación del propio proveedor guarda silencio, lo que hace posible usar el modelo e imposible citar un benchmark oficial para él. Los equipos que lo evalúan trabajan a partir de un artículo y sus propias pruebas.

Sana: comprimir la cadena de costos en lugar de un solo módulo

Sana ataca la misma capa de la pila desde la dirección opuesta. La conversión de texto a imagen en alta resolución se vuelve costosa por una razón que tiene poco que ver con el recuento de píxeles: la cantidad de tokens latentes que entran al transformer de difusión crece rápidamente con la resolución. La autoatención estándar tiene que relacionar cada token con todos los demás, así que el costo, la memoria y la latencia aumentan a la vez.

En la propia comparación de 1024 píxeles de NVIDIA, FLUX-dev tiene 12 mil millones de parámetros, se ejecuta a 0,04 muestras por segundo y tarda 23 segundos por imagen. Avanzar hacia 2K o 4K, reducir el modelo o recortar los pasos de muestreo no soluciona el problema de fondo.

Sana comprime toda la cadena en lugar de un solo componente. Un autoencoder de compresión profunda de 32x reduce la cantidad de tokens latentes. La atención lineal reduce el costo de cada capa del transformer. Un solucionador eficiente y la destilación de pocos pasos reducen la cantidad de pasadas de muestreo. El slicing, el offloading y la cuantización de bajos bits reducen la memoria de despliegue. Los modelos publicados incluyen versiones de 0,6B y 1,6B orientadas a hasta 4K, con Sana-1.5 extendiéndose a 4,8B. En la comparación oficial de 1024 píxeles, la versión de 0,6B se ejecuta con 0,9 segundos de latencia.

El enfoque de compresión de cadena tiene una propiedad atractiva que una solución de un solo módulo no tiene. Como cada etapa contribuye, un equipo puede aplicar las partes que encajan con su hardware y omitir el resto. Alguien con una estación de trabajo y sin experiencia en cuantización puede tomar el solucionador eficiente. Alguien que despliega a escala puede apilar slicing, offloading y cuantización de bajos bits para caber en una tarjeta mucho más pequeña. Las compensaciones se documentan por etapa en lugar de agruparse en una única decisión de todo o nada.

El linaje de Sana también muestra con qué rapidez un resultado de investigación se convierte en una superficie de producto. El modelo original apuntaba a salida de texto a video en 4K. Desde entonces, el repositorio ha crecido para incluir Sana-Sprint, generación de video, ControlNet, LoRA, cuantización, integración con ComfyUI y un servicio en línea. Ese es el mismo arco que siguieron las herramientas de imagen: de un artículo, a un repositorio, a un nodo en la interfaz que la gente ya usa.

Qué comparten los dos enfoques

Si ponemos los lanzamientos uno al lado del otro, la dirección del viaje está clara. Ambos intentan eliminar la maquinaria intermedia que se ha interpuesto entre los píxeles y los modelos desde los primeros días del campo. PixelUMM se pregunta si el codificador es necesario en absoluto. Sana se pregunta cuánto de la cadena de cómputo se puede comprimir antes de que la calidad se rompa.

La compensación es la misma en ambos casos, y ningún laboratorio la oculta. Eliminar un codificador significa que el modelo tiene que aprender lo que el codificador solía proporcionar, lo que cuesta cómputo de entrenamiento y puede costar calidad en tareas que el codificador manejaba bien. Comprimir la cadena de forma agresiva significa que el techo de calidad se desplaza, y los propios materiales de Sana son cuidadosos con el hardware y las condiciones de medición detrás de esos números de latencia.

La razón por la que ambos laboratorios atacan esta capa es que los intermediarios se han convertido en la parte costosa. Un codificador de visión y un VAE se entrenan por separado, se ajustan por separado y se sirven por separado. Cada uno es un componente que puede desincronizarse con el resto del pipeline, y cada uno añade latencia al frente de cada solicitud. Eliminarlos es una simplificación arquitectónica más que un truco de investigación, y da sus frutos en cada despliegue.

Por qué importa para cualquiera que construya con imágenes

Para los profesionales, la consecuencia práctica son mínimos de hardware más bajos. El trabajo de Sana de NVIDIA es parte de un patrón más amplio este año: los modelos que antes necesitaban una tarjeta de centro de datos están siendo reelaborados para caber en hardware de consumo, y la comunidad abierta ha empezado a tratar un mínimo de 6 GB de VRAM como un requisito en lugar de un extra.

Hay una segunda consecuencia que aparece en los diagramas de arquitectura. Cuando el codificador y el VAE dejan de ser servicios separados, un pipeline que solía tener tres modelos que versionar, monitorear y pagar se convierte en uno. Eso es menos visible que un número de latencia, pero es lo que cambia la carga de mantenimiento en un producto real.

Para los equipos que construyen sobre estos modelos, la pregunta práctica es qué simplificación pueden adoptar primero. El enfoque sin codificador promete una arquitectura más limpia, pero requiere confiar en que el manejo de representaciones del propio modelo coincida con lo que proporcionaba un codificador diseñado a propósito. El enfoque de compresión de cadena promete mejoras medibles de velocidad y memoria hoy, manteniendo intacta la arquitectura existente. Una es una apuesta por la dirección en la que se dirige el campo; la otra es una apuesta por el hardware que ya tienes.

Ambas apuestas son razonables, y los laboratorios que las persiguen no compiten por el mismo despliegue. El enfoque unificado de PixelUMM conviene a equipos que quieren un modelo para comprensión y generación. Sana conviene a equipos que necesitan salida de alta resolución en hardware limitado. La superposición es la parte de la pila que ambos intentan eliminar.

NVIDIA no ha dicho si PixelUMM está terminado. El código de Sana está disponible, y el repositorio ha crecido para incluir variantes sprint, generación de video, ControlNet, LoRA, cuantización, soporte de ComfyUI y un servicio en línea. Dos equipos de investigación, dos rutas, un objetivo: las partes de la pila visual en las que nadie quería pensar están siendo eliminadas por diseño.

Artículos relacionados