← Volver al blog
Aiaprox. 6 min de lectura

Iris-3B genera pixeles sin VAE

Publicado 11 oct 2026
Iris-3B genera pixeles sin VAE

Casi todos los generadores de imagenes populares funcionan igual bajo el capo. No dibujan los pixeles directamente. Primero comprimen la imagen en una representacion abstracta mas pequena con un componente llamado autoencoder variacional, o VAE, generan en ese espacio comprimido y luego decodifican el resultado de vuelta a pixeles. Este diseno en dos pasos es eficiente, y de ahi vienen tambien muchos defectos pequenos. El texto fino se emborrona. Las lineas delgadas ondulan. Los detalles se pierden en el viaje de ida y vuelta.

En octubre de 2026, un pequeno laboratorio llamado Speridlabs publico Iris-3B, un modelo de 3 mil millones de parametros que se salta el viaje por completo. Genera pixeles directamente. Los pesos son abiertos bajo licencia Apache 2.0, y todo se apoya en un transformer de flow matching. No es el modelo de imagen mas grande ni mas llamativo del mes. Es, probablemente, el mas interesante por lo que dice sobre hacia donde va el campo.

Por que prescindir del VAE importa

El VAE existe para abaratar la generacion. Trabajar en un espacio latente comprimido reduce mucho el computo necesario, y por eso casi todo modelo de difusion usa uno. El compromiso es que el codificador descarta informacion antes de que empiece la generacion, y el decodificador tiene que adivinarla. A baja resolucion la perdida es invisible. A alta resolucion, o en imagenes con texto denso y bordes precisos, se manifiesta como la papilla que los generadores suelen dejar alrededor de los detalles pequenos.

Generar en el espacio de pixeles elimina ese cuello de botella, porque no hay un paso de compresion que pueda perder algo. El precio es que ahora se trabaja en una rejilla de valores mucho mayor, lo que resulta caro. El argumento de Iris-3B es que es lo bastante pequeno para hacer manejable ese gasto. Si aguanta en la practica lo probara la comunidad, pero la direccion es clara: cuanto mejor la eficiencia, mas debil la razon para aceptar la penalizacion de calidad del VAE.

{{INLINE1}}

El segundo truco: un prior generativo para vision

Lo mas inusual de Iris-3B es lo que hace ademas. El modelo aplica su prior generativo a tareas de vision sensibles al detalle, incluida la estimacion de profundidad y la restauracion de imagen. Dicho claro: un modelo entrenado para producir imagenes tambien puede recibir el encargo de extraer informacion de ellas, estimar a que distancia estan las cosas o limpiar una foto degradada.

Es una combinacion significativa, porque apunta a una tendencia mas amplia. Durante un tiempo, generacion y comprension se trataron como dos problemas con dos modelos. Ultimamente se estan fusionando. Un sistema capaz de producir una imagen verosimil ya entiende mucho sobre como se estructuran las escenas, como cae la luz y como se relacionan los objetos en el espacio. Reutilizar esa comprension para tareas de analisis cuesta menos que entrenar un modelo dedicado para cada una.

Que significa flow matching

Iris-3B se apoya en un transformer de flow matching, y la idea es mas sencilla que el nombre. Los modelos de imagen anteriores aprenden invirtiendo un proceso que anade ruido aleatorio a una imagen, paso a paso, hasta que desaparece. La generacion recorre ese proceso al reves, eliminando ruido paso a paso hasta que emerge una imagen. El flow matching toma una ruta mas directa. Aprende un camino casi recto del ruido a la imagen en lugar de uno sinuoso, lo que en teoria necesita menos pasos y menos computo para un buen resultado.

Eso importa especialmente para un modelo en espacio de pixeles. Trabajar sobre pixeles crudos es caro, y la forma habitual de controlar ese coste es hacer eficiente cada paso. Un camino mas recto significa menos pasos, y eso explica en parte como un modelo de 3 mil millones de parametros puede intentar una tarea que otros mayores resuelven con el atajo del VAE. La eleccion de arquitectura y el tamano van juntos. Ninguno de los dos bastaria solo.

Pruebas independientes decidiran si el intercambio compensa. Si la generacion en espacio de pixeles iguala a la latente a un coste similar, el VAE deja de ser lo predeterminado y pasa a ser una opcion. Si no, Iris-3B sigue siendo un dato util sobre donde esta el muro.

Para que sirve de verdad un modelo abierto pequeno

Iris-3B no superara a ningun gigante en una clasificacion. Tres mil millones de parametros son una fraccion de lo que ejecutan los lideres comerciales, y un modelo generalista de ese tamano perdera en los prompts mas dificiles. Juzgarlo con ese criterio es perder el punto.

Los modelos abiertos de este tamano se ganan su sitio de tres maneras. Corren en hardware que la gente ya tiene, asi que no hay factura por imagen ni datos que salen del edificio. Se pueden afinar para una tarea estrecha, y ahi es donde los modelos pequenos suelen batir a los grandes: un modelo entrenado especificamente con la fotografia de producto de una empresa superara a un generalista en esa tarea concreta. Y son inspeccionables, lo que importa a equipos que deben explicar de donde viene una salida.

La licencia Apache 2.0 es el detalle que hace posibles las tres cosas. Una licencia permisiva permite a una startup construir un producto sobre Iris-3B sin negociar condiciones ni temer un cambio de precio. Para un laboratorio que quiere que su arquitectura se adopte, es el camino mas rapido hacia la relevancia. El modelo no necesita ganar el ranking. Necesita ser aquello con lo que otros construyen.

Una advertencia valida para toda publicacion abierta

Una advertencia se aplica a todo modelo abierto, e Iris-3B no es la excepcion. Una licencia permisiva cubre los pesos, no los datos de entrenamiento ni las salidas. Los equipos que quieran entregar comercialmente deben seguir pensando de que aprendio el modelo y que derechos lleva aparejados una imagen generada. Es una cuestion legal que la licencia no resuelve, y es la misma pregunta que plantea todo modelo abierto. La libertad de ejecutar el modelo uno mismo es real y valiosa. No es lo mismo que la ausencia de responsabilidad.

La imagen mas amplia

El campo de la imagen en octubre de 2026 parece abarrotado visto desde arriba. Nano Banana 2.1, GPT Image 2.5, FLUX 3 y Seedream 5.0 entregaron actualizaciones recientes, y las ganancias en la frontera se miden en margenes pequenos. Por debajo, el movimiento mas interesante es arquitectonico. La generacion en espacio de pixeles cuestiona una suposicion sostenida desde los primeros modelos de difusion: que hay que comprimir antes de crear. Y los modelos abiertos pequenos siguen demostrando que la forma mas rapida de difundir una idea por el campo es regalarla.

Puede que Iris-3B acabe siendo una nota al pie, o la version que otros copien. En cualquier caso, las dos preguntas que plantea merecen atencion. Se pueden generar imagenes con todo el detalle sin un paso intermedio con perdida, y puede un modelo crear y analizar a la vez. Si las respuestas pasan a ser si, la proxima generacion de herramientas de imagen se construira sobre una base distinta a la anterior.

Artículos relacionados