Iris-3B genere des pixels sans VAE

Presque tous les generateurs d'images populaires fonctionnent de la meme maniere sous le capot. Ils ne dessinent pas les pixels directement. Ils compressent d'abord l'image dans une representation abstraite plus petite via un composant appele autoencodeur variationnel, ou VAE, generent dans cet espace compresse, puis decodent le resultat en pixels. Cette conception en deux temps est efficace, et c'est aussi de la que viennent beaucoup de petits defauts. Le texte fin bave. Les traits fins ondulent. Les details se perdent dans l'aller-retour.
En octobre 2026, un petit laboratoire nomme Speridlabs a publie Iris-3B, un modele de 3 milliards de parametres qui saute entierement l'aller-retour. Il genere des pixels directement. Les poids sont ouverts sous licence Apache 2.0, et l'ensemble repose sur un transformer a flow matching. Ce n'est pas le plus grand ni le plus clinquant des modeles d'images du mois. C'est sans doute le plus interessant pour ce qu'il dit de la direction du domaine.
Pourquoi se passer du VAE compte
Le VAE existe pour rendre la generation peu couteuse. Travailler dans un espace latent compresse reduit fortement le calcul necessaire, ce qui explique pourquoi presque tous les modeles de diffusion en utilisent un. Le compromis, c'est que l'encodeur jette de l'information avant meme que la generation commence, et que le decodeur doit la deviner. A basse resolution, la perte est invisible. A haute resolution, ou sur des images riches en texte et en bords precis, elle se manifeste par la bouillie familiere que les generateurs produisent autour des petits details.
Generer dans l'espace pixel supprime ce goulot d'etranglement, car aucune etape de compression ne peut rien perdre. Le cout, c'est qu'on travaille desormais sur une grille de valeurs bien plus grande, ce qui est cher. L'argument d'Iris-3B est qu'il est assez petit pour rendre cette depense gerable. Reste a voir si cela tient en pratique, mais la direction est claire : a mesure que l'efficacite progresse, la raison d'accepter la penalite de qualite du VAE s'affaiblit.
{{INLINE1}}
Le second tour : un a priori generatif pour la vision
Le cote plus inhabituel d'Iris-3B est ce qu'il fait d'autre. Le modele applique son a priori generatif a des taches de vision sensibles au detail, dont l'estimation de profondeur et la restauration d'image. En clair, un modele entraine a produire des images peut aussi etre charge d'en extraire de l'information : estimer la distance des objets, ou nettoyer une photo degradee.
C'est une combinaison interessante, car elle pointe une tendance plus large. Pendant un temps, generation et comprehension etaient traitees comme deux problemes, avec deux modeles distincts. Elles fusionnent aujourd'hui. Un systeme capable de produire une image plausible comprend deja beaucoup de choses sur la structure des scenes, la chute de la lumiere et les relations spatiales entre objets. Reutiliser cette comprehension pour des taches d'analyse coute moins cher que d'entrainer un modele dedie pour chacune.
Ce que dit le flow matching
Iris-3B repose sur un transformer a flow matching, et l'idee est plus simple que le nom. Les anciens modeles d'images apprennent en inversant un processus qui ajoute du bruit aleatoire a une image, etape par etape, jusqu'a ce qu'elle disparaisse. La generation fait ensuite tourner ce processus a l'envers, en denoisant pas a pas jusqu'a ce qu'une image emerge. Le flow matching prend une voie plus directe. Il apprend un chemin presque droit du bruit vers l'image plutot qu'un chemin sinueux, ce qui, en theorie, demande moins d'etapes et moins de calcul pour un bon resultat.
Cela compte particulierement pour un modele en espace pixel. Travailler sur les pixels bruts est couteux, et le moyen habituel de maitriser ce cout est de rendre chaque etape efficace. Un chemin plus droit signifie moins d'etapes, ce qui explique en partie qu'un modele de 3 milliards de parametres puisse tenter un travail que de plus grands gerent grace au raccourci du VAE. Le choix d'architecture et la taille du modele vont ensemble. Ni l'un ni l'autre ne suffirait seul.
Des tests independants decideront si le compromis est payant. Si la generation en espace pixel egale celle en espace latent a cout comparable, le VAE cesse d'etre un defaut pour devenir un choix. Sinon, Iris-3B reste un point de donnee utile sur l'emplacement du mur.
A quoi sert vraiment un petit modele ouvert
Iris-3B ne depassera aucun geant sur un classement. Trois milliards de parametres, c'est une fraction de ce que font tourner les leaders commerciaux, et un modele generaliste de cette taille perdra sur les prompts les plus difficiles. Le juger sur ce critere manque l'essentiel.
Les modeles ouverts de cette taille gagnent leur place de trois facons. Ils tournent sur du materiel que les gens possedent deja, donc pas de facture a l'image et pas de donnees qui quittent le batiment. Ils peuvent etre affines pour une tache etroite, et c'est souvent la que les petits modeles battent les grands : un modele entraine specifiquement sur la photographie produit d'une entreprise surpassera un modele generaliste sur cette tache precise. Et ils sont inspectables, ce qui compte pour les equipes qui doivent expliquer d'ou vient une sortie.
La licence Apache 2.0 est le detail qui rend les trois possibles. Une licence permissive permet a une startup de construire un produit sur Iris-3B sans negocier de conditions ni craindre un changement de prix. Pour un laboratoire qui veut faire adopter son architecture, c'est le chemin le plus rapide vers la pertinence. Le modele n'a pas besoin de gagner le classement. Il doit etre l'objet avec lequel les autres construisent.
Une mise en garde qui vaut pour toute publication ouverte
Une mise en garde s'applique a tout modele ouvert, et Iris-3B ne fait pas exception. Une licence permissive couvre les poids, pas les donnees d'entrainement ni les sorties. Les equipes qui veulent livrer commercialement doivent toujours reflechir a ce que le modele a appris et aux droits attaches a une image generee. C'est une question juridique que la licence ne tranche pas, et c'est la meme question que souleve tout modele ouvert. La liberte de faire tourner le modele soi-meme est reelle et precieuse. Ce n'est pas la meme chose que l'absence de responsabilite.
La vue d'ensemble
Le domaine de l'image en octobre 2026 parait encombre vu d'en haut. Nano Banana 2.1, GPT Image 2.5, FLUX 3 et Seedream 5.0 ont tous livre des mises a jour recentes, et les gains a la frontiere se mesurent en petites marges. En dessous, le mouvement plus interessant est architectural. La generation en espace pixel remet en question une hypothese tenue depuis les premiers modeles de diffusion : qu'il faut compresser avant de creer. Et les petits modeles ouverts continuent de prouver que le moyen le plus rapide de repandre une idee dans le domaine est de la donner.
Iris-3B finira peut-etre en note de bas de page, ou deviendra la version que d'autres copient. Dans les deux cas, les deux questions qu'il souleve meritent l'attention. Peut-on generer des images a pleine fidelite sans etape intermediaire avec perte, et un modele peut-il a la fois creer et analyser ? Si les reponses deviennent oui, la prochaine generation d'outils d'image sera construite sur une fondation differente de la precedente.
Articles associés
Le protocole PACT de Decagon veut faire du consentement un standard
Decagon a ouvert un protocole pour verifier l'identite d'un agent personnel et les permissions qu'un client lui a accordees. C'est de la plomberie, et elle decide si l'economie des agents fonctionne.
La vague des retrouvailles par IA : un debat que la Chine n'arrive pas a trancher
Des films hommage par IA ont ramene des figures disparues sur les ecrans chinois et recolte des centaines de milliers de likes. Puis la controverse est arrivee, et elle portait sur le consentement.
Apple a publie un modele multimodal ouvert et n'en a presque rien dit
Cette sortie axee sur la recherche a glisse sous les radars grand public, mais son ancrage visuel tres fin dit beaucoup de la direction de la pile IA d'Apple.
OpenCut et le moment du CapCut open source
Un editeur video gratuit sous licence MIT grimpe sans cesse dans les tendances GitHub, et sa feuille de route inclut un serveur MCP pour agents IA. Les outils autour des medias IA rattrapent les modeles.