← Retour au blog
AiEnviron 8 min de lecture

PixelUMM se débarrasse des deux composants dont dépend chaque modèle d'IA visuelle

Publié le 5 oct. 2026
PixelUMM se débarrasse des deux composants dont dépend chaque modèle d'IA visuelle

Le 1er octobre, un développeur publiant sous le nom de CongWei1230 a publié PixelUMM, un modèle multimodal sans encodeur qui traite directement dans l'espace pixel la compréhension et la génération d'images et de vidéos. Le code et les poids entraînés sont publics. La partie intéressante, c'est ce que le modèle ne contient pas.

La plupart des systèmes d'IA visuelle conçus ces dernières années partagent deux composants. Un auto-encodeur variationnel compresse une image en une représentation latente compacte, et le modèle génératif travaille dans cet espace compressé plutôt que sur les pixels bruts. Séparément, les transformateurs de vision transforment une image en patchs sur lesquels un modèle de langage peut raisonner. PixelUMM abandonne les deux. Il supprime l'espace latent utilisé pour la génération et l'encodeur de patchs utilisé pour la compréhension, et traite directement les pixels.

Cette affirmation est architecturale, et il vaut la peine de comprendre pourquoi presque tous les autres ont conservé ces composants.

Ce que faisaient les deux composants

Un VAE existe pour rendre la génération abordable. Une photographie en 1024 par 1024 avec trois canaux de couleur représente environ trois millions de nombres. Exécuter un processus de diffusion sur trois millions de valeurs à chaque étape est coûteux, donc le VAE compresse l'image vers une grille latente plus petite, et le modèle y débruite. Le compromis est que le VAE introduit un goulot d'étranglement avec perte. Les détails fins et le rendu précis du texte perdent souvent de l'information lors de la compression, ce qui explique en partie pourquoi les premiers modèles d'image avaient du mal avec les petits textes.

Le ViT existe pour rendre la compréhension possible. Les modèles de langage consomment des tokens, et un ViT convertit une image en une séquence d'embeddings de patchs qui ressemblent à des tokens. C'est ainsi qu'un modèle multimodal peut répondre à des questions sur une image. Le compromis est que la grille de patchs est fixe, et que l'information aux frontières entre les patchs peut devenir confuse.

Un champ dense de minuscules cellules lumineuses carrées passant du bleu froid à l'ambre chaud

Le pari de PixelUMM est qu'en abandonnant les deux, il peut unifier compréhension et génération dans un seul cadre et éviter les artefacts que chaque composant introduit.

Pourquoi c'est difficile

La diffusion au niveau pixel a déjà été proposée et s'est heurtée à plusieurs reprises au coût de calcul. Si un modèle latent débruite une grille latente de 128 par 128, un modèle pixel débruite une grille d'image de 1024 par 1024, soit environ 64 fois plus de positions par étape. Les longueurs de séquence explosent, les coûts d'attention augmentent avec le carré de la longueur de séquence, et le résultat est une facture d'entraînement et d'inférence que la plupart des laboratoires ne paieront pas pour un gain de qualité modéré.

La compréhension sans encodeur pose un problème différent. Entraîner un modèle à raisonner directement sur des pixels bruts signifie que le modèle doit apprendre les caractéristiques visuelles à partir de zéro plutôt que de partir d'un encodeur de vision préentraîné. C'est une grande quantité de supervision à rattraper, et il n'est pas évident que le bénéfice dépasse le coût.

PixelUMM est un pari que la simplicité architecturale et la fidélité valent le coût de calcul. Les poids publiés sont les preuves permettant de l'évaluer. Savoir s'il gagne en qualité par dollar est une question ouverte qui sera tranchée par les personnes qui l'exécuteront, pas par l'annonce de publication. C'est le cycle de vie normal d'une proposition architecturale : intéressante jusqu'à ce que quelqu'un l'évalue, puis utile ou oubliée.

La partie réellement nouvelle

Ce qui rend cette publication digne d'attention, c'est l'affirmation d'unification. La plupart des stacks de production pour l'image et la vidéo sont assemblés à partir de pièces conçues séparément : un VAE entraîné pour un objectif, un transformateur de diffusion pour un autre, un encodeur de vision pour un troisième. Chaque jointure entre elles est un endroit où le comportement peut différer entre l'entraînement et le déploiement, et où les erreurs se cumulent.

Un cadre unique qui gère la génération et la compréhension dans la même représentation supprime ces jointures. Si cela fonctionne, le débogage d'un pipeline multimodal devient plus simple, car il y a une seule représentation et un seul ensemble de modes de défaillance au lieu de quatre.

Il y a aussi un argument lié aux données. Un modèle qui ne compresse jamais n'hérite pas d'un artefact de compression, il peut donc en principe préserver les détails exacts, y compris le texte et les textures fines, sans étape de raffinement séparée. Cela est pertinent pour quiconque construit des pipelines de documents, d'interfaces utilisateur ou d'images produit où les petites erreurs sont rédhibitoires.

Le timing n'est pas anodin

PixelUMM est arrivé la même semaine où plusieurs systèmes commerciaux ont fait de la préservation des détails leur fonctionnalité phare. Black Forest Labs a livré FLUX 3 Image avec une sortie 4K et des modifications régionales préservant les pixels, et les variantes d'Imagen 4 de Google sont arrivées sur une plateforme hébergée. Le marché récompense clairement les modèles qui conservent ce que l'utilisateur avait tout en ne changeant que ce que l'utilisateur a demandé de changer.

La génération dans l'espace pixel est la réponse d'un chercheur à la même question que ces produits résolvent par l'ingénierie industrielle. La voie commerciale ajoute de la résolution et des contrôles d'édition au-dessus d'une architecture latente. La voie de la recherche supprime l'architecture latente et le paie en coût de calcul. Les deux tentent d'atteindre le point où les détails générés résistent à l'examen, et elles seront jugées par les mêmes utilisateurs.

Pourquoi quelqu'un a publié cela maintenant

La publication est aussi un commentaire sur l'état de l'écosystème ouvert. Depuis deux ans, la communauté des modèles ouverts rivalise principalement sur l'échelle, en publiant des modèles de plus en plus grands entraînés sur davantage de données. Cette compétition a produit des systèmes réellement compétents, et elle a aussi produit beaucoup d'architectures très similaires, puisque presque toutes utilisent la même conception de diffusion latente et la même famille d'encodeurs de vision.

Publier un modèle sans encodeur est une façon de rivaliser sur la structure plutôt que sur la taille. Il est moins coûteux d'essayer une architecture différente que de dépenser plus que les plus grands laboratoires en données d'entraînement, et c'est une contribution plus utile si cela fonctionne. Une communauté qui ne fait que monter en échelle des conceptions existantes converge vers une seule approche. Une communauté qui teste des alternatives garde plus d'options en vie.

C'est la lecture charitable, et c'est probablement la bonne. Les poids publiés donnent à l'approche un examen équitable, ce dont la plupart des propositions architecturales ne bénéficient pas.

Ce qui compterait comme un succès

Les poids sont disponibles, donc les tests sont peu coûteux à exécuter et difficiles à falsifier.

Regardez le rendu du texte. La génération sans encodeur devrait mieux gérer les petits caractères qu'un modèle latent avec le même budget, sinon il n'y a aucune raison d'accepter le coût de calcul.

Regardez la mémoire et la latence sur un seul accélérateur grand public. Si le modèle a besoin de matériel de centre de données pour produire une image modeste, il reste un artefact de recherche. S'il tourne à une vitesse utile sur une carte de station de travail haut de gamme, il devient un outil.

Regardez la voie vidéo. La publication revendique une gestion unifiée de l'image et de la vidéo, et c'est dans la vidéo que l'argument du coût de calcul mord le plus fort, car la longueur de séquence temporelle multiplie tout. Un court clip crédible généré dans l'espace pixel serait la preuve la plus solide pour cette approche.

Attendez-vous à des résultats mitigés. Les nouvelles architectures le sont généralement, et les premiers benchmarks publics racontent rarement toute l'histoire. Une publication comme celle-ci compte parce qu'elle rend explicites les hypothèses de la conception en place, et ces hypothèses ont été considérées comme établies depuis assez longtemps pour qu'il soit utile de voir quelqu'un les tester directement.

Articles associés