Un seul cadre pour le langage et la vision : le modèle ouvert 1,6B d’Horizon

Un article de l’Université des sciences et technologies de Huazhong, de l’Université Jiaotong de Pékin et de Horizon Robotics propose quelque chose qui semble presque trop basique pour être nouveau : un seul modèle qui traite le langage et les images comme des objets de même nature.
Le cadre s’appelle Multimodal Flow, ou MF-1, et il est entièrement ouvert. Sa plus grande version compte 1,6 milliard de paramètres, entraînée sur 150 milliards de tokens de pré-entraînement. Sur GenEval, il obtient 82,8 et sur DPG-Bench, 75,3, plaçant un modèle de taille modeste aux côtés de systèmes multimodaux bien plus grands.
L’idée en une phrase
La plupart des modèles multimodaux sont des assemblages. Un modèle de texte et un modèle d’image, ou un socle linguistique auquel on greffe des composants de vision séparés, qui échangent des représentations via des tokens discrets ou des encodeurs distincts. MF-1 ne fait pas cela. Il modélise le texte et les images ensemble dans un espace d’embedding partagé, et utilise le Flow Matching comme unique objectif génératif et procédure d’échantillonnage pour les deux.

C’est là l’affirmation intéressante. Au lieu de traduire entre modalités à une frontière, le modèle opère sur une représentation continue unique où langage et vision ne sont pas fondamentalement des objets différents. Les auteurs soutiennent que cela contourne les faiblesses des approches discrètes et hybrides qui dominent la pratique actuelle.
Si cela tient, le gain est la généralité. Un cadre unique qui gère la modélisation du langage, la compréhension visuelle, la génération d’images, l’édition et les séquences vidéo est bien plus simple à entraîner, à étendre et à appréhender qu’une chaîne de spécialistes. Il pointe aussi vers un avenir où d’autres modalités, toute entrée pouvant être exprimée comme un bloc continu ordonné, s’intègrent à la même structure sans refonte.
Il y a une raison pratique de vouloir cela au-delà de l’élégance. Chaque fois que l’on greffe une nouvelle modalité sur un système, on introduit une nouvelle interface à maintenir et un nouveau lieu où les erreurs s’accumulent. Enchaîner un encodeur visuel à un modèle de langage signifie qu’une image doit être résumée en tokens que le modèle de langage comprend, et ce résumé perd de l’information. Une représentation partagée évite l’étape de traduction, là où beaucoup de qualité subtile s’échappe des systèmes multimodaux.
Le nom dans les crédits
Un détail dans la liste des auteurs mérite un second regard. Parmi les auteurs figurent Yu Kai, fondateur de Horizon Robotics et ancien architecte des efforts de deep learning de Baidu, et le cofondateur Huang Chang. L’auteur correspondant est Wang Xinggang, du Vision Lab de l’Université de Huazhong.
Le nom de Yu sur un article n’est pas anodin. Il a rarement publié depuis 2016, année où il participait à une première tentative d’unification de la détection de texte en scènes naturelles. Sa réapparition aujourd’hui, sur un article traitant de l’unification du langage et de la vision, se lit comme un retour délibéré à un problème qu’il a travaillé il y a dix ans, à un moment où l’industrie dispose de la puissance de calcul et des données pour que cela compte.
Une phrase révélatrice lui est attribuée, tirée d’une intervention antérieure : que les termes à la mode, VLA, VLM, end-to-end, world model, sont souvent plus significatifs commercialement que techniquement, et que les équipes sérieuses font largement des choses similaires. Un article qui réduit plusieurs de ces catégories à un seul cadre génératif est cohérent avec cette vision. C’est un argument selon lequel les étiquettes importent moins que le mécanisme sous-jacent.
Pourquoi petit et ouvert est tout l’enjeu
Un modèle de 1,6 milliard de paramètres qui obtient des scores compétitifs est remarquable pour la même raison que les petits modèles issus d’autres laboratoires le sont. La capacité par paramètre est la métrique qui décide de ce qui tourne en local, de ce qui tourne sur un téléphone, et de ce qu’une petite équipe peut se permettre de fine-tuner.
Les 150 milliards de tokens d’entraînement sont également modestes selon les standards de pointe, ce qui suggère que l’approche est efficace plutôt que brutale. Savoir si cette efficacité survit à plus grande échelle reste la question ouverte. Un petit modèle qui se comporte bien dit quelque chose d’une méthode, mais pas tout.
Les poids ouverts comptent ici pour une raison précise. Un cadre génératif unifié est surtout utile si d’autres peuvent l’étendre, le tester sur des modalités que les auteurs n’ont pas essayées et s’appuyer sur la représentation partagée. Une version fermée serait un article intéressant. Une version ouverte est un outil.
Ce que les benchmarks ne couvrent pas
GenEval et DPG-Bench mesurent avec quelle fidélité un modèle transforme un prompt en image. Ils ne disent rien de la question de savoir si la représentation unifiée améliore la capacité d’un modèle à raisonner conjointement sur le texte et les images, ce qui est l’affirmation réelle. Un modèle pourrait bien scorer sur la fidélité d’image tout en traitant les deux modalités comme des sous-systèmes séparés qui partagent par hasard un format numérique. Les auteurs sont conscients de cet écart, et le véritable argument de l’article réside dans l’architecture, pas dans les scores. Pour quiconque évalue ce travail, la bonne question est de savoir si la représentation partagée change le comportement sur des tâches qui exigent les deux modalités à la fois, et c’est exactement ce que les benchmarks laissent non mesuré.
Les inconnues assumées
Unifier les modalités dans un seul espace est une affirmation forte, et les affirmations fortes invitent à l’examen. Les scores de benchmark sont réels, mais ils mesurent la fidélité de génération d’images, pas si la représentation partagée aide réellement le modèle à raisonner entre les modalités comme le cadre le laisse entendre. Il est possible d’obtenir un bon chiffre sur GenEval et d’avoir quand même un modèle qui traite le texte et les images comme des voisins dans un embedding plutôt que comme véritablement la même matière.
L’autre inconnue est l’échelle. Les représentations unifiées continues ont toujours été séduisantes en théorie et rétives en pratique, car le signal d’entraînement peut être plus difficile à stabiliser que dans une configuration discrète. Un succès à 1,6B est encourageant et pas encore concluant.
Vers quoi cela mène ensuite
L’extension évidente est la vidéo et l’audio, qui sont tous deux des signaux continus et donc des candidats naturels pour un cadre bâti sur des représentations continues. Les auteurs l’esquissent, considérant toute modalité exprimable comme un bloc continu ordonné comme un terrain de jeu légitime. Si l’approche tient, le gain est un pipeline unique qu’une équipe peut étendre à une modalité que les auteurs originaux n’ont jamais touchée. C’est la promesse des poids ouverts ici : non pas un produit fini, mais une fondation que d’autres peuvent plier à leur propre problème.
La vue d’ensemble
Ce qui rend cela digne d’intérêt, c’est moins le modèle que la direction. Le domaine a passé des années à construire des ponts de plus en plus élaborés entre des systèmes de texte et de vision séparés. MF-1 est un pari que ces ponts sont inutiles, que le bon geste est d’arrêter de traiter le langage et les images comme étrangers l’un à l’autre et de les modéliser sur un même pied.
Si ce pari est juste, la conséquence pratique est ennuyeuse de la meilleure façon. Un cadre, un objectif d’entraînement, un ensemble d’outils, appliqués à toute modalité dont vous avez besoin ensuite. S’il est faux, cela reste une expérience bien menée par une équipe avec un long historique dans le domaine, publiée ouvertement là où elle peut être vérifiée.
Dans tous les cas, la partie intéressante est que les personnes qui observent ce problème depuis une décennie ont choisi maintenant de s’y attaquer à nouveau, et ont choisi de le faire avec un modèle ouvert et petit plutôt qu’un modèle géant. Cette combinaison est généralement le signe que quelqu’un croit que c’est la méthode, et non l’échelle, qui manquait.
Articles associés
Un semi-humanoïde à roues a terminé une heure de lessive sans aide
Des tâches individuelles peuvent réussir alors qu'un flux de travail échoue encore. Dyna a changé la métrique.
LTX 2.5 veut transformer votre brouillon Blender en un plan finalisé
En texte-vidéo, vous ne contrôlez pas ce qui se passe. Cet outil tente d'y remédier.
ServiceNow transforme les échecs des agents en données d'entraînement
La génération sans vérification est du bruit. Les portes sont le produit.
Un mur de mémoire photonique : le pari de 88 millions de dollars que Volantis vient de faire
Le compromis avec lequel tout le monde a appris à vivre est précisément ce que la société cherche à supprimer.