Xiaomi publie un modèle omnimodal qui égale la frontière, recette d'entraînement comprise

Une entreprise de téléphonie a publié un modèle d'IA le 22 septembre, et le chiffre qui fait la une était 46. C'est le score obtenu par MiMo-V2.6 Pro de Xiaomi sur l'Intelligence Index d'Artificial Analysis, que la société présente comme le plus élevé jamais enregistré par un modèle open source au moment de sa sortie.
MiMo-V2.6 existe en deux versions. Pro est la grande, Flash la rapide. Xiaomi affirme que Pro est au niveau de Claude Opus 5 et GPT-5.6 Sol sur la plupart des benchmarks d'agents, et met en avant des progrès en programmation, en utilisation d'ordinateur, en raisonnement 3D et en tâches créatives. Les modèles sont omnimodaux, c'est-à-dire qu'ils acceptent du texte, des images et d'autres entrées à travers un seul jeu de poids, et ils ont été entraînés par apprentissage par renforcement à l'échelle (« scaled reinforcement learning »), ce qui explique à la fois les capacités et le format de publication.
Ce que contient réellement le téléchargement
La plupart des publications de poids ouverts se contentent de livrer les poids. MiMo-V2.6 fournit les poids, un rapport technique, les environnements d'apprentissage par renforcement et le code d'entraînement. Xiaomi a publié les quatre sur son propre site, plutôt que de faire passer les développeurs par un hub de modèles avec une page de licence et une liste d'attente.
C'est l'inclusion des environnements d'apprentissage par renforcement qui fait la vraie différence. Les poids permettent d'exécuter un modèle. Les environnements permettent de le réentraîner. Quand un laboratoire publie les environnements sur lesquels il a entraîné son modèle, il explique comment il a obtenu le comportement, et pas seulement en quoi consiste ce comportement. Pour quiconque veut reproduire le résultat, ou affiner le modèle selon son propre signal de récompense, les environnements sont le véritable artefact.
Cela augmente aussi le coût de la publication pour l'entreprise qui l'a réalisée. Publier les environnements expose la forme du signal d'entraînement, qui relève davantage de la recette que du point de contrôle. Un concurrent peut le lire et s'épargner un an d'essais et d'erreurs. Xiaomi semble avoir jugé que les bénéfices en matière de recrutement et de crédibilité l'emportaient.
Pourquoi une entreprise de terminaux fait de la recherche de pointe
Xiaomi n'est pas un laboratoire de recherche qui vend des téléphones par hasard. C'est l'inverse, et cette orientation transparaît dans ce à quoi sert un modèle omnimodal.
Un téléphone est l'écrin naturel d'un assistant capable de lire un écran, de comprendre une photographie, d'utiliser une interface et de répondre dans une conversation vocale. De ce point de vue, l'utilisation d'ordinateur, le raisonnement 3D et la génération créative ne sont pas des benchmarks abstraits. Ce sont les briques d'un système qui doit tourner sur un appareil que quelqu'un tient en main, souvent avec une connexion lente et une batterie à ménager. Une famille de modèles scindée en un palier Pro pour la capacité et un palier Flash pour la latence est une décision de feuille de route produit autant que de recherche.
Publier les poids sert deux objectifs. Cela recrute des chercheurs qui amélioreront le modèle au grand jour, et cela établit un plancher sous la position de l'entreprise sur un marché où les affirmations de capacité sont sinon acceptées sur parole. Un modèle que l'on peut télécharger et évaluer soi-même a besoin de moins de marketing, et Xiaomi dispute l'attention des développeurs à des laboratoires dont toute la réputation repose sur des résultats publiés.
Ce que « omnimodal » signifie en pratique
L'étiquette recouvre une affirmation d'ingénierie précise : un seul modèle traite plusieurs types d'entrées via une représentation partagée, au lieu d'orienter chaque type d'entrée vers un spécialiste distinct. Sur un téléphone, cela compte, car l'alternative consiste à faire tourner plusieurs modèles et à recoller leurs sorties, alors que la mémoire et la latence sont toutes deux rares sur un terminal. Le palier Flash de Xiaomi existe pour la même raison. Un modèle qui répond en une seconde sur un fleuron peut être inutilisable sur un appareil de milieu de gamme ou dans une voiture : la famille correspond donc en réalité à deux points sur une courbe capacité/latence, plutôt qu'à une seule publication.

La méthode d'entraînement explique le reste. L'apprentissage par renforcement à l'échelle signifie que le modèle est optimisé par rapport à un signal de récompense, et pas seulement entraîné à prédire le token suivant ; c'est l'approche qui sous-tend le bond récent des performances agentiques dans tout le secteur. C'est aussi la raison pour laquelle les environnements comptent autant que les poids. Un signal de récompense ne vaut pas mieux que l'environnement qui le produit : publier l'environnement revient donc davantage à publier une méthode qu'un résultat.
L'appareil est le canal de distribution
L'avantage de Xiaomi, c'est qu'elle n'a pas besoin d'un écosystème de développeurs pour atteindre les utilisateurs. Elle livre du matériel à des dizaines de millions de personnes, et un modèle intégré à un assistant téléphonique touche en un trimestre plus de gens qu'un hub de modèles en un an. C'est pourquoi le format de publication est généreux. Les poids et la recette coûtent relativement peu à l'entreprise en revenus de licence perdus, et ils lui achètent la crédibilité auprès de la communauté de la recherche, qui sans cela jugerait le modèle sur une capture d'écran de benchmark.
Le risque est à la hauteur de l'avantage. Un assistant téléphonique est jugé sur sa capacité à fonctionner à chaque fois, et un agent qui échoue sur une tâche sur vingt est une nuisance dans une fenêtre de chat, mais un handicap dans un appareil qui gère aussi des paiements, des photos et des messages. Les benchmarks de capacité ne mesurent pas cet écart, et un score composite de 46 non plus.
Le même mardi, trois autres sorties
Le calendrier est instructif. Le 22 septembre, le modèle de Xiaomi est apparu en même temps que Qwen-Image-2.1 d'Alibaba, dont Alibaba a ouvert les poids le 20 septembre et qu'il a présenté le jour même à sa conférence Yunqi, et que l'aperçu de Hy Image 3.5 de Tencent, un modèle d'image professionnel facturé 0,15 yuan par image 2K sur l'API Tencent Cloud. Unitree a profité de la même fenêtre pour annoncer Dex5-S, une main robotique dextre à 22 degrés de liberté, à partir de 6 500 dollars.
Alibaba a aussi profité de la conférence pour revendiquer la première place du classement agentique d'Artificial Analysis avec Qwen3.8-Max et la première place sur CodeArena en programmation front-end, et pour annoncer que Qwen4 est en cours d'entraînement, avec des modèles successeurs prévus entre cinq et dix mille milliards de paramètres. Son responsable de Qwen-Image a noté que l'objectif de l'équipe est de réduire le coût d'exécution d'une tâche plutôt que de maximiser le nombre de paramètres, ce qui est exactement le même arbitrage que celui opéré par la structure à deux paliers de MiMo.
Aucune de ces annonces n'était coordonnée, et toutes pointaient dans la même direction. Cet automne, la question concurrentielle dans l'IA chinoise n'est pas de savoir s'il existe un modèle de classe frontière. C'est de savoir quelle part on est autorisé à en détenir.
La réserve sur les benchmarks
Un chiffre comme 46 dépend entièrement de l'indice qui le sous-tend, et l'Intelligence Index d'Artificial Analysis n'est qu'un composite parmi d'autres. La comparaison avec Claude Opus 5 et GPT-5.6 Sol est faite par Xiaomi, sur les benchmarks choisis par Xiaomi, et l'expression « la plupart des benchmarks d'agents » fait un travail qu'un tableau de résultats ferait mieux. Les benchmarks d'agents en particulier sont sensibles à l'échafaudage : un même modèle peut obtenir des scores très différents selon ce qui l'entoure.
Ce qui empêche cette affirmation d'être du simple marketing, c'est le téléchargement. Quiconque doute du 46 peut exécuter le modèle, lire le rapport et le réentraîner dans les environnements livrés par Xiaomi. C'est un test plus exigeant qu'une capture d'écran de classement, et il n'est possible que parce que l'entreprise a choisi de publier la recette en même temps que le résultat.
Articles associés
Huawei Cloud a reconstruit sa stack autour des agents, puis a fixé une date aux factures
La capacité des modèles a convergé, et la valeur s'est déplacée vers ce qui les entoure.
Cadence intègre des agents à la conception de puces et ramène un cycle de vérification de cinq semaines à un jour
Les agents appellent donc davantage les moteurs sous-jacents, et non moins.
Roblox Build a publié 9 000 jeux en six semaines. Le chiffre intéressant, c'est 71
Lisez ce chiffre comme un chiffre de recrutement, non comme un indicateur de qualité.
Deux agents sont passés en production en septembre. Voici ce qu'ils avaient en commun
Les agents qui ont survécu au contact de la production en septembre sont ceux qui se sont intégrés à un processus existant.