← Retour au blog
AiEnviron 9 min de lecture

Les nouveaux modèles ouverts chinois sont entraînés à servir de substrat pour agents

Publié le 3 oct. 2026
Les nouveaux modèles ouverts chinois sont entraînés à servir de substrat pour agents

Trois modèles publiés par des laboratoires chinois au cours de la semaine écoulée partagent une intuition de conception facile à manquer si on les lit comme une simple liste de nombres de paramètres. Aucun d'entre eux n'a été conçu pour être bon en conversation.

Ils ont été conçus pour être ce sur quoi tourne un agent. C'est une cible différente, et les choix d'entraînement qui en découlent paraissent étranges si l'on suppose que l'objectif est un meilleur chatbot.

Entraîner la tâche et le monde qui l'entoure

L'exemple le plus clair est IQuest-Q1, publié par le ZhiZhi Innovation Research Institute le 29 septembre. Il s'agit d'un modèle mixture-of-experts creux de 320 milliards de paramètres au total, 15 milliards actifs, avec une fenêtre de contexte de 524 288 tokens. Son architecture est banale comparée à sa méthode d'entraînement.

Plutôt que d'affiner le modèle sur des transcriptions de conversations humaines ou sur des jeux d'instructions statiques, l'équipe a synthétisé conjointement les tâches et les environnements dans lesquels elles se déroulent. Le modèle s'est ensuite entraîné sur plusieurs échafaudages d'agents (scaffolds) différents. Elle a conservé intacts les outils natifs et la gestion de contexte propres à chaque scaffold, et n'a traité comme signal d'apprentissage que les erreurs du modèle lui-même. Le harnais n'a pas été autorisé à devenir la leçon. Ensuite, quatre modèles spécialisés ont été fusionnés en un seul via une distillation on-policy multi-enseignants.

Cela compte en raison d'un problème que quiconque construit des agents a rencontré. Un modèle qui obtient de bons scores sur un benchmark peut s'effondrer lorsqu'on l'enveloppe dans ses propres outils, parce qu'il a appris les particularités du harnais de quelqu'un d'autre. Entraîner sur plusieurs scaffolds tout en gardant le harnais constant attaque précisément cette défaillance. Le résultat annoncé est un modèle qui se situe juste derrière Claude Opus 5 sur les tâches de langage naturel vers dépôt de code, ce qui est une compétence étrange et exactement ce dont un agent de codage a besoin.

Voir et décider en une seule étape

La deuxième publication emprunte une voie différente vers le même objectif. Le même jour, le Shanghai AI Laboratory a présenté un modèle de décision appelé Shusheng Mingjue, en trois tailles : 0,8B, 2B et 4B. Sa petitesse est délibérée.

Le principe de conception est que la perception et la décision ne doivent pas être des étapes séparées. La plupart des piles d'agents prennent une capture d'écran, la confient à un modèle de vision, obtiennent une description, transmettent la description à un planificateur, puis agissent. Chaque saut ajoute de la latence et perd des détails. Mingjue fusionne la perception visuelle native et le suivi d'instructions, de sorte que le modèle regarde un écran et prend une décision en une seule passe. Le laboratoire affirme qu'il surpasse Jev et des modèles ouverts comparables en qualité de décision. Pour un agent qui doit agir dans un environnement dynamique, la taille est justement l'essentiel : un modèle de 4B peut tourner au plus près de la boucle, ce qu'un modèle de 320B ne peut pas faire.

Supprimer la couche d'attention pour atteindre un million de tokens

La troisième publication est la plus agressive sur le plan architectural. Naive N0.5 Flash, du laboratoire pékinois NaiveAI, est un modèle mixture-of-experts de 309 milliards de paramètres avec 15,5 milliards de paramètres actifs, construit sur MiMo-V2.5 de Xiaomi. Il prend nativement en charge un contexte d'un million de tokens et est distribué sous licence MIT.

La partie intéressante, c'est ce qu'il a supprimé. Le modèle utilise un hybride d'attention à fenêtre glissante et d'attention parcimonieuse (sparse attention) de DeepSeek, et ne comporte aucune couche d'attention complète. L'attention standard des transformeurs évolue quadratiquement avec la longueur de séquence, ce qui explique pourquoi le contexte long a toujours été coûteux. Supprimer l'attention complète est un pari : l'information utile dans une longue séquence peut être atteinte via une parcimonie structurée. Si ce pari tient, cela change ce qu'un agent peut garder en vue simultanément. Un million de tokens représente environ un gros dépôt de code, ou l'historique d'une longue session de travail, conservé sans troncature.

Les sorties plus petites vont dans le même sens

Le schéma se retrouve au-delà de ces trois-là. Puro-2B, de Tsinghua, a été entraîné pour environ 4 400 dollars et surpasse en moyenne un modèle Qwen plus grand sur quinze tâches. Un laboratoire de télécommunications a livré TeleOCR, un modèle d'analyse documentaire de 1,2B qui a pris la tête d'un benchmark de compréhension de documents. Stanford et NVIDIA ont publié un vérificateur contrastif qui choisit la meilleure action candidate par alignement d'embeddings plutôt que par raisonnement, et rapporte d'importants gains de vitesse par rapport à un modèle juge comparable.

Chacun de ces éléments est un composant d'un agent, pas une destination pour un utilisateur. Un vérificateur qui classe à moindre coût les actions candidates, un petit modèle qui analyse des documents, un modèle minuscule qui décide sur quoi cliquer. Les pièces deviennent spécialisées et de plus en plus petites, tandis que l'unique modèle qui porte le contexte de toute la session devient très grand.

Le problème d'évaluation que personne n'a résolu

Un trou traverse tout cela. Les benchmarks pour les modèles de base destinés aux agents sont encore majoritairement empruntés à l'évaluation des chatbots, qui mesure les mauvaises choses. Un modèle peut bien scorer à un test de raisonnement et rester un mauvais substrat pour un agent, car les propriétés qui comptent n'apparaissent qu'au fil d'une session : combien de tours s'écoulent avant que le contexte se dégrade, si un appel d'outil qui échoue est réessayé de manière sensée, si le modèle remarque qu'il a perdu de vue l'objectif initial.

La plupart des chiffres rapportés ici viennent des laboratoires eux-mêmes, sur des benchmarks qu'ils ont contribué à définir. Le « juste derrière Claude Opus 5 » d'IQuest-Q1 sur les tâches de langage naturel vers dépôt de code est une comparaison de fournisseur. Le « bat Jev » de Mingjue est une affirmation de fournisseur. L'absence d'attention complète dans Naive N0.5 Flash est un fait architectural facile à vérifier et dont les conséquences pratiques ne sont pas encore mesurées à grande échelle. Rien de tout cela ne rend la direction fausse. Cela signifie que l'état honnête des choses est le suivant : nous avons trois conceptions intéressantes et très peu de preuves indépendantes sur celle qui tient la route quand un agent tourne pendant six heures.

Ce manque commence à être reconnu. Des groupes indépendants construisent des benchmarks orientés vers la mise en production plutôt que vers la génération de code, et vers le détournement d'agents (agent hijacking) plutôt que vers la sécurité des modèles, ce qui suggère que le domaine sait qu'il mesurait la mauvaise couche. Tant que ces travaux n'auront pas mûri, le signal utile d'une publication comme celle-ci n'est pas le score. C'est la méthode d'entraînement, car une méthode qui s'attaque à un mode de défaillance connu des agents a plus de chances d'être réelle qu'un chiffre qui s'adresse à un classement.

Il y a une autre conséquence de ce basculement, facile à négliger. Si les modèles importants deviennent de petits composants plutôt que de grandes destinations, alors l'avantage d'un laboratoire cesse de venir du fait de posséder le plus grand modèle et commence à venir de la connaissance de la façon dont les pièces s'assemblent. Une équipe capable d'entraîner un modèle de décision rapide, un analyseur documentaire bon marché et un vérificateur, puis de les câbler dans une boucle qui tourne sur du matériel modeste, possède quelque chose qu'un unique point de contrôle géant ne peut égaler. C'est un autre type de compétition, plus proche de l'ingénierie système que du scaling, et les publications de ce mois suggèrent qu'au moins quelques équipes chinoises se sont déjà réorientées en ce sens.

Pendant deux ans, la course aux poids ouverts s'est mesurée à la distance entre un modèle gratuit et un chatbot de pointe. Ce cadrage perd de son emprise. La qualité conversationnelle est devenue un socle de base, et les questions qui déterminent si un logiciel fonctionne se sont déplacées sur un autre terrain : combien de tours avant que le contexte se dégrade, à quelle vitesse le modèle peut agir dans une boucle, et avec quelle tolérance il accepte d'être déposé dans l'outillage de quelqu'un d'autre.

Les modèles qui répondent à ces questions ne remporteront pas beaucoup de classements. Ils gagneront la compétition moins visible : celle qui désigne celui vers lequel un développeur se tourne quand le chatbot a déjà fait son travail et que le vrai travail doit avoir lieu. Cette compétition s'est jouée discrètement cette semaine, à travers trois publications qui ne cherchaient à impressionner personne par la conversation.

Articles associés