Septembre : les grands modèles chinois se ruent vers l’open source, et cette fois la course se joue sur l’abordabilité

La mi-septembre à peine passée, les évaluateurs ont déjà du mal à suivre le rythme de mise à jour des grands modèles chinois. Les nouveautés de Zhipu, Meituan, ModelBest, Tencent et Ant sont tombées presque dans la même fenêtre temporelle, couvrant tout un spectre : des modèles généraux aux petits modèles embarqués, puis à la génération d’images et à l’intelligence incarnée. Au-delà de l’effervescence, ce qui mérite vraiment l’attention, c’est la voie qu’ils ont choisie sans concertation : pas d’empilement de paramètres à tout crin, mais un effort concentré sur « comment les rendre abordables et déployables ».
Commençons par Zhipu. Le GLM-5.3-Flash publié en septembre compte 320 milliards de paramètres au total, mais seulement 18 milliards de paramètres actifs réellement sollicités à chaque calcul. L’idée de l’activation parcimonieuse est simple : agrandir le modèle tout en n’éveillant qu’une petite partie lors d’une inférence, ce qui réduit à la fois les coûts et la latence. Il est publié en open source sous licence MIT, prend nativement en charge le multimodal et coûte environ 0,25 dollar par million de tokens de sortie. La phrase la plus lourde de sens dans la note de version est celle-ci : le service d’inférence tourne de bout en bout sur des puces d’IA chinoises, avec des performances de bout en bout multipliées par trois environ par rapport au benchmark initial, et atteint l’échelle de 100 000 milliards de tokens gratuits par jour. Pour les développeurs, cette phrase pèse plus que n’importe quel chiffre du tableau de paramètres.
Du côté de Meituan, on a dévoilé LongCat-2.0, avec 1 600 milliards de paramètres au total et une prise en charge native d’un contexte d’un million de tokens. Son intérêt ne réside pas dans sa taille, mais dans le terreau de son entraînement : la société affirme qu’il s’agit du premier grand modèle open source à mille milliards de paramètres dont l’entraînement et l’inférence complets ont été réalisés sur une grappe de calcul chinoise de niveau dix mille cartes. L’écosystème comprend aussi CatPaw, un espace de travail IA pour l’exploitation, et « Xiaotuan », un agent intelligent pour les services de proximité, qui a déjà répondu à plus de 700 millions de demandes d’utilisateurs. Qu’une entreprise partie du commerce local de proximité mette sur la table un modèle à mille milliards de paramètres montre que la structure de coûts de ce secteur est en train de se desserrer.
Avec MiniCPM5-2B, ModelBest prend la direction opposée : il comprime les paramètres au niveau de 2 milliards et vise l’embarqué. Il poursuit l’approche habituelle de MiniCPM : peu de paramètres, une réelle capacité de déploiement, et la possibilité de fonctionner une fois installé dans un téléphone ou un appareil en périphérie. Presque en même temps, MiniMax a publié Code CLI en open source sous licence MIT, et Zhipu a ajouté GLM-5.3-FlashX, axé sur le haut débit, avec une vitesse d’inférence d’environ 200 tokens par seconde. Embarqué, accélération de l’inférence et outils de programmation : les trois lignes se complètent, et cet ensemble en dit plus sur la maturité de l’écosystème qu’un seul « modèle phare ».
Pris ensemble, une tendance se dessine clairement : l’open source devient un moyen de concurrence, et non plus une posture idéaliste. Licence MIT, poids ouverts, quotas gratuits : ces gestes ont une visée très concrète. Celui qui attire le premier les développeurs et les PME dans son écosystème s’assure la prochaine vague de volume d’appels. Être en tête sur les paramètres peut remplir une salle de conférence de lancement, mais pas faire tourner un environnement de production au quotidien.
La ligne de la génération d’images n’était pas absente non plus. Le 4 septembre, le laboratoire Bailing d’Ant Group a publié et ouvert les modèles de la série LLaDA-Image, comprenant une version Base et une version Turbo, avec environ 7 milliards de paramètres. Un seul point de contrôle prend en charge à la fois la génération d’images à partir de texte, l’édition à partir d’images de référence et le rendu de texte en chinois et en anglais, sans branche d’édition supplémentaire. Le point fort est la version Turbo, qui utilise la distillation Twin-DMD pour réduire le nombre d’étapes d’échantillonnage à 2 ou 4, en préservant à la fois la qualité et la vitesse, et dont l’inférence ne dépend pas de GPU haut de gamme. Sur Qwen-Image-Bench, elle obtient 53,53 points en scénario anglais et 53,38 en scénario chinois, ce que l’entreprise présente comme les meilleurs scores actuels. Passer d’un nombre d’étapes habituel de 50 à un chiffre à un seul chiffre, cela ne signifie pas seulement aller vite : cela rend la génération en temps réel possible sur du matériel grand public.
Du côté de l’intelligence incarnée, Zidong Taichu a ouvert le 15 septembre ZDTaichu5.0-9B. Ce modèle de 9 milliards de paramètres a décroché 8 premières places mondiales dans sa catégorie de paramètres sur des tâches de compréhension spatiale et incarnées, et obtient 78,27 points sur MindCube-tiny, soit 20,67 points de plus que Qwen3.5-9B. Il comble le chaînon manquant du robot : « que faire après avoir vu ? ». Reconnaître une tasse ne répond qu’à la question « qu’est-ce que c’est » ; déterminer l’orientation de l’anse et si l’on peut poser quelque chose à côté se rapproche de « que peut-on faire ».
Impossible aussi d’ignorer Tencent. Le 22 septembre, Hunyuan a publié la version preview d’Image 3.5, avec des améliorations ciblées sur la génération de texte, la composition d’image, le réalisme et l’édition continue ; elle accepte jusqu’à 5 images de référence par requête et produit jusqu’en 2K. Le prix est de 0,15 yuan par image 2K, et la facturation ne porte que sur la sortie finale. La date de publication est elle aussi soigneusement choisie : elle tombe le jour même de l’ouverture de la conférence Apsara d’Alibaba Cloud. Ce type de « sortie calée sur un événement » n’a plus rien de nouveau en Chine, mais appliqué aux modèles d’image, il déplace directement la concurrence du terrain technique vers celui de l’attention et des points d’entrée d’écosystème.
En reliant tous ces gestes, la ligne directrice de septembre peut se résumer en trois points : accélération de l’open source, baisse du coût d’inférence et autonomie en calcul. Les trois s’engrènent en réalité. L’open source abaisse le seuil d’utilisation, l’inférence à bas prix transforme ce seuil en volume d’appels réel, et la substitution par du calcul chinois détermine si ce prix bas peut durer. Si GLM-5.3-Flash ose la licence MIT avec des quotas gratuits, et si LongCat-2.0 ose faire tourner mille milliards de paramètres sur une grappe chinoise de dix mille cartes, c’est sous-tendu par le même jugement : il faut que les coûts restent maîtrisables pour oser confier le modèle.
Pour les créateurs ordinaires et les PME, l’effet direct de cette vague de changements est que les comptes deviennent tenables. Auparavant, pour utiliser des modèles de pointe, il fallait soit assumer une facture d’API loin d’être bon marché, soit réunir soi-même des GPU : deux barrières qui écartaient la plupart des gens. Aujourd’hui, une image 2K à 0,15 yuan, de la génération d’images en temps réel en 2 à 4 étapes, ou des modèles embarqués qui tournent avec 2 milliards de paramètres ramènent ces coûts dans une fourchette où beaucoup de gens essaieront réellement. Quand les outils deviennent bon marché, les essais-erreurs se multiplient, et la qualité des œuvres se polit souvent dans cette répétition d’essais et d’erreurs.

Il reste aussi des points qui appellent à la lucidité. Des licences open source de plus en plus permissives ne signifient pas que l’usage commercial est sans coût : clauses non commerciales, conformité des données, contrôlabilité du comportement des modèles, tout cela doit encore être vérifié au cas par cas dans de vraies activités. L’amélioration d’un facteur trois des performances d’inférence sur puces chinoises repose sur des comparaisons avec leurs propres benchmarks, et la reproduction par des tiers n’a pas encore suivi ; des modèles « open source » dont le code d’entraînement reste fermé existent toujours, ce qui limite la reproduction et le développement secondaire. De beaux chiffres, c’est une chose ; une livraison stable en est une autre.
Dans cette vague dense de mises à jour de septembre, le vrai signal n’est pas « encore combien de premières places les modèles chinois ont décrochées », mais le fait que toute la logique de coûts du côté de l’offre est en train d’être réorganisée. À mesure que les modèles eux-mêmes ressemblent de plus en plus à une infrastructure, la compétition se déplace vers l’aval : qui a le flux de travail le plus fluide, qui cible le plus précisément les usages, qui sait transformer du calcul bon marché en œuvres stables. L’open source n’a fait que donner le coup de pistolet de départ ; il reste un long chemin à parcourir.
Articles associés
Un semi-humanoïde à roues a terminé une heure de lessive sans aide
Des tâches individuelles peuvent réussir alors qu'un flux de travail échoue encore. Dyna a changé la métrique.
LTX 2.5 veut transformer votre brouillon Blender en un plan finalisé
En texte-vidéo, vous ne contrôlez pas ce qui se passe. Cet outil tente d'y remédier.
ServiceNow transforme les échecs des agents en données d'entraînement
La génération sans vérification est du bruit. Les portes sont le produit.
Un seul cadre pour le langage et la vision : le modèle ouvert 1,6B d’Horizon
Un pari : les ponts entre le langage et la vision n’ont jamais été nécessaires.