Le Ling 3.1 Flash d’Ant Group active 25 B de paramètres sur 560 B et obtient 41

--- title: Le Ling 3.1 Flash d’Ant Group active 25 B de paramètres sur 560 B et obtient 41 meta_title: Ling 3.1 Flash place 560 B de paramètres derrière une facture de 25 B meta_description: Le Ling 3.1 Flash d’Ant Group obtient 41 sur l’Indice d’intelligence avec 25 B de paramètres actifs sur 560 B au total, montrant jusqu’où le MoE parcimonieux peut s’étendre. ---
AntLingAGI, d’Ant Group, a publié Ling 3.1 Flash le 6 octobre. Le chiffre qui ressort est celui des 25 milliards de paramètres qui s’activent réellement lorsque le modèle tourne, sur 560 milliards au total.
Le modèle a obtenu 41 sur l’Indice d’intelligence d’Artificial Analysis, une nette progression par rapport à son prédécesseur. L’évaluation a spécifiquement pointé les capacités agentiques comme le domaine de plus forte amélioration, une catégorie que les acheteurs entreprises ont commencé à pondérer le plus lourdement.
L’architecture, c’est l’argument
Ling 3.1 Flash est un modèle de mélange d’experts. Il embarque 560 milliards de paramètres au total, mais n’en active qu’environ 25 milliards par token, et il prend en charge une fenêtre de contexte allant jusqu’à un million de tokens.
Ce ratio est tout l’argument. Un modèle dense de capacité comparable devrait déplacer chaque paramètre pour chaque token généré. En acheminant chaque token vers un petit sous-ensemble d’experts, un modèle parcimonieux produit une sortie similaire tout en touchant bien moins de calcul. Le compromis est la mémoire : les 560 milliards de paramètres doivent toujours être résidants quelque part, même si la plupart restent inactifs à chaque passe avant.

La conséquence pratique est un modèle qui peut être servi pour une fraction du coût d’un équivalent dense au même niveau de qualité, à condition qu’une équipe dispose du matériel nécessaire pour héberger les poids. C’est la même histoire d’ingénierie qui a porté la plupart des sorties open-weight de pointe cette année, et c’est pourquoi la métrique intéressante est passée du total de paramètres aux paramètres actifs.
Ce que couvrent les benchmarks
Ant Group a publié des résultats sur un ensemble d’évaluations : GDPVal-AA v2.1 à 1673 Elo, FrontierSWE à 75,16, HealthBench à 65,35, et Design Arena, où il se classe près du sommet pour les applications mobiles et la génération SVG.
Le score de 41 à l’Indice d’intelligence est le point d’orgue, et il place le modèle aux côtés de sorties de laboratoires bien plus grands. Ant Group affirme que le modèle complet sera open source, avec une documentation déjà publiée. Un essai gratuit de deux semaines est en cours en attendant.
Les démonstrations d’ingénierie sont plus révélatrices que les scores
Ant Group a également décrit trois exemples travaillés, et ceux-ci en disent plus sur l’usage prévu qu’un classement.
Le premier : construire un compilateur Lua-vers-x86 à partir de zéro, en passant 178 des 182 tests. C’est une tâche où le modèle doit garder à l’esprit une spécification volumineuse, produire du code cohérent sur de nombreux fichiers et suivre les cas limites tout du long. Ce travail pénalise les modèles faibles en gestion de contexte long.
Le deuxième : accélérer la vérification de types sur une grande base de code Python. C’est une tâche de maintenance plutôt qu’un projet greenfield, ce qui correspond à l’endroit où passe en réalité la majorité du temps d’ingénierie. Un modèle capable de raisonner sur les relations de types d’un dépôt existant est utile d’une manière qu’un modèle qui écrit de nouvelles fonctions n’est pas.
Le troisième : construire un agent de bureau qui coordonne un navigateur, des fichiers locaux et des outils de terminal. L’orchestration multi-outils est la frontière actuelle du travail agentique, et c’est la capacité que le saut dans les benchmarks indique.
Les trois sont rapportés par l’entreprise et n’ont pas été reproduits indépendamment. L’affirmation du compilateur passant 182 tests aurait en particulier besoin d’une vérification externe, car réussir des tests n’a de sens que si les tests sont représentatifs. Un compilateur qui gère la syntaxe courante et échoue sur les cas inhabituels peut encore bien scorer sur une suite écrite la même semaine que le modèle.
Il y a aussi un schéma plus large à noter ici. Les laboratoires chinois ont de plus en plus utilisé des démonstrations d’ingénierie plutôt que des scores de benchmarks comme principal argument marketing, parce que les benchmarks sont devenus ambigus et les démonstrations concrètes. Le compromis est qu’une démonstration montre une trajectoire dans l’espace des problèmes, et rien sur la distribution des résultats.
La perspective plus longue : ce que les poids ouverts chinois continuent de faire
Ling 3.1 Flash s’inscrit dans un schéma qui s’est maintenu toute l’année. Les laboratoires chinois publient des poids ouverts à l’échelle de la frontière avec des licences permissives à un rythme qu’aucun laboratoire occidental n’a égalé, et ils rivalisent sur l’efficacité plutôt que sur l’échelle brute.
Le contexte mérite d’être énoncé clairement. Un développeur qui fait tourner l’un de ces modèles possède la pile d’inférence, ce qui signifie aucun coût d’API par token, aucune donnée ne quitte l’entreprise et aucun tiers ne décide quand le modèle change. Pour les équipes soumises à des contraintes de confidentialité ou avec des charges de travail prévisibles mais lourdes, cela vaut de l’argent réel.
Victor Taelin a noté ce mois-ci qu’aucun modèle ouvert ne reste dans le top 25 des classements d’Artificial Analysis, le meilleur, MiMo de Xiaomi, se trouvant à la 26e place. Ling 3.1 Flash à 41 sur l’Indice d’intelligence est un score d’intelligence plutôt qu’un rang, donc les deux chiffres mesurent des choses différentes, et l’écart entre le meilleur modèle ouvert et le meilleur modèle fermé reste bien réel. Ce qui a changé, c’est que l’écart se mesure désormais en points plutôt qu’en capacité d’un modèle ouvert à faire le travail tout court.
Ce que cela signifie pour quiconque choisit un modèle
Trois considérations comptent plus que le ratio de paramètres.
Les conditions de licence et de déploiement. Ant Group affirme que le modèle sera ouvert, mais la licence spécifique détermine si l’usage commercial est sans restriction. Étant donné la fréquence à laquelle « poids ouverts » et « licence permissive » sont employés de manière interchangeable alors qu’ils ne désignent pas la même chose, les conditions méritent une lecture attentive avant toute dépendance en production. La même prudence s’applique à la documentation publiée avant la sortie, qui décrit des capacités plutôt que des obligations.
La promesse de fenêtre de contexte. Un million de tokens est un grand nombre, mais le contexte utilisable est généralement plus court que ce qui est annoncé. Savoir si le modèle conserve sa qualité sur toute la fenêtre, ou se dégrade bien avant la fin, est la question qui détermine son utilité pour le travail sur de longs documents et de grands dépôts. Les propres démonstrations de contexte long d’Ant Group suggèrent que le modèle gère de grandes entrées, mais là encore, ce sont des tests du fournisseur.
L’exigence mémoire. Un modèle parcimonieux de 560 B n’est pas un déploiement sur ordinateur portable. L’argument des paramètres actifs réduit le calcul par token, pas l’empreinte des poids, et quiconque prévoit de l’auto-héberger doit dimensionner le matériel sur le total, pas sur le nombre d’actifs. Cette distinction piège régulièrement les gens. Un modèle décrit comme activant 25 B de paramètres semble petit jusqu’à ce qu’on essaie de le charger, moment où les 560 B complets doivent bien tenir quelque part.
Il y a aussi une question pratique de support. Un modèle issu d’un laboratoire qui publie fréquemment sera remplacé, et les équipes doivent prévoir un chemin de migration. Le rythme de publication d’Ant Group suggère que Ling 3.2 ou Ling 4 est une question de mois, ce qui est bon pour la capacité et délicat pour quiconque a construit un fine-tuning ou un script de déploiement autour d’une version.
Ling 3.1 Flash est une sortie capable d’un laboratoire qui publie régulièrement. La vraie nouvelle est structurelle : un modèle à 25 B de paramètres actifs peut désormais légitimement figurer dans la même conversation que des systèmes denses bien plus grands. C’est l’argument que toute la lignée de travaux sur les MoE parcimonieux avance, et les benchmarks commencent enfin à le confirmer.
Articles associés
Google Flow et Adobe Firefly font sortir la vidéo IA de la fenêtre de chat
La qualité des modèles de base a suffisamment convergé pour que le facteur différenciant se soit déplacé vers ce qui entoure le modèle.
Google réduit de moitié le prix de sortie de Nano Banana 2.1 et corrige ses fonctionnalités les plus faibles
Le détail le plus important se situe en dehors de la liste des fonctionnalités, et c’est le prix.
Vida veut facturer les agents IA en fonction des résultats plutôt que de l'usage
La facturation basée sur l'usage aligne le revenu du fournisseur sur le fait que l'agent prend plus de temps. La tarification au résultat inverse cela.
Le Voice 3 et PACT de Decagon préparent le support client aux agents de l'autre côté
Les systèmes de support ont passé des décennies à modéliser le comportement humain. Aujourd'hui, une partie des demandes entrantes est constituée de machines agissant pour le compte de personnes.