← Retour au blog
AiEnviron 6 min de lecture

Alibaba publie en open source un modèle multimodal 30B : 3 milliards de paramètres actifs, pour défier frontalement GPT-5-Mini

Publié le 4 oct. 2026
Alibaba publie en open source un modèle multimodal 30B : 3 milliards de paramètres actifs, pour défier frontalement GPT-5-Mini

Le 4 octobre, l'équipe Qwen (Tongyi Qianwen) d'Alibaba Cloud a dévoilé en une seule fois les deux versions Instruct et Thinking de Qwen3-VL-30B-A3B, accompagnées de poids quantifiés FP8, et a également présenté la version FP8 du plus grand Qwen3-VL-235B-A22B. Le bilan officiel est sans détour : sur cinq axes — raisonnement STEM, questions-réponses visuelles, reconnaissance de texte OCR, compréhension vidéo et tâches d'agent — il se mesure à GPT-5-Mini et Claude 4-Sonnet, avec des résultats parfois meilleurs.

Ce qui mérite vraiment qu'on s'y arrête, c'est le A3B dans le nom.

Une enveloppe de 30B, un appétit de 3B

Le nombre total de paramètres de Qwen3-VL-30B-A3B est de 30 milliards, mais à chaque inférence, seuls environ 3 milliards participent réellement au calcul. Il s'agit d'une architecture typique de mélange d'experts (MoE) : le modèle contient un grand nombre d'experts, et pour chaque token traité, il n'en sélectionne qu'une petite poignée des plus pertinents pour travailler, tandis que les autres restent en attente.

Une rangée de blocs de verre sombres disposés sur une longue table, seuls quelques-uns laissant échapper une lumière chaude de l'intérieur

Imaginez-le comme une entreprise, ce sera plus parlant. L'entreprise compte trente mille employés, mais chaque projet concret ne mobilise que trois mille spécialistes du domaine concerné, les autres restant en réserve. La capacité globale de l'entreprise est de l'ordre de trente mille personnes, tandis que le coût en main-d'œuvre d'un projet donné avoisine les trois mille personnes.

Les avantages de cette structure sont très concrets. L'occupation de la mémoire vidéo et la vitesse d'inférence se rapprochent davantage de celles d'un modèle dense bien plus petit que 30B, tout en conservant un plafond de capacités digne d'un modèle de niveau 30B. Pour les équipes qui doivent exécuter des capacités multimodales en local ou dans un environnement privé, c'est précisément la combinaison qui a été la plus difficile à réunir ces dernières années : des performances comparables aux fleurons propriétaires, sans exiger une carte saturée de mémoire vidéo.

Pourquoi le bilan est présenté selon ces cinq axes

Les axes choisis par l'équipe officielle pour la comparaison correspondent justement aux champs de bataille où le déploiement du multimodal est le plus dense.

L'OCR répond à des besoins essentiels comme la numérisation de documents, la reconnaissance de factures ou l'extraction de texte à partir de captures d'écran. La compréhension vidéo est la porte d'entrée de la production de contenu à l'ère des vidéos courtes : qui sait comprendre une vidéo peut la transformer en matériau consultable et modifiable. Les agents permettent au modèle non seulement de comprendre, mais aussi d'agir ; c'est la ligne directrice sur laquelle presque tout le secteur mise cette année. STEM et VQA sont quant à eux les sésames de scénarios à forte valeur comme l'éducation, la recherche scientifique et le contrôle qualité industriel.

L'atout de l'open source : le coût de déploiement

Pour cette vague, Tongyi n'a pas publié qu'une seule version. Instruct s'adresse au suivi d'instructions et aux questions-réponses classiques, Thinking adopte un raisonnement où l'on réfléchit avant de répondre, et les poids FP8 sont destinés à ceux qui veulent faire tenir tout le modèle dans une mémoire vidéo limitée.

La sortie simultanée des trois versions pointe vers la même chose : faire passer le multimodal de « l'appel d'API dans le cloud » à « un déploiement autonome ». Une fois que les poids peuvent être téléchargés, quantifiés et exécutés sur des serveurs privés, la logique d'achat change. Auparavant, les entreprises calculaient le coût par million de tokens ; désormais, une option supplémentaire s'ajoute : le coût par million de tokens en amortissant leurs propres cartes graphiques. Pour les équipes à forte consommation, ce dernier calcul est souvent plus avantageux, et les données ne quittent pas le réseau interne.

C'est aussi la direction offensive la plus constante des modèles open source chinois depuis un an. Il ne s'agit plus simplement de comparer qui a le plus de paramètres ou le meilleur classement, mais de savoir qui permet au plus grand nombre d'utiliser le modèle avec un seuil d'entrée plus bas. Lorsque l'écart de capacités est réduit à une marge acceptable, le prix et l'accessibilité deviennent les véritables facteurs décisifs.

L'autre face de l'open source

Rendre les poids publics signifie que n'importe qui peut les télécharger, les affiner et les redistribuer. L'avantage est une expansion très rapide de l'écosystème : des versions quantifiées, des versions affinées pour des secteurs spécifiques et des versions adaptées aux appareils en périphérie émergeront vite dans la communauté. Le risque est tout aussi clair : une fois le modèle sorti du champ de vision de l'émetteur, celui-ci n'a presque aucun moyen de contrôler où et comment il est utilisé.

Pour les développeurs, cela place au contraire le pouvoir de décision entre leurs mains. Il faut connaître ses limites de conformité, savoir si les données peuvent quitter le territoire et comprendre les conditions de licence de la redistribution. L'open source vous confie l'outil, mais aussi la responsabilité.

Ce qu'il faut regarder ensuite

La comparaison sur ces cinq axes n'est qu'un point de départ. Ce qui détermine vraiment si un modèle multimodal peut tenir en production, c'est rarement le score à un benchmark précis ; c'est plutôt sa capacité à ne pas soudainement défaillir au fil de dizaines de tâches consécutives, et sa stabilité face à de vrais documents, de vraies vidéos et de véritables entrées désordonnées.

La capacité de cette approche à 3 milliards de paramètres actifs à continuer de progresser dépendra de l'efficacité du routage des experts, de la qualité des données d'entraînement et des stratégies de post-entraînement de la prochaine génération. Si cette voie fonctionne, ce n'est pas seulement un classement qui sera réécrit, mais l'hypothèse par défaut de tout le secteur sur la taille de modèle nécessaire pour être suffisant.

Si un modèle aux capacités proches d'un fleuron ne coûte qu'une fraction du prix d'exploitation de ce dernier, alors ce qui devient vraiment rare n'est plus la puissance de calcul, mais les personnes capables de réfléchir à ce qu'il faut en faire.

Articles associés