← Retour au blog
AiEnviron 8 min de lecture

Mistral Large 4 : l’Europe parie mille milliards de paramètres sur les poids ouverts

Publié le 11 oct. 2026
Mistral Large 4 : l’Europe parie mille milliards de paramètres sur les poids ouverts

Le 6 octobre, Mistral AI a mis en aperçu public un modèle à mille milliards de paramètres et lui a donné un surnom : Le Chonk. Le laboratoire français affirme que Mistral Large 4 est le modèle à poids ouverts le plus puissant jamais issu des États-Unis ou d’Europe. Les poids eux-mêmes ne seront pas publiés avant le 27 octobre, mais l’API est déjà en ligne et les benchmarks sont déjà publics.

Le surnom est un clin d’œil, mais les chiffres derrière ne sont pas petits. Large 4 embarque 1 050 milliards de paramètres au total dans une architecture de type sparse mixture-of-experts, et il en active environ 49 milliards pour une tâche donnée. La documentation de Mistral arrondit à 52 milliards d’actifs à un endroit, et des premiers rapports citaient 49 milliards à un autre. Quoi qu’il en soit, l’objectif de conception est le même que celui que tous les grands laboratoires poursuivent désormais : obtenir la capacité d’un très grand modèle sans payer pour l’exécuter entièrement à chaque token.

Ce qu’il y a vraiment à l’intérieur

Le modèle est nativement multimodal. Mistral a associé la base linguistique à un encodeur d’images distinct de 1,6 milliard de paramètres, et il traite à la fois le texte et les images. La fenêtre de contexte atteint un million de tokens. Les données d’entraînement étaient fortement orientées multilingue, couvrant plus de 160 langues, dont toutes les langues officielles de l’Union européenne.

Mistral a entraîné Large 4 à partir de zéro sur environ 3 800 à 4 000 GPU Nvidia Grace Blackwell dans ses propres centres de données européens, pendant environ deux mois. Le même matériel sert désormais à l’aperçu public. L’entreprise indique aussi que l’apprentissage par renforcement est toujours en cours sur le modèle, et elle s’attend donc à ce que les chiffres évoluent dans les semaines à venir.

Un noyau dense et lumineux de nombreux petits nœuds dont seule une fine bande s’allume à la fois

Le tableau des benchmarks, à lire attentivement

En codage agentique, Mistral rapporte 61,7 % sur DeepSWE v1.1, 59,4 % sur SWE-Atlas-QnA et 28,3 % sur Terminal-Bench 4, pour un Coding Agent Index combiné de 49,8 %. Selon l’entreprise, ce chiffre dépasse légèrement DeepSeek V4 Pro 0813 et Qwen3.8 Max. Sur AutomationBench, qui exécute 657 flux de travail métier à travers des outils comme Gmail, Google Sheets, Slack et Salesforce, Large 4 a obtenu 59,9 %.

L’affirmation la plus intéressante concerne l’ancrage visuel. Sur le benchmark Dense 200, qui mesure la capacité d’un modèle à localiser un objet précis dans une image, Mistral place Large 4 à 42 %, un point au-dessus de GPT-6 Astra à 41 %. Un écart d’un point sur une seule évaluation n’est pas un K.-O., et il ne faut pas l’interpréter comme tel. Mais c’est le genre de tâche où les modèles ouverts ont été distancés par les modèles fermés, donc une égalité mérite d’être signalée.

La cybersécurité est le domaine où le ton passe du marketing à l’argument. Mistral affirme que Large 4 se classe dans le top cinq mondial de l’Artificial Analysis Cyber Index. Il rapporte un taux de réussite de 82 % pour reproduire et corriger de vraies vulnérabilités dans des logiciels open source, et de 93 % sur Cybench, un ensemble de 40 problèmes de compétition de sécurité. L’entreprise fait aussi une observation appuyée : certains modèles fermés refusent purement et simplement de reproduire une vulnérabilité, parce que la demande ressemble à une activité offensive, ce qui fait chuter leurs scores près de zéro sur les mêmes tests.

Une évaluation en aveugle raconte une histoire plus concrète. Lors d’un test mené avec Surge AI, des évaluateurs professionnels ont noté du code généré sur une échelle de cinq points sans savoir quel modèle l’avait écrit. Large 4 a obtenu 3,74. Claude Opus 5 a obtenu 4,22, et GLM-5.3 a obtenu 3,60. Ainsi, sur la qualité du code jugée par des humains, Large 4 se classe deuxième parmi les cinq modèles comparés, devant les concurrents ouverts mais derrière le leader fermé.

Chacun de ces chiffres provient de Mistral. Ils sont préliminaires, autodéclarés, et aucune partie indépendante ne les a encore reproduits. Considérez-les comme une solide affirmation de départ, pas comme un résultat établi.

Tarification et pari sur les poids ouverts

L’API est déjà disponible via Mistral Studio et OpenRouter. Le prix catalogue est de 1,36 $ par million de tokens d’entrée et de 4,18 $ par million de tokens de sortie, avec une promotion de lancement à la moitié de ces tarifs, soit 0,68 $ et 2,09 $. Le 27 octobre, les poids arriveront, et chacun pourra les télécharger et exécuter Large 4 sur son propre matériel sans louer d’accès.

Cette dernière partie, c’est toute la stratégie. Mistral ne peut pas dépenser plus qu’OpenAI ou Anthropic en calcul, et il ne peut pas suivre le rythme de sortie des laboratoires chinois de poids ouverts qui livrent de grands modèles presque chaque mois. Ce qu’il peut offrir, c’est le contrôle. Une entreprise soumise à des règles de résidence des données, ou une équipe de sécurité qui a besoin d’un modèle pour aider à reproduire une vulnérabilité sans qu’un fournisseur refuse la demande, obtient quelque chose qu’un modèle fermé hébergé ne fournit pas. Mistral mise fortement sur cet argument, décrivant Large 4 comme forgé en Europe de bout en bout et déployable depuis l’Europe via son propre cloud.

Le calendrier concurrentiel rend l’enjeu évident. Reflection AI, un laboratoire soutenu par Nvidia, a publié le 5 octobre un modèle à poids ouverts de 501 milliards de paramètres, un jour avant Large 4. Les laboratoires chinois, dont Alibaba, Z.ai, Moonshot et DeepSeek, ont passé les deux derniers mois à livrer régulièrement de puissants modèles ouverts. Des analystes qui suivent la convergence des benchmarks rapportent que l’écart entre modèles à poids ouverts et modèles propriétaires s’est réduit sur certaines tâches de raisonnement, et que les prix des API propriétaires haut de gamme ont baissé en conséquence. Mistral entre sur un marché où être le plus grand modèle ouvert vaut moins qu’être le plus digne de confiance, et la confiance se construit sur les licences et les options de déploiement, pas sur le nombre de paramètres.

Le red teaming en cybersécurité suit la même logique. Avant la publication des poids, Mistral donne à des partenaires vérifiés et à des autorités étatiques l’accès au même modèle « avec une modération réduite et des capacités cyber étendues ». L’entreprise soutient que les refus au niveau du fournisseur peuvent bloquer une réponse légitime à incident, et que perdre l’accès à un outil en pleine gestion d’incident est en soi un risque.

Cette sortie arrive aussi à un moment précis. Mistral a récemment clôturé un tour de financement qui a fait grimper sa valorisation au-delà de 24 milliards de dollars, avec Samsung parmi les nouveaux investisseurs. Reflection AI a livré un modèle ouvert de 501 milliards de paramètres la veille. Le segment des poids ouverts devient encombré, et le différenciateur n’est plus la taille brute.

Ce que cela change, et ce que cela ne change pas

Large 4 ne comble pas l’écart avec les meilleurs modèles fermés sur toutes les tâches, et Mistral ne prétend pas vraiment que c’est le cas. Ce qu’il fait, c’est réduire l’écart sur une poignée de tâches qui comptent pour les entreprises, et associer cela à un argumentaire de licences et de déploiement dont ces entreprises ont réellement besoin. Si les poids du 27 octobre résistent à des tests externes, la question pratique cesse d’être de savoir si un modèle ouvert est assez bon dans l’absolu, et devient de savoir s’il est assez bon pour une tâche précise et bien définie.

L’affirmation plus rare à surveiller est celle concernant la cybersécurité. Un modèle qui aide les équipes de sécurité à corriger de vraies vulnérabilités, exécuté selon leurs propres politiques, sur leur propre matériel, est un type de produit différent d’un chatbot qui refuse la demande. Si cela se vérifie, cela peut compter plus que quelques points sur un benchmark de codage. Si des testeurs externes constatent que le chiffre de 82 % ne se transpose pas en dehors de l’environnement de Mistral, l’argument retombe sur le prix et la portabilité, ce qui est un terrain encombré.

Dans tous les cas, l’Europe a désormais son propre modèle phare à propos duquel débattre. Le débat commencera pour de bon le 27 octobre.

Articles associés