Mistral Large 4: Europa setzt eine Billion Parameter auf Open Weights

Am 6. Oktober hat Mistral AI ein Modell mit einer Billion Parameter in die öffentliche Vorschau gestellt und ihm einen Spitznamen gegeben: Le Chonk. Das französische Labor sagt, Mistral Large 4 sei das stärkste Open-Weight-Modell, das entweder aus den Vereinigten Staaten oder aus Europa komme. Die Gewichte selbst werden erst am 27. Oktober ausgeliefert, aber die API ist bereits live, und die Benchmarks sind bereits öffentlich.
Der Spitzname ist augenzwinkernd gemeint, aber die Zahlen dahinter sind nicht klein. Large 4 trägt insgesamt 1,05 Billionen Parameter in einem spärlichen Mixture-of-Experts-Layout und aktiviert bei einer gegebenen Aufgabe etwa 49 Milliarden davon. Mistrals eigene Dokumentation rundet an einer Stelle auf 52 Milliarden aktive Parameter, und frühe Berichte nannten an anderer Stelle 49 Milliarden. Wie auch immer: Das Designziel ist dasselbe, das jedes große Labor inzwischen verfolgt – die Fähigkeiten eines sehr großen Modells zu bekommen, ohne dafür zu bezahlen, bei jedem Token alles davon laufen zu lassen.
Was wirklich darin steckt
Das Modell ist nativ multimodal. Mistral hat das Sprach-Backbone mit einem separaten Bildencoder mit 1,6 Milliarden Parametern kombiniert, und es verarbeitet sowohl Text als auch Bilder. Das Kontextfenster reicht bis zu einer Million Token. Die Trainingsdaten waren stark mehrsprachig ausgerichtet und deckten mehr als 160 Sprachen ab, darunter jede Amtssprache der Europäischen Union.
Mistral hat Large 4 von Grund auf auf ungefähr 3.800 bis 4.000 Nvidia Grace Blackwell GPUs in seinen eigenen europäischen Rechenzentren über etwa zwei Monate hinweg trainiert. Dieselbe Hardware bedient jetzt die öffentliche Vorschau. Das Unternehmen sagt außerdem, dass Reinforcement Learning noch auf dem Modell läuft, weshalb es erwartet, dass sich die Zahlen in den kommenden Wochen verändern werden.

Die Benchmark-Tabelle, sorgfältig gelesen
Beim agentischen Coding meldet Mistral 61,7 % auf DeepSWE v1.1, 59,4 % auf SWE-Atlas-QnA und 28,3 % auf Terminal-Bench 4, was einen kombinierten Coding Agent Index von 49,8 % ergibt. Dieser Wert liegt laut Unternehmen knapp vor DeepSeek V4 Pro 0813 und Qwen3.8 Max. Auf AutomationBench, wo 657 Geschäftsworkflows über Tools wie Gmail, Google Sheets, Slack und Salesforce laufen, erzielte Large 4 59,9 %.
Die interessanteste Behauptung betrifft visuelles Grounding. Im Dense-200-Benchmark, der misst, wie gut ein Modell ein bestimmtes Objekt in einem Bild lokalisieren kann, setzt Mistral Large 4 auf 42 %, einen Punkt über GPT-6 Astra mit 41 %. Ein Ein-Punkt-Abstand bei einer einzelnen Evaluation ist kein Knockout, und er sollte nicht als solcher gelesen werden. Aber es ist die Art von Aufgabe, bei der offene Modelle geschlossenen hinterherhinkten, daher ist ein Gleichstand eine Notiz wert.
Cybersicherheit ist der Bereich, in dem der Ton von Marketing zu Argument wechselt. Mistral sagt, Large 4 gehöre weltweit zu den Top 5 im Artificial Analysis Cyber Index. Es meldet eine Erfolgsquote von 82 % beim Reproduzieren und Patchen echter Schwachstellen in Open-Source-Software und 93 % bei Cybench, einer Sammlung von 40 Sicherheitswettbewerbsaufgaben. Das Unternehmen macht außerdem eine pointierte Beobachtung: Manche geschlossenen Modelle weigern sich, eine Schwachstelle überhaupt zu reproduzieren, weil die Anfrage wie offensive Aktivität aussieht, was ihre Ergebnisse in denselben Tests gegen null treibt.
Eine Blindbewertung erzählt eine bodenständigere Geschichte. In einem Testlauf mit Surge AI bewerteten professionelle Prüfer generierten Code auf einer Fünf-Punkte-Skala, ohne zu wissen, welches Modell ihn geschrieben hatte. Large 4 landete bei 3,74. Claude Opus 5 erzielte 4,22, und GLM-5.3 erzielte 3,60. Bei der von Menschen beurteilten Codequalität liegt Large 4 damit auf Platz zwei unter den fünf verglichenen Modellen – vor den offenen Konkurrenten, aber hinter dem geschlossenen Spitzenreiter.
Jede dieser Zahlen stammt von Mistral. Sie sind vorläufig, selbst berichtet, und keine unabhängige Instanz hat sie bisher reproduziert. Betrachten Sie sie als starke Ausgangsbehauptung, nicht als gesichertes Ergebnis.
Preise und die Open-Weights-Wette
Die API ist jetzt über Mistral Studio und OpenRouter verfügbar. Der Listenpreis liegt bei 1,36 $ pro Million Eingabe-Token und 4,18 $ pro Million Ausgabe-Token, mit einer Einführungsaktion zu halbierten Preisen, 0,68 $ und 2,09 $. Am 27. Oktober kommen die Gewichte, und jeder kann sie herunterladen und Large 4 auf eigener Hardware ausführen, ohne Zugang zu mieten.
Genau dieser letzte Teil ist die ganze Strategie. Mistral kann OpenAI oder Anthropic beim Rechenaufwand nicht überbieten und kann auch nicht mit der Veröffentlichungsfrequenz der chinesischen Open-Weight-Labore mithalten, die fast monatlich große Modelle ausliefern. Was es bieten kann, ist Kontrolle. Ein Unternehmen mit Data-Residency-Regeln oder ein Sicherheitsteam, das ein Modell braucht, um eine Schwachstelle zu reproduzieren, ohne dass ein Anbieter die Anfrage ablehnt, bekommt etwas, das ein gehostetes geschlossenes Modell nicht bietet. Mistral setzt stark auf dieses Argument und beschreibt Large 4 als von Anfang bis Ende in Europa geschmiedet und aus Europa über seine eigene Cloud bereitstellbar.
Der Wettbewerbszeitpunkt macht deutlich, worum es geht. Reflection AI, ein von Nvidia unterstütztes Labor, veröffentlichte am 5. Oktober ein Open-Weight-Modell mit 501 Milliarden Parametern, einen Tag vor Large 4. Chinesische Labore wie Alibaba, Z.ai, Moonshot und DeepSeek haben in den vergangenen zwei Monaten laufend starke offene Modelle ausgeliefert. Analysten, die die Benchmark-Konvergenz verfolgen, berichten, dass sich die Lücke zwischen Open-Weight- und proprietären Modellen bei ausgewählten Reasoning-Aufgaben verkleinert hat und dass die Preise für Premium-APIs proprietärer Modelle infolgedessen gefallen sind. Mistral betritt einen Markt, in dem es weniger wert ist, das größte offene Modell zu sein, als das vertrauenswürdigste zu sein – und Vertrauen entsteht durch Lizenzen und Deployment-Optionen, nicht durch Parameterzahlen.
Das Cybersicherheits-Red-Teaming folgt derselben Logik. Bevor die Gewichte ausgeliefert werden, gibt Mistral geprüften Partnern und staatlichen Behörden Zugang zu demselben Modell „mit reduzierter Moderation und erweiterten Cyber-Fähigkeiten“. Das Unternehmen argumentiert, dass Ablehnungen auf Anbieterebene eine legitime Incident Response blockieren können und dass der Verlust des Zugangs zu einem Tool mitten in einem Incident selbst ein Risiko ist.
Die Veröffentlichung fällt außerdem in einen bestimmten Moment. Mistral hat kürzlich eine Finanzierungsrunde abgeschlossen, die seine Bewertung über 24 Milliarden $ getrieben hat, mit Samsung unter den neuen Investoren. Reflection AI lieferte nur einen Tag zuvor ein offenes Modell mit 501 Milliarden Parametern aus. Die Open-Weight-Klasse wird voller, und das Unterscheidungsmerkmal ist nicht mehr die reine Größe.
Was sich dadurch ändert – und was nicht
Large 4 schließt die Lücke zu den besten geschlossenen Modellen nicht bei jeder Aufgabe, und Mistral behauptet auch nicht ganz, dass es das tut. Was es tut, ist, die Lücke bei einer Handvoll Aufgaben zu verringern, die für Unternehmen wichtig sind, und das mit einer Lizenzierungs- und Deployment-Geschichte zu verbinden, die diese Unternehmen tatsächlich brauchen. Wenn die Gewichte vom 27. Oktober externen Tests standhalten, ist die praktische Frage nicht mehr, ob ein offenes Modell im Abstrakten gut genug ist, sondern ob es für eine bestimmte, klar definierte Aufgabe gut genug ist.
Die seltenere Behauptung, die es zu beobachten gilt, ist die Cyber-Behauptung. Ein Modell, das Sicherheitsteams dabei hilft, echte Schwachstellen zu patchen, unter ihren eigenen Richtlinien, auf ihrer eigenen Hardware, ist eine andere Art von Produkt als ein Chatbot, der die Anfrage ablehnt. Wenn das Bestand hat, könnte es mehr zählen als ein paar Punkte in einem Coding-Benchmark. Wenn externe Tester feststellen, dass die 82-%-Zahl außerhalb von Mistrals eigener Umgebung nicht trägt, fällt das Argument auf Preis und Portabilität zurück – ein überfüllter Ort, um zu stehen.
Wie auch immer, Europa hat jetzt ein eigenes Flaggschiff, über das man streiten kann. Dieser Streit beginnt am 27. Oktober so richtig.
Verwandte Artikel
Decagons PACT-Protokoll will Zustimmung zum Standard machen
Decagon hat ein Protokoll offengelegt, das die Identitat eines personlichen Agenten und die vom Kunden erteilten Berechtigungen pruft. Es ist unspektakulare Infrastruktur, und sie entscheidet, ob die Agentenwirtschaft funktioniert.
Die KI-Wiedervereinigungswelle: eine Debatte, die China noch nicht einordnen kann
KI-Hommagefilme brachten Verstorbene zuruck auf chinesische Bildschirme und sammelten Hunderttausende Likes. Dann kam der Widerspruch, und es ging um Zustimmung.
Apple veroffentlichte ein offenes multimodales Modell und sagte es kaum jemandem
Dieser forschungsorientierte Launch glitt an der Offentlichkeit vorbei, doch das feinkornige visuelle Grounding verrat, wohin Apples KI-Stack geht.
OpenCut und der Moment des Open-Source-CapCut
Ein kostenloser Videoeditor unter MIT-Lizenz klettert weiter in den GitHub-Trends, und seine Roadmap enthalt einen MCP-Server fur KI-Agenten. Die Werkzeuge um KI-Medien holen die Modelle ein.