← Zurück zum Blog
Aica. 7 Min. Lesezeit

Ant Groups Ling 3.1 Flash aktiviert 25 Mrd. von 560 Mrd. Parametern und landet bei 41

Veröffentlicht 6. Okt. 2026
Ant Groups Ling 3.1 Flash aktiviert 25 Mrd. von 560 Mrd. Parametern und landet bei 41

--- title: Ant Groups Ling 3.1 Flash aktiviert 25 Mrd. von 560 Mrd. Parametern und landet bei 41 meta_title: Ling 3.1 Flash packt 560 Mrd. Parameter hinter eine 25-Mrd.-Rechnung meta_description: Ant Groups Ling 3.1 Flash erzielt 41 auf dem Intelligence Index mit 25 Mrd. aktiven Parametern von insgesamt 560 Mrd. und zeigt, wie weit sparsame MoE reichen kann. ---

Ant Groups AntLingAGI hat Ling 3.1 Flash am 6. Oktober veröffentlicht. Die Zahl, die heraussticht, sind die 25 Milliarden Parameter, die beim Ausführen des Modells tatsächlich aktiv werden, von insgesamt 560 Milliarden.

Das Modell erzielte 41 auf dem Artificial Analysis Intelligence Index, eine deutliche Steigerung gegenüber seinem Vorgänger. Die Bewertung hob agentische Fähigkeiten als Bereich mit der stärksten Verbesserung hervor – die Kategorie, der Unternehmenskäufer inzwischen das größte Gewicht beimessen.

Die Architektur ist das Argument

Ling 3.1 Flash ist ein Mixture-of-Experts-Modell. Es trägt insgesamt 560 Milliarden Parameter, aktiviert aber pro Token etwa 25 Milliarden, und unterstützt ein Kontextfenster von bis zu einer Million Token.

Dieses Verhältnis ist das eigentliche Verkaufsargument. Ein dichtes Modell vergleichbarer Leistungsfähigkeit müsste für jeden generierten Token jeden Parameter bewegen. Indem jeder Token durch eine kleine Teilmenge von Experten geleitet wird, liefert ein sparsames Modell eine ähnliche Ausgabe und berührt dabei weit weniger Rechenleistung. Der Kompromiss ist der Speicher: Alle 560 Milliarden Parameter müssen weiterhin irgendwo resident sein, obwohl die meisten bei einem gegebenen Forward Pass untätig bleiben.

Ein kleiner Cluster leuchtender goldener Knoten, die durch dünne Lichtspuren mit einer Matrix aus dunkelgrauen Knoten verbunden sind

Die praktische Konsequenz ist ein Modell, das zu einem Bruchteil der Kosten eines dichten Äquivalents bei gleichem Qualitätsniveau bereitgestellt werden kann, vorausgesetzt, ein Team hat die Hardware, um die Gewichte zu halten. Es ist dieselbe Ingenieursgeschichte, die in diesem Jahr die meisten Open-Weight-Veröffentlichungen an der Frontier vorangetrieben hat, und deshalb hat sich die interessante Kennzahl von den Gesamtparametern zu den aktiven Parametern verschoben.

Was die Benchmarks abdecken

Ant Group veröffentlichte Ergebnisse aus einer Reihe von Evaluierungen: GDPVal-AA v2.1 bei 1673 Elo, FrontierSWE bei 75,16, HealthBench bei 65,35 und Design Arena, wo es für mobile Anwendungen und SVG-Generierung nahe der Spitze rangiert.

Der Intelligence-Index-Wert von 41 ist die Schlagzeile, und er stellt das Modell in eine Reihe mit Veröffentlichungen deutlich größerer Labore. Ant Group sagt, das vollständige Modell werde als Open Source veröffentlicht, die Dokumentation sei bereits publiziert. In der Zwischenzeit läuft eine zweiwöchige kostenlose Testphase.

Die Engineering-Demonstrationen sind aussagekräftiger als die Punktzahlen

Ant Group beschrieb außerdem drei ausgearbeitete Beispiele, und diese sagen mehr über den beabsichtigten Einsatz aus als eine Bestenliste.

Das erste: einen Lua-zu-x86-Compiler von Grund auf zu bauen und 178 von 182 Tests zu bestehen. Das ist eine Aufgabe, bei der das Modell eine große Spezifikation im Auge behalten, über viele Dateien hinweg intern konsistenten Code erzeugen und durchgehend Randfälle im Blick behalten muss. Die Arbeit bestraft Modelle mit schwacher Langkontext-Behandlung.

Das zweite: die Typprüfung in einer großen Python-Codebasis zu beschleunigen. Das ist eher eine Wartungs- als eine Greenfield-Aufgabe, und genau dorthin geht in der Praxis der größte Teil der Engineering-Zeit. Ein Modell, das über die Typbeziehungen eines bestehenden Repositorys Schlussfolgerungen ziehen kann, ist auf eine Weise nützlich, wie es ein Modell, das frische Funktionen schreibt, nicht ist.

Das dritte: einen Desktop-Agenten zu bauen, der Browser, lokale Dateien und Terminal-Tools koordiniert. Multi-Tool-Orchestrierung ist die aktuelle Grenze agentischer Arbeit, und genau auf diese Fähigkeit deutet der Benchmark-Sprung hin.

Alle drei sind vom Unternehmen berichtet und nicht unabhängig reproduziert. Besonders die Behauptung zum Compiler mit 182 Tests würde eine externe Überprüfung erfordern, denn bestandene Tests sind nur aussagekräftig, wenn die Tests repräsentativ sind. Ein Compiler, der gängige Syntax bewältigt und bei ungewöhnlichen Fällen scheitert, kann in einer Testsuite, die in derselben Woche wie das Modell geschrieben wurde, trotzdem gut abschneiden.

Es gibt hier außerdem ein breiteres Muster zu bemerken. Chinesische Labore nutzen zunehmend Engineering-Demonstrationen statt Benchmark-Ergebnisse als ihr primäres Marketing, weil Benchmarks mehrdeutig geworden sind und Demonstrationen konkret sind. Der Kompromiss besteht darin, dass eine Demonstration eine einzige Trajektorie durch den Problemraum zeigt und nichts über die Verteilung der Ergebnisse.

Der längere Bogen: Was chinesische Open Weights immer wieder tun

Ling 3.1 Flash passt in ein Muster, das das ganze Jahr über Bestand hatte. Chinesische Labore veröffentlichen Open Weights in Frontier-Größe mit permissiven Lizenzen in einem Tempo, das kein westliches Labor erreicht hat, und sie konkurrieren über Effizienz statt über rohe Größe.

Der Kontext ist es wert, klar benannt zu werden. Ein Entwickler, der eines dieser Modelle betreibt, besitzt den Inferenz-Stack, was bedeutet: keine API-Kosten pro Token, keine Daten, die das Haus verlassen, und kein Dritter, der entscheidet, wann sich das Modell ändert. Für Teams mit Datenschutzvorgaben oder vorhersehbaren, aber schweren Workloads ist das bares Geld wert.

Victor Taelin bemerkte diesen Monat, dass kein offenes Modell mehr in den Top 25 der Artificial-Analysis-Rankings steht, wobei das beste, Xiaomis MiMo, auf Platz 26 liegt. Ling 3.1 Flash mit 41 auf dem Intelligence Index ist ein Intelligenzwert und kein Rang, die beiden Zahlen messen also unterschiedliche Dinge, und die Lücke zwischen dem besten offenen und dem besten geschlossenen Modell ist weiterhin real. Was sich geändert hat, ist, dass die Lücke nun in Punkten gemessen wird und nicht mehr darin, ob ein offenes Modell die Aufgabe überhaupt erledigen kann.

Was das für alle bedeutet, die ein Modell auswählen

Drei Überlegungen sind wichtiger als das Parameterverhältnis.

Lizenz- und Bereitstellungsbedingungen. Ant Group sagt, das Modell werde offen sein, aber die konkrete Lizenz regelt, ob die kommerzielle Nutzung uneingeschränkt ist. Angesichts dessen, wie oft „offene Gewichte“ und „permissive Lizenz“ synonym verwendet werden, obwohl sie nicht dasselbe sind, verdienen die Bedingungen eine sorgfältige Lektüre, bevor irgendeine Produktionsabhängigkeit entsteht. Dieselbe Vorsicht gilt für die vor der Veröffentlichung publizierte Dokumentation, die Fähigkeiten beschreibt statt Verpflichtungen.

Die Behauptung zum Kontextfenster. Eine Million Token ist eine große Zahl, doch nutzbarer Kontext ist üblicherweise kürzer als beworben. Ob das Modell über das gesamte Fenster hinweg Qualität hält oder schon deutlich früher nachlässt, ist die Frage, die den Nutzen für Langdokument- und große Repository-Arbeit bestimmt. Ant Groups eigene Langkontext-Demonstrationen legen nahe, dass das Modell große Eingaben verarbeitet, wobei es sich wieder um Herstellertests handelt.

Die Speicheranforderung. Ein sparsames 560-Mrd.-Modell ist kein Laptop-Deployment. Die Geschichte der aktiven Parameter reduziert den Rechenaufwand pro Token, nicht den Fußabdruck der Gewichte, und wer Self-Hosting plant, sollte die Hardware an der Gesamtzahl und nicht an der aktiven Anzahl ausrichten. Diese Unterscheidung bringt Leute regelmäßig durcheinander. Ein Modell, das laut Beschreibung 25 Mrd. Parameter aktiviert, klingt klein, bis man versucht, es zu laden – dann müssen die vollen 560 Mrd. irgendwo hineinpassen.

Es gibt außerdem eine praktische Support-Frage. Ein Modell aus einem Labor, das häufig ausliefert, wird abgelöst, und Teams sollten einen Migrationspfad einplanen. Ant Groups Veröffentlichungsrhythmus legt nahe, dass Ling 3.2 oder Ling 4 eine Frage von Monaten ist, was gut für die Leistungsfähigkeit und unangenehm für jeden ist, der ein Fine-Tuning oder ein Deployment-Skript um eine Version herum gebaut hat.

Ling 3.1 Flash ist eine leistungsfähige Veröffentlichung aus einem Labor, das beständig ausliefert. Die eigentliche Neuigkeit ist struktureller Natur: Ein Modell mit 25 Mrd. aktiven Parametern kann jetzt glaubwürdig im selben Gespräch sitzen wie deutlich größere dichte Systeme. Das ist das Argument, das die gesamte Sparse-MoE-Arbeitsrichtung vorgebracht hat, und die Benchmarks beginnen endlich, es zu stützen.

Verwandte Artikel