Ai2 hat den Trainings-Stack als Open Source veröffentlicht – nicht nur ein weiteres Set Gewichte

Das Allen Institute for AI hat Olmo-core 3 veröffentlicht, eine offene Trainingsinfrastruktur für Mixture-of-Experts-Modelle im Billionen-Parameter-Bereich. Der wichtigste Benchmark ist ein MoE mit 47 Milliarden Parametern, das auf acht B300-GPUs etwa den 2,7-fachen Durchsatz der vorherigen Konfiguration erreicht. Diese Zahl ist respektabel. Sie ist aber nicht der Grund, warum dieses Release wichtig ist.
Gewichte sind leicht weiterzugeben und schwer daraus zu lernen. Man lädt einen Satz Gewichte herunter und kann ein Modell ausführen. Man kann es jedoch nicht reproduzieren, prüfen oder mit eigenen Daten neu trainieren, ohne im Wesentlichen die Trainingspipeline von Grund auf neu zu bauen. Olmo-core 3 ist eine Veröffentlichung der Pipeline.
Die Unterscheidung, die immer wieder auftaucht
Offene Gewichte und offenes Training sind unterschiedliche Produkte, und in der Lücke dazwischen steckt der größte Teil der nützlichen Informationen.
Ein veröffentlichtes Modell sagt einem, was ein Team erreicht hat. Ein Trainings-Stack sagt einem, wie – und genau das braucht man, wenn man es selbst tun möchte. Letzteres ist für alle außerhalb der veröffentlichenden Organisation weitaus nützlicher und weitaus seltener, denn der Trainingscode, die Datenpipeline und die Konfigurationsdetails sind die Teile, deren korrekte Umsetzung am längsten gedauert hat.
Mixture-of-Experts macht dies wichtiger statt weniger wichtig. Ein MoE-Modell leitet jedes Token an eine Teilmenge von Experten weiter, sodass ein Modell mit Billionen Gesamtparametern pro Token nur einen kleinen Bruchteil aktivieren kann. Dieses Design senkt die Inferenzkosten, führt aber Routing-Entscheidungen, Lastverteilung zwischen Experten und geräteübergreifende Kommunikationsmuster ein, die wirklich schwierig abzustimmen sind. Zwei Teams können identische Modellarchitekturen haben und dennoch sehr unterschiedliche Durchsätze erzielen, weil sie andere Entscheidungen in der Trainingsschleife getroffen haben.
Die Trainingsinfrastruktur zu veröffentlichen bedeutet, dass diese Entscheidungen sichtbar werden. Das macht eine Durchsatzsteigerung um den Faktor 2,7 aussagekräftig, denn sie hängt an Code, den andere ausführen und überprüfen können.

Warum MoE-Training der schwierige Teil ist
Dichte Modelle skalieren vorhersehbar. Man fügt Parameter hinzu, fügt Rechenleistung hinzu und erhält eine glatte Kurve. MoE-Modelle führen ein Scheduling-Problem ein. Wenn der Router die meisten Token an wenige Experten schickt, werden diese Experten zum Engpass und der Rest der Hardware liegt brach. Wenn er die Token zu gleichmäßig verteilt, verliert das Modell die Spezialisierung, die die Architektur attraktiv gemacht hat.
Um das richtig hinzubekommen, braucht man Kapazitätsfaktoren, Hilfsverluste und Kommunikations-Overlays, die die meisten Labore als proprietär behandeln. Außerdem braucht man Checkpointing, das Hardwareausfälle übersteht, denn ein Trainingslauf in dieser Größenordnung wird auf Ausfälle stoßen, und ein Neustart von Anfang an ist keine Option.
Der von Ai2 auf acht B300-GPUs gemeldete Durchsatzgewinn ist ein Ergebnis im kleinen Maßstab und sollte auch so gelesen werden. Zu zeigen, dass eine Trainingsschleife auf einem Knoten effizient ist, ist nicht dasselbe wie zu zeigen, dass sie bei Hunderten von Knoten hält, wo die Kommunikation zwischen den Knoten dominiert. Es ist aber das richtige erste Ergebnis, denn Effizienzprobleme treten üblicherweise zuerst im kleinen Maßstab auf und verschlimmern sich mit der Skalierung.
Warum der Durchsatz auf acht GPUs die richtige erste Zahl ist
Ein Durchsatzergebnis im kleinen Maßstab wirkt neben dem Billionen-Parameter-Rahmen bescheiden, und es verdient eine Verteidigung. Probleme mit der Trainingseffizienz treten tendenziell früh auf und werden schlimmer. Wenn eine Trainingsschleife auf einem einzelnen Knoten ein Drittel ihrer Rechenleistung verschwendet, wird dieselbe Schleife mehr verschwenden, sobald Kommunikation zwischen Knoten hinzukommt, weil sich die Ineffizienz mit jeder Koordinationsschicht verstärkt.
Eine Zahl im kleinen Maßstab zuerst zu veröffentlichen, ist eine Art zu sagen, dass die Grundlagen solide sind, bevor man Behauptungen über einen großen Cluster aufstellt. Es ist auch der richtige Ausgangspunkt. Ein Team, das eine große Zahl vor einer kleinen meldet, berichtet üblicherweise von einer Spitzenleistung statt von einer anhaltenden Rate.
Es gibt einen zweiten Grund, warum die Zahl wichtig ist. Der MoE-Durchsatz reagiert auf Batch-Größe und Sequenzlänge in einer Weise, wie es dichte Modelle nicht tun, und die Konfiguration, die die Effizienz auf acht GPUs maximiert, lässt sich oft mit Feintuning auf größere Cluster übertragen. Eine Verbesserung um den Faktor 2,7 ist groß genug, dass sie eine strukturelle Änderung statt eines Tuning-Details widerspiegelt, was sie beachtenswert macht.
Das Publikum dafür ist kleiner als das Publikum für Gewichte
Die meisten Leute, die über offene Modelle sprechen, wollen Gewichte. Sie wollen Inferenz ausführen, ein Modell auf eine Domäne feinabstimmen oder ein Produkt bauen. Diese Gruppe wird von jeder Open-Weight-Veröffentlichung bedient.
Die Gruppe, die einen Trainings-Stack braucht, ist viel kleiner: Forschungslabore, nationale Compute-Programme, Universitäten mit Clusterzugang und Unternehmen in regulierten Branchen, die dokumentieren müssen, wie ein Modell erstellt wurde. Diese Nutzer wurden schlecht bedient, denn die Wahl bestand zwischen dem Aufbau einer Pipeline von Grund auf und der Nutzung von etwas, das nur mit der Hardware eines bestimmten Anbieters funktioniert.
Ein offener Trainings-Stack verändert die zweite Option. Er gibt einem Labor einen Ausgangspunkt, den es anpassen kann, und er gibt einem Regierungsprogramm einen Weg zu souveränen Modellen, der nicht davon abhängt, ob ein ausländischer Anbieter bereit ist, Implementierungsdetails zu teilen.
Das ist eine strategische Veröffentlichung, und Ai2 ist dabei konsequent gewesen. Die Modelle des Instituts wurden mit Daten, Code und Trainingsprotokollen veröffentlicht, was ein strengerer Standard ist als die Veröffentlichung von Gewichten und einem Paper.
Die leise Debatte über offenes Training
Innerhalb der Open-Model-Community gibt es eine Debatte darüber, was Offenheit bedeuten sollte, und Veröffentlichungen wie diese treiben sie voran.
Eine Position besagt, dass Gewichte das sind, worauf es ankommt, weil Gewichte das sind, was Menschen nutzen. Aus dieser Sicht ist die Veröffentlichung eines Modells ein Geschenk und die Trainingsdetails sind das Privatgeschäft eines Unternehmens. Die andere Position besagt, dass ein Modell ohne seinen Trainings-Stack von niemandem außerhalb des ursprünglichen Teams geprüft, reproduziert oder verbessert werden kann und dass die Bezeichnung einer solchen Veröffentlichung als offen übertreibt, was sie bietet.
Die zweite Position gewinnt aus einem praktischen Grund an Boden. Regulierungsbehörden in mehreren Jurisdiktionen haben begonnen, Modellentwickler aufzufordern, Trainingsdaten und Herkunft zu dokumentieren. Ein Team, das mit einer veröffentlichten Pipeline trainiert hat, kann diese Fragen beantworten. Ein Team, das geliehene Gewichte feinabgestimmt hat, kann das nicht, weil es nicht weiß, was in sie eingeflossen ist.
Für ein Forschungsinstitut ist die Kalkulation einfach. Einen Stack zu veröffentlichen kostet Ingenieurszeit und gibt kommerziell nichts preis, weil das Institut keine API-Aufrufe verkauft. Für ein kommerzielles Labor würde dasselbe den Wettbewerbern einen Vorsprung verschaffen. Diese Asymmetrie ist der Grund, warum offene Trainings-Stacks weit häufiger von Instituten und Universitäten als von Unternehmen kommen und warum jeder einzelne, der erscheint, eine Prüfung wert ist.
Worauf man achten sollte
Ob das Durchsatzergebnis im großen Maßstab Bestand hat. Der interessante Test sind nicht acht GPUs, sondern ein paar Hundert, wo die Kommunikationsmuster, die Olmo-core 3 kodiert, entweder funktionieren oder nicht.
Ob Labore außerhalb es tatsächlich übernehmen. Ein Trainings-Stack verbreitet sich, wenn jemand anderes damit ein Modell trainiert und das Ergebnis veröffentlicht. Die erste glaubwürdige Reproduktion wäre informativer als jede Benchmark-Tabelle.
Ob offenes Training die Beschaffung verändert. Organisationen, die die Herkunft ihres Modells dokumentieren müssen, hatten begrenzte Optionen. Wenn eine vollständige Trainingspipeline unter einer permissiven Lizenz verfügbar ist, werden einige dieser Organisationen darauf aufbauen, statt für eine geschlossene Alternative zu bezahlen.
Die Gewichtsveröffentlichungen bekommen die Aufmerksamkeit, weil jeder sie herunterladen und ausprobieren kann. Die Trainingsveröffentlichungen sind der Ort, an dem das eigentliche Wissen des Feldes weitergegeben wird, und sie kommen weitaus seltener vor. Diese hier ist es wert, genau gelesen zu werden, denn der übertragbare Teil eines Modells ist der Prozess dahinter.
Verwandte Artikel
Das Video-Modell-Ranking, das niemand bewirbt: Wohin die Anfragen wirklich gehen
Jede Woche erscheint ein neues Ranking zur Videogenerierung, und fast alle sind nach demselben Muster aufgebaut.
Alibabas Qwen3.8-Max behauptet, zwei Wochen lang selbstständig programmieren zu können
Parameterzahlen sind schon vor einer Weile keine Neuigkeit mehr. Zwölf Tage ist die Zahl, die es zu untersuchen lohnt.
PixelUMM verwirft die zwei Komponenten, auf die jedes visuelle KI-Modell angewiesen ist
Diffusion auf Pixelebene wurde schon früher vorgeschlagen und ist immer wieder an Rechenleistung gescheitert.
KI-Rechenzentren warten jetzt auf Stromleitungen, nicht auf Chip-Lieferungen
Die Projekte, die 2027 termingerecht eröffnen, werden diejenigen sein, die den Netzanschluss und die Speicherzuweisung zuerst gelöst haben.