← Zurück zum Blog
Aica. 6 Min. Lesezeit

Xiaomi veröffentlicht ein omnimodales Modell auf Frontier-Niveau – samt Trainingsrezept

Veröffentlicht 4. Okt. 2026
Xiaomi veröffentlicht ein omnimodales Modell auf Frontier-Niveau – samt Trainingsrezept

Ein Telefonunternehmen hat am 22. September ein KI-Modell veröffentlicht, und die Schlagzeile war die Zahl 46. Das ist Xiaomis Wert für MiMo-V2.6 Pro im Intelligence Index von Artificial Analysis, der laut Unternehmen der höchste ist, den ein Open-Source-Modell zum Zeitpunkt der Veröffentlichung erreicht hat.

MiMo-V2.6 gibt es in zwei Versionen. Pro ist die große, Flash die schnelle. Xiaomi zufolge erreicht Pro bei den meisten Agent-Benchmarks das Niveau von Claude Opus 5 und GPT-5.6 Sol und verweist auf Verbesserungen bei Coding, Computer Use, 3D-Reasoning und kreativen Aufgaben. Die Modelle sind omnimodal, das heißt, sie nehmen Text, Bilder und andere Eingaben über einen einzigen Satz von Gewichten entgegen, und sie wurden mit skaliertem Reinforcement Learning trainiert – der Teil, der sowohl die Fähigkeiten als auch das Veröffentlichungsformat erklärt.

Was tatsächlich im Download steckt

Die meisten Open-Weight-Veröffentlichungen übergeben die Gewichte und hören dort auf. MiMo-V2.6 liefert Gewichte, einen technischen Bericht, die Reinforcement-Learning-Umgebungen und den Trainingscode. Xiaomi hat alle vier auf der eigenen Website veröffentlicht, statt Entwickler über einen Model-Hub mit Lizenzseite und Warteliste zu leiten.

Die beigefügten RL-Umgebungen sind der eigentliche Unterschied. Gewichte lassen dich ein Modell ausführen. Umgebungen lassen dich es neu trainieren. Wenn ein Labor die Umgebungen veröffentlicht, auf denen es trainiert hat, sagt es dir, wie es zu diesem Verhalten gekommen ist, statt nur, was das Verhalten ist. Für alle, die das Ergebnis reproduzieren oder das Modell auf ein eigenes Reward-Signal hin feinabstimmen wollen, sind die Umgebungen das eigentliche Artefakt.

Zugleich erhöht das die Kosten der Veröffentlichung für das Unternehmen, das sie gemacht hat. Wer Umgebungen publiziert, legt die Form des Trainingssignals offen – und das ist näher an einem Rezept als an einem Checkpoint. Ein Wettbewerber kann es lesen und ein Jahr Trial-and-Error überspringen. Xiaomi scheint entschieden zu haben, dass die Vorteile bei Recruiting und Glaubwürdigkeit das aufwiegen.

Warum ein Gerätehersteller Frontier-Forschung betreibt

Xiaomi ist kein Forschungslabor, das nebenbei Telefone verkauft. Es ist genau umgekehrt, und diese Ausrichtung zeigt sich daran, wofür ein omnimodales Modell gut ist.

Ein Telefon ist der natürliche Ort für einen Assistenten, der einen Bildschirm lesen, ein Foto verstehen, eine Oberfläche bedienen und in einem gesprochenen Dialog antworten kann. Computer Use, 3D-Reasoning und kreative Generierung sind von diesem Standpunkt aus keine abstrakten Benchmarks. Sie sind die Bestandteile eines Systems, das auf einem Gerät laufen muss, das jemand in der Hand hält – oft mit langsamer Verbindung und einem Akku, den es zu schonen gilt. Eine Modellfamilie, die sich in eine Pro-Stufe für Fähigkeit und eine Flash-Stufe für Latenz aufteilt, ist ebenso eine Entscheidung über die Geräte-Roadmap wie eine über die Forschung.

Die Veröffentlichung der Gewichte hat zwei Zwecke. Sie wirbt Forschende an, die das Modell öffentlich verbessern, und sie schafft ein Fundament für die Position des Unternehmens in einem Markt, in dem Fähigkeitsclaims sonst auf Vertrauen basieren. Ein Modell, das man selbst herunterladen und bewerten kann, braucht weniger Marketing – und Xiaomi konkurriert um die Aufmerksamkeit von Entwicklern mit Laboren, deren gesamte Reputation auf veröffentlichten Ergebnissen beruht.

Was omnimodal in der Praxis bedeutet

Das Label steht für eine konkrete technische Behauptung: Ein Modell verarbeitet mehrere Eingabearten über eine gemeinsame Repräsentation, statt jeden Eingabetyp an einen separaten Spezialisten weiterzuleiten. Bei einem Telefon ist das wichtig, weil die Alternative darin besteht, mehrere Modelle laufen zu lassen und ihre Ausgaben zusammenzufügen – und Speicher wie Latenz sind auf einem Handset knapp. Xiaomis Flash-Stufe existiert aus demselben Grund. Ein Modell, das auf einem Flaggschiff in einer Sekunde antwortet, kann auf einem Mittelklassegerät oder im Auto unbrauchbar sein; die Familie ist also eher zwei Punkte auf einer Fähigkeits- und Latenzkurve als eine einzelne Veröffentlichung.

Eine klare Glaslinse mit Regenbogenrefraktion auf einem dunklen Ring

Die Trainingsmethode erklärt den Rest. Skaliertes Reinforcement Learning bedeutet, dass das Modell gegen ein Reward-Signal optimiert wird und nicht nur darauf trainiert, das nächste Token vorherzusagen – und es ist der Ansatz hinter dem jüngsten Sprung bei agentischen Fähigkeiten in der Branche. Es ist auch der Grund, warum die Umgebungen genauso wichtig sind wie die Gewichte. Ein Reward-Signal ist nur so gut wie die Umgebung, die es erzeugt; eine Umgebung zu veröffentlichen kommt daher dem Veröffentlichen einer Methode näher als dem eines Ergebnisses.

Das Gerät ist der Vertriebskanal

Xiaomis Vorteil ist, dass das Unternehmen kein Entwickler-Ökosystem braucht, um Nutzer zu erreichen. Es liefert Hardware an zig Millionen Menschen, und ein Modell, das in einem Telefonassistenten läuft, erreicht in einem Quartal mehr Menschen, als ein Model-Hub in einem Jahr. Deshalb ist das Veröffentlichungsformat großzügig. Die Gewichte und das Rezept kosten das Unternehmen relativ wenig an entgangenen Lizenzeinnahmen – und sie kaufen Glaubwürdigkeit in der Forschungsgemeinschaft, die das Modell sonst anhand eines Benchmark-Screenshots beurteilen würde.

Das Risiko ist dasselbe wie der Vorteil. Ein Telefonassistent wird daran gemessen, ob er jedes Mal funktioniert, und ein Agent, der bei einer von zwanzig Aufgaben versagt, ist in einem Chatfenster ein Ärgernis und in einem Gerät, das auch Zahlungen, Fotos und Nachrichten verarbeitet, ein Sicherheitsrisiko. Fähigkeits-Benchmarks messen diese Lücke nicht, und ein zusammengesetzter Wert von 46 tut es ebenso wenig.

Derselbe Dienstag, drei weitere Veröffentlichungen

Das Timing ist aufschlussreich. Am 22. September erschien Xiaomis Modell zusammen mit Alibabas Qwen-Image-2.1, das Alibaba am 20. September als Open Weights veröffentlichte und noch am selben Tag auf seiner Yunqi-Konferenz vorstellte, sowie mit der Preview von Tencents Hy Image 3.5, einem professionellen Bildmodell zum Preis von 0,15 Yuan pro 2K-Bild über die Tencent-Cloud-API. Unitree nutzte dasselbe Zeitfenster, um Dex5-S anzukündigen, eine geschickte Roboterhand mit 22 Freiheitsgraden ab 6.500 Dollar.

Alibaba nutzte die Konferenz außerdem, um für Qwen3.8-Max Platz eins im agentischen Leaderboard von Artificial Analysis und Platz eins auf CodeArena für Frontend-Programmierung zu beanspruchen und um mitzuteilen, dass Qwen4 im Training ist, mit Nachfolgemodellen von geplanten fünf bis zehn Billionen Parametern. Der Leiter von Qwen-Image merkte an, das Ziel des Teams sei, die Kosten für die Erledigung einer Aufgabe zu senken statt die Parameterzahl zu maximieren – genau der Trade-off, den MiMos zweistufige Struktur eingeht.

Keine dieser Ankündigungen war abgestimmt, und alle wiesen in dieselbe Richtung. Die Wettbewerbsfrage im chinesischen KI-Sektor ist in diesem Herbst nicht, ob es ein Modell der Frontier-Klasse gibt. Sie lautet, wie viel davon man in Händen halten darf.

Der Vorbehalt bei den Benchmarks

Eine Zahl wie 46 hängt vollständig von dem Index ab, der dahintersteht, und der Intelligence Index von Artificial Analysis ist nur einer von mehreren zusammengesetzten Werten. Der Vergleich mit Claude Opus 5 und GPT-5.6 Sol stammt von Xiaomi, auf Basis von Xiaomis Benchmark-Auswahl, und die Formulierung „die meisten Agent-Benchmarks“ leistet Arbeit, die eine Ergebnistabelle besser leisten würde. Gerade Agent-Benchmarks reagieren empfindlich auf das Scaffolding: Dasselbe Modell kann je nach Umgebung sehr unterschiedlich abschneiden.

Was die Behauptung über Marketing hinaushebt, ist der Download. Wer die 46 bezweifelt, kann das Modell ausführen, den Bericht lesen und es in den von Xiaomi mitgelieferten Umgebungen neu trainieren. Das ist ein härterer Test als ein Leaderboard-Screenshot – und er ist nur möglich, weil das Unternehmen sich entschieden hat, das Rezept zusammen mit dem Ergebnis zu veröffentlichen.

Verwandte Artikel