← Zurück zum Blog
Aica. 7 Min. Lesezeit

Chinas neue offene Modelle werden zu Agenten-Substraten trainiert

Veröffentlicht 3. Okt. 2026
Chinas neue offene Modelle werden zu Agenten-Substraten trainiert

Drei Modellveröffentlichungen aus chinesischen Laboren in der letzten Woche teilen einen Designinstinkt, der leicht zu übersehen ist, wenn man sie als Liste von Parameterzahlen liest. Keines davon wurde gebaut, um gut in Konversation zu sein.

Sie wurden gebaut, um das zu sein, worauf ein Agent läuft. Das ist ein anderes Ziel, und die Trainingsentscheidungen, die daraus folgen, wirken seltsam, wenn man annimmt, das Ziel sei ein besserer Chatbot.

Die Aufgabe und die Welt um sie herum trainieren

Das deutlichste Beispiel ist IQuest-Q1, veröffentlicht vom ZhiZhi Innovation Research Institute am 29. September. Es ist ein Sparse-Mixture-of-Experts-Modell mit insgesamt 320 Milliarden Parametern, 15 Milliarden aktiven und einem Kontextfenster von 524.288 Token. Die Architektur ist neben seiner Trainingsmethode unspektakulär.

Statt auf Transkripten menschlicher Konversation oder auf statischen Instruktionssets feinabzustimmen, synthetisierte das Team Aufgaben und die Umgebungen, in denen sie stattfinden, gemeinsam. Das Modell wurde dann über mehrere verschiedene Agenten-Scaffolds hinweg trainiert. Es hielt die nativen Werkzeuge und das Kontextmanagement jedes Scaffolds intakt und behandelte nur die eigenen Fehler des Modells als Lernsignal. Das Harness durfte nicht zur Lektion werden. Anschließend wurden vier Spezialistenmodelle durch Multi-Teacher-On-Policy-Distillation zu einem zusammengeführt.

Das ist wichtig wegen eines Problems, auf das jeder gestoßen ist, der Agenten baut. Ein Modell, das in einem Benchmark gut abschneidet, kann zusammenbrechen, wenn man es in die eigenen Werkzeuge einbettet, weil es die Eigenheiten des Harness von jemand anderem gelernt hat. Das Training über verschiedene Scaffolds hinweg, während das Harness konstant gehalten wird, greift genau diesen Fehler an. Das berichtete Ergebnis ist ein Modell, das bei Natural-Language-to-Repository-Aufgaben knapp hinter Claude Opus 5 landet – eine seltsame Sache, in der man gut sein kann, und genau das, was ein Coding-Agent braucht.

Sehen und Entscheiden im selben Schritt

Die zweite Veröffentlichung nimmt einen anderen Weg zum selben Ziel. Am selben Tag stellte das Shanghai AI Laboratory ein Entscheidungsmodell namens Shusheng Mingjue in drei Größen vor: 0,8B, 2B und 4B. Es ist bewusst klein.

Das Designprinzip lautet, dass Wahrnehmung und Entscheidung keine getrennten Stufen sein sollten. Die meisten Agenten-Stacks machen einen Screenshot, geben ihn an ein Vision-Modell, erhalten eine Beschreibung, reichen die Beschreibung an einen Planer weiter und handeln. Jeder Sprung erhöht die Latenz und verliert Details. Mingjue verschmilzt native visuelle Wahrnehmung mit Instruction-Following, sodass das Modell auf einen Bildschirm schaut und in einem Durchgang eine Entscheidung trifft. Das Labor berichtet, dass es Jev und vergleichbare offene Modelle bei der Entscheidungsqualität schlägt. Für einen Agenten, der in einer dynamischen Umgebung handeln muss, ist die Größe entscheidend: Ein 4B-Modell kann nah an der Schleife laufen, ein 320B-Modell nicht.

Die Attention-Schicht entfernen, um eine Million Token zu erreichen

Die dritte Veröffentlichung ist architektonisch am aggressivsten. Naive N0.5 Flash aus dem Pekinger Labor NaiveAI ist ein Mixture-of-Experts-Modell mit 309 Milliarden Parametern und 15,5 Milliarden aktiven Parametern, das auf Xiaomis MiMo-V2.5 basiert. Es unterstützt nativ einen Kontext von einer Million Token und erscheint unter der MIT-Lizenz.

Der interessante Teil ist, was es entfernt hat. Das Modell verwendet einen Hybrid aus Sliding-Window-Attention und DeepSeeks Sparse Attention und hat überhaupt keine Full-Attention-Schichten. Standard-Transformer-Attention skaliert quadratisch mit der Sequenzlänge, weshalb langer Kontext historisch teuer war. Das Entfernen von Full Attention ist eine Wette darauf, dass die nützlichen Informationen in einer langen Sequenz durch strukturierte Sparsity erreichbar sind, und wenn das Bestand hat, verändert es, was ein Agent auf einmal im Blick behalten kann. Eine Million Token entsprechen grob einem großen Repository oder dem Verlauf einer langen Arbeitssitzung, der ohne Kürzung gehalten wird.

Die kleineren Veröffentlichungen weisen in dieselbe Richtung

Das Muster zeigt sich auch über diese drei hinaus. Tsinghuas Puro-2B wurde für rund 4.400 US-Dollar trainiert und schlägt ein größeres Qwen-Modell im Durchschnitt über fünfzehn Aufgaben. Ein Telekommunikationslabor veröffentlichte TeleOCR, ein 1,2B-Modell zur Dokumentenanalyse, das einen Dokumentenverständnis-Benchmark anführte. Stanford und NVIDIA veröffentlichten einen kontrastiven Verifier, der die beste Kandidatenaktion durch Embedding-Ausrichtung statt durch Reasoning auswählt und große Geschwindigkeitsgewinne gegenüber einem vergleichbaren Judge-Modell berichtet.

Jedes davon ist eine Komponente in einem Agenten, kein Ziel für einen Nutzer. Ein Verifier, der Kandidatenaktionen kostengünstig rankt, ein kleines Modell, das Dokumente parst, ein winziges Modell, das entscheidet, worauf geklickt wird. Die Teile werden spezialisierter und kleiner, während das eine Modell, das den Kontext der gesamten Sitzung hält, sehr groß wird.

Das Evaluationsproblem, das niemand gelöst hat

Durch all das zieht sich ein Loch. Benchmarks für Agenten-Basismodelle sind noch immer größtenteils aus der Chatbot-Evaluation entlehnt, die die falschen Dinge misst. Ein Modell kann in einem Reasoning-Test gut abschneiden und trotzdem ein schlechtes Substrat für einen Agenten sein, weil die Eigenschaften, die zählen, erst über eine Sitzung hinweg sichtbar werden: wie viele Turns vergehen, bevor der Kontext nachlässt, ob ein fehlgeschlagener Tool-Aufruf sinnvoll erneut versucht wird, ob das Modell bemerkt, dass es das ursprüngliche Ziel aus den Augen verloren hat.

Die meisten hier berichteten Zahlen stammen von den Laboren selbst, aus Benchmarks, die sie mitdefiniert haben. IQuest-Q1 „nur knapp hinter Claude Opus 5“ bei Natural-Language-to-Repository-Aufgaben ist ein Anbietervergleich. Mingjues „Jev zu schlagen“ ist eine Anbieterbehauptung. Das Fehlen von Full Attention bei Naive N0.5 Flash ist eine architektonische Tatsache, die leicht zu überprüfen ist und deren praktische Konsequenzen noch nicht im großen Maßstab gemessen wurden. Nichts davon macht die Richtung falsch. Es bedeutet, dass der ehrliche Stand der Dinge ist, dass wir drei interessante Designs und sehr wenig unabhängige Belege dafür haben, welches standhält, wenn ein Agent sechs Stunden lang läuft.

Die Lücke beginnt anerkannt zu werden. Unabhängige Gruppen haben Benchmarks entwickelt, die auf Produktionsbereitstellung statt auf Codegenerierung abzielen und auf Agent-Hijacking statt auf Modellsicherheit, was darauf hindeutet, dass das Feld weiß, dass es die falsche Ebene gemessen hat. Bis diese ausgereift sind, ist das nützliche Signal einer Veröffentlichung wie dieser nicht die Punktzahl. Es ist die Trainingsmethode, denn eine Methode, die einen bekannten Fehlermodus von Agenten adressiert, hat eher Substanz als eine Zahl, die auf ein Leaderboard zielt.

Es gibt noch eine weitere Folge dieses Wandels, die leicht zu übersehen ist. Wenn die wichtigen Modelle kleine Komponenten statt große Ziele werden, dann kommt der Vorteil eines Labors nicht mehr daher, das größte Modell zu haben, sondern daher, zu wissen, wie die Teile zusammenpassen. Ein Team, das ein schnelles Entscheidungsmodell, einen günstigen Dokumentenparser und einen Verifier trainieren und sie zu einer Schleife verdrahten kann, die auf bescheidener Hardware läuft, hat etwas, das ein einzelner gigantischer Checkpoint nicht bieten kann. Das ist eine andere Art von Wettbewerb, näher am Systems Engineering als an der Skalierung, und die in diesem Monat erscheinenden Veröffentlichungen legen nahe, dass sich mindestens einige chinesische Teams bereits darauf ausgerichtet haben.

Zwei Jahre lang wurde das Rennen um offene Gewichte daran gemessen, wie nah ein freies Modell an einen Frontier-Chatbot herankam. Diese Betrachtungsweise verliert an Überzeugungskraft. Chatqualität ist zur Grundvoraussetzung geworden, und die Fragen, die darüber entscheiden, ob Software funktioniert, haben sich auf anderen Boden verlagert: wie viele Turns vergehen, bevor der Kontext nachlässt, wie schnell das Modell in einer Schleife handeln kann, wie gut es damit zurechtkommt, in die Tooling-Landschaft von jemand anderem geworfen zu werden.

Die Modelle, die diese Fragen beantworten, werden nicht viele Leaderboards gewinnen. Sie werden den weniger sichtbaren Wettbewerb darum gewinnen, zu welchem ein Entwickler greift, wenn der Chatbot seine Aufgabe bereits erledigt hat und die Arbeit tatsächlich getan werden muss. Dieser Wettbewerb hat sich diese Woche leise abgespielt – in drei Veröffentlichungen, die niemanden mit Konversation beeindrucken wollten.

Verwandte Artikel