← Zurück zum Blog
Aica. 7 Min. Lesezeit

Unitree und ZDTaichu im Rennen um das räumliche Gehirn des Roboters

Veröffentlicht 2. Okt. 2026
Unitree und ZDTaichu im Rennen um das räumliche Gehirn des Roboters

Roboter sind schon seit einer Weile gut, was ihren Körper angeht. Ein Humanoide kann gehen, balancieren und greifen. Woran es hapert, ist der Teil, der entscheidet, was als Nächstes zu tun ist – besonders, wenn der Raum nicht der Raum ist, in dem er trainiert wurde. Verschieben Sie eine Tasse, ändern Sie die Werkbank, übergeben Sie dem Roboter eine Aufgabe mittendrin, und die Demo zerfällt.

Zwei chinesische Veröffentlichungen im September zielten auf genau diesen Teil. Unitree präsentierte UnifoLM-WLA-1.0, ein Foundation-Modell für Humanoide mit sechs Milliarden Parametern, trainiert auf rund 2.500 Stunden echten Roboterdaten, und beansprucht sieben Open-Source-Spitzenergebnisse beim Embodied Reasoning. ZDTaichu, eine Ausgründung der Chinesischen Akademie der Wissenschaften und des Wuhan AI Research Institute, hat am 15. September ZDTaichu5.0-9B als Open Source veröffentlicht, ein multimodales Modell mit neun Milliarden Parametern, das in acht von neun internationalen Benchmarks zum räumlichen Verständnis in seiner Parameterklasse den ersten Platz belegte.

Keines von beiden ist ein Roboter. Beide sind Versuche, das Gehirn zu bauen, auf dem ein Roboter läuft, und beide wurden veröffentlicht, statt hinter einer Demo-Wand gezeigt zu werden.

Unitrees Wette auf Allgemeinheit

Die Zahl, die in Unitrees Veröffentlichung heraussticht, ist 64. Ein einziges Modell soll 64 verschiedene Aufgaben koordinieren, vom Falten von Handtüchern und Einräumen von Geschirr über das Bettenmachen und Müllrausbringen bis zum Beladen einer Waschmaschine. Der Punkt dieser Liste ist nicht eine einzelne Aufgabe. Es ist, dass dieselben Gewichte alle bewältigen.

Das ist seit Jahren das zentrale Problem der Robotik. Die meisten Demonstrationen sind auf eine Aufgabe, eine Szene und starkes Tuning ausgelegt. Sie sehen beeindruckend aus und übertragen sich nicht. Eine Policy, die ein Handtuch unter einer Lichtbedingung faltet, faltet kein andersfarbiges Handtuch auf einem anderen Tisch. Eine Robotarbeitskraft nach diesem Modell zu skalieren, hieße, ihr jede Variation beizubringen – und das ist keine Skalierung.

Unitrees Ansatz stützt sich auf eine Basis für Embodied Reasoning namens UnifoLM-ER-1-4B, die auf Qwen3-VL-4B aufbaut und auf mehr als fünf Millionen Embodied-Reasoning-Beispielen trainiert wurde. Bei 16 Benchmarks zur multimodalen Wahrnehmung und zum Verständnis führt sie in sieben davon das Feld an. Bei zwei räumlichen Tests, Where2Place und EmbSpatial, erzielt sie 82,0 und 88,9 gegenüber 69,0 und 83,3 von GPT-6 Astra. Das sind konkrete Vergleiche mit einem geschlossenen Modell, über die sich leichter streiten lässt als über einen allgemeinen Überlegenheitsanspruch.

Unitree kündigt an, das Modell, den Code und den Datensatz zu öffnen. Der letzte Punkt ist der entscheidende. Eine Roboter-Policy mit offenen Gewichten, aber geschlossenem Datensatz lässt sich nicht reproduzieren, nur nutzen. Die Daten zu veröffentlichen ist das, was einem anderen Labor erlaubt, die Behauptung zu überprüfen oder darauf aufzubauen.

ZDTaichus Wette auf räumliches Denken

ZDTaichu5.0-9B geht das Problem von der Wahrnehmungsseite an. Das Modell verarbeitet Text, einzelne Bilder, mehrere Bilder, lange Videos und beliebige Auflösungen, und sein Verkaufsargument ist räumliches Denken: zu verstehen, wo Objekte sind, wie sie zueinander stehen und wie sich eine Szene verändert, wenn sich der Blickwinkel verschiebt.

Die Benchmark-Lücke, die es hervorhebt, liegt bei MindCube-tiny, wo es 78,27 erreicht – mehr als 20 Punkte vor Qwen3.5-9B und mehr als 15 vor STEP3-VL-10B. In einer Demonstration, in der es die zweite silberne Box von links finden soll, gibt es die korrekten Koordinaten aus, während andere offene Modelle ähnlicher Größe alle auf die falsche Stelle zeigen. In einem Test über verschiedene Blickwinkel hält nur dieses Modell den Bezugsrahmen gerade, wenn sich der Kamerawinkel ändert.

Das sind die Fehler, die echte Roboter scheitern lassen. Ein Modell, das eine Tasse erkennt, hat beantwortet, was das Objekt ist. Ein Modell, das weiß, in welche Richtung der Griff zeigt und ob daneben Platz ist, um sie abzustellen, hat begonnen zu beantworten, was man damit tun kann. Wenn eine Aufgabe lange läuft, müssen sich diese Urteile verketten: Objekt aufgenommen, Identität erinnert, Behälter geöffnet, Zustand aktualisiert. Ein ausgelassener Schritt, und der Rest der Aufgabe driftet.

ZDTaichus technischer Kniff ist adaptives Loop-Reasoning. Einfache Fragen bekommen weniger Rechenaufwand. Schwierige, etwa räumliche Transformationen und Objektbeziehungen, bekommen mehrere interne Denk-Durchläufe, ohne ein externes Tool aufzurufen, was verhindert, dass die Token-Kosten bei der einfachen Mehrheit der Eingaben explodieren.

Der Teil der Veröffentlichung, der am wichtigsten sein könnte, ist das, was nicht zurückgehalten wird. Zusammen mit den Gewichten hat ZDTaichu seine gesamte Pipeline zur Produktion räumlicher multimodaler Daten veröffentlicht, die Pretraining, Supervised Fine-Tuning und Reinforcement Learning abdeckt. Institutionen und Unternehmen können sie wiederverwenden, um ihre eigenen Werkshallen- oder Labordaten in Trainingsbeispiele zu verwandeln. Das beantwortet eine Beschwerde, die Open-Model-Veröffentlichungen seit zwei Jahren begleitet: Man bekommt die Gewichte, kann sie aber nicht an die eigenen Daten anpassen, weil das Rezept privat bleibt. Das Modell läuft bereits auf Embodied-Trainingsgeländen in Peking, Foshan und Qingdao.

Zwei Wege zur selben Lücke

Stellt man die beiden Veröffentlichungen nebeneinander, ist der Unterschied lehrreich. Unitree arbeitet von der Handlungsseite nach außen: Man nehme eine Policy, die Aufgaben ausführen muss, trainiere sie auf 2.500 Stunden echter Roboterbewegung und messe, ob sie über 64 Tätigkeiten hinweg generalisiert. ZDTaichu arbeitet von der Wahrnehmungsseite nach innen: Man nehme ein multimodales Modell, das eine Szene verstehen muss, trainiere es auf räumlichen Benchmarks und messe, ob es die Geometrie geradehält, wenn sich der Blickwinkel verschiebt.

Ein Roboter braucht beides. Er muss wissen, wo die Tasse ist, und er muss wissen, wie er sie aufhebt. Die beiden Labore greifen dieselbe Lücke von entgegengesetzten Enden an, und die Tatsache, dass beide im selben Monat veröffentlicht haben, deutet darauf hin, dass sich das Feld darüber einig ist, was die Lücke ist: die mittlere Schicht, in der Wahrnehmung in Handlung übergeht und in der aus einer Aufgabe, die acht Sekunden lief, eine wird, die acht Minuten läuft.

Die Datenfrage trennt sie erneut. Unitree trainierte auf echten Roboterbewegungen, die teuer zu sammeln und selten sind. ZDTaichu setzte auf seine Datenpipeline und synthetische räumliche Aufgaben, die anders skalieren und ein anderes Risiko tragen: dass ein Modell gut in Testszenen wird und dort bleibt. Welcher Weg auch immer eine Policy hervorbringt, die den Kontakt mit einem echten Lager übersteht, wird entscheiden, welche Datenquelle die richtige Wette war.

Der Branchenkontext

Beide Veröffentlichungen landen in einem Feld, das seine Annahmen kürzlich neu geordnet hat. Googles Gemini Robotics 2 wirbt mit „ein Gehirn für jeden Roboter“. Nvidias Jim Fan hat argumentiert, dass Vision-Language-Action-Modelle tot sind und World-Action-Modelle der Nachfolger. Gartners Septemberbericht zu Chinas KI-Trends zählte Physical AI und Weltmodelle zu den Richtungen, die zu strukturellen Anforderungen statt zu Experimenten geworden sind.

Diese Neurahmung ist der Grund, warum ein räumlicher Benchmark mehr zählt als ein Chat-Score. Der Wettbewerb in der Embodied AI hat sich davon verschoben, wie gut ein Modell über die physische Welt spricht, hin zu der Frage, ob es in ihr handeln kann, und die Metriken sind gefolgt. Koordinatengenauigkeit, Blickwinkelkonsistenz und Aufgabenabschluss über Szenen hinweg sind die neue Anzeigetafel.

Worauf man achten sollte

Der ehrliche Vorbehalt bei beiden Veröffentlichungen ist, dass Benchmark-Führerschaft beim räumlichen Denken nicht dasselbe ist wie ein Roboter, der in einem Lager funktioniert. Ein Modell kann Objekte in einem Testset korrekt platzieren und trotzdem an einem echten Arm mit klemmendem Greifer oder schlechter Beleuchtung scheitern. In der Lücke zwischen Denken und Handeln sind die meisten Robotik-Versprechen gestorben.

Was diese beiden verfolgenswert macht, ist die Kombination aus offenen Gewichten und offenen Datenpipelines. Wenn ein Labor außerhalb von Unitree oder ZDTaichu eines der Modelle nehmen, es auf seiner eigenen Hardware neu trainieren und das Ergebnis veröffentlichen kann, werden die Behauptungen öffentlich getestet. Bleiben die Veröffentlichungen Benchmarks und Demos, während Wettbewerber ihre Daten geschlossen halten, bleibt das Feld dort, wo es war: viele beeindruckende Videos und sehr wenige Roboter, die an einem Dienstag nützliche Arbeit verrichten.

Verwandte Artikel