← Zurück zum Blog
Newsca. 5 Min. Lesezeit

Unitree veröffentlicht 6B-Humanoidenbasis als Open Source: Ein Modell steuert Hände und Füße zugleich, verkörperte Intelligenz beginnt pro Arbeitsplatz zu rechnen

Veröffentlicht 6. Okt. 2026
Unitree veröffentlicht 6B-Humanoidenbasis als Open Source: Ein Modell steuert Hände und Füße zugleich, verkörperte Intelligenz beginnt pro Arbeitsplatz zu rechnen

Am 3. Oktober hat Unitree Robotics auf GitHub und Hugging Face das neue universelle Basismodell für humanoide Roboter UnifoLM-WLA-1.0 veröffentlicht. Es hat 6 Milliarden Parameter und wurde auf Basis von etwa 2500 Stunden echten Roboterdaten feinabgestimmt. Diese Nachricht verbreitete sich in der chinesischen Robotikszene nicht langsam, doch der am leichtesten zu übersehende Punkt ist, dass sie „Handeln“ und „Gehen“ in dasselbe Modell gesteckt hat.

Im vergangenen Jahr blieben die Glanzmomente humanoider Roboter meist in Demo-Clips stecken: Saltos, Tanzen, ein Glas Wasser tragen. Doch wenn sie wirklich in Fabriken, Läden und Haushalte kommen sollen, ändert sich die Prüfungsfrage. Ob eine einzelne Bewegung beeindruckend genug ist, ist eine Sache; ob ein Modell gleichzeitig feine Tischmanipulation und Ganzkörper-Mobilitätsaufgaben bewältigen kann, eine andere. Die Zahl, die Unitree diesmal nennt, sind 64 Aufgaben, darunter 10 Ganzkörperaufgaben und 54 Tischaufgaben, und es lässt sich gleichzeitig mit Parallelgreifern und zwei unterschiedlich konfigurierten Dexterous-Händen nutzen.

Auch der Technologie-Stack ist einen Blick wert. Er startet mit einem auf Qwen3-VL basierenden Embodied-Reasoner, ergänzt um optischen Fluss und VQ-VAE-basierte Vorhersage zukünftiger dynamischer Bereiche, residuale VQ-Aktionsdiskretisierung und schließlich einen MMDiT-Aktionsexperten. Weniger sperrig ausgedrückt: Zuerst soll das Modell verstehen, was im Bild als Nächstes passieren wird, dann wird die „auszuführende Aktion“ in wiederverwendbare Bausteine zerlegt, und am Ende setzt ein für die Ausführung zuständiges Modul sie zusammen.

Auf einer Werkbank verstreute Metallgelenkmodule und ein leerer Notizzettel, weiches Seitenlicht

Warum „ein Modell steuert Hände und Füße“ ein Wendepunkt ist

In der Ingenieurspraxis verkörperter Intelligenz waren Hände und Füße lange zwei getrennte Teams. Greifen, Einstecken, Schrauben eindrehen gehören zu häufigen, kleinräumigen Bewegungen mit hohen Anforderungen an Präzision und Kraftkontrolle; Gehen, Drehen, Auf- und Abstiege gehören zu selteneren, großräumigen Bewegungen, die Balance und Gelände bewältigen müssen. Beides auf verschiedene Modelle aufzuteilen hat den Vorteil, dass jeder Pfad bis zum Optimum getunt werden kann; der Preis ist, dass beim Umschalten Zustand übergeben werden muss, und jede Übergabe kann Informationen verlieren und Latenz hinzufügen.

Indem Unitree 64 Aufgaben in ein 6B-Modell presst, wettet es im Kern darauf, dass der Nutzen einer „einheitlichen Repräsentation“ größer ist als der Nutzen getrennter Optimierung. Diese Wette ist auf Allzweck-GPUs nicht billig, aber auf Robotern sinnvoll: Beim Deployment auf echter Hardware sind VRAM, Rechenleistung und Leistungsaufnahme hart begrenzt; ein Modellsatz weniger bedeutet auch einen Aufwand weniger.

Nicht nur Unitree treibt das voran

Betrachtet man mehrere Ereignisse rund um den Oktober im Zusammenhang, zeigt sich, dass dies keine isolierte Veröffentlichung ist.

Das Beijing Academy of Artificial Intelligence (BAAI) hat am 29. September RoboBrain-X0 als Open Source veröffentlicht und damit die Fähigkeiten großer Modelle auf Wahrnehmung und Bewegungssteuerung von Robotern ausgeweitet. Open-Source-Projekte für verkörperte Intelligenz blieben früher meist auf der Ebene von Simulationsumgebungen und Datensätzen; dass nun Modelle erscheinen, die direkt auf Aktionsstrategien ausgerichtet sind, zeigt, dass dieser Weg von Papers zu reproduzierbaren Engineering-Assets führt.

Am 4. Oktober gingen mehrere humanoide Roboter des in Hangzhou, Zhejiang, ansässigen Unternehmens DEEP Robotics auf die Straße, um Verkehrsregelung an Kreuzungen, Ordnungsdienste und Touristenauskunft zu testen. Die Testumgebung wurde an einer echten Kreuzung und nicht auf einem Messestand gewählt, und sie liefen auch bei Regen. Der Wert solcher Tests liegt nicht darin, wie flüssig die Bewegungen sind, sondern darin, humanoide Roboter in eine reale Umgebung zu bringen, die ihnen nicht ausweicht.

Noch weiter zurück haben sieben Hochschulen, darunter die National University of Singapore, die Tsinghua-Universität und die Peking-Universität, gemeinsam die Welt-Aktions-Modell-Basis OpenWAM als Open Source veröffentlicht. Sie soll die alte Kluft zwischen Simulation und realer Maschine überbrücken: Traditionelle Simulatoren berechnen Physik und visuelle Wahrnehmung oft getrennt; OpenWAM lässt Modelle direkt aus Daten lernen, „wie Aktionen die Welt verändern“, und darauf aufbauend Objektpositionen, Szenensemantik und Aufgabenstatus vorhersagen. Die offizielle README empfiehlt etwa 640 GB Trainingsdaten; die Positionierung ist Forschungsinfrastruktur, kein sofort einsatzbereites Produkt.

Von „Kann es sich bewegen?“ zu „Kann es den Job übernehmen?“

Die Erzählung der verkörperten Intelligenz wechselt die Spur. In den letzten zwei Jahren verglich man, ob der Roboter selbst laufen kann und ob die Bewegungen cool genug sind; jetzt vergleicht man, ob ein Roboter mehrere Stunden am Stück ohne Panne arbeiten kann.

Für diesen Wandel gibt es eine sehr handfeste Kennzahl: die durchschnittliche Zeit zwischen zwei menschlichen Eingriffen. Ein Hersteller hat einmal eine „Zuverlässigkeitsrechnung“ veröffentlicht: Ein Waschzyklus verkettet etwa 79 Teilaufgaben; rechnet man mit 95 % Erfolgsquote pro Schritt, liegt die Wahrscheinlichkeit, dass ein kompletter Durchlauf ohne Eingriff klappt, bei nur etwa 1,7 %. Die 95 % pro Teilaufgabe klingen einzeln hoch, multipliziert brechen sie zusammen. Deshalb beginnt die Branche, das Optimierungsziel von der Erfolgsquote einzelner Aufgaben darauf zu verlagern, wie lange ein vollständiger Workflow durchhält.

Der Wert der von Unitree diesmal als Open Source veröffentlichten 6B-Basis liegt ebenfalls hier. Ihre Bedeutung liegt darin, einen reproduzierbaren gemeinsamen Ausgangspunkt zu bieten. Nachfolgende Entwickler können auf dieser Basis feinjustieren, Hardware austauschen, Aufgaben ergänzen, ohne Daten von null aufzubauen. Der Wettbewerb in der verkörperten Intelligenz verschiebt sich von „einen bewegungsfähigen Körper bauen“ zu „Kann das Gehirn hardware- und aufgabenübergreifend wiederverwendet werden?“

Zum Schluss

Ein humanoides Basismodell mit 6 Milliarden Parametern als Open Source zu veröffentlichen, zeigt kurzfristig keinen kommerziellen Return, und die Datenkosten lasten ebenfalls. Aber es löst eine grundlegendere Sache: Forschende und Entwickler haben einen gemeinsamen Referenzpunkt zum Abgleichen.

Beim Thema Roboter liegt die entscheidende Hürde letztlich in den Tausenden Stunden in Fabriken und Läden; die Pressekonferenz ist nur der Auftakt. Wer „dauerhafte Verfügbarkeit“ wirklich umsetzt, hat tatsächlich den Platz betreten.

Die Beobachtungspunkte, die der Branche bleiben, sind sehr konkret: Wie hoch ist die Reproduktionsrate dieser Veröffentlichung, wie schnell wird in realen Projekten iteriert, und wie viele Leute reichen sechs Monate später noch Verbesserungen ein? Der Trubel am Veröffentlichungstag wird verfliegen; bleiben werden nur die Codezeilen, die noch benutzt werden.

Verwandte Artikel