Sieben Hochschulen veröffentlichen OpenWAM gemeinsam als Open Source: Roboter müssen nicht nur „sehen“, sondern auch „die nächste Sekunde vorhersehen“

Anfang Oktober stellte ein Team aus Forschenden von sieben Hochschulen, darunter die National University of Singapore, Tsinghua-Universität und Peking-Universität, OpenWAM auf GitHub und Hugging Face. Die Ausrichtung des Projekts ist klar: ein Open-Source-Forschungs-Full-Stack für World-Action-Modelle (WAM), plus ein Basismodell. Das Paper ist bereits auf arXiv unter der Nummer 2609.07398 verfügbar, und das Repository hatte bis zum 1. Oktober etwa 940 Sterne.
Die Nachricht verbreitete sich in China nicht langsam, aber wirklich einen zweiten Blick wert ist das alte Problem, das sie lösen will: Es reicht nicht, dass ein Roboter nur erkennt, was vor ihm liegt.
Herkömmliche Simulatoren berechnen Physik und Vision getrennt
Früher gab es für Roboterstrategien zwei übliche Wege. Der eine lernt gleichzeitig visuelle Muster und Steuersignale direkt aus Roboter-Demonstrationen; der andere beginnt mit Bild-Text-Vortraining, um Semantik- und Sprachwissen einzubringen – das ist der VLA-Ansatz.
Das World-Action-Modell geht einen dritten Weg: Zuerst erbt es aus dem Video-Generierungs-Vortraining den Prior dafür, wie sich die Welt verändert, und lernt dann durch verkörperte Erfahrungen, was in dieser Welt zu tun ist. Es klingt wie ein Umweg, umgeht aber den alten Riss zwischen Simulation und realer Maschine. Bei traditionellen Simulatoren werden Physik und Vision oft getrennt berechnet, sodass Aktionswirkung und visueller Eindruck nicht zusammenpassen; OpenWAM lässt das Modell direkt aus Daten lernen, wie eine Aktion die Welt verändert, und darauf aufbauend Objektpositionen, Szenensemantik und Aufgabenstatus vorhersagen.
In drei Ebenen zerlegt, damit Experimente reproduzierbar sind
Das Team zerlegt das Problem in drei Ebenen, jede Ebene entspricht einer Komponente.
OpenWAM-Infra ist eine modulare Infrastruktur, die vier Ebenen entkoppelt: kombinierbare Modelle, Trainings-Runtime, Deployment-Runtime und Evaluierungsprotokolle. Diese Ebene verwandelt World-Action-Modelle von einer eng gekoppelten Einzelimplementierung in einen Prüfstand, bei dem Komponenten ausgetauscht werden können.
OpenWAM-Study ist für das Destillieren von Designregeln zuständig. Es baut keine Modelle, sondern führt kontrollierte Experimente durch und macht mit Vergleichsgruppen aus „Welches Design funktioniert?“ reproduzierbare Schlussfolgerungen.
OpenWAM-α ist das Basismodell selbst und validiert das gesamte Vorgehen auf großen Mengen von Egoperspektive-Videos von Menschen und Roboterdaten.
Drei Designprinzipien, jedes mit Vergleichszahlen
Bei solchen Papers ist die größte Gefahr, dass alles nur Schlagworte sind. Die drei Schlussfolgerungen von OpenWAM sind jeweils mit Kontrollexperimenten belegt.
Erstens: Es braucht einen ausreichend starken generativen Welt-Prior. Ein 14B-Videobackbone erreicht 93,79 %, ein 1,3B-Modell nur 90,14 %; die Standardkonfiguration wählt 5B und liegt nur 1,4 Prozentpunkte unter 14B. In Kombination mit dem kompakten visuellen latenten Raum, den DINOv3 und S-VAE komprimieren, ist die Wirkung nahe an dem VAE, das Wan2.2 mitbringt.
Zweitens: Beim Training muss ein klarer Informationsfluss von der Welt zur Aktion aufgebaut werden. Wenn der „Aktionsstrom den Weltstrom sehen“ kann, liegt die Genauigkeit bei 92,39 %; mit isolierter Maske nur bei 87,41 % – ein Unterschied von ganzen 5 Prozentpunkten. Bei der Inferenz funktioniert synchrones gemeinsames Entrauschen am besten.
Drittens: Daten müssen je nach Quelle eingesetzt werden. Roboterdaten sichern das Grounding der Aktionen, Egoperspektive-Videos von Menschen erweitern die Abdeckung der Welt, und ein einstufiges kooperatives Training integriert beides. Interessant ist, dass die Verbesserung innerhalb der Vortrainingsdomäne begrenzt ist, die Erfolgsrate außerhalb der Verteilung (OOD) aber von 14,50 % auf 26,62 % steigt.
Die tatsächlichen Spezifikationen des Basismodells
OpenWAM-α setzt sich aus zwei Teilen zusammen: Wan2.2-TI2V-5B dient als Videostream, dazu kommt ein 1B-Action-DiT. Der Aktionsraum ist auf 80 Dimensionen vereinheitlicht und mit 17 physischen Plattformen kompatibel. Die Vortrainingsdaten umfassen 14.300 Stunden, davon 30 % Egoperspektive von Menschen, 30 % synthetische Daten und 40 % echte Daten.

Bei der Inferenzgeschwindigkeit benötigt ein einzelner Aktionsblock auf einer RTX 5090 170 Millisekunden. Die Evaluierung deckt 8 Simulationsbenchmarks wie LIBERO, RoboTwin2.0 und RoboDojo ab, von einarmigen und zweiarigen Formen bis hin zu mobiler Manipulation und Dexterous Hands. Im mobilen Zweiarm-Projekt von EBench ist es derzeit das beste und liegt etwa 4 Prozentpunkte vor dem Zweitplatzierten. In der Realmaschinen-Validierung absolvierte es mit einem Franka-Einarm sechs Aufgaben mit einer durchschnittlichen Erfolgsrate von 82,5 %, höher als LingBot-VA mit 77,5 % und π0.5 mit 55,0 %, wobei zwei Aufgaben 100 % erreichten. Mit einer zur Trainingszeit nie gesehenen Dexterous Hand übertraf es nach Feinabstimmung π0.5 ebenfalls durchgängig.
Es erklärt VLA nicht für erledigt
Im Paper gibt es eine Schlussfolgerung, die man gesondert hervorheben sollte: WAM nutzt latente Variablen zukünftiger Videos als Supervision und passt innerhalb der Verteilung besser; VLA ist bei Störungen außerhalb der Verteilung robuster. Wer gewinnt, ist noch nicht entschieden.
Dieser Satz ist viel ehrlicher als „ein Paradigma ist tot“. Wer Paper liest, merkt sich leicht nur die Punktzahlen, doch viel eher sollte man sich diesen Satz merken: Beide Routen haben derzeit ihre jeweiligen Stärken, und es ist noch nicht die Zeit für ein abschließendes Urteil.
Die Einstiegshürde wurde eine Stufe gesenkt
Im größeren Zusammenhang: Auf der Linie der Weltmodelle rief Googles Gemini Robotics 2 aus: „Ein Gehirn, anwendbar auf jeden Roboter“, und Nvidias Jim Fan warf ein: „VLA ist tot, es lebe das World-Action-Modell“. Am 3. Oktober erweiterte Nvidia den offenen Physical-AI-Stack und veröffentlichte gemeinsam das Cosmos-Weltmodell, Isaac Lab Arena, das Autonome-Fahren-Projekt Alpamayo, das Orchestrierungstool OSMO und die OpenUSD-Bibliothek; Caterpillar, LEM Surgical und Neura Robotics waren unter den ersten Nutzern. Am 4. Oktober liefen mehrere humanoide Roboter von Yunshenchu Technology in Hangzhou, Zhejiang, auf die Straße, um Verkehrsregelung an Kreuzungen und Touristenauskünfte zu testen – auch bei Regen.
Bei dieser Dichte bedeutet es, dass Hochschulen den Full-Stack-Unterbau als Open Source veröffentlichen, die Einstiegshürde für diese Richtung um eine Stufe senken und „mit Videos die Welt lernen, mit Trajektorien Aktionen lernen“ zu einer offeneren Route machen.
Es ist nicht für den direkten Einsatz gedacht
Klarzustellen ist: OpenWAM ist als Forschungsinfrastruktur positioniert, nicht als sofort einsatzbereites Produkt. Die offizielle README empfiehlt, etwa 640 GB Trainingsdaten vorzubereiten; die Umgebung umfasst etwa 6,5 GB, und das Repository wird weiterhin aktiv verändert. Es eignet sich für Teams, die bereits GPUs und Daten haben und darauf World-Action-Modell-Forschung betreiben wollen, nicht für Szenarien mit kleinem Produktiveinsatz.
Die konkreten Beobachtungspunkte für die Zukunft sind ebenfalls klar: Wie hoch ist die Reproduktionsrate dieses Stapels, wie viele Leute reichen nach einem halben Jahr noch Verbesserungen ein, und hat ein Team es tatsächlich in eine Produktlinie feinabgestimmt? Die Aufregung am Veröffentlichungstag wird verfliegen; bleiben werden die Codezeilen, die noch verwendet werden.
Verwandte Artikel
Eine Bundesrichterin nannte Flocks Kennzeichennetzwerk „wahllose Massenüberwachung“
Eine einzelne Sichtung eines Autos verrät wenig. Ein Monat aggregierter Sichtungen aus vielen Behörden offenbart ein Leben.
US-Bundesanwälte: Nvidia-Server im Wert von 300 Millionen Dollar gelangten über Malaysia nach China
Durchsetzungsfälle messen den Fluss, statt ihn zu stoppen, und die Transitroute ist der Teil, den die Politik nicht gelöst hat.
Supabase kauft Turso, weil Agenten eine Datenbank pro Aufgabe brauchen
Eine Datenbank pro Agent ergibt erst dann Sinn, wenn die kleinste Speichereinheit günstig genug ist, um sie wie ein Session-Token auszugeben.
Schauspieler haben einen Vertrag erhalten, der ihre digitalen Replikate reguliert. Der schwierige Teil ist die Durchsetzung.
Ein Vertrag kann definieren, was ein digitales Replikat ist. Zu beweisen, dass eines ohne Einwilligung erstellt wurde, ist ein anderes Problem.