Reka Rho-1 vereint Verständnis und Generierung im selben KV-Cache

Die meisten multimodalen Systeme sind Pipelines. Ein Sprachmodell plant, ein Diffusionsmodell rendert, ein Detektor lokalisiert und ein Policy-Netzwerk steuert den Roboter. Jede Übergabe kostet. Der Zustand muss serialisiert, zwischen Diensten verschoben und in das Format neu kodiert werden, das die nächste Komponente erwartet.
Reka AIs Rho-1 geht einen anderen Weg. Das Modell mit 19 Milliarden Parametern, am 5. Oktober als Research Preview veröffentlicht, verarbeitet Text, Bilder, Video und Roboteraktionen in einem einzigen Netzwerk, wobei alles als Tokens in einem einzigen Kontextfenster dargestellt wird. Es gibt keine Tool-Aufrufe und kein zweites Modell.
Die Demo macht den Unterschied konkret. Ein Nutzer bittet um eine niedrige Luftaufnahme eines rot-weißen Leuchtturms auf einer felsigen Landzunge. Rho-1 rendert sie. Der Nutzer bittet um einen Rahmen um den Leuchtturm; das Modell zeichnet einen. Der Nutzer bittet darum, das Ganze als Drohnen-Fly-in zu animieren; das Modell generiert ein Video aus dem Einzelbild des Bildes, das es gerade erstellt hat. Der Nutzer wünscht einen Schneesturm, während die Kamerabewegung identisch bleibt; das Modell bearbeitet das Video. Schließlich fragt der Nutzer, was sich zwischen den beiden Clips verändert hat, und das Modell antwortet in Textform.
Jeder Schritt in dieser Sequenz hängt davon ab, dass das Modell weiterhin Zugriff auf das hat, was es zuvor erzeugt hat. Eine konventionelle Pipeline müsste Bild und Video zwischen Diensten weiterreichen und den Kontext an jeder Grenze rekonstruieren. Rho-1 behält ihn im selben Attention-Kontext, weshalb die Kette zusammenhält.
Zwei Streams, ein Cache
Die Architektur teilt jeden Transformer-Block zwischen zwei Experten-Gewichtsströmen auf, die sich eine Attention-Operation teilen. Ein Verständnis-Stream verarbeitet Sprache, interne Reasoning-Tokens und visuelle Eingaben, und ein Next-Token-Head gibt diskrete Ausgaben aus. Ein Generierungs-Stream nutzt einen Flow-Matching-Head, um kontinuierliche latente Repräsentationen zu Bildern und Videos zu ent-rauschen.
Beide Streams lesen aus demselben KV-Cache. Anweisungen, zuvor generierte visuelle Inhalte, Reasoning-Tokens und Motorbefehle bleiben alle verfügbar. Ein spezielles Token signalisiert, wann eine Antwort visuelle Generierung erfordert, wodurch der Generierungs-Stream aus dem angesammelten Zustand fortsetzen kann, statt neu zu beginnen.

Das Modell trägt Informationen bewusst in zwei Formaten. Diskrete Tokens übernehmen Text und symbolisches Reasoning. Kontinuierliche Repräsentationen tragen Bild-Latents, Videoframes, Roboteraktionen und Propriozeption. Physische Signale kontinuierlich zu halten, vermeidet den Präzisionsverlust, der entsteht, wenn man Gelenkpositionen und -geschwindigkeiten in ein diskretes Vokabular zwingt.
Genau dieses letzte Detail macht die Behauptung zur Robotersteuerung zu mehr als einer Marketingzeile. Dieselben Gewichte, die ein Kamerabild vorhersagen, steuern auch die Roboterbewegung, weil beide im selben Repräsentationsraum leben.
Der Generierung von der anderen Seite begegnen
Reka nennt zwei Varianten. Das Basismodell verwendet 99 Denoising-Schritte und generiert mit einer Medianrate vom 0,79-Fachen der Echtzeit, wobei die Streaming-Ausgabe nach etwa sechs Sekunden beginnt. Eine destillierte Version namens Rho-1 Flash nutzt acht Schritte und liefert einen 5,3-Sekunden-Clip in etwa einer Sekunde. Flash-Edits rendern etwa einsekündige Clips in rund 1,1 Sekunden neu.
Die Streaming-Schnittstelle kann einen Clip aus seinem vorherigen latenten Zustand verlängern und während der Generierung neue Anweisungen annehmen. In einer Luftaufnahmen-Demo treffen die Befehle zum Links- und Rechtsrollen eine halbe Sekunde nach Beginn des Rollouts ein. Die resultierenden Zweige teilen dieselben Anfangsframes, bevor sie auseinanderlaufen. Das ist eine echte Fähigkeit, wenn sie außerhalb einer kontrollierten Demo Bestand hat, denn sie bedeutet, dass ein Regisseur eine Aufnahme mitten im Flug steuern kann, statt von Grund auf neu zu generieren.
Um den Mangel an Roboter-Trainingsdaten zu umgehen, baute Reka ein inverses Dynamikmodell, das Steuersignale aus gewöhnlichen Internetvideos extrahiert. Das geteilte Backbone wurde auf 320 H100-GPUs über etwa drei Monate trainiert, was im Vergleich zu Frontier-Läufen bescheiden ist.
Die Compute-Geschichte verdient Betonung. Ein 19B-Modell drei Monate lang auf 320 H100s zu trainieren, ist nach Frontier-Maßstäben ein kleiner Lauf, wo Systeme auf Zehntausenden von Beschleunigern trainiert werden. Wenn Rho-1 auch nur einen Bruchteil seines architektonischen Versprechens in diesem Maßstab einlöst, deutet das darauf hin, dass die nächste Welle multimodaler Fähigkeiten kein enormes Kapital erfordern wird und dass kleinere Labs weiterhin strukturelle Beiträge leisten können, statt nur über Compute zu konkurrieren.
Wo das im Wettlauf um Weltmodelle einzuordnen ist
Rho-1 erscheint in einer vollen Woche für Modelle, die darzustellen versuchen, wie sich eine Szene entwickelt. InSpatio veröffentlichte InSpatio-World 1.5, das ein einzelnes Bild, ein Panorama oder ein Video in eine navigierbare 4D-Welt verwandelt und in einem Benchmark für dynamische Szenen unter Echtzeit-interaktiven Methoden den ersten Platz belegte. Nvidia hat Lyra 2.0 als Open Source veröffentlicht, das ein Bild in eine erkundbare 3D-Umgebung umwandelt. Google und eine Reihe chinesischer Labore arbeiten an derselben Naht.
Rekas Ansatz unterscheidet sich von der Rekonstruktions-Fraktion. Jene Projekte bauen eine Szene, durch die man sich bewegen kann. Rho-1 versucht, ein Modell zu bauen, das eine Szene sowohl beschreiben als auch auf Anfrage verändern kann und zugleich die Motorbefehle ausgibt, um auf sie einzuwirken. Wenn das funktioniert, könnte derselbe Checkpoint einen Roboter steuern und erzählen, was der Roboter sieht – ohne separates Policy-Netzwerk oder separates Vision-Language-Modell.
Die Robotik-Behauptung ist die folgenreichste und die am wenigsten verifizierte. Reka sagte, dieselben Gewichte, die Kamerabilder vorhersagen, steuern auch die Roboterbewegung, und dass man ein inverses Dynamikmodell gebaut habe, um Steuersignale aus gewöhnlichen Internetvideos zu ziehen, weil Roboterdaten knapp sind. Wenn der Ansatz Bestand hat, weist er einen Weg um den größten Engpass in der verkörperten KI herum: dass echte Roboter-Trajektorien teuer zu sammeln und in ihrer Vielfalt begrenzt sind. Wenn nicht, ist die Robotersteuerungs-Funktion ein Demo-Clip.
Die Veröffentlichung ist auch dafür relevant, wie diese Systeme bepreist werden. Die meisten multimodalen Produkte berechnen Planung, Bildgenerierung und Videogenerierung getrennt, weil jedes ein anderer Dienst ist. Ein einzelnes Modell, das alle drei in einem Kontextfenster ausführt, verändert die Unit Economics für jedes darauf aufbauende Produkt. Ob sich das in niedrigeren Preisen niederschlägt, hängt davon ab, wie effizient das vereinheitlichte Modell gleichzeitige Anfragen bedient – genau das würde unabhängiges Testen zeigen.
Die Behauptungen, die noch offen sind
Rho-1s Leistungswerte stammen aus Rekas Preview und lassen sich noch nicht reproduzieren, da es keine öffentlichen Gewichte oder API gibt. Hardware-Konfiguration, Batching, Ausgabeeinstellungen und Compiler-Entscheidungen können die Video-Latenz um große Faktoren verändern, weshalb die Effizienzzahlen eine unabhängige Replikation brauchen, bevor sie viel bedeuten.
Das Modell hat eingeräumte Grenzen. Natives Video ist auf 672x384 begrenzt. Langfristige strukturelle Drift, Video-Grounding und Bearbeitungsstabilität werden vom Unternehmen selbst als Schwachpunkte beschrieben. Das sind dieselben Probleme, die jedes Weltmodell plagen, und ein 19B-Netzwerk hat sie kaum vollständig gelöst.
Die Veröffentlichung fügt sich in eine breitere Verschiebung hin zu Weltmodellen ein, bei der das Ziel ein System ist, das vorhersagen kann, wie sich eine Szene entwickelt, und auf dieser Vorhersage handeln kann. Rho-1s Beitrag ist architektonischer Natur: Es argumentiert, dass Verständnis und Generierung Gewichte und Kontext teilen sollten, statt zusammengenäht zu werden. Ob dieses Argument gewinnt, hängt davon ab, wie die nächsten Research Previews anderer Labore aussehen und ob Reka etwas ausliefert, das Dritte testen können.
Verwandte Artikel
BOSSFIGHT ließ Frontier-Modelle 24 Wochen lang als Cafébesitzer antreten. Die meisten verloren gegen Nichtstun.
Eine Bestechung in einem Quiz abzulehnen und sich in einem laufenden Quartal nicht verbiegen zu lassen, sind zwei verschiedene Fähigkeiten, und aktuelle Evaluationen neigen dazu, die einfachere zu messen.
NASA und IBM haben ein lunares Foundation-Modell als Open Source veröffentlicht, das mit 17 Jahren Orbiter-Daten trainiert wurde
Das Modell ist nützlich, um Merkmale zu finden und zu charakterisieren, und unzuverlässig, wenn es darum geht, mit hoher Präzision genau anzugeben, wo sie sich befinden.
Vier Schritte statt vierzig: Wie Destillation offene Bildmodelle auf Consumer-GPUs quetscht
Low-Step-Destillation ist ein Kompromiss, kein kostenloses Mittagessen. Texttreue, Bearbeitungspräzision und Multi-Referenz-Konsistenz leiden zuerst.
Agenten begannen diese Woche, Kurzfilme zu inszenieren. Der Engpass verlagerte sich zur Qualitätskontrolle.
Generierung ist billig, Orchestrierung ist das Produkt, und was entscheidet, ob eine Pipeline nützlich ist, ist, ob sie erkennen kann, wann sie versagt hat.