← Retour au blog
AiEnviron 8 min de lecture

Reka Rho-1 place la compréhension et la génération dans le même cache KV

Publié le 6 oct. 2026
Reka Rho-1 place la compréhension et la génération dans le même cache KV

La plupart des systèmes multimodaux sont des pipelines. Un modèle de langage planifie, un modèle de diffusion effectue le rendu, un détecteur localise et un réseau de politique pilote le robot. Chaque transfert a un coût. L’état doit être sérialisé, déplacé entre les services et réencodé dans le format attendu par le composant suivant.

Rho-1 de Reka AI emprunte une autre voie. Ce modèle de 19 milliards de paramètres, publié le 5 octobre sous forme d’aperçu de recherche, traite le texte, les images, la vidéo et les actions robotiques au sein d’un seul réseau, le tout représenté sous forme de tokens dans une unique fenêtre de contexte. Il n’y a ni appels d’outils ni second modèle.

La démo rend la différence concrète. Un utilisateur demande une vue aérienne basse d’un phare rouge et blanc sur un promontoire rocheux. Rho-1 en fait le rendu. L’utilisateur demande une boîte autour du phare ; le modèle en dessine une. L’utilisateur demande de l’animer comme un survol de drone ; il génère une vidéo à partir de l’image qu’il vient de créer. L’utilisateur demande une tempête de neige tout en gardant un mouvement de caméra identique ; il modifie la vidéo. Enfin, l’utilisateur demande ce qui a changé entre les deux clips, et le modèle répond en texte.

Chaque étape de cette séquence dépend du fait que le modèle a toujours accès à ce qu’il a produit précédemment. Un pipeline classique devrait transmettre l’image et la vidéo entre les services et reconstruire le contexte à chaque frontière. Rho-1 le conserve dans le même contexte d’attention, ce qui permet à la chaîne de tenir.

Deux flux, un seul cache

L’architecture répartit chaque bloc transformer entre deux flux de poids experts qui partagent une opération d’attention. Un flux de compréhension traite le langage, les tokens de raisonnement internes et l’entrée visuelle, tandis qu’une tête de prédiction du token suivant produit une sortie discrète. Un flux de génération utilise une tête de flow matching pour débruiter des représentations latentes continues en images et en vidéos.

Les deux flux lisent depuis le même cache KV. Les instructions, le contenu visuel généré précédemment, les tokens de raisonnement et les commandes motrices restent tous disponibles. Un token spécial signale lorsqu’une réponse nécessite une génération visuelle, ce qui permet au flux de génération de continuer à partir de l’état accumulé plutôt que de repartir de zéro.

Une sphère de verre transparent contenant deux chambres lumineuses séparées, l’une ambre chaude et l’autre bleu froid

Le modèle transporte délibérément l’information sous deux formats. Les tokens discrets gèrent le texte et le raisonnement symbolique. Les représentations continues transportent les latents d’images, les images vidéo, les actions robotiques et la proprioception. Conserver les signaux physiques sous forme continue évite la perte de précision liée au fait de forcer les positions et vitesses articulaires dans un vocabulaire discret.

Ce dernier détail fait de l’argument de contrôle robotique autre chose qu’un slogan marketing. Les mêmes poids qui prédisent une image de caméra pilotent aussi le mouvement du robot, car les deux vivent dans le même espace de représentation.

Aborder la génération dans l’autre sens

Reka rapporte deux variantes. Le modèle de base utilise 99 étapes de débruitage et génère à un rythme médian de 0,79 fois le temps réel, la sortie en streaming commençant après environ six secondes. Une version distillée appelée Rho-1 Flash utilise huit étapes et renvoie un clip de 5,3 secondes en environ une seconde. Les modifications avec Flash re-rendent des clips d’environ une seconde en environ 1,1 seconde.

L’interface de streaming peut prolonger un clip depuis son état latent précédent et accepter de nouvelles instructions pendant la génération. Dans une démo aérienne, les commandes d’incliner à gauche et à droite arrivent une demi-seconde après le début du déroulé. Les branches obtenues partagent les mêmes images d’ouverture avant de diverger. C’est une véritable capacité si elle se confirme en dehors d’une démo contrôlée, car cela signifie qu’un réalisateur peut orienter un plan en cours de vol au lieu de tout régénérer à partir de zéro.

Pour contourner le manque de données d’entraînement robotiques, Reka a construit un modèle de dynamique inverse qui extrait les signaux de contrôle à partir de vidéos ordinaires trouvées sur Internet. Il a entraîné le squelette partagé sur 320 GPU H100 pendant environ trois mois, ce qui reste modeste comparé aux entraînements de pointe.

L’histoire de calcul mérite d’être soulignée. Entraîner un modèle de 19 milliards de paramètres sur 320 H100 pendant trois mois est une petite opération selon les standards de pointe, où les systèmes sont entraînés sur des dizaines de milliers d’accélérateurs. Si Rho-1 tient ne serait-ce qu’une fraction de sa promesse architecturale à cette échelle, cela suggère que la prochaine vague de capacités multimodales n’exigera pas un capital énorme, et que les petits laboratoires peuvent encore apporter des contributions structurelles plutôt que de rivaliser uniquement sur le calcul.

Où cela se situe dans la course aux modèles du monde

Rho-1 arrive dans une semaine chargée pour les modèles qui tentent de représenter l’évolution d’une scène. InSpatio a publié InSpatio-World 1.5, qui transforme une seule image, un panorama ou une vidéo en un monde 4D navigable et a dominé un benchmark de scènes dynamiques parmi les méthodes interactives en temps réel. Nvidia a mis Lyra 2.0 en open source, ce qui convertit une image en un environnement 3D explorable. Google et un ensemble de laboratoires chinois travaillent tous sur le même filon.

L’angle de Reka diffère de celui de la foule de la reconstruction. Ces projets construisent une scène dans laquelle on peut se déplacer. Rho-1 cherche à construire un modèle capable à la fois de décrire une scène et de la modifier à la demande, tout en produisant les commandes motrices pour agir dessus. Si cela fonctionne, le même checkpoint pourrait piloter un robot et raconter ce que le robot voit, sans réseau de politique séparé ni modèle vision-langage distinct.

L’argument robotique est le plus lourd de conséquences et le moins vérifié. Reka affirme que les mêmes poids qui prédisent les images de caméra pilotent aussi le mouvement du robot, et qu’il a construit un modèle de dynamique inverse pour extraire les signaux de contrôle de vidéos ordinaires sur Internet, car les données robotiques sont rares. Si l’approche tient, elle indique un moyen de contourner le principal goulot d’étranglement de l’IA incarnée : les trajectoires de robots réelles sont coûteuses à collecter et limitées en variété. Si ce n’est pas le cas, la fonction de contrôle robotique n’est qu’un clip de démo.

La publication compte aussi pour la façon dont ces systèmes sont tarifés. La plupart des produits multimodaux facturent séparément la planification, la génération d’images et la génération de vidéos, car chacun est un service différent. Un modèle unique qui réalise les trois dans une même fenêtre de contexte modifie l’économie unitaire de tout produit construit au-dessus. Savoir si cela se traduit par des prix plus bas dépend de l’efficacité avec laquelle le modèle unifié sert des requêtes simultanées, ce que des tests indépendants révéleraient précisément.

Les affirmations encore en suspens

Les chiffres de performance de Rho-1 proviennent de l’aperçu de Reka et ne peuvent pas encore être reproduits, car il n’existe ni poids publics ni API. La configuration matérielle, le batching, les réglages de sortie et les choix de compilation peuvent modifier la latence vidéo par de grands facteurs ; les chiffres d’efficacité doivent donc être répliqués indépendamment avant de signifier grand-chose.

Le modèle a des limites reconnues. La vidéo native est plafonnée à 672x384. La dérive structurelle sur longue durée, l’ancrage vidéo et la stabilité des modifications sont décrits comme des points faibles par l’entreprise elle-même. Ce sont les mêmes problèmes qui affectent tous les modèles du monde, et un réseau de 19 milliards de paramètres est peu susceptible de les avoir résolus d’emblée.

Cette publication s’inscrit dans un mouvement plus large vers les modèles du monde, où l’objectif est un système capable de prédire l’évolution d’une scène et d’agir sur cette prédiction. La contribution de Rho-1 est architecturale : il défend l’idée que la compréhension et la génération devraient partager les poids et le contexte plutôt que d’être assemblées. Savoir si cet argument l’emporte dépend de ce à quoi ressembleront les prochains aperçus de recherche d’autres laboratoires, et de la capacité de Reka à livrer quelque chose qu’un tiers peut tester.

Articles associés