Reka Rho-1 mette comprensione e generazione nella stessa KV cache

La maggior parte dei sistemi multimodali sono pipeline. Un modello linguistico pianifica, un modello di diffusione renderizza, un rilevatore localizza e una rete di policy guida il robot. Ogni passaggio ha un costo. Lo stato deve essere serializzato, spostato tra i servizi e ricodificato nel formato che il componente successivo si aspetta.
Rho-1 di Reka AI segue una strada diversa. Il modello da 19 miliardi di parametri, rilasciato il 5 ottobre come anteprima di ricerca, gestisce testo, immagini, video e azioni robotiche all'interno di un'unica rete, con tutto rappresentato come token in un'unica finestra di contesto. Non ci sono chiamate a strumenti e non c'è un secondo modello.
La demo rende concreta la differenza. Un utente chiede una veduta aerea bassa di un faro rosso e bianco su un promontorio roccioso. Rho-1 la renderizza. L'utente chiede un riquadro attorno al faro; il modello lo disegna. L'utente chiede di animarlo come un drone che si avvicina; genera un video dal fotogramma dell'immagine appena creata. L'utente chiede una tempesta di neve mantenendo identico il movimento della camera; modifica il video. Infine, l'utente chiede cosa è cambiato tra le due clip, e il modello risponde in testo.
Ogni passo di quella sequenza dipende dal fatto che il modello abbia ancora accesso a ciò che ha prodotto in precedenza. Una pipeline convenzionale dovrebbe passare l'immagine e il video tra i servizi e ricostruire il contesto a ogni confine. Rho-1 lo mantiene nello stesso contesto di attenzione, ed è per questo che la catena rimane coesa.
Due flussi, una cache
L'architettura divide ogni blocco transformer tra due flussi di pesi esperti che condividono un'operazione di attenzione. Un flusso di comprensione elabora linguaggio, token di ragionamento interno e input visivo, e una testa next-token emette output discreti. Un flusso di generazione usa una testa di flow-matching per il denoising di rappresentazioni latenti continue in immagini e video.
Entrambi i flussi leggono dalla stessa KV cache. Istruzioni, contenuti visivi generati in precedenza, token di ragionamento e comandi motori rimangono tutti disponibili. Un token speciale segnala quando una risposta necessita di generazione visiva, il che permette al flusso di generazione di continuare dallo stato accumulato invece di ricominciare da zero.

Il modello trasporta intenzionalmente informazioni in due formati. I token discreti gestiscono testo e ragionamento simbolico. Le rappresentazioni continue trasportano latenti di immagini, fotogrammi video, azioni robotiche e propriocezione. Mantenere i segnali fisici continui evita la perdita di precisione che deriva dal forzare posizioni e velocità articolari in un vocabolario discreto.
Quest'ultimo dettaglio è ciò che rende l'affermazione sul controllo robotico più di uno slogan di marketing. Gli stessi pesi che predicono un'immagine della telecamera guidano anche il movimento del robot, perché entrambi vivono nello stesso spazio rappresentazionale.
Affrontare la generazione dalla direzione opposta
Reka riporta due varianti. Il modello base usa 99 passaggi di denoising e genera a una velocità mediana di 0,79 volte il tempo reale, con output in streaming che inizia dopo circa sei secondi. Una versione distillata chiamata Rho-1 Flash usa otto passaggi e restituisce una clip di 5,3 secondi in circa un secondo. Le modifiche di Flash ri-renderizzano clip di circa un secondo in circa 1,1 secondi.
L'interfaccia in streaming può estendere una clip dal suo precedente stato latente e accettare nuove istruzioni durante la generazione. In una demo aerea, i comandi di virare a sinistra e virare a destra arrivano mezzo secondo dopo l'inizio del rollout. I rami risultanti condividono gli stessi fotogrammi iniziali prima di divergere. Questa è una capacità reale se regge al di fuori di una demo controllata, perché significa che un regista può guidare un'inquadratura in volo invece di rigenerare da zero.
Per aggirare la carenza di dati di addestramento robotici, Reka ha costruito un modello di dinamica inversa che estrae segnali di controllo da normali video di internet. Ha addestrato la backbone condivisa su 320 GPU H100 per circa tre mesi, il che è modesto rispetto ai run di frontiera.
La storia del calcolo merita enfasi. Addestrare un modello da 19 miliardi su 320 H100 per tre mesi è un run piccolo per gli standard di frontiera, dove i sistemi vengono addestrati su decine di migliaia di acceleratori. Se Rho-1 mantiene anche solo una frazione della sua promessa architetturale a quella scala, suggerisce che la prossima ondata di capacità multimodale non richiederà capitali enormi, e che i laboratori più piccoli possono ancora dare contributi strutturali invece di competere solo sul calcolo.
Dove si colloca nella corsa ai modelli del mondo
Rho-1 arriva in una settimana affollata per i modelli che cercano di rappresentare come evolve una scena. InSpatio ha rilasciato InSpatio-World 1.5, che trasforma una singola immagine, un panorama o un video in un mondo 4D navigabile e ha superato un benchmark di scene dinamiche tra i metodi interattivi in tempo reale. Nvidia ha reso open source Lyra 2.0, che converte un'immagine in un ambiente 3D esplorabile. Google e una serie di laboratori cinesi stanno tutti lavorando sulla stessa vena.
L'angolazione di Reka è diversa da quella della folla della ricostruzione. Quei progetti costruiscono una scena che puoi attraversare. Rho-1 cerca di costruire un modello che possa sia descrivere una scena sia modificarla su richiesta, emettendo anche i comandi motori per agire su di essa. Se funziona, lo stesso checkpoint potrebbe guidare un robot e narrare ciò che il robot vede, senza una rete di policy separata o un modello visione-linguaggio separato.
L'affermazione sulla robotica è la più rilevante e la meno verificata. Reka ha detto che gli stessi pesi che predicono le immagini della telecamera guidano anche il movimento del robot, e che ha costruito un modello di dinamica inversa per estrarre segnali di controllo da normali video di internet perché i dati robotici sono scarsi. Se l'approccio regge, indica una via per aggirare il più grande collo di bottiglia nell'AI incarnata, ovvero che le traiettorie robotiche reali sono costose da raccogliere e limitate in varietà. Se non regge, la funzione di controllo robotico è una clip dimostrativa.
Il rilascio conta anche per come questi sistemi vengono prezzati. La maggior parte dei prodotti multimodali addebita separatamente pianificazione, generazione di immagini e generazione di video, perché ciascuno è un servizio diverso. Un singolo modello che esegue tutti e tre in un'unica finestra di contesto cambia l'economia unitaria per qualsiasi prodotto costruito sopra. Se ciò si traduca in prezzi più bassi dipende da quanto efficientemente il modello unificato serve richieste concorrenti, che è esattamente ciò che un test indipendente rivelerebbe.
Le affermazioni ancora aperte
I dati sulle prestazioni di Rho-1 provengono dall'anteprima di Reka e non possono ancora essere riprodotti, perché non ci sono pesi pubblici o API. Configurazione hardware, batching, impostazioni di output e scelte di compilazione possono cambiare la latenza video di fattori elevati, quindi i numeri di efficienza necessitano di replica indipendente prima di avere un significato.
Il modello ha limiti ammessi. Il video nativo è limitato a 672x384. Deriva strutturale a lungo orizzonte, grounding video e stabilità delle modifiche sono descritti come punti deboli dall'azienda stessa. Questi sono gli stessi problemi che affliggono ogni modello del mondo, ed è improbabile che una rete da 19 miliardi li abbia risolti del tutto.
Il rilascio si inserisce in un più ampio spostamento verso i modelli del mondo, dove l'obiettivo è un sistema che possa predire come evolve una scena e agire su quella previsione. Il contributo di Rho-1 è architetturale: sostiene che comprensione e generazione dovrebbero condividere pesi e contesto invece di essere cucite insieme. Se quell'argomentazione vincerà dipende da come saranno le prossime anteprime di ricerca di altri laboratori, e se Reka rilascerà qualcosa che una terza parte possa testare.
Articoli correlati
BOSSFIGHT ha messo i modelli frontier a gestire caffetterie per 24 settimane. La maggior parte ha perso contro il non fare nulla.
Resistere a una tangente in un quiz e rifiutarsi di piegarsi in un trimestre reale sono due abilità diverse, e le valutazioni attuali tendono a misurare quella più facile.
NASA e IBM hanno reso open source un modello fondativo lunare addestrato su 17 anni di dati in orbita
Il modello è utile per individuare e caratterizzare le caratteristiche del terreno, ma inaffidabile nel dire con alta precisione dove si trovino esattamente.
Quattro passaggi invece di quaranta: come la distillazione sta comprimendo i modelli open di immagini sulle GPU consumer
La distillazione a basso numero di passaggi è uno scambio, non un pranzo gratis. Fedeltà del testo, precisione di editing e coerenza multi-riferimento sono le prime cose a soffrire.
Questa settimana gli agenti hanno iniziato a dirigere cortometraggi. Il collo di bottiglia si è spostato sul controllo qualità.
La generazione è economica, l'orchestrazione è il prodotto, e ciò che decide se una pipeline è utile è se sa riconoscere quando ha fallito.