Reka Rho-1 pone la comprensión y la generación en la misma caché KV

La mayoría de los sistemas multimodales son canalizaciones. Un modelo de lenguaje planifica, un modelo de difusión renderiza, un detector localiza y una red de política controla el robot. Cada traspaso tiene un coste. El estado debe serializarse, moverse entre servicios y recodificarse en el formato que espere el siguiente componente.
Rho-1 de Reka AI toma una ruta diferente. El modelo de 19 mil millones de parámetros, publicado el 5 de octubre como vista previa de investigación, maneja texto, imágenes, vídeo y acciones de robot dentro de una sola red, con todo representado como tokens en una única ventana de contexto. No hay llamadas a herramientas ni un segundo modelo.
La demostración concreta la diferencia. Un usuario pide una vista aérea baja de un faro rojo y blanco en un promontorio rocoso. Rho-1 la genera. El usuario pide un recuadro alrededor del faro; lo dibuja. El usuario pide animarlo como un sobrevuelo de dron; genera vídeo a partir del fotograma de la imagen que acaba de crear. El usuario pide una tormenta de nieve manteniendo idéntico el movimiento de cámara; edita el vídeo. Por último, el usuario pregunta qué cambió entre los dos clips, y el modelo responde en texto.
Cada paso de esa secuencia depende de que el modelo siga teniendo acceso a lo que produjo antes. Una canalización convencional tendría que pasar la imagen y el vídeo entre servicios y reconstruir el contexto en cada límite. Rho-1 lo mantiene en el mismo contexto de atención, y por eso la cadena se mantiene unida.
Dos flujos, una caché
La arquitectura divide cada bloque transformer entre dos flujos de pesos expertos que comparten una operación de atención. Un flujo de comprensión procesa lenguaje, tokens de razonamiento internos y entrada visual, y una cabeza de siguiente token emite salida discreta. Un flujo de generación usa una cabeza de flow matching para eliminar el ruido de representaciones latentes continuas y convertirlas en imágenes y vídeo.
Ambos flujos leen de la misma caché KV. Las instrucciones, el contenido visual generado previamente, los tokens de razonamiento y los comandos motores permanecen disponibles. Un token especial señala cuándo una respuesta necesita generación visual, lo que permite que el flujo de generación continúe desde el estado acumulado en lugar de empezar de cero.

El modelo transporta información en dos formatos a propósito. Los tokens discretos manejan texto y razonamiento simbólico. Las representaciones continuas llevan latentes de imagen, fotogramas de vídeo, acciones de robot y propiocepción. Mantener las señales físicas continuas evita la pérdida de precisión que proviene de forzar posiciones y velocidades articulares dentro de un vocabulario discreto.
Ese último detalle es lo que hace que la afirmación sobre el control de robots sea más que una frase de marketing. Los mismos pesos que predicen una imagen de cámara también impulsan el movimiento del robot, porque ambos viven en el mismo espacio de representación.
Abordar la generación desde la otra dirección
Reka informa de dos variantes. El modelo base usa 99 pasos de eliminación de ruido y genera a una tasa mediana de 0,79 veces el tiempo real, con salida en streaming que comienza tras unos seis segundos. Una versión destilada llamada Rho-1 Flash usa ocho pasos y devuelve un clip de 5,3 segundos en alrededor de un segundo. Las ediciones de Flash vuelven a renderizar clips de aproximadamente un segundo en unos 1,1 segundos.
La interfaz de streaming puede extender un clip desde su estado latente anterior y aceptar nuevas instrucciones durante la generación. En una demostración aérea, los comandos de girar a la izquierda y girar a la derecha llegan medio segundo después del inicio del rollout. Las ramas resultantes comparten los mismos fotogramas iniciales antes de divergir. Es una capacidad real si se mantiene fuera de una demo controlada, porque significa que un director puede dirigir un plano en pleno vuelo en lugar de regenerarlo desde cero.
Para sortear la escasez de datos de entrenamiento de robots, Reka construyó un modelo de dinámica inversa que extrae señales de control de vídeo común de internet. Entrenó la columna vertebral compartida en 320 GPU H100 durante unos tres meses, lo cual es modesto en comparación con las ejecuciones de frontera.
La historia de cómputo merece énfasis. Entrenar un modelo de 19B en 320 H100 durante tres meses es una ejecución pequeña para los estándares de frontera, donde los sistemas se entrenan con decenas de miles de aceleradores. Si Rho-1 entrega aunque sea una fracción de su promesa arquitectónica a esa escala, sugiere que la próxima oleada de capacidad multimodal no requerirá un capital enorme, y que los laboratorios más pequeños aún pueden hacer contribuciones estructurales en lugar de competir solo por cómputo.
Dónde encaja esto en la carrera de los modelos del mundo
Rho-1 llega en una semana concurrida para los modelos que intentan representar cómo evoluciona una escena. InSpatio lanzó InSpatio-World 1.5, que convierte una sola imagen, panorama o vídeo en un mundo 4D navegable y encabezó un benchmark de escenas dinámicas entre métodos interactivos en tiempo real. Nvidia liberó como open source Lyra 2.0, que convierte una imagen en un entorno 3D explorable. Google y un conjunto de laboratorios chinos están trabajando en la misma veta.
El ángulo de Reka es distinto del de la multitud de reconstrucción. Esos proyectos construyen una escena por la que puedes moverte. Rho-1 intenta construir un modelo que pueda tanto describir una escena como cambiarla a petición, mientras también emite los comandos motores para actuar sobre ella. Si eso funciona, el mismo checkpoint podría controlar un robot y narrar lo que el robot ve, sin una red de política separada ni un modelo visión-lenguaje separado.
La afirmación sobre robótica es la más trascendental y la menos verificada. Reka dijo que los mismos pesos que predicen imágenes de cámara también impulsan el movimiento del robot, y que construyó un modelo de dinámica inversa para extraer señales de control de vídeo común de internet porque los datos de robots son escasos. Si el enfoque se sostiene, apunta a una forma de sortear el mayor cuello de botella de la IA encarnada, que es que las trayectorias reales de robots son caras de recopilar y limitadas en variedad. Si no, la función de control de robots es un clip de demo.
El lanzamiento también importa para cómo se fijan los precios de estos sistemas. La mayoría de los productos multimodales cobran por separado por planificación, generación de imágenes y generación de vídeo, porque cada una es un servicio diferente. Un único modelo que realiza las tres cosas en una sola ventana de contexto cambia la economía unitaria de cualquier producto construido encima. Que eso se traduzca en precios más bajos depende de la eficiencia con que el modelo unificado atienda solicitudes concurrentes, que es exactamente lo que revelarían las pruebas independientes.
Las afirmaciones que siguen abiertas
Las cifras de rendimiento de Rho-1 provienen de la vista previa de Reka y aún no pueden reproducirse, porque no hay pesos públicos ni API. La configuración de hardware, el batching, los ajustes de salida y las decisiones de compilación pueden cambiar la latencia de vídeo por factores grandes, así que los números de eficiencia necesitan replicación independiente antes de significar mucho.
El modelo tiene límites admitidos. El vídeo nativo está limitado a 672x384. La deriva estructural a largo plazo, el grounding de vídeo y la estabilidad de edición son descritos como puntos débiles por la propia compañía. Son los mismos problemas que aquejan a todos los modelos del mundo, y es poco probable que una red de 19B los haya resuelto de plano.
El lanzamiento encaja en un cambio más amplio hacia los modelos del mundo, donde el objetivo es un sistema que pueda predecir cómo evoluciona una escena y actuar sobre esa predicción. La contribución de Rho-1 es arquitectónica: sostiene que la comprensión y la generación deberían compartir pesos y contexto en lugar de coserse juntas. Que ese argumento gane depende de cómo sean las próximas vistas previas de investigación de otros laboratorios, y de si Reka lanza algo que un tercero pueda probar.
Artículos relacionados
BOSSFIGHT hizo que modelos frontera dirigieran cafeterías durante 24 semanas. La mayoría perdió frente a no hacer nada.
Resistir un soborno en un cuestionario y negarse a ceder en un trimestre real son dos habilidades distintas, y las evaluaciones actuales tienden a medir la más fácil.
La NASA e IBM publicaron como código abierto un modelo fundacional lunar entrenado con 17 años de datos de orbitadores
El modelo es útil para encontrar y caracterizar características, y poco fiable para decir exactamente dónde están con alta precisión.
Cuatro pasos en lugar de cuarenta: cómo la destilación está comprimiendo los modelos de imagen abiertos para que quepan en las GPU de consumo
La destilación de pocos pasos es un intercambio, no un almuerzo gratis. La fidelidad del texto, la precisión de edición y la consistencia con múltiples referencias son las primeras cosas que se resienten.
Los agentes empezaron a dirigir cortometrajes esta semana. El cuello de botella se trasladó al control de calidad.
La generación es barata, la orquestación es el producto, y lo que decide si un pipeline es útil es si puede saber cuándo ha fallado.