Reka Rho-1 coloca compreensão e geração no mesmo cache KV

A maioria dos sistemas multimodais são pipelines. Um modelo de linguagem planeja, um modelo de difusão renderiza, um detector localiza e uma rede de política controla o robô. Cada transferência tem um custo. O estado precisa ser serializado, movido entre serviços e recodificado para qualquer formato que o próximo componente espere.
O Rho-1 da Reka AI segue um caminho diferente. O modelo de 19 bilhões de parâmetros, lançado em 5 de outubro como uma prévia de pesquisa, lida com texto, imagens, vídeo e ações robóticas dentro de uma única rede, com tudo representado como tokens em uma única janela de contexto. Não há chamadas de ferramentas nem um segundo modelo.
A demonstração torna a diferença concreta. Um usuário pede uma vista aérea baixa de um farol vermelho e branco em um promontório rochoso. O Rho-1 renderiza isso. O usuário pede uma caixa ao redor do farol; ele desenha uma. O usuário pede para animá-lo como uma aproximação de drone; ele gera vídeo a partir do quadro da imagem que acabou de criar. O usuário pede uma tempestade de neve mantendo o movimento de câmera idêntico; ele edita o vídeo. Por fim, o usuário pergunta o que mudou entre os dois clipes, e o modelo responde em texto.
Cada etapa dessa sequência depende de o modelo ainda ter acesso ao que produziu antes. Um pipeline convencional teria que passar a imagem e o vídeo entre serviços e reconstruir o contexto em cada limite. O Rho-1 mantém isso no mesmo contexto de atenção, e é por isso que a cadeia se sustenta.
Dois fluxos, um cache
A arquitetura divide cada bloco transformer entre dois fluxos de pesos especialistas que compartilham uma operação de atenção. Um fluxo de compreensão processa linguagem, tokens de raciocínio internos e entrada visual, e uma cabeça de próximo token emite saída discreta. Um fluxo de geração usa uma cabeça de flow matching para remover ruído de representações latentes contínuas em imagens e vídeo.
Ambos os fluxos leem do mesmo cache KV. Instruções, conteúdo visual gerado anteriormente, tokens de raciocínio e comandos motores permanecem todos disponíveis. Um token especial sinaliza quando uma resposta precisa de geração visual, o que permite que o fluxo de geração continue a partir do estado acumulado em vez de começar do zero.

O modelo carrega informações em dois formatos de propósito. Tokens discretos lidam com texto e raciocínio simbólico. Representações contínuas carregam latentes de imagem, quadros de vídeo, ações robóticas e propriocepção. Manter sinais físicos contínuos evita a perda de precisão que vem de forçar posições e velocidades de juntas em um vocabulário discreto.
Esse último detalhe é o que torna a alegação de controle robótico mais do que uma frase de marketing. Os mesmos pesos que preveem uma imagem de câmera também controlam o movimento do robô, porque ambos vivem no mesmo espaço representacional.
Abordando a geração por outro caminho
A Reka relata duas variantes. O modelo base usa 99 etapas de remoção de ruído e gera a uma taxa mediana de 0,79 vezes o tempo real, com saída em streaming começando após cerca de seis segundos. Uma versão destilada chamada Rho-1 Flash usa oito etapas e retorna um clipe de 5,3 segundos em cerca de um segundo. As edições do Flash renderizam novamente clipes de aproximadamente um segundo em cerca de 1,1 segundo.
A interface de streaming pode estender um clipe a partir de seu estado latente anterior e aceitar novas instruções durante a geração. Em uma demonstração aérea, comandos para inclinar à esquerda e à direita chegam meio segundo após o início da geração. Os ramos resultantes compartilham os mesmos quadros iniciais antes de divergirem. Isso é uma capacidade real se se mantiver fora de uma demonstração controlada, porque significa que um diretor pode direcionar uma tomada em pleno voo em vez de regenerar do zero.
Para contornar a escassez de dados de treinamento de robôs, a Reka construiu um modelo de dinâmica inversa que extrai sinais de controle de vídeos comuns da internet. Ele treinou o backbone compartilhado em 320 GPUs H100 ao longo de cerca de três meses, o que é modesto em comparação com treinamentos de ponta.
O aspecto computacional merece ênfase. Treinar um modelo de 19B em 320 H100s por três meses é um treinamento pequeno para os padrões de ponta, em que sistemas são treinados em dezenas de milhares de aceleradores. Se o Rho-1 entregar nem que seja uma fração de sua promessa arquitetural nessa escala, isso sugere que a próxima onda de capacidade multimodal não exigirá capital enorme, e que laboratórios menores ainda podem fazer contribuições estruturais em vez de competir apenas em poder computacional.
Onde isso se encaixa na corrida dos modelos de mundo
O Rho-1 chega em uma semana movimentada para modelos que tentam representar como uma cena evolui. A InSpatio lançou o InSpatio-World 1.5, que transforma uma única imagem, panorama ou vídeo em um mundo 4D navegável e liderou um benchmark de cenas dinâmicas entre métodos interativos em tempo real. A Nvidia tornou o Lyra 2.0 open source, que converte uma imagem em um ambiente 3D explorável. O Google e um conjunto de laboratórios chineses estão todos trabalhando na mesma frente.
A abordagem da Reka é diferente da ala da reconstrução. Esses projetos constroem uma cena pela qual você pode se mover. O Rho-1 tenta construir um modelo que possa tanto descrever uma cena quanto alterá-la sob demanda, além de emitir os comandos motores para agir sobre ela. Se isso funcionar, o mesmo checkpoint poderia controlar um robô e narrar o que o robô vê, sem uma rede de política separada ou um modelo de visão-linguagem separado.
A alegação sobre robótica é a de maior impacto e a menos verificada. A Reka disse que os mesmos pesos que preveem imagens de câmera também controlam o movimento do robô, e que construiu um modelo de dinâmica inversa para extrair sinais de controle de vídeos comuns da internet porque dados de robôs são escassos. Se a abordagem se sustentar, ela aponta um caminho para contornar o maior gargalo da IA incorporada, que é o fato de trajetórias reais de robôs serem caras de coletar e limitadas em variedade. Se não, o recurso de controle robótico é um clipe de demonstração.
O lançamento também importa para como esses sistemas são precificados. A maioria dos produtos multimodais cobra separadamente por planejamento, geração de imagens e geração de vídeo, porque cada um é um serviço diferente. Um único modelo que executa os três em uma janela de contexto muda a economia unitária de qualquer produto construído sobre ele. Se isso se traduz em preços mais baixos depende de quão eficientemente o modelo unificado atende a solicitações simultâneas, que é exatamente o que testes independentes revelariam.
As alegações que ainda estão em aberto
Os números de desempenho do Rho-1 vêm da prévia da Reka e ainda não podem ser reproduzidos, porque não há pesos públicos nem API. Configuração de hardware, processamento em lote, configurações de saída e escolhas de compilação podem alterar a latência de vídeo em grandes fatores, então os números de eficiência precisam de replicação independente antes de significarem muito.
O modelo tem limites admitidos. O vídeo nativo é limitado a 672x384. Deriva estrutural de longo horizonte, ancoragem em vídeo e estabilidade de edição são descritos como pontos fracos pela própria empresa. Esses são os mesmos problemas que assolam todo modelo de mundo, e é improvável que uma rede de 19B os tenha resolvido por completo.
O lançamento se encaixa em uma mudança mais ampla em direção a modelos de mundo, em que o objetivo é um sistema que possa prever como uma cena evolui e agir com base nessa previsão. A contribuição do Rho-1 é arquitetural: ele argumenta que compreensão e geração deveriam compartilhar pesos e contexto em vez de serem costuradas juntas. Se esse argumento vencer depende de como serão as próximas prévias de pesquisa de outros laboratórios, e de se a Reka lançará algo que terceiros possam testar.
Artigos relacionados
BOSSFIGHT fez modelos de fronteira atuarem como donos de cafeteria por 24 semanas. A maioria perdeu para o não fazer nada.
Resistir a um suborno em um questionário e recusar-se a ceder em um trimestre real são duas habilidades diferentes, e as avaliações atuais tendem a medir a mais fácil.
NASA e IBM disponibilizam em código aberto um modelo de fundação lunar treinado com 17 anos de dados de orbitadores
O modelo é útil para encontrar e caracterizar feições, e não é confiável para dizer exatamente onde elas estão com alta precisão.
Quatro passos em vez de quarenta: como a destilação está comprimindo modelos de imagem abertos para GPUs de consumidor
A destilação de poucos passos é uma troca, não um almoço grátis. A fidelidade de texto, a precisão de edição e a consistência entre múltiplas referências são as primeiras coisas a sofrer.
Agentes começaram a dirigir curtas-metragens nesta semana. O gargalo passou para o controle de qualidade.
A geração é barata, a orquestração é o produto, e o que decide se um pipeline é útil é se ele consegue perceber quando falhou.