← 블로그로
Ai약 13 분 읽기

Reka Rho-1, 이해와 생성을 동일한 KV 캐시에 담다

게시일 2026년 10월 6일
Reka Rho-1, 이해와 생성을 동일한 KV 캐시에 담다

대부분의 멀티모달 시스템은 파이프라인입니다. 언어 모델이 계획하고, 확산 모델이 렌더링하고, 검출기가 위치를 찾고, 정책 네트워크가 로봇을 구동합니다. 각각의 핸드오프에는 비용이 따릅니다. 상태는 직렬화되어 서비스 간에 이동하고, 다음 구성 요소가 기대하는 형식으로 다시 인코딩되어야 합니다.

Reka AI의 Rho-1은 다른 경로를 택합니다. 10월 5일 연구 프리뷰로 공개된 190억 매개변수 모델은 텍스트, 이미지, 비디오, 로봇 동작을 하나의 네트워크 안에서 처리하며, 모든 것이 단일 컨텍스트 윈도우 안의 토큰으로 표현됩니다. 도구 호출도, 두 번째 모델도 없습니다.

데모는 그 차이를 구체적으로 보여줍니다. 사용자가 바위 곶 위의 빨간색과 흰색 등대를 낮은 항공 뷰로 요청합니다. Rho-1이 이를 렌더링합니다. 사용자가 등대 주위에 상자를 그려 달라고 요청하면, 상자를 그립니다. 사용자가 드론이 날아드는 것처럼 애니메이션화해 달라고 요청하면, 방금 만든 이미지의 프레임에서 비디오를 생성합니다. 사용자가 카메라 움직임은 동일하게 유지하면서 눈보라를 추가해 달라고 요청하면, 비디오를 편집합니다. 마지막으로 사용자가 두 클립 사이에 무엇이 바뀌었는지 묻자, 모델이 텍스트로 답합니다.

그 순서의 모든 단계는 모델이 이전에 생성한 것에 여전히 접근할 수 있는지에 달려 있습니다. 기존 파이프라인이라면 이미지와 비디오를 서비스 간에 전달하고 각 경계에서 컨텍스트를 재구성해야 합니다. Rho-1은 이를 동일한 어텐션 컨텍스트에 유지하므로, 이 체인이 유지됩니다.

두 개의 스트림, 하나의 캐시

아키텍처는 각 트랜스포머 블록을 어텐션 연산을 공유하는 두 개의 전문가 가중치 스트림으로 나눕니다. 이해 스트림은 언어, 내부 추론 토큰, 시각 입력을 처리하고, 다음 토큰 헤드는 이산 출력을 내보냅니다. 생성 스트림은 플로우 매칭 헤드를 사용해 연속 잠재 표현을 이미지와 비디오로 디노이즈합니다.

두 스트림 모두 동일한 KV 캐시에서 읽습니다. 지시사항, 이전에 생성된 시각 콘텐츠, 추론 토큰, 모터 명령이 모두 사용 가능한 상태로 남아 있습니다. 특수 토큰은 응답에 시각 생성이 필요할 때를 알리며, 이를 통해 생성 스트림은 처음부터 시작하는 대신 누적된 상태에서 이어갈 수 있습니다.

하나의 맑은 유리 구체 안에 두 개의 분리된 빛나는 방이 있으며, 하나는 따뜻한 호박색이고 다른 하나는 차가운 파란색

모델은 의도적으로 두 가지 형식으로 정보를 운반합니다. 이산 토큰은 텍스트와 기호 추론을 처리합니다. 연속 표현은 이미지 잠재, 비디오 프레임, 로봇 동작, 고유수용감각을 담습니다. 물리적 신호를 연속적으로 유지하면 관절 위치와 속도를 이산 어휘에 강제로 넣을 때 발생하는 정밀도 손실을 피할 수 있습니다.

그 마지막 세부 사항이 로봇 제어 주장을 단순한 마케팅 문구 이상으로 만듭니다. 카메라 이미지를 예측하는 동일한 가중치가 로봇 움직임도 구동합니다. 둘 다 같은 표현 공간에 존재하기 때문입니다.

다른 방향에서 생성에 접근하다

Reka는 두 가지 변형을 보고합니다. 기본 모델은 99개의 디노이징 단계를 사용하고 실시간의 0.79배 중앙값 속도로 생성하며, 스트리밍 출력은 약 6초 후에 시작됩니다. Rho-1 Flash라는 증류 버전은 8단계를 사용하고 약 1초 만에 5.3초 클립을 반환합니다. Flash 편집은 약 1초 분량의 클립을 약 1.1초 만에 다시 렌더링합니다.

스트리밍 인터페이스는 이전 잠재 상태에서 클립을 확장하고 생성 중에 새로운 지시를 받을 수 있습니다. 한 항공 데모에서는 좌측 선회와 우측 선회 명령이 롤아웃 0.5초 시점에 도착합니다. 그 결과로 생긴 분기는 갈라지기 전까지 동일한 오프닝 프레임을 공유합니다. 통제된 데모 밖에서도 유지된다면 이는 실제 역량입니다. 감독이 처음부터 다시 생성하는 대신 촬영 중간에 샷을 조종할 수 있기 때문입니다.

로봇 훈련 데이터 부족을 해결하기 위해 Reka는 일반 인터넷 비디오에서 제어 신호를 추출하는 역동역학 모델을 구축했습니다. 공유 백본은 약 3개월 동안 320개의 H100 GPU에서 훈련되었으며, 이는 최전선 실행에 비하면 소규모입니다.

컴퓨팅 이야기는 강조할 가치가 있습니다. 190억 모델을 320개의 H100에서 3개월 동안 훈련하는 것은 수만 개의 가속기로 시스템을 훈련하는 최전선 기준에서는 작은 실행입니다. Rho-1이 그 규모에서 아키텍처적 약속의 일부라도 달성한다면, 다음 물결의 멀티모달 역량이 막대한 자본을 필요로 하지 않으며, 더 작은 연구소들도 컴퓨팅만으로 경쟁하는 대신 구조적 기여를 할 수 있음을 시사합니다.

월드 모델 경쟁에서 이것이 차지하는 위치

Rho-1은 장면이 어떻게 진화하는지 표현하려는 모델들이 붐비는 주에 등장했습니다. InSpatio는 단일 이미지, 파노라마 또는 비디오를 탐색 가능한 4D 세계로 바꾸고 실시간 상호작용 방법 중 하나의 동적 장면 벤치마크에서 1위를 차지한 InSpatio-World 1.5를 출시했습니다. Nvidia는 이미지를 탐험 가능한 3D 환경으로 변환하는 Lyra 2.0을 오픈소스로 공개했습니다. Google과 일련의 중국 연구소들도 모두 같은 지점을 파고들고 있습니다.

Reka의 접근 방식은 재구성 진영과 다릅니다. 그 프로젝트들은 이동할 수 있는 장면을 구축합니다. Rho-1은 장면을 설명하고 요청에 따라 변경하며, 동시에 그에 작용할 모터 명령까지 출력할 수 있는 모델을 구축하려고 합니다. 이것이 작동한다면, 동일한 체크포인트가 별도의 정책 네트워크나 별도의 비전-언어 모델 없이 로봇을 구동하고 로봇이 보는 것을 설명할 수 있습니다.

로봇 공학 주장은 가장 중대하면서도 가장 검증되지 않은 부분입니다. Reka는 카메라 이미지를 예측하는 동일한 가중치가 로봇 움직임도 구동한다고 말했으며, 로봇 데이터가 부족하기 때문에 일반 인터넷 비디오에서 제어 신호를 끌어내는 역동역학 모델을 구축했다고 밝혔습니다. 이 접근 방식이 유지된다면, 실제 로봇 궤적은 수집 비용이 많이 들고 다양성이 제한적이라는 체화 AI의 가장 큰 병목을 우회하는 길을 가리킵니다. 그렇지 않다면 로봇 제어 기능은 데모 클립에 불과합니다.

이번 출시는 이러한 시스템의 가격 책정 방식에도 중요합니다. 대부분의 멀티모달 제품은 계획, 이미지 생성, 비디오 생성에 대해 각각 다른 서비스이기 때문에 별도로 과금합니다. 하나의 컨텍스트 윈도우에서 세 가지를 모두 수행하는 단일 모델은 그 위에 구축된 모든 제품의 단위 경제성을 바꿉니다. 이것이 더 낮은 가격으로 나타나는지는 통합 모델이 동시 요청을 얼마나 효율적으로 처리하는지에 달려 있으며, 이는 바로 독립적 테스트가 밝혀낼 부분입니다.

아직 열려 있는 주장들

Rho-1의 성능 수치는 Reka의 프리뷰에서 나온 것이며 아직 재현할 수 없습니다. 공개된 가중치나 API가 없기 때문입니다. 하드웨어 구성, 배칭, 출력 설정, 컴파일 선택은 비디오 지연 시간을 크게 바꿀 수 있으므로, 효율성 수치가 의미를 갖기 전에 독립적인 재현이 필요합니다.

이 모델은 한계를 인정했습니다. 네이티브 비디오는 672x384로 제한됩니다. 장기 구조적 드리프트, 비디오 그라운딩, 편집 안정성은 회사 자체가 약점으로 설명합니다. 이는 모든 월드 모델을 괴롭히는 동일한 문제이며, 19B 네트워크가 이를 완전히 해결했을 가능성은 낮습니다.

이번 출시는 장면이 어떻게 진화하는지 예측하고 그 예측에 따라 행동할 수 있는 시스템을 목표로 하는 월드 모델로의 더 넓은 전환에 부합합니다. Rho-1의 기여는 아키텍처적입니다. 이해와 생성이 서로 꿰매어지는 대신 가중치와 컨텍스트를 공유해야 한다고 주장합니다. 그 주장이 승리할지는 다른 연구소의 향후 몇 가지 연구 프리뷰가 어떤 모습인지, 그리고 Reka가 제3자가 테스트할 수 있는 것을 출시하는지에 달려 있습니다.

관련 글