Reka Rho-1、理解と生成を同じKVキャッシュに統合

ほとんどのマルチモーダルシステムはパイプラインである。言語モデルが計画し、拡散モデルが描画し、検出器が位置を特定し、ポリシーネットワークがロボットを動かす。各引き渡しにはコストが伴う。状態をシリアライズし、サービス間で移動させ、次のコンポーネントが期待する形式に再エンコードする必要がある。
Reka AIのRho-1は異なる道を行く。10月5日に研究プレビューとして公開された190億パラメータのモデルは、テキスト、画像、動画、ロボット動作を1つのネットワーク内で扱い、すべてが単一のコンテキストウィンドウ内のトークンとして表現される。ツール呼び出しも、第2のモデルも存在しない。
デモは違いを具体的に示す。ユーザーが岩がちな岬にある赤と白の灯台の低い空撮ビューを求める。Rho-1がそれを描画する。ユーザーが灯台の周囲に枠を求める。モデルは枠を描く。ユーザーがドローンのフライインとしてアニメーション化するよう求める。すると、先ほど生成した画像のフレームから動画を生成する。ユーザーがカメラの動きは同一のまま吹雪に変更するよう求める。モデルは動画を編集する。最後にユーザーが2つのクリップ間で何が変わったかを尋ねると、モデルはテキストで答える。
その一連の各ステップは、モデルが以前に生成したものへ引き続きアクセスできることに依存している。従来のパイプラインでは、画像と動画をサービス間で受け渡し、各境界でコンテキストを再構築する必要がある。Rho-1はそれを同じアテンションコンテキストに保持するため、この連鎖はつながったままになる。
2つのストリーム、1つのキャッシュ
このアーキテクチャは各トランスフォーマーブロックを、アテンション演算を共有する2つのエキスパート重みストリームに分ける。理解ストリームは言語、内部推論トークン、視覚入力を処理し、次トークンヘッドが離散出力を生成する。生成ストリームはフローマッチングヘッドを使い、連続潜在表現をノイズ除去して画像と動画にする。
両ストリームは同じKVキャッシュから読み取る。指示、以前に生成された視覚コンテンツ、推論トークン、モーターコマンドはすべて利用可能なまま残る。応答が視覚生成を必要とするときには特別なトークンが合図し、これにより生成ストリームは新規に始めるのではなく、蓄積された状態から継続できる。

このモデルは意図的に2つの形式で情報を運ぶ。離散トークンはテキストと記号的推論を扱う。連続表現は画像潜在、動画フレーム、ロボット動作、固有受容感覚を運ぶ。物理信号を連続のまま保つことで、関節位置や速度を離散語彙に押し込むことによる精度損失を避ける。
その最後の細部が、ロボット制御の主張を単なるマーケティング的な謳い文句以上にする。カメラ画像を予測する同じ重みがロボットの動きも駆動する。なぜなら両者は同じ表現空間に存在するからだ。
反対方向から生成に挑む
Rekaは2つのバリアントを報告している。ベースモデルは99のノイズ除去ステップを使い、中央値で実時間の0.79倍の速度で生成し、ストリーミング出力は約6秒後に始まる。Rho-1 Flashと呼ばれる蒸留版は8ステップを使い、5.3秒のクリップを約1秒で返す。Flashの編集は約1秒のクリップを約1.1秒で再レンダリングする。
ストリーミングインターフェースは、以前の潜在状態からクリップを延長し、生成中に新しい指示を受け付けられる。ある空撮デモでは、左にバンクしろというコマンドと右にバンクしろというコマンドが、ロールアウト開始から0.5秒の時点で到着する。結果として分岐したクリップは、分かれる前の同じ冒頭フレームを共有する。これが制御されたデモの外でも成り立つなら実際の能力である。なぜなら、監督はゼロから再生成するのではなく、飛行中にショットを操縦できるからだ。
ロボット訓練データの不足を回避するため、Rekaは通常のインターネット動画から制御信号を抽出する逆動力学モデルを構築した。共有バックボーンを320台のH100 GPUで約3か月訓練しており、これはフロンティアの実行と比べれば控えめである。
計算資源の話は強調に値する。19Bモデルを320台のH100で3か月訓練するのは、数万基のアクセラレータでシステムを訓練するフロンティア基準では小規模な実行である。もしRho-1がその規模でアーキテクチャ上の約束の一部でも実現するなら、次世代のマルチモーダル能力に莫大な資本は不要であり、小規模ラボでも計算力だけで競うのではなく構造的な貢献ができることを示唆する。
ワールドモデル競争における位置づけ
Rho-1は、シーンがどのように変化するかを表現しようとするモデルにとって混雑した週に登場した。InSpatioはInSpatio-World 1.5を公開した。これは単一の画像、パノラマ、または動画をナビゲート可能な4D世界に変え、リアルタイム対話手法の中で動的シーンのベンチマーク1つで首位に立った。Nvidiaは画像を探索可能な3D環境に変換するLyra 2.0をオープンソース化した。Googleと一連の中国のラボも同じ領域に取り組んでいる。
Rekaの切り口は再構築系の集団とは異なる。それらのプロジェクトは移動できるシーンを構築する。Rho-1は、シーンを記述し、要求に応じて変更し、さらにそれに作用するためのモーターコマンドも出力できるモデルを構築しようとしている。もしそれが機能すれば、同じチェックポイントがロボットを駆動し、ロボットが見ているものを語ることができ、別個のポリシーネットワークや別個の視覚言語モデルは不要になる。
ロボティクスに関する主張は最も重要で、最も検証されていない。Rekaは、カメラ画像を予測する同じ重みがロボットの動きも駆動すると述べ、ロボットデータが乏しいため通常のインターネット動画から制御信号を引き出す逆動力学モデルを構築したと述べた。このアプローチが成り立てば、実世界のロボット軌道は収集コストが高く多様性も限られるという、身体性AI最大のボトルネックを回避する道を示す。成り立たなければ、ロボット制御機能はデモクリップにすぎない。
このリリースは、こうしたシステムの価格設定のあり方にも関わる。ほとんどのマルチモーダル製品は、計画、画像生成、動画生成を別々に課金する。それぞれが異なるサービスだからだ。3つすべてを1つのコンテキストウィンドウで実行する単一モデルは、その上に構築されるあらゆる製品の単位経済性を変える。それが価格低下として現れるかは、統合モデルが同時リクエストをどれだけ効率的に処理するかにかかっており、まさに独立したテストが明らかにする点である。
まだ未解決の主張
Rho-1の性能値はRekaのプレビューによるもので、公開された重みやAPIがないためまだ再現できない。ハードウェア構成、バッチ処理、出力設定、コンパイルの選択は動画レイテンシを大きく変えうるので、効率の数値は独立に再現されて初めて意味を持つ。
このモデルには認められた限界がある。ネイティブ動画は672x384に制限されている。長期的な構造ドリフト、動画グラウンディング、編集の安定性は、企業自身が弱点と述べている。これらはあらゆるワールドモデルを悩ませる同じ問題であり、19Bネットワークがそれらを完全に解決した可能性は低い。
このリリースは、シーンがどのように変化するかを予測し、その予測に基づいて行動できるシステムを目指す、ワールドモデルへのより広い移行に合致する。Rho-1の貢献はアーキテクチャ上のものである。理解と生成は縫い合わされるのではなく、重みとコンテキストを共有すべきだと主張する。その主張が勝つかどうかは、他ラボによる今後の研究プレビューがどのようなものか、そしてRekaが第三者がテストできるものを出荷するかどうかにかかっている。
関連記事
Cloudflare、Jevの得意分野でJevを凌ぐ27B意思決定モデルを投入
一部のモデル呼び出しは、段落ではなく数値を返すべきだ。その考えを中心にカテゴリーが形成されつつある。
BOSSFIGHTはフロンティアモデルを24週間コーヒーショップのオーナーとして走らせた。大半は「何もしない」に敗れた。
クイズで賄賂を断ることと、実際の四半期で屈しないことは、二つの異なるスキルであり、現在の評価はより易しい方を測りがちだ。
NASAとIBM、17年分の周回機データで訓練した月基盤モデルをオープンソース化
このモデルは特徴の発見と特徴づけには有用だが、それらが正確にどこにあるかを高精度で示すには信頼できない。
40ステップではなく4ステップ:蒸留はいかにしてオープン画像モデルをコンシューマー向けGPUに押し込んでいるか
低ステップ蒸留はトレードオフであり、ただで得られるものではない。テキストの忠実度、編集の精度、マルチリファレンスの一貫性が最初に犠牲になる。