Reka は、リサーチプレビューとして Rho-1をリリースしました。これはスクラッチから学習された19Bのオムニ推論モデルであり、単一のニューラルネットワークがテキスト、画像、映像を理解・生成し、それらについて推論し、ロボット動作を出力します。Rekaはこれを、モダリティ特化型モデル間で処理を受け渡すエージェント型パイプラインの直接の代替として位置づけています。
Rho-1が変えるもの
現在のほとんどのマルチモーダルシステムはパイプライン構成です。中央のモデルが計画を立て、画像、映像、検出などの専門モデルに処理を委譲します。受け渡しのたびにレイテンシが増え、各専門モデルは狭いリクエストしか見ることができません。
Rho-1はこれらの受け渡しを排除します。テキスト、視覚、ロボット動作が、1つのコンテキストウィンドウ内のトークンになります。 Rekaの研究によれば、1つの無編集セッションが全ループを示しています。モデルは灯台を描き、バウンディングボックスを付け、アニメーション化し、映像を吹雪に編集し、その違いを説明します。すべて5ターン以内で、ツール呼び出しも第二のモデルもなしに行われます。
アーキテクチャ: 2つのストリーム、1つのKVキャッシュ
すべての入出力は、2つのネイティブ形式のいずれかを使用します。
- 離散トークン はテキスト、記号的推論、高レベルコマンドを担います。
- 連続トークン は画像の潜在表現、映像フレーム、ロボット動作、固有受容感覚を担います。
各トランスフォーマーブロックは2つのエキスパート重みストリームを持ちます。理解ストリームは言語と視覚の解析を処理し、生成ストリームは潜在表現を脱ノイズして画像と映像にします。両ストリームはアテンションを共有し、同じKVキャッシュ上で動作します。
応答にピクセルが必要な場合、理解ストリームが離散のハンドオフトークンを発行します。その後、生成ストリームが蓄積された完全な状態からレンダリングします。学習は、離散系列に対する次トークン予測と、連続出力に対するフローマッチングを組み合わせます。
この設計には実用上の効果があります。バウンディングボックスは、別個の検出器ではなく座標トークンとして出力されます。映像の最初のフレームは、再エンコードされたコピーではなく、コンテキスト内の画像表現を再利用します。
速度: ベース vs 蒸留
ベースモデルは 0.79x実時間 (中央値)で映像を生成し、視聴可能なストリームがおおよそ6秒で開始されます。Rekaチームは最初のクリップまでに7.0秒を測定しました。これは、マルチエージェントパイプラインの例示値13.8秒に対するものです。
蒸留バリアントは、デノイジングを99ステップから8ステップに削減し、品質低下は最小限と報告されています。約1秒で5.3秒のクリップを返しました。Rekaの社内テストでは、最速の専用画像モデルと同等でした。また、最初のテキストトークンまでが最速のモデルでもありました。これらはベンダー自身が実施したテストであり、独立したベンチマークではありません。
ワールドモデルとロボティクス
Rho-1はクリップからクリップへと継続的にストリーミングします。新しい指示は理解ストリームを通じて入力され、ロールアウトの途中で状態を更新します。Rekaは、1つの開始が「bank left」と「bank right」の継続に分岐するデモを示しています。
ロボティクスでは、動作と将来フレームが同じ潜在状態からデコードされます。 LIBERO シミュレーションのエピソードでは、Rho-1が7つのアクションチャンネルを出力する様子が示されています。希少なテレオペレーションログを超えてスケールするため、RekaはRho-1をその Inverse Dynamics Model生の映像から制御信号を推論するものです。
Rho-1 の比較
2026年10月5日時点で公式ソースに基づき検証済みのデータです。
| 機能 | Reka Rho-1 | ByteDance BAGEL | BAAI Emu3.5 | Google Genie 3 |
|---|---|---|---|---|
| 開発元 | Reka | ByteDance Seed | BAAI | Google DeepMind |
| パラメータ | 19B | 合計14B、アクティブ7B(MoT) | 34B | 非公開 |
| 入力 | テキスト、画像、動画、アクション、固有受容感覚 | テキスト、画像 | テキストと画像のインターリーブ | テキストプロンプト、ナビゲーション入力 |
| 出力 | テキスト、画像、動画、アクション、固有受容感覚 | テキスト、画像 | テキストと画像のインターリーブ | インタラクティブなビデオワールド |
| ネイティブ動画生成 | はい、672×384に制限 | いいえ | いいえ(画像フレームであり、ネイティブクリップではない) | はい、24 fpsで720p |
| リアルタイム操作 | はい、連続ロールアウト | いいえ | いいえ | はい、プロンプト可能なワールドイベント |
| ロボットアクション | ネイティブの連続アクショントークン | いいえ | 身体を使ったマニピュレーションデモ | ナビゲーションアクションを実行するが、アクション自体は出力しない |
| オープンウェイト | いいえ | はい、Apache 2.0 | はい、Apache 2.0 | いいえ |
| 本日アクセス可能 | contact@reka.ai経由のリサーチプレビュー | Hugging Face、GitHub | Hugging Face、emu.worldアプリ | Google AI Ultra契約者向けのProject Genie |
| ソース/リソース | Rekaブログ | GitHub | Hugging Face | DeepMindブログ |
Genie 3へのアクセスは Project Genieによるもの。Emu3.5のパラメータ数はそのHugging Faceモデルカードに基づく。
要点
- Rho-1は、テキスト、画像、動画、ロボットのアクションを読み書きする19Bモデルです。
- 2つのエキスパートストリームが、すべてのブロックでアテンションと1つのKVキャッシュを共有します。
- 蒸留によりデノイジングを99ステップから8ステップに削減し、5.3秒のクリップあたり約1秒で処理します。
- H100を320基使用して3か月間トレーニングされ、動画は672×384に制限されています。
- 現時点ではリサーチプレビューのみ:公開されている重み、API、価格設定はまだありません。
ぜひご覧ください 技術的詳細 および Xでの発表。このプロジェクトの研究者に全ての功績があります。また、ぜひ Twitter でフォローし、 150k+ML SubReddit への参加と ニュースレター. お待ちください!Telegramはご利用ですか? Telegramでもご参加いただけるようになりました。
GitHubリポジトリ、Hugging Faceページ、製品リリース、ウェビナーなどのプロモーションで当社との提携をお考えですか? お問い合わせください
この記事 Reka、動画の理解と生成、そしてロボット動作の出力を1つで実現する19Bオムニ推論モデル「Rho-1」をリリース は最初に MarkTechPost.