MarkTechPost

Reka、Rho-1をリリース:理解、映像生成、ロボット動作出力を1つに統合した19Bのオムニ推論モデル

Rekaは、スクラッチから学習された19Bのオムニ推論モデルRho-1をリリースしました。単一のネットワークが、共有KVキャッシュを介してテキスト、画像、映像、ロボット動作を読み取り・生成します。蒸留バリアントは約1秒で5.3秒のクリップを返します。現在は公開重みが存在しないリサーチプレビューです。本記事「Reka Releases Rho-1: A 19B Omni-Reasoning Model That Understands…

Reka は、リサーチプレビューとして Rho-1をリリースしました。これはスクラッチから学習された19Bのオムニ推論モデルであり、単一のニューラルネットワークがテキスト、画像、映像を理解・生成し、それらについて推論し、ロボット動作を出力します。Rekaはこれを、モダリティ特化型モデル間で処理を受け渡すエージェント型パイプラインの直接の代替として位置づけています。

Rho-1が変えるもの

現在のほとんどのマルチモーダルシステムはパイプライン構成です。中央のモデルが計画を立て、画像、映像、検出などの専門モデルに処理を委譲します。受け渡しのたびにレイテンシが増え、各専門モデルは狭いリクエストしか見ることができません。

Rho-1はこれらの受け渡しを排除します。テキスト、視覚、ロボット動作が、1つのコンテキストウィンドウ内のトークンになります。 Rekaの研究によれば、1つの無編集セッションが全ループを示しています。モデルは灯台を描き、バウンディングボックスを付け、アニメーション化し、映像を吹雪に編集し、その違いを説明します。すべて5ターン以内で、ツール呼び出しも第二のモデルもなしに行われます。

アーキテクチャ: 2つのストリーム、1つのKVキャッシュ

すべての入出力は、2つのネイティブ形式のいずれかを使用します。

  • 離散トークン はテキスト、記号的推論、高レベルコマンドを担います。
  • 連続トークン は画像の潜在表現、映像フレーム、ロボット動作、固有受容感覚を担います。

各トランスフォーマーブロックは2つのエキスパート重みストリームを持ちます。理解ストリームは言語と視覚の解析を処理し、生成ストリームは潜在表現を脱ノイズして画像と映像にします。両ストリームはアテンションを共有し、同じKVキャッシュ上で動作します。

応答にピクセルが必要な場合、理解ストリームが離散のハンドオフトークンを発行します。その後、生成ストリームが蓄積された完全な状態からレンダリングします。学習は、離散系列に対する次トークン予測と、連続出力に対するフローマッチングを組み合わせます。

この設計には実用上の効果があります。バウンディングボックスは、別個の検出器ではなく座標トークンとして出力されます。映像の最初のフレームは、再エンコードされたコピーではなく、コンテキスト内の画像表現を再利用します。

速度: ベース vs 蒸留

ベースモデルは 0.79x実時間 (中央値)で映像を生成し、視聴可能なストリームがおおよそ6秒で開始されます。Rekaチームは最初のクリップまでに7.0秒を測定しました。これは、マルチエージェントパイプラインの例示値13.8秒に対するものです。

蒸留バリアントは、デノイジングを99ステップから8ステップに削減し、品質低下は最小限と報告されています。約1秒で5.3秒のクリップを返しました。Rekaの社内テストでは、最速の専用画像モデルと同等でした。また、最初のテキストトークンまでが最速のモデルでもありました。これらはベンダー自身が実施したテストであり、独立したベンチマークではありません。

ワールドモデルとロボティクス

Rho-1はクリップからクリップへと継続的にストリーミングします。新しい指示は理解ストリームを通じて入力され、ロールアウトの途中で状態を更新します。Rekaは、1つの開始が「bank left」と「bank right」の継続に分岐するデモを示しています。

ロボティクスでは、動作と将来フレームが同じ潜在状態からデコードされます。 LIBERO シミュレーションのエピソードでは、Rho-1が7つのアクションチャンネルを出力する様子が示されています。希少なテレオペレーションログを超えてスケールするため、RekaはRho-1をその Inverse Dynamics Model生の映像から制御信号を推論するものです。

Rho-1 の比較

2026年10月5日時点で公式ソースに基づき検証済みのデータです。

機能Reka Rho-1ByteDance BAGELBAAI Emu3.5Google Genie 3
開発元RekaByteDance SeedBAAIGoogle DeepMind
パラメータ19B合計14B、アクティブ7B(MoT)34B非公開
入力テキスト、画像、動画、アクション、固有受容感覚テキスト、画像テキストと画像のインターリーブテキストプロンプト、ナビゲーション入力
出力テキスト、画像、動画、アクション、固有受容感覚テキスト、画像テキストと画像のインターリーブインタラクティブなビデオワールド
ネイティブ動画生成はい、672×384に制限いいえいいえ(画像フレームであり、ネイティブクリップではない)はい、24 fpsで720p
リアルタイム操作はい、連続ロールアウトいいえいいえはい、プロンプト可能なワールドイベント
ロボットアクションネイティブの連続アクショントークンいいえ身体を使ったマニピュレーションデモナビゲーションアクションを実行するが、アクション自体は出力しない
オープンウェイトいいえはい、Apache 2.0はい、Apache 2.0いいえ
本日アクセス可能contact@reka.ai経由のリサーチプレビューHugging Face、GitHubHugging Face、emu.worldアプリGoogle AI Ultra契約者向けのProject Genie
ソース/リソースRekaブログGitHubHugging FaceDeepMindブログ

Genie 3へのアクセスは Project Genieによるもの。Emu3.5のパラメータ数はそのHugging Faceモデルカードに基づく。

要点

  • Rho-1は、テキスト、画像、動画、ロボットのアクションを読み書きする19Bモデルです。
  • 2つのエキスパートストリームが、すべてのブロックでアテンションと1つのKVキャッシュを共有します。
  • 蒸留によりデノイジングを99ステップから8ステップに削減し、5.3秒のクリップあたり約1秒で処理します。
  • H100を320基使用して3か月間トレーニングされ、動画は672×384に制限されています。
  • 現時点ではリサーチプレビューのみ:公開されている重み、API、価格設定はまだありません。


ぜひご覧ください 技術的詳細 および Xでの発表。このプロジェクトの研究者に全ての功績があります。また、ぜひ Twitter でフォローし、 150k+ML SubReddit への参加と ニュースレター. お待ちください!Telegramはご利用ですか? Telegramでもご参加いただけるようになりました。

GitHubリポジトリ、Hugging Faceページ、製品リリース、ウェビナーなどのプロモーションで当社との提携をお考えですか? お問い合わせください

この記事 Reka、動画の理解と生成、そしてロボット動作の出力を1つで実現する19Bオムニ推論モデル「Rho-1」をリリース は最初に MarkTechPost.

原文の出典

MarkTechPost

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください