Reka AIのオムニモデルRho-1、1つのモデルでテキスト・画像・動画・ロボット制御を処理
Matthias Bastian
Matthias BastianのLinkedInプロフィールを見る
2026年10月5日
Reka AIがRho-1のリサーチプレビューを公開しました。 この19 billionパラメータのオムニモデルは、テキスト、画像、動画、ロボット制御アクションを1つのニューラルネットワークで処理・生成します。ほとんどのAIシステムがタスクを専門モデルに振り分けるのとは異なり、Rho-1はすべてのモダリティをツール呼び出しや外部モデルなしで1つの共有コンテキストウィンドウ内のトークンとして処理します。このモデルは連続的な動画をリアルタイムで生成し、再起動なしでその場で新しい指示に応答します。
カメラ画像を予測するのと同じ重みが、ロボットの動きも駆動します。ロボットの訓練データの不足を workaround するため、Reka AIは通常のインターネット動画から制御信号を抽出する 逆ダイナミクスモデル を構築しました。Rho-1は320基のH100 GPUを用いて約3ヶ月にわたり訓練されました。
Reka AIはマルチモーダルAIの新参者ではありません。2024年4月、同社は Reka Coreをリリースしました。これはベンチマークでGPT-4、Claude 3、Gemini Ultraと競合したマルチモーダル言語モデルです。今回のリリースは、 いわゆる世界モデルに向けたAI研究のより広範な流れに合致するものです。Ad
誇張なしのAIニュース – 人間によるキュレーション
広告なしの閲覧、週刊AIニュースレター、年6回の限定「AI Radar」フロンティアレポート、完全なアーカイブへのアクセス、コメントセクションへのアクセスのために、THE DECODERを購読してください。
出典: Reka AI