MarkTechPost

Reka 发布 Rho-1:一个 19B 全能推理模型,集理解、生成视频与输出机器人动作于一体

Reka 发布了 Rho-1,这是一个从零训练的 19B 全能推理模型。一个网络在共享 KV 缓存上读取并生成文本、图像、视频和机器人动作。其蒸馏变体约在 1 秒内返回一段 5.3 秒的片段。这是研究预览版,尚无公开权重。本文《Reka 发布 Rho-1:一个 19B 全能推理模型,集理解、生成视频与输出机器人动作于一体》最先发表于 MarkTechPost 。

Reka 发布了研究预览版 Rho-1,这是一个从零训练的 19B 全能推理模型。单一神经网络理解并生成文本、图像和视频,对其进行推理,并输出机器人动作。Reka 将其定位为在模态专用模型之间传递工作的智能体流水线的直接替代方案。

Rho-1 改变了什么

如今的大多数多模态系统都是流水线。中央模型进行规划,然后将任务交给图像、视频或检测方面的专用模型。每次交接都会增加延迟,而且每个专用模型只能看到狭窄的请求。

Rho-1 消除了这些交接。文本、视觉和机器人动作成为同一上下文窗口内的 token。根据 Reka 的研究,一个未剪辑的会话展示了完整闭环。模型绘制一座灯塔、为其加框、使其动起来、将视频编辑成暴风雪场景,并解释其中的差异。这一切在 5 轮内完成,没有工具调用,也没有第二个模型。

架构:双流,一个 KV 缓存

每个输入和输出都使用两种原生格式之一:

  • 离散 token 承载文本、符号推理和高层命令。
  • 连续 token 承载图像潜变量、视频帧、机器人动作和本体感知。

每个 transformer 块持有两个专家权重流。理解流处理语言和视觉解析。生成流将潜变量去噪为图像和视频。两个流共享注意力,并在同一 KV 缓存上运行。

当回复需要像素时,理解流发出一个离散的交接 token。生成流随后从完整累积状态进行渲染。训练将离散序列的下一 token 预测与连续输出的流匹配相结合。

这一设计具有实际效果。边界框作为坐标 token 输出,而不是来自单独的检测器。视频的第一帧复用上下文中的图像表示,而不是重新编码的副本。

速度:基础版 vs 蒸馏版

基础模型以 0.79 倍实时 (中位数)生成视频,大约 6 秒内开始可观看的流。Reka 团队测得生成第一段片段需要 7.0 秒,而多智能体流水线的示意时间为 13.8 秒。

蒸馏变体将去噪从 99 步减少到 8 步,据报道质量损失极小。它约在 1 秒内返回一段 5.3 秒的片段。在 Reka 的内部测试中,它匹敌了最快的专用图像模型。它还是所测试模型中输出首个文本 token 最快的。这些是厂商自测结果,并非独立基准。

世界模型与机器人技术

Rho-1 持续流式运行,片段连着片段。新指令通过理解流进入,并在执行过程中更新状态。Reka 展示了一个开场分叉为“向左倾斜”和“向右倾斜”的延续。

在机器人技术方面,动作和未来帧从同一潜变量状态解码。一个 LIBERO 仿真片段显示 Rho-1 输出 7 个动作通道。为了在遥操作日志稀缺的情况下进行扩展,Reka 将 Rho-1 与其 逆动力学模型,它从原始视频中推断控制信号。

Rho-1 如何比较

数据于2026年10月5日经官方来源核实。

特性Reka Rho-1ByteDance BAGELBAAI Emu3.5Google Genie 3
开发者RekaByteDance SeedBAAIGoogle DeepMind
参数19B14B总计,7B激活(MoT)34B未披露
输入文本、图像、视频、动作、本体感觉文本、图片图文交错文本提示、导航输入
输出文本、图像、视频、动作、本体感觉文本、图片交错文本与图像互动视频世界
原生视频生成是的,上限为672×384否否(图像帧,而非原生剪辑)是的,24 fps 的 720p
实时转向是的,持续滚动发布不否是的,可提示的世界事件
机器人动作原生连续动作代币不是具身操作演示执行导航操作,但不发出这些操作
开放权重不是的,Apache 2.0是的,Apache 2.0否
今日即可访问通过 contact@reka.ai 获取研究预览Hugging Face、GitHubHugging Face、emu.world 应用面向 Google AI Ultra 订阅者的 Project Genie
来源/资源Reka 博客GitHubHugging FaceDeepMind 博客

Genie 3 的访问方式依 Project Genie;Emu3.5 的参数量依其 Hugging Face 模型卡。

要点

  • Rho-1 是一个 19B 模型,可以读取和生成文本、图像、视频以及机器人动作。
  • 两个专家流在每一层块中共享注意力机制和同一个 KV 缓存。
  • 蒸馏将去噪步骤从 99 步减少到 8 步,每个 5.3 秒的片段约需 1 秒。
  • 在 320 块 H100 上训练了 3 个月;视频分辨率上限为 672×384。
  • 仅为研究预览:暂无公开权重、API 或定价。


请查看 技术细节 ,以及 在 X 上的公告。所有功劳归于该项目的研究者。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ ML SubReddit 并订阅 我们的新闻通讯等等!你在用 Telegram 吗? 现在你也可以在 Telegram 上加入我们了。

需要与我们合作推广你的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等吗? 与我们联系

这篇文章 Reka 发布 Rho-1:一个 19B 全能推理模型,可在一个模型中理解与生成视频并输出机器人动作 首发于 MarkTechPost.

原始出处

MarkTechPost

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准