Reka AI的全模态模型Rho-1在单一模型中处理文本、图像、视频和机器人控制
Matthias Bastian
查看Matthias Bastian的LinkedIn资料
2026年10月5日
Reka AI已发布Rho-1的研究预览版。 这个19 billion参数的全模态模型可在单一神经网络中处理和生成文本、图像、视频以及机器人控制动作。与大多数将任务路由到专门模型的AI系统不同,Rho-1在同一个共享上下文窗口中将所有模态作为token运行,无需工具调用或外部模型。该模型可实时生成连续视频,并能即时响应新指令而无需重启。
用于预测摄像头图像的同一组权重也能驱动机器人的运动。为解决机器人训练数据稀缺的问题,Reka AI构建了一个 逆动力学模型 ,从普通的互联网视频中提取控制信号。Rho-1在320块H100 GPU上训练了大约三个月。
Reka AI在多模态AI领域并非新手。2024年4月,该公司推出了 Reka Core,这是一个在基准测试中与GPT-4、Claude 3和Gemini Ultra竞争的多模态语言模型。此次发布契合了 AI研究中向所谓世界模型推进的更广泛趋势。广告
AI新闻,没有炒作 – 由人工精选
订阅THE DECODER,享受无广告阅读、每周AI新闻通讯、每年六期独家"AI Radar"前沿报告、完整档案访问权限以及评论区的访问权限。
来源: Reka AI