MarkTechPost

Reka lanza Rho-1: un modelo de 19B de razonamiento omnímodo que comprende, genera video y produce acciones de robot.

Reka ha lanzado Rho-1, un modelo de razonamiento omnisciente de 19B parámetros entrenado desde cero. Una red lee y genera texto, imágenes, video y acciones de robot a través de una caché KV compartida. Una variante…

Reka ha lanzado una vista previa de investigación de Rho-1, un modelo de razonamiento omnipresente de 19B parámetros entrenado desde cero. Una sola red neural comprende y genera texto, imágenes y video, razona sobre ellos y produce acciones de robot. Reka lo considera una sustitución directa para las tuberías agenticas que transfieren trabajo entre modelos específicos de modalidad.

Los cambios realizados por Rho-1

La mayoría de los sistemas multimodales de hoy en día son tuberías. Un modelo central planifica, y luego pasa las tareas a especialistas para imágenes, vídeo o detección. Cada transferencia añade latencia, y cada especialista ve solo una solicitud limitada.

Rho-1 elimina esos pasos de transferencia. El texto, la visión y las acciones robóticas se convierten en tokens dentro de una única ventana de contexto. Según la investigación de Reka, una sesión no editada muestra todo el ciclo completo. El modelo dibuja un faro, lo encierra en cajas, lo anima, edita el video para convertirlo en una tormenta de nieve y explica la diferencia. Todo esto ocurre en 5 turnos, sin llamadas a herramientas ni segundo modelo.

Arquitectura: Dos flujos, una caché KV

Toda entrada y salida utiliza uno de los dos formatos nativos:

  • Tokens discretos transportan texto, razonamiento simbólico y comandos de alto nivel.
  • Tokenes continuos transportan latencias de imágenes, fotogramas de video, acciones de robots y propioccepción.

Cada bloque de transformador contiene dos flujos de peso de expertos. El flujo de comprensión se encarga del análisis lingüístico y visual. El flujo de generación elimina los ruido de los latentes para convertirlos en imágenes y videos. Ambos flujos comparten atención y operan sobre la misma caché KV.

Cuando una respuesta necesita píxeles, el flujo de comprensión emite un token de transferencia discreto. La corriente de generación luego se renderiza a partir del estado total acumulado. El entrenamiento combina la predicción del siguiente token para secuencias discretas con el mapeo de flujo para salidas continuas.

Este diseño tiene efectos prácticos. Las cajas de borde se presentan como tokens de coordenadas, y no vienen de un detector separado. La primera imagen del video reutiliza la representación de imagen en contexto, en lugar de una copia reencodada.

Velocidad: Base contra Destilada

El modelo base genera video a 0.79 veces el tiempo real (mediana), con un flujo visualizable que comienza aproximadamente en 6 segundos. El equipo de Reka medió 7.0 segundos para el primer clip, frente a 13.8 segundos como referencia para una pipeline de múltiples agentes.

Una variante distilada reduce el desenfoque de 99 pasos a 8, con una pérdida mínima en calidad reportada. Generó un clip de 5.3 segundos en aproximadamente un segundo. En las pruebas internas de Reka, igualó al modelo de imagen dedicado más rápido. También fue el modelo probado más rápido para llegar al primer token de texto. Estas son pruebas realizadas por el proveedor, no evaluaciones independientes.

Modelo Mundial y Robótica

Rho-1 se transmite de forma continua, clip tras clip. Nuevas instrucciones entran a través del flujo de comprensión y actualizan el estado durante la implementación. Reka demuestra una apertura que se divide en continuaciones ‘banco izquierda’ y ‘banco derecha’.

Para la robótica, las acciones y los marcos futuros se decodifican desde el mismo estado latente. Un episodio de simulación LIBERO muestra que Rho-1 emite 7 canales de acción. Para superar los escasos registros de teleoperación, Reka asocia a Rho-1 su Modelo de Dinámica Inversa, que infiere señales de control a partir del video bruto.

Cómo compara Rho-1

Los datos fueron verificados el 5 de octubre de 2026 desde fuentes oficiales.

CaracterísticaReka Rho-1ByteDance BAGELBAAI Emu3.5Google Genie 3
DesarrolladorRekaByteDance SeedBAAIGoogle DeepMind
Parámetros19B14B en total, 7B activos (MoT)34BNo divulgado
EntradasTexto, imagen, video, acciones, propiocepciónTexto, imagenTexto e imagen intercaladosPrompt de texto, entradas de navegación
SalidasTexto, imagen, video, acciones, propiocepciónTexto, imagenTexto e imagen intercaladosMundo de video interactivo
Generación de video nativoSí, limitado a 672×384NoNo (marcos de imagen, no clips nativos)Sí, 720p a 24 fps
Dirigido en tiempo realSí, implementaciones continuasNoNoSí, eventos mundiales que se pueden solicitar
Acciones del robotTokens de acción continua nativaNoDemostraciones de manipulación incorporadaRealiza acciones de navegación, pero no las emite
Pesas abiertasNoSí, Apache 2.0Sí, Apache 2.0No
Accede hoyVista previa de la investigación a través de contact@reka.aiHugging Face, GitHubHugging Face, aplicación emu.worldProyecto Genie para suscriptores de Google AI Ultra
Fuente/RecursosBlog de RekaGitHubHugging FaceBlog de DeepMind

Acceso a Genie 3 por Project Genie; cuenta de parámetros de Emu3.5 según su tarjeta de modelo en Hugging Face.

Conclusiones Clave

  • Rho-1 es un modelo de 19B que puede leer y escribir texto, imágenes, videos y acciones de robots.
  • Dos flujos de expertos comparten la atención y una caché KV en cada bloque.
  • La destilación reduce el noise en 8 pasos, desde 99 a 8, aproximadamente 1 segundo por cada clip de 5.3 segundos.
  • Entrenado con 320 H100s durante 3 meses; el video tiene un límite de 672×384.
  • Solo vista preliminar de la investigación: aún no hay pesos públicos, API ni precios.


Revisa los detalles técnicos y el anuncio en X. Todo el crédito pertenece al investigador de este proyecto. También, no dudes en seguirnos en Twitter y no olvides unirte a nuestro subreddit de 150k+ ML y suscribirte a nuestro boletín informativo. ¡Espera! ¿Estás en Telegram? Ahora puedes unirte a nosotros en Telegram también.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub, página de Hugging Face, lanzamiento de producto o webinario, etc.? Conéctese con nosotros

El artículo Reka lanza Rho-1: Un modelo de razonamiento omni de 19B que comprende, genera video y produce acciones de robot en una sola herramienta apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original