Reka ha lanzado una vista previa de investigación de Rho-1, un modelo de razonamiento omnipresente de 19B parámetros entrenado desde cero. Una sola red neural comprende y genera texto, imágenes y video, razona sobre ellos y produce acciones de robot. Reka lo considera una sustitución directa para las tuberías agenticas que transfieren trabajo entre modelos específicos de modalidad.
Los cambios realizados por Rho-1
La mayoría de los sistemas multimodales de hoy en día son tuberías. Un modelo central planifica, y luego pasa las tareas a especialistas para imágenes, vídeo o detección. Cada transferencia añade latencia, y cada especialista ve solo una solicitud limitada.
Rho-1 elimina esos pasos de transferencia. El texto, la visión y las acciones robóticas se convierten en tokens dentro de una única ventana de contexto. Según la investigación de Reka, una sesión no editada muestra todo el ciclo completo. El modelo dibuja un faro, lo encierra en cajas, lo anima, edita el video para convertirlo en una tormenta de nieve y explica la diferencia. Todo esto ocurre en 5 turnos, sin llamadas a herramientas ni segundo modelo.
Arquitectura: Dos flujos, una caché KV
Toda entrada y salida utiliza uno de los dos formatos nativos:
- Tokens discretos transportan texto, razonamiento simbólico y comandos de alto nivel.
- Tokenes continuos transportan latencias de imágenes, fotogramas de video, acciones de robots y propioccepción.
Cada bloque de transformador contiene dos flujos de peso de expertos. El flujo de comprensión se encarga del análisis lingüístico y visual. El flujo de generación elimina los ruido de los latentes para convertirlos en imágenes y videos. Ambos flujos comparten atención y operan sobre la misma caché KV.
Cuando una respuesta necesita píxeles, el flujo de comprensión emite un token de transferencia discreto. La corriente de generación luego se renderiza a partir del estado total acumulado. El entrenamiento combina la predicción del siguiente token para secuencias discretas con el mapeo de flujo para salidas continuas.
Este diseño tiene efectos prácticos. Las cajas de borde se presentan como tokens de coordenadas, y no vienen de un detector separado. La primera imagen del video reutiliza la representación de imagen en contexto, en lugar de una copia reencodada.
Velocidad: Base contra Destilada
El modelo base genera video a 0.79 veces el tiempo real (mediana), con un flujo visualizable que comienza aproximadamente en 6 segundos. El equipo de Reka medió 7.0 segundos para el primer clip, frente a 13.8 segundos como referencia para una pipeline de múltiples agentes.
Una variante distilada reduce el desenfoque de 99 pasos a 8, con una pérdida mínima en calidad reportada. Generó un clip de 5.3 segundos en aproximadamente un segundo. En las pruebas internas de Reka, igualó al modelo de imagen dedicado más rápido. También fue el modelo probado más rápido para llegar al primer token de texto. Estas son pruebas realizadas por el proveedor, no evaluaciones independientes.
Modelo Mundial y Robótica
Rho-1 se transmite de forma continua, clip tras clip. Nuevas instrucciones entran a través del flujo de comprensión y actualizan el estado durante la implementación. Reka demuestra una apertura que se divide en continuaciones ‘banco izquierda’ y ‘banco derecha’.
Para la robótica, las acciones y los marcos futuros se decodifican desde el mismo estado latente. Un episodio de simulación LIBERO muestra que Rho-1 emite 7 canales de acción. Para superar los escasos registros de teleoperación, Reka asocia a Rho-1 su Modelo de Dinámica Inversa, que infiere señales de control a partir del video bruto.
Cómo compara Rho-1
Los datos fueron verificados el 5 de octubre de 2026 desde fuentes oficiales.
| Característica | Reka Rho-1 | ByteDance BAGEL | BAAI Emu3.5 | Google Genie 3 |
|---|---|---|---|---|
| Desarrollador | Reka | ByteDance Seed | BAAI | Google DeepMind |
| Parámetros | 19B | 14B en total, 7B activos (MoT) | 34B | No divulgado |
| Entradas | Texto, imagen, video, acciones, propiocepción | Texto, imagen | Texto e imagen intercalados | Prompt de texto, entradas de navegación |
| Salidas | Texto, imagen, video, acciones, propiocepción | Texto, imagen | Texto e imagen intercalados | Mundo de video interactivo |
| Generación de video nativo | Sí, limitado a 672×384 | No | No (marcos de imagen, no clips nativos) | Sí, 720p a 24 fps |
| Dirigido en tiempo real | Sí, implementaciones continuas | No | No | Sí, eventos mundiales que se pueden solicitar |
| Acciones del robot | Tokens de acción continua nativa | No | Demostraciones de manipulación incorporada | Realiza acciones de navegación, pero no las emite |
| Pesas abiertas | No | Sí, Apache 2.0 | Sí, Apache 2.0 | No |
| Accede hoy | Vista previa de la investigación a través de contact@reka.ai | Hugging Face, GitHub | Hugging Face, aplicación emu.world | Proyecto Genie para suscriptores de Google AI Ultra |
| Fuente/Recursos | Blog de Reka | GitHub | Hugging Face | Blog de DeepMind |
Acceso a Genie 3 por Project Genie; cuenta de parámetros de Emu3.5 según su tarjeta de modelo en Hugging Face.
Conclusiones Clave
- Rho-1 es un modelo de 19B que puede leer y escribir texto, imágenes, videos y acciones de robots.
- Dos flujos de expertos comparten la atención y una caché KV en cada bloque.
- La destilación reduce el noise en 8 pasos, desde 99 a 8, aproximadamente 1 segundo por cada clip de 5.3 segundos.
- Entrenado con 320 H100s durante 3 meses; el video tiene un límite de 672×384.
- Solo vista preliminar de la investigación: aún no hay pesos públicos, API ni precios.
Revisa los detalles técnicos y el anuncio en X. Todo el crédito pertenece al investigador de este proyecto. También, no dudes en seguirnos en Twitter y no olvides unirte a nuestro subreddit de 150k+ ML y suscribirte a nuestro boletín informativo. ¡Espera! ¿Estás en Telegram? Ahora puedes unirte a nosotros en Telegram también.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub, página de Hugging Face, lanzamiento de producto o webinario, etc.? Conéctese con nosotros
El artículo Reka lanza Rho-1: Un modelo de razonamiento omni de 19B que comprende, genera video y produce acciones de robot en una sola herramienta apareció primero en MarkTechPost.