Reka a publié une preview de recherche de Rho-1, un modèle de raisonnement omnidimensionnel de 19B paramètres entraîné depuis zéro. Un seul réseau neural comprend et génère du texte, des images et des vidéos, raisonne à leur sujet, et produit des actions robotiques. Reka le considère comme un remplaçant direct pour les pipelines agentiques qui transmettent le travail entre des modèles spécifiques à chaque modalité.
Les changements apportés par Rho-1
La plupart des systèmes multimodaux d’aujourd’hui sont des pipelines. Un modèle central planifie, puis transfère les tâches aux spécialistes pour les images, les vidéos ou la détection. Chaque transfert ajoute une latence, et chaque spécialiste ne voit qu’une requête limitée.
Rho-1 supprime ces transferts. Le texte, la vision et les actions robotiques deviennent des tokens dans une seule fenêtre de contexte. Selon la recherche de Reka, une session non modifiée montre l’ensemble du processus. Le modèle dessine un phare, le place dans des boîtes, l’anime, transforme la vidéo en tempête de neige et explique la différence. Tout cela se passe en 5 tours, sans appel d’outil ni autre modèle secondaire.
Architecture : Deux flux, un cache KV
Chaque entrée et sortie utilise l'un des deux formats natifs suivants :
- Tokens discrètes transportent du texte, de la raisonnement symbolique et des commandes de haut niveau.
- Tokens continus transportent des latents d'images, des frames de vidéo, des actions de robot et la proprioception.
Chaque bloc de transformateur contient deux flux de poids d’experts. Le flux de compréhension gère la parsing linguistique et visuelle. Le flux de génération dénature les latents en images et vidéos. Les deux flux partagent l’attention et fonctionnent sur le même cache KV.
Lorsqu’une réponse nécessite des pixels, le flux de compréhension émet un token de transfert discrétin. Le flux de génération se charge ensuite du état accumulé complet. L’entraînement combine la prédiction du prochain token pour les séquences discrètes avec l’association de flux pour les sorties continues.
Ce design a des effets pratiques. Les boîtes de boundage apparaissent en tant que tokens de coordonnées, et non via un détecteur distinct. La première image d’un vidéo réutilise la représentation d’image dans le contexte, plutôt qu’une copie redécoupée.
Vitesse : Base vs Distillé
Le modèle de base génère des vidéos à 0,79x du temps réel (médiane), avec un flux lisible qui commence environ en 6 secondes. L’équipe Reka a mesuré 7,0 secondes pour la première clip, contre 13,8 secondes pour une pipeline multi-agents.
Une variante dégradée réduit le nettoyage de 99 étapes à 8, sans perte minimale de qualité rapportée. Elle a produit un clip de 5,3 secondes en environ une seconde. Dans les tests internes de Reka, elle correspondait au modèle d’image le plus rapide dédié. C’était également le modèle le plus rapide pour atteindre le premier mot du texte testé. Il s’agit de tests menés par le fournisseur, et non de benchmarks indépendants.
Modèle mondial et robotique
Rho-1 diffuse en continu, clip après clip. De nouvelles instructions entrent par le flux de compréhension et mettent à jour l’état au cours de la mise en œuvre. Reka illustre une ouverture se décomposant en deux continuations : « banque gauche » et « banque droite ».
Pour la robotique, les actions et les frames futurs sont décodés à partir du même état latent. Un épisode de simulation LIBERO montre que Rho-1 émet 7 canaux d'action. Pour dépasser les archives limitées de la téléopération, Reka associe Rho-1 à son Modèle d'Inversion Dynamique, qui infère les signaux de contrôle à partir de vidéos brutes.
Comment Rho-1 se compare
Les données ont été vérifiées le 5 octobre 2026 via des sources officielles.
| Caractéristique | Reka Rho-1 | ByteDance BAGEL | BAAI Emu3.5 | Google Genie 3 |
|---|---|---|---|---|
| Développeur | Reka | ByteDance Seed | BAAI | Google DeepMind |
| Paramètres | 19B | 14B au total, 7B actifs (MoT) | 34B | Non divulgué |
| Entrées | Texte, image, vidéo, actions, proximité | Texte, image | Texte et image intercalés | Prompt de texte, entrées de navigation |
| Sorties | Texte, image, vidéo, actions, proximité | Texte, image | Texte et image intercalés | Monde vidéo interactif |
| Génération de vidéos natives | Oui, limité à 672×384 | Aucun | Non (cadres d’image, pas de clips natifs) | Oui, 720p à 24 fps |
| Direction en temps réel | Oui, déploiements continus | Aucun | Aucun | Oui, événements mondiaux pouvant être demandés |
| Actions du robot | Tokens d'action continue natifs | Aucun | Demos de manipulation incarnée | Exécute des actions de navigation, ne les émet pas |
| Poids ouverts | Aucun | Oui, Apache 2.0 | Oui, Apache 2.0 | Aucun |
| Accédez dès aujourd'hui | Voir la prévisualisation de la recherche via contact@reka.ai | Hugging Face, GitHub | Hugging Face, application emu.world | Projet Genie pour les abonnés Google AI Ultra |
| Source/Ressources | Blog Reka | GitHub | Hugging Face | Blog DeepMind |
Accès Genie 3 via Project Genie ; nombre de paramètres Emu3.5 selon sa carte de modèle sur Hugging Face.
Points clés
- Rho-1 est un modèle 19B qui lit et écrit du texte, des images, des vidéos et des actions de robot.
- Deux flux d’experts partagent l’attention et une mémoire cache KV dans chaque bloc.
- Le distillation réduit le nettoyage de 99 à 8 étapes, environ 1 seconde par 5,3 s de clip.
- Formé sur 320 H100 pendant 3 mois ; la vidéo est limitée à 672×384.
- Prévisualisation de recherche seulement : aucun poids public, API ou tarif pour l’instant.
Veuillez consulter Détails techniques et le annonce sur X. Tout le crédit revient au chercheur de ce projet. De plus, n’hésitez pas à nous suivre sur Twitter et n’oubliez pas de rejoindre notre 150 000+ Mo de données sur SubReddit et Abonner notre Newsletter. Attendez ! êtes-vous sur Telegram ? Maintenant, vous pouvez également vous joindre à nous sur Telegram.
Voulez-vous collaborer avec nous pour promouvoir votre repo GitHub, votre page Hugging Face, la sortie d'un produit ou un webinaire, etc. ? Connectez-vous à nous
La publication Reka publie Rho-1 : un modèle de raisonnement omni 19B qui comprend, génère des vidéos et exécute des actions robotiques en une seule fois a été publiée en premier sur MarkTechPost.