MarkTechPost

Reka lance Rho-1 : un modèle omni-réfléchissant de 19B qui comprend, génère des vidéos et produit des actions robotiques en une seule…

Reka a publié Rho-1, un modèle de raisonnement omniscient de 19B par unité de calcul, entraîné depuis zéro. Un réseau lit et génère du texte, des images, des vidéos et des actions robotiques via une mémoire partagée KV.…

Reka a publié une preview de recherche de Rho-1, un modèle de raisonnement omnidimensionnel de 19B paramètres entraîné depuis zéro. Un seul réseau neural comprend et génère du texte, des images et des vidéos, raisonne à leur sujet, et produit des actions robotiques. Reka le considère comme un remplaçant direct pour les pipelines agentiques qui transmettent le travail entre des modèles spécifiques à chaque modalité.

Les changements apportés par Rho-1

La plupart des systèmes multimodaux d’aujourd’hui sont des pipelines. Un modèle central planifie, puis transfère les tâches aux spécialistes pour les images, les vidéos ou la détection. Chaque transfert ajoute une latence, et chaque spécialiste ne voit qu’une requête limitée.

Rho-1 supprime ces transferts. Le texte, la vision et les actions robotiques deviennent des tokens dans une seule fenêtre de contexte. Selon la recherche de Reka, une session non modifiée montre l’ensemble du processus. Le modèle dessine un phare, le place dans des boîtes, l’anime, transforme la vidéo en tempête de neige et explique la différence. Tout cela se passe en 5 tours, sans appel d’outil ni autre modèle secondaire.

Architecture : Deux flux, un cache KV

Chaque entrée et sortie utilise l'un des deux formats natifs suivants :

  • Tokens discrètes transportent du texte, de la raisonnement symbolique et des commandes de haut niveau.
  • Tokens continus transportent des latents d'images, des frames de vidéo, des actions de robot et la proprioception.

Chaque bloc de transformateur contient deux flux de poids d’experts. Le flux de compréhension gère la parsing linguistique et visuelle. Le flux de génération dénature les latents en images et vidéos. Les deux flux partagent l’attention et fonctionnent sur le même cache KV.

Lorsqu’une réponse nécessite des pixels, le flux de compréhension émet un token de transfert discrétin. Le flux de génération se charge ensuite du état accumulé complet. L’entraînement combine la prédiction du prochain token pour les séquences discrètes avec l’association de flux pour les sorties continues.

Ce design a des effets pratiques. Les boîtes de boundage apparaissent en tant que tokens de coordonnées, et non via un détecteur distinct. La première image d’un vidéo réutilise la représentation d’image dans le contexte, plutôt qu’une copie redécoupée.

Vitesse : Base vs Distillé

Le modèle de base génère des vidéos à 0,79x du temps réel (médiane), avec un flux lisible qui commence environ en 6 secondes. L’équipe Reka a mesuré 7,0 secondes pour la première clip, contre 13,8 secondes pour une pipeline multi-agents.

Une variante dégradée réduit le nettoyage de 99 étapes à 8, sans perte minimale de qualité rapportée. Elle a produit un clip de 5,3 secondes en environ une seconde. Dans les tests internes de Reka, elle correspondait au modèle d’image le plus rapide dédié. C’était également le modèle le plus rapide pour atteindre le premier mot du texte testé. Il s’agit de tests menés par le fournisseur, et non de benchmarks indépendants.

Modèle mondial et robotique

Rho-1 diffuse en continu, clip après clip. De nouvelles instructions entrent par le flux de compréhension et mettent à jour l’état au cours de la mise en œuvre. Reka illustre une ouverture se décomposant en deux continuations : « banque gauche » et « banque droite ».

Pour la robotique, les actions et les frames futurs sont décodés à partir du même état latent. Un épisode de simulation LIBERO montre que Rho-1 émet 7 canaux d'action. Pour dépasser les archives limitées de la téléopération, Reka associe Rho-1 à son Modèle d'Inversion Dynamique, qui infère les signaux de contrôle à partir de vidéos brutes.

Comment Rho-1 se compare

Les données ont été vérifiées le 5 octobre 2026 via des sources officielles.

CaractéristiqueReka Rho-1ByteDance BAGELBAAI Emu3.5Google Genie 3
DéveloppeurRekaByteDance SeedBAAIGoogle DeepMind
Paramètres19B14B au total, 7B actifs (MoT)34BNon divulgué
EntréesTexte, image, vidéo, actions, proximitéTexte, imageTexte et image intercalésPrompt de texte, entrées de navigation
SortiesTexte, image, vidéo, actions, proximitéTexte, imageTexte et image intercalésMonde vidéo interactif
Génération de vidéos nativesOui, limité à 672×384AucunNon (cadres d’image, pas de clips natifs)Oui, 720p à 24 fps
Direction en temps réelOui, déploiements continusAucunAucunOui, événements mondiaux pouvant être demandés
Actions du robotTokens d'action continue natifsAucunDemos de manipulation incarnéeExécute des actions de navigation, ne les émet pas
Poids ouvertsAucunOui, Apache 2.0Oui, Apache 2.0Aucun
Accédez dès aujourd'huiVoir la prévisualisation de la recherche via contact@reka.aiHugging Face, GitHubHugging Face, application emu.worldProjet Genie pour les abonnés Google AI Ultra
Source/RessourcesBlog RekaGitHubHugging FaceBlog DeepMind

Accès Genie 3 via Project Genie ; nombre de paramètres Emu3.5 selon sa carte de modèle sur Hugging Face.

Points clés

  • Rho-1 est un modèle 19B qui lit et écrit du texte, des images, des vidéos et des actions de robot.
  • Deux flux d’experts partagent l’attention et une mémoire cache KV dans chaque bloc.
  • Le distillation réduit le nettoyage de 99 à 8 étapes, environ 1 seconde par 5,3 s de clip.
  • Formé sur 320 H100 pendant 3 mois ; la vidéo est limitée à 672×384.
  • Prévisualisation de recherche seulement : aucun poids public, API ou tarif pour l’instant.


Veuillez consulter Détails techniques et le annonce sur X. Tout le crédit revient au chercheur de ce projet. De plus, n’hésitez pas à nous suivre sur Twitter et n’oubliez pas de rejoindre notre 150 000+ Mo de données sur SubReddit et Abonner notre Newsletter. Attendez ! êtes-vous sur Telegram ? Maintenant, vous pouvez également vous joindre à nous sur Telegram.

Voulez-vous collaborer avec nous pour promouvoir votre repo GitHub, votre page Hugging Face, la sortie d'un produit ou un webinaire, etc. ? Connectez-vous à nous

La publication Reka publie Rho-1 : un modèle de raisonnement omni 19B qui comprend, génère des vidéos et exécute des actions robotiques en une seule fois a été publiée en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original