MarkTechPost

Reka veröffentlicht Rho-1: Ein 19B-Omni-Reasoning-Modell, das versteht, Videos erstellt und Robotaktionen ausgibt.

Reka hat Rho-1 veröffentlicht – ein 19B-Modell für umfassendes Denken, das von Grund auf trainiert wurde. Ein Netzwerk liest und generiert Text, Bilder, Videos sowie Roboterhandlungen über einen gemeinsamen KV-Cache.…

Reka hat eine Forschungsvorstellung von Rho-1 veröffentlicht, einem 19B-omni-reasoning-Modell, das von Grund auf trainiert wurde. Ein einzelnes neuronales Netzwerk versteht und generiert Text, Bilder und Videos, denkt über sie nach und liefert robotische Aktionen. Reka betrachtet dies als direkten Ersatz für agentische Pipeline, die Arbeit zwischen spezifischen Modelltypen austauschen.

Was Rho-1 verändert

Die meisten Multimodal-Systeme von heute sind Pipeline-Architekturen. Ein zentrales Modell plant anschließend die Aufgaben und übergibt sie den Spezialisten für Bilder, Videos oder Detektion. Jeder Übergang führt zu Latenzzeit, und jeder Spezialist erhält nur eine sehr begrenzte Anfrage.

Rho-1 entfernt diese Handoff-Prozesse. Text, Vision und Roboteraktionen werden zu Tokens innerhalb eines einzigen Kontextfensters. Laut Rekas Forschung zeigt eine unverarbeitete Sitzung den vollen Prozess. Das Modell zeichnet ein Leuchtturm, umschließt es in Kästchen, animiert es und bearbeitet das Video zu einem Schneesturm – und erklärt die Unterschiede. Alles geschieht in 5 Turns, ohne Toolaufruf und ohne zweites Modell.

Architektur: Zwei Ströme, eine KV-Cache

Jeder Eingabe- und Ausgabepunkt verwendet einen von zwei nativen Formaten:

  • Discrete Tokens tragen Text, symbolisches Denken und Hochlevel-Commands.
  • Kontinuierliche Tokens tragen Bildlatents, Video-Frames, Roboter-Aktionen und Propriozeptionen.

Jeder Transformierungsblock enthält zwei Expert-Waage-Ströme. Der Verständnis-Strang übernimmt die Sprach- und visuelle Parsing. Der Generations-Strang entfernt Latents in Bilder und Videos. Beide Ströme teilen die Aufmerksamkeit und arbeiten über denselben KV-Cache.

Wenn eine Antwort Pixels benötigt, emittiert der Verständigkeitsstrom ein diskretes Handoff-Token. Der Generierungstrom dann erstellt aus dem vollständig angesammelten Zustand. Das Training kombiniert die Vorhersage des nächsten Tokens für diskrete Sequenzen mit der Flussmatching-Technik für kontinuierliche Ausgaben.

Dieses Design hat praktische Effekte. Die Bildrahmen werden als Koordinaten-Token ausgegeben, und nicht von einem separaten Detektor. Das erste Bild eines Videos verwendet die in-context-Imagedarstellung anstatt einer neuen Encodierung.

Schwung: Basis vs. Entkoppelt

Das Basismodell erzeugt Videos mit einer Geschwindigkeit von 0,79x im Echtzeitverhältnis (Mittelwert), wobei die anschaubare Stream-Verfassung etwa 6 Sekunden nach Beginn stattfindet. Das Team von Reka erzielte für den ersten Clip eine Dauer von 7,0 Sekunden, während für einen Multi-Agent-Pipeline ein illustrativer Zeitraum von 13,8 Sekunden verwendet wurde.

Eine verdünnte Variante reduziert die Entfernung von Unschärfen von 99 Schritten auf 8, wobei nur minimale Qualitätsverluste festgestellt wurden. Es ergab einen 5,3-sekündigen Clip in etwa einer Sekunde. In Rekas internen Tests erreichte es die schnellste spezialisierte Bildmodellierung. Es war auch das schnellste Modell, das bis zum ersten Text-Token getestet wurde. Dies sind von dem Anbieter durchgeführte Tests, keine unabhängigen Benchmarks.

Weltmodell und Robotik

Rho-1 fließt kontinuierlich, Clip nach Clip. Neue Anweisungen gelangen durch den Verständigungsfluss und aktualisieren den Zustand während des Rollouts. Reka zeigt eine Öffnung, die in „Bank links“ und „Bank rechts“ weiterführte.

Für Robotik dekodieren Aktionen und zukünftige Frames aus demselben latenten Zustand. Ein LIBERO-Simulationsepisod enthüllt, dass Rho-1 7 Aktionenschlüsse ausgibt. Um die Grenzen knapper Teleoperationstracks zu überwinden, kombiniert Reka Rho-1 mit seinem Inverse Dynamics Model, der Steuersignale aus Rohvideo inferiert.

Wie Rho-1 verglichen wird

Die Daten wurden am 5. Oktober 2026 von offiziellen Quellen überprüft.

FunktionReka Rho-1ByteDance BAGELBAAI Emu3.5Google Genie 3
EntwicklerRekaByteDance SeedBAAIGoogle DeepMind
Parameter19B14B insgesamt, 7B aktiv (MoT)34BNicht offenlegt
EingabenText, Bild, Video, Aktionen, PropriozeptionText, BildGemischtes Text und BildTextvorschlag, Navigationsinhalte
ErgebnisseText, Bild, Video, Aktionen, PropriozeptionText, BildGemischtes Text und BildInteraktives Video-Welt
Native-Video-GenerierungJa, begrenzt auf 672×384KeineNein (Bildrahmen, keine nativen Clips)Ja, 720p bei 24 fps
EchtzeitlenkungJa, kontinuierliche Rollout-PhasenKeineKeineJa, abrufbare Welterereignisse
Roboter-AktionenNative kontinuierliche HandlungstokensKeineVerkörperte Manipulation-DemosFührt Navigationsaktionen aus, emittiert sie nicht
Öffnende GewichteKeineJa, Apache 2.0Ja, Apache 2.0Keine
Erstellen Sie den Zugriff heuteUnternehmensübersicht durch contact@reka.aiHugging Face, GitHubHugging Face, emu.world AppProject Genie für Google AI Ultra-Abonnenten
Quelle/RessourcenReka BlogGitHubHugging FaceDeepMind-Blog

Zugriff auf Genie 3 durch Project Genie; Parameterzahl für Emu3.5 gemäß seiner Hugging Face-Modellkarte.

Wichtigste Erkenntnisse

  • Rho-1 ist ein 19B-Modell, das Text, Bild, Video und Roboteraktionen liest und schreibt.
  • Zwei Expertenströme teilen die Aufmerksamkeit und eine KV-Cache pro Block.
  • Die Destillation reduziert die Unschärfe von 99 auf 8 Schritte, etwa 1 Sekunde pro 5,3 Sekunden-Clip.
  • Trainiert auf 320 H100s über 3 Monate; das Video wird auf 672×384 begrenzt.
  • Nur Forschungsvorstellung: Es gibt noch keine öffentlichen Gewichte, API oder Preise.


Schauen Sie sich die technischen Details und das Ankündigung auf X an. Der gesamte Dank gilt dem Forscher dieses Projekts. Folgen Sie uns auch gerne auf Twitter und vergessen Sie nicht, sich bei unserem 150k+ML SubReddit anzumelden sowie unseren Newsletter zu abonnieren. Warte! Sind Sie auf Telegram? Jetzt können Sie uns auch auf Telegram beitreten.

Möchten Sie mit uns zusammenarbeiten, um Ihre GitHub-Repo, Hugging Face-Seite, Produktveröffentlichung oder Webinar zu promoten? Beziehen Sie Kontakt mit uns auf

Die Nachricht Reka veröffentlicht Rho-1: Ein 19B-Omni-Reasoning-Modell, das versteht, Videos erstellt und Robotaktionen ausgibt – alles in einem erschien zunächst auf MarkTechPost.

Originalquelle

MarkTechPost

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten