Rekas AI-Modell Rho-1 verarbeitet Text, Bilder, Videos und Robotsteuerung in einem einzigen Modell
Matthias Bastian
Das LinkedIn-Profil von Matthias Bastian ansehen
5. Oktober 2026Reka AI hat eine Forschungsvorstellung von Rho-1 veröffentlicht. Das 19-Milliarden-Parametergroße Omni-Modell verarbeitet und generiert Text, Bilder, Videos sowie Robotersteuerungsaktionen in einem einzigen neuronalen Netzwerk. Im Gegensatz zu den meisten AI-Systemen, die Aufgaben an spezialisierte Modelle weitergeben, führt Rho-1 alle Modi als Tokens in einem gemeinsamen Kontextfenster aus, ohne Toolanrufe oder externe Modelle. Das Modell generiert kontinuierliches Video in Echtzeit und reagiert auf neue Anweisungen sofort, ohne zu neu starten.
Die gleichen Gewichte, die die Kamerabilder vorhersagen, bestimmen auch die Bewegungen des Roboters. Um mit den knappen Trainingsdaten für Roboter umzugehen, hat Reka AI ein Invers-Dynamikmodell entwickelt, das Steuerzeichen aus gewöhnlichen Internetvideos abruft. Rho-1 wurde über etwa drei Monate auf 320 H100-GPUs trainiert.
Reka AI ist nicht neu im Bereich multimodaler KI. Im April 2024 veröffentlichte das Unternehmen Reka Core, ein multimodaler Sprachmodell, der bei Benchmarken mit GPT-4, Claude 3 und Gemini Ultra konkurriert. Die Veröffentlichung passt zu einem umfassenderen Fortschritt in der KI-Forschung hin zu sogenannten Weltmodellen.
AI-News ohne Hype – von Menschen zusammengestellt
Abonnieren Sie THE DECODER, um eine Werbefreie Lektüre, einen wöchentlichen AI-Bulletin, unseren exklusiven „AI Radar“-Report sechsmal pro Jahr, Zugang zum vollständigen Archiv und Zugang zur Kommentarspalte zu erhalten.
Quelle: Reka AI