Reka أصدرت معاينة بحثية لـ Rho-1، وهو نموذج استدلال شامل بحجم 19B دُرّب من الصفر. شبكة عصبية واحدة تفهم وتولّد النصوص والصور والفيديو، وتستدل عليها، وتُصدر أفعال الروبوت. تقدّم Reka النموذج كبديل مباشر لخطوط الأنابيب الوكيلة التي تمرر العمل بين نماذج متخصصة بكل وسائط.
ما الذي يغيّره Rho-1
معظم الأنظمة متعددة الوسائط اليوم هي خطوط أنابيب. نموذج مركزي يخطط، ثم يسند المهام إلى متخصصين للصور أو الفيديو أو الكشف. كل تسليم يضيف تأخيراً، وكل متخصص يرى طلباً ضيقاً فقط.
يزيل Rho-1 تلك التسليمات. يصبح النص والرؤية والأفعال الروبوتية رموزاً داخل نافذة سياق واحدة. وفقاً لـ أبحاث Reka، تُظهر جلسة واحدة غير معدّلة الحلقة الكاملة. يرسم النموذج منارة، ويحيطها بإطار، ويحركها، ويعدّل الفيديو إلى عاصفة ثلجية، ويشرح الفرق. كل ذلك يحدث في 5 أدوار، دون استدعاء أداة ودون نموذج ثانٍ.
البنية: مساران، ذاكرة KV cache واحدة
كل مدخلات ومخرجات النموذج تستخدم واحداً من صيغتين أصليتين:
- الرموز المنفصلة تحمل النص والاستدلال الرمزي والأوامر عالية المستوى.
- الرموز المتصلة تحمل كامنات الصور وإطارات الفيديو وأفعال الروبوت والحس الذاتي.
تحتفظ كل كتلة محوِّل (transformer) بمجرّي أوزان خبراء اثنين. يتعامل مسار الفهم مع اللغة والتحليل البصري. يحوّل مسار التوليد الكامنات إلى صور وفيديو عبر إزالة التشويش. يشترك كلا المسارين في الانتباه ويعملان على نفس الـ KV cache.
عندما تحتاج الإجابة إلى بكسلات، يُصدر مسار الفهم رمز تسليم منفصلاً. ثم يرسم مسار التوليد من الحالة المتراكمة الكاملة. يجمع التدريب بين التنبؤ بالرمز التالي للتسلسلات المنفصلة وتطابق التدفق (flow matching) للمخرجات المتصلة.
لهذا التصميم آثار عملية. تخرج الصناديق المحيطة كرموز إحداثيات، لا من كاشف منفصل. إطار الفيديو الأول يعيد استخدام تمثيل الصورة داخل السياق بدلاً من نسخة معاد ترميزها.
السرعة: الأساسي مقابل المقطَّر
يولّد النموذج الأساسي الفيديو بسرعة 0.79x من الزمن الحقيقي (الوسيط)، مع بدء بث قابل للمشاهدة في حوالي 6 ثوانٍ. قاس فريق Reka ثانية 7.0 لأول مقطع، مقابل 13.8 ثانية توضيحية لخط أنابيب متعدد الوكلاء.
يقلّل متغير مُقطَّر خطوات إزالة التشويش من 99 إلى 8، مع خسارة جودة طفيفة على حدّ التقرير. أعاد مقطعاً مدته 5.3 ثانية في حوالي ثانية واحدة. في اختبارات Reka الداخلية، طابق أسرع نماذج الصور المخصصة. كان أيضاً أسرع نموذج مُختبَر للوصول إلى أول رمز نصي. هذه اختبارات أُجريت من الشركة، وليست معايير مستقلة.
نموذج العالم والروبوتات
يبثّ Rho-1 باستمرار، مقطعاً بعد مقطع. تدخل التعليمات الجديدة عبر مسار الفهم وتحدّث الحالة في منتصف التنفيذ. تُظهر Reka مشهداً افتتاحياً تفرّع إلى متابعتين ‘bank left’ و‘bank right’.
بالنسبة للروبوتات، تفكّ الأفعال والإطارات المستقبلية من نفس الحالة الكامنة. تُظهر حلقة محاكاة LIBERO أن Rho-1 يُصدر 7 قنوات أفعال. للتوسع بعد سجلات التحكم عن بُعد الندرة، تقترن Reka نموذج Rho-1 مع نموذج الديناميكا العكسية (Inverse Dynamics Model)، والتي تستنتج إشارات التحكم من الفيديو الخام.
كيف تتم مقارنة Rho-1
تم التحقق من البيانات في 5 أكتوبر 2026 من مصادر رسمية.
| الميزة | Reka Rho-1 | ByteDance BAGEL | BAAI Emu3.5 | Google Genie 3 |
|---|---|---|---|---|
| المطوّر | Reka | ByteDance Seed | BAAI | Google DeepMind |
| المعاملات | 19B | 14B إجمالاً، 7B نشط (MoT) | 34B | لم يُفصح عنها |
| المدخلات | نص وصورة وفيديو وأفعال وإحساس ذاتي (بروبريوسبشن) | نص وصورة | نص وصورة متداخلان | توجيه نصي ومدخلات ملاحة |
| المخرجات | نص وصورة وفيديو وأفعال وإحساس ذاتي (بروبريوسبشن) | نص وصورة | نص وصورة متداخلان | عالم فيديو تفاعلي |
| توليد الفيديو الأصلي | نعم، بحد أقصى 672×384 | لا | لا (إطارات صور، وليست مقاطع أصلية) | نعم، بدقة 720p وبتردد 24 إطاراً في الثانية |
| التوجيه في الوقت الفعلي | نعم، عمليات تنفيذ متواصلة | لا | لا | نعم، أحداث عالم قابلة للتوجيه بالأوامر |
| أفعال الروبوت | رموز أفعال متصلة أصلية | لا | عروض توضيحية للتلاعب المجسّد | ينفذ أفعال ملاحة، لكنه لا يُصدرها |
| أوزان مفتوحة | لا | نعم، Apache 2.0 | نعم، Apache 2.0 | لا |
| الوصول اليوم | معاينة بحثية عبر contact@reka.ai | Hugging Face، GitHub | Hugging Face، تطبيق emu.world | Project Genie لمشتركي Google AI Ultra |
| المصدر/الموارد | مدونة Reka | GitHub | Hugging Face | مدونة DeepMind |
الوصول إلى Genie 3 عبر Project Genie؛ ويُذكر عدد معاملات Emu3.5 في بطاقة نموذجه على Hugging Face.
الخلاصة الرئيسية
- Rho-1 هو نموذج بحجم 19B يقرأ ويكتب النصوص والصور والفيديو وأعمال الروبوتات.
- مجرَّدا خبرة يشتركان في الانتباه وذاكرة KV واحدة في كل كتلة.
- التقطير يخفض إزالة الضوضاء من 99 إلى 8 خطوات، أي حوالي 1 ثانية لكل مقطع مدته 5.3 ثانية.
- دُرّب على 320 معالج H100 لمدة 3 أشهر؛ ويُحدّد الفيديو بدقة 672×384.
- معاينة بحثية فقط: لا أوزان عامة أو واجهة API أو أسعار بعد.
اطّلع على التفاصيل التقنية و الإعلان على X. كل الفضل يعود إلى باحث هذا المشروع. كما لا تترددوا في متابعتنا على Twitter ولا تنسوا الانضمام إلى SubReddit الخاص بنا الذي يضم أكثر من 150k من محبي تعلم الآلة والاشتراك في نشرتنا البريدية. انتظر! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضًا.
هل تحتاج إلى الشراكة معنا للترويج لمستودع GitHub الخاص بك أو صفحة Hugging Face أو إطلاق منتج أو ندوة عبر الإنترنت وغيرها؟ تواصل معنا
ظهر المقال Reka تطلق Rho-1: نموذج Omni-Reasoning بحجم 19B يفهم الفيديو ويولّده ويُخرج أفعال الروبوتات في نموذج واحد أول مرة على MarkTechPost.