MarkTechPost

Reka تطلق Rho-1: نموذج استدلال شامل بحجم 19B يفهم ويولّد الفيديو ويُصدر أفعال الروبوت في نموذج واحد

أطلقت Reka نموذج Rho-1، وهو نموذج استدلال شامل بحجم 19B دُرّب من الصفر. تقرأ شبكة واحدة وتولّد النصوص والصور والفيديو وأفعال الروبوت عبر ذاكرة KV cache مشتركة. ويعود متغير مُقطَّر بمقطع مدته 5.3 ثانية في حوالي ثانية…

Reka أصدرت معاينة بحثية لـ Rho-1، وهو نموذج استدلال شامل بحجم 19B دُرّب من الصفر. شبكة عصبية واحدة تفهم وتولّد النصوص والصور والفيديو، وتستدل عليها، وتُصدر أفعال الروبوت. تقدّم Reka النموذج كبديل مباشر لخطوط الأنابيب الوكيلة التي تمرر العمل بين نماذج متخصصة بكل وسائط.

ما الذي يغيّره Rho-1

معظم الأنظمة متعددة الوسائط اليوم هي خطوط أنابيب. نموذج مركزي يخطط، ثم يسند المهام إلى متخصصين للصور أو الفيديو أو الكشف. كل تسليم يضيف تأخيراً، وكل متخصص يرى طلباً ضيقاً فقط.

يزيل Rho-1 تلك التسليمات. يصبح النص والرؤية والأفعال الروبوتية رموزاً داخل نافذة سياق واحدة. وفقاً لـ أبحاث Reka، تُظهر جلسة واحدة غير معدّلة الحلقة الكاملة. يرسم النموذج منارة، ويحيطها بإطار، ويحركها، ويعدّل الفيديو إلى عاصفة ثلجية، ويشرح الفرق. كل ذلك يحدث في 5 أدوار، دون استدعاء أداة ودون نموذج ثانٍ.

البنية: مساران، ذاكرة KV cache واحدة

كل مدخلات ومخرجات النموذج تستخدم واحداً من صيغتين أصليتين:

  • الرموز المنفصلة تحمل النص والاستدلال الرمزي والأوامر عالية المستوى.
  • الرموز المتصلة تحمل كامنات الصور وإطارات الفيديو وأفعال الروبوت والحس الذاتي.

تحتفظ كل كتلة محوِّل (transformer) بمجرّي أوزان خبراء اثنين. يتعامل مسار الفهم مع اللغة والتحليل البصري. يحوّل مسار التوليد الكامنات إلى صور وفيديو عبر إزالة التشويش. يشترك كلا المسارين في الانتباه ويعملان على نفس الـ KV cache.

عندما تحتاج الإجابة إلى بكسلات، يُصدر مسار الفهم رمز تسليم منفصلاً. ثم يرسم مسار التوليد من الحالة المتراكمة الكاملة. يجمع التدريب بين التنبؤ بالرمز التالي للتسلسلات المنفصلة وتطابق التدفق (flow matching) للمخرجات المتصلة.

لهذا التصميم آثار عملية. تخرج الصناديق المحيطة كرموز إحداثيات، لا من كاشف منفصل. إطار الفيديو الأول يعيد استخدام تمثيل الصورة داخل السياق بدلاً من نسخة معاد ترميزها.

السرعة: الأساسي مقابل المقطَّر

يولّد النموذج الأساسي الفيديو بسرعة 0.79x من الزمن الحقيقي (الوسيط)، مع بدء بث قابل للمشاهدة في حوالي 6 ثوانٍ. قاس فريق Reka ثانية 7.0 لأول مقطع، مقابل 13.8 ثانية توضيحية لخط أنابيب متعدد الوكلاء.

يقلّل متغير مُقطَّر خطوات إزالة التشويش من 99 إلى 8، مع خسارة جودة طفيفة على حدّ التقرير. أعاد مقطعاً مدته 5.3 ثانية في حوالي ثانية واحدة. في اختبارات Reka الداخلية، طابق أسرع نماذج الصور المخصصة. كان أيضاً أسرع نموذج مُختبَر للوصول إلى أول رمز نصي. هذه اختبارات أُجريت من الشركة، وليست معايير مستقلة.

نموذج العالم والروبوتات

يبثّ Rho-1 باستمرار، مقطعاً بعد مقطع. تدخل التعليمات الجديدة عبر مسار الفهم وتحدّث الحالة في منتصف التنفيذ. تُظهر Reka مشهداً افتتاحياً تفرّع إلى متابعتين ‘bank left’ و‘bank right’.

بالنسبة للروبوتات، تفكّ الأفعال والإطارات المستقبلية من نفس الحالة الكامنة. تُظهر حلقة محاكاة LIBERO أن Rho-1 يُصدر 7 قنوات أفعال. للتوسع بعد سجلات التحكم عن بُعد الندرة، تقترن Reka نموذج Rho-1 مع نموذج الديناميكا العكسية (Inverse Dynamics Model)، والتي تستنتج إشارات التحكم من الفيديو الخام.

كيف تتم مقارنة Rho-1

تم التحقق من البيانات في 5 أكتوبر 2026 من مصادر رسمية.

الميزةReka Rho-1ByteDance BAGELBAAI Emu3.5Google Genie 3
المطوّرRekaByteDance SeedBAAIGoogle DeepMind
المعاملات19B14B إجمالاً، 7B نشط (MoT)34Bلم يُفصح عنها
المدخلاتنص وصورة وفيديو وأفعال وإحساس ذاتي (بروبريوسبشن)نص وصورةنص وصورة متداخلانتوجيه نصي ومدخلات ملاحة
المخرجاتنص وصورة وفيديو وأفعال وإحساس ذاتي (بروبريوسبشن)نص وصورةنص وصورة متداخلانعالم فيديو تفاعلي
توليد الفيديو الأصلينعم، بحد أقصى 672×384لالا (إطارات صور، وليست مقاطع أصلية)نعم، بدقة 720p وبتردد 24 إطاراً في الثانية
التوجيه في الوقت الفعلينعم، عمليات تنفيذ متواصلةلالانعم، أحداث عالم قابلة للتوجيه بالأوامر
أفعال الروبوترموز أفعال متصلة أصليةلاعروض توضيحية للتلاعب المجسّدينفذ أفعال ملاحة، لكنه لا يُصدرها
أوزان مفتوحةلانعم، Apache 2.0نعم، Apache 2.0لا
الوصول اليوممعاينة بحثية عبر contact@reka.aiHugging Face، GitHubHugging Face، تطبيق emu.worldProject Genie لمشتركي Google AI Ultra
المصدر/المواردمدونة RekaGitHubHugging Faceمدونة DeepMind

الوصول إلى Genie 3 عبر Project Genie؛ ويُذكر عدد معاملات Emu3.5 في بطاقة نموذجه على Hugging Face.

الخلاصة الرئيسية

  • Rho-1 هو نموذج بحجم 19B يقرأ ويكتب النصوص والصور والفيديو وأعمال الروبوتات.
  • مجرَّدا خبرة يشتركان في الانتباه وذاكرة KV واحدة في كل كتلة.
  • التقطير يخفض إزالة الضوضاء من 99 إلى 8 خطوات، أي حوالي 1 ثانية لكل مقطع مدته 5.3 ثانية.
  • دُرّب على 320 معالج H100 لمدة 3 أشهر؛ ويُحدّد الفيديو بدقة 672×384.
  • معاينة بحثية فقط: لا أوزان عامة أو واجهة API أو أسعار بعد.


اطّلع على التفاصيل التقنية و الإعلان على X. كل الفضل يعود إلى باحث هذا المشروع. كما لا تترددوا في متابعتنا على Twitter ولا تنسوا الانضمام إلى SubReddit الخاص بنا الذي يضم أكثر من 150k من محبي تعلم الآلة والاشتراك في نشرتنا البريدية. انتظر! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضًا.

هل تحتاج إلى الشراكة معنا للترويج لمستودع GitHub الخاص بك أو صفحة Hugging Face أو إطلاق منتج أو ندوة عبر الإنترنت وغيرها؟ تواصل معنا

ظهر المقال Reka تطلق Rho-1: نموذج Omni-Reasoning بحجم 19B يفهم الفيديو ويولّده ويُخرج أفعال الروبوتات في نموذج واحد أول مرة على MarkTechPost.

المصدر الأصلي

MarkTechPost

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل