المؤلف: ما شياو نينغ
تحرير:岑 فنغ
في 27 سبتمبر، ستنطلق مؤتمرات IROS 2026 في بيتسبرغ. وبعد غياب دام 31 عامًا، يعود IROS إلى مدينة الحديد والصلب هذه. وباعتباره أحد أكبر المؤتمرات الأكاديمية في مجال الروبوتات على مستوى العالم، بلغ عدد الأوراق البحثية المدرجة في جدول أعماله الرسمي هذا العام 1933 ورقة. وإذا نظرنا إلى ما يقرب من ألفي ورقة بحثية هذه كما لو كانت مبسوطة أمامنا، فإنها تبدو أكثر شبهاً بمقطع عرضي لأبحاث الروبوتات في عام 2026: من التعلم المعزز والتعلم بالمحاكاة، إلى تخطيط المسارات والإدراك البصري والتحكم الحركي والتلاعب الدقيق، وصولاً إلى الروبوتات البشرية واللمس والنماذج الكبيرة، فقد ظهرت تقريبًا جميع المسارات التقنية المهمة في مجال الروبوتات خلال السنوات الماضية في هذه الخريطة في آن واحد. لكن ما يستحق الانتباه حقًا ليس تلك الكلمات المفتاحية مثل Humanoid أو VLA أو World Model التي تجذب انتباه الصناعة ووسائل الإعلام بسهولة أكبر. فبعد إجراء تصنيف متعدد التسميات للأوراق الـ 1933، يتضح أن الأوراق المتعلقة بـ Robot Learning / Embodied AI تبلغ حوالي 809 أوراق، وNavigation / Planning عددُها 564، وPerception / Vision عددُها 556، وControl / Dynamics عددُها 546، وManipulation عددُها 520، بينما تبلغ الأوراق المتعلقة بـ Humanoid / Legged حوالي 213 ورقة. ونظرًا لأن ورقة بحثية واحدة قد تتناول عدة اتجاهات في آن واحد، فلا يمكن جمع هذه الأرقام ببساطة، لكنها تثبت أمرًا واحدًا: أبحاث الروبوتات لم تُعَد دمجها في "مسألة ذكاء اصطناعي" واحدة بسبب دخول النماذج الكبيرة. وعلى العكس من ذلك، فإن التعلم والإدراك والتخطيط والتحكم والتلاعب تتشابك اليوم بكثافة غير مسبوقة. وفي خلفية حماس الجموع المتوافد على AGI، أطلقت هذه الأوراق الـ近两千 إشارة واحدة:النماذج الكبيرة لم“يأكل”علم الروبوتات.على العكس تمامًا، فبعد عامين من الانطلاق المحموم في الاتجاه من الطرف إلى الطرف، تحاول أبحاث الروبوتات، من خلال "نهضة الطبقة الوسطى" القائمة على الهندسة ثلاثية الأبعاد والاستدلال الرمزي والتحكم الأساسي، أن تستعيد في بيتسبرغ ذلك الروح الفيزيائية التي حجبتها البكسلات والرموز (Token)." ربما السؤال الحقيقي الذي يستحق الطرح بشأن IROS 2026 ليس "هل تحل النماذج الضخمة محل علم الروبوتات التقليدي"، بل هل تدخل أبحاث الروبوتات مرحلة نظامية أكثر تعقيدًا.
01
لم تُحِلّ الذكاء الاصطناعي محل علم الروبوتات التقليدي،
بل إنها تُعاد إلى موضعها من جديد
إذا ألقينا نظرة أعمق على العلاقات المتقاطعة بين هذه الأوراق البحثية، فستصبح التغييرات الحقيقية بعد دخول النماذج الكبيرة إلى مجال الروبوتات أكثر وضوحًا. هناك حوالي 276 ورقة بحثية ظهرت فيها مصطلحات Robot Learning وManipulation معًا، و269 ورقة تتقاطع مع Perception، و225 ورقة تتقاطع مع Navigation / Planning، و221 ورقة تتقاطع أيضًا مع Control / Dynamics. لم تؤد طرق التعلم إلى سحق بسيط للوحدات التقنية الأصلية في الروبوتات، بل أصبحت مدمجة بشكل أعمق فأعمق في هذه المسائل التقليدية. يتجلى هذا التغيير أولاً في التخطيط. يقدم Jorge Mendez-Mendez من جامعة ستوني بروك في 《دراسة منهجية للنماذج اللغوية الكبيرة لتخطيط المهام والحركة باستخدام PDDLStream》 في هذه الدراسة، تم اختبار أداء نماذج اللغة الكبيرة بعد دمجها في أطر Task and Motion Planning التقليدية. ولم يخلص البحث إلى أن «النماذج الكبيرة يمكنها أن تحل محل المخطِّط مباشرة»، بل أظهر أن القيود الهندسية وجدوى الحركة ومنطق التنفيذ لا تزال تتطلب مشاركة أنظمة التخطيط التقليدية. وهذا أمر بالغ الدلالة. فنموذج اللغة الكبير يمكنه فهم معنى «انقل الكوب إلى الجانب الآخر من الطاولة»، لكن عندما ينفّذ الروبوت ذلك فعليًا، لا بد أيضًا من الإجابة عن أسئلة مثل: هل سيصطدم الذراع الآلية؟ هل المفاصل قادرة على الوصول؟ هل يمكن تنفيذ المسار؟ وهل طرأ تغيير على البيئة الحالية. وهكذا تتحول المسألة من «هل يمكن لنموذج اللغة الكبير أن يحل محل المخطِّط» إلى كيف ينبغي توزيع الأدوار بينهما. وتظهر ظاهرة مماثلة أيضًا في الجانب الإدراكي لنماذج VLA، وذلك في الأوراق المرشحة لجائزة أفضل ورقة في مجال Cognitive Robotics ضمن مؤتمر IROS 2026، ومنها GeoVLA: Empowering 3D التمثيلات في نماذج الرؤية واللغة والفعلالمنجز بتعاون بين جامعة تيانجين وشركة Yuanli Lingji وجامعة تسينغهوا، ومن بين مؤلفيهشيه بينمن شركة Yuanli Lingji وشيه هاومن جامعة تسينغهوا. يستهدف العمل تحديدًا مشكلة الاعتماد المفرط لـ VLA الحالية على الرؤية ثنائية الأبعاد: فأنظمة VLA التقليدية تولّد عادةً الأفعال مباشرةً من صور RGB والتعليمات اللغوية، لكن الروبوتات الحقيقية تواجه عالمًا ثلاثي الأبعاد، حيث يمكن أن تؤثر ارتفاعات الأجسام وأحجامها وتغيّرات زاوية الكاميرا مباشرةً على الالتقاط. ولم تقتصر GeoVLA على مجرد تكبير النموذج، بل أضافت صراحةً معلومات العمق والهندسة ثلاثية الأبعاد، مستخدمةً التمثيل 3D مع ميزات الرؤية واللغة معًا لتوليد الأفعال. بعبارة أخرى، بعد أن تقوّت النماذج الكبيرة، عادت «الهندسة المكانية»، الأكثر تقليدية في علم الروبوتات، لتُستكمل من جديد. وقد ظهرت ظاهرة مماثلة في جانب التحكم أيضًا. فورقة تدريب سياسات الروبوتات السريعة باستخدام نماذج الأساس البطيئةمن فريق من جامعة وسط فلوريدا ومعهد الهندسة التكنولوجية الهندي في كانبور وجامعة باث وجامعة ماريلاند في باركstudied تتناول مشكلة واقعية جدًا: نموذج الأساس الكبير يمكنه توفير معرفة وتعميم أقوى، لكن سرعة الاستدلال لديه بطيئة للغاية، ما يجعله غير مناسب للتشغيل المستمر داخل حلقة التحكم عالية التردد للروبوت. لذلك جعل الباحثون النماذج الكبيرة تشارك أكثر في التدريب، ثم تعلّموا سياسة روبوتية أخف وأسرع تتولى التنفيذ الفعلي. فإذا تأخر النموذج اللغوي بضع مئات من المللي ثانية في الإجابة عن سؤال، فسيرى المستخدم عادةً أنه أبطأ قليلًا فقط؛ أما إذا تأخر الروبوت بضع مئات من المللي ثانية في التحرك أثناء الالتقاط أو التلامس أو الحفاظ على التوازن، فقد تكون المهمة قد فشلت بالفعل. فالقدرة النموذجية والتحكم في الزمن الحقيقي لم تكونا يومًا المسألة نفسها. وأبحاث اللمس الأقرب إلى العالم المادي تظهر اتجاهًا مشابهًا أيضًا. فورقةفانغ شينمينومن معه من جامعة كولورادو في دنفر، المنجزة بالتعاون مع فريق من جامعة كينيسو ستيت، DexTact: نموذج أساس بصري-لمسي للإمساك باليد الماهرةتضع الرؤية واللمس معًا في مسألة الالتقاط باليد الرشيقة. فما تدرسه لم يعد مجرد «كيف تخبر الصورة الروبوت بموقع الجسم»، بل «ما الذي يمكن للنظام إدراكه بعد أن تلامس اليد الجسم». وهنا يوضع نموذج الأساس واللمس والتلاعب الرشيق والتحكم في نظام واحد يُفهم ككل. لذا فإن التغيير الجدير بالملاحظة حقًا في عام 2026 ليس أن علم الروبوتات تُستبدل بالذكاء الاصطناعي. والأدق قولًا إن الذكاء الاصطناعي بدأ يتعمق في أكثر جوانب علم الروبوتات تقليدية، وهو في الوقت نفسه يُعاد تشكيله بواسطة هذه المسائل التقليدية.02
انتقال VLA من مرحلة «إثبات القدرة» إلى مرحلة «سدّ نقاط الضعف»
إذا كان السؤال الجوهري لـ VLA خلال العامين الماضيين هو "هل يمكن ل_model واحد موحد أن يفهم الرؤية واللغة ويولّد أفعال الروبوت مباشرة"، فإننا في IROS 2026 نجد أن محور البحث قد تحرك بوضوح نحو اتجاه آخر: بما أن النماذج أصبحت قادرة على ذلك، فإن المطلوب الآن هو كيفية جعلها أسرع وأكثر استقراراً وأكثر ملاءمة للروبوتات الحقيقية. في إحصائياتنا متعددة التسميات، بلغ عدد الأوراق البحثية المتعلقة بـ VLA وVLM وLLM وFoundation Model نحو 162 ورقة، أي 8.4% من إجمالي الأوراق؛ منها نحو 82 ورقة تتناول صراحةً VLA. هذا الحجم كافٍ بالفعل لتشكيل خط بحثي مستقل. لكن القضايا التي تركز عليها لم تبقَ عند سؤال "هل يمكن للنموذج أن يصبح أكبر"، بل تفرقت بسرعة نحو قضايا الكفاءة، والفهم ثلاثي الأبعاد، والذاكرة طويلة المدى، وتغير زاوية الرؤية، والتكيف مع البيئات الواقعية، والسلامة. والمثال الأكثر مباشرة هو Shallow-π: تقطيع المعرفة لـ VLAs القائمة على التدفق。تأتي هذه الورقة البحثية من 42dot وجامعة سيول وSamsung Research، وقد ترشحت لجائزة IROS 2026 Best Paper / Best Student Paper Award. إنها لا تعالج مسألة كيفية تدريب نموذج VLA أكبر، بل تعالج بالضبط مشكلة ضخامة النموذج وبطء الاستدلال، وذلك عن طريق ضغط نموذج VLA عبر تقطير المعرفة، مما يجعل النموذج أكثر ملاءمة للنشر على الروبوتات الحقيقية والأجهزة الطرفية. وهذا يكشف أول قيد واقعي تواجهه نماذج VLA بعد دخولها عالم الروبوتات: فالنموذج لا ينبغي أن يكون «ذكيًا» فحسب، بل يجب أيضًا أن يكون سريعًا بما يكفي. ومن أوجه القصور الأخرى هو فهم الفضاء ثلاثي الأبعاد. فنموذج GeoVLA المذكور سابقًا والذي طوّره فريق جامعة تيانجين وشركة 原力灵机 وفريق جامعة تسينغهوا، هو في جوهره محاولة لمنح نماذج VLA القدرة الهندسية الأكثر تقليدية في علم الروبوتات. بل إن تغيّر زاوية الرؤية نفسه أصبح يمثل مشكلة مستقلة بذاتها.AnyCamVLA: تكيّف الكاميرا بدون تدريب لنماذج اللغة والرؤية والفعل المتينة تجاه تغيّر زاوية الرؤية من فريق جامعة سيول الوطنية ومعهد MIT. يبحث في سبب سهولة فشل نموذج VLA المدرَّب مسبقًا عندما يتغير موضع الكاميرا، وما إذا كان يمكن التكيّف مع زاوية كاميرا جديدة دون إعادة تدريب النموذج بالكامل. في النشر الفعلي، تكون أخطاء تركيب الكاميرا، واختلافات منصة الروبوت، وتغيرات زاوية الرؤية أمرًا شائعًا جدًا، وأي سياسة لا تعمل إلا من زاوية ثابتة يصعب أن تتعمم حقًا. أما المهام طويلة الأمد فتكشف عن فجوة من نوع آخر: النموذج ينفّذ الأفعال، لكنه لا يجمع الخبرة بالضرورة.ذاكرة طويلة الأمد للوكلاء القائمين على VLA في تنفيذ المهام في العالم المفتوح أُنجز بواسطة فرق من جامعة نانجينغ وجامعة واسيدا وشركة LimX Dynamics وجامعة تشجيانغ وغيرها، وهو يربط الذاكرة طويلة الأمد مباشرة بوكيل VLA، بحيث يحفظ النظام المسارات والخبرات التي أنجزها سابقًا ويستدعيها لاحقًا. لم تعد المشكلة هنا هي نجاح عملية إمساك واحدة من عدمه، بل ما إذا كان الروبوت قادرًا على تذكّر "ما حدث سابقًا" في مهام طويلة متسلسلة. ومن جامعة سونغكيونكوان (Sungkyunkwan University): RoboBRIDGE: إطار معياري لربط السياسات بوكلاء روبوتيين أقوياء في العالم الحقيقي تتقدم خطوة أبعد. فهي لم تحاول إعادة تدريب VLA أقوى، بل أضافت حول السياسة المدرَّبة مسبقًا مكوّنات: Monitor وPerceptor وPlanner وController وRobot Interface. عند فشل التنفيذ، يتولى Monitor اكتشاف المشكلة؛ وعند تغيّر البيئة، يعيد Planner التخطيط؛ ويحدّث Perceptor المشهد؛ ثم يحوّل Controller السياسة عالية المستوى إلى أفعال فعلية. هذا الهيكل يوضّح جيدًا ما يجري في المرحلة التالية من VLA. بدأت الأبحاث تتحول من "بناء مُنبئ أفعال أقوى" إلى كيفية بناء نظام كامل حوله. لذا، قد لا يقتصر التنافس القادم في VLA على التوسع (scaling) فحسب. فالمسألة الأكبر تتحول إلى system engineering: كيف يعمل VLA مع الإدراك والذاكرة والتخطيط والتحكم والعتاد معًا، ويتحول في النهاية من مجرد نموذج قادر على إخراج أفعال إلى نظام روبوتي قادر على العمل لفترة طويلة.03
الروبوتات تعيد نمو "الطبقة الوسطى"
إذا كانت المرحلة الأولى من VLA تسعى إلى توحيد الإدراك واللغة والفعل في نموذج واحد، فإن أحد خيوط البحث الأخرى التي تتضح أكثر فأكثر في IROS 2026 هو: بدأ الباحثون مجددًا بإضافة هياكل جديدة عمدًا في منتصف هذه السلسلة من الطرف إلى الطرف. ومن بين 1933 ورقة، بلغ عدد أوراق Reasoning / Memory ذات الصلة نحو 119 ورقة، أي 6.2% من إجمالي الأوراق؛ منها 64 ورقة تتناول Reasoning صراحة، و36 ورقة تتناول Memory. وقد شكّلت هذه الأوراق جلسات (Session) محددة بوضوح، منها Agents and Memory for Robust VLA Manipulation وConstraint-Guided Reasoning for Long-Horizon Manipulation وLLM Agents Reasoning Through Robot Tasks وRepresenting 3D Space for Robot Reasoning. هذه المسألة في ذاتها تستحق التساؤل: إذا كانت النماذج من الطرف إلى الطرف قادرة فعلًا على توليد الأفعال مباشرة من الرؤية واللغة، فلماذا تحتاج الروبوتات إلى Reasoning وMemory وPlanner، بل وإعادة إدخال Symbolic Constraint و3D representation صريحة؟ من الأسباب أن المهام الروبوتية، بمجرد أن تطول، لا تكفي عبارة "ما يُرى في هذا الإطار الحالي".TempoFit: ذاكرة KV زمنية طبقية قابلة للتوصيل والتشغيل المباشر للتحكم اليدوي طويل المدى بنماذج VLA من فريق جامعة شيآن جياوتونغ - ليفربول. لم يعيد تدريب VLA أكبر، بل استغل temporal KV memory داخل النموذج نفسه، ليسمح للسياسات الحالية بحفظ المعلومات التاريخية واستدعائها عبر الزمن. لكن ما يحتاج الروبوت فعلًا إلى تذكّره لا يقتصر على "ما رآه في الماضي". وفريق من جامعة طوكيو للعلوم في ورقته GaussMemory: ذاكرة مشهد غاوسي ثلاثية الأبعاد (3D) مدفوعة بالمهام للتحكم اليدوي الروبوتي طويل المدىيضع Memory أيضًا في الفضاء ثلاثي الأبعاد. فالجسم حتى لو حُجب مؤقتًا، لا يجب أن يختفي من "عالم" الروبوت لمجرد أن الكاميرا لا تراه في هذه اللحظة؛ والجسم الذي نُقل بالفعل يحتاج إلى تحديث موقعه في الوقت المناسب. لذا فإن الذاكرة في الروبوتات ليست مطابقة تمامًا لذاكرة السياق في النماذج اللغوية؛ إذ يجب أن تتوافق باستمرار مع الفضاء ثلاثي الأبعاد الحقيقي. ومشكلة الاستدلال كذلك حالة مماثلة.DualCoT-VLA: سلسلة تفكير بصرية-لغوية عبر الاستدلال المتوازي لنماذج الرؤية-اللغة-الفعل أُنجز بالتعاون بين جامعة هونغ كونغ للعلوم والتكنولوجيا (قوانغجو) وهواوي. لم يكتفِ بجعل VLA يخرج الأفعال مباشرة، بل أضاف قبل توليد الفعل سلسلة تفكير بصرية (Chain-of-Thought) وأخرى لغوية: الأولى تعالج العلاقات المكانية، والثانية تعالج منطق المهمة عالي المستوى. فالتقسيم بين "المستوى العالي والمستوى المنخفض" الذي حاول النموذج من الطرف إلى الطرف الاستغناء عنه عاد بأشكال أخرى. أما الورقة المرشحة ضمن قائمة أفضل الأوراق في Cognitive Robotics بعنوان VL-Nav: نهج عصبي-رمزي للملاحة البصرية-اللغوية القائمة على الاستدلالفأنجزها أساسًا فريق من جامعة نيويورك في بافلو، والباحثة الأولى هيدو يي. تدمج VL-Nav الفهم الدلالي لنماذج الرؤية واللغة مع الاستدلال المكاني والرمزي الصريح، لتُستخدم في الملاحة بالرؤية واللغة (vision-language navigation) في البيئات المعقدة. ظهور الأساليب الرمزية (Symbolic) من جديد لا يعني أن علم الروبوتات عاد إلى عصر قائم كليًا على القواعد؛ بل إنها تتولى الجزء الذي لم تُجرب بعد النماذج الكبيرة في إنجازه باستقرار: جعل العلاقات المكانية وشروط التنفيذ والقيود أكثر وضوحًا. من Memory وReasoning إلى Geometry وPlanner وSymbolic Constraint، تستخدم هذه الأعمال تقنيات مختلفة ظاهريًا، لكنها جميعًا تحل المشكلة الهيكلية ذاتها: وجود مسافة هائلة بين الفهم الدلالي عالي المستوى والأفعال المستمرة منخفضة المستوى. لذا، فإن ظهور Reasoning وMemory وPlanner وSymbolic Constraint في IROS 2026 ليس "معاداة النهج من الطرف إلى الطرف" بقدر ما هو علم الروبوتات يعيد اختراعالطبقة الوسطىبين النماذج الكبيرة والتحكم منخفض المستوى. لم تفشل مقاربة الطرف إلى الطرف ببساطة، ولم تعد الوحدانية (المودولارية) إلى الواجهة ببساطة أيضًا. التغيير الأدق هو: مع انتقال المهام من الإمساك بخطوة واحدة إلى العمليات طويلة الأمد، ومن بيئات المختبر إلى العالم المفتوح، بدأت تظهر من جديد تدرجات هرمية في أنظمة الروبوتات.04
Manipulation
تصبح واحدة من أكثر ساحات الذكاء المُجسَّد كثافة
إذا كان VLA وReasoning وWorld Model يمثلون أكثر ما يمثل "كيف يفكر" الروبوت، فإن Manipulation أقرب إلى سؤال آخر: كيف تطبّق هذه القدرات في النهاية، عبر يد أو مخلب آلي أو ذراع روبوتية، فعلًا على العالم الفيزيائي. بلغ عدد الأوراق المتعلقة بـ Manipulation نحو 520 ورقة؛ وبعد تصفية إضافية حسب اتجاهات Dexterous Manipulation وTactile وIn-hand Manipulation وContact-rich Manipulation وغيرها، بلغ عدد الأوراق ذات الصلة نحو 225 ورقة. منها نحو 91 ورقة تتناول Tactile صراحة، و52 ورقة تتناول Dexterous Manipulation صراحة. وفي هذه الأوراق الـ 225 المرتبطة بـ Dexterous/Tactile، تتناول نحو 165 ورقة أيضًا Manipulation، و79 ورقة تتناول Learning، و57 ورقة تتناول Perception، و52 ورقة تتناول Control. فاللمس والتعلم والإدراك والتحكم تتقارب باستمرار ضمن المجموعة نفسها من مهام التلاعب. من مرشحي جوائز IROS 2026 ورقة VTAP Gripper: الجمع بين الإحساس بأطراف الأصابع وراحة نشطة بصرية-لمسية للتحكم الرشيق داخل اليد، أُنجزت بالتعاون بين فريق من جامعة بيرديو وجامعة كولومبيا، ومن بينهمهو تشي شيانمن جامعة بيرديو، إضافة إلى من جامعة كولومبياهوانغ بينغ هاو ولي يون تشووغيرهما من الباحثين. فهي لم تواصل السعي نحو يد إنسانية بارعة تزداد درجات حرّيتها اقترابًا من يد الإنسان، بل صمّمت ثلاثة أصابع مرنة قابلة لإعادة التهيئة وراحةً بصرية-لمسية نشطة، لتُنجز الإمساك والتحكم داخل اليد من خلال اللمس عند أطراف الأصابع والاتصال النشط بالراحة. والأكثر إثارة للاهتمام هنا أن التحكم البارع عالي المستوى لا يرتبط بالضرورة ببنية إنسانية ذات درجات حرّية عالية جدًا؛ فالتآزر بين البنية الميكانيكية والاتصال النشط والإدراك متعدد الأنماط قادر هو الآخر على إنتاج قدرات تحكم معقدة. ومرشّح آخر لجائزة تصميم الآلات في الروبوتات هو PDS Joint: مفصل حلزوني مزدوج بارامتري مصمم خصيصًا لليد الآلية الماهرةمن فريق مكون من خمسة باحثين في معهد بكين للتكنولوجيا. فقد انطلقوا من بنية المفصل الأدنى مستوى، وجمعوا معًا في تصميم مفاصل اليد البارعة بين البنى المرنة وصلابة المفصل والإحساس الذاتي والمعايرة بالتعلّم. من VTAP إلى PDS Joint، يمكن ملاحظة أن العتاد نفسه ما يزال بعيدًا عن الاستقرار، لكنه في المقابل أصبح يصعب فصله أكثر فأكثر عن الإدراك والتحكم والتعلّم. وفي الوقت نفسه، ينتقل اللمس من "تركيب مستشعر" إلى "الدخول في الاستراتيجية".TacVLA: دمج لمسي واعٍ بالتلامس للتلاعب القوي بنموذج الرؤية-اللغة-الفعل أُنجز بتعاون بين جامعة بيرديو والمعهد الإيطالي للتكنولوجيا، ويضم فريق بيرديو باحثين من بينهمشو تشنغ تونغ وتشانغ تشي يوانوغيرهما. فهو يُدخل اللمس مباشرة إلى VLA، بحيث تشارك المعلومات اللمسية في اتخاذ قرارات الحركة عند حدوث التلامس فعليًا؛ لأن المعلومات التي يوفرها البصر تتراجع بسرعة في مشاهد انسداد الأنابيب أو التركيب الدقيق أو التلامس المُنشأ أصلًا. أما المسار الآخر فيحاول تقليل الاعتماد على عتاد اللمس في مرحلة النشر.HapticVLA: تلاعب غني بالتلامس عبر نموذج الرؤية-اللغة-الفعل دون استشعار لمسي وقت الاستدلال من فريق معهد سكولكوفو للعلوم والتكنولوجيا. إذ يستخدمون المعلومات اللمسية في مرحلة التدريب ليتعلم النظام المعرفة التلامسية، لكنهم لا يفرضون بعد ذلك الاعتماد على مدخلات لمسية فورية في مرحلة الاستدلال. ويمثل TacVLA وHapticVLA بالضبط نهجين مختلفين: أحدهما يوصل اللمس فوريًا إلى الاستراتيجية، والآخر يستفيد من اللمس في التدريب ثم يحاول ضغط الخبرة اللمسية داخل النموذج قدر الإمكان. وفي المقابل بدأت مشكلة البيانات بالظهور. فمن بين المرشحين لجائزة Entertainment and Amusement Paper Award PianoFingering-1.5K: مجموعة بيانات واسعة النطاق لتصبيح البيانو الخبير للتعلم الآلي الماهر من فريق جامعة العلوم والتكنولوجيا في الصين، ومن مؤلفيهوانغ روي يووآخرون. فقد نظّموا التدبير الاحترافي لعزف البيانو في شكل مجموعة بيانات منظمة. ويبدو عزف البيانو أمرًا خاصًا، لكنه في الحقيقة مهمة تحكم بارع صارمة للغاية: إذ يتعين على عدة أصابع تنفيذ تلامس دقيق ومتواصل ومقيد بقوة زمنيًا في وقت قصير جدًا. ونظم هذه الحركات على مستوى الخبراء هو، في جوهره، توفير أولويات بشرية عالية الجودة للتحكم البارع في الروبوتات. فمن العتاد إلى اللمس ثم البيانات، تلتقي عدة مسارات في نهاية المطاف عند السؤال نفسه: كيف يُشكّل الروبوت قدرة تحكم حلقية مغلقة حقيقية. ومن ثمّ يتوسع التحكم البارع من "صناعة يد أفضل" إلى بناء حلقة مغلقة كاملة منالإدراك—اللمس—البيانات—الاستراتيجية—التحكم.05
Humanoid يتوسع من "المشي" إلى "العمل أثناء المشي"
قد تكون الروبوتات ذات الشكل البشري واحدة من أكثر صور الروبوتات حظًا باهتمام الصناعة ووسائل الإعلام خلال العامين الماضيين، لكن إذا أعدنا وضعها ضمن الخريطة الكاملة لأوراق IROS 2026، فسيبدو المشهد أكثر تحفظًا. ففي الإحصاءات، بلغ عدد الأوراق المتعلقة بـ Humanoid / Loco-Manipulation نحو 89 ورقة، أي 4.6% من إجمالي الأوراق. ومن بينها 46 ورقة تتقاطع مع Control، و44 ورقة تتقاطع مع Learning، و34 ورقة تخص Manipulation، و32 ورقة تخص Planning. واللافت حقًا هو أن الأسئلة المطروحة داخل هذه الأوراق تتغير. فخلال السنوات الماضية، تركزت معظم التقدمات التقنية المهمة في مجال الروبوتات ذات الشكل البشري على locomotion؛ أم يتم الآن ملاحظة دفعة أخرى من الأعمال تبدأ في وضع "الحركة" و"التلاعب" ضمن النظام نفسه. ومن أبرز الأمثلة على ذلك ULTRA: تحكم موحّد متعدد الوسائط للتنقل والمناولة الجسدية الكاملة المستقل للروبوتات البشرية. هذه الورقة البحثية من إعداد Xia Lin He من جامعة إلينوي في أوربانا-شامبين何夏麟وآخرين، بالتعاون مع باحثين من جامعة شنغهاي جياو تونغ وجامعة تسينغhua، وقد دخلت قائمة المرشحين لأفضل الأوراق المتعلقة بـ Mobile Manipulation في IROS 2026. وهي لا تقوم مجددًا بتدريب سياسة مشي أقوى، بل تجعل الروبوت ذو الشكل البشري ينجز مهامًا متسلسلة مثل الاقتراب من الأجسام والالتقاط والنقل والإفلات. الشيء الأكثر لفتًا للانتباه هنا ليس أن الروبوت أصبح أخيرًا "قادرًا على نقل الأشياء"، بل أن بنية المشكلة قد تغيرت. في locomotion وحده، الهدف الأساسي هو الحفاظ على استقرار الجسم؛ لكن بمجرد أن يحمل الروبوت جسمًا في يديه، تصبح حركات الذراع تُغيّر مركز الثقل، وتؤثر الأحمال على المشية، ويجب أن يتحقق الاتصال بباطن القدم وحركة الطرف العلوي ومهمة الإمساك في آنٍ واحد. لم يعد بإمكان "المشي" و"التعامل مع الأشياء" أن يُفصلا تمامًا.SteadyTray: تعلّم مهام موازنة الأجسام في نقل الأطباق بواسطة الروبوتات البشرية عبر التعلم المعزز المتبقي من فريق جامعة كاليفورنيا في سان دييغو، والمؤلف الأول هو黄安伦. وهي تُضخّم هذا التناقض في مهمة بديهية جدًا: أن يحمل الروبوت ذو الشكل البشري صينية ويمشي، دون أن يسقط ما فيها من أجسام. تضيف SteadyTray سياسة residual فوق سياسة locomotion قائمة بالفعل، للتعامل خصيصًا مع الاضطرابات التي يُحدثها المشية على الطرف النهائي.DreamMimic: تعلّم التنقل والمناولة الجسدية الكاملة البصرية الحركية عبر نموذج العالم أما فقد أنجزها 殷杰 من جامعة شنغهاي جياو تونغ殷杰بالتعاون مع فريق جامعة تسينغhua، حيث أدخلت الرؤية وWorld Model إلى whole-body loco-manipulation، مستخدمةً نماذج تنبؤية لمساعدة الروبوت على الحفاظ على فهمه للحالة خلال التحكم البصري طويل الأمد. كما بدأت نماذج VLA تدخل نفس المشكلة.تعلّم التنقل والمناولة للروبوت البشري مع خبراء متخصصين محدَّثين بالمسؤولية لنماذج الرؤية واللغة والفعل من فريق جامعة سيول الوطنية. تعالج هذه الدراسة مشكلة الاختلاف الكبير بين توزيعات حركات locomotion وmanipulation، بإدخال specialized experts تتحمل فيها كل خبير مسؤولية تحكم مختلفة. وهذا يؤكد مجددًا أن "العامة" لا تعني "أن كل شيء في الداخل غير مُفصَل". ومثال آخر أكثر تطرفًا هو المرشحة للجائزة Award Candidate تعلّم المهارات الرياضية للتنس للروبوتات البشرية من بيانات حركة بشرية غير مثالية. قادت هذه الدراسة 张智楷 من جامعة تسينغhua张智楷وآخرون، بالتعاون مع باحثين من جامعة بكين ومختبر شنغهاي للذكاء الاصطناعي وGalbot وجامعة دلفت للتكنولوجيا. تتطلب لعبة التنس أن يراقب الروبوت الكرة سريعة الحركة، ويتنبأ بمسارها، ويحرك جسمه، ويأرجح المضرب، مع الحفاظ على التوازن في آنٍ واحد. قد تبدو بعيدة عن نقل الحمولات في المصانع، لكنها تكشف المشكلة ذاتها: لا يكفي أن يمتلك الروبوت ذو الشكل البشري مشية مستقرة واحدة ثم "يضيف يدين" ببساطة. فالذكاء whole-body الحقيقي يتطلب أن تتحرك الأرجل والجذع والذراعان معًا حول المهمة. لذا، فإن اختزال أوراق الروبوتات ذات الشكل البشري في IROS 2026 بعبارة "Humanoid أصبح أكثر رواجًا" سيُفوّت التغيير الحقيقي. والوصف الأدق هو:يتحول مركز البحث من locomotion وحده نحو التوسع في whole-body loco-manipulation.06
World Model حار جدًا، لكنه لم يصبح بعد سائدًا
إذا نظرنا فقط إلى حجم النقاشات في مجال الروبوتات خلال العام الماضي، فقد يمنحنا World Model إحساسًا بأنه "دخل ساحة المعركة الرئيسية بالكامل". لكن بين جميع الأوراق، لم تُشر سوى 19 ورقة إلى World Model صراحةً، أي نحو 1% من إجمالي الأوراق. "الشعبية" لا تعني "الكثرة". ما يستحق الانتباه حقًا ليس عدد أوراق World Model، بل المواضع التي بدأ يظهر فيها: حركة الرباعيات الأرجل، والتعامل الدقيق مع الأجسام، والتوصيل الدقيق، والتحكم whole-body للروبوتات ذات الشكل البشري، والروبوتات الطبية، والملاحة. المرشحة لجائزة Best Paper / Best Student Paper DAWN: باركور رباعي الأرجل مقاوم للضوضاء عبر نماذج العالم المزيلة لضوضاء العمق من فريق جامعة كوريا للتكنولوجيا والتعليم. وهي لا تجعل الروبوت الرباعي الأرجل "يتخيل" فيديو أكثر واقعية، بل تستخدم World Model لنمذجة الإدراك العمقي المشوّش بالضوضاء، لمساعدة الروبوت على إنجاز parkour في البيئة الحقيقية. هنا بدأ World Model يصبح أداة لنمذجة الحالة في سلسلة الإدراك–التحكم. وفي التعامل الدقيق مع الأجسام،توسيع نماذج العالم عبر الأجسام المختلفة للمناولة البارعة باليد قادها何子浩بالتعاون مع باحثين من جامعة كاليفورنيا في سان دييغو وMIT ومؤسسات أخرى. تحاول تجاوز اختلاف مفاصل وفضاءات الحركة تمامًا بين أيدي الروبوتات المختلفة، لتتعلم قواعد أكثر عمومية حول "كيف تغيّر الحركات العالم المادي". وخلف هذا فرضية مثيرة للاهتمام: ما قد تتشاركه الروبوتات المختلفة حقًا في المستقبل ربما ليس الحركات نفسها، بلكيف تغيّر الحركات العالم。أما أنجز بالتعاون المشترك بين فرق من جامعة كاليفورنيا في سان دييغو (UC San Diego) وNVIDIA وجامعة واشنطن وجامعة جنوب كاليفورنيا. يضع هذا العمل نموذج العالم في مهمة التركيب الدقيق للتقويات. وبدلاً من جعل السياسة تحفظ عن ظهر قلب "كيفية إدخال هذا القطعة"، يأمل الباحثون في أن يتعلم النموذج "كيف ستغيّر أفعالي الحالة الحالية"، ثم استخدام التنبؤ لإنجاز التحكم. وفيما يخص الروبوتات البشرية، فإن فريق جامعة شنغهاي جياو تونغ المذكور سابقاًفأنجزت بالتعاون بين فرق UC San Diego وNVIDIA وجامعة واشنطن وجامعة جنوب كاليفورنيا. وهي تضع World Model في مهمة التوصيل الدقيق. بدلًا من جعل السياسة تحفظ عن ظهر قلب "كيف يُدخل هذا القطعة"، يأمل الباحثون أن يتعلم النموذج "كيف ستغيّر حركاتي الحالة الحالية"، ثم يستخدم التنبؤ لإتمام التحكم. وعندما نصل إلى الروبوتات ذات الشكل البشري، فمن الأوراق المذكورة سابقًا ورقة 殷杰 من جامعة شنغهاي جياو تونغمع فريق DreamMimic من جامعة تسينغهوا، نقلت World Model إلى loco-manipulation الكلي للجسم. بينما RoDyn: إتقان نموذج تفاعلي عالمي روبوتي-ديناميكي ثنائي ونصف الأبعاد (2.5D) للتحكم الآلي في الروبوتات أُنجز بتعاون بين جامعة نانيانغ التكنولوجية وجامعة تسينغهوا. تحاول RoDyn حل مشكلة واضحة في التنبؤ البصرية الثنائية الأبعاد الخالصة: كون الإطارات المستقبلية تبدو معقولة لا يعني أن العلاقات الفيزيائية صحيحة. وهي تُدخل معلومات العمق وديناميكيات الروبوت، فتجعل نتائج التنبؤ أقرب إلى تمثيل حالة قابل للاستخدام فعلاً في التحكم بالروبوتات. وهذا يشير بالضبط إلى التناقض الأكثر أهمية لـ World Model في مجال الروبوتات. ما يحتاجه الروبوت حقاً ليس مستقبلاً معقولاً بصرياً، بلمستقبلاً مشروطاً بالأفعال، وموثوقاً بما يكفي هندسياً وفيزيائياً. لذا، لم تعد مسألة World Model هذا العام مجرد: "إذا فعل الروبوت هذا، فكيف سيبدو المستقبل؟" بل بدأت تتحول إلى: "بما أنني أستطيع التنبؤ بالمستقبل، فهل يمكن لهذا التنبؤ أن يغيّر فعلاً خطوتي التالية؟" وبهذا المعنى، فإن World Model حالياً أقرب إلى مسار تقني ينتقل منالتنبؤ بالعالمإلىالمشاركة في التحكم، وليس منهجاً بات يحكم أبحاث الروبوتات.07
الروبوتات تدخل "عصر مشاكل الأنظمة"
إذا نظرنا إلى هذه الأبحاث مجتمعة، فإن أبرز ما يستحق الانتباه في IROS 2026 ليس أن أحد المسارات التقنية يحقق "الانتصار". فـ VLA لم تحل محل التخطيط والتحكم التقليديين، وWorld Model لم تصبح بعد سائدة، والروبوتات البشرية Humanoid ليست سوى جزء من خريطة أبحاث الروبوتات بأكملها. التغيير الحقيقي الجاري هو أنه بعد دخول هذه الطرق الجديدة إلى العالم الفيزيائي، أصبحت قضايا الإدراك والذاكرة والتخطيط والتحكم واللمس والسلامة والاسترداد لا مفر منها من جديد. إن نجاح النماذج اللغوية خلال السنوات الماضية جاء إلى حد كبير من توحيد عدد كبير من المهام في نموذج واحد. لكن الروبوتات مختلفة: فهي لا تحتاج فقط إلى "الفهم"، بل إلى التحرك فعلياً، والعالم الفيزيائي يكشف الأخطاء والتأخير والتماس والفشل كلها. لذا فإن IROS 2026 أشبه بإجابة عن سؤال جديد: عندما تصبح النماذج قوية بما يكفي، كيف نعيد تجميع هذه القدرات في نظام روبوتي يعمل فعلاً. هذا لا يعني أن النهج من طرف إلى طرف قد فشل، ولا أن الوحدات التقليدية استعادت السيطرة. والأدق أن الروبوتات تبحث من جديد عن الحدود بين النماذج الكبيرة والتخطيط والتحكم والعتاد. وقد لا يكون التنافس المستقبلي سوى مقارنة من يملك نموذجاً أكبر وقدرات أكثر، بل من يستطيع دمج هذه القدرات معاً بشكل مستقر فعلاً.عندما تصبح الروبوتات أكثر ذكاءً، يتحول الصعب فعلاً إلى: كيف نجعلها لا تخطئ.لتسهيل التواصل والتبادل وتبادل أخبار المؤتمر، أنشأنا مجموعة خاصة 2026 للتواصل حول المؤتمر! بالانضمام ستفتح هذه «المزايا»؟
مركز معلومات المؤتمر: مواعيد تقديم الأوراق، معايير التنسيق، سير التحكيم…… النقاط الحرارية تصلك فوراً، فلن تخاف من تفويت الموعد النهائي، وسيكون التحضير للتقديم مطمئناً تماماً.
جلسة نقاش الزملاء: زملاء من مختلف المناطق جميعهم في المجموعة، تبادل الخبرات وتبادل الأفكار وبناء العلاقات، فنحن رفاق درب البحث العلمي.
محطة الإمداد بالآفاق: أحدث نتائج الأبحاث والاتجاهات الساخنة بشكل متزامن، مع توضيح خط سير التقديم وفق موضوع المؤتمر، لتعبئة إلهام ورقتك بالوقود.
فريق الدعم الميداني: (مخصص لفترة المؤتمر):ولا داعي للقلق حتى في مقر المؤتمر——
التنقل والإرشاد: توزيع القاعات وكيفية الوصول إلى قاعات المحاضرات، اسأل في المجموعة في أي وقت؛
قراءة مواضيع المؤتمر معاً: مناقشة الجلسات الشائعة والخطابات الرئيسية Keynote، وإن فوّتتها يمكنك متابعتها؛
مجموعة الملصقات Poster: جوهر الملصقات في الموقع مجمع، اجمعها بضغطة واحدة دون أن يفوتك شيء؛
ساحة المواعيد: مواعيد للعشاء أو المقابلات أو التبادل…… إن أردت الدردشة أو التعاون أو اللقاء، أطلقها في المجموعة ويتم.
? بوابة الانضمام للمجموعة: امسح رمز الاستجابة للانضمام أو أضف WeChat: Luyoyo_2026، مع ملاحظة: ECCV + الجهة/الجامعة + الاسم + التخصص.
في البحث العلمي والتقنية، فرق المعلومات مهم جداً.
هيا، لنكن متقدمين بخطوة واحدة!
اصعد إلى الحافلة، ودعنا نأخذك في جولة عبر أبرز خلاصات المؤتمرات العالمية الكبرى في مجال الذكاء الاصطناعي
يمكنك الاطلاع حصريًا على:
عروض PPT لمحاضرات الخبراء
النصوص الكاملة لتقارير المؤتمرات
تحليلات الأوراق البحثية الأكثر رواجًا
مقابلات مع النجوم الصاعدين في الأوساط الأكاديمية
امسح رمز الاستجابة السريعة (QR) أعلاه
أو انقر على «اقرأ النص الأصلي» لمتابعة قسم موقع Leiphone (الحساب الرسمي: 雷峰网).
مقالات حصرية من Leiphone، ويُمنع إعادة نشرها دون إذن. لمعرفة التفاصيل، راجعإرشادات إعادة النشر。