الكاتب丨 وو سيمنغ
التحرير丨 قينغ فنغ ما شياونينغ
إذا كنت قد لعبت Mario Tennis أو TopSpin، فمن المحتمل أنك لا تعتبر لعب التنس أمراً معقداً بشكل خاص. الكرة تحلق نحوك، تحرّك الشخصية، تحدد مكان الهبوط، وتضغط زر الضرب في التوقيت المناسب. وخاصةً في Mario Tennis Aces، حيث قسّمت اللعبة التنس إلى لغة حركية بديهية للغاية: ضربة أمامية، ضربة خلفية، توب سبين، ضربة مقطوعة، كرة عالية، وحتى ضربات خاصة تتطلب توقيتاً دقيقاً تماماً. لقطة شاشة من لعبة Mario Tennis Aces التنس في الواقع بالطبع أكثر تعقيداً بكثير من ذلك، وما تفعله الألعاب هو«ربط الأفعال»(action mapping)، وهو في جوهره تحويل «عملية ضغط زر» مجردة جداً من جانب اللاعب إلى مجموعة كاملة من الحركات الجسدية المعقدة للشخصية. لا يحتاج اللاعب إلى معرفة كيفية تنفيذ هذه الحركة، لأن التحكم الحركي في الوسط تتولاه نظام اللعبة. متى تهبط الكرة على الأرض، ومتى يلتف الجذع، وإلى أي جهة يجب أن تخطو القدم، وبأي سرعة يجب أن تتأرجح الذراع؛ كل هذه الأمور مخفية تقريباً في اللعبة. ما يراه اللاعب ليس سوى إدخال بسيط، ومحرك اللعبة مسؤول عن ترجمته إلى سلسلة متكاملة من الحركات الجسدية. وحتى لو طارت الكرة بأقصى سرعة، فلن تفقد الشخصية ثباتها لتعذر تعديل مركز الثقل، ولن تفقد توازنها بكامل جسدها بسبب خطوة متأخرة في القدمين. لكن إذا استبدلنا هذه الشخصية التي «تتأرجح بالمضرب بضغطة زر» بروبوت بشري حقيقي، فإن «الجسدانية» ستجعل الأمور مختلفة تماماً.أما الذكاء الجسداني فيطلب من الروبوت أن يستأنف مسؤولية هذه العملية الجسدية التي أخفتها اللعبة، أي الفجوة من النية إلى الفعل.فعليه أولاً أن يحدد من أين تأتي الكرة، ثم يقرر متى يتحرك وكم يتحرك؛ وعند الاقتراب من نقطة الضرب، يجب أن تنسجم الساقان والخصر والجذع والكتفان والذراعان والمعصمان معاً. ربما لا يتجاوز زمن تلامس المضرب للكرة لحظة قصيرة جداً، وخلال هذه المدة يجب على الروبوت أيضاً معالجة سلسلة من التغيرات مثل وضعية جسمه وسرعات مفاصله وقوى الاحتكاك ووزن المضرب وسرعة الكرة القادمة. وهكذا أصبح التنس مشكلة روبوتية شيقة للغاية. إنه ليس مثل التقاط كوب ثابت في المختبر؛ فالكرة تطير باستمرار، ونقطة الضرب تتغير باستمرار، ولا يمكن للروبوت أن ينفذ الحركة صحيحة مرة واحدة فقط، بل يجب أن يكررها صحيحةً في حالات متغيرة باستمرار. وما يحتاجه لم يعد فقط «أن يعرف ماذا يفعل»، بل أن يشكّل جسده كله استجابة متناسقة خلال بضع مئات من المللي ثانية أو أقل. وهذا أيضاً هو السؤال الذي سعت للإجابة عنه عمل IROS 2026 من فريق جالاكسي روبوتكس GaLbot وجامعة تسينغهوا وجامعة بكين ومعهد شنغهاي تشيتشي للبحوث وفريق بحثي من مختبر شنغهاي للذكاء الاصطناعي، وهوLATENT، وهو السؤال الذي حاول الإجابة عنه. عنوان الورقة البحثية نفسه مثير للاهتمام:تعلم المهارات الرياضية للروبوتات ذات الهيكل البشري في التنس من بيانات حركة بشرية غير مثالية؛ فالكلمة المفتاحية ليست "perfect" بل "imperfect". لم يجهّز فريق البحث للروبوت مجموعة بيانات مُنتقاة بعناية وكاملة ودقيقة من مباريات التنس الاحترافية البشرية؛ بل تعمّدوا البدء من بيانات حركية بشرية غير مثالية، ليتعلم الروبوت القدرات الجسدية الأساسية في لعبة التنس، ثم من خلال التعلم المعزز والمحاكاة، يجمع هذه القدرات في سياسات قادرة فعلاً على ضرب الكرة. بعبارة أخرى، ما أرادوا حله ليس «كيفية نسخ الحركات البشرية كاملة إلى الروبوت»، بل سؤالاً أقرب إلى الواقع:إذا كانت الأمثلة التي يقدمها البشر للروبوت غير مكتملة وغير دقيقة أصلاً، فما الذي يمكن أن يتعلمه منها؟
01
خمس ساعات من البيانات غير المثالية
إذا أردنا فعلاً أن يتعلم الروبوت من لاعب تنس بشري، فإن الطريقة الأكثر بديهية هي تسجيل هذا اللاعب بالكامل، من وضعية الاستعداد إلى التحرك والتأرجح وضرب الكرة والعودة للموقع، ثم الضربة التالية. والأفضل أن تتوفر أيضاً كميات كبيرة من الكرات القادمة المختلفة ونقاط الهبوط المختلفة ووضعيات الجسم المختلفة، بل حتى مباريات كاملة. هكذا لن يرى الروبوت فقط «كيف يجب أن يتأرجح الذراع»، بل سلوكاً كاملاً للتنس. المشكلة أن جمع مثل هذه البيانات صعب للغاية، ناهيك عن أن الهدف روبوت بشري، فبنية جسم الإنسان تختلف عن بنية جسم الروبوت نفسه؛ فطول ذراع الإنسان ومدى مفاصله ووزن جسمه وقوة عضلاته كلها تختلف عن الروبوت، وحتى إذا سجّل نظام التقاط الحركة حركات شخص بدقة، فلا ضمان لقدرة الروبوت على تنفيذها بالمثل تماماً. اتخذ LATENT طريقاً آخر. عثر فريق البحث على 5 لاعبي تنس من الهواة، وسجّل في منطقة التقاط حركة بحجم حوالي 3 متر × 5 متر نحو 5 ساعات من بيانات الحركة البشرية. هذه المساحة لا تتجاوز جزءاً صغيراً جداً من ملعب تنس قياسي. لم يطلب الباحثون من اللاعبين خوض مباريات كاملة، بل ركزوا انتباههم على بعض الحركات الجسدية الأساسية في التنس، بما في ذلك الضربة الأمامية والخلفية، وكذلك حركات التنقل مثل الانزلاق الجانبي والخطوة المتقاطعة. التقاط الحركة البشرية للتنس تبدو هذه الحركات مجزأة جداً؛ شخص يخطو خطوتين إلى الجانب، وشخص ينفذ تأرجحة أمامية، وشخص يؤدي حركة خلفية. لا يمكنها أن تشكل مباراة تنس كاملة، ناهيك عن إخبار الروبوت «إلى أين يجب أن يوجه الكرة التالية». لكن فريق البحث يرى أن هذه الشظايا تحتوي مع ذلك على شيء بالغ الأهمية:كيف يستخدم الإنسان جسده عند مواجهة رياضة التنس.وهذا أيضاً ما تسميه الورقة "imperfect human motion data". و"عدم المثالية" هنا له بعدان على الأقل.أولاً، أنها ليست دقيقة بما يكفي.الحركة البشرية الملتقطة عبر التقاط الحركة لا تعني أن الروبوت يمكنه نسخها دون تعديل، خاصةً في الحركات المحلية مثل المعصم، حيث توجد فروق واضحة بين البيانات البشرية وجسد الروبوت.ثانياً، أنها غير مكتملة.ما جمعه فريق البحث هو حركات التنس الأساسية، وليس مجموعة سلوكيات مباراة كاملة؛ فالبيانات يمكن أن تخبر الروبوت كيف يتحرك وكيف يتأرجح، لكنها لن تخبره مباشرة ما الاستراتيجية التي يجب اختيارها أمام الكرات القادمة المختلفة. من السهل على التفكير التقليدي اعتبار هذه العيوب مشكلة: إذا كانت البيانات غير دقيقة، فاجمع المزيد؛ وإذا كانت غير مكتملة، فاجمع المزيد أيضاً. لكن نهج LATENT اتخذ خطوة جانبية قليلاً؛ فبدلاً من محاولة إصلاح هذه البيانات لتصبح «دليلاً مثالياً لحركة التنس البشرية»، تعاملوا معها كمعرفة مسبقة (prior). لا يحتاج الروبوت إلى أن يكون نسخة طبق الأصل من لاعب بشري معين؛ بل يحتاج أولاً إلى معرفة كيف يستخدم البشر أجسادهم تقريباً في رياضة سريعة كالتنس. وهذا الفرق مهم، لأنه بالنسبة للتعلم المعزز، فإن استكشاف جميع الحركات الجسدية الممكنة من الصفر مكلف جداً. روبوت بشري بـ29 درجة حرية لا يملك خيارين فقط هما «التأرجح» و«عدم التأرجح»؛ ففي كل لحظة يمكنه تغيير حالة الساقين والخصر والجذع والكتفين والذراعين. وإذا بدأ من الصفر تماماً، فلن يعرف حتى ما هي الحركة الجسدية المعقولة. بيانات الحركة البشرية، حتى لو كانت مجرد شظايا، يمكنها أن ترسم له حداً تقريبياً مسبقاً. هذا أشبه بشخص يلتقط مضرب التنس لأول مرة؛ لا تحتاج إلى منحه دورة تدريبية احترافية كاملة، يكفي أن يعرف «أن البشر يقفون هكذا تقريباً، ويتحركون هكذا، ويتأرجحون هكذا»، وبعد ذلك فقط يمكنه أن يجد أسلوبه الخاص عبر التجربة والخطأ المستمر. ما يفعله LATENT يمكن فهمه تقريبياً بأنه منح الروبوت أولاً هذا «الحدس الجسدي».02
ما يحتاجه الروبوت هو مجموعة من «اللغة الجسدية»
لم يقم فريق البحث ببساطة بحقن الحركات البشرية الملتقطة في الروبوت مفصلاً after مفصل. إن الصعوبة الحقيقية تكمن بالضبط هنا:الحركة البشرية ليست حركة روبوت.عندما يتأرجح شخص بالمضرب، لا يقوم دماغه بحساب صريح لـ«كم درجة تنثني الركبة اليسرى، وكم درجة تلتوي مفصل الورك الأيمن، وكم درجة يميل الجذع»؛ ما يتشكل في النهاية هو نوع من التناسق الجسدي. وإذا كان على الروبوت أن يحدد مباشرة في كل مرة كيف تتحرك الـ29 درجة حرية، فستكون فضاء التعلم ضخماً جداً، ومن السهل أن تنتج أثناء التعلم المعزز حركات غير طبيعية بل غير مستقرة. مخطط إطار منهجية LATENT لذلك درّب LATENT أولاً متتبع حركة (motion tracker) يمكّن الروبوت من تعلم أنماط الحركة الجسدية التي تحتويها الحركات البشرية. ثم ضغط فريق البحث هذا المتتبع بدوره في فضاء أفعال كامن مستمر (latent action space)، وهو ما يسمى الفضاء الحركي الكامن. وإذا استخدمنا تشبيهاً أكثر بديهية، فإنه يشبه إلى حد ما «قاموس حركات»؛ فلا يضطر الروبوت في كل مرة إلى حساب كيفية تناغم الـ29 مفصلاً من الصفر، بل يمكنه أولاً اختيار حركة جسدية تعلّمها مسبقاً من هذا القاموس، ثم تعديلها بحسب الكرة أمامه. ولهذا الفضاء الحركي أيضاً سمة مهمة جداً: فهو لا يثبّت الروبوت على الحركات البشرية؛ فالأمثلة البشرية تقدم المعرفة المسبقة للحركة فقط، وعند مواجهة التنس فعلياً يحتاج الروبوت إلى التعلم بنفسه. لهذا السبب لم تجعل الورقة «تقليد البشر» هدفاً نهائياً. افترض أن لاعباً بشرياً يقوم بحركة في معصمه أثناء التأرجح، وهذه الحركة غير موثوقة بالنسبة لـG1؛ عندها لا داعي للروبوت أن يتمسك بها عناداً. بل عالج فريق البحث معصم اليد اليمنى عمداً: خفضوا موثوقيته في مرحلة تتبع الحركة، بحيث لا يستطيع الروبوت الاعتماد المفرط على هذه الحركة المحلية التي تتضمن أخطاء، ثم جعلوا السياسة عالية المستوى تصححها عند الضرب الفعلي للكرة. هذا التصميم أشبه بترك برغي غير محكم عمداً في الروبوت؛ فإذا كان النظام لا يعمل إلا عندما يكون هذا البرغي دقيقاً تماماً، فإن أي خطأ بسيط في الواقع قد يجعل الحركة كلها تفشل. وعلى النقيض، إذا أُجبر الروبوت منذ البداية على التعلم بالاعتماد على الساقين والوركين والجذع والكتفين وأجزاء الجسم الأخرى لإنجاز الحركة معاً، فعندما يحدث خلل في المعصم ستظل لديه فرصة لتعديل جسده كاملاً وإرجاع الكرة. وهذه أيضاً نقطة مثيرة للاهتمام في LATENT:البيانات البشرية ليست الإجابة النهائية التي يسعى إليها الروبوت، بل هي أشبه بنقطة انطلاق للروبوت عند تعلم الحركة الجسدية.بعد ذلك، يواجه فريق البحث مشكلة نموذجية في التعلم المعزز: عندما يمتلك الروبوت «قاموس حركات»، ألن يبدأ التعلم المعزز، سعياً لرفع نسبة نجاح إرجاع الكرة، بالقفز عشوائياً بين حركات مختلفة تماماً في القاموس؟ الجواب أنه ممكن. لذلك اقترح فريق البحث Latent Action Barrier، أي LAB. يقيد هذا الحاجز الأفعال التي تولدها السياسة عالية المستوى، بحيث لا تنحرف السياسة بسهولة عن توزيع الأفعال الأصلي. Latent Action Barrier "الحاجز" (Barrier) هنا ليس لقفل الروبوت، بل لرسم حد أثناء الاستكشاف. استخدمت الورقة مسافة Mahalanobis لقياس درجة انحراف الفعل بدلاً من المسافة الإقليدية البسيطة. والسبب مفهوم بسهولة: مقاييس ومدى التغير تختلف بين أبعاد الأفعال المختلفة، ولا يمكن اعتبار التغيرات في جميع الاتجاهات «انحرافاً» متساوياً. وقد أثبتت التجارب أيضاً قيمة هذا القيد. في مهمة الضربة الأمامية، بلغ معدل نجاح سياسة LATENT الكاملة 96.52%؛ وبعد إزالة LAB انخفض معدل النجاح إلى 93.12%. لكن التغير الأوضح ظهر في جودة الحركة: ارتفع مؤشر سلاسة الحركة من 25.61 إلى 37.64، وارتفع عزم المفاصل أيضاً من 7.40 إلى 12.53. بمعنى أن ما حسّنه LAB فعلياً لم يكن فقط «هل يمكن إرجاع الكرة»، بل أيضاً ما إذا كان بإمكان الروبوت أن ينجز المهمة بحركات أقل فجائية وحدة وآلية. وهذا يشبه الفرق عند البشر أثناء الحركة؛ فقد يتمكن شخص من إرجاع الكرة أحياناً، لكن إذا اعتمد كل ضربة على هزة عنيفة للجسم وتوقفات مفاجئة وتصحيحات مستمرة، فمن الصعب أن تستمر هذه الحركات. القدرة الحركية المفيدة حقاً ليست النجاح مرة واحدة فقط، بل القدرة على تحويل النجاح إلى عادة جسدية مستقرة.03
حتى الروبوتات لا يمكنها التعلم فقط في "عالم نظيف"
هنا أصبح الروبوت يمتلك الحركة، ويملك أيضًا الاستراتيجية. لكن تظل هناك مشكلة أكبر: العالم المحاكى والعالم الواقعي ليسا متطابقين. في المحاكي، يعرف الباحثون كتلة الكرة ومرونتها ومقاومة الهواء، كما يعرفون كتلة جسم الروبوت ومعاملات الاحتكاك الخاصة به. ومن أين تطير الكرة وبأي سرعة، يمكن التحكم في ذلك بدقة. أما في الواقع، فإن ارتداد كرة التنس لا يبقى متطابقًا أبدًا، وقد يوجد خطأ طفيف في مركز ثقل المضرب، كما يتغير احتكاك الأرضية. وتوجد أخطاء مماثلة في مفاصل الروبوت ومشغلاته ومستشعراته. دون أن ننسى أن الأنظمة الحقيقية تتضمن أيضًا تأخيرًا وضوضاء وقياسات مفقودة أحيانًا. وإذا تعلّم الروبوت لعب الكرة داخل "عالم محاكاة مثالي" فقط، فقد تفشل الحركات التي تعلّمها فور انتقاله إلى الواقع. النهج الذي تبنّاه LATENT لم يكن السعي لجعل عالم المحاكاة مثاليًا قدر الإمكان، بل كان العكس:الدمج الاستباقي لعدم اليقين في العالم المحاكى.قام فريق البحث بتنويع (توزيع عشوائي لقيم) معاملات جسم الروبوت مثل الكتلة ومركز الثقيل والاحتكاك في القدمين واحتكاك المفاصل وقصور المحركات، كما طبّق التوزيع العشوائي أيضاً على المعاملات الديناميكية لكرة التنس مثل الكتلة ومعامل الارتداد ومقاومة الهواء. Figure 2(c+d):Dynamics Randomization + Observation Noise وفي الوقت نفسه، أضافوا أيضاً عوامل مثل ضوضاء الملاحظة وفقدان الإطارات والتأخير. بمعنى آخر، لم يكن الروبوت يواجه أثناء التدريب المحاكى عالم كرة تنس ثابتاً واحدة، بل «عالماً واقعياً محتملاً» كاملاً. أحياناً تكون الكرة أثقل قليلاً، وأحياناً أخف؛ أحياناً يكون الاحتكاك أكبر، وأحياناً أصغر؛ أحياناً تصل البيانات التي تراها المستشعرات متأخرة قليلاً، وأحياناً ينقص إطار كلياً. ما اضطر الروبوت إلى تعلمه هو: «حتى لو لم أعرف أي حالة من حالات العالم هي السائدة فعلاً، ينبغي أن أحاول إعادة الكرة على أي حال.» وهذا أحد الفروق المثيرة للاهتمام بين تعلم الروبوتات والتحكم البرمجي التقليدي. يمكن للبرنامج أن يخبر الآلة: سرعة الكرة A، والاحتكاك B، والتأخير C، إذن نفّذ الحركة D. لكن العالم الحقيقي نادراً ما يمنحك شروطاً مرتبة بهذا الشكل مثل A وB وC. لذلك لم تحاول LATENT القضاء على عدم اليقين، بل جعلت الروبوت يعتاد على عدم اليقين منذ مرحلة التدريب. وتوضّح تجارب الاستئصال في الورقة العلمية هذه النقطة جيداً. فإذا أُزيل التوزيع العشوائي لديناميكيات كرة التنس، انخفض معدل نجاح الضربة الأمامية في العالم الحقيقي بوضوح إلى 16.67%؛ وإذا أُزيلت ضوضاء الملاحظة، انخفضت تجربة الضربة الخلفية حتى إلى 0%. وهاتان النتيجتان تثبتان بالضبط أمراً واحداً:أسباب فشل الروبوت في الواقع أحيانًا ليست أنه لم يتعلّم الحركة، بل أن العالم الذي تعلّمه كان نظيفًا أكثر من اللازم.هذه أيضاً إحدى أصعب نقاط sim-to-real الجوهرية. جعل المحاكي أقرب إلى الواقع أكثر فأكثر أمر مهم بالطبع، لكن هناك مساراً آخر يتمثل في جعل الروبوت يعتاد على أن الواقع لن يكون أبداً مطابقاً تماماً للمحاكي. وقد اختارت LATENT المسار الثاني. وقد جُلبت هذه الفكرة في النهاية إلى روبوت Unitree G1 الحقيقي. لكن يجب التوضيح هنا بشكل خاص: هذا لم يكن روبوتاً يقف في ملعب تنس عادي وينجز كل التجارب بمفرده اعتماداً على كاميرته فقط. فالتحقق الحقيقي على الجهاز الفعلي ما زال يعتمد حتى الآن على نظام التقاط الحركة. استخدم فريق البحث كاميرات التقاط الحركة للحصول على معلومات حركة الروبوت والكرة، واستخدمت التجارب الحقيقية بيئة واسعة النطاق لالتقاط الحركة. وتشير المواد الرسمية للمشروع إلى أن التجارب استخدمت أكثر من 50 كاميرا لالتقاط الحركة، وأن منطقة التقاط الحركة بلغت 19 متراً × 15 متراً. وهذا يشكل تبايناً مثيراً للاهتمام مع جمع البيانات السابق. فعند جمع الحركات الجسدية لخمسة (5) لاعبين هواة، لم يحتج فريق البحث سوى منطقة صغيرة بمساحة 3 أمتار × 5 أمتار؛ بينما جعل الروبوت يلعب Tennis باستقرار في العالم الواقعي تطلب بنية تحتية كاملة ومعقدة لالتقاط الحركة. أي أن«عدم كمال البيانات» لا يعني أن نظام التجربة بأكمله بسيط.على النقيض تمامًا، نقلّ فريق البحث جزءًا من المشكلة من "كيفية جمع بيانات مثالية" إلى "كيفية تمكين الروبوت من تعلّم قدرات مستقرة من بيانات غير مثالية"، لكن التحقّق على الروبوت الحقيقي بحد ذاته لا يزال نظامًا هندسيًا مكلفًا ومعقدًا. كما ذكرت الورقة صراحةً أن الاعتماد على نظام التقاط الحركة يُعدّ قيدًا على العمل الحالي، وحدّدت الاستخدام المستقبلي الأعمق للرؤية النشطة كخطوة تالية. وهذا يعني أن LATENT اليوم ليست بعد "روبوت تنس مستقلًا" قد تجاوز ظروف المختبر. لكنها أثبتت على الأقل أمرًا واحدًا:يمكن أن تكون البيانات غير الكاملة نقطة انطلاق لاكتساب الروبوتات القدرة على الحركة الديناميكية.04
لقد أعاد الكرة حقًا
لكن ما يمنحنا في النهاية إحساسًا مباشرًا حقيقيًا هو الكرة. في التجارب المحاكاة، أجرى فريق البحث اختبارات واسعة النطاق لتقييم ظروف الكرات الواردة المختلفة. بلغ معدل نجاح LATENT في إرجاع الكرات بالضربة الأمامية 96.52%، بمتوسط خطأ في نقطة الهبوط قدره 1.32 متر. للمقارنة، كانت معدلات النجاح بالضربة الأمامية لطرق AMP وASE وPULSE هي 41.32% و63.47% و71.85% على التوالي، مع متوسطات خطأ في نقطة الهبوط أكبر بكثير. تشير هذه الأرقام إلى أن LATENT ليس مجرد جعل الروبوت "يقوم بحركة تأرجح مضرب". فقد أصبح قادرًا على ربط حركة الجسم وظروف الكرات الواردة وأهداف المهمة. مع كرات واردة من مواضع وسرعات مختلفة، يحتاج الروبوت إلى تحريك جسده، وإتمام الضربة في الموضع المناسب، ثم محاولة إرجاع الكرة إلى المنطقة المستهدفة قدر الإمكان. وعند الانتقال إلى العالم الحقيقي، ظلت النتائج قائمة. أجرّت الورقة 20 تجربة متتالية من جولات إنسان وروبوت. في ظروف الضربة الأمامية، كان معدل نجاح إرجاع الكرة المُبلَّغ عنه في الورقة 90.90%، وفي الضربة الخلفية 77.78%؛ وفي ظروط الملعب الأمامي والخلفي كان 88.89% و81.82% على التوالي. وهنا قيد بالغ الأهمية: هذه الأرقام ليست "معدل فوز الروبوت في مباريات تنس حقيقية". معيار النجاح في التجارب الحقيقية هو ما إذا كان الروبوت قادرًا على إرجاع الكرة داخل ملعب الخصم؛ ولم يتجاوز حجم التجارب 20 جولة متتالية. لذا فإن الفهم الأكثر دقة لرقم 90.90% هو أنه في ظروف التجربة الحقيقية التي حددتها الورقة، كان الروبوت قادرًا على إتمام إرجاع الضربة الأمامية بثبات ملحوظ. ما تثبته هو قدرة معينة، وليس مستوى تنافس احترافيًا. وفي الواقع، المهمة التي يحلها LATENT حاليًا لا تزال محددة نسبيًا: يحتاج الروبوت إلى ضرب الكرة الواردة نحو الموضع المستهدف، بدلًا من خوض مباراة فردية أو زوجية كاملة كما يفعل لاعب التنس الحقيقي. فمباريات التنس الحقيقية تتضمن أيضًا عددًا كبيرًا من المسائل الأكثر تعقيدًا. متى ينبغي لعب كرة مستقيمة، ومتى يجب لعب كرة مائلة؟ أين يقف الخصم؟ وكيف ينبغي العودة إلى الموضع بعد هذه الضربة؟ وإذا غيّر الخصم نقاط الهبوط باستمرار، فكيف يعدّل الروبوت تكتيكاته؟ وإذا لم تسقط الكرة في المنطقة المتوقعة، فماذا ينبغي فعله في الضربة التالية؟ هذه المسائل لم تعد مجرد "كيفية التأرجح بالمضرب"، بل تتطلب من الروبوت أن يفهم بيئة تنافسية متغيرة باستمرار. وقد قدّم الـ robot-robot self-play في الورقة مكملًا لذلك. في بيئة المحاكاة، يمكن لروبوتين يستخدمان هذه الاستراتيجية ممارسة اللعب الذاتي، وإتمام ما يصل إلى 25 جولة متتالية كحد أقصى. لكن هنا أيضًا يجب رسم الحدود بوضوح:25 جولة تأتي من تجارب محاكاة بين روبوت وروبوت، وليس من مباريات واقعية بين الإنسان والآلة.إذن، إذا وضعنا LATENT في سياق التاريخ الأطول لتطور الروبوتات، فإن ما حققته الآن ليس في الحقيقة "تعليم الروبوت لعبة التنس"، بل دفع خطوة إلى الأمام لمشكلة كانت صعبة في الماضي: هل يستطيع الروبوت أن يتعلم من شذرات محدودة من الحركات البشرية قدرة جسدية قابلة للنقل، ثم يستخدمها فعلياً في بيئة سريعة وديناميكية ومليئة بالأخطاء؟ الجواب حتى الآن هو نعم. على الأقل في المهام المحددة في الورقة البحثية، فهو قادر على ذلك بالفعل. والسبب في أن هذا الأمر يستحق الانتباه ليس، في الواقع، بسبب التنس نفسه.05
التنس مجرد مدخل
على مدى فترة طويلة في الماضي، كانت عروض القدرات الحركية للروبوتات تجري غالباً في بيئات محددة نسبياً. المشي والإمساك والنقل وفتح الأبواب، كل مهمة من هذه المهام كان لها هدف واضح، وكان موقع الأجسام عادةً لا يتغير فجأة. لكن الرياضة ليست كذلك. الكرة تطير، والهدف يتحرك، ووقت التلامس قصير جداً، والحركات تحتاج إلى أن تُنجز بشكل متصل. فالروبوت لا يتحكم بجسده فحسب، بل يضطر أيضاً إلى إعادة اتخاذ القرار حول الخطوة التالية باستمرار وفقاً لتغيرات العالم الخارجي. لذلك توفر الرياضة في الواقع ساحة اختبار متطرفة للـ embodied intelligence. كرة القدم تتطلب من الروبوت الجري والدوران وركل الكرة، إضافة إلى فهم مواقع الرياضيين الآخرين؛ والريشة تتطلب منه إنجاز خطوات الخطوات وضرب المضرب والتحكم في نقطة السقوط في ظل كرة قادمة بسرعة عالية؛ بينما يركّز التنس هذه المشكلات أكثر في لحظة محددة جداً: يجب على الروبوت أن يضرب كرة تطير بسرعة عالية في المكان الصحيح، وبوضعية الجسم الصحيحة، وفي التوقيت الصحيح. ولهذا السبب أصبحت الـ athletic humanoid robotics في مؤتمر IROS 2026 هذا العام اتجاهاً يُناقش على حدة. فورشة "Perception and Decision Making for Athletic Humanoid Robotics" في IROS 2026، ضمنت مباشرةً في موضوعات النقاش الـ agile locomotion والرياضة والـ dynamic manipulation والـ real-time planning والـ embodied AI وغيرها، واهتمامها منصبّ تحديداً على كيفية قيام الروبوتات بالإدراك واتخاذ القرار والتحكم بالجسم كاملاً في بيئات سريعة وكثيفة التلامس وغير قابلة للتنبؤ. كما رتّبت الورشة عروضاً لروبوتات رياضية من Unitree وPhybot وBooster Robotics، تغطي مهام الجري والريشة وكرة القدم وغيرها. وقيمة LATENT تكمن بالضبط هنا. فهي لم تحاول تحويل بيانات الحركة البشرية إلى إجابة دقيقة للغاية. ما تركه 5 لاعبين هواة ليس سوى بعض مقاطع الحركة، بل إن هذه المقاطع نفسها تحوي أخطاء. لكن هذه البيانات غير المثالية ما زالت تخبر الروبوت بأمور معينة: كيف يتحرك الإنسان في هذا العالم، وكيف يحافظ على توازنه، وكيف يحرك جسده لملاحقة جسم متحرك بسرعة عالية. ثم يواصل الروبوت السير إلى الأمام بنفسه. فهو يضغط الحركات البشرية في فضاء حركات كامن، ثم يستخدم التعلم المعزز للبحث عن مجموعات حركات تناسب جسده؛ وهو لا يثق تماماً بحركة معصم الإنسان، فيتعلم إشراك الجسم كله في التعويض؛ وهو لا يفترض أن معاملات العالم الحقيقي دقيقة دائماً، فيضيف بنفسه في المحاكي ضوضاء وتأخيراً وتغيرات في الديناميكا؛ وأخيراً، ينقل كل هذا إلى جسد الروبوت الحقيقي. إنه يحاول الإجابة عن سؤال أكبر:عندما نعجز عن تزويد الروبوت بدليل مثالي عن العالم، هل يستطيع أن يبني بنفسه، من معلومات غير مثالية، فهماً لجسده وللعالم؟وهذا بالضبط ما يجعل التنس، كميدان تجريبي، أمراً مثيراً للاهتمام في سياق الذكاء المجسّد: فهو يتطلب من الروبوت أن يتحرك في عالم لا توجد فيه إجابة ثابتة، ويغيّره أطراف أخرى باستمرار، مع الكشف المستمر عن المشكلات والتحسين المستمر. فالكرة لا تنتظر الروبوت. حين تأتي، يجب أن يتفاعل الجسد قبل اللغة. فالمستشعرات فيها تأخير، والحركات فيها أخطاء، وبذلك لم تعد المسار الأصلي تعليمات يمكن تنفيذها حرفياً. لذا فإن ما يقف في النهاية على الملعب الحقيقي ليس آلة تنسخ الحركات البشرية إطاراً بإطار. ففي قدميه شظايا حركات تركها 5 لاعبين هواة، وهناك بيانات جسدية بشرية غير مثالية، وعدم يقين تم كشفه عمداً، وهناك أيضاً استراتيجيات جسدية تشكّلت بعد محاولات وخطأ متواصلة في التعلم المعزز. ما يقدمه الإنسان هو آثار معرفة، أما ما يحصل عليه الروبوت فليس المعرفة نفسها، والجزء المتبقي عليه أن يكمله بجسده هو.لتسهيل التجمّع والتبادل وتبادل أخبار المؤتمر بين الجميع، أنشأ موقع Leifeng (الحساب الرسمي: 雷峰网) بشكل خاص مجموعة 2026 مجموعة التواصل والتبادل في المؤتمر! بالانضمام إلى المجموعة ستفتح لك هذه «المزايا»؟
محطة معلومات المؤتمر: مواعيد تقديم الأبحاث النهائية (DDL)، ومعايير التنسيق، وتقدم التحكيم... نقاط رئيسية تُوصل إليك في وقتها الأول، فلا تخشى بعد الآن تفويت أي deadline، وستكون جاهزية تقديمك راسخة.
جلسة الحوار بين الزملاء: زملاء من كل الأرجاء موجودون في المجموعة، تبادلوا الخبرات، وتبادلوا الأفكار، وابنوا علاقات، فنحن نتواجد معاً في طريق البحث العلمي.
محطة الإمداد بالأبحاث الرائدة: أحدث نتائج الأبحاث والاتجاهات الساخنة تُناقل بشكل لحظي، مع مساعدتك في تنظيم مسار التقديم استناداً إلى موضوعات المؤتمر، وتزويد أوراقك البحثية بالإلهام إلى أقصى حد.
فريق الدعم في الموقع: (يُفتح حصرياً خلال فترة المؤتمر):لا داعي للقلق حتى في قاعة المؤتمرات——
الإرشاد والملاحة: توزيع القاعات وكيفية الوصول إلى قاعات المحاضرات، اسأل في المجموعة في أي وقت؛
القراءة المشتركة للمحاور: مناقشة الجلسات الساخنة والـ Keynote، حتى لو فاتتك يمكنك متابعتها؛
تجميعات الـ Poster: خلاصات المنشورات الموقعية منظمة، احفظها بضغطة واحدة دون أن يفوتك شيء؛
ساحة المواعيد: مواعيد العشاء، ولقاءات المقابلات، ولقاءات التبادل... إن أردت الدردشة أو التعاون أو اللقاء، ابدأها في المجموعة وسيتم.
؟ بوابة الدخول إلى المجموعة: امسح رمز الاستجابة للانضمام إلى المجموعة أو أضف حساب WeChat Luyoyo_2026، مع ملاحظة: ECCV + الجهة/المدرسة + الاسم + التخصص.
في البحث العلمي والتطوير التقني، فرق المعلومات مهم جدًا.
هيا، فلكنحن الأسرع بخطوة واحدة!
اصعد معنا لنستعرض معًا خلاصة أبرز مؤتمرات الذكاء الاصطناعي حول العالم
يمكنك الاطلاع الحصري على:
عروض PPT التقديمية للخبراء
النصوص الكاملة لتقارير المؤتمر
تفسيرات الأوراق البحثية الأكثر رواجًا
مقابلات مع النجوم الأكاديميين الصاعدين
امسح رمز الاستجابة أعلاه
أو انقر على «قراءة النص الأصلي» لمتابعة القسم المخصص.
مقال أصلي من موقع雷峰网، يُمنع إعادة نشره دون إذن. لمزيد من التفاصيل راجعشروط إعادة النشر。