雷峰网 AI

وو جيا جون: خطاب في IROS 2026: التمثيل الهيكلي ليس الإجابة، بل هو الدعامة التي يستخدمها الروبوتات للتعلم من الاستدلال | IROS 2026

من التمثيل المنظم إلى طريق التعلم بدون عروض توضيحية. المؤلف: وو سي مينغ، المحرر: تشن فنغ. طبقٌ، صنبورٌ، كتلة صغيرة من الصابون الأزرق. بدأ وو جيا جون محاضرته في IROS 2026 بمشهد مطبخ لا يحتوي على أي معرفة تقنية تقريبًا.…

من التمثيل المنظم إلى طريق التعلم بدون عروض توضيحية.

المؤلف | وو سي مينغ

التحرير | تسين فنغ

                                                                                                       

طبق واحد، مفغ ماء، قطعة صغيرة من الصابون الأزرق. بدأ وو جيا جون خطابه في IROS 2026 بمشهد مطبخ لا يحتوي على أي تقنيات معقدة كهذا. شرب الطالب الصابون، فتح المفغ الماء، غسل نصف الطبق، ثم غادر مؤقتًا. الآن، يتولى الروبوت المهمة. للوهلة الأولى، المهمة واضحة تمامًا: غسل الطبق جيدًا، ثم إعادته إلى مكانه. لكن ما يحتاج الروبوت حقًا إلى معالجةه ليس كلمات "غسل الطبق". يجب عليه أولاً معرفة أي شيء أمامه هو طبق؛ يجب أن يعرف مدى قذارة هذا الطبق؛ يجب أن يلاحظ إذا كان هناك كتلة صغيرة من الصابون الأزرق على الطبق. كما يجب أن يعرف إذا كانت الصنبور مفتوحة الآن، وما إذا تم غسل الطبق بالفعل، وإذا ظهر مشكل جديد على الطاولة بعد أن يأخذ الطبق. نفس المهمة، لكن بوضع بديل في البداية، قد تكون الإجابة مختلفة تمامًا. إذا تم غسل الطبق بالفعل، فلا حاجة للغسل مرة أخرى. بدون صابون، يجب عليه استخدام بعض الصابون أولاً. إذا كان هناك شيء قذر مضغوط تحت الطبق، فإن “تنظيف الطبق” لا يعني بعد ذلك وضعه على الرف. عند مواجهة هذه التغيرات، غالبًا لا يشعر الناس بأنهم قاموا بأي تحليل معقد. نحن ننظر مرة واحدة فقط، ثم نستمر في العمل. أما بالنسبة للروبوتات، فكل مرة “تنظيف ومتابعة العمل” يحمل في طياته سؤالًا: ما الذي تفهمه الروبوت من العالم أمامه؟ في 27 سبتمبر، في يوم افتتاح IROS 2026، قدم وو جياجون، أستاذ مشارك في قسم علوم الكمبيوتر بجامعة ستانفورد، تقريرًا مدعوًا بعنوان “بناء العوامل الفيزيائية من خلال التمثيلات المنظمة” خلال مؤتمر RoBoWoMo. على مدى السنوات القليلة الماضية، كان يدرس كيفية استعادة العالم الذي يختبئ خلف الصور: الهندسة، المواد، الخصائص الفيزيائية، والعلاقات بين الأجسام. الآن، عندما تُطبق هذه القضايا في العالم الفيزيائي الحقيقي للروبوتات، تظهر مشاكل أخرى. كيف يجب وصف مهمة الروبوت؟ هل يمكن تعلم هذه الوصفات بنفسها؟ عند مواجهة أجسام لم تظهر من قبل في بيانات التدريب، متى يحتاج النموذج إلى تدريب إضافي؟ إذا كان التخطيط نفسه يمكن تعلمه، فهل لا يزال مخطط التخطيط التقليدي ضروريًا؟ أخيرًا، لم تعد المسألة تتعلق بـ "هل رأى الروبوت شخصًا يعمل كيف؟". إذا لم تكن هناك عروض توضيحية، ولا بيانات التحكم عن بعد، وحتى عند مواجهة صنبور لم يره من قبل، هل يمكن للروبوت أن يتخيل بنفسه: كيف يمكن استخدامه؟ هذا هو نص مُعَدٍّ لخطاب وو جيا جون في مؤتمر IROS 2026. تم تحريره بواسطة منصة لي فنغwang (حساب العامة: لي فنغwang)·AI Technology Review استنادًا إلى الخطاب الإنجليزي في الموقع، وتم إعادة تنظيم التعبيرات الشفوية والمصطلحات التقنية دون تغيير المعنى الأصلي.

▎بناء العوامل الفيزيائية من خلال التمثيلات المنظمة

المتحدث الرئيسي: وو جيا جون، أستاذ مشارك في قسم علوم الكمبيوتر بجامعة ستانفورد (وهو أيضًا أستاذ مشارك في قسم علم النفس)

01


طبق صغير، لماذا يجعل الروبوت يواجه صعوبة

اليوم أريد أن أتحدث عن كيفية استخدام التمثيلات الهيكلية لبناء كيانات ذكية قادرة على العمل في العالم الفيزيائي. دعونا نبدأ من الجانب البصري. في النهاية، يمكنك فقط رؤية الصور، لكن خلف كل صورة يوجد عالم بأكمله: الهندسة، المواد، والخصائص الفيزيائية المختلفة. كانت الخط الرئيسي لبحثنا دائمًا هو إلى أي مدى يمكن استعادة هذه العناصر؛ وما إن تستعيدها، يمكنك خلق هذا العالم من جديد. وفي السنوات الأخيرة، هناك اتجاه نشط آخر وهو الكيانات الذكية في الفضاء الرقمي. تستقبل هذه الكائنات الأوامر، وتتفاعل مع العالم بأكمله. وهذا يدفعنا إلى طرح سؤال آخر: هل يوجد بنية مماثلة في العالم الفيزيائي؟ في العالم الرقمي، لديك مجلدات، وفي المجلدات توجد ملفات، وللملفات خصائصها؛ أما في العالم الفيزيائي، لديك مشاهد، وفي المشاهد توجد أجسام، وللأجسام أيضًا خصائصها. فهل يمكننا استخدام هذه البنية لنقل الكائنات الذكية من الفضاء الرقمي إلى الفضاء الفيزيائي؟ هذا هو موضوع هذا التقرير اليوم. عندما تريد حقًا أن تجعل الروبوتات والبشر في نفس العالم، تصبح الأمور صعبة. هذا العالم معقد للغاية، وهو ديناميكي ومتنوع، ويجب عليك التعامل مع عدد كبير من المهام المختلفة. بالطبع يجب استخدام النماذج الأساسية، وهي أصبحت أقوى يومًا بعد يوم، قوية لدرجة أنه من الصعب التخلي عنها. لكن الطريقة التي تستخدم بها هذه النماذج يمكن أن تكون مختلفة: هل يجب إجراء التدريب اللاحق؟ هل يجب إدخال المزيد من الهيكلية؟ هل يجب إدخال بعض المعرفة الإضافية، وكيف يتم دمجها مع الأجزاء القائمة؟ هذه كلها خيارات قيد التحديد. هناك مكان آخر يتعلق بشكل خاص بالروبوتات ويفرق عن العالم الرقمي. فالعالم الرقمي يتم توحيده إلى حد كبير من خلال اللغة؛ أما في حالة الروبوتات، فإنها تظهر مشهدًا مختلفًا، مع مجالات ومهام مختلفة، وغالبًا ما تكون هذه سيناريوهات وبيانات خاصة، وكل روبوت مختلف. لن تظهر هذه البيانات في مجموعة البيانات الضخمة المستخدمة لتدريب النمور الكبيرة. لذلك، يصبح السؤال: كيف نتجاوز هذا الحاجز. بعد كل هذا التعبير المجرد، دعونا نبدأ من مشهد عادي تمامًا في مطبخ، لنرى ما يحتاجه نظام الروبوتات للعمل بشكل حقيقي مع البشر حتى في مثل هذا المشهد. طالب يضغط الكحول على الطبق، يفتح الصنبور، ثم يضطر إلى الابتعاد. الآن دعو الروبوت يتولى العمل. بالطبع، يجب عليه أولاً إجراء تفكير دلالي: من بين هذه الأواني الخزفية، أي منها يجب أن أساعد في غسله؟ إنه هذا الطبق. يمكن تنفيذ هذه الخطوة بسهولة نسبيًا اليوم باستخدام نموذج بصري. ثم يجب أن يفهم أنه هذا الطبق يجب غسله. لقد تم سحب الصابون المنظف، والمصباح مفتوح. لذلك، كل ما عليّ فعله هو أخذ الطبق، الغسل، ووضعه على الرف، وأغلاق المصباح. يبدو الأمر واضحًا. لكن الجزء الصعب حقًا هو: كيف تحافظ على الاستمرارية بين بيئات مختلفة، أشياء مختلفة، وأهداف مختلفة. حتى في هذا السيناريو البسيط جدًا، قد تحدث حالات مختلفة تمامًا. الحالة الأولى هي أن عليك التكيف مع حركات الآخرين. على سبيل المثال، إذا دخل شخص ويغسل الأطباق ثم يعيدها على الطاولة، في هذه الحالة يجب أن تعرف أن الأطباق قد تم غسلها بالفعل، ولا حاجة لغسلها مرة أخرى. كل ما يجب فعله هو إعادتها إلى مكانها، ولا داعي لإغلاق الصنبور، لأنه قد تم إغلاقه بالفعل. النوع الثاني هو الاختلافات الدقيقة في الحالة الأولية. لنفترض أن كل شيء كما كان قبل ذلك، والفرق الوحيد هو عدم وجود صابون غسيل على هذه الطبق. إذا نظرت إلى الصورة الكاملة، فإن هذا الاختلاف صغير جدًا، إنه مجرد كتلة صغيرة من اللون الأزرق، وليس من السهل رؤيتها. لكنها ليست مجرد "فرق طفيف" يمكن إخفاؤه: إنها فرق ذاتي في وصف الحالة. لأنه إذا لم يُضاف شيء من الصابون إلى الطبق، فمن المحتمل ألا يجب عليك غسله، فالغسل مباشرة سيؤدي إلى الفوضى. يجب عليك أولاً وضع الصابون على الطبق، ثم الغسل، ثم وضعه على الرف، ثم إنجاز باقي الأمور. الفرق في الإدخال صغير جدًا، أما الفرق في الحالة فهو ذاتي، والإجراءات التي يجب اتخاذها مختلفة تمامًا. الثالث هو أن عليك مواكبة الملاحظات المتجددة باستمرار. مثلاً، عندما يأخذ الروبوت الطبق ويضعه على الرف، هذا كافٍ لأنه قد أصبح نظيفاً بالفعل، ولا حاجة لإغلاق الصنبور. لكن هناك بعض الأوساخ تحت الطبق. في هذه الحالة، يجب أن تدرك أنه إذا كان هدفي حقاً أن يكون كل شيء نظيفاً، فعليّ أن أمسح الطاولة. لم يأمرك أحد بذلك، لقد فهمت ذلك من خلال الملاحظات الجديدة. في الحالة المثالية، يجب أن تعيد الطبق إلى مكانه؛ لكننا لا نستطيع حتى اتخاذ هذه الخطوة، لأن جسم الروبوت ومهاراته تحد من ذلك. لذلك يجب أن تكون قادرًا على التكيف مع جميع هذه الحالات المختلفة. السؤال هو، كيف يمكن تحقيق ذلك.

02


إذا كان الروبوت يحتاج أيضًا إلى لغة

خلال السنوات الماضية، كنا نحاول إيجاد نموذج معين. طريقة تنفيذه تتغير باستمرة، لأن النموذج الأساسي يتغير، وأشكال الاحتمالات تختلف أيضًا. لكن الهيكل العام كان دائمًا كالتالي: من أحد الطرفين يأتي المدخل الأصلي، سواء في شكل فيديو أو لغة؛ ومن الطرف الآخر يتم استخدام النموذج الأساسي لاكتشاف مجموعة من المفاهيم المجردة التي يمكن تركيبها مع بعضها؛ ويجب أن تكون هذه المفاهيم قابلة للتكرار وتركيب مرة أخرى لتحقيق مهام عامة؛ ومن الطرف الآخر يتم التحكم في الحركات، ويفضل أن يتم اكتشافها وتعلمها بشكل مستقل. فيما يتعلق بتعلم الحركات، نأمل أن نتعلم من ما يُسمى بالإشراف الطبيعي. أي أن العملية بأكملها تُكتسب من خلال التعلم والاكتشاف، وكلما قلت مشاركة الإنسان، كان ذلك أفضل. ربما تعطيه مجرد فيديو، أو عرضًا توضيحي، أو بعض اللغة، والآن هذه المدخلات يمكن معالجتها بالفعل. كلما كان الإشراف أقل، كانت الشمولية أفضل. لكن عند رسم ذلك، تظهر سلسلة من الأسئلة على الورق. كيف يبدو هذا التركيب المجرد؟ كيف يتم اكتشافه؟ من أين تأتي اللغة المتخصصة التي تصف المهام؟ إذا لم تحتاجها على الإطلاق؟ كيف يمكن حل التخطيط، باستخدام منظم المهام التقليدي أم تعلم منظم؟ وأيضًا، بالنسبة لمفهوم العالم نفسه، هل يجب استخدامه كما هو أم تعديله قليلاً أو تدريبه مرة أخرى. لكل من هذه الطرق تنفيذات مختلفة، وقد جربنا أنفسنا نسخًا مختلفة على طول الطريق. سأبدأ أولاً بشرح الهيكل العام للطبقة العليا. النسخة الأولى من التنفيذ تم إنجازها قبل عامين، وكانت المكونات التفصيلية أكثر خشونة بكثير من الآن، لكن النموذج كان واضحًا بالفعل. افترض أن لديك مجموعة من العروض التقديمية. يمكن للروبوت أن يقوم بأكثر من مهمة مختلفة في نفس المكان، ويمكنك استخلاص النقاط الرئيسية خلال العملية بأكملها، مثل الإمساك بالوعاء في الخطوة الأولى، والحصول على الصنبور في الخطوة الثانية، ووضعها على الرف في الخطوة الثالثة. كما يمكن أن يكون شيء آخر، مثل بيانات الفيديو، على أي حال لديك مجموعة من البيانات هذه. هدفك هو تعلم النموذج الوصفي وراء هذه المهمة. هذا يشبه مجموعة من الرموز للنموذج العالمي، حيث يحتوي تقريبًا على مجموعتين من الوحدات. المجموعة الأولى هي الخصائص والعلاقات المكانية التي تهتم بها. هل هذا الجسم متسخ أم نظيف؟ ما هي العلاقة بين هذين الجسمين، علاقة ثنائية الأبعاد أم ثلاثية الأبعاد؟ يجب أن يمكن تحديد ذلك، وهذا يعتبر مجموعة من الصفات. بالطبع لا يمكن الاعتماد على الناس لوضع القواعد، بل يجب استخدام الشبكات والنماذج الأساسية للتعلم: حتى يتعلموا تحديد أي مجموعة من الصفات، سواء كان الجسم متسخًا أم لا، أو أي نوع من العلاقات المكانية. المجموعة الثانية هي الأفعال. لديك مجموعة من الأفعال الذرية، مثل “التنظيف”. يجب توضيح شروط البداية وتأثير النهاية لكل فعل. لتنفيذ هذه الحركة، يجب أولاً الإمساك بالشيء في اليد، والشخص يجب أن يكون في المطبخ؛ النتيجة هي أنه إذا كان على جسم الشيء صابون غسيل، فإنه يصبح نظيفًا. أما كيفية معرفة ما إذا كانت الروبوتتا تحتويان على شيء في يدها، وكيفية معرفة ما إذا كان الجسم نظيفًا أم متسخًا، فهذا يعتمد على مجموعة الصفات المذكورة سابقًا لتحديد ذلك. وفي الوقت نفسه، لإنجاز حركة فعلية بالفعل، تحتاج أيضًا إلى استراتيجية، أي كيف يجب أن تبذل المفاصل جهدًا. هذه الجزء أيضًا عبارة عن شبكة عصبية طبقية، مع استراتيجية انتشار لكل حركة ذرة. وبهذه الطريقة، يُعرّف الطبق التجريبي الخاص بالرموز الترابطية: طالما تُحقق الشروط المسبقة، يمكن ربط هذه الأفعال الذرية معًا لتشكيل مهام أطول ومعقدة. وكل من الإدراك والتحكم يتم من خلال الشبكات العصبية. ولكن من ناحية ما، هذا يُعد لغة متخصصة، مجموعة من اللغات المتخصصة في المجال (DSL). وهنا تبرز مشكلة أساسية: في البدايات، كانت هذه الأمور إما مكتوبة بخط اليد أو نسخة مباشرة من PDDL وما شابه، وقد تم تثبيت DSL. فهل هو عام بما فيه الكفاية؟ لماذا يكفي ذلك؟ ماذا لو كان هناك شيء مفقود؟ لذا، الخطوة التالية هي: يجب أيضًا أن يتعلم DSL نفسه. يمكنك ترك النموذج الأساسي ليرى البيانات التي بين يديك، سواء كانت فيديوهات تعليمية أو سجلات التشغيل أو لغة، ثم تخبره بأن هذه هي المهمة التي نهتم بها. بعد ذلك، يجب أن ينتج: أعتقد أن الخصائص التالية مهمة، وكذلك الأفعال الذرية التالية وشروطها المسبقة وتأثيراتها المباشرة مهمة. فماذا لو كان مخطئًا؟ يمكنك أيضًا التحقق من ذلك. من ناحية، يمكن التحقق من ذلك بشكل رمزي، ومن ناحية أخرى يمكن استخدام البيانات مباشرة للتحقق. على سبيل المثال، إذا قال النظام إنه يجب أمساك الشيء قبل غسله، وإلا فلن يتم الغسل. إذًا، يمكنك العودة ومراجعة بياناتك: هل كنت دائمًا أمسك الشيء قبل الغسل في كل مرة؟ يمكنك استخدام العروض التي تقدمها أو بيانات أخرى، سواء كانت عامة أو خاصة، للتحقق من هذه المواصفات. لذلك، فإن هذه اللغة نفسها تم طرحها من قبل نظام آخر. في العام الماضي، كانت عبارة ما قلتها فوضوية جدًا، وأتمنى أن تكون الأعوام القادمة أفضل، لأنني اكتشفت أن المقارنة الجيدة يمكن أن تجعل الأمور أكثر وضوحًا. هذه المقارنة موجودة على أجهزة الكمبيوتر الخاصة بكم. إذا قمتم بنسخ جملة مثل “افعل هذا” داخل برنامج الأنظمة الذكية، فإنه سيقوم بعشرة أو ثمانية خطوات بنفسه. الخطوة الأولى هي إنشاء ملف، والخطوة الثانية هي تنفيذ عملية معينة، وهكذا تابع الأمر خطوة بخطوة. لديها العديد من الخطوات المختلفة. عند التفكير في الأمر، فهذا يشبه تمامًا ما نحتاج إلى فعله. ما نقوم به في جوهره هو نقل الكائن الذكي مثل Cursor الذي يعمل على الكمبيوتر إلى الفضاء المادي: أولاً يتم تخيل سلسلة من الخطط، ثم تنفيذ هذه الخطوات، مع وجود طبقة من التحقق لضمان أن هذه الخطوات تم تعريفها بشكل صحيح وتم تنفيذها بشكل صحيح أيضًا. بشكل أساسي هذا هو كل شيء.

03


ماذا تفعل بالأشياء التي لم ترها من قبل، والنموذج؟

دعونا نتحدث عن متى يجب الجلوس لإجراء التدريب اللاحق. بالطبع، إذا تم استخدام النموذج الأمامي مباشرة وتطبيقه حتى النهاية، فهذا هو الأسهل. لكن هناك مشكلة لا يمكن تجاوزها فيما يتعلق بالروبوتات: الأشياء التي يجب التعامل معها قد لا تكون موجودة من قبل. لأن العالم الفيزيائي أكثر انفصالًا من العالم الرقمي. ربما رأيت شكلًا معينًا من الأجسام، لكن في الواقع، غالبًا ما يكون هناك قطعة من المكونات المستخدمة على خط الإنتاج، وهي متوفرة فقط في مصنعك، ولا توجد في أي مكان آخر. لم أرَ هذا الجزء من قبل، الآن أريد تحديد ما إذا كان متسخًا أم لا، وما إذا كان قد أحدث نتائج معينة. من الواضح أنه لا يمكن استخدام النماذج المتقدمة العامة مباشرة في هذا الوقت، لأنها حتى لا تعرف تعريفًا لما إذا كان هذا الجزء جيدًا أم سيئًا. لذلك، قد تكون هناك بعض الحالات التي تحتاج فيها إلى بعض التدريب الإضافي. الشرط هو أن تقرر عدم الاعتماد فقط على النماذج المتقدمة الجاهزة. فكيف يمكن القيام بذلك؟ تجدر الإشارة إلى شيء: على الرغم من أن هذه التأثيرات تبدو منطقية، مثل وجود صابون على الشيء بعد غسله يصبح نظيفًا، إلا أنه في الواقع تم كتابتها بشكل تقريبي، وغالبًا ما تكون العمليات المنطقية موجودة على شكل احتمالات. لذلك يمكنك ربط السلسلة بأكملها: إذا قلت إن الشيء يحتوي على صابون، وبعد غسله يجب أن يصبح نظيفًا. ولكن ماذا لو كانت معيار تحديد "هل يحتوي على صابون" سيئًا؟ لأنه كونٌ جديد لم أرَه من قبل، لا يمكن تحديده، فالإخراج خاطئ، وتتبع ذلك كل الخطأ. وفي هذا الوقت، يخبرني العرض التوضيحي حقيقة أخرى: أن الكون نظيف بالفعل. وهكذا تحصل على علامة تسمية. بما أن جميع خطوات التنفيذ متراكمة بشكل تفاضلي، يمكنك استخدام هذه علامة تنفيذ في العرض التوضيحي للانتشار العكسي، لتوفير الإشراف للنموذج. لذلك، يمكن إجراء التدريب اللاحق في بعض الحالات. ليس ضروريًا، ولكن إذا اعتبرت هذه النماذج كوحدات في النظام، وكان من الضروري تدريبها مرة أخرى، فإن الطريق ممكن. لا سأل عن نتائج تلك الدفعة من قبل عامين، فهذه الأجزاء الآن قد فقدت قيمتها، وبعد تغيير الأسلوب، سيبدو أن بعض الأجزاء كانت غير دقيقة في ذلك الوقت. لكن القاعدة نفسها لها إمكانات كبيرة، وفيما بعد قمنا بتغيير الأجزاء المختلفة إلى نسخ أكثر حداثة. بالمناسبة، أحد الباحثين العلميين في ذلك العمل يعمل الآن كأستاذ في جامعة سنغافورة الوطنية، والشريك الآخر كان طالب دكتور في معهد ماساشي للتكنولوجيا، والآن أصبح أيضًا أستاذًا.

04


حتى التخطيط بدأ يتم تركه للنموذج

سأتحدث عن بعض التطورات الأقرب الآن، وسأتحدث بسرعة. كما ذُكر سابقًا، فإن الوحدات في النظام تظهر طبقة تلو الأخرى، وتم تسليم التحقق والإدراك والتحكم إلى الشبكات العصبية. لكن هناك شيء لم يتم بعد: التخطيط. عندما يكون لديك جميع الوحدات، وبعد التحقق من الحالة، فهل يجب أن أبدأ بالغسل أم أفعل شيئًا آخر؟ في ذلك الوقت، كان يتم استخدام الأساليب التقليدية، وفقًا للمنهجية المستخدمة في التخطيط المهام التقليدي. ولكن مؤخرًا، قمنا بإصدار بحث خاص يغيّر هذا الجزء أيضًا. هذا أيضًا سبب عدم حصولي على شريط عرض جيد اليوم، كان يجب أن يكون لدي فيديو، وأنا فعلاً أريد الفيديو. لذا، بترقب، سنحصل على فيديو جميل خلال بضعة أيام. الآن يمكنني استخدام صورة واحدة من الأوراق البحثية كبديل. هذه الفكرة هي كالتالي: لا تزال لدي مجموعة من الحالات التي يتم التحقق منها بواسطة الشبكات العصبية؛ ولكن مسألة “مع تحديد الحالة الحالية، يجب أن أفعل ماذا أولاً، هل يجب أن أغسل، أم أحمل صحن الطعام، أم ما إلى ذلك”، لم تعد تُترك للمنظم التقليدي، بل تُترك للشبكة. بشكل أكثر تحديدًا: تلك المجموعة من الصفات أصبحت الآن لغة طبيعية بشكل أساسي، لغة طبيعية حقيقية. يمكنك استخدام اللغة الطبيعية والصور معًا كتلميحات لتعليم النموذج الأساسي ليتولّى التخطيط. لكن يجب أن يتم التدريب عليها بعد ذلك. لذلك، نحن مضطرون إلى استخدام نماذج الأوزان المفتوحة المصدر، لأنه يجب تدريبها بعد التنفيذ؛ كما أنه لأن الصور تُعتبر جزءًا من المدخلات، فإن النموذج يجب أن يكون قادرًا على استيعاب الرسومات. ووجدنا أن بعض النماذج المفتوحة المصدر تتمتع بقدرة ضعيفة على الاستدلال البصري، على الأقل كانت أضعف من النماذج الخاصة المغلقة في نفس الفترة. لذلك، إذا استخدمتها مباشرة، فإنها غالبًا ما تنتج أشياء غير منطقية تمامًا. في التطبيق العملي، اخترنا بعض النماذج وقمنا بتدريبها لاحقًا. وبهذه الطريقة، حتى مشروعيّر نفسه أصبح شيئًا تم تعلمه بعد التدريب. يمكنه استخدام هذا النوع من اللغة الطبيعية الرمزية في التخطيط، وتكون احتمالات تنفيذ السلسلة الفعلية أعلى بكثير. وبالنسبة لهذه المهام طويلة المدى، فهذا يعني قلة الحاجة إلى تدخل بشري. وهناك تحدٍ آخر: كل ذلك يعتمد على مكتبة المهارات، وقد تختلف مكتبات المهارات لكل روبوت. إذا استخدمت أي نموذج متقدم مباشرة، فلن يكون لديك السياق المتعلق بمكتبة المهارات الخاصة بك. على سبيل المثال، قد يقول الروبوت: "الآن يجب أن تملأ هذا الكوب بالماء من الصنبور، لكن الصنبور لم يُفتح بعد". وهذا الفعل غير قابل للتنفيذ. بعد التدريب، يبدو أن منظم العمليات عند التعامل مع هذه العمليات طويلة المدى يقدم تحركات يمكن تنفيذها فعليًا. بعد بضعة أيام سنحصل على فيديوهات، اليوم سنتابع النتائج الجديدة. حتى الآن، كنا نفترض دائمًا أن هناك عرضًا توضيحي: سواء كان فيديو أو عملية بشرية. ما أريد قوله في الوقت المتبقي هو: ماذا لو لم يكن هناك عرض توضيحي؟ ماذا لو واجهت شيئًا جديدًا لم أره من قبل؟ الممارسة السابقة كانت أن يُظهر لي ذلك الشيء، ويخبرني كيف أتعامل معه. لكن هل من الممكن أن أفكر في طرق مختلفة للتعامل مع ذلك الشيء دون الحاجة إلى فيديو توضيحي أو أي مساعدة من شخص ما؟ على سبيل المثال، إذا كان أمامك مجموعة من الأشياء الجديدة. لقد علمناك سابقًا كيف تفتح الصنبور. لكنني لم أستخدم هذا الصنبور من قبل، هل يمكنك أن تقدم بعض الأمثلة وتخبرني بطرق التفاعل معه؟ هذه أيضًا جزء من العمل الذي نجريه. دعونا نصيغ الأمر بشكل تقريبي أولاً. لنفترض أن لدينا جسم ثابت واحد فقط، مثل مفتاح مياه أو صندوق. هل يمكننا تطوير نظام يستخلص توزيعًا من هذه الأجسام الثابتة من زاوية واحدة، ثم يقوم بأخذ عينات من هذا التوزيع لخلق مساحة إمكانيات؟ إذا أعطيتمه مفتاح مياه، فإنه سيقوم بأخذ عينات على شكل حركة؛ وإذا أعطيتموه صندوقًا، فإنه سيقوم بأخذ عينات على شكل فتح وإغلاق، بالإضافة إلى جميع الأشكال المختلفة. سأمرر بالطريقة التفصيلية قليلاً اليوم، مع احترام وقت الجميع. لكن النتيجة هي: بمجرد أن تتعلم هذا النظام، يمكنك الدخول إلى سيناريو جديد تمامًا، على مجموعة من الأشياء المختلفة، حيث يمكن للنموذج استنتاج طرق التفاعل المحتملة. شاشات عرض، أقراص USB، زهور، كل شيء. والنتائج التي يخرجها ليست إجابات مكررة، بل تستخدم أبسط ما تعلمته من التوزيع: كيف يمكنني التعامل مع هذا الشيء؟ فماذا عن العالم الحقيقي؟ عندما يدخل الروبوت إلى غرفة، إدراكه سيكون قذرًا للغاية. لذلك قمنا بأمر آخر: ترك طالب يستخدم iPhone لإجراء مسح للغرفة. يمكن لiPhone فعل المسح ثلاثي الأبعاد بالفعل، لكن دقةه ليست عالية، والنتائج التي يتم إخراجها مزعجة جدًا ومتواضعة للغاية، تشبه كتلة من الوجوه. حتى لو قدمنا هذه النتائج ذات الضوضاء العالية كمدخل لنظامنا، ستلاحظ أن لها بعض خاصية التعميم بالعين الصفرية: يمكنه تفكير في كيفية التعامل مع غسالة مياه، أو ثلاجة، أو ميكروويف، واستنتاج الطريقة المناسبة للتعامل معها. هذا سيكون أكثر فائدة للروبوتات. لأن الروبوت سيدخل إلى غرفة لم ترها من قبل، حتى مع إدخال خام كهذا، سيتحدث قائلاً: "هذا الصنبور المحدد لم أراه من قبل، لكن يمكنني استنتاج طرق مختلفة للتعامل معه، ويمكنني تخيل طرق متعددة للتفاعل معه، ثم استخدام هذا الشيء لاكتشاف استراتيجية. الوضع في المكتب كذلك، نتيجة إعادة البناء مماثلة، لكنه يمكنه استنتاج كيفية التعامل مع حاسوب محمول. لكن هناك مشكلة في هذا الاستنتاج أيضًا." يمكنه تقديم أربعين طريقة للتفاعل مع هذا الجسم، لكنك في الأصل تريد تحقيق هدف ما، ولا تعرف أي من هذه الأربعين طريقة هي التي ستكون مفيدة بالنسبة لك حقًا. لذلك نفكر أيضًا، هل يمكن إضافة شروط لغوية إلى هذا النموذج حتى نتمكن من التحكم فيه بشكل أفضل. على سبيل المثال، لدي مشهد ساكن، ثم أعطي جملة لغوية: "طفل يقفز على العربة". هل يمكن أن ينتج مشهد ثلاثي الأبعاد حيٍّ، أو مشهد رابعي الأبعاد؟ هكذا تحدث الشخص والجسم مع بعضهما، وتظهر حركات الطفل عند قفزه على الجانبين. وهذا مفيد للغاية، لأنك يمكنك الاستمرار في السؤال: كيف يجب أن يتفاعل الروبوت مع هذا الجسم؟ يمكنك توليد النتائج، ويمكنك توليدها في هذا الاتجاه أو في ذلك الاتجاه، ثم اختيار الحركة التي تساعد فعليًا في حل المشكلة. كيف يمكن تحقيق ذلك؟ لا بد من الاعتماد على نماذج توليدية مُتدربة مسبقًا بكميات كبيرة. في هذا العمل، نعتمد بشكل رئيسي على نماذج الانتشار بالفيديو. افترض أنك حصلت على مشهد ساكن، قد يكون قذرًا بأي حال، يمكنك تحويله إلى تمثيل وسطي يتكون من آلاف النقاط، ثم يمكنك إضافة بُعد أخرى، وهو الزمن. وبذلك تحصل على تمثيل رباعي الأبعاد. لكن عند تحويل ثلاثة أبعاد مباشرة إلى رباعي أبعاد، يكون المشهد ساكنًا، كيف يمكنك جعله يتحرك؟ هناك طريقة. إذا كان لديك شكل ساكن واحد فقط، وتريد جعله أكثر واقعية، فهناك تقنية تُسمى أخذ العينات بالتقطيع التفاضلي (SDS). طريقة العمل في البُعد الثلاثي العادي هي كالتالي: يتم رسم هذه الشكل، ويتم الحصول على مقاطع فيديو من زوايا مختلفة، ثم تُرسل إلى نموذج الانتشار المرئي لكي يتم تحديث هذا التمثيل على طول اتجاه الزمن. يمكن القيام نفس الشيء في البُعد الرابع أيضًا. من الناحية العملية، الأمر صعب للغاية، حيث يجب حل مجموعة من المشكلات، ويجب أيضًا تصميم هياكل البيانات على مستوى التمثيل الرابع. لكن من الناحية المفهومية، يتم استخدام نموذج الفيديو والنموذج المرئي المدرب مسبقًا لتوجيهك، وإنشاء تسلسل تفاعلي بين الأشخاص والأشياء الحقيقية، أو بين الروبوتات والأشياء. لنذكر نتائج أخريين. على سبيل المثال، إذا كان لديك كتلة طوب، وأضفت جملة "الروبوت يلتقط الكتلة الطوب"، فإنه سيولد تسلسل تفاعلي للروبوت وهو يلتقط الكتلة الطوب، مما يتيح لك رؤية كيف سيبدو هذا التفاعل تحت ظرف لغوي مختلف. يمكنك أيضًا إضافة بعض العروض التوضيحية المجانية، وتعلم المهارات من هذه العروض التوضيحية المجانية. في السابق، كان عليك أولاً أن تمتلك فيديو تفاعل بواسطة الإنسان أو بيانات التشغيل عن بعد، حتى تتمكن من تعلم المهارات والانضمام إلى التخطيطات؛ أما الآن، يمكنني أن أقوم بأنتاج العروض الخاصة بي، ثم أتعلم المهارات من هذه العروض، وبعد الانتهاء أعيدها إلى الإطار التدريبي الأصلي. لا يشترط استخدامها بالضرورة على الروبوتات. مثل ضرب كرة البيسبول على الصندوق وتقليبها، أو قفز القطة على وسادة، كل ذلك ممكن القيام به. لكننا في الواقع استخدمناه على الروبوتات أيضًا. على سبيل المثال، هناك قطعة قماش. تريد أن تقوم بإنشاء سلسلة من التفاعلات بين الإنسان والقطعة القماشة، وتفردها. الجانب الأيسر هو الجانب المُولد. لأنه مُولد، فإنك تحصل على مجموعة من العروض التجريبية المجانية، ويمكنك الحصول على مسارات كثيفة في ثلاثة أبعاد، يتم تتبعها عبر الزمن في ثلاثة أبعاد. تتحول هذه الأشياء إلى مجموعة من أهداف الإشراف المجانية، لتعرف الروبوت: أنا أريد أن يتحرك هذا الجسم بهذه الطريقة. الجانب الأيمن هو الروبوت الحقيقي الذي يحاول فعل نفس الشيء. بدءًا من الخيال، دع نموذج الانتشار يوجهك، واعتبر إخراجه هدفًا ناجحًا، وهكذا تتعلم استراتيجية لفعل ذلك. مثال آخر هو إغلاق الكمبيوتر المحمول. في الآونة الأخيرة، كنا نعمل على تحسين سرعة الجهاز. لأن في هذه الطرق، كلما تعاملت مع وحدات الانتشار، يكون الأمر بطيئًا، وأما في الأبعاد الأربعة، فإن عملية تقطير النسب تكون بطيئة أيضًا. لذلك استخدمنا الذاكرة التخزينية والرسم البصري الدلالي، لزيادة نسبة التحديث الناجح في مرة واحدة، بحيث لا تحتاج إلى استدعاء نموذج الفيديو بشكل متكرر. بهذه الطريقة يمكنك إنشاء تسلسل عروض ذو مدة أطول. ربما في الماضي كنت أُنشئ مجرد عرض توضيحي واحد، حيث يأخذ الروبوت الطوب أو يغلق الدفتر، وهذا لإعطائك دروسًا في المهارات الذرية. الآن ليس روبوتًا، ولكن لا يوجد سبب لعدم أن يكون روبوتًا، يمكنك إنشاء تسلسلات متقطعة لفترات طويلة جدًا، ويمكنك القيام بأشياء مختلفة تمامًا. وبالتالي، ما تحصل عليه ليس مجرد عرض توضيحي مجاني للمهارات الذرية، بل عرض توضيحي مجاني لمشاكل التشغيل المعقدة لفترات طويلة، والتي يمكن أن توفر لك بياناتًا لا نهائية لتدريب مهاراتك. حسنًا، سأتوقف هنا.

05


الهيكل ليس الإجابة، بل هو جسر عمل.

عند النظر إلى الوراء، لقد كنا دائمًا نتحدث عن كيفية العثور على هذه التصورات المُنظمة. ستلاحظ أنه مع مرور الوقت، أصبحت هذه الأشياء أكثر عددًا. الآن، تقريبًا كل جزء متوفر، لكنك لا تزال تحتفظ بالطبقة المتوسطة من التصورات. الآن، توجد تقريبًا في شكل لغة، وبالطبع، هناك تصورات المشهد مقابلها، مما يجعل الكل متعدد الفهم.

كنا أيضًا نفكر دائمًا في كيفية جعله أكثر شيوعًا، وكيف لا نقيده بأشياء موجودة بالفعل أو عروض مقدمة.

بالنسبة لكلمة “الهيكل”، أود أن أقول المزيد. عندما يتحدث الآخرون عن الهيكل، من السهل أن يُفهم على أنه يجب دفع الهيكل إلى النظام بشكل قسري. هذا ليس جيدًا، وليس ما نفعله. نحن نفكر في إمكانية استخدام هذه الواجهة لتساعد النظام على التحكم بشكل أكثر كفاءة؛ فهي كهيكل خارجي، وفي نفس الوقت تسمح للبشر بالتواصل معه. من الناحية الأساسية، أنت تستخدم البيانات المتراكمة من الوسائط المختلفة، خاصة الفيديوهات، بالإضافة إلى اللغة، وكذلك الأبعاد الثلاثية والرابعة التي يمكنك الحصول عليها. لكن في النهاية، ما يجب أن تهتم به هو شيء آخر: كيف تسمح لنا هذه التمثيلات المنظمة بامتلاك القدرة على الاستدلال. لديك تمثيلات على مستوى الذرات، سأقوم بالتنظيف، سأضعها، سأفعل هذه الأمور؛ إذًا الخطوة التالية هي، ما هي العلاقات التابعة بين هذه المهام، وما هو تأثيرها. ما يجعلك تتمكن فعليًا من حل المشكلات طويلة المدى، وذلك بطريقة شاملة، هو هذا. شكرًا للجميع.

لتسهيل التواصل بين الجميع وتبادل أخبار الاجتماعات، قمنا بإنشاء موقع خاص باسم IROS 2026 مجموعة التبادل والمشاركة!هل دخول المجموعة سيجعلك تستفيد من هذه "المزايا"؟

  • محطة المعلومات للاجتماعات: إرسال المقالات بصيغة DDL، قواعد التنسيق، تقدم التقييم... النقاط الحاسمة تصل في الوقت المناسب، ولن تخف من تفويت الموعد النهائي، فالاستعداد للإرسال يتم بشكل مستقر.

  • اجتماع الشراب مع الزملاء: جميع الزملاء من كل مكانات العالم حاضرون في المجموعة، نتحدث عن الخبرات، نتبادل الأفكار، ونبني علاقات، نسير معًا في طريق البحث العلمي.

  • محطة إمداد رائدة: أحدث نتائج البحوث، اتجاهات العمليات الساخنة مُتزامنة في الوقت الحقيقي، مع دمج موضوع المؤتمر ليساعدك على توضيح سياق النشر، ويوفر إلهامًا للمقالات.

  • فريق الدعم الميداني: (يُفتح حصريًا أثناء الاجتماع):لا داعي للقلق عند وصولك إلى مكان الاجتماع —

    توجيه المسار: توزيع الملاعب، كيف يصل إلى قاعة التقارير، يمكن الاستفسار في المجموعة في أي وقت؛

    قراءة المواضيع المشتركة: جلسات شائعة، مناقشات Keynote، يمكن متابعةها حتى إذا فاتك؛

    معرض البوستر: تجميع جوهرة البوسترات الميدانية، حفظ بضغطة واحدة دون أي إغفال؛

    ساحة يوجو: غرف عشاء، مكاتب مقابلات، لجان تبادل… إذا أردت التحدث أو التعاون أو التقاء شخصي، يمكن إنشاء مجموعة لتحقيق ذلك.

؟ باب الانضمام إلى المجموعة: امسح الرمز للانضمام إلى المجموعة أو أضف لويتويو_2026 على ويتشات، وضع ملاحظة: ECCV + الجهة/الجامعة + الاسم + التخصص.

في البحث العلمي أو التقنية، يُعَد الفرق في المعلومات أمرًا مهمًا.

هيا، دعونا نتقدم خطوة أقوى!

اصعد إلى السيارة، وسنرافقك لاستكشاف جوهر المؤتمرات الكبرى في مجال الذكاء الاصطناعي حول العالم

يمكن الاطلاع على المحتوى حصريًا:

عروض PPT الخاصة بالخبراء

تقرير المؤتمر كاملاً

تحليل الأوراق البحثية الشهيرة

مقابلة مع نجم أكاديمي جديد

امسح الرمز الثنائي الأبعاد أعلاه

أو انتقل إلى “قراءة النص الأصلي” لمتابعة القسم المخصص.

مقال أصلي من موقع ليي فنغ، يُمنع نشره دون تصريح. لمزيد من التفاصيل، راجع تعليمات النشر.

المصدر الأصلي

雷峰网 AI

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل