雷峰网 AI

فنغ تسونغباو من Zhijian Power: تحقيق تصنيع الروبوتات بواسطة الروبوتات في سيناريو حقيقي تبلغ الفجوة فيه 0.5 ملم فقط | IROS 2026

الذكاء المجسّد ينتقل من المختبرات إلى المصانع الحقيقية، ويتجه نحو التصنيع الدقيق. الكاتب丨 دنغ جيه مين التحرير丨 تشي تشنغ يونغ هل فكرت يوماً أن الروبوتات يمكنها أن تدخل ورش التصنيع وتصنع بأيديها القطع اللازمة لتجميع روبوت؟…

الذكاء المُجسَّد ينتقل من المختبرات إلى المصانع الحقيقية، متجهاً نحو التصنيع الدقيق.

    الكاتب: دنغ جيمين

تحرير: تشي تشنغ يونغ

                                                                                                       

هل فكرت يومًا في أن الروبوتات يمكنها أيضًا دخول ورش التصنيع وصناعة بنفسها القطع اللازمة لتجميع روبوت؟ قد يبدو هذا الأمر نكتة، لكنه في الواقع أحد أصعب تحديات التطبيق العملي للذكاء المتجسّد. مفاصل الروبوتات وأجهزة التثبيت والهياكل الدقيقة، كلها تُصنَّع خطوة بخطوة بواسطة مخارط ومقاعد CNC (التحكم الرقمي بالحاسوب). إذا استطاعت الروبوتات الإشراف الذاتي على هذه الأجهزة، وتنفيذ مهام الإمساك بالقطع وتحميلها وإدخالها وإخراجها ووضعها، فإن صناعة الروبوتات ستغذي نفسها ذاتيًا — فكلما زاد عدد الروبوتات، زادت القدرة على تصنيع الروبوتات وانخفضت التكاليف، مشكّلةً حلقة تغذية راجعة إيجابية. لكن تحقيق ذلك أصعب بكثير مما يُتخيَّل. فالقطع اللازمة لصناعة الروبوتات هي تحديدًا من بين أكثر القطع تطلّبًا للدقة: الفجوة بين القطعة وجهاز التثبيت لا تتجاوز غالبًا 0.5 ملم، والأسطح المعدنية العاكسة والأشكال شبه الخالية من الملمس والتشابه الكبير بين القطع، كلها تتحدى القدرات البصرية واللمسية للروبوت ودقته طوال العملية. وحتى العروض التوضيحية المبهرة في المختبرات، لا بد أن تتجاوز أولًا هناالتفاوت المسموح، ووقت الدورة، ومعدل الجودةهذه العوائق الثلاثة. في 29 سبتمبر 2026، في مدينة بيتسبرغ الأمريكية، على أرض مؤتمر IROS 2026 القمي في علم الروبوتات، تناول Tech Talk هذه المسألة مباشرةً: كيف نجعل روبوتًا يعتني بشكل مستقل بماكينتي CNC، وينجز جميع العمليات المذكورة في فجوة بمقدار 0.5 ملم، وبالتدريب باستخدام 600 مسار روبوتي حقيقي فقط. المتحدث هو فنغ زونغباو، مدير التعلم المعزز في Zhijian Power. لم يكن هذا مجرد عرض تقني، بل كان إجابة مرجعية حول كيفية تحويل دقة المختبر إلى دقة المصنع. وفيما يلي نص مُحرَّر من خطاب فنغ زونغباو في IROS 2026، أُعدّ بناءً على العرض الإنجليزي المُلقى في المكان، حيث أعاد موقع 雷峰网 (حساب WeChat: 雷峰网) تنظيم التعبيرات الشفهية والمصطلحات التقنية دون تغيير المعنى الأصلي.

▎من المختبر إلى المصنع: لماذا يُفشل التلاعب الواقعي بمخرطة CNC خطوط تعلّم الروبوتات الحالية

المحاضر: فنغ زونغباو، رئيس تعلم التعزيز في شركة تشيجيان للطاقة (Simplexity Robotics)

01

تصنيع الروبوتات باستخدام الروبوتات

تبدأ هذه المشاركة من هدف تصنيعي وهو تصنيع الروبوتات بواسطة الروبوتات. قد تبدو عمليات CNC بسيطة، لكن جعلها مستقرة وموثوقة في مصنع حقيقي هو مسألة مختلفة تمامًا. وهو ما يكشف عنالشق الواضح الفاصل بين نجاح الاختبارات المعيارية المخبرية والدقة بمستوى المصنع. اليوم، سأعرض كيف نسعى جاهدين لسدّ هذه الفجوة. تُعدّ SimpleClaw شركة ذكاء مُجسَّد متكاملة الطبقات (Full-Stack). نموذجنا متعدد الوسائط الذي طوّرناه ذاتياً يوحّد الفهم والتوليد معاً؛ وحلقة بيانات مغلقة تتيح لنا التحسين المستمر لهذه النماذج؛ ومنصة عتادية نمطية موحّدة تُشغّلها على روبوتات حقيقية؛ بينما تمنح منصة SimpleClaw المطوّرين منصة مفتوحة لبناء تطبيقات الروبوتات ونشرها. على جانب العتاد، لدينا أربعة خطوط منتجات. i7 Pro هو روبوتنا ذو العجلات، وiX هو روبوتنا البشريّ الشكل ذو العجلات. كما نوفر ذراعاً روبوتية نمطية تحكّم بالقوة بتكوينين، ونعرض هنا شكليها مع اليد الماهرة Dexter ومع المِشبَط على التوالي. وأخيراً، تساعدنا قفازات جمع البيانات في جمع العروض التوضيحية البشرية على نطاق واسع، بما يوفر بيانات لتعلّم الروبوتات. إذن، نهجنا يربط بين ثلاثة أجزاء: نحن متكاملو الطبقات ومنتجون ذاتياً، من العتاد إلى البرمجيات ثم النماذج؛ وقفازات جمع البيانات تجعل جمع العروض البشرية على نطاق واسع ممكناً؛ والنموذج متعدد الوسائط يوحّد الفهم والتوليد. الهدف هو تعلّم المزيد من هذه البيانات ورفع سقف قدرات الروبوت في عمليات CNC الدقيقة. يركّز هذا العرض على ثلاثة مناهج متكاملة: SimpleWAM يولّد مقاطع حركية من مشاهدات متعددة الوسائط؛ وDRAM، أي الذاكرة الترابطية الحلقية بقاعدة الدلتا، تعالج السياق طويل المدى بذكرى مصفوفة ثابتة الحجم؛ وDPE يستخدم مقيّماً مدرَّباً بشكل منفصل لتقييم الحركات المرشّحة مع إبقاء السياسة مُجمَّدة. الثلاثة مجتمعةً تحلّ مشاكل توليد الحركة والذاكرة واختيار الحركة في نظام CNC لدينا.

02

تحديات المصنع الواقعية

هذا هو التحدي الذي واجهناه في المصنع. هدفنا هو روبوت يصنع الروبوتات، وعمليات CNC الدقيقة هي الممثّل الأبرز لذلك. لماذا هي صعبة؟ أولاً، الفجوة بين قطعة العمل والمِشبَط لا تتجاوز 0.5 ملم، فلا تكاد تترك أي مجال لخطأ المحاذاة. ثانياً، الأسطح العاكسة والأنسجة الخافتة والأجزاء المتشابهة في الشكل تجعل المحاذاة البصرية أمراً صعباً. ثالثاً، يجب على الروبوت تنفيذ سلسلة من الحركات في مساحة عمل مقيّدة، بينما واجهات التلامس الحرجة ليست مرئية دائماً. لذلك، يجب أن يحافظ النظام على الدقة طوال المهمة بأكملها، حتى مع نقص المعلومات البصرية. هذه القيود الخاصة بـ CNC شكّلت بنيتنا: النسيج الضعيف يتطلب مُرمِّزاً بصرياً قوياً بما يكفي؛ والاقتراب طويل المدى يحتاج إلى زوايا متعددة توفرها كاميرا الرأس وكاميرا المعصم؛ بينما يتطلب التلامس الدقيق التكييف على الإحساس بالاقتراب. وهكذا تُحوَّل المدخلات البصرية واللغوية والحالة إلى رموز (tokens). يوفر SimpleWAM العمود الفقري متعدد الوسائط وDiT الحركية. نُدخل وحدة DRAM بينهما لتكملة السياق التاريخي إلى جانب المشاهدة الحالية. يقترح DiT الحركي مقاطع حركية مرشّحة، ويقيّمها DPE بمقيّم مدرَّب بشكل منفصل مع إبقاء مُقترِح الحركات المدرَّب ثابتاً دون تغيير. ثم يُرسَل المقطع الحركي المختار إلى i7 Pro.

03

الحل الملموس المعتمد

SimpleWAM هو نموذجنا الموحّد العالمي-الحركي (World-Action Model). وفكرته هي:التعلّم أثناء التدريب من إشراف مستقبلي غني، والتنبؤ المباشر بالحركات أثناء الاستدلال. في مرحلة التدريب، يعيد DiT الفيديو وDiT ثلاثي الأبعاد (3D DiT) وDiT الحركي، بتوجيه من تعليمات المهمة، إعادة بناء إطارات الفيديو المستقبلية والحالة ثلاثية الأبعاد (3D) ومقاطع الحركة بشكل مشترك، ما يمكّن النموذج من التعلّم المتزامن لديناميكيات الرؤية والفضاء والحركة. وفي مرحلة الاستدلال، نُدخل فقط الصورة الحالية والحالة ثلاثية الأبعاد (3D) الحالية والتعليمات اللغوية، فيُخرج النموذج مقاطع الحركة مباشرة دون حاجة إلى توليد الصور أو الحالات ثلاثية الأبعاد (3D) المستقبلية. قبل تنفيذ الحركة، نستخرج الملامح على حدة ثم نجري دمجاً تكيفياً لها. مُرمِّز مشترك ومُجمَّد يحتفظ برموز الصور الكثيفة القادمة من كاميرا الرأس وكاميرا المعصم؛ بعد ذلك، تقرأ الاستعلامات كل زاوية على حدة بشكل مستقل، فلا تكتسح أي زاوية الأخرى قبل الدمج؛ ثم توازن البوابات، لكل استعلام ولكل قناة ملامح، بين السياق العام ومؤشرات المحاذاة المحلية. وفي النهاية، يُدمَج التاريخ البصري مع DiT حركي قوي مشروط بالحالة للتنبؤ بمقاطع الحركة. تُظهر خرائط الانتباه على اليمين تأثير تركيز أوضح على الحدود. في التجارب الاسمية لكل طريقة، نجحت طريقة الدمج 15 مرة، مقارنةً بـ 0 مرة لـ Query-concay و8 مرات للأساس π0.5 SFT. للتحرك باستقرار واستمرار خلال مهمة طويلة، يحتاج الروبوت إلى سياق من الخطوات السابقة. لذلك قدّمنا DRAM — الذاكرة الترابطية الحلقية بقاعدة الدلتا (Delta-Rule Recurrent Associative Memory) — التي تضيف هذه القدرة إلى سياسات الروبوتات المدرَّبة مسبقاً. هنا، يستخرج العمود الفقري المُجمَّد لـ SimpleWAM الملامح من المشاهدة الحالية؛ وتقرأ DRAM أولاً باستخدام هذه الملامح التاريخ ذي الصلة من الذاكرة؛ ثم يدمج DiT الحركي التاريخ المقروء مع السياق الحالي لتوليد مقاطع الحركة؛ وبعدها تُحدَّث الذاكرة عبر قاعدة الدلتا المبوَّبة لتُستخدم في الخطوة التالية. الذاكرة عبارة عن مصفوفة ترابطية ثابتة الحجم، لذا يبقى حجمها المستهلك ثابتاً كلما طالت المهمة. ويمكن إضافة DRAM دون تعديل بنية العمود الفقري أو إعادة تدريبه، ما يجعل إدماج الذاكرة طويلة المدى في السياسات القائمة أسهل. أثناء الإدخال الدقيق، قد لا يكفي المشهد البصري وحده لتحديد كيفية تلامس قطعة العمل مع المِشبَط. القوة وعزم الدوران يكملان هذه المعلومات التلامسية المفقودة تماماً. نستخدمهما من جانبين: أولاً، التكييف على الإحساس بالاقتراب يعدّل مدخلات حالة الروبوت، فيأخذ DiT الحركي عامل التلامس في الحسبان عند توليد الحركة التالية؛ وثانياً، متحكّم الممانعة في الزمن الحقيقي يستخدم التغذية الراجعة الفورية لجعل التنفيذ أكثر متانة، ويعدّل الحركة وفق تغيّرات التلامس. ودمجهما يدعم التعافي عند انسداد الإدخال المباشر. في مهمة الإدخال الدقيق في CNC، حقّقت هذه المجموعة من الطرق نسبة نجاح 100% في المهمة. النهج الشائع هو استخدام تغذية المقيّم الراجعة لتحديث المُنفِّذ، لكن ذلك قد يؤدي إلى انحراف السياسة. يدرّب DPE أولاً مُنفِّذاً بالاستنساخ السلوكي، ثم يستخدم مقيّماً مدرَّباً بشكل منفصل لتقييم الحركات المرشّحة أثناء النشر؛ وتُحدَّث لاحقاً عمليات التنفيذ الناجحة والفاشلة المقيّم فقط، فتتكوّن الحلقة المغلقة، بينما يبقى المُنفِّذ مُجمَّداً دائماً على الروبوت. رفع DPE نسبة نجاح المهمة وقلّل عدد خطوات التنفيذ.

04

عرض النتائج

حققنا في النهاية حلاً تشغيلياً كاملاً يتيح لروبوت واحد الإشراف الآلي الكامل على ماكينتي CNC دون تدخل بشري. يعرض فيديو العرض التوضيحي الرئيسي، بخمسة أضعاف السرعة، عملية العمل الذاتية الكاملة للروبوت، إضافةً إلى مقاطع فرعية متعددة تعرض كلٍّ على حدة العمليات الثلاث المستقلة الأساسية: التقاط قطعة العمل ذاتياً، والتحميل الدقيق في المِشبَط، وسحب القطعة بعد اكتمال التشغيل وإعادتها إلى مكانها. التقاط قطعة العمل: إدخال القطعة في المِشبَط، إخراج القطعة ووضعها، والجدير بالذكر أننا خلال عملية تدريب النموذج بأكملها استخدمنا فقط 600 مسار حركة لروبوت حقيقيكتدريب بيانات. وهذه هي القيمة الجوهرية لعملنا هذه المرة: نقل الذكاء المُجسَّد من نتائج الاختبارات المعيارية المخبرية إلى التطبيق الفعلي في سيناريوهات التصنيع الصناعي عالية الدقة وعالية الواقعية.

لتسهيل التواصل والتبادل وتبادل أخبار المؤتمر بينكم، أنشأنا خصيصاً مجموعة 2026 التواصل الخاص بالمشاركين في IROS! بالانضمام إلى المجموعة ستحصل على هذه «المزايا»؟

  • محطة معلومات المؤتمر: مواعيد التقديم النهائية، وقواعد التنسيق، وتقدّم التحكيم… تصل إشعارات المحطات الرئيسية في وقتها الأول، فلن تخشى تفويت أي deadline بعد اليوم، وتحضيرك للإرسال سيكون مطمئناً.

  • جلسة الحوار بين الزملاء: زملاء من كل مكان في المجموعة، تبادل الخبرات، وتلقيح الأفكار، وبناء العلاقات، فنحن رفقاء في طريق البحث العلمي.

  • محطة التغذية بالتقدم: أحدث الأبحاث والمجالات الساخنة تُنقل لحظياً، مع ربطها بموضوع المؤتمر لمساعدتك على تنظيم خط الإرسال، وملء ورقتك بالكامل بالأفكار.

  • فريق الدعم في الموقع: (يُفتح حصرياً خلال فترة المؤتمر):وإذا وصلت إلى مكان المؤتمر فلا داعي للقلق أيضًا —

    التنقل عبر المسارات:أماكن توزيع القاعات وكيفية الوصول إلى قاعة المحاضرات، اسألوا في المجموعة في أي وقت؛

    قراءة جماعية للمواضيع: الجلسات الشائعة ونقاشات Keynote، وإذا فاتتك فيمكنك متابعتها لاحقًا؛

    مجموعة الملصقات: ملخص لافتات الحفل الميداني، احفظها بنقرة واحدة دون أن يفوتك شيء؛

    ساحة ترتيب اللقاءات: مواعيد الطعام، ومواعيد المقابلات الصحفية، وجلسات التبادل... إذا أردت الدردشة أو التعاون أو اللقاء وجهًا لوجه، يكفي أن يقترحها أحد أعضاء المجموعة.

؟ بوابة الانضمام إلى المجموعة: امسح رمز الاستجابة للانضمام إلى المجموعة أو أضف حساب WeChat: Luyoyo_2026، مع ملاحظة: ECCV + الجهة/المدرسة + الاسم + التخصص.

في البحث العلمي/العمل التقني، يُعدّ الفارق المعلوماتي أمرًا بالغ الأهمية.

هيا بنا، لنكن خطوة أمام الجميع!

انضم إلى الرحلة لنأخذك في جولة على خلاصة أهم مؤتمرات الذكاء الاصطناعي العالمية

يمكنك الاستمتاع بمشاهدة حصرية:

عرض تقديمي لمحاضرة الخبراء

النص الكامل لتقرير المؤتمر

تحليل الأوراق البحثية الشائعة

مقابلات مع النجوم الأكاديميين الصاعدين

امسح رمز الاستجابة السريعة أعلاه

أو انقر على «قراءة النص الأصلي» لمتابعة القسم المخصص.

مقالات Leiifeng Wang (雷峰网) الأصلية محمية بحقوق الطبع والنشر، ولا يجوز إعادة نشرها دون إذن. لمزيد من التفاصيل، راجعإرشادات إعادة النشر。

المصدر الأصلي

雷峰网 AI

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل