量子位

توقف طارئ خلال 0.2 ثانية، وإعادة تخطيط في ثوانٍ! الذكاء السببي يدخل العالم الحقيقي

هذه هي المدة التي أوقف فيها روبوت حركته فجأةً في الهواء أثناء إغلاق باب فرن ميكروويف بسبب دخول يد إنسان فجأة

مصدر الصورة · 量子位

Jay من 凹非寺

量子位 | الحساب الرسمي QbitAI

0.2 ثانية.

هذه هي المدة التي أوقف فيها روبوت حركته فجأةً في الهواء أثناء إغلاق باب فرن ميكروويف بسبب دخول يد إنسان فجأة.

وهناك ما هو أكثر إثارة للاهتمام.

عندما وُضعت علبة معدنية ضمن أطباق الكيك وأُرسلت نحو الميكروويف، انتزع الذراع الآلية العلبة المعدنية أولاً ووضعها جانباً، وبعد تأكده من أن الطبق آمن، أرسله إلى داخل الفرن.

بصراحة، عند مشاهدة هذه العروض التجريبية شعرت بنوع من الذهول.

من يتابع المجال التجسيدية (Embodied) منذ فترة طويلة يدرك جيداً أن كثيراً من الروبوتات تبدو مبهرجة، لكنها في معظم الأحيان تقوم بـ«حفظ الإجابات». فبمجرد أن يتغير الإضاءة، أو تُركل إحدى الأشياء، أو تحمل التعليمة بعض الدلالة الضمنية، يفقد الروبوت إدراكه فوراً.

لكن حتى لو أمسكت بمصباح يدوي وأومضت به في «عيني» هذا الروبوت بشراسة كما في الفيديو، فإنه يظل غير مبالٍ تماماً...

غير أن تلك المشاهد ليست إعادة تشغيل لحركات مسجلة مسبقاً، ولا ارتباطات إحصائية خُمّنت بالمصادفة.

ففي مواجهة الاضطرابات المفاجئة المتتالية، استنتج النظام هذه السلسلة من الحركات في الزمن الحقيقي استناداً إلى فهمه للقوانين السببية للعالم الفيزيائي.

النظام الذي يحرك هذا الروبوت يحمل الاسم الرمزيCRIS-0。

وخلفه تقف شركة ذكاء سببي أسستها هوانغ بي-وي، الأستاذة المساعدة في جامعة كاليفورنيا في سان دييغو (UCSD) وباحثة المدرسة السببية في CMU، وهي

Aether AI。

قبل ثلاثة أشهر، تناولت量子位 خبراً عن المسار السببي الذي اخترته هذه الشركة. حينها ظن كثيرون أن الذكاء الاصطناعي السببي لا يزال محصوراً في المعادلات الرياضية والتجارب الفكرية.

اليوم، تطلّت Aether AI عرضها التجريبي الرسمي.

وداعاً للعمى الميكانيكي: الروبوتات تتعلم فهم السببية

في السيناريوهات التطبيقية للروبوتات التجسيدية، لم تكن المصادر القياسية لتصدّع المهندسين هي الإجراءات المعيارية، بل الحوادث المنتشرة في كل مكان.

عند مواجهة اضطرابات مفاجئة، تلجأ الروبوتات التقليدية إما إلى تكرار الإحداثيات القديمة ميكانيكياً ما يؤدي إلى تصادمات، أو إلى تعطل كامل المسار بخطأ يجمّد العمل؛ أما النماذج الصندوقية من طرف إلى طرف فتُنتج بسهولة أخطاء تراكمية في المهام طويلة المدى الممتدة لعشرات الخطوات، حيث خطوة منحرفة واحدة تُسقط كل شيء.

الحل الذي تقدمه CRIS-0 للخروج من هذا المأزق هو «السببية» —

أي نقل الروبوت من «رؤية ما يحدث» إلى «فهم لماذا يحدث، وما الذي يؤثر في النتيجة عند تغييره».

لنلقِ نظرة أولاً على النتائج.

في اختبار تحضير القهوة (Coffee Preparation) المعرض لتدخلات خارجية مفاجئة، واجه الروبوت إزاحة يدوية وتغيرات مفاجئة في الإضاءة أثناء الإمساك بآلة القهوة. تمكنت CRIS-0 خلال2 ثانية في المتوسطقام بتحديد التغير في المتغير السببي وأتم إعادة التخطيط في الزمن الحقيقي، محققاً نجاحاً في 10 من حالات التشويش العشوائية9 تعافيات فعالة من أصل 10 اضطرابات عشوائية。

كما أنها لم تكن إعادة تنفيذ عشوائية لكامل المسار.

فعندما دُفعت آلة القهوة جانباً، تتبّع النظام المتغير السببي الحاسم وهو «الوضعية النسبية للمقبض». وعند اكتشاف انحراف حالة المتغير، يصحّح فقط مرحلتي الاقتراب والإمساك دون الحاجة إلى العودة للموضع الأصلي وإعادة التشغيل.

مقاومة التداخل هي مجرد الأساسيات، أما في المهام الذاتية طويلة المدى فتتجلى ميزة القيادة السببية بشكل أكثر شمولاً.

في المهام المتسلسلة التي تتضمن عشرات الخطوات مثل «البحث عن الأغراض وترتيبها في غرفة المعيشة»، يقوم النظام بتفكيك الهدف طويل المدى إلى مراحل سببية ذرية قابلة للتحقق، وينفذ فحص الشروط السابقة واللاحقة مع كل خطوة.

والأكثر إثارة للاهتمام هو قدرة CRIS-0 على الاستدلال بالمنطق السليم والإدراك الفيزيائي:

عند تنظيف المكتب، يرتب الكتب العادية المبعثرة على طاولة القهوة، لكنه يضع الفواتير المتعلقة بالخصوصية الشخصية في الدرج؛

عند مواجهة علبتي مشروب متشابهتين في المظهر، يبدأ بالإمساك بهما وهزهما لاستشعار وزن العلبة وحالة السائل في الداخل، وبعد التأكد من أنهما فارغتان يرميهما في سلة المهملات، وإذا استشعر مشروباً لم يُنتهى منه فيعيدها بثبات إلى مكانها الأصلي.

وأخيراً، عند مواجهة طلبات غامضة، يمكن للسببية أن تحسّن بشكل كبير من قابلية تعميم المطالبات (prompts)، مما يوفر قدرة على الفهم المخصص.

في اختبار Personal Pick and Place، وبمواجهة 20 تعليمة غامضة تتطلب استدلالاً ضمنياً مثل «أحضر لي زجاجة مشروب مناسبة بعد ركض الصباح»، حقق النظام نتيجة18 إمساكاً ووضعاً دقيقاً.

فهو لا يعتمد على حفظ الكلمات المفتاحية والحظ، بل يدمج الوقت وحالة المستخدم وسياق البيئة، ويستخرج «الحاجة بعد التمرين إلى تعويض الطاقة وتجنب السكريات العالية» كمتغير سببي خفي، ويطابق تلقائياً العملية المناسبة.

فما هي البنية التقنية التي تقف خلف هذه العروض التوضيحية (Demo)؟

تفكيك CRIS-0: تحويل الصندوق الأسود إلى محرك سببي

وقبل الإجابة عن هذا السؤال، ربما علينا أولاً توضيح سؤال آخر —

لماذا كانت الروبوتات السابقة تبدو دائماً «غبية»؟

العالم الفيزيائي والعالم الرقمي الصرف شيئان مختلفان تماماً. ففي الحاسوب، عند كتابة الشيفرة أو الدردشة، يمكن التراجع عن الخطأ، أما في العالم الواقعي فالقوى الاحتكاكية والجاذبية والتصادمات وتغيرات الإضاءة، ومواقف مفاجئة متنوعة تحدث كل ثانية.

النماذج التقليدية من طرف إلى طرف، مثل حلول VLA، رغم سرعة تعلمها، لديها نقطة ضعف قاتلة عند مواجهة المهام متعددة المراحل، وهي تراكم الأخطاء.

خطأ بسيط في الخطوة 1 يكبر في الخطوة 2، وعند الوصول إلى الخطوة 10 قد تكون الحركة كلها قد تشوهت تماماً. والأخطر من ذلك أن نموذجاً وحيداً على شكل صندوق أسود، عند مواجهة اضطراب، لا يعرف ماذا حدث بالضبط، فيضطر غالباً إما إلى المضي قُدماً وفق الخطة الأصلية رغم أنفه، أو إلى الانهيار والتوقف مباشرة.

أما النهج الآخر الشائع، حلول الـ Agent، فهي رغم قيامها بتقسيم الخطوات، يظل منطق تفكيرها محصوراً في الاستدلال الاحتمالي على النصوص الصرفة أو نماذج الذكاء الاصطناعي متعددة الوسائط الكبيرة.

وكلما تغيرت البيئة، يتعين عليها أولاً تحويل الصورة إلى نص، وانتظار النموذج وهو يفكر على مهل في «ما الخطوة التالية»، وحين ينتهي الاستدلال قد يكون اليد قد انُسحق بالباب منذ زمن...

فكيف يتحقق هذا التماسك ومقاومة الاضطراب اللذان أظهرهما CRIS-0؟

صممت Aether AI منطقاً جديداً كلياً:

بنية Agent سببية أصلية.

ويمكن فهمها من ثلاثة أبعاد —

1. المهمة كحالة: استخراج المتغيرات السببية الفيزيائية

هذه في نظري أهم مبدأ أول (first principle).

في نظام CRIS-0، هناك تغيير عميق جداً يُسمى توحيد الحالة والمتغيرات السببية.

كانت الروبوتات السابقة تنظر إلى العالم عبر بكسلات الصور الكثيفة. أما في نظر CRIS-0، فما يهمه ليس شكل سطح العالم، بل إلى أي مرحلة وصلت المهمة؛ فالمهمة نفسها هي شريط تقدم لحالة سببية.

خذ مثالاً واقعياً جداً، مثل قيام الروبوت بفرش مفرش الطاولة.

لن يقوم بحساب إحداثيات كل بكسل في المفرش كله بسذاجة، بل يتتبع في الوقت الفعلي بضعة متغيرات سببية أساسية. مثل: هل أمسك الجزء القابض بالمفرش فعلاً، وكم سنتيمتراً تفصل زاوية المفرش عن الموضع المستهدف، وهل حدث انزلاق أثناء السحب.

وحالما ينزلق الممسك، يعرف النظام فوراً أن المتغير السببي «الإمساك» لم يتحقق، فيعودت حالة المهمة مباشرة إلى مرحلة إعادة الإمساك، بدلاً من إلغاء الحركة بأكملها وإعادتها من الصفر، أو الاستمرار بشكل أعمى في سحب الهواء.

في اختبار التداخل أثناء تحضير القهوة المعلن رسمياً، وبمواجهة مشاهد عذابية مثل تحرك آلة القهوة بشكل متكرر وتغير الإضاءة المفاجئ، يتمكن النظام في المتوسط خلال 2 ثانية من اكتشاف تغيّر المتغيرات الرئيسية وإعادة التخطيط، محققاً 9 تعافيات فعالة من أصل 10 اضطرابات خارجية.

هذه هي قوة المتغيرات السببية؛ فعند وقوع حادث مفاجئ، يعرف بدقة أين حدث الخطأ وإلى أي خطوة يجب الرجوع.

2. واجهة أدوات موحدة: رفض أن تتولى سياسة واحدة كل شيء

فكيف ينفذ هذا النظام الإجراءات (Action) تحديداً؟

الجواب هو: Tool Call، حيث تتولى كل أداة دورها الخاص.

في بنيتها، هناك Planner مسؤول عن التنسيق العام، يدير تحت يده صندوق أدوات متكامل الوظائف، يدمج عبر Unified Tool Interface وحدات متعددة.

وظائف الحركة القاعدية(الوظائف القاعدية / Rule-based functions):تجمع بين التموضع البصري وعلم الحركة العكسي لحل المسافات الواسعة في الفضاء والتموضع المسبق بكفاءة؛

نموذج استراتيجية المهارات(نماذج السياسات / Policy models):مكرسة خصيصًا للتغلب على العمليات اللاإرادية عالية الصعوبة الغنية بالتلامس (Contact-rich) مثل سكب الماء والإمساك الدقيق؛

وحدة الملاحة(SLAM): مسؤولة عن التوجيه العام للمسار؛

المُتحقِّقات(Verifiers): تنفّذ الفحوصات الفيزيائية عند كل عقدة مرحلية؛

نموذج العالم السببي(CausalWM): مسؤول عن استنتاج العواقب الفيزيائية للأفعال.

وأخطر ورقة رابحة في كل هذا هي تحديداً نموذج العالم السببي هذا.

عندما يتحدث كثير من الأصدقاء عن نماذج العالم، فإن ردّ الفعل الأول لديهم هو توليد مقاطع فيديو واقعية لبضع ثوانٍ قادمة. لكن في CRIS-0CausalWMفي CRIS-0 يركّز أكثر على تأثير الـ Action في البيئة.

منطقه هو: أولاً النظر إلى الحالة الحالية، ثم التنبؤ بأي متغيرات سببية ستتغيّر نتيجة الأفعال المرشّحة، وأخيراً استنتاج الحالة المستقبلية.

بعبارة أخرى، الروبوت يقوم بالاستنتاج في ذهنه قبل أن يمدّ يده، مثلاً: إذا فعلت هذا، هل سيكون المقبض معوجاً؟ هل سينقلب الكوب؟

الأمر يعادل إضافة خطوة «بروفة»: يستهلّ النظام بعرض «إذا نفّذتُ الفعل B، كيف ستتطور المتغيرات السببية الفيزيائية» في نموذج العالم، وبعد التأكد من إمكانية تحقيق الهدف يستدعي Action Head لإخراج الأمر إلى طبقة التحكم السفلية.

3. الحلقة المهيكلة والسلامة المدمجة أصلاً

وكل هذا بأكمله يدور في حلقة متكررة (Loop).

عند مواجهة مهام معقدة، يقوم Planner بتقسيم الهدف الكبير، فيستدعي أولاً دالة قواعد لنقل الكماشة بسرعة إلى محيط الهدف، ثم يستدعي نموذج السياسة لإنجاز التقاط التلامسي الدقيق. وهكذا تُقسَّم المسائل المعقدة التي يصعب على نموذج واحد إنجازها من البداية إلى النهاية إلى خطوات صغيرة عالية الحتمية.

وبالتحديد، إنها خريطة مهام (Task Graph) ديناميكية التطور بهذا الشكل:تعرّف الحالة ← اختيار الأداة ← التنفيذ ← التحقق ← التعديل。

بعد إتمام كل خطوة، يتحقق المُتحقِّق فوراً مما إذا كانت الشروط الفيزيائية قد تحققت. وإذا لم تتحقق، فللنظام آلية استرداد واضحة من ثلاثة مستويات: أولاً يقيّم إمكانية إعادة المحاولة مباشرة في هذه المرحلة، فإن تعذّر أعاد تخطيط المسار، فإن تعذّر ذلك أيضاً ينبّه إلى الحاجة إلى تدخّل بشري.

وإذا نجح تعديل غير متوقع في إحدى المرات، فإن مسار الاسترداد الناجح هذا يُسجَّل ويرسّخ في خريطة المهام، ففي المرة القادمة عند مواجهة حالة مشابهة يصبح أكثر مهارة.

وهذا يفسّر لماذا استطاع في مهمة الترتيب الطويلة في غرفة المعيشة تلك تنفيذ عشرات بل مئات الخطوات على التوالي دون انهيار.

لأنه في كل خطوة يتحقق من الحالة السببية، فيُحلّ الخطأ فور نشوئه في مكانه، ولا تُتاح له على الإطلاق فرصة الانتشار مثل كرة الثلج حتى يتحول إلى انهيار كلي.

وبالمثل، لهذا السبب أيضاً يستطيع تحقيق توقف طوارئ آمن خلال 0.2 ثانية.

في CRIS-0، حكم السلامة مدمج مباشرة في كل مرحلة سببية.

في مرحلة إغلاق الباب، فإن اليد البشرية التي تظهر فجأة تُعدّ متغيراً خطيراً ينتهك شروط سلامة المستخدم، فيلتقطها النظام لحظياً على طبقة الحالة ويُطلق حجباً بأعلى أولوية، فيتوقف خلال 0.2 ثانية.

لكن إذا كانت المهمة الحالية هي تقديم كوب ماء لإنسان، فإن اليد الممتدة تكون عندها متغير الهدف التفاعلي، فلا يتوقف النظام تStopاً عشوائياً.

وفي الواقع، فإن قدرة CRIS-0 على مستوى النظام هذه لم تأتِ من فراغ، إذ تقف خلفها قواعد بحثية متينة.

في تقييم قدرات الوكلاء (Agent)، كان إطار الوكلاء السببية من Aether AI سابقاً، أيRSIAgentقد حقق درجة جزئية (Partial Score) بلغت 78.98% على OSWorld 2.0، ودون تحديث معاملات النموذج تمكّن من رفع قدرات النماذج مفتوحة المصدر كوكلاء، متجاوزاً نماذج مغلقة المصدر مثل GPT-6 Astra.

أما النسخة الأولى من نموذج العالم السببي لديه فهيCausalWMكما تصدّرت قائمة المتصدرين (Leaderboard) في معيار نماذج العالم للروبوتات TriWorldBench محققة المركز Top-1.

وهذان الطبقان هما بالضبط المساهمان الرئيسيان في هذا العرض التجريبي.

إضافة إلى ذلك، هناك طبقتان لا تزالان قيد التطوير المستمر — البنية العصبية المعيارية: كل وحدة تقابل آلية سببية مختلفة، وقابلة للتركيب والاستبدال؛ وCausation Transformer: يتعلم العلاقات السببية بدلاً من الاعتماديات الإحصائية.

العالم المادي لا يصدّق الحفظ عن ظهر قلب

وبعد هذا الحديث، يمكننا في الحقيقة تجاوز عرض الروبوت التجريبي المحدد والنظر نظرة أعمق.

لماذا أصبح الجميع يتحدثون بشكل متزايد عن الذكاء السببي؟

بصراحة، كان انفجار النماذج اللغوية الكبيرة في هذه الجولة الماضية، إلى حد كبير، حظاً سعيداً حقاً؛ فاللغة ذاتها وسيط تمثل بالرموز وبالتجريد بدرجة عالية من قبل البشر، وقد لخّص البشر مسبقاً الكثير من المنطق والقواعد على سطح النصوص. لذا كان يكفي الاعتماد على الملاءمة الإحصائية للارتباطات الاحتمالية مباشرةً لتحقيق نتائج مذهلة بالقوة الغاشمة.

لكن العالم المادي لا يقبل هذا الأسلوب.

قوة الاحتكاك لن تتغير لمجرد أنك قرأت 100,000 ورقة علمية، كما أن الجاذبية لن تختفي فجأة بسبب الإحصاء الاحتمالي. في العالم الحقيقي المليء بالديناميكيات المعقدة، سوف تصطدم الملاءمة المعتمدة على الارتباطات السطحية وحدها عاجلاً أم آجلاً بسقف قانون التحجيم (Scaling Law).

وفي ظل النقص الحاد في البيانات الفيزيائية، لبناء نظام قادر فعلاً على التعامل مع البيئات الفيزيائية المعقدة، يجب أن يتعلم النموذج أن يعمل مثل العلماء البشر، فيستخرج من كميات صغيرة من البيانات الآليات السببية الكامنة، ويفهم كيف تغيّر الأفعال العالم فعلاً.

هذا النوع من الضغط المُهيكل وفق مبدأ «السببية» كأولى المبادئ، قد يكون هو قانون التوسع (Scaling Law) الأصيل المتجسّد بيئيًا.

بالطبع، هذا الطريق صعب للغاية. يتطلب الاكتشاف السببي وتعلّم التمثيلات السببية مستوى عالياً جدًا من الرياضيات والنظريات الإحصائية، والفرق القادرة على الجمع عالميًا بين تراكم نظري عميق وقدرة هندسية تطبيقية قليلة جداً.

جرأة Aether AI على دخول هذا المجال ترجع إلى حدٍّ كبير إلى مسارها الأكاديمي الفريد على الأرجح.

عملت Huang Biwei في هذا المجال لأكثر من عشر سنوات، وتلقت تعليمها على يد Clark Glymour وPeter Spirtes مؤسسي مدرسة CMU السببية، ومن الجيل الثاني Bernhard Schölkopf وKun Zhang، وهي واحدة من الحاملات الأساسيّ لروح مدرسة الاكتشاف السببي.

الخط النظري لثلاثة أجيال من المدرسة السببية تَجمَّع في النهاية ليشكّل اليوم الركيزة التقنية الأساسية لـ Aether AI.

من التراكم النظري في جامعة كارنيغي ميلون ومعهد ماكس بلانك، إلى التجسيد الملموس اليوم لـ CRIS-0 على ذراع روبوتية حقيقية، خطت الذكاء السببي أخيرًا الخطوة الحاسمة نحو العالم الفيزيائي.

عندما يمتلك نظام ما فعلاً القدرة على استخراج المتغيرات السببية، ونمذجة ديناميكيات العالم، والاستدلال بالعواقب قبل الفعل، فإن مجالات استخدامه لن تقتصر أبداً على مساعدة الناس في إطفاء الميكروويف أو سكب فنجان قهوة.

وبالنظر إلى أبعد من ذلك، من التنبؤ باتجاهات الأنظمة الديناميكية المعقدة، إلى الاكتشافات العلمية في مجالات المواد وعلوم الحياة وغيرها، ربما يمكن إعادة استخدام هذا المنطق نفسه.

يا لها من حقبة عظيمة، أيها الأصدقاء.

لطالما انتظرنا أن يخرج الذكاء الاصطناعي فعلياً من صندوق الدردشة الرقمي البحت، ليسيد بثبات هذا العالم الفيزيائي الحقيقي المعقّد المليء بالمجهول.

وقد تكون السببية هي المفتاح الأهم لذلك.

— انتهى —
QbitAI الكوانتوم · موقع إلكتروني بعقد حصري مع Toutiao
تابعونا لتكونوا أول من يطّلع على آخر أخبار التكنولوجيا المتقدمة

 

المصدر الأصلي

量子位

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل