هنري من مصدر ووتر نيف سي
كوانتوم بيت | الحساب العام QbitAI
معيار Harness البصري الأصلي للنماذج متعددة الطبقات، وصل!
مؤخرًا، قدم فريق هو كاي مينغ في الورقة البحثية الأحدث “VISTA: A Visual Harness for Reasoning in an Interactive World” مجموعة من Harnessات بدائية بصرية.
فيستا.
يتيح ذلك للنماذج متعددة الوسائط الموجودة الآن أن تراقب البيئة مباشرة، وتحفظ الصور الأصلية، ويمكنها العودة إلى الصور في أي وقت أثناء التفكير، وتمديدها وفحص تفاصيلها، دون الحاجة إلى التدريب من الصفر.
بالمقارنة مع الطريقة التقليدية التي تحلل البيئة إلى نصوص أو كود، يحافظ VISTA على المعلومات البصرية الأصلية. يمكن للنموذج أن يعيد تضمين الصور التي تم رؤيتها في الماضي ضمن السياق الحالي، مما يساعد على اتخاذ القرارات والاستدلالات الحالية.
بناءً على هذه الطريقة، أصبحت التجربة البصرية سياقًا يمكن النموذج استدعاؤه منه وتفقده مرارًا وتكرارًا، وأصبحت النماذج متعددة الوسائط تمتلك حاملًا أصليًا يُبنى حول الذاكرة البصرية.
في مجال التقييم، مع استخدام VISTA وClaude Opus 5.0، تم إكمال جميع الـ 25 لعبة علنية في ARC-AGI-3، حيث بلغت نقاط الكفاءة مقارنة بالحركات البشرية 100، بينما كانت حركات اللاعبين المستخدمة أقل بنسبة 57.4% مقارنة بالحركات البشرية في المرة الأولى.
تم التبديل إلى GPT-5.6 Sol، وتم تجاوز كل المستويات بالكامل، وحصلت على نقاط تبلغ 99.
وعلاوة على ذلك، قام الفريق أيضًا باختبار هذه الطريقة في ألعاب المتصفح، والمتاهات، والمسائل التي تتطلب ربط الأشياء، ووضع المهام التي تكون أكثر قربًا من العالم الفيزيائي كمجال للبحث المستقبلي.
كيف تم ذلك؟
الدعامة البصرية الأصلية
من ResNet وMask R-CNN إلى MAE، كانت التعلم البصري والتمثيل دائمًا خط رئيسي في أبحاث هو كاي مينغ.
هذه المرة، وجهت VISTA أنظارها إلى مشكلة جديدة: كيف يمكن للنموذج أن يتراكم ويحفظ ويستخدم التجارب البصرية أثناء التفاعل المستمر؟
الإجابة هي Harness.
في نوفمبر من العام الماضي، استخدمت شركة Anthropic مهمة برمجة طويلة الأمد كمثال لعرض كيفية مساعدة Harness للنموذج على عبور عدة نوافذ سياقية وتقدم المهمة بشكل مستمر.
بالتحديد، يقوم Harness بتسجيل الأمور التي لم تكتمل بعد في قائمة المهام، ويحفظ الأعمال التي تم إنجازها في ملفات التقدم والكود.
بهذا، حتى عندما يدخل النموذج إلى نافذة سياق جديدة، يمكنه من خلال قراءة هذه المعلومات معرفة ما تم فعله سابقًا وما يجب فعله بعد ذلك.
يمكن تنفيذ المهام المعقدة على مراحل، وفحص النتائج، ومواصلة العمل بين نوافذ السياق المختلفة.
يمكن القول إن برنامج Harness الذي يحفظ حالة المهام من خلال النصوص والكود، دفع إلى حد ما انتشار قدرات الأجهزة.
ومع ذلك، في البيئة الواقعية، مجرد الذاكرة النصية لا تكفي بوضوح.
لأنه بمجرد دخول البيئة البصرية الحقيقية، لا يحتاج النموذج فقط إلى تذكر موقع واتجاه الأجسام، بل يجب عليه أيضًا فهم التغييرات التي تحدث في البيئة قبل وبعد كل حركة.
وأيضًا عندما يرى النموذج الصورة لأول مرة، قد لا يعرف بالضرورة أي تفصيل سيصبح مهمًا لاحقًا.
في الوقت نفسه، من الصعب أيضًا تسجيل هذه المعلومات البصرية بشكل كامل بواسطة ملاحظة نصية مسبقة، ومن الصعب أكثر التأكد من أن المعلومات المسجلة ستكون كافية عند تنفيذ المشروع لاحقًا.
في معيار ARC-AGI-3، إحدى الطرق المطروحة هي أولاً تحويل الصورة إلى شبكة نصية مكونة من أرقام، ثم توجيه النموذج بكتابة برنامج لتقليد قواعد البيئة والتحقق من خطة العمل.
(ملحوظة: ARC-AGI-3 هو مجموعة من معايير التفكير البصري التفاعلي، حيث لا يتم توفير قواعد اللعبة والأهداف مسبقًا، ويجب على الكيان الذكي أن يكتشف بنفسه كيف يتجاوز المرحلة من خلال الملاحظة والأفعال)
لكن المشكلة تكمن في أنه كلما كان البيئة أكثر تعقيدًا، يصبح من الصعب تحويل مظهر الأجسام والعلاقات المكانية والتغيرات الديناميكية إلى نص وكود بشكل كامل. وعلاوة على ذلك، مع زيادة طول التاريخ التفاعلي، ستتم إزالة الصور القديمة تدريجيًا من السياق، أو سيتم استبدالها بتلخيصات نصية.
لذلك، هنا، تحولت مسألة البحث في VISTA إلى:
كيف يمكن للذكاء الاصطناعي، دون الحاجة إلى تدريب نموذج أساسي إضافي، أن يتحقق من المعلومات البصرية التي رآها في الماضي عند الحاجة إلى التفكير؟
بناءً على ذلك، تقوم VISTA بيتم حفظ كل إطار من الإطارات التي تُرجعها البيئة كما هي دون تغيير، بما في ذلك الإطارات الوسطية للرسوم المتحركة أثناء الحركة، ويُستخدم النموذج مرة أخرى عند الحاجة.
في اختبار ARC-AGI-3، يمكنه مقارنة الصور في أوقات مختلفة، وكذلك تكبير الأجزاء المحلية لفحص علامات الاتجاه على المربعات الصغيرة.
في ذلك، يقوم نموذج تسجيل الملاحظات النصية بتسجيل الفهم الحالي، بينما تُحتفظ الصورة الأصلية بالأدلة التي يمكنه استخدامها لإعادة التقييم.
يطلق البحث على هذه الآلية اسم الانتباه الصريح لتاريخ التفاعل، ويختار النموذج المعلومات البصرية التي يجب إعادة دخولها في السياق بناءً على القضايا التي يتم التفكير فيها.
لجعل هذا الاختيار ممكنًا، يجب على النظام أن يحفظ الصورة الأصلية، وتوفير أدوات يمكن استخدامها والفحص في أي وقت.
التنفيذ التفصيلي
لتمكين النموذج من حفظ واستخدام التجارب البصرية السابقة، قامت VISTA بتصميم ثلاثة مكونات أساسية:
الملاحظة البصرية، التخزين البصري غير الضار، والفحص البصري النشط. هذه المكونات الثلاثة لكل منها دورها الخاص، حيث تتولى كل منها جعل النموذج يرى الصورة بوضوح، وتخزين التاريخ، والعودة إلى الرؤية حسب الحاجة.
أولاً، هو الملاحظة البصرية، المسؤول عن تقديم صورة البيئة للنموذج.
في تجربة ARC-AGI-3، ستقوم VISTA بتكبير الصورة الرسمية التي يقدمها النظام والتي تكون بحجم 64×64 إلى صورة PNG بحجم 512×512، مع الحفاظ على ألوان الأجسام ومظهرهم وعلاقاتهم المكانية، حتى يمكن للنموذج أن يرى البيئة مباشرة.
ثم يأتي الذاكرة البصرية بدون ضرر، التي تتولى حفظ الصور التي يراها النموذج.
بعد كل تنفيذ لحركة، تقوم VISTA بتخزين كامل الصور التي يتم عرضها في البيئة، بما في ذلك الإطارات الوسطية للرسوم المتحركة خلال عملية الحركة، وتقيم فهرسة وفقًا لرقم الجولة ورقم الإطار.
وبهذه الطريقة، لا يحتاج النموذج إلى تحديد مسبقًا أي المعلومات تستحق التذكر، بل يمكنه حفظ التجارب البصرية بشكل كامل للاستخدام لاحقًا.
أخيرًا، فحص البصري النشط، المسؤول عن إعادة النظر إلى الصور التاريخية حسب الحاجة.
من خلال أداة التفتيش، يمكن للنموذج تحديد جولة تاريخية معينة، وإظهار الصورة المقابلة، كما يمكن تصفية أو تكبير مناطق معينة، وفحص التفاصيل الداخلية.
إذا أردت معرفة ما الذي غيره عملية معينة، يمكن للنموذج أيضًا عرض عدة إطارات في نفس الوقت، لفحص التغيرات قبل وبعد الحركة.
يعادل العملية الكاملة تزويد النموذج بمجموعة من الملفات البصرية يمكن الاطلاع عليها في أي وقت. لا يمكنه فقط رؤية البيئة أمامه، بل يمكنه أيضًا الرجوع بنشاط إلى نتائج الملاحظات السابقة لتوفير أساس للأفعال المستقبلية.
إذًا، كيف يعمل هذه المكونات الثلاثة معًا بالتحديد؟
وفقًا للإجراءات التنفيذية لـ VISTA، عند بدء كل جولة، يقوم النموذج أولاً بمراقبة الصورة الحالية والحركات المتاحة، ثم بالجمع بين الخبرة المتراكمة سابقًا لتحديد حالة البيئة الحالية، ويضع فرضية للإجراء التالي.
إذا كانت المعلومات المتوفرة غير كافية، يمكن للنموذج استخدام الأدوات لمراجعة الصور التاريخية، تكبير المناطق المحددة، وحتى قراءة معلومات البيكسل الفردية، بهدف البحث عن أدلة إضافية.
بعد العثور على الأدلة، لا يتحرك النموذج مباشرة، بل يتنبأ أولاً بما قد يحدث من تغييرات نتيجة هذه العملية.
بعد انتهاء تنفيذ الأفعال، يتم مقارنة النتائج الفعلية مع التوقعات، لفحص ما إذا كانت تقديراتك صحيحة، واستنادًا إلى ذلك تُصحح فهمك لقواعد اللعبة.
بهذه الطريقة المتكررة، يمكن للنموذج أن يتعلم من البيئة أثناء التفاعل المستمر، ويسجل الخبرات.
بالطبع، لا يكفي وجود ملفات بصرية فقط. لضمان استمرارية النموذج أثناء المهام الطويلة، قدمت VISTA أيضًا كتابين من الملاحظات النصية:
- GUIDE.md: تسجيل القواعد والتجارب التي يمكن استخدامها بين المستويات المختلفة.
- WORKING.md: تسجيل حالة المستوى الحالي، التقدم، والخطط المستقبلية.
عند اقتراب السياق من الحد الأقصى، يقوم النموذج أولاً بتنظيم ملخص التسليم، ثم يدخل نافذة السياق الجديدة لاستمرار تنفيذ المهمة. سيتم الاحتفاظ بالملاحظات النصية السابقة، وتاريخ الأفعال، وملفات الرؤية.
هناك تصميم يستحق الانتباه أيضًا: على الرغم من أن VISTA يحافظ على الصور التاريخية بشكل كامل، إلا أنه لا يضع جميع الصور دفعة واحدة في السياق الخاص بالنموذج.
في الخطة الكاملة، بعد كل تنفيذ للحركة، يعرض الإطار الافتراضي النتيجة الأخيرة فقط للموديل. أما الصور المتوسطة خلال عملية الحركة، فيتم حفظها بشكل موحد في ملفات البصرية، ويتم استدعاؤها بشكل تلقائي عند الحاجة إلى الموديل.
حفظت هذه الطريقة المعلومات البصرية الكاملة، كما تجنبت استخدام كمية كبيرة من الصور التاريخية التي تستهلك مساحة السياق.
الأهم من ذلك، أن VISTA لم تدرب نموذجًا جديدًا إضافيًا لهذا الغرض.
تتمثل فهم البيئة، وتخطيط الأفعال، والاستدلال على التوالي من خلال نماذج متعددة الوسائط جاهزة بالفعل، بينما يتولى Harness تنفيذ استدعاء الأدوات، وحفظ التاريخ البصري، وتقديم الأدلة المناسبة عند الحاجة إلى النموذج.
بمعنى آخر، ما الذي غيره نظام VISTA ليس النموذج نفسه، بل طريقة حصول النموذج على البيانات البصرية وحفظها واستخدامها.
تحقق التجارب
بالإضافة إلى التجربة المذكورة في البداية، اختبر الفريق VISTA على ثلاث معايير هي GameWorld وAI GameStore وBabyVision، وتغطي المهام مثل ألعاب المتصفح والمتاهات والروابط.
باستخدام نفس نموذج GPT-5.6 Sol، فقد رفعت VISTA نسبة النجاح من 40.0% إلى 63.3% في 170 مهمة في GameWorld مقارنة بالإطار الأساسي الرسمي؛
في 10 ألعاب في AI GameStore، ارتفع التصنيف الشامل من 47.3 إلى 140.3، حيث تم تحويل المجموع العادي للبشر إلى 100؛
على 39 مسألة متاهة وربط تم اختيارها بواسطة BabyVision، ارتفعت دقة التصنيف من 41.0% إلى 63.2%. في هذه المجموعة الأخيرة من المهام، كانت الصور ثابتة فقط، ويمكن للنموذج تحسين تقييمه عن طريق تكبير الأجزاء المحلية وفحص البيكسلات.
تُظهر هذه النتائج أنه من الممكن الحفاظ على الصورة الأصلية، وتمكين النموذج للنظر إليها حسب الحاجة، مما يمكن أن يعزز قدرة النماذج متعددة الأشكال الحالية.
نفس إطار VISTA يمكن تكييفه بكمية قليلة فقط، ويمكن استخدامه في ألعاب وألغاز مختلفة، كما يظهر إمكاناته في تنفيذ المهام البصرية المتعددة.
في الختام، يشير البحث إلى اتجاهات التحقق المستقبلية التي تتمحور حول مهام ذات جسم أقرب إلى العالم الفيزيائي: بحيث يحفظ النموذج خبرته البصرية ويعيدها وفكّر بها في بيئة متغيرة بشكل مستمر، ليتخذ قراراته التالية.
مقدمة المؤلف
أخيرًا، دعونا نقدم أسماء مؤلفي هذا العمل.
المؤلفون الأوائل الثلاثة للأوراق البحثية هم تشيشو هان، هو كه يا، لينلو تشيو، أما المؤلفون الآخران فهم كاثي وو وهي كاي مينغ.
تشي شو هان (جوش هان) هو حاليًا طالب دكتور في مركز MIT لبحوث التخطيط الإداري، والمشرف عليه كاثي وو.
هو كي يا (Keya Hu) هي حاليًا طالبة دكتوراه في قسم الهندسة الكهربائية والعلوم الحاسوبية بجامعة MIT، وتتلقى التوجيه من هو كاي مينغ وجاكوب أندرياس.
تخرجت من كلية الصين للنقل البري، فصل ACM، وتركز اهتماماتها البحثية على مجال التقاطع بين اللغات والرؤية، وتأمل في بناء كائن ذكي يتمتع بكفاءة عالية في استخدام البيانات وقدرة أكبر على التعميم.
لينلو تشيو حاليًا طالب دكتور في قسم الهندسة الكهربائية والعلوم الحاسوبية بجامعة MIT، ومختبر العلوم الحاسوبية والذكاء الاصطناعي، والمشرفون عليه يون كيم وجاكوب أندرياس.
تشمل مجالات دراسته معالجة اللغة الطبيعية والتعلم الآلي، وقد أجرى أبحاثًا في جوجل ريسيرش وميتا FAIR.
كاثي وو تعمل حاليًا كأستاذة مساعدة في قسم الهندسة المدنية والبيئة بجامعة MIT، ومعهد البحوث في أنظمة البيانات والمجتمعات. تدرس كيفية تحسين الأنظمة المعقدة مثل النقل من خلال التعلم الآلي والتعلم الترويلي.
حصلت على درجة البكالوريوس والماجستير في الهندسة من معهد ماساتشوستس للتكنولوجيا، ثم حصلت على الدكتوراه من جامعة كاليفورنيا في بيركلي.
هي كاي مينغ هو حاليًا أستاذ مساعد مدى الحياة في قسم الهندسة الكهربائية وعلوم الكمبيوتر بجامعة MIT، كما هو مؤلف رئيسي في أبحاث مثل ResNet وMask R-CNN وMAE.
تخرج من البكالوريوس من جامعة تسينغهوا، وتخرج من الدكتوراه من جامعة الصين في هونغ كونغ، عمل في معهد مايكروسوفت الآسيوي وFAIR، وانضم إلى MIT في عام 2024.
رابط مرجعي
[1]https://arxiv.org/pdf/2610.02200