تبين الدراسات أن العملاء الذكيون يبالغون في تقدير نتائجهم، ولا يزالون بعيدين عن البحث المستقل.
مانويل أوث
11 أكتوبر 2026
Nano Banana Pro الذي تم توجيهه من قبل THE DECODERتُظهر نتائج من شركة Epoch AI وشركة Anthropic أن نماذج الذكاء الاصطناعي يمكنها إجراء التجارب، لكنها تفتقر إلى النقد الذاتي العلمي والتفكير الإبداعي الحقيقي.
تقوم مختبرات الذكاء الاصطناعي الرئيسية بتسويق نماذجها كأدوات بحثية. لقد وسّعت جوجل ديب مايند العالم المشارك إلى نظام بحثي كامل، بينما قدمت أوپن آي متدرب بحثي آلي في سبتمبر. ومن المفترض أن يصبح هذا المتدرب بحثي مستقل تحت إشراف بشري بحلول مارس 2028، لكن يبدو أن مهارة أساسية لا تزال مفقودة: الحكم العلمي.
تم طلب من العملاء اختراع طريقة تدريب جديدة
باستخدام مؤشره المقارن “InnovationEval”، اختبرت شركة Epoch AI ما إذا كان العملاء الذكيون يمكنهم إجراء الأبحاث بشكل مستقل. كانت المهمة هي اختراع طريقة جديدة لتحسين نماذج اللغة بعد التدريب الأولي لها، ثم تنفيذها واختبارها وتحسينها بشكل مستقل.
نقطة البداية كانت GRPO، وهي تقنية مستخدمة على نطاق واسع. يقارن GRPO بين الإجابات المتعددة التي يولدها النموذج لغرض واحد ويكافئ الإجابات الأفضل، عادةً من خلال تقييم كل حل ككل. أما الطريقة المرجعية المصممة بواسطة البشر، SDPO، فهي تستخدم إشارات إضافية مثل رسائل الأخطاء لإنتاج تغذية علمية أكثر دقة للخطوات الفردية داخل الإجابة، بحيث يصبح النموذج في الواقع معلمًا لنفسه.
اختبر العصر كلود فابل 5 و GPT-5.6 Sol، ووفقًا للمنظمة، لم يكن لدى الأجهزة أي معرفة مسبقة بـ SDPO. تم قياس الأداء في مهام الإجابة القصيرة مثل الأسئلة العلمية ومهام البرمجة، حيث كان لكل جهاز إمكانية الوصول إلى 3000 ساعة من الحسابات على شرائح عالية الجودة، لكن بدون اتصال بالإنترنت.
كلا النموذجين استخدما التقنيات المعروفة بدلاً من الابتكار
لم يقترب أي من النموذجين من المعيار البشري. استهدف GPT-5.6 Sol نقطة ضعف في GRPO: عندما تكون جميع الإجابات لبعض المهمة صحيحة، لا يتعلم النموذج شيئًا لأن لا يوجد شيء للمقارنة. قام Sol بتشجيع النموذج على تعزيز حلوله الناجحة في تلك الحالات، لكن الفكرة لم تكن جديدة.
وفقًا لما ذكرته "إيبوك"، فإن نتائج "سول" مقارنةً بالتحسين الذي حققه "SDPO" على "GRPO" كانت حوالي 35% مع تقييم واسع. وإذا تم احتساب التغييرات التي ظلت ضمن قواعد التجربة فقط، فإن الرقم ينخفض إلى حوالي 15%. في المهام البرمجية، جعل "سول" التدريب أكثر تكلفة وبطءًا بدلاً من تحسين الطريقة نفسها.
حتى أن النموذج Claude Fable 5 فشل في إعادة تنفيذ المهام التي فشلت فيها عند تزويده بالمحاولات السابقة الفاشلة، وهو تقنية معروفة أيضًا ولم يُحقق منها أي تحسين قابل للقياس. حتى نجاح Sol الجزئي لا يمكن اعتباره “مثيرًا للاهتمام إلى حد معتدل” بالنسبة للخبراء، حسب قول Epoch. النماذج الجديدة التي تعرف على SDPO من بيانات تدريبها لم تتمكن أيضًا من تكرارها بالكامل. بنى GPT-6 Astra حلاً مماثلاً، لكنه لم يكشف عن مصدره، وحتى مع وجود الورقة الأصلية أمامه، فإن Fable 5 لم تفدق المعيار المطلوب.
اختار الوكلاء أفضل جولاتهم ودفن البقية
لقد واجه كل من الوكلاء مشكلة في الإبلاغ أيضًا. لقد أجروا عدة جولات تدريب متشابهة، وأبلغوا فقط عن أفضل نتيجة في كل مرة، مما يجعل الطريقة تبدو أقوى من حالتها الفعلية لأن النتائج تتغير بشكل عشوائي. في التقارير النهائية، لم يذكر النماذج هذا السلوك إلا قليلاً، ولم يتمكنوا أيضًا من ذكر الأعمال السابقة التي استندوا إليها طرقهم. أظهرت الأرقام التي قدموها بأنفسهم أرقامًا مرتفعة بشكل كبير: ادعى سول أن حوالي 70% من تحسين SDPO قد تم، بينما ادعى Fable 5 أن النسبة كانت حوالي 40%. قام Epoch بإزالة هذه الأرقام المبالغ فيها.

تُظهر سجلات التفكير الداخلي للنماذج أنهم كانوا على علم بالمشكلة، حيث وصف Fable 5 تكرارات التشغيل كبحث عن نقطة توقف أفضل. سواء كان ذلك إخفاقًا متعمدًا أو ارتباكًا، يترك Epoch الأمر غير محدد.
بالنسبة لـ GPT-5.6 Sol، فإن سلوكه يتوافق مع النتائج التي توصلت إليها منظمة التقييم METR، حيث اكتشفت هذه المنظمة أكثر محاولات الغش من هذا النموذج في اختبار الترميز الخاص به، مقارنة بأي نموذج آخر متاح علنًا قامت بتقييمه.
يُشير العصر إلى أن البشر سيحتاجون إلى مراجعة كاملة لكل الأبحاث المولدة بواسطة الذكاء الاصطناعي، مما يقلل من فائدة هذه النماذج.
ترى شركة أنثروبيك نفس نقاط الضعف في نموذجها الخاص
تصف شركة Anthropic نفس القيود في بطاقة النظام لـ Claude Opus 5.5. تقول شركة Anthropic إن النموذج بعيد كل البعد عن استبدال الباحثين الذين في الشركة، وأن المشاكل الرئيسية تكمن في “جودة المعرفة” واتباع التعليمات.
يقدم Opus 5.5 افتراضات غير مرقَّبة كحقائق، ويتجاهل شكوكه الخاصة أكثر من النماذج السابقة. يصف الفحوصات الجزئية على أنها التحقق الكامل، ويحول التقييمات الأولية إلى توصيات دون إجراء تدقيق متبادل، ويتعامَل مع الانتقادات بشكل ضيق دون التساؤل عن النهج العام. كما يفضل التعديلات الصغيرة والتدريجية، ويميل إلى الاستفادة من الدراسات المنشورة بدلاً من تطوير أفكار جديدة.
أ التجربة التي شارك فيها جامعة برينستون ومعهد الأمان البريطاني توصلت أيضًا إلى نتائج مماثلةكان لديه تطبيق Claude Opus 4.8 لمدة ستة أيام في دراسة الأسئلة البحثية المتعلقة بورقةين غير منشورة من مؤتمر NeurIPS للذكاء الاصطناعي، ورفض المؤلفون الأصليون النتائج معًا عند مراجعتهما. عندما فشلت الفرضيات الأولية، قام الوكلاء بتخفيف ادعاءاتهم بدلاً من البدء من جديد.
التنفيذ التقني أصبح مشكلة أقل أهمية، لأن ما يفتقر إليه الوكلاء بشكل كبير هو القدرة على تقدير مدى الثقة التي يجب أن يكونوا فيها في النتيجة، والتمسك باستفسار نهجهم الخاص على المستوى الأساسي.
المزيد من الحسابات وحدها لن تغلق الفجوة
لا تكون الذكاء الاصطناعي عديم الفائدة للبحث، حيث يمكن للنماذج أن تسرع عملية مراجعة الأدبيات، وكتابة الكود، وتحليل التنويعات بشكل أسرع من البشر.
لكن ما إذا كان استخدام المزيد من الحوسبة في حل المشكلات سيؤدي إلى إنتاج باحثين مستقلين، يظل سؤالًا مفتوحًا. استخدم GPT-5.6 Sol كامل ميزانيته، ووجد أن تحسينه في المهام التي تتطلب إجابات قصيرة حدث فقط في النهاية البعيدة من تخصيصه للحوسبة، دون أن يحقق أي تقدم يتوافق مع القواعد في المهام البرمجة. ترى Epoch أن هذا الاختراق المتأخر يُعد إشارة ضعيفة على أن استخدام المزيد من الوقت الحوسبي قد يساعد، رغم أن Fable 5 لم تستخدم حتى نصف ميزانيته.

تشير "إيبوك" أيضًا إلى أن النماذج الرائدة من قبل عام مضى كانت ستؤدي أداءً أسوأ بكثير في نفس الاختبار، وتخطط المنظمة لإجراء اختبار "إنويميشنإيفال" بشكل دوري مع مهام جديدة. حتى ذلك الوقت، يظل الفارق الأكبر عبارة عن الانضباط المعرفي: التحقق بتشكك من نتائجك الخاصة، الكشف عن عدم اليقين، واعتبار النتائج السلبية بجدية.
أخبار الذكاء الاصطناعي بدون الضجيج – من اختيار البشر
اشترك في THE DECODER للقراءة بدون إعلانات، إلى نشرة أخبار الذكاء الاصطناعي الأسبوعية، إلى تقرير "AI Radar" الحصري الذي يصدر ست مرات في السنة، إلى الوصول الكامل لأرشيف المحتوى، وإلى الوصول إلى قسم التعليقات.
اقرأ المزيد للحصول على الصورة الكاملة.
اشترك لتتابع تغطية خالية من الإثارة.
- الوصول الكامل لكل المقالات على THE DECODER
- بدون إعلانات
- انضم إلى التعليقات والمناقشات المجتمعية
- تلخيص أخبار الذكاء الاصطناعي الأسبوعي عبر البريد
- 6 مرات في السنة: “الرادار الذكي” – دورات عميقة حول المواضيع الرئيسية المتعلقة بالذكاء الاصطناعي
- أخبار الذكاء الاصطناعي اليوم، دائمًا محدثة
- أرشيفنا الكامل لمدة عشر سنوات
- محاط بفريق يمتلك أكثر من 10 سنوات من خبرة في الذكاء الاصطناعي
