Artificial Analysis · Xآخر تحديث

قمنا بمقارنة ستة أجهزة للتحقق من الخرافات على نفس المخرجات، من مجموعة ثابتة تضم 20 مهمة و8 نماذج. قمنا بتشغيل فحصنا ذا المرحلتين...

قمنا بمقارنة ستة أدوات للتحقق من الخرافات على نفس المتطلبات، من مجموعة ثابتة مكونة من 20 مهمة وثمانية نماذج. قمنا بتشغيل فحص المستويين باستخدام GPT-6 Sol (عالي)، وGPT-6 Luna (عالي)، وGrok 4.7 (عالي)، وClaude Opus 5.5…

مصدر الصورة · Artificial Analysis · X

قارنّا ستة أدوات للتحقق من الخرافات على نفس المخرجات من مجموعة ثابتة تضم 20 مهمة وثمانية نماذج. قمنا بتشغيل فحصنا ذا المرحلتين باستخدام GPT-6 Sol (عالي)، وGPT-6 Luna (عالي)، وGrok 4.7 (عالي)، وClaude Opus 5.5 (عالي)، وClaude Sonnet 5.5 (عالي)، وGemini 3.8 Flash (عالي)، واخترنا GPT-6 Sol (عالي) للاستخدام في الإنتاج.

على مستوى هذا المجموعتين المكونتين من 20 مهمة، حدد GPT-6 Sol وGPT-6 Luna عددًا أكبر من الأوهام المادية، بينما حدد Claude Sonnet 5.5 وGemini 3.8 Flash عددًا أقل بكثير. كان Claude Opus 5.5 في نطاق بين Grok 4.7 وClaude Sonnet 5.5 في كل صف من النماذج. بشكل عام، حدد Opus 99 وهامة مادية، مقارنة بـ 219 لـ Grok، و57 لـ Sonnet، و470 لـ GPT-6 Sol. تم التعرف على المزيد من الوهمات المادية بواسطة GPT-6 Sol، رغم النهج المحافظ للتحقق من الأخطاء، والذي يستبعد المعرفة القانونية العامة التي لا توجد في وثائق المصدر.

لم يجد كل ستة مراقبين أي وهم مادي في نتائج GPT-6 Astra، بينما كان متوسط GPT-6 Sol بين 0 و0.20 لكل مهمة. كان كلا النموذجين من بين النماذج التي تحتوي على أقل عدد من الوهم المادي أمام كل مراقب. تُظهر هذه المقارنة اختلافات في سلوك المراقبين؛ فالأرقام وحدها لا تثبت الدقة أو تبطل التفضيل الذاتي.

المصدر الأصلي

Artificial Analysis · X

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل