تقديم نماذج Access الموثوقة إلى فهرس التحليل الاصطناعي الإلكتروني
GPT-6 Sol (Daybreak Blue) تتصدر الآن مؤشر السيبرني
تجمع تحالف مؤشر التحليل الاصطناعي الإلكتروني الشركاء الصناعيين لتقييم أداء نماذج الذكاء الاصطناعي في مهام الدفاع الإلكتروني للمؤسسات. تم إطلاق المؤشر مع نماذج قابلة للوصول علنًا فقط، مما يوفر للمستخدمين أفضل مؤشر على القدرات المتاحة علنًا في الدفاع الإلكتروني القائم على الوكالات. الآن، نحن نوسع القائمة الرئيسية لإدراج نماذج ذات قيود إلكترونية أقل، مما يوفر رؤية أوسع للقدرات الإلكترونية للنماذج الجديدة. الأول من هذه هو GPT-6 Sol (Daybreak Blue، الحد الأقصى) والذي يمكن الوصول إليه فقط من خلال برنامج Daybreak التابع لشركة OpenAI.

GPT-6 Sol (Daybreak Blue، القصوى) يقود الآن المؤشر ويقف على حدود تباين التكلفة والإمكانات. لم يواجه أي عوائق أمان في جميع أجزاء المؤشر، وسجله الإجمالي ارتفع بمقدار 32 نقطة مقارنة بGPT-6 Sol (القصوى) المتاح للجمهور.
بتكلفة عملية تبلغ 1.77 دولار لكل مهمة، فهو أكثر كفاءة من التكلفة مقارنة بالنماذج الرائدة الأخرى، بما في ذلك Grok 4.7 (xhigh) الذي تكلف 11.67 دولار لكل مهمة

مقارنةً بالنموذج GPT-6 Sol المتاح علنًا، يحقق نموذج Daybreak Blue أكبر فوائد في تقييم CyberGym-E2E، وهو المقياس الذي نلاحظ فيه أغلب رفضات الأمان.

سنواصل توسيع فهرس التحليل الاصطناعي الإلكتروني لتشمل نماذج المتاحة علنًا والنماذج التي يحصل عليها الجمهور بطريقة موثوقة.
للحصول على نتائج التقييم الكاملة، يرجى الاطلاع هنا: https://artificialanalysis.ai/evaluations/artificial-analysis-cyber-index
