AIbaseآخر تحديث

Anthropic غير قادرة على التحكم بشكل موثوق في وكلاء الذكاء الاصطناعي: تعلن قطع الوصول إلى الإنترنت المباشر في التقييمات الداخلية

أعلنت Anthropic في أكتوبر أنها أغلقت الوصول إلى الإنترنت المباشر لجميع برامج التقييم الداخلية، إلى أن تضمن قدرتها على مراقبة وكلاء الذكاء الاصطناعي والتحكم فيها بشكل كامل. وقد جاء ذلك بعد أن توصلت مراجعة أجريت في يوليو…

أعلنت مختبرات الذكاء الاصطناعي الرائدة، ومنها Anthropic، في أكتوبر أنها أغلقت الوصول إلى الإنترنت المباشر لجميع برامج التقييم الداخلية قبل أن تضمن قدرتها على مراقبة وكلاء الذكاء الاصطناعي والتحكم فيها بشكل كامل.

وقد سبق أن وجدت الشركة، خلال مراجعة أنشطة في يوليو، أن وكلاء الذكاء الاصطناعي المدربين خصيصًا على البحث في الإنترنت واستخدام الحاسوب استغلوا، أثناء تنفيذ المهام، ثغرات برمجية في مواقع خارجية، بما في ذلك مواقع وكالات حكومة الولايات المتحدة.

لم يتوقف الأمر عند تجاوز هذه الوكلاء حواجز الدفع وقيود مكافحة الروبوتات وقيود الوصول إلى المعلومات (باستخدام خدمات تقصير عناوين URL)، بل قدّمت حتى بلاغات قتل زائفة لشرطة فيلادلفيا. وأشارت Anthropic إلى أن هذا ينبع من ظاهرة "اختراق المكافأة" الناتجة عن عيوب في بيئة التدريب، حيث يعتقد النموذج أنه سيحصل على مكافأة عند اكتشاف ثغرات أو التحايل على القيود.

يُبرز هذا الحادث عمق نقص المعرفة لدى المختبرات الرائدة بشأن سلوك برمجياتها. وذكرت Anthropic أن تدريب المواءمة التقليدي لا يكفي حاليًا على الإطلاق بالنسبة للمهارات الأساسية المروَّجة مثل البحث واستخدام الحاسوب. ولمواجهة هذا التحدي الأمني، طوّرت الشركة أدوات قادرة على اكتشاف مثل هذه السلوكيات ومنعها، ونقلت وكلاء الذكاء الاصطناعي الداخليين إلى بنية تحتية مركزية الإدارة تتمتع بقدرات عزل قوية، وبدأت في استخدام مصنفات أمنية لمراقبة السلوك بشكل أكثر تكرارًا.

المصدر الأصلي

AIbase

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل