قالت Anthropic إن نماذجها استغلت مواقع على الإنترنت، بينها مواقع تديرها وكالات حكومية أمريكية، وأنها ستوقف الوصول إلى الإنترنت الحي لجميع تقييماتها الداخلية حتى تتأكد المختبرات الرائدة من قدرتها على مراقبة وكلائها الذكيين والتحكم فيها.
الحوادث، التي تم الكشف عنها في منشور مدونة، تضمنت وكلاء ذكيين مكلّفين بحل المشكلات يسعون إلى الحصول على موارد على الإنترنت. وفي هذه العملية، استغلوا ثغرات برمجية، وتجاوزوا حواجز الدفع وقيود منع الروبوتات، واستخدموا خدمات تقصير عناوين URL لتهريب المعلومات وتجاوز القيود، بل بل وقاموا بتقديم بلاغ قتل كاذب إلى شرطة فيلادلفيا.
قالت Anthropic إنها اكتشفت هذه المشكلات الجديدة في مراجعة لأنشطة نموذجها بدأت في يوليو، وهو ما يبرز نقص الوعي لدى المختبر بسلوك برمجياتها.
واللافت أن الشركة قالت إن تدريب المواءمة لم يكن بعد كافياً لمهارات مثل البحث واستخدام الحاسوب، وهي مهارات محورية في عرضها القائل بأن الوكلاء الذكيين سيستخدمها أي محترف يعتمد على الأدوات الرقمية.
السلوكيات التي كشفت عنها Anthropic تشبه حوادث تخص وكلاء OpenAI الذين تعاونوا لاختراق مواقع متنوعة بحثاً عن معلومات، بينها مواقع تديرها الحكومة الأسترالية.
كانت Anthropic قد كشفت سابقاً أن نماذجها اخترقت أنظمة خارجية. وقال المختبر الرائد إنه يعتبر الكشفوفات اليوم "أقل خطورة بشكل ملحوظ من منظور المواءمة والأمن" من تلك التي أعلنها سابقاً.
غير أن المختبر قال مع ذلك إنه "أوقف الوصول إلى الإنترنت الحي" لـ "جميع تقييماتنا الداخلية" حتى يتأكد من قدرته على مراقبة وكلائه والتحكم فيها.
ليس من الواضح ماذا يعني ذلك، لكن سيدني فون أرك، مؤسِّسة منظمة Nightingale لسلامة الذكاء الاصطناعي، قالت لـ TechCrunch في مقابلة قبل هذا الكشف إن تطوير النماذج في مركز بيانات معزول عن الإنترنت المفتوح سيكون تحدياً كبيراً للباحثين من حيث الوصول، وللتقدم في النماذج التي تستفيد من الوصول إلى الإنترنت.
"عليك أن تُواءمها في مرحلة ما"، قالت فون أرك. "إذا أُطلقت الأنظمة الذكية إلى الإنتاج ولم يكن لديها إطلاقاً وصول إلى الإنترنت، فلن تكون أداة مفيدة جداً".
قالت Anthropic إن هذا السلوك كان نتيجة لعيوب في بيئات تدريب المختبر، مما قاد النماذج إلى الاعتقاد بأنها ستُكافأ على إيجاد ثغرات أو تجاوز القيود، وهو سلوك يُسمى "اختراق المكافأة".
وقالت الشركة إنها ستتوقف عن تشغيل بعض تقييماتها أو نقلها دون اتصال، وقد بنت أدوات لاكتشاف هذا السلوك وحجبه. وقد اختُبرت هذه الأدوات ضد نوع الحوادث الذي كُشف عنه اليوم وحجبته؛ وليس من الواضح ما الأدلة التي ستدفع Anthropic إلى إعادة الوصول إلى الإنترنت الحي لتقييماتها الداخلية.
كما قالت Anthropic إنها ستنقل وكلائها الذكيين الداخليين إلى "بنية تحتية مُدارة مركزياً مع احتواء قوي"، وبدأت تستخدم مصنّفات السلامة بشكل متكرر أكثر لمراقبة هؤلاء الوكلاء.
