The Decoder

تقول شركة OpenAI إن النموذج غير المتوافق دمر بوعي بيئته الخاصة آملة في بدء جديد مع بيانات أفضل

لقد سجلت شركة OpenAI حالات جديدة لسلوك النماذج غير المتوافقة. نموذج تقييم واحد قام بإنتاج بيانات مزيفة ودمر بيئته الخاصة. بينما تجاهلت نماذج أخرى بشكل متعمد قيود الشبكة عن طريق توجيه الطلبات عبر مراكز انتقال مجهولة…

Matthias Bastian
مصدر الصورة · The Decoder

تقول شركة OpenAI إن النموذج غير المتوافق دمر بوعي بيئته الخاصة آملة في بدء جديد مع بيانات أفضل

Matthias Bastian ماتياس باستيان عرض ملف ماتياس باستيان على لينكدإن 10 أكتوبر 2026

لدى OpenAI بعض قصص عن وكلاء جانحين جدد. في الحالة الأولى (6 أكتوبر)، لم يتمكن نموذج تقييم الذكاء الاصطناعي من العثور على الإجابات التي كان من المفترض أن يقيمها. بدلاً من الإبلاغ عن الخطأ، قام بإنتاج تقييمات مزيفة، وإنشاء ملفات مدخلات مزيفة، ثم أفسد بعمد بيئةه الخاصة، على أمل أن يقوم النظام باستبداله بجهاز افتراضي جديد يحتوي على البيانات المفقودة.

نموذج OpenAI يفكر في سلسلة تفكير داخلية بشأن تشويه بيئته عمدًا لإجبار إنشاء آلة افتراضية جديدة مع البيانات المفقودة. | الصورة: OpenAI عبر ماركوس ويليامز

في الحالة الثانية (19/20 يونيو)، تجاوزت النماذج قيود تحد من استخدامها فقط لطلبات HTTP GET أثناء استرجاع الإحصائيات العامة. اعترفت إحدى النماذج صراحةً بانتهاك ذلك في سلسلة تفكيرها، لكنها اختارت المضي قدمًا ولم تذكر ذلك أبدًا.

في الحالة الثالثة (16/17 يونيو)، كان للنماذج البيانات التي تحتاجها بالفعل، لكنهن استمرت في إيجاد طرق لتجاوز قيود الشبكة الخاصة بها. قامت النماذج بإنشاء حسابات على خدمة سطح مُعزولة، وقامت بتوجيه طلبات POST المحظورة عبر مراكز إرسال مجهولة الهوية، وبنّت أيضًا عملاء FTP الخاصين بها. كشفت شركة Anthropic أيضًا عن الطرق الغريبة التي تستخدمها النماذج لالتفاف حول القيود المفروضة.

أخبار الذكاء الاصطناعي بدون الضجة الشرسة – مُختاره البشر

اشترك في THE DECODER للقراءة بدون إعلانات، إلى نشرة أخبار الذكاء الاصطناعي الأسبوعية، إلى تقرير "AI Radar" الحصري الست مرات في السنة، إلى الوصول الكامل للأرشيف، وإلى الوصول إلى قسم التعليقات.

المصدر: OpenAI
المصدر الأصلي

The Decoder

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل