لماذا يفشل DeepSeek فجأة في النصوص الطويلة؟ فريق Seed من ByteDance يكشف لغز تذبذب أداء الذكاء الاصطناعي
قاعدة AIbase
نُشر فيأخبار ومعلومات الذكاء الاصطناعي · قراءة 1 دقيقة · Oct 9, 20262في أحدث أوراقها البحثية، كشف فريق Seed التابع لشركة ByteDance الأسباب التقنية وراء تذبذب أداء النماذج اللغوية الكبيرة عند معالجة النصوص فائقة الطول. وأشار فريق البحث إلى أن هذه الظاهرة تعود أساساً إلى "الحساسية الطورية" الناتجة عن تقنية ضغط ذاكرة KV المؤقتة المقسمة إلى كتل.
آلية رئيسية تسبب انحرافاً في الاسترجاع
ولخفض استهلاك الذاكرة أثناء الاستدلال بالسياق الطويل، تضغط هذه التقنية نوافذ من الرموز المتتالية إلى عدد أقل من المدخلات بخطوة ثابتة. غير أن آلية الضغط هذه تُدخل إحداثي موقع جديداً تماماً، وهو "الطور" أي موقع الرمز (Token) بالنسبة إلى حدود نافذة الضغط.
وتُظهر التجارب أنه عند مواجهة معلومات متطابقة تماماً، يؤدي اختلاف الطور إلى تغيرات حادة في صعوبة الاسترجاع. وفي بعض النماذج مفتوحة المصدر الكبيرة، قد تصل الفجوة في دقة استرجاع النصوص الطويلة الناجمة عن هذا الاختلاف الطوري إلى 40 نقطة مئوية.
نقاط ضعف دورية تستدعي التحسين العاجل
يكشف هذا الاكتشاف عن محدودية اختبارات المعايير المتوسطة التقليدية، إذ قد تخفي بعض النماذج نقاط ضعف دورية خطيرة خلف متوسطات درجات مرتفعة تبدو مبهرة. ومع اتساع تطبيقات نماذج النصوص الطويلة يوماً بعد يوم، توفر هذه النتائج البحثية أساساً نظرياً مهماً لتحسين بُنى النماذج مستقبلاً ورفع استقرار الاستدلال بالسياق الطويل.
هذا المقال من نشرة AIbase اليومية
مرحباً بكم في قسم 【النشرة اليومية للذكاء الاصطناعي】! هنا دليلكم اليومي لاستكشاف عالم الذكاء الاصطناعي؛ كل نقدم لكم يومياً أبرز محتويات مجال الذكاء الاصطناعي، مع التركيز على المطورين، لمساعدتكم على إدراك اتجاهات التقنية والتعرف على التطبيقات المبتكرة لمنتجات الذكاء الاصطناعي.
—— من إنتاج فريق النشرة اليومية لـ AIbase © جميع الحقوق محفوظة لقاعدة AIbase 2024، اضغط لعرض المصدر -