الكاتب丨غاو يونيي
المحرر丨تسينغ فنغ
عند سؤال DeepSeek عن السؤال نفسه مرتين، بمجرد إضافة بضعة مسافات فقط، تكون الإجابة المعطاة في مرة تشبه «عبقرياً» وفي مرة أخرى تشبه «أبله». في نهاية شهر 9، أصدرت الورقة البحثية الجديدة لفريق بايت«البقع الضعيفة الدورية: حساسية الطور الناتجة عن ضغط KV-Cache المُجزَّأ»، وأشارت مباشرةً إلى سلسلة نماذج DeepSeek V4 في«الازدواجية بين الإله والشيطان» في نماذج سلسلة DeepSeek V4. توضيح الصورة: رابط الورقة البحثية https://arxiv.org/pdf/2609.36322 هذه في جوهرها «فقدان ذاكرة دوري» ناتج عن اختصار في الخوارزمية الأساسية،تقنية ضغط KV Cache المجزأةتقسّم السياق الطويل إلى كتل تُضغط وتُعالج، وهذا يطرح مشكلة:«الموقع يحسم المصير». إذا وقعت كلماتك الأساسية مصادفة في «المنطقة العمياء للمعلومات» عند حدود الكتل، فلن يبقى للنموذج سوى الثرثرة بلا معنى. تخيّل أن تطلب من نموذج لغوي كبير مراجعة عقد من عشرات الصفحات، وبندًا حرجًا يقع مصادفة في «المنطقة العمياء للمعلومات»، فيتجاهل النموذج هذه المعلومات تمامًا ويقدم استنتاجًا معاكسًا. وقد يحدث هذا الخطأ لمجرد أنك أضفت عن غير قصد بعض المحارف الفارغة، فيفشل النموذج فورًا دون أن تعرف أين تكمن المشكلة إطلاقًا. وهذه العيوب الخلقية لـ«الازدواجية بين الإله والشيطان» ليست حكرًا على DeepSeek وحدها. في هذا العصر الذي تُصرخ فيه الجماهير «اخفض تكلفة النصوص الطويلة»، أي نموذج يعتمد تقنيات الضغط المجزأ أو التخفيف له مشكلات مماثلة بدرجة أو بأخرى، مثل سلسلة Llama 3 مفتوحة المصدر.
01
ورقة بايت تضبط DeepSeek على الخطأ
اكتشاف بايت الأولي نشأ من مطالبة DeepSeek-V4-Flash-Base بإكمال مقطع برمجي. كانت المهمة إكمال آخر Token لدالة تكميم FP8. وفقًا لمنطق الشيفرة، كانت النتيجة الصحيحة يجب أن تكون 8، لكن لأن الباحثين أضافوا في مقدمة الشيفرة سلسلة من علامات التساوي لأغراض تجميلية بحتة، أخرج النموذج 32. والأغرب أن هذا الخطأ ليس عشوائيًا، بل يرتبط مباشرة بعدد علامات التساوي:عند قسمة عدد علامات التساوي على 4، إذا كان الباقي 0 أو 1، فمن المرجح جدًا أن يجيب النموذج خطأً، إذ يصل معدل الخطأ إلى 71.3%؛ وإذا كان الباقي 2 أو 3، يتمكن النموذج من الإجابة الصحيحة، إذ يصل معدل الدقة إلى 91.5%.تتبّع فريق بايت الخيط فاكتشف أن هذا عيب خلقي خلّفته النماذج اللغوية الكبيرة عند اعتمادهاتقنية ضغط KV Cache المجزأة. تقنية ضغط KV Cache المجزأة هي الورقة الرابحة التي تستخدمها DeepSeek لحل مشكلة ضغط الذاكرة في السياقات الطويلة، إذ تقسّم التوكنات المتتالية بطول ثابت، ويمكن ضغط التوكنات في كل مقطع عبر طبقة بوابة قابلة للتعلم إلى «ملخصات صغيرة»، فتخف ضغط الذاكرة للسياق الطويل فورًا. هذا يحل مشكلة الذاكرة، لكنه يُدخل مشكلة جديدة. انتباه محول Transformer القياسي يعتمد فقط على المسافات النسبية بين التوكنات ولا يهتم بالمواقع المطلقة. مهما وُضعت الجملة، ما دام ترتيب الكلمات ثابتًا يبقى المعنى ثابتًا.لكن بعد اعتماد DeepSeek لضغط KV Cache المجزأ، أصبح موقع كل توكن داخل المقطع المضغوط مهمًا، ويُسمى هذا الموقع «الطور». تمنح طبقة البوابة أوزانًا مختلفة للتوكنات في مواقع مختلفة، ويُسمى هذا الوزن معامل الكسب للخانة.التوكنات التي تُرتَّب في الخانات القوية تُحفظ بأوزان مرجّحة ويجيب النموذج بدقة؛ أما التوكنات التي تقع في الخانات العمياء فتُهمل تقريبًا فيجيب النموذج خطأً.تُسمى هذه الظاهرة الحساسة للترتيب حساسية الطور.وبتعمّق التحليل داخل النموذج، اكتشف الباحثون أيضًا أن رؤوس الانتباه شكّلت تقسيمًا طبيعيًا للعمل. بعضها متخصص في معالجة المواقع الأولى داخل المقطع، وبعضها متخصص في المواقع الأخيرة. هذا التخصص الطوري جعل بعض الترتيبات نقاط ضعف.وللتحقق من أن هذا ليس صدفة، أجرى فريق ByteDance اختبار "إبرة في كومة قش". قام الباحثون ببناء سياق يبلغ طوله 128K Token، يحتوي على نحو 1.6 万 زوج من المفاتيح والقيم، حيث يقابل كل مفتاح (Key) قيمة (Value). في ظل ثبات علاقات المفاتيح، وثبات السؤال، وثبات الطول الإجمالي للسياق، إذا وُضع أحد أزواج المفتاح-القيمة في مواضع مختلفة، فهل يستطيع النموذج الإجابة بشكل صحيح عن القيمة المقابلة؟ وجدوا أن أقصى فارق في دقة DeepSeek-V4-Flash-Base بين المواضع المختلفة بلغ 40.2 %. وبعد التحويل إلى DeepSeek-V4-Pro-Base، بلغ الفارق 34.8 %، وحتى مع التحسين عبر التدريب اللاحق، استمرت المشكلة، إذ بلغ الفارق 19.1% و14.8%. ولمواجهة مشكلة النقاط العمياء الدورية هذه، جرّبت DeepSeek نموذج DeepSeek-V4.1-Flash بخفض خطوة الضغط إلى النصف مباشرة. ف عندما تُضبط خطوة الضغط على 4، يقسّم كل جولة ضغط إلى 4 خانات. ويتفاوت كبيرًا وزن المعلومات المخصّص للخانات المختلفة، حيث إن الرموز (Token) الموجودة في المواضع الطرفية يسهل أن تُفقد خلال جولتين متتاليتين من ضغط النافذة. وبعد خفض الخطوة إلى 2، أصبح الضغط أدق، إذ يُدمج في كل مرة 2 من الرموز فقط. وداخل دورة ضغط واحدة، يكون للرمز موضعان نسبيان فقط. وبهذا، حتى إذا وقعت المعلومات الحاسمة في موضع فردي أضعف، فبسبب أن المواضع المتجاورة تختلف بمقدار 1 من الرموز فقط، يصعب تمامًا فقدان السياق بالكامل. لقد خفّض DeepSeek-V4.1-Flash فعلًا فارق الدقة إلى 6.1 %، لكن المشكلة لم تُزل قائمة. ونتيجة لذلك، درّب فريق ByteDance مجموعة من النماذج من الصفر بمعمارية Qwen3-0.6B، مع ثبات جميع الإعدادات الأخرى تمامًا، وتغيير آلية الضغط فقط. ووجدوا النتيجة التالية:- جميع النماذج التي تستخدم الضغط المجزأ أظهرت تذبذبًا دوريًا في الدقة؛ بينما نموذج الانتباه الكامل الأساسي دون ضغط لم تظهر لديه هذه الظاهرة؛
- فترة التذبذب تساوي تمامًا خطوة الضغط؛
- بإزالة ترميز المواقع RoPE يبقى التذبذب قائمًا، فهو ليس انحيازًا ناتجًا عن ترميز المواقع؛
- وباستبدال أوزان البوابة القابلة للتعلم بأبسط توزيع متساوٍ، يبقى التذبذب الدوري قائمًا، فهو ليس سوء ضبط للمعاملات.
02
هل تقنية "التقسيم الديناميكي" هي العلاج؟
جوهر التقسيم الديناميكي هو التخلي عن نمط القطع بمقدار ثابت من الرموز، وتعديل الحدود بمرونة وفقًا للدلالة والأهمية.هذا النهج التقني يمثل إعادة بناء من الأعلى إلى الأسفل لمنظومة تقنية كاملة، من رياضيات الخوارزميات إلى إدارة ذاكرة الفيديو وصولًا إلى العتاد التحتي.▎الطبقة الأولى: إعادة بناء الأساس الرياضي لآلية الانتباه
كيف ينبغي أن يتم التقسيم الديناميكي بالضبط؟ الجوهر هو "حجم يتبع المحتوى". الكلام الحشو منخفض الكثافة المعلوماتية يُدمج مباشرة في كتل كبيرة؛ وعند مواجهة المنعطفات الحاسمة والمعلومات عالية الكثافة، يُقسَّم بدقة كافية ويُحسب بعناية. وبهذا، مهما كان موقع المعلومة الحاسمة، يستطيع النموذج التقاطها بحساسية عالية، وهو ما يعيد رياضيًا بناء خاصية الثبات بالانزياح التي كسرها التقسيم الثابت. وعلى نحو أعمق، يمنح ذلك النموذج "قدرة استباقية": يمسح كثافة المعلومات أولًا، ثم يقرر حجم القطع. لم تعد عملية الاستدلال قراءة بإيقاع واحد من البداية للنهاية، بل قراءة سريعة حيث يجب السرعة، وتأنٍّ حيث يجب التدقيق، أي نشوء غريزة "التفكير السريع والبطيء" في عمق البنية التحتية.▎الطبقة الثانية: دفع إدارة ذاكرة الفيديو إلى التطور
سابقًا، ومن أجل تسريع حساب المصفوفات، كانت ذاكرة KV Cache تُدار بكتل ذات حجم ثابت. ميزة هذه الطريقة هي بساطتها وانتظامها وسهولة التعامل معها، لكن معدل استغلال الذاكرة لا يرتفع وتُهدر القدرة الحسابية بلا داعٍ. بعد التقسيم الديناميكي، لم تعد "المصفوفات الثابتة المتصلة" التقليدية في الطبقة التحتية كافية، وسيكون التطور حتمًا نحو "المصفوفات المتناثرة طوبولوجيًا"، مع الاعتماد على طبقة فهرسة ديناميكية لإتمام العنونة. والأجمل أن الأبحاث وجدت أن حدود التقسيم الديناميكي متشابهة إلى حد كبير بين طبقات Transformer المختلفة، ويمكن إعادة استخدامها مباشرة، مما يخفف إلى حد كبير كلفة العنونة الديناميكية. وفي النهاية: الطبقة العليا تقسم بذكاء، والطبقة التحتية تخزن باقتصاد أكبر، والعنونة في الوسط ليست بطيئة.▎الطبقة الثالثة: حل مشكلة المحاذاة في العتاد
هذه أصعب الطبقات الثلاث في الاختراق. تفضل وحدات معالجة الرسومات بطبيعتها عمليات مصفوفات منتظمة وأطوال أضلاعها تقبل القسمة على 8 و16 و32، وهذا هو السبب العتادي الأكثر واقعية وراء تمسك الصناعة كلها بالتقسيم الثابت طوال هذه المدة. وإذا تفاوتت أحجام الكتل، فإن وحدات التسريع المخصصة لحساب المصفوفات (مثل Tensor Core) ستتعطل كثيرًا بلا عمل. بخصوص هذه المشكلة، توصلت الصناعة بالفعل إلى حلول قابلة للتطبيق. مثلًا، خوارزمية الحشو بالأصفار تستطيع على مستوى ذاكرة الفيديو الفعلية أن تضم الكتل الدلالية الديناميكية المتفاوتة الأطوال بإحكام دون إهدار المساحة، كما تحافظ منطقيًا على حدود كل كتلة دلالية. حاليًا،تتقدم أعرق مختبرات الذكاء الاصطناعي عالميًا بتقنية التقسيم الديناميكي من اتجاهين: "الاستمرارية الدلالية" و"الحساب المتناثر"وقد أصبحت هذه التقنية نقطة الاختراق الجوهرية لتسريع الجيل الجديد من النماذج اللغوية الكبيرة للنصوص الطويلة ورفع جودتها.ومن أبرز النتائج تمثيلية ما اقترحه فريق جامعة العلوم والتكنولوجيا في هونغ كونغ (قوانغتشو) تحت اسم ChunkKVوهو يسلك طريق "الاستمرارية الدلالية". في الماضي، كانت طرق ضغط KV السائدة، سواء H2O أو SnapKV أو PyramidKV، يقودها فكر جوهري واحد: إعطاء درجة لكل رمز على حدة، والاحتفاظ بالمهم وإهمال غير المهم. وهذا النوع من الترشيح يسهل أن يفتت جملة كاملة ذات فاعل وفعل ومفعول إلى شذرات. أما الفكرة الجوهرية في ChunkKV فهي اعتبار الكتل الدلالية المتصلة وحدة الضغط الأساسية: إما الاحتفاظ بالكتلة كاملة وإما إهمالها بالكامل. فما يُحتفظ به عبارة عن عبارات وجمل مكتملة. وفي اختبار NIAH (البحث عن إبرة في بحر) الذي يمثل أصعب اختبار لقدرة استرجاع النصوص الطويلة، عندما كان حجم ذاكرة KV المخبئية محدودًا بـ128، بلغت دقة ChunkKV المبني على LLaMA-3 نسبة 73.8%، بينما لم تتجاوز الطريقة التقليدية SnapKV نسبة 58.9%. هذه التقنية سدت مباشرة نقطة ضعف النماذج الكبيرة في سيناريوهات النصوص الطويلة المتمثلة في "عدم الفهم ودقة البحث المنخفضة"، ورفعت بشكل كبير قابلية النموذج للاستخدام الفعلي.وإلى جانب ChunkKV، يوجد فريق الدكتور شياو هان في Jina AI الذي ركز على تحسين سيناريوهات الاسترجاع واقترح حل التقسيم المتأخر، الذي يعالج المشكلة القاتلة في الاسترجاع الذكي التقليدي المتمثلة في "تقسيم النص أولًا ثم تحليل المحتوى"؛ إذ يُترك النموذج يقرأ النص كاملًا أولًا ويستوعب المحتوى العام ومنطق السياق، وحتى قبل إخراج النتيجة النهائية، يُقسَّم النص وفق الحدود الدلالية الطبيعية، بما يحفظ أكبر قدر من المعلومات الكاملة. أما في جانب "الحساب المتناثر"، فقد طورمعهد مايكروسوفت للبحوث في آسياإطار MInference المخصص خصيصًا لسيناريوهات الاستدلال على نصوص فائقة الطول بمستوى المليون كلمة. وجد الفريق في أبحاثه أنه عندما تقرأ النماذج الكبيرة النصوص الطويلة، لا يحتاج كل مقطع إلى حساب دقيق، وأن مصفوفة الانتباه تتضمن أنماط تناثر ثابتة قابلة للاستغلال. وبناءً على هذه الخاصية، يطابق هذا الإطار كل رأس انتباه مع أسلوب الحساب المتناثر الأنسب له. ودون أي انخفاض في دقة الاسترجاع، حقق تسريعًا يصل إلى 10 أضعاف في مرحلة التعبئة المسبقة (prefill) للسياق الطويل بمليون كلمة. في الشوط الأول لسباق السياقات الطويلة، عندما تنافس الجميع على "من يعالج نصوصًا أطول"، كان لضغط KV دور لا يُنكَر. لكن جوهر السياقات الطويلة لم يكن قط لكي تكون طويلة Lengthًا في ذاتها. وحين بدأ المستخدمون يستخدمون السياقات الطويلة فعلًا في مهام حقيقية، أصبحت القابلية للاستخدام وجودة الأداء وعدم فقدان المعلومات هي مؤشر الأداء الجديد. روابط مرجعية: https://arxiv.org/pdf/2609.36322https://www.zhihu.com/question/2091513666864682278
استقل السيارة، فليقودك موقع雷峰网 (الحساب الرسمي: 雷峰网) لاستكشاف خلاصات أفضل مؤتمرات الذكاء الاصطناعي حول العالم
يمكنك الاطلاع حصريًا على:
عروض PPT التقديمية للخبراء
النصوص الكاملة لتقارير المؤتمرات
تحليلات الأوراق البحثية الرائجة
مقابلات مع النجوم الأكاديميين الصاعدين
امسح رمز الاستجابة السريعة أعلاه
أو انقر على «قراءة النص الأصلي» لمتابعة القسم المخصص.
مقالات 雷峰网 الأصلية، يُحظر إعادة نشرها دون إذن. لمزيد من التفاصيل، راجعشروط إعادة النشر。