عندما يتم إدخال الذكاء الاصطناعي الصوتي في حوار حقيقي يستمر لعدة ساعات ويتجول عبر عدة جولات، فهل يمكنه بالفعل تذكر "من قال هذه الجملة، وبأي نبرة صوتية، وما هي الأصوات الموجودة في الخلفية"؟ يعتقد الفريق المشترك بين جامعة ملبورن وجامعة نيو ساوث ويلز أن التقييمات الحالية لا تستطيع الإجابة على هذا السؤال، لذا قدموا معيار VoxMem المصمم خصيصًا لمواجهة هذه النقطة الضعيفة.
لقد كشفوا أولاً عن نقطتين ضعيفتين في التقييمات القديمة: الأولى هي التركيز فقط على محتوى النص المطبوع، وإهمال المعلومات الهامة المخفية في الصوت، ودلائل المشاعر، والأصوات المحيطة؛ والثانية هي عدم القدرة على فصل متغير “مدى طول التاريخ” بشكل منفصل، مما أدى إلى أداء سيء للنموذج، ولا يمكن تحديد ما إذا كان السبب ضعف الذاكرة أم طول التاريخ الذي يعيق الأداء. طريقة عمل VoxMem هي إنشاء نظام تصنيف ثنائي الأبعاد يجمع بين "الأدلة الصوتية × عمليات الذاكرة"، حيث يتم فصل أبعاد الدراسة بشكل متوازي، ويشمل 15 تركيبة مختلفة، وتظل جميع الأسئلة كما هي دون تغيير عند أطوال تاريخية من 8K إلى 64K – أي أنه يتم تعديل "طول الحوار" فقط، بينما يتم حظر كل شيء آخر، مما يسمح بتفسير تغيرات تأثير الذاكرة بشكل واضح على طولها.
حجم هذه المعايير ليس خفيفًا: 3196 حالة تقييم و34743 محادثة صوتية، بالإضافة إلى حوالي 177 ساعة صوتية، وهذا كافٍ لتقليد محادثة طويلة متعددة الجولات. أما نتائج الاختبار الفعلية على 15 نموذجًا صوتيًا رئيسيًا، فهي مخيبة للآمال. عند طول سياق 32 كيلوبايت، لم تتمكن جميع النماذج من تجاوز نسبة دقة 40%. الجانب المثير للاهتمام هو التفاوت في الاستيعاب: تكون الذاكرة الدلالية للنموذج بالنسبة لـ "ما قاله" أقوى بوضوح من ذاكرة المعلومات الأصلية الثلاثة المتعلقة بشخصية المتحدث، ودلائل اللغة الفرعية (النبرة، المشاعر)، والصوت البيئي؛ خاصةً أن دقة تتبع تقلبات النبرة والتغيرات في الصوت الخلفية منخفضة جدًا، وتكون في حالة عدم يقين تقريبًا. وعلاوة على ذلك، مع زيادة طول التاريخ، تنخفض دقة استيعاب المعلومات المختلفة تدريجيًا.
اتخذ الفريق حكمًا بناءً على ذلك: الاختناق في ذاكرة الصوت لدى النموذج الصوتي الكبير الحالي يكمن بشكل رئيسي في مراحل “التعرف، التحديد، ربط المعلومات”، وليس في العمليات الاستدلالية نفسها – بمعنى آخر، النموذج لا يعجز عن التفكير، بل حتى الحقائق الأساسية مثل “من قال ماذا ومتى وبأي طريقة” لم يتم تجميعها بشكل صحيح، وبالتالي لا يمكن البدء في الاستدلال العلوي. معيار VoxMem هذا يعادل استخدام قياس حرارة الجسم للذكاء الاصطناعي الصوتي، مما يجبر الصناعة على الاعتراف بحقيقة كان يتم إخفاؤها طويلاً من خلال التحويل النصي: ففهم الكلمات لا يعني أن الشخص يتذكر الأشخاص ونبرة الكلام والعالم بأكمله.