معظم الموصيات في بيئة الإنتاج هي سلاسل متتالية. تولّد مولّدات المرشحين مدخلات لمصنّف أولي، يغذي بدوره مصنّفاً ثقيلاً مبنيّاً على مئات الميزات المهندسة. تجربة يانديكس التقرير التقني لـ Sona تصف تصميماً مختلفاً. Sona هو نموذج ذكاء اصطناعي توليدي يجمع توليد المرشحين والترتيب في نظام واحد، ليحل محل المراحل المتعددة المستخدمة عادةً في أنظمة التوصيات. اختبرت يانديكس النموذج في تجربة إنتاج حية استمرت سبعة أيام على مكبراتها الصوتية الذكية. في اختبار A/B على الإنترنت، حل المحوّل (ترانسفورمر) المُقدَّم الواحد محل أكثر من 15 مولّد مرشحين، ومرحلة الترتيب الأولي، ومرحلة الترتيب النهائي.
ما المشكلة التي تحلها Sona؟
تقسم السلاسل المتتالية قراراً واحداً بين نماذج مدرّبة بشكل منفصل. كل مرحلة تُحسّن هدفها الخاص، ولا يرى المصنّف النهائي إلا ما تسمح به المراحل السابقة به. كان النظام السابق ليانديكس على واجهة Yandex Music يستهلك مئات الميزات، بما في ذلك إشارات من Argus، وهو محوّل التوصيات السابق من يانديكس. تضع Sona توليد المرشحين والترتيب حول تمثيل واحد مشترك للمستخدم. يقرأ المشفّر تاريخ المستمع مرة واحدة لكل طلب. ويولّد فكّ التشفير المرشحين. ثم تقيّم وحدة الترتيب هذه المرشحين مقابل حالات المشفّر نفسها. لا يستخدم أي مكوّن ميزات هندسية يدوية. المدخلات هي حقول أحداث مسجّلة (معرّف المقطع، معرّف الفنان، المدة، الإعجابات، وقت التشغيل، أعلام الواجهة) ومعرّفات دلالية مُتعلّمة.
على مكبرات يانديكس الصوتية الذكية، يمكن أن يبدأ التشغيل دون أن يختار المستخدم أولاً فناناً أو نوعاً موسيقياً أو مزاجاً. يصف فريق البحث هذا بأنه إعداد توصية خالصة.
كيف تعمل بنية Sona
1. المُرمِّز الدلالي
اتباعاً لـ صيغة المعرف الدلالي لـ Rajput وآخرين.، يصبح كل مقطع موسيقي مجموعة من 3 رموز منفصلة. يقرأ نموذج LLM متعدد الوسائط ومجمّد الطيف الصوتي (mel-spectrogram) لأول 90 ثانية مع العنوان والفنانين والوسوم. يعمل بنمط prefill فقط. ثم يقوم محوّل تحسين من 4 طبقات بمواءمة هذه الميزات مع سلوك الاستماع، باستخدام InfoNCE على أزواج المقاطع التشاركية. ويكمّم K-means التتابعي النتيجة إلى 3 كتيّبات رموز تحتوي كل منها على 32,000 إدخال. تفوق هذا خط الأساس الصوتي CLMR: ارتفع Recall@1000 من 0.8111 إلى 0.8524.
2. المشفّر مع ضغط السجل
تنتبه Sona إلى 8,192 حدثاً سابقاً. الانتباه الكامل على هذا الطول مكلف، لذا يوزّع المشفّر العمق بشكل غير متساوٍ. تحصل الأحداث الـ 2,048 الأحدث على مكدس انتباه ذاتي من 7 طبقات. أما الأحداث الأقدم فتمر عبر الانتباه المتقاطع وطبقة 1 فقط للسجل الكامل. يذكر البحث أن هذا يحافظ على معظم جودة الانتباه الكامل بنحو نصف تكلفة الاستدلال.
3. فكّ التشفير ووحدة الترتيب
يُصدر فكّ تشفير من 2 طبقة مجموعات المعرفات الدلالية عبر بحث شعاعي مقيّد بعرض 1,024. تحجب شجرة (trie) الكتالوج البادئات غير الصالحة. تتوسع كل مجموعة لتشمل كل مقطع يشاركها. ثم تقيّم وحدة الترتيب، المكونة من 4 طبقات انتباه متقاطع، هذه المقاطع مقابل ذاكرة المشفّر المشتركة.
التدريب: معلّم لا يُنشر أبداً
يتعلم وحدة الترتيب (Ranking Module) من مُرتّب معلّم (Teacher Ranker) مجمّد. المعلّم هو محوّل (transformer) يحتوي على 0.6B من المعاملات، وهو أيضًا بدون خصائص مُهندَسة يدويًا. تم تدريبه على عام من أحداث التفاعل في 2 من المراحل: تدريب مسبق للتنبؤ بالعنصر التالي، ثم ضبط دقيق متعدد الرؤوس للترتيب. أدّت إزالة التدريب المسبق إلى انخفاض دقة الأزواج الموزونة من 0.6215 إلى 0.6153.
يسمي الفريق طريقة التقطير الخاصة به Rollout Distillation. أثناء التدريب، يولّد فكّ التشفير الحالي مرشحين بالبحث الشعاعي. يقيّم المعلّم هذه المرشحين، مع الانطباعات المسجّلة. تنحدر وحدة الترتيب نحو تلك الدرجات باستخدام متوسط الخطأ المطلق. دالة الخسارة المشتركة هي L = L_NTP + L_rollout + L_impression. تُحدّث كلتا الخسارتين المشفّر المشترك. وعند وقت الخدمة، يُزال المعلّم.
يبقى التدريب متصلاً بالإنترنت. تُجمّع الأحداث في جلسات على مدى نافذة مدتها 15 دقيقة، وتغذّي مُدرّباً على GPU، وتصل الأوزان الجديدة إلى الخدمة كل 10 دقائق. زمن الاستجابة من البداية إلى النهاية هو 45 دقيقة عند الوسيط و60 دقيقة عند p99. تعمل الخدمة على NVIDIA Triton Inference Server مع CUDA graphs وتصل إلى استغلال بنسبة 41% من عمليات FLOPs للنموذج.
النتائج: اختبار A/B على الإنترنت بحركة مرور حية
استغرقت التجربة النهائية 7 أيام على 15% من المستخدمين المختارين عشوائياً لكل مجموعة. كل تغيير أدناه ذو دلالة إحصائية ومقارن بمجموعة التحكم في الإنتاج:
- المستخدمون النشطون (المقياس الأساسي): +4.53%
- إجمالي وقت الاستماع: +6.30%
- الإعجابات: +11.42%
- أوامر "التكرار": +17.99%
- المستخدمون المشاركون بعمق: +7.37%
تتراكم هذه المكاسب فوق التحسينات التي تم الاحتفاظ بها من عمليات النشر السابقة. فيما يتعلق بالمستخدمين النشطين، فإن أثر Sona الإيجابي يبلغ 2.35 ضعف الزيادة البالغة +1.93% التي حققتها Argus سابقًا على هذه الواجهة.
Sona مقابل OneRec مقابل HSTU: مقارنة الميزات
سونا (Sona) ليست أول مُوصي توليدي من طرف إلى طرف يعمل في الإنتاج. فمنصة OneRec من كوايشو تخدم بالفعل نموذج ترميز-فك ترميز واحدًا. كما أعادت HSTU Generative Recommenders من ميتا صياغة التوصية كتحويل تسلسلي على أفعال المستخدم في عام 2024. ما تجمعه سونا هو استبدال كامل للتتالية، وغياب السمات المصممة يدويًا، ومُصنِّف مُقطَّر، مع تحقق عبر الإنترنت.
| الخاصية | سونا (ياندكس) | OneRec (كوايشو) | HSTU GR (ميتا) |
| المجال | بث الموسيقى | الفيديو القصير | منصة إنترنت كبيرة، أسطح متعددة |
| نموذج واحد مُخدَم يستبدل التتالية | نعم، في اختبار A/B | نعم، حوالي 25% من إجمالي QPS | لا، مُقدَّم كمعمارية جديدة لنماذج التوصية |
| مدخلات المستخدم | حقول الأحداث المسجلة فقط، بدون سمات مصممة يدويًا | مسارات "هندسة السمات متعددة المقاييس"، بما في ذلك uid والعمر والجنس | تسلسلات أفعال المستخدم (تحويل تسلسلي) |
| مخرجات العناصر | معرفات دلالية من 3 مستويات، 3 × 32,000 | معرفات دلالية من 3 مستويات عبر RQ-Kmeans | معرفات العناصر |
| إشارة الترتيب | مُنتَجة من مُصنِّف المعلم المجمد بحجم 0.6B | تعلم معزز بنموذج مكافأة P-Score (ECPO) | نموذج ترتيب HSTU |
| التعلم المعزز | لا، إشراف كامل | نعم (ECPO) | غير مُبلَّغ عنه |
| تم الإبلاغ عن المقياس | سجل أحداث يضم 8,192 حدثًا، ومعلم مُدرِّب بحجم 0.6B | 10 أضعاف عمليات FLOPs لنموذج الترتيب السابق | 1.5 تريليون معامل |
| المكسب المُبلَّغ عنه على الإنترنت | +4.53% مستخدمون نشطون، +6.30% وقت استماع، +11.42% إعجابات | +0.54% و+1.24% وقت بقاء في التطبيق | +12.4% في اختبارات A/B على الإنترنت |
| كود أو أوزان عامة | لا | غير مذكور في التقرير | نعم، على GitHub |
المصادر: Sona, OneRec, HSTU. المكاسب على الإنترنت تأتي من منصات ومقاييس مختلفة، لذا فهي غير قابلة للمقارنة المباشرة.
الخلاصات الرئيسية
- استبدلت Sona أكثر من 15 مولدًا، والترتيب المسبق، والترتيب بنموذج مُقدَّم واحد (1).
- لا ميزات هندسية يدوية: فقط أحداث مسجلة ومعرفات دلالية مُتعلَّمة.
- معلّم بحجم 0.6B يدرّب المُرتِّب، ثم يبقى خارج الخدمة.
- اختبار A/B: +4.53% مستخدمين نشطين، أي 2.35x المكسب السابق لـ Argus.
- غير قابلة للنشر خارجيًا: لا كود أو أوزان، وليس على كامل حركة المرور.
الأسئلة الشائعة
ما هي Yandex Sona؟
Sona هو نموذج ذكاء اصطناعي توليدي يجمع توليد المرشحين والترتيب ضمن نظام واحد. اختبرت Yandex النموذج في تجربة إنتاجية حية استمرت سبعة أيام على مكبراتها الصوتية الذكية، حيث استبدل خط أنابيب التوصيات متعدد المراحل القائم للمجموعة التجريبية.
كيف يختلف Sona عن OneRec؟
يستخدم OneRec مسارات ميزات مستخدمين مُهندَسة وتعلمًا معززًا مع نموذج مكافأة. أما Sona فيستخدم فقط حقول الأحداث المسجلة ويقوم بتقطير الترتيب من معلّم مجمد.
اطّلع على الورقة البحثية للتفاصيل الكاملة.
ظهر المقال تقدم Yandex نظام Sona: موصِل توليدي واحد يحل محل سلسلة التوصيات بالكامل أول مرة على MarkTechPost.