MarkTechPost

Yandex présente Sona : un recommandeur génératif unique qui remplace toute la cascade de recommandation

Un seul transformeur a exécuté la génération de candidats et le classement lors du test A/B de Yandex Music sans caractéristiques conçues à la main, augmentant les likes de 11,42 %. L'article Yandex présente Sona : un…

La plupart des recommandeurs en production sont des cascades. Des générateurs de candidats alimentent un pré-classeur, qui alimente lui-même un classeur lourd construit sur des centaines de caractéristiques conçues. Le rapport technique de Sona décrit une conception différente. Sona est un modèle d'IA générative qui réunit la génération de candidats et le classement en un seul système, remplaçant les multiples étapes généralement utilisées dans les pipelines de recommandation. Yandex a testé le modèle lors d'une expérience de production en direct de sept jours sur ses enceintes intelligentes. Dans un test A/B en ligne, il a remplacé plus de 15 générateurs de candidats, l'étape de pré-classement et l'étape de classement par un seul transformeur servi.

Quel problème Sona résout-il ?

Les cascades répartissent une même décision entre des modèles entraînés séparément. Chaque étape optimise son propre objectif, et le classeur ne voit que ce que les étapes en amont laissent passer. La pile précédente de Yandex sur la surface Yandex Music consommait des centaines de caractéristiques, y compris des signaux provenant de Argus, le transformeur de recommandation antérieur de Yandex. Sona place la génération de candidats et le classement autour d'une représentation utilisateur partagée unique. L'encodeur lit l'historique de l'auditeur une fois par requête. Un décodeur génère les candidats. Un module de classement les note par rapport aux mêmes états de l'encodeur. Aucun composant n'utilise de caractéristiques conçues à la main. Les entrées sont des champs d'événements journalisés (ID de piste, ID d'artiste, durée, likes, temps d'écoute, indicateurs de surface) et des Semantic IDs appris.

Sur les enceintes intelligentes de Yandex, la lecture peut commencer sans que l'utilisateur ait d'abord sélectionné un artiste, un genre ou une ambiance. L'équipe de recherche décrit cela comme un cadre de recommandation pure.

Fonctionnement de l'architecture de Sona

1. Tokeniseur sémantique

En suivant la formulation de Semantic ID de Rajput et al., chaque piste devient un tuple de 3 codes discrets. Un LLM multimodal gelé lit le mel-spectrogramme des 90 premières secondes ainsi que le titre, les artistes et les tags. Il fonctionne en mode prefill-only. Un transformeur de raffinement à 4 couches aligne ensuite ces caractéristiques avec le comportement d'écoute, en utilisant InfoNCE sur des paires de pistes collaboratives. Un K-means résiduel quantifie le résultat en 3 codebooks de 32,000 entrées chacun. Cela a surpassé une base de référence audio CLMR : le Recall@1000 est passé de 0.8111 à 0.8524.

2. Encodeur avec compression d'historique

Sona porte attention à 8,192 événements passés. L'attention complète sur cette longueur est coûteuse, donc l'encodeur répartit la profondeur de manière inégale. Les 2,048 événements les plus récents bénéficient d'une pile d'auto-attention à 7 couches. Les événements plus anciens passent uniquement par une cross-attention et 1 couche sur tout l'historique. L'article indique que cela conserve l'essentiel de la qualité de l'attention complète pour environ la moitié du coût d'inférence.

3. Décodeur et module de classement

Un décodeur à 2 couches émet des tuples de Semantic ID via une recherche par faisceau contrainte de largeur 1,024. Un trie du catalogue bloque les préfixes invalides. Chaque tuple s'étend à toutes les pistes qui le partagent. Le module de classement, composé de quatre couches de cross-attention, note ensuite ces pistes par rapport à la mémoire partagée de l'encodeur.

Entraînement : un enseignant qui n'est jamais déployé

Le module de classement apprend à partir d'un Teacher Ranker gelé. L'enseignant est un transformeur de 0.6B de paramètres, également sans caractéristiques conçues à la main. Il est entraîné sur une année d'événements d'engagement en 2 étapes : pré-entraînement par prédiction de l'élément suivant, puis affinage du classement multi-têtes. La suppression du pré-entraînement a fait chuter la précision pondérée par paires de 0.6215 à 0.6153.

L'équipe appelle sa méthode de distillation Rollout Distillation. Pendant l'entraînement, le décodeur actuel génère des candidats par faisceau. L'enseignant les note, ainsi que les impressions journalisées. Le module de classement régresse sur ces scores avec l'erreur absolue moyenne. La perte jointe est L = L_NTP + L_rollout + L_impression. Les deux pertes mettent à jour l'encodeur partagé. Au moment du service, l'enseignant est retiré.

L'entraînement reste en ligne. Les événements s'agrègent en sessions sur une fenêtre de 15 minutes, alimentent un entraîneur GPU, et les nouveaux poids atteignent le service toutes les 10 minutes. La latence de bout en bout est de 45 minutes à la médiane et de 60 minutes au p99. Le service fonctionne sur NVIDIA Triton Inference Server avec des CUDA graphs et atteint une utilisation des FLOPs du modèle de 41 %.

Résultats : test A/B en ligne sur trafic réel

L'expérience finale s'est déroulée pendant 7 jours sur 15 % des utilisateurs sélectionnés aléatoirement par groupe. Chaque changement ci-dessous est statistiquement significatif et relatif au contrôle de production :

  • Utilisateurs actifs (métrique principale) : +4,53 %
  • Temps d'écoute total: +6.30%
  • Likes: +11.42%
  • Commandes « Répéter »: +17.99%
  • Utilisateurs Deepement Engagés: +7.37%

Ces gains s'ajoutent aux améliorations conservées des déploiements précédents. Sur les Utilisateurs Actifs, l'effet de Sona est 2,35 fois supérieur à l'augmentation de +1,93 % qu'Argus avait précédemment apportée sur cette surface.

Sona vs OneRec vs HSTU : Comparaison des fonctionnalités

Sona n'est pas le premier recommendeur génératif de bout en bout en production. Celui de Kuaishou, OneRec, sert déjà un unique modèle encodeur-décodeur. Celui de Meta, HSTU Generative Recommenders, a reconsidéré la recommandation comme une transduction séquentielle sur les actions des utilisateurs en 2024. Ce que Sona combine, c'est un remplacement complet de la cascade, aucune caractéristique conçue à la main, et un ranker distillé, validé en ligne.

CaractéristiqueSona (Yandex)OneRec (Kuaishou)HSTU GR (Meta)
DomaineStreaming musicalVidéo courteGrande plateforme internet, multiples surfaces
Un seul modèle servi remplace la cascadeOui, en test A/BOui, environ 25 % du QPS totalNon, présenté comme une nouvelle architecture pour les modèles de recommandation
Entrées utilisateurUniquement les champs d'événements journalisés, aucune caractéristique conçue à la mainVoies d'« ingénierie de caractéristiques multi-échelle », incluant uid, âge, genreSéquences d'actions utilisateur (transduction séquentielle)
Sortie d'articlesSemantic IDs à 3 niveaux, 3 x 32,000Semantic IDs à 3 niveaux via RQ-KmeansItem IDs
Signal de classementProduit à partir du Teacher Ranker figé de 0.6BRL avec modèle de récompense P-Score (ECPO)Modèle de classement HSTU
Apprentissage par renforcementNon, entièrement superviséOui (ECPO)Non communiqué
Échelle communiquéeHistorique de 8,192 événements, modèle enseignant de 0.6B10x les FLOPs du précédent modèle de classement1,5 trillion de paramètres
Gain en ligne rapporté+4,53 % d'utilisateurs actifs, +6,30 % de temps d'écoute, +11,42 % de likes+0,54 % et +1,24 % de temps passé sur l'application+12,4 % dans les tests A/B en ligne
Code ou poids publicsNonNon mentionné dans le rapportOui, sur GitHub

Sources : Sona, OneRec, HSTU. Les gains en ligne proviennent de plateformes et de métriques différentes, ils ne sont donc pas directement comparables.

Points clés

  • Sona a remplacé plus de 15 générateurs, le pré-classement et le classement par 1 seul modèle servi.
  • Aucune caractéristique conçue à la main : uniquement des événements journalisés et des Semantic IDs appris.
  • Un enseignant de 0,6B entraîne le ranker, puis reste hors du service en production.
  • Test A/B : +4,53 % d'utilisateurs actifs, soit 2,35x le gain antérieur d'Argus.
  • Non déployable en externe : pas de code ni de poids, pas sur tout le trafic.

FAQ

Qu'est-ce que Yandex Sona ?
Sona est un modèle d'IA générative qui combine la génération de candidats et le classement au sein d'un même système. Yandex l'a testé dans une expérience en production réelle de sept jours sur ses enceintes intelligentes, où il a remplacé le pipeline de recommandation multi-étapes existant pour le groupe de test.

En quoi Sona diffère-t-il de OneRec ?
OneRec utilise des voies de caractéristiques utilisateur conçues et un RL avec un modèle de récompense. Sona n'utilise que des champs d'événements journalisés et distille le classement à partir d'un enseignant figé.

Consultez le papier pour tous les détails.

L'article Yandex présente Sona : un recommandeur génératif unique qui remplace toute la cascade de recommandation est applu d'abord sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original