Die meisten Recommender in der Produktion sind Kaskaden. Kandidatengeneratoren speisen einen Pre-Ranker, der wiederum einen schweren Ranker speist, der auf Hunderten von konstruierten Merkmalen basiert. Yandex’ Sona Technical Report beschreibt einen anderen Entwurf. Sona ist ein generatives KI-Modell, das Kandidatengenerierung und Ranking in ein einziges System zusammenführt und die mehreren Stufen ersetzt, die typischerweise in Empfehlungspipelines verwendet werden. Yandex testete das Modell in einem siebentägigen Live-Produktionsexperiment auf seinen Smart Speakern. In einem Online-A/B-Test ersetzte es mehr als 15 Kandidatengeneratoren, die Pre-Ranking-Stufe und die Ranking-Stufe durch einen einzigen ausgelieferten Transformer.
Welches Problem löst Sona?
Kaskaden verteilen eine Entscheidung auf separat trainierte Modelle. Jede Stufe optimiert ihr eigenes Ziel, und der Ranker sieht nur, was die vorgelagerten Stufen durchlassen. Yandex’ früherer Stack auf der Yandex-Music-Oberfläche verbrauchte Hunderte von Merkmalen, darunter Signale von Argus, Yandex’ früherem Recommender-Transformer. Sona legt Kandidatengenerierung und Ranking um eine gemeinsame Benutzerrepräsentation. Der Encoder liest den Verlauf des Hörers einmal pro Anfrage. Ein Decoder generiert Kandidaten. Ein Ranking Module bewertet sie anhand derselben Encoder-Zustände. Keine Komponente verwendet handkonstruierte Merkmale. Eingaben sind protokollierte Ereignisfelder (Track-ID, Künstler-ID, Dauer, Likes, Spielzeit, Surface-Flags) und gelernte Semantic IDs.
Auf Yandex-Smart-Speakern kann die Wiedergabe beginnen, ohne dass der Benutzer zuvor einen Künstler, ein Genre oder eine Stimmung auswählt. Das Forschungsteam beschreibt dies als eine Pure-Recommendation-Einstellung.
Wie Sonas Architektur funktioniert
1. Semantischer Tokenizer
Nach der Semantic-ID-Formulierung von Rajput et al.wird jeder Track zu einem Tupel aus 3 diskreten Codes. Ein eingefrorenes multimodales LLM liest das Mel-Spektrogramm der ersten 90 Sekunden zusammen mit Titel, Künstlern und Tags. Es läuft im Prefill-only-Modus. Ein 4-Schicht-Refinement-Transformer richtet diese Merkmale dann an Hörverhalten aus, indem er InfoNCE auf kollaborativen Track-Paaren verwendet. Residual-K-means quantisiert das Ergebnis in 3 Codebücher mit jeweils 32,000 Einträgen. Dies schlug eine CLMR-Audio-Baseline: Recall@1000 stieg von 0.8111 auf 0.8524.
2. Encoder mit Verlaufskompression
Sona beachtet 8,192 vergangene Ereignisse. Volle Aufmerksamkeit über diese Länge ist teuer, daher verteilt der Encoder die Tiefe ungleichmäßig. Die letzten 2,048 Ereignisse erhalten einen 7-Schicht-Self-Attention-Stack. Ältere Ereignisse durchlaufen nur Cross-Attention und 1 vollständige Verlaufsschicht. Das Paper berichtet, dass dies den Großteil der Qualität voller Aufmerksamkeit bei etwa der Hälfte der Inferenzkosten bewahrt.
3. Decoder und Ranking Module
Ein 2-Schicht-Decoder erzeugt Semantic-ID-Tupel durch eingeschränkte Strahlensuche mit Breite 1,024. Ein Katalog-Trie blockiert ungültige Präfixe. Jedes Tupel expandiert zu jedem Track, der es teilt. Das Ranking Module, das aus vier Cross-Attention-Schichten besteht, bewertet dann diese Tracks anhand des gemeinsamen Encoder-Gedächtnisses.
Training: Ein Lehrer, der nie ausgeliefert wird
Das Ranking Module lernt von einem eingefrorenen Teacher Ranker. Der Lehrer ist ein Transformer mit 0.6B Parametern, ebenfalls ohne handkonstruierte Merkmale. Er wird auf einem Jahr Engagement-Ereignissen in 2 Stufen trainiert: Next-Item-Prediction-Pre-Training, dann Multi-Head-Ranking-Fine-Tuning. Das Entfernen des Pre-Trainings senkte die gewichtete Paargenauigkeit von 0.6215 auf 0.6153.
Das Team nennt seine Destillationsmethode Rollout Distillation. Während des Trainings erzeugt der aktuelle Decoder Beam-Kandidaten. Der Lehrer bewertet sie zusammen mit protokollierten Impressionen. Das Ranking Module regressiert auf diese Scores mit mittlerem absolutem Fehler. Der gemeinsame Verlust ist L = L_NTP + L_rollout + L_impression. Beide Verluste aktualisieren den gemeinsamen Encoder. Zur Auslieferungszeit wird der Lehrer entfernt.
Das Training bleibt online. Ereignisse werden über ein 15-minütiges Fenster zu Sitzungen aggregiert, füttern einen GPU-Trainer, und neue Gewichte erreichen die Auslieferung alle 10 Minuten. Die End-to-End-Latenz beträgt 45 Minuten im Median und 60 Minuten bei p99. Die Auslieferung läuft auf dem NVIDIA Triton Inference Server mit CUDA-Graphen und erreicht eine Modellauslastung von 41% der FLOPs.
Ergebnisse: Online-A/B-Test mit Live-Traffic
Das abschließende Experiment lief 7 Tage lang auf 15% der zufällig ausgewählten Benutzer pro Split. Jede der folgenden Änderungen ist statistisch signifikant und relativ zur Produktions-Kontrolle:
- Aktive Benutzer (primäre Metrik): +4.53%
- Gesamte Hörzeit: +6.30%
- Likes: +11.42%
- „Repeat“-Befehle: +17.99%
- Tief engagierte Nutzer: +7.37%
Diese Gewinne summieren sich zu den Verbesserungen, die aus früheren Deployments beibehalten wurden. Bei Active Users beträgt Sonas Uplift das 2.35-Fache des Zuwachses von +1.93 %, den Argus zuvor auf dieser Oberfläche erzielt hatte.
Sona vs. OneRec vs. HSTU: Funktionsvergleich
Sona ist nicht der erste End-to-End-generative Recommender im Produktiveinsatz. Kuaishous OneRec bedient bereits ein einzelnes Encoder-Decoder-Modell. Metas HSTU Generative Recommenders haben 2024 die Empfehlung als sequentielle Transduktion über Nutzeraktionen neu definiert. Was Sona kombiniert, ist ein vollständiger Ersatz der Cascade, keine handkonstruierten Features und ein destillierter Ranker, online validiert.
| Feature | Sona (Yandex) | OneRec (Kuaishou) | HSTU GR (Meta) |
| Domain | Music-Streaming | Kurzvideo | Große Internetplattform, mehrere Oberflächen |
| Ein ausgeliefertes Modell ersetzt die Cascade | Ja, im A/B-Test | Ja, etwa 25% des gesamten QPS | Nein, als neue Architektur für Empfehlungsmodelle berichtet |
| Nutzereingaben | Nur protokollierte Ereignisfelder, keine handkonstruierten Features | Pfade für „Multi-scale feature engineering“, einschließlich uid, Alter, Geschlecht | Nutzeraktionssequenzen (sequentielle Transduktion) |
| Item-Ausgabe | 3-stufige Semantic IDs, 3 x 32.000 | 3-stufige Semantic IDs via RQ-Kmeans | Item-IDs |
| Ranking-Signal | Erzeugt aus eingefrorenem 0.6B Teacher Ranker | RL mit P-Score-Belohnungsmodell (ECPO) | HSTU-Ranking-Modell |
| Reinforcement Learning | Nein, vollständig überwacht | Ja (ECPO) | Nicht berichtet |
| Skala berichtet | 8,192-Ereignis-Historie, 0.6B-Lehrermodell | 10x FLOPs des vorherigen Ranking-Modells | 1.5 Billionen Parameter |
| Berichteter Online-Zuwachs | +4.53 % aktive Nutzer, +6.30 % Hörzeit, +11.42 % Likes | +0.54 % und +1.24 % App-Verweildauer | +12.4 % in Online-A/B-Tests |
| Öffentlicher Code oder Gewichte | Nein | Nicht im Bericht | Ja, GitHub |
Quellen: Sona, OneRec, HSTU. Online-Zuwächse stammen von unterschiedlichen Plattformen und Metriken und sind daher nicht direkt vergleichbar.
Kernerkenntnisse
- Sona ersetzte 15+ Generatoren, Pre-Ranking und Ranking durch 1 ausgeliefertes Modell.
- Keine handkonstruierten Merkmale: nur protokollierte Ereignisse und gelernte Semantic IDs.
- Ein 0.6B-Lehrer trainiert den Ranker und bleibt dann außerhalb des Betriebs.
- A/B-Test: +4.53 % aktive Nutzer, 2.35x des früheren Zuwachses von Argus.
- Nicht extern einsetzbar: kein Code oder Gewichte, nicht auf dem gesamten Datenverkehr.
FAQ
Was ist Yandex Sona?
Sona ist ein generatives KI-Modell, das Kandidatengenerierung und Ranking in einem einzigen System vereint. Yandex testete es in einem siebentägigen Live-Produktionsexperiment an seinen Smart Speakern, wo es die bestehende mehrstufige Empfehlungspipeline für die Testgruppe ersetzte.
Wie unterscheidet sich Sona von OneRec?
OneRec verwendet konstruierte Nutzermerkmal-Pfade und RL mit einem Belohnungsmodell. Sona verwendet nur protokollierte Ereignisfelder und destilliert das Ranking aus einem eingefrorenen Lehrer.
Schauen Sie sich die Arbeit für alle Details an.
Der Beitrag Yandex stellt Sona vor: Ein einzelner generativer Empfehlungsmechanismus, der die gesamte Empfehlungskaskade ersetzt erschien zuerst auf MarkTechPost.