ほとんどの本番レコメンダーはカスケード構成です。候補生成器がプリランカーに供給し、プリランカーが数百のエンジニアリングされた特徴量に基づく重量級ランカーに供給します。Yandexの Sona Technical Report は、異なる設計を説明しています。Sonaは、候補生成とランキングを単一のシステムに統合し、レコメンデーションパイプラインで通常使われる複数のステージを置き換える生成AIモデルです。Yandexはこのモデルを、スマートスピーカー上で7日間のライブ本番実験でテストしました。オンラインA/Bテストでは、15以上の候補生成器、プリランキングステージ、ランキングステージを、提供される1つのトランスフォーマーで置き換えました。
Sonaはどんな問題を解決するのか?
カスケードは1つの決定を、別々に訓練されたモデルに分割します。各ステージは独自の目的関数を最適化し、ランカーは上流ステージが通したものしか見ることができません。YandexのYandex Musicサーフェスにおける以前のスタックは、Yandexの以前のレコメンダートランスフォーマーである Argusからのシグナルを含む数百の特徴量を消費していました。Sonaは、候補生成とランキングを1つの共有ユーザー表現を中心に据えます。エンコーダーはリスナーの履歴をリクエストごとに1回読み込みます。デコーダーが候補を生成します。ランキングモジュールが、同じエンコーダー状態に対してそれらをスコアリングします。どのコンポーネントも手作りの特徴量を使用しません。入力はログに記録されたイベントフィールド(トラックID、アーティストID、再生時間、いいね、再生時間、サーフェスフラグ)と学習されたセマンティックIDです。
Yandexのスマートスピーカーでは、ユーザーがアーティスト、ジャンル、ムードを先に選択しなくても再生を開始できます。研究チームはこれを純粋レコメンデーション設定と呼んでいます。
Sonaのアーキテクチャの仕組み
1. セマンティックトークナイザー
Rajputらによる セマンティックIDの定式化に従い、すべてのトラックは3つの離散コードのタプルになります。凍結されたマルチモーダルLLMが、タイトル、アーティスト、タグとともに最初の90秒のメルスペクトログラムを読み込みます。これはprefill-onlyモードで実行されます。その後、4層のリファインメントトランスフォーマーが、協調トラックペア上のInfoNCEを用いて、これらの特徴量をリスニング行動と整合させます。残差K-meansが結果を、それぞれ32,000エントリの3つのコードブックに量子化します。これはCLMR音声ベースラインを上回りました:Recall@1000が0.8111から0.8524に上昇しました。
2. 履歴圧縮を備えたエンコーダー
Sonaは8,192件の過去のイベントに注意を向けます。その長さ全体にわたるフルアテンションは高コストなため、エンコーダーは深さを不均等に配分します。直近の2,048イベントには7層のセルフアテンションスタックを割り当てます。それより古いイベントは、クロスアテンションと1つのフル履歴層のみを通過します。論文によると、これにより推論コストを約半分に抑えつつ、フルアテンションの品質の大部分が維持されるとしています。
3. デコーダーとランキングモジュール
2層のデコーダーが、幅1,024の制約付きビームサーチを通じてセマンティックIDタプルを出力します。カタログのトライが無効なプレフィックスをブロックします。各タプルはそれを共有するすべてのトラックに展開されます。4つのクロスアテンション層からなるランキングモジュールが、共有エンコーダーメモリに対してこれらのトラックをスコアリングします。
訓練:デプロイされない教師モデル
ランキングモジュールは、凍結された教師ランカーから学習します。教師は0.6Bパラメータのトランスフォーマーで、これも手作りの特徴量を使用しません。1年分のエンゲージメントイベントで2段階(次アイテム予測による事前学習、その後のマルチヘッドランキングによるファインチューニング)で訓練されます。事前学習を除くと、重み付きペア精度が0.6215から0.6153に低下しました。
チームはこの蒸留手法をRollout Distillationと呼んでいます。訓練中、現在のデコーダーがビーム候補を生成します。教師が、ログに記録されたインプレッションとともにそれらをスコアリングします。ランキングモジュールは、平均絶対誤差でそれらのスコアに回帰します。結合損失は L = L_NTP + L_rollout + L_impression です。両方の損失が共有エンコーダーを更新します。提供時には教師は削除されます。
訓練はオンラインで継続されます。イベントは15分のウィンドウでセッションに集約され、GPUトレーナーに供給され、新しい重みが10分ごとに提供環境へ届きます。エンドツーエンドのレイテンシは中央値で45分、p99で60分です。提供環境は NVIDIA Triton Inference Server 上でCUDAグラフとともに実行され、モデルFLOPS利用率41%に到達します。
結果:ライブトラフィックでのオンラインA/Bテスト
最終実験は、各スプリットごとにランダムに選ばれたユーザーの15%を対象に7日間実施されました。以下のすべての変化は統計的に有意であり、本番のコントロール群との相対値です:
- アクティブユーザー (主要指標):+4.53%
- 総リスニング時間: +6.30%
- いいね: +11.42%
- 「リピート」コマンド: +17.99%
- 深く関与するユーザー: +7.37%
これらの改善は、以前の展開で得られた改善の上に積み重なります。アクティブユーザーに関して、Sonaの向上は、このサーフェスで以前Argusがもたらした+1.93%の増加分の2.35倍です。
Sona vs OneRec vs HSTU: 機能比較
Sona は本番環境で稼働する初のエンドツーエンドの生成系レコメンダーではありません。Kuaishou の OneRec はすでに単一のエンコーダ・デコーダモデルを提供しています。Meta の HSTU Generative Recommenders は 2024 年に、レコメンデーションをユーザーアクション上の逐次変換として捉え直しました。Sona が組み合わせたのは、カスケードの完全な置き換え、手作業による特徴量エンジニアリングの排除、そしてオンラインで検証された蒸留ランカーです。
| 特徴 | Sona (Yandex) | OneRec (Kuaishou) | HSTU GR (Meta) |
| ドメイン | 音楽ストリーミング | ショート動画 | 大規模インターネットプラットフォーム、複数のサービス面 |
| 提供される単一モデルによるカスケードの置き換え | はい、A/B テストにおいて | はい、全体の QPS の約 25% | いいえ、レコメンデーションモデル向けの新アーキテクチャとして報告 |
| ユーザー入力 | ログに記録されたイベントフィールドのみ、手作業で設計された特徴量なし | uid、年齢、性別を含む「マルチスケール特徴量エンジニアリング」の経路 | ユーザーアクション系列(逐次変換) |
| アイテム出力 | 3 レベルの Semantic ID、3 x 32,000 | RQ-Kmeans による 3 レベルの Semantic ID | アイテム ID |
| ランキングシグナル | 凍結された 0.6B Teacher Ranker から生成 | P-Score 報酬モデルを用いた強化学習 (ECPO) | HSTU ランキングモデル |
| 強化学習 | いいえ、完全に教師あり | はい (ECPO) | 報告なし |
| 規模は報告あり | 8,192イベントの履歴、0.6Bの教師モデル | 従来のランキングモデルの10倍のFLOPs | 1.5兆パラメータ |
| オンラインで報告された利益 | アクティブユーザー +4.53%、リスニング時間 +6.30%、いいね +11.42% | +0.54%および+1.24%のアプリ滞在時間 | オンラインA/Bテストで+12.4% |
| 公開コードまたは重み | いいえ | レポートには記載されていません | はい、GitHubです |
出典: Sona, OneRec, HSTU。オンラインの数字は異なるプラットフォームや指標に基づくものであるため、直接比較することはできない。
重要ポイント
- Sonaは15以上のジェネレーター、プリランキング、ランキングを、提供される1つのモデルに置き換えました。
- 手作業による特徴量エンジニアリングは不要:ログされたイベントと学習されたセマンティックIDのみを使用します。
- 0.6Bのティーチャーがランカーを訓練し、その後はサービングには関与しない。
- A/Bテスト:アクティブユーザー +4.53%、Argusの従来の改善幅の2.35倍。
- 外部に展開不可:コードや重みは公開されておらず、全トラフィックには適用されていない。
FAQ
Yandex Sonaとは何ですか?
Sonaは、候補生成とランキングを1つのシステムに統合した生成AIモデルです。Yandexはスマートスピーカー上で7日間の実運用実験としてこれをテストし、テストグループ向けに既存の多段階レコメンデーションパイプラインを置き換えました。
SonaはOneRecとどう違うのですか?
OneRecは工学的に設計されたユーザー特徴パスと、報酬モデルを用いた強化学習(RL)を使用します。Sonaはログ記録されたイベントフィールドのみを使用し、凍結された教師モデルからランキングを蒸留します。
以下をご覧ください 論文 詳細についてはこちらをご覧ください。
この投稿 Yandex、Sonaを発表:推薦カスケード全体を置き換える単一の生成型レコメンダー 最初に掲載されたのは MarkTechPost.