MarkTechPost

Yandex, 전체 추천 캐스케이드를 대체하는 단일 생성형 추천기 Sona 공개

하나의 트랜스포머가 Yandex Music의 A/B 테스트에서 후보 생성과 랭킹을 수작업 엔지니어링 피처 없이 수행하여 좋아요를 11.42% 증가시켰습니다. Yandex Introduces Sona: A Single Generative Recommender That Replaces Entire Recommendation Cascade 글은 MarkTechPost 에 처음 게재되었습니다.

대부분의 프로덕션 추천기는 캐스케이드 방식입니다. 후보 생성기가 사전 랭커에 입력을 공급하고, 사전 랭커는 수백 개의 엔지니어링된 피처를 기반으로 구축된 무거운 랭커에 입력을 공급합니다. Yandex의 Sona 기술 보고서 는 다른 설계를 설명합니다. Sona는 후보 생성과 랭킹을 단일 시스템으로 통합하여 추천 파이프라인에서 일반적으로 사용되는 여러 단계를 대체하는 생성형 AI 모델입니다. Yandex는 자사 스마트 스피커에서 7일간의 실시간 프로덕션 실험으로 이 모델을 테스트했습니다. 온라인 A/B 테스트에서 15개 이상의 후보 생성기, 사전 랭킹 단계, 랭킹 단계를 서빙되는 하나의 트랜스포머로 대체했습니다.

Sona는 어떤 문제를 해결하는가?

캐스케이드는 하나의 결정을 별도로 학습된 모델들로 분할합니다. 각 단계는 자체 목적 함수를 최적화하며, 랭커는 상위 단계가 통과시킨 내용만 볼 수 있습니다. Yandex Music 서피스에서 이전에 사용한 Yandex의 스택은 Argus를 포함한 수백 개의 피처, 즉 Yandex의 이전 추천 트랜스포머의 신호들을 소비했습니다. Sona는 후보 생성과 랭킹을 하나의 공유 사용자 표현 주변에 배치합니다. 인코더는 요청당 한 번 청취자의 이력을 읽습니다. 디코더가 후보를 생성합니다. 랭킹 모듈은 동일한 인코더 상태를 기준으로 후보를 채점합니다. 어떤 구성 요소도 수작업 엔지니어링 피처를 사용하지 않습니다. 입력은 로그된 이벤트 필드(트랙 ID, 아티스트 ID, 길이, 좋아요, 재생 시간, 서피스 플래그)와 학습된 Semantic ID입니다.

Yandex 스마트 스피커에서는 사용자가 먼저 아티스트, 장르, 분위기를 선택하지 않아도 재생이 시작될 수 있습니다. 연구팀은 이를 순수 추천(pure-recommendation) 설정이라고 설명합니다.

Sona의 아키텍처 작동 방식

1. Semantic 토크나이저

Rajput 등의 Semantic ID 공식화를 따라, 모든 트랙은 3개의 이산 코드 튜플이 됩니다. 동결된 멀티모달 LLM이 첫 90초의 멜 스펙트로그램과 제목, 아티스트, 태그를 함께 읽습니다. 이는 prefill-only 모드로 실행됩니다. 그런 다음 4계층 정제(refinement) 트랜스포머가 협업 트랙 쌍에 InfoNCE를 사용하여 이러한 피처를 청취 행동과 정렬합니다. Residual K-means는 결과를 각 32,000개 항목을 가진 3개의 코드북으로 양자화합니다. 이는 CLMR 오디오 베이스라인을 능가했습니다: Recall@1000이 0.8111에서 0.8524로 상승했습니다.

2. 이력 압축을 갖춘 인코더

Sona는 8,192개의 과거 이벤트에 어텐션을 적용합니다. 해당 길이 전체에 대한 풀 어텐션은 비용이 많이 들기 때문에, 인코더는 깊이를 균등하게 사용하지 않습니다. 최근 2,048개 이벤트는 7계층 셀프 어텐션 스택을 거칩니다. 더 오래된 이벤트는 크로스 어텐션과 1개의 전체 이력 계층만 통과합니다. 논문에 따르면 이는 추론 비용 약 절반으로 풀 어텐션 품질의 대부분을 유지합니다.

3. 디코더와 랭킹 모듈

2계층 디코더가 폭 1,024의 제약된 빔 서치를 통해 Semantic ID 튜플을 생성합니다. 카탈로그 트라이가 유효하지 않은 접두어를 차단합니다. 각 튜플은 해당 튜플을 공유하는 모든 트랙으로 확장됩니다. 그런 다음 4개의 크로스 어텐션 계층으로 구성된 랭킹 모듈이 이 트랙들을 공유 인코더 메모리를 기준으로 채점합니다.

학습: 출시되지 않는 교사 모델

랭킹 모듈은 동결된 교사 랭커(Teacher Ranker)로부터 학습합니다. 교사 모델은 0.6B 파라미터 트랜스포머로, 역시 수작업 엔지니어링 피처가 없습니다. 교사 모델은 2단계로 1년치 참여 이벤트에 대해 학습됩니다: 다음 항목 예측 사전 학습, 그 후 멀티헤드 랭킹 파인튜닝입니다. 사전 학습을 제거하면 가중 쌍 정확도가 0.6215에서 0.6153으로 하락했습니다.

팀은 자신들의 증류 방법을 Rollout Distillation이라고 부릅니다. 학습 중 현재 디코더가 빔 후보를 생성합니다. 교사 모델이 로그된 노출(impression)과 함께 이들을 채점합니다. 랭킹 모듈은 평균 절대 오차로 해당 점수에 회귀합니다. 전체 손실은 L = L_NTP + L_rollout + L_impression입니다. 두 손실 모두 공유 인코더를 업데이트합니다. 서빙 시점에는 교사 모델이 제거됩니다.

학습은 온라인 상태로 유지됩니다. 이벤트는 15분 창에 걸쳐 세션으로 집계되어 GPU 트레이너에 공급되며, 새 가중치가 10분마다 서빙에 도달합니다. 엔드투엔드 지연 시간은 중앙값 기준 45분, p99 기준 60분입니다. 서빙은 CUDA 그래프와 함께 NVIDIA Triton Inference Server 에서 실행되며 41%의 모델 FLOPs 활용률에 도달합니다.

결과: 실시간 트래픽에 대한 온라인 A/B 테스트

최종 실험은 각 분할당 무작위로 선정된 사용자의 15%를 대상으로 7일간 진행되었습니다. 아래의 모든 변화는 통계적으로 유의미하며 프로덕션 대조군 대비 수치입니다:

  • 활성 사용자 (기본 지표): +4.53%
  • 총 청취 시간: +6.30%
  • 좋아요: +11.42%
  • ‘반복’ 명령: +17.99%
  • 깊이 참여하는 사용자: +7.37%

이러한 향상은 이전 배포에서 유지된 개선 사항 위에 누적됩니다. 활성 사용자(Active Users) 측면에서 Sona의 향상은 이 서피스에서 이전에 Argus가 제공한 +1.93% 증분의 2.35배입니다.

Sona vs OneRec vs HSTU: 기능 비교

Sona는 프로덕션 환경에 적용된 최초의 엔드투엔드 생성형 추천 시스템은 아닙니다. Kuaishou의 OneRec 은 이미 단일 인코더-디코더 모델을 서비스하고 있습니다. Meta의 HSTU Generative Recommenders 는 2024년에 추천을 사용자 행위에 대한 순차적 변환(sequential transduction) 문제로 재정의했습니다. Sona가 결합한 것은 전체 캐스케이드 대체, 수작업 특징 엔지니어링 없음, 그리고 온라인에서 검증된 증류(distilled) 랭커입니다.

특징Sona (Yandex)OneRec (Kuaishou)HSTU GR (Meta)
도메인음악 스트리밍짧은 동영상대형 인터넷 플랫폼, 다중 서비스면
하나의 서비스 모델이 캐스케이드를 대체예, A/B 테스트에서예, 전체 QPS의 약 25%아니요, 추천 모델을 위한 새로운 아키텍처로 보고됨
사용자 입력로그된 이벤트 필드만 사용, 수작업 특징 없음uid, 연령, 성별을 포함한 "멀티스케일 특징 엔지니어링" 경로사용자 행동 시퀀스 (순차적 변환)
아이템 출력3단계 Semantic ID, 3 x 32,000RQ-Kmeans를 통한 3단계 Semantic ID아이템 ID
랭킹 신호동결된 0.6B Teacher Ranker에서 생성P-Score 보상 모델을 사용한 강화학습 (ECPO)HSTU 랭킹 모델
강화학습아니요, 완전 지도학습예 (ECPO)보고되지 않음
규모 보고됨8,192 이벤트 히스토리, 0.6B teacher기존 랭킹 모델 대비 10배 FLOPs1.5조 개의 파라미터
보도된 온라인 수익활성 사용자 +4.53%, 청취 시간 +6.30%, 좋아요 +11.42%+0.54% 및 +1.24% 앱 체류 시간온라인 A/B 테스트에서 +12.4%
공개 코드 또는 가중치아니오보고서에 없음네, GitHub입니다

출처: 소나(Sona), OneRec, HSTU. 온라인 성과는 서로 다른 플랫폼과 지표를 기준으로 하므로 직접 비교할 수 없습니다.

핵심 요약

  • Sona는 15개 이상의 제너레이터, 사전 랭킹, 그리고 랭킹을 1개의 서빙 모델로 대체했습니다.
  • 수작업으로 설계된 특징 없음: 로그된 이벤트와 학습된 Semantic ID만 사용합니다.
  • 0.6B teacher가 ranker를 훈련시킨 뒤, 서빙에는 관여하지 않습니다.
  • A/B 테스트: 활성 사용자 +4.53%, Argus의 이전 성과 대비 2.35배.
  • 외부 배포 불가: 코드나 가중치 없음, 전체 트래픽에는 적용되지 않음.

FAQ

Yandex Sona란 무엇인가요?
Sona는 후보 생성과 랭킹을 하나의 시스템 안에서 결합한 생성형 AI 모델입니다. Yandex는 자사 스마트 스피커에서 7일간의 실시간 프로덕션 실험으로 이를 테스트했으며, 실험 중 테스트 그룹의 기존 다단계 추천 파이프라인을 대체했습니다.

Sona는 OneRec과 어떻게 다른가요?
OneRec는 설계된 사용자 특성 경로와 보상 모델을 활용한 강화학습(RL)을 사용합니다. Sona는 로그된 이벤트 필드만 사용하고 동결된 교사(frozen teacher)로부터 랭킹을 증류합니다.

다음을 확인해 보세요 논문 자세한 내용은 원문을 참조하십시오.

해당 게시물 Yandex, 전체 추천 캐스케이드를 대체하는 단일 생성형 추천기 'Sona' 공개 최초 발행: MarkTechPost.

원문 출처

MarkTechPost

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요