MarkTechPost

Yandex presenta Sona: un recomendador generativo único que reemplaza toda la cascada de recomendación

Un solo transformador ejecutó la generación de candidatos y el ranking en la prueba A/B de Yandex Music sin características diseñadas a mano, aumentando los 'likes' un 11.42%. La entrada Yandex presenta Sona: un…

La mayoría de los recomendadores en producción son cascadas. Los generadores de candidatos alimentan un preclasificador, que a su vez alimenta un clasificador pesado construido sobre cientos de características diseñadas. El Informe Técnico de Sona describe un diseño diferente. Sona es un modelo de IA generativa que une la generación de candidatos y el ranking en un solo sistema, reemplazando las múltiples etapas que se utilizan típicamente en los flujos de recomendación. Yandex probó el modelo en un experimento en vivo de producción de siete días en sus altavoces inteligentes. En una prueba A/B en línea, reemplazó más de 15 generadores de candidatos, la etapa de preclasificación y la etapa de ranking con un único transformador servido.

¿Qué problema resuelve Sona?

Las cascadas dividen una decisión entre modelos entrenados por separado. Cada etapa optimiza su propio objetivo, y el clasificador solo ve lo que las etapas anteriores dejan pasar. La pila anterior de Yandex en la superficie de Yandex Music consumía cientos de características, incluidas señales de Argus, el transformador recomendador anterior de Yandex. Sona coloca la generación de candidatos y el ranking alrededor de una única representación compartida del usuario. El encoder lee el historial del oyente una vez por solicitud. Un decoder genera candidatos. Un Ranking Module los puntúa contra los mismos estados del encoder. Ningún componente utiliza características diseñadas a mano. Las entradas son campos de eventos registrados (ID de pista, ID de artista, duración, likes, tiempo reproducido, indicadores de superficie) y Semantic IDs aprendidos.

En los altavoces inteligentes de Yandex, la reproducción puede comenzar sin que el usuario seleccione primero un artista, género o estado de ánimo. El equipo de investigación describe esto como un entorno de recomendación pura.

Cómo funciona la arquitectura de Sona

1. Tokenizador semántico

Siguiendo la formulación de Semantic ID de Rajput et al., cada pista se convierte en una tupla de 3 códigos discretos. Un LLM multimodal congelado lee el mel-espectrograma de los primeros 90 segundos junto con el título, los artistas y las etiquetas. Funciona solo en modo prefill. Luego, un transformador de refinamiento de 4 capas alinea esas características con el comportamiento de escucha, usando InfoNCE sobre pares de pistas colaborativas. K-means residual cuantiza el resultado en 3 codebooks de 32,000 entradas cada uno. Esto superó una línea base de audio CLMR: Recall@1000 subió de 0.8111 a 0.8524.

2. Encoder con compresión del historial

Sona atiende a 8,192 eventos pasados. La atención completa sobre esa longitud es costosa, por lo que el encoder distribuye la profundidad de manera desigual. Los 2,048 eventos más recientes reciben una pila de autoatención de 7 capas. Los eventos más antiguos pasan solo por atención cruzada y 1 capa de historial completo. El artículo informa que esto conserva la mayor parte de la calidad de la atención completa a aproximadamente la mitad del costo de inferencia.

3. Decoder y Ranking Module

Un decoder de 2 capas emite tuplas de Semantic ID mediante búsqueda de haz restringida con anchura 1,024. Un trie del catálogo bloquea los prefijos inválidos. Cada tupla se expande a todas las pistas que la comparten. El Ranking Module, que consta de cuatro capas de atención cruzada, puntúa entonces esas pistas contra la memoria compartida del encoder.

Entrenamiento: un profesor que nunca se despliega

El Ranking Module aprende de un Teacher Ranker congelado. El profesor es un transformador de 0.6B de parámetros, también sin características diseñadas a mano. Se entrena sobre un año de eventos de interacción en 2 etapas: preentrenamiento de predicción del siguiente elemento y luego ajuste fino de ranking multi-cabeza. Eliminar el preentrenamiento redujo la precisión ponderada por pares de 0.6215 a 0.6153.

El equipo llama a su método de destilación Rollout Distillation. Durante el entrenamiento, el decoder actual genera candidatos por haz. El profesor los puntúa, junto con las impresiones registradas. El Ranking Module hace una regresión sobre esas puntuaciones con el error absoluto medio. La pérdida conjunta es L = L_NTP + L_rollout + L_impression. Ambas pérdidas actualizan el encoder compartido. En el momento de servir, el profesor se elimina.

El entrenamiento permanece en línea. Los eventos se agregan en sesiones dentro de una ventana de 15 minutos, alimentan un entrenador de GPU, y los nuevos pesos llegan al servicio cada 10 minutos. La latencia de extremo a extremo es de 45 minutos en la mediana y de 60 minutos en p99. El servicio se ejecuta en NVIDIA Triton Inference Server con CUDA graphs y alcanza una utilización de FLOPs del modelo del 41%.

Resultados: prueba A/B en línea con tráfico real

El experimento final se ejecutó durante 7 días sobre el 15% de los usuarios seleccionados aleatoriamente por división. Cada cambio a continuación es estadísticamente significativo y relativo al control de producción:

  • Usuarios Activos (métrica principal): +4.53%
  • Tiempo Total de Escucha: +6.30%
  • Likes: +11.42%
  • Comandos de "Repetir": +17.99%
  • Usuarios Muy Comprometidos: +7.37%

Estas ganancias se suman a las mejoras retenidas de despliegues anteriores. En Usuarios Activos, el incremento de Sona es 2.35 veces el aumento de +1.93% que Argus entregó previamente en esta superficie.

Sona vs OneRec vs HSTU: Comparación de Características

Sona no es el primer recomendador generativo de extremo a extremo en producción. El OneRec de Kuaishou ya sirve un único modelo codificador-decodificador. Los HSTU Generative Recommenders de Meta replantearon la recomendación como una transducción secuencial sobre las acciones del usuario en 2024. Lo que combina Sona es un reemplazo completo de la cascada, sin características diseñadas a mano y un rankeador destilado, validado en línea.

CaracterísticaSona (Yandex)OneRec (Kuaishou)HSTU GR (Meta)
DominioStreaming de músicaVideo cortoPlataforma grande de internet, múltiples superficies
Un único modelo servido reemplaza la cascadaSí, en prueba A/BSí, alrededor del 25% del QPS totalNo, se reporta como una nueva arquitectura para modelos de recomendación
Entradas del usuarioSolo campos de eventos registrados, sin características diseñadas a manoRutas de "ingeniería de características multi-escala", incluyendo uid, edad, géneroSecuencias de acciones del usuario (transducción secuencial)
Salida de ítemsIDs Semánticos de 3 niveles, 3 x 32,000IDs Semánticos de 3 niveles mediante RQ-KmeansIDs de ítems
Señal de rankingProducida a partir del Teacher Ranker congelado de 0.6BRL con modelo de recompensa P-Score (ECPO)Modelo de ranking HSTU
Aprendizaje por refuerzoNo, totalmente supervisadoSí (ECPO)No reportado
Escala reportadahistorial de 8,192 eventos, modelo profesor de 0.6B10x los FLOPs del modelo de ranking anterior1.5 billones (trillion) de parámetros
Ganancia en línea reportada+4.53% usuarios activos, +6.30% tiempo de escucha, +11.42% me gusta+0.54% y +1.24% tiempo de uso de la app+12.4% en pruebas A/B en línea
Código o pesos públicosNoNo se menciona en el informeSí, GitHub

Fuentes: Sona, OneRec, HSTU. Las ganancias en línea provienen de diferentes plataformas y métricas, por lo que no son directamente comparables.

Conclusiones clave

  • Sona reemplazó más de 15 generadores, la preselección y el ranking con 1 modelo servido.
  • Sin características diseñadas a mano: solo eventos registrados y Semantic IDs aprendidos.
  • Un maestro de 0.6B entrena el ranker y luego queda fuera del servicio.
  • Prueba A/B: +4.53% usuarios activos, 2.35 veces la ganancia previa de Argus.
  • No desplegable externamente: sin código ni pesos, no en todo el tráfico.

FAQ

¿Qué es Yandex Sona?
Sona es un modelo de IA generativa que combina la generación de candidatos y el ranking dentro de un solo sistema. Yandex lo probó en un experimento de producción en vivo de siete días en sus altavoces inteligentes, donde reemplazó la tubería de recomendación multi-etapa existente para el grupo de prueba.

¿En qué se diferencia Sona de OneRec?
OneRec utiliza rutas de características de usuario diseñadas y RL con un modelo de recompensa. Sona utiliza solo campos de eventos registrados y destila el ranking de un maestro congelado.

Consulta el artículo (Paper) para todos los detalles.

La entrada Yandex presenta Sona: un recomendador generativo único que reemplaza toda la cascada de recomendación apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original