AIbaseActualizado el

¿Cómo es posible que el gran modelo de audio no recuerde quién habla? El nuevo estándar VoxMem de la Universidad de Moheang revela: bajo un…

El equipo conjunto de la Universidad de Melbourne y la Universidad de Nueva Gales del Sur lanzó el benchmark de evaluación de IA vocal VoxMem, con el fin de comprobar si este puede recordar la identidad, el tono y el…

Cuando la IA de voz se involucra en una conversación real que dura horas y consta de varias docenas de rondas, ¿puede realmente recordar “¿quién dijo esta frase, con qué tono y qué sonidos hay en el fondo”? Un equipo conjunto de la Universidad de Melbourne y la Universidad de New South Wales cree que los evaluadores existentes no pueden responder a esta pregunta, por lo que presentaron un benchmark VoxMem especialmente diseñado para atacar este punto débil.

Primero, destaparon dos defectos graves en los antiguos análisis: primero, se enfocan únicamente en el contenido del texto que se transcribe, descartando todo lo relacionado con la información de identidad, las pistas emocionales y los sonidos ambientales que se esconden en el sonido; segundo, no pueden separar por separado la variable “cuánto tiempo ha durado”, por lo que el rendimiento del modelo es malo. No se sabe si es debido a una falta de memoria o a la longitud de los datos. La estrategia de VoxMem es establecer un método de clasificación bidimensional de “pruebas acústicas × operaciones de memoria”, descomponiendo las dimensiones de la investigación en componentes ortogonales, cubriendo 15 combinaciones. Además, todos los ejercicios se mantienen sin cambios bajo diferentes longitudes históricas de 8K a 64K: es como si se girara únicamente el botón “longitud del diálogo”, mientras que todo lo demás queda bloqueado, permitiendo que los cambios en el efecto de la memoria se atribuyan claramente a la longitud.

El volumen de este benchmark no es pequeño: hay un total de 3196 ejemplos de evaluación y 34743 conversaciones de voz, sumando aproximadamente 177 horas de audio, lo suficiente para simular una larga conversación en múltiples rondas. En cuanto a los resultados prácticos de los 15 grandes modelos de audio dominantes, fueron bastante decepcionantes. Con una longitud de contexto de 32K, la precisión general de todos los modelos no superó el 40%. Lo más interesante es la dirección desequilibrada: la memoria semántica del modelo sobre “lo que se dice” es claramente más fuerte que la memoria de las tres clases de información natural de los sonidos, como la identidad del hablante, las pistas paralíricas (tono, emoción) y el sonido ambiental; en particular, la precisión en seguir los cambios en el tono y el sonido de fondo es muy baja, básicamente en un estado de fracaso. Además, a medida que aumenta la longitud de la historia, la precisión en la memoria de todas las clases de información disminuye constantemente.

El equipo tomó una decisión basada en esto: el cuello de botella en la memoria vocal de los grandes modelos de audio actuales se encuentra principalmente en los pasos de “reconocimiento, localización y asociación de información”, y no en las operaciones de razonamiento en sí. En otras palabras, el modelo no no piensa, sino que ni siquiera capta correctamente los hechos básicos como “quién, cuándo y cómo dijo qué”. Por lo tanto, es imposible llevar a cabo razonamientos superiores. El conjunto de estándares VoxMem es como cambiar un termómetro más fino cuando se mide la temperatura de una IA de voz, obligando a la industria a reconocer un hecho que durante mucho tiempo ha sido ocultado por la transcripción de texto: entender las palabras no significa recordar a las personas, el tono y todo el mundo.

Fuente original

AIbase

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original