AIbaseMis à jour le

Le grand modèle audio ne se souvient pas qui parle ? Le nouveau standard VoxMem de l'Université de MoFe révèle : sous 32K contexte, tout le…

L’équipe conjointe de l’Université de Melbourne et de l’Université de New South Wales a lancé le benchmark de évaluation de l’IA vocale VoxMem, afin de déterminer si cette technologie peut mémoriser l’identité de la…

Lorsque l’IA vocale est impliquée dans une conversation réelle qui dure plusieurs heures et comporte des dizaines de échanges, peut-elle vraiment se souvenir « de qui a dit cette phrase, du ton utilisé et des sons présents dans le contexte » ? Une équipe conjointe de l’Université de Melbourne et de l’Université de New South Wales estime que les évaluations existantes ne peuvent pas répondre à cette question, et a donc développé un benchmark VoxMem spécifiquement conçu pour toucher ce point faible.

Ils ont d’abord révélé deux problèmes majeurs des anciens tests : premièrement, ils se concentrent uniquement sur le contenu textuel produit par la transcription, oubliant les informations identitaires, les signaux émotionnels et les sons environnants qui se trouvaient dans les voix ; deuxièmement, il est impossible de séparer individuellement la variable « longueur de l’histoire », ce qui entraîne de mauvaises performances du modèle. On ne sait pas si c’est à cause d’une mauvaise mémoire ou du volume trop important qui affecte les résultats. La méthode de VoxMem consiste à créer une classification bidimensionnelle de « preuves acoustiques × opérations de mémorisation », en décomposant les dimensions d’examen orthogonally, couvrant 15 combinaisons. De plus, tous les sujets restent inchangés pour des longueurs historiques allant de 8K à 64K – c’est comme si l’on tournait uniquement le bouton « longueur du dialogue », tout le reste étant verrouillé, permettant ainsi d’attribuer clairement les variations de l’effet mémoriel au facteur de la longueur.

La taille de cet ensemble de références n’est pas négligeable : 3196 exemples d’évaluation et 34743 conversations vocales, pour un total d’environ 177 heures d’audio, suffisantes pour simuler une longue conversation multiple. Les résultats mesurés pour les 15 grands modèles audio majeurs sont plutôt décevants. À une longueur de contexte de 32K, la précision globale de tous les modèles ne dépasse pas le 40 %. Ce qui est encore plus intéressant, c’est la tendance des domaines déficients : la mémoire sémantique du modèle concernant « ce qu’il dit » est nettement plus forte que la mémoire des informations naturelles liées à l’identité de l’interlocuteur, aux indices paralinguistiques (ton, émotion) et au bruit environnant ; en particulier, la précision dans le suivi des variations du ton et des changements du bruit de fond est très faible, ce qui donne une impression de perte de temps. De plus, à mesure que la longueur de l’histoire augmente, la précision de la mémoire des différentes informations diminue progressivement.

L’équipe a fait ce jugement : le problème de stockage de la voix des grands modèles audio actuels réside principalement dans les étapes de « reconnaissance, localisation et association des informations », et non dans l’opération de raisonnement lui-même. En d’autres termes, le modèle ne fait pas de pensées, mais il ne parvient même pas à saisir correctement les faits fondamentaux tels que « qui a dit quoi, à quel moment et de quelle manière », ce qui rend naturellement impossible toute raisonnement supérieur. Le système de référence VoxMem, c’est comme remplacer un thermomètre plus fin lorsqu’on mesure la température de l’IA vocale, et forcer le secteur à reconnaître une réalité longtemps cachée par les transcriptions textuelles : comprendre les mots ne signifie pas se souvenir des personnes, du ton ou de l’univers entier.

Source originale

AIbase

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original