AIbase更新于 原文 · 中文

音频大模型记不住谁在说话?墨大新基准VoxMem揭穿:32K上下文下全员不及格

墨尔本大学联合团队推出语音记忆基准VoxMem,含3196个评测实例、约177小时音频。实测15个音频大模型在32K上下文下准确率均未超40%,语音记忆普遍不合格。

当语音AI被拉进一场长达数小时、横跨几十轮的真实对话,它到底能不能记住"这句话是谁说的、用什么样的语气、背景里有什么声音"?墨尔本大学与新南威尔士大学的联合团队觉得,现有的评测根本答不了这个问题,于是端出了专门戳这块软肋的基准VoxMem。

他们先点破了旧评测的两道硬伤:一是只盯着转写出来的文字内容,把声音里藏着的身份信息、情绪线索、环境声一股脑丢掉;二是没法把"历史有多长"这个变量单独剥离出来看,于是模型表现差,到底是记性差还是被长度拖垮的,谁也说不清。VoxMem的打法是建一套"声学证据 × 记忆操作"的二维分类法,把考察维度正交拆开,覆盖15种组合,而且所有题目在8K到64K的不同历史长度下保持原样不动——等于只拧"对话长度"这一颗旋钮,其余全锁死,让记忆效果的变化能干净地归因到长度上。

这套基准的体量不轻:共3196个评测实例、34743个语音会话,合计约177小时音频,足以模拟一场漫长的多轮交谈。而对15个主流音频大模型的实测结果,相当打脸。在32K上下文长度下,所有模型的整体准确率都没能越过40%这条线。更值得玩味的是偏科方向:模型对"说了什么"的语义记忆,明显强过对说话人身份、副语言线索(语气、情绪)和环境声这三类声音原生信息的记忆;尤其追踪语气起伏、背景声变化的准确率极低,基本处于抓瞎状态。而且随着历史长度往上加,各类信息的记忆准确率全在往下掉。

团队据此下了个判断:当前音频大模型的语音记忆瓶颈,主要卡在"识别、定位、把信息关联绑定"这几个环节,而不是推理操作本身——换句话说,模型不是不会想,而是连"谁在什么时候、以什么方式说了什么"这种底层事实都没接稳,上层推理自然无从谈起。VoxMem这套基准,等于给语音AI量体温时换了一支更细的体温计,逼着业界正视一个长期被文字转写掩盖的事实:听得懂词,不等于记得住人、语气和整个世界。

原始出处

AIbase

内容说明

原始发布及相关权利归来源方。