AIbase수정일

음성 대모델은 누가 말하는지 기억하지 못하나요? 무고대 새로운 기준 VoxMem이 밝혀냈습니다: 32K 컨텍스트에서 모두 불합격입니다.

멜버른 대학교와 뉴사우스웨일스 대학교의 공동 팀이 음성 AI 평가 기준인 VoxMem을 출시했습니다. 이 기준은 수 시간에 걸친 수십 번의 실제 대화 중에서 화자 신분, 톤, 배경 소리를 기억할 수 있는지를 검증합니다. 팀은 기존 평가 방식이 단지 텍스트 변환에만 집중하여 음성 속의 신분, 감정, 환경 단서를 잃게 되고, 음성 기억 능력을 측정할 수 없다고 지적했습니다. VoxMem은 이러한…

음성 AI가 수 시간에 걸쳐 여러 번의 실제 대화를 거치게 되면, “이 말은 누가 한 것인지, 어떤 어조로 말했는지, 배경에 어떤 소리가 있는지”를 어떻게 기억할 수 있을까? 멜버른 대학과 뉴사우스웨일스 대학의 공동 팀은 현재의 평가 방법으로는 이 문제에 답할 수 없다고 판단하여, 이 약점을 공략하는 특별한 기준 VoxMem을 제시했다.

그들은 먼저 기존 평가의 두 가지 심각한 문제를 지적했다: 첫째는 음성을 전사한 문자 내용에만 집중하여, 소리 속에 숨겨진 신분 정보와 감정 단서, 환경 소리를 모두 버리는 것이었다; 둘째는 "역사가 얼마나 긴지"라는 변수를 별도로 분리하여 살펴보는 것이 불가능했기 때문에 모델의 성능이 저조해졌으며, 이것이 기억력 부족 때문인지 길이에 의한 영향인지 누구도 명확히 말할 수 없었다. VoxMem의 접근법은 "음향 증거 × 기억 조작"의 이차원 분류법을 만드는 것으로, 검토 차원을 직교적으로 나누어 15가지 조합을 포함하며, 모든 문제는 8K에서 64K에 이르는 다양한 역사적 길이에서 원형 그대로 유지된다. 즉 "대화 길이"라는 스톱버튼만 조정하면 나머지는 모두 잠겨서 기억 효과의 변화가 길이에 의해 명확하게 설명될 수 있다.

이 기준의 규모는 꽤 큽니다: 총 3196개의 평가 예시와 34743개의 음성 대화, 합쳐서 약 177시간에 달하는 오디오 데이터로, 긴 다단계 대화를 모방할 수 있습니다. 그러나 15개의 주요 오디오 대규모 모델에 대한 실제 테스트 결과는 매우 실망스러웠습니다. 32K 컨텍스트 길이에서 모든 모델의 전체 정확도는 40%를 넘지 못했습니다. 더 주목할 만한 것은 특정 영역에 대한 편향입니다: 모델은 말하는 사람의 정체성, 부언어적 단서(톤, 감정) 및 환경 소리라는 세 가지 원천 정보보다 "무엇을 말했는지"에 대한 의미 기억을 더 잘 저장합니다; 특히 톤의 변화와 배경 소리의 변동을 추적하는 정확도는 매우 낮아 거의 아무것도 파악할 수 없는 상태입니다. 게다가 시간이 길어질수록 모든 종류의 정보에 대한 기억 정확도가 점점 떨어집니다.

팀은 이에 대한 판단을 내렸다: 현재의 오디오 대모델의 음성 기억 병목 현상은 추론 작업 자체가 아니라 "인식, 위치 파악, 정보의 연관 및 결합"이라는 단계에서 발생한다. 다시 말해, 모델은 생각을 하지 못하는 것이 아니라 "누가 언제, 어떤 방식으로 무슨 말을 했는지"와 같은 기본적인 사실조차 제대로 파악하지 못하기 때문에 상위 수준의 추론도 불가능하다. VoxMem 이 기준은 음성 AI의 체온을 측정할 때 더 얇은 체온계를 사용하는 것과 같아서, 업계가 길게 문자 변환으로 가려져 있던 사실을 직시하도록 만들었습니다. 단어를 이해한다고 해서 사람, 톤, 그리고 전 세계를 기억하는 것은 아닙니다.

원문 출처

AIbase

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요