AIbase更新日

音声モデルは誰が話しているか覚えられない?墨大新基準VoxMemが明らかに:32Kの文脈では全員が不合格

メルボルン大学とニューサウスウェールズ大学の共同チームが、音声AI評価基準VoxMemを発表した。この基準は、数時間に及ぶ数十回の実際の会話の中で、話し手の身分、トーン、背景音声をどれだけ記憶できるかを検証するものである。チームによると、従来の評価は文字の転写のみに焦点を当てており、声声の中の身分、感情、環境の手がかりを失っているため、音声記憶能力を測ることができなかった。VoxMemはこの空白を埋めるために設計されている。

数時間に及び、数十回にもわたる実際の対話を経て、音声AIが「この言葉は誰が言ったか、どのような口調で、背景にはどんな音があるか」を記憶できるのか?メルボルン大学とニューサウスウェールズ大学の共同チームは、現在の評価方法ではこの問題に答えられないと考え、この弱点を突くための特別な基準VoxMemを提案した。

彼らはまず、古い評価の二つの深刻な問題を指摘した。一つは、翻字された文字内容だけに注目し、声の中に隠された情報や感情の手がかり、環境音をすべて捨て去ることである。もう一つは、「歴史がどれほど長いか」という変数を単独で分離して見ることができないため、モデルのパフォーマンスが悪くなり、それが記憶力の不足によるものなのか、長さの影響によるものなのか、誰にも明確にはわからないということである。 VoxMemの戦略は、「音声証拠 × 記憶操作」の二次元分類法を構築することで、検討の次元を直交的に分割し、15種類の組み合わせをカバーしている。また、すべての問題は8Kから64Kまでの異なる歴史的な長さにおいてもそのままの形で保持される――つまり、「対話の長さ」というノブだけを回すだけで、他はすべて固定され、記憶効果の変化が長さに起因するようになる。

この基準のデータ量はかなり大きい:合計で3196件の評価例、34743件の音声会話、約177時間の音声データがあり、長く複数回にわたる会話を模倣するのに十分である。しかし、15つの主要な音声大モデルに対する実測結果は、かなり失望させられるものだった。32Kの文脈長においても、すべてのモデルの全体正確率は40%を超えることができなかった。 さらに興味深いのは偏った能力の方向性です:モデルは「何を言ったか」という意味記憶に対する記憶が、話し手の身分、副言語的手がかり(トーン、感情)、環境音という3種類の声の固有情報に対する記憶よりも明らかに強いです。特にトーンや背景音の変化を追跡する精度は極めて低く、ほぼ無効な状態にあります。さらに、歴史の長さが長くなるにつれて、各種情報の記憶精度は全体的に低下していきます。

チームはこれに基づいて次の判断を下した:現在の音声大モデルの音声記憶のボトルネックは、推論操作自体ではなく、「認識、位置特定、情報の関連付け」といういくつかの段階にありている。言い換えれば、モデルは考えることができないのではなく、誰がいつ、どのような方法で何を言ったのかという基礎的な事実すら正確に把握していないため、上層の推論は自然と成り立たない。 VoxMemという基準は、音声AIに体温を測定させる際に、より細い体温計を使うようなものです。これにより、テキストの転写によって隠されてきた事実を業界が認識するようになりました。言葉を理解することは、人や口調、そして世界全体を覚えていることとは異なります。

原文の出典

AIbase

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください