AIbaseAktualisiert

Kann das große Audio-Modell nicht merken, wer spricht? Das neue VoxMem-Benchmark von der Mei-Da zeigt: Unter 32K Kontext ist jeder…

Das gemeinsame Team der University of Melbourne und der University of New South Wales hat das Sprach-AI-Bewertungsstandard VoxMem eingeführt, um zu überprüfen, ob es in mehreren Stunden und Dutzenden von Dialogrunden die…

Wenn eine Sprach-KI in ein mehrere Stunden dauerndes, durch zahlreiche Sitzungen geprägtes echtes Gespräch eingebunden wird, kann sie dann wirklich „wer diese Worte gesagt hat, in welchem Tonfall und welche Geräusche im Hintergrund“ merken? Eine gemeinsame Gruppe der Universitäten von Melbourne und New South Wales ist der Ansicht, dass die bestehenden Tests diese Frage nicht beantworten können, und hat daher das Benchmark-VoxMem entwickelt, das genau diese Schwachstelle adressiert.

Sie haben zunächst zwei Schwächen der alten Bewertungen aufgedeckt: Erstens konzentriert man sich nur auf den ausgesprochenen Textinhalt und verliert dabei die Informationen, Emotionen und Umgebungsgeräusche im Ton. Zweitens kann man die Variable „Wie lang die Geschichte ist“ nicht separat betrachten, daher ist das Modell schlecht performend – es ist unklar, ob es an einer schlechten Gedächtnis liegt oder an der Länge. VoxMem entwickelt eine zweidimensionale Klassifizierungssystem mit „akustischen Beweisen × Gedächtnisoperationen“, indem die Untersuchungsdimensionen orthogonal getrennt werden und 15 Kombinationen abgedeckt werden. Alle Aufgaben bleiben unverändert bei unterschiedlichen historischen Längen von 8K bis 64K – das bedeutet, dass man nur den Knopf „Dialoglänge“ dreht, während alles andere geschlossen bleibt, sodass die Veränderungen des Gedächtnis Effekts sauber auf die Länge zurückgeführt werden können.

Die Größe dieser Referenz ist nicht gering: insgesamt 3196 Bewertungsbeispiele und 34743 Sprachgespräche, zusammen etwa 177 Stunden Audiodaten, reichen aus, um eine lange mehrstufige Unterhaltung zu simulieren. Die tatsächlichen Ergebnisse für die 15 wichtigsten Audio-Modellreihen sind jedoch eher enttäuschend. Bei einer Kontextlänge von 32K konnte die Gesamtrechteckität aller Modelle nicht über das Niveau von 40% steigen. Noch interessanter ist die schleichende Schwäche in bestimmten Bereichen: Die semantische Erinnerung des Modells an „was gesagt wurde“ ist deutlich stärker als die Erinnerung an die Identität des Sprechers, an die Untertonsinformationen (Stimmlage, Emotionen) und an die Umgebungsgeräusche – drei Arten von natürlichen Audioinformationen. Insbesondere die Genauigkeit bei der Erfassung der Stimmlage und der Veränderungen des Hintergrunds ist sehr niedrig, und es handelt sich im Grunde um eine völlig ineffiziente Methode. Zudem nimmt die Genauigkeit der Erinnerung an allen Arten von Informationen mit zunehmender Dauer ab, je weiter man in der Geschichte zurückgeht.

Die Gruppe traf daraufhin eine Entscheidung: Der Latenzpunkt der Sprachmembran des aktuellen Audiomodells liegt hauptsächlich in den Schritten „Erkennen, Lokalisieren und die Informationen miteinander verbinden“, nicht in den Rechenoperationen selbst – mit anderen Worten: Das Modell kann nicht nachdenken, sondern erfasst nicht einmal die grundlegenden Fakten wie „Wer, wann und wie etwas gesagt hat“. Daher kann die obere Ebene der Rechenarbeit natürlich nicht stattfinden. Die VoxMem-Benchmark-Methode ist wie das Wechseln eines dünneren Thermometers beim Messen des Körpertempos von Sprach-KI-Systemen, und zwingt die Branche dazu, eine Tatsache anzuerkennen, die seit Langem durch Textübersetzungen verdeckt wurde: Das Verstehen der Wörter bedeutet nicht, dass man die Personen, den Tonfall und die ganze Welt im Gedächtnis hat.

Originalquelle

AIbase

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten