音声が次の重要なインターフェースであるという理論は、大きな勢いを増しています。投資家たちは、モデル開発から企業の顧客サービスプロバイダーまで、会議ノートの記録からAI駆動型音声入力まで、さまざまな分野で活動する音声AIスタートアップに数十億ドルを投資しています。
毎週、人間のような声で会話すると主張する新しいモデルやツールが発表されます。しかし実際には、そうではないかもしれません。エンタープライズ・ボイスAIプラットフォームPolyAIのCTOであるShawn Wenは、完全双方向モデルが発表されているにもかかわらず、ボイスAIにはまだ「ChatGPTの瞬間」は来ていないと考えています。
「完全双方向モデルの開発というマイルストーンに到達しました。次の課題は、推論を非常に速く行えるようにすることです。そうすれば、モデルが迅速に答えを得られ、会話が自然に感じられるようになります」と、先月HumanXカンファレンスでステージ上で私に語りました。
また、カスタマーサービスにおけるAIエージェントはロボットのように聞こえないようにし、通話者が問題を解決できるという信頼感を持てるようにすべきだと述べました。
「次の段階は少し異なると思います。なぜなら、声が十分に良く、顧客も最初の2、3回の会話で対応してくれるようになったら、自信を持ち始めます。そして時間が経つにつれて、エージェントが私の問題を解決できれば、人間と話す必要はないと感じるようになるでしょう」と彼は言った。
会議ノートレーターOtterのCMOであるアレックス・ゲイは、発言者識別、意図の把握、そして組織知識を組み合わせたタイピングが自動化を実現するための重要なステップであると述べました。同社はまた、会議中の人々を表すデジタルツイン技術にも取り組んでいます。この技術においては、出力される音声が会議中の人間との会話と同じ感情表現を持つことが極めて重要だと彼は言いました。
「今あなたが参加している会議を考えてみると、最も良い会話とは、議論や戦略的な討論が可能で、その背後に何らかの関係があると感じられる場所です。もしアバターでそのようなことができないなら、それは単なるQとチャットボットに過ぎません」とゲイは述べた。
Voice AIの理解力と透明性
音声AIモデルは向上していますが、AIアシスタントはしばしばユーザーの意図を理解できないか、会議のメモを取る機能が間違った記録や要約を表示することがあります。
ウェンは、ASR(自動音声認識)モデルがしばしば重要なキーワードを見落とすと考えており、それが全体的な文脈を把握する上での問題を生じると述べている。
オッターズ・ゲイはこれに同意し、企業が音声転写の改善に取り組み続けていると述べた。また、言語も音声モデルを改善する必要がある分野の一つだと言った。
「オッターにとって、テキスト転写は決して終点ではありません。それは単なる一層に過ぎず、そこから生産性の向上を実現するための手がかりとなるだけです。しかし、元のテキスト転写が必要な精度を持っていない場合、すべての後続の対応が不適切になります。そして、何か行動を起こす瞬間に、それは間違いです。プラットフォームへの信頼が失われるのです。」 「すべての下流の影響が大きいので、ASRモデルを継続して改善することは非常に重要です」と彼は言った。
新しい音声ツールを使うことで、透明性の問題も生じる。ツールは、自分が録音されているか、AIと話していることを顧客に明らかにすべきだ。オッターは、会議に参加している人々の信頼を得たいと考えており、ボットが出席していない会議であっても、チャットで全員に会議が録音されていることを通知するような方法を試みたいと述べた。PolyAIのウェンも、企業向け通話で人々がAIと話していることを明確にすることが重要だと言った。
