TechCrunch AI

这些高管认为语音人工智能还未能达到 ChatGPT 那样的水平

TechCrunch在HumanX会议采访PolyAI首席技术官Shawn Wen与Otter CMO Alex Gay:尽管全双工模型已问世,语音AI仍未迎来其“ChatGPT时刻”,还需更快的推理速度;ASR常漏关键词致上下文断裂,转录不准会损害下游自动化信任。两位高管还强调工具应告知用户正在录音或与AI对话,Otter正研发会议数字孪生。

配图来源 · TechCrunch AI

语音作为下一个重要交互方式的理论正在获得强劲发展势头,投资者正在向那些致力于模型开发、企业客户服务提供等领域的语音人工智能初创公司投入数十亿美元资金,此外还有用于会议记录以及由人工智能驱动的语音输入领域的相关项目。

每周都有新的模型或工具发布,这些产品声称能发出类似人类的声音并像人一样交流。然而,实际上可能并非如此。PolyAI 企业语音 AI 平台的首席技术官 Shawn Wen 认为,尽管已经发布了全双工模型——这些模型可以在倾听你的话的同时进行说话,但语音 AI 尚未迎来“ChatGPT 时刻”。

“我们已经实现了开发全双工模型的里程碑。下一个挑战是让推理过程变得非常快速,这样模型就能迅速获取答案,对话也会显得自然,”他在上个月 HumanX 会议上的台上对我说。

他还表示,客户服务中的人工智能代理不应听起来像机器人,而应该让通话者有足够信心,相信他们能够解决问题。

“我认为下一个阶段会有所不同,因为一旦语音表现足够好,且客户愿意在最初的两到三次交流中与客服互动,他们就会逐渐建立信心。随着时间的推移,他们会觉得如果客服能够解决我的问题,或许就不需要再和真人交谈了,”他说。

Otter 会议的 CMO Alex Gay 认为,说话者识别、意图捕捉以及结合组织知识进行打字,是实现自动化的关键步骤。该公司还在研发数字孪生技术,以便在会议中模拟人物形象。他说,这项技术的关键在于,输出语音要能表现出与人类在会议中交谈时相同的情感表达。

“如果你想想目前参与的会议,最良好的交流方式就是能够展开辩论和战略讨论,同时有某种关系作为基础。如果你无法通过虚拟形象进行这样的交流,那就只是一次聊天以及一个聊天机器人而已,”盖伊指出。

语音 AI 的理解能力与透明度

虽然语音 AI 模型已经得到了改进,但 AI 助手往往无法理解用户的意思,或者会议记录器会显示错误的录音内容或总结。

文认为,自动语音识别模型常常会遗漏重要的关键词,这导致无法完整捕捉整个上下文。

Otter’s Gay同意这一点,并补充说公司仍在努力改进语音转写功能。他还表示,语言是语音模型需要改进的一个领域。

“对于 Otter 来说,转录从来都不是最终目标。它只是我们开始提升效率的一个环节而已。但如果原始转录的准确率不符合需求,所有后续操作都会变得不可靠。一旦开始采取相关措施,那就是错误的了。你会对平台失去信任。” “对我们来说,继续改进该 ASR 模型非常重要,因为所有相关的下游影响都十分显著,”他说。

新的语音工具也带来了透明度问题。这些工具应向客户说明正在录制或与人工智能进行对话。Otter表示,希望在会议中建立人们的信任,因此即使没有机器人参与会议,也打算通过在聊天中通知所有人会议正在被录制等方式来实现。PolyAI的Wen也指出,在企业通话中明确表明人们正在与人工智能对话非常重要。

原始出处

TechCrunch AI

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准