原文标题:These execs think voice AI hasn’t reached its ChatGPT moment yet
语音成为下一个重要界面的理论已经获得了强劲的发展势头,投资者向语音人工智能初创公司投入了数十亿美元,这些初创公司的领域涵盖从模型制作者到企业客户服务提供商,从会议记录员到人工智能听写等领域。
每周都会有一个新的模型或工具发布,声称听起来像人类,并且像人类一样交谈。然而,事实上,情况可能并非如此。企业语音AI平台PolyAI的CTO Shawn Wen认为,尽管发布了全双工模型——可以边听边说话——语音AI还没有达到“ChatGPT时刻”。
“我们已经达到了开发全双工模型的里程碑。下一个挑战是使推理变得非常快,以便模型能够快速获取答案并且对话感觉自然,”他在上个月的 HumanX 会议的舞台上告诉我。
他还表示,客户服务中的人工智能代理不应该听起来像机器人,而应该让呼叫者有足够的信心,相信他们可以解决问题。
“我认为下一阶段会略有不同,因为一旦声音足够好,并且客户愿意在前两个或
三轮后,他们开始建立信心,随着时间的推移,他们会觉得如果代理可以解决我的问题,我可能不需要与人交谈,”他说。
会议记录员 Otter 的首席营销官 Alex Gay 认为,发言者识别、意图捕获以及利用组织知识进行输入是实现自动化的关键步骤。该公司还在研究可以代表人们参加会议的数字双胞胎。他表示,对于这项技术来说,最重要的是输出的声音能够提供与在会议中与人交谈相同的情感表达。
“如果你想想你现在参加的会议,最好的对话就是你可以进行辩论和战略讨论,并且当你觉得有一种关系支撑它时。如果你无法通过头像实现这一点,那么它就只是一个 q 和一个聊天机器人,”盖伊指出。
语音人工智能的理解力和透明度
虽然语音 AI 模型有所改进,但 AI 助手通常无法理解用户,或者您的会议记录员会显示错误的文字记录或摘要。
Wen 认为 ASR(自动语音识别)模型经常会错过重要的关键字,这会产生一个问题
捕捉整个上下文。
Otter’s Gay 对此表示同意,并补充说该公司一直致力于改进转录。他还表示,语言是语音模型需要改进的领域之一。
“对于 Otter 来说,你知道,转录从来都不是终点。它只是我们可以开始推动部分生产力提高的层面。但是,如果你的原始转录没有达到你需要的准确性,那么你的所有后续行动都会有缺陷。从开始采取行动的那一刻起,那就是错误的。你会失去对平台的信任。对我们来说,继续改进 ASR 模型至关重要,因为所有下游影响都是巨大的,”他说。
新的语音工具还存在透明度问题。工具应该向客户声明他们正在被记录或与人工智能交谈。 Otter 表示,它希望向参加会议的人灌输信任,因此即使对于机器人不在场的会议,它也想尝试一些方法,例如通知聊天中的每个人会议正在被录制。 PolyAI 的 Wen 还表示,确定人们在企业通话中与人工智能交谈非常重要。