“语音将成为下一个重要交互界面”的理论正迅速升温。投资者正向语音 AI 初创公司投入数十亿美元,这些公司覆盖的领域从模型开发商到企业客服提供商,再到会议记录工具和 AI 驱动的语音听写产品。
几乎每周都会有新的模型或工具发布,宣称自己能像人类一样发声、像人类一样对话。不过,现实可能并非如此。企业语音 AI 平台 PolyAI 首席技术官 Shawn Wen 认为,尽管全双工模型——也就是能在倾听用户说话的同时进行回应的模型——已经发布,但语音 AI 还没有迎来自己的“ChatGPT 时刻”。
他上个月在 HumanX 大会的台上对我表示:“我们已经达成了开发全双工模型这一里程碑。下一个挑战是让推理速度变得非常快,这样模型才能迅速获取答案,让对话感觉更自然。”
他还表示,客服场景中的 AI 代理不应该听起来像机器人,而应当让来电者有足够信心,相信它们能够解决问题。
他说:“我认为下一阶段会略有不同,因为一旦语音足够好,比如客户愿意在前两三轮对话中与它互动,他们就会开始建立信心。随着时间推移,如果这个代理能解决我的问题,他们会觉得自己可能不必再和真人交谈了。”
会议记录工具 Otter 的首席营销官 Alex Gay 认为,说话人识别、意图捕捉,以及结合组织知识将这些内容整理出来,是实现自动化的关键一步。该公司也在开发可能在会议中代表用户的数字分身。对于这项技术,他表示,输出的语音必须能够像人在会议中交谈时那样传达相同的情感表达,这一点至关重要。
Gay 指出:“如果你想想自己现在参加的会议,最好的对话往往是那些可以展开辩论、进行战略讨论,而且你能感受到背后存在某种关系基础的对话。如果你无法和一个虚拟化身建立这种互动,那它就只是一个问答聊天机器人。”
语音 AI 的理解能力与透明度
尽管语音 AI 模型已经有所改进,但 AI 助手仍经常听不懂用户,或者你的会议记录工具会给出错误的转录文本或摘要。
Wen 认为,ASR(自动语音识别)模型经常会漏掉重要关键词,这会导致系统无法捕捉完整语境。
Otter 的 Gay 也认同这一点,并补充说,公司一直在持续改进转录能力。他还表示,语言本身也是语音模型需要提升的一个领域。
他说:“对 Otter 来说,转录从来都不是终点。它只是一个基础层,我们可以在其之上推动一些生产力提升。但如果最初的转录没有达到你所需要的准确度,那么后续所有动作都会出现偏差。而一旦系统开始执行错误操作,你就会失去对这个平台的信任。对我们来说,持续改进 ASR 模型至关重要,因为所有下游影响都非常显著。”
随着新语音工具不断出现,透明度也成为一个问题。工具应当向客户明确说明,他们正在被录音,或者正在与 AI 交流。Otter 表示,公司希望在参会者中建立信任,因此即便在机器人并未直接出现在会议中的情况下,它也希望尝试一些方式,比如在聊天中通知所有人会议正在被录音。PolyAI 的 Wen 也表示,在企业通话中,让人们明确知道自己是在与 AI 对话,这一点很重要。












