多位高管认为语音 AI 尚未迎来其 “ChatGPT 时刻”
「语音将成为下一个重要交互界面」这一论断势头正猛,投资机构已向语音 AI 创业公司砸下数十亿美元,覆盖范围从模型厂商到企业客服供应商,从会议记录工具到 AI 听写应用。
每周都有新模型或新工具发布,声称听起来像真人、能像真人一样对话。但现实可能并非如此。企业级语音 AI 平台 PolyAI 的 CTO Shawn Wen 认为,尽管全双工模型(可以一边听你说话一边回应)已经问世,语音 AI 还没有迎来自己的「ChatGPT 时刻」。
他说:「开发全双工模型这个里程碑我们已经达到了。下一个挑战是让推理速度足够快,模型才能迅速给出答案,让对话感觉自然。」他上个月在 HumanX 大会舞台上接受采访时如是说。
他还表示,客服领域的 AI agent 不应该听起来机械生硬,而要让来电者有足够的信心相信它能解决问题。
他说:「我认为下一阶段会稍有不同——一旦语音质量足够好,客户愿意在前两三轮对话中与之交流,信任就开始建立。时间一长,客户会觉得如果 agent 能解决我的问题,可能就不必再找真人了。」
会议记录工具 Otter 的 CMO Alex Gay 认为,说话人识别、意图捕捉,并结合企业内部知识进行整理,是实现自动化的关键一步。这家公司还在开发能在会议中代表真人的数字分身。他表示,对这项技术来说,至关重要的是生成的语音能像真人开会时那样传递出丰富的情绪表达。
Gay 指出:「想想你现在参加的会议,最好的交流是那种可以辩论、可以讨论战略、并且让你感觉有真实关系作为基础的对话。如果做不到这些,那它就只是一个问答聊天机器人。」
语音 AI 的理解力与透明度
虽然语音 AI 模型不断进步,但 AI 助手经常听不懂用户在说什么,或者会议记录工具给出的转录和摘要并不准确。
Wen 认为,ASR(自动语音识别)模型经常漏掉关键词,导致难以捕捉完整的上下文。
Otter 的 Gay 对此表示认同,并补充说公司一直在致力于提升转录效果。他还指出,语言是语音模型需要改进的领域之一。
“对 Otter 来说,转录从来都不是最终目的。它只是我们在此基础上推动生产力提升的一个层级。但如果最初的转录精度达不到要求,后续所有基于此的行动都会出现问题。一旦开始执行错误的操作,用户对平台的信任就会流失。因此,持续提升 ASR 模型至关重要,因为其对下游环节的影响巨大,”他说道。
随着新语音工具的出现,透明度问题也浮出水面。工具应当告知用户他们正在被录音,或者正在与 AI 对话。Otter 表示,希望建立会议中人们对平台的信任。因此,即使会议中没有机器人参与,公司也会尝试通过聊天通知所有人会议正在录音等方式来实现这一点。PolyAI 的 Wen 也强调,在企业通话中明确告知人们正在与 AI 交流同样重要。