← 文章 / 行业与公司动态
TechCrunch 3小时前 · 2026-09-25 01:24:12 · 0 阅读

对话 ElevenLabs CEO:估值 220 亿美元背后的语音 AI 战略

ElevenLabs 致力于构建 AI 的语音层,开发能将文本转化为逼真人类语音的模型。大多数人接触它时,通常是在与客服交流的过程中,且往往未察觉其存在。例如,Klarna 利用该平台为 3500 万美国用户提供一线电话支持;德国电信、思科、Adobe 以及越来越多的政府机构也采用此服务。ElevenLabs 还面向创作者销售产品,他们利用其平台制作有声读物、配音和音乐。

在该领域,ElevenLabs 并非孤例。事实上,它正越来越多地与客户产生竞争关系。例如,对话式 AI 平台 Decagon 曾基于 ElevenLabs 训练其语音产品,如今却成了竞品。不过,投资者似乎并不担心这一点。该公司称其年化经常性收入达 6 亿美元,尽管成立仅四年,但其支持方据报对其估值已达 220 亿美元。

为了深入了解,我在多伦多当地的一场创业会议 Nrth(前身为 Elevate)上采访了 ElevenLabs 联合创始人兼首席执行官 Mati Staniszewski。在有限的时间内,我们涵盖了广泛话题,包括企业是否应告知客户正在与 AI 对话(他认为应该告知),以及他是否可以谈论公司的毛利率。不出所料,Staniszewski 表示无法详细讨论毛利率,但他明确表示,如果意味着能扩大公司市场份额,他不介意利润率被进一步压缩。

以下是我们对话的浓缩与轻微编辑版本。完整对话可在此查看。

你去年参加了 TechCrunch Disrupt,当时表示音频模型将在一两年内成为通用商品。现在你如何评价这一预测?

还有很多工作要做,仅靠在模型层面优化,能带来的质量差距依然显著。从长远来看,大约三到五年后,这些差异会缩小。我们希望成为首批通过对话式人工智能“图灵测试”的公司。这需要结合智能与情商,要能理解对方的情绪,并据此调整语速快慢。这一点目前尚未实现。

目前企业级业务占多大比例?

我们目前的年经常性收入(ARR)已达 6 亿美元。其中 55% 以上是传统企业客户,其余 45% 中很大一部分来自中小企业、开发者、构建者和创作者。

和其他 AI 公司一样,你越来越发现自己在与客户竞争。Decagon 基于你的技术训练了其语音产品,现在通过自研模型运行查询。

界限变得愈发模糊。当我们把公司分为模型公司、平台公司和应用公司时,过去它们的边界非常清晰。但现在这条线模糊多了。以 Anthropic 为例,它从模型公司变成了一个平台,且正在扩展出一系列应用。我认为这种趋势会持续下去。

客户可以从 ElevenLabs 的菜单中选择“推理层”。你观察到前沿实验室模型与开源权重的使用情况有何不同?

这不再是非黑即白的选择。在客户体验方面,如果通话仅是提供信息,不涉及执行操作——你可以大量使用开源模型,因为知识库定义了什么才算好的体验。但如果是金融服务,你需要身份认证、交易信息,甚至处理退款。这里没有容错空间。在此类场景下,前沿模型仍将领先。

部分开源权重模型来自中国。美国政府是你们的客户,欧洲各国政府也是。这些对话是怎样的?

不一样。每次部署,我们用什么模型、什么声音,取决于具体场景。如果和波兰政府或巴西政府合作,他们都有各自的要求。可能是开源权重模型,也可能是闭源模型,或者他们自己微调的模型。(在波兰)这是一个医疗案例:患者在公共医疗系统预约就诊,但 18% 的人爽约。我们部署的是打电话提醒患者的 agent。他们的模型基于自己的知识做了优化,我们负责集成,同时保证数据留在本地。

当对方是在和 agent 而不是真人交谈时,企业是否应该告知?

我认为现阶段应该告知。目前人们还不习惯这种情况,常见的心理是:通话时不想觉得自己被骗了。但五年后,当每个人都有自己的 agent 替自己办事时,你打电话过去本来就会预期对面是 agent,到那时社会观念就会转变。其实有不少好的做法——比如真人客服要等 30 分钟,就给客户一个选择。几乎所有情况下,客户都会选择 agent,然后惊讶地发现体验居然这么好。

考虑到模型和推理的成本,你们的毛利率是多少?

这个问题我只能模糊回答。因为我们有自研能力,可以非常聪明地微调和约束模型。只要能把成本优势让利给客户,我们就会这么做。目前最重要的是证明价值、贴近客户。所以只要能投入并证明这个价值,我们不介意利润率低一些,好在未来五年价值兑现时实现共同受益。

你们有数百万小时的客服通话数据,会用它们来训练吗?训练数据中合成的占多少?

在某些客户公司,我们是和对方一起共建模型的,他们想要针对自己场景的专用模型。除此之外,训练的关键其实不在数据量,而在数据标注。我们内部有几千名外包人员帮忙做标注——不只是标注说了什么,还有说话的时机、方式、带有什么情绪。我们还专门请了语音教练,才能准确识别各种口音。

有报道称你们计划 2028 年 IPO,能确认吗?

希望打造一家基业长青的公司。我们正在夯实基础,以便在未来几年实现这一目标。但能否如愿,还得看天时地利。 “未来几年”定义太模糊了。 (笑) 幕后环节:你如何看待前沿实验室放缓研发进程的问题? 大家一致同意,应协作探索如何控制节奏。至于是否公开推进、在多大程度上需要媒体关注或监管介入,那是另一个议题。但没错,在部署技术时,我们都应采取恰当的风控措施。我们不训练文本模型及模型的智能核心部分——而这恰恰是争论的焦点。 ElevenLabs 会像 Hugging Face 那样暴露风险吗? 我们比他们走得更谨慎。因为我们不部署具有自我复制或循环特性的智能体组件,技术也不允许智能体自我生成更多智能体。所有客户均须通过 KYC 验证。网络安全风险对全球确实是隐患,但我们已建立一套完备的预防机制。
原始来源: TechCrunch

评论 (0)