Meta发布Muse Voice Transcribe:实时音频转录模型的实时平衡与多语言优势
核心要点
- Meta 发布了 Muse Voice Transcribe,这是一款实时模型,无需依赖独立系统即可同时完成语音转录、断句和最多 20 人语音分离。
- 该模型将音频切分为 80 毫秒的片段,并根据难度动态调整每个单词的延迟,在速度与准确性之间实现实时平衡。
- Meta 以每小时 0.18 美元的价格 undercut OpenAI 和 ElevenLabs 等竞争对手。该模型支持 70 多种语言,现已在 Meta AI 中可用,也可通过 Meta Model API 调用。
Meta 的 Superintelligence Labs 发布了其首款实时音频感知模型。它能够在对话进行中同步完成语音转录、说话人区分和句子边界检测。
Spark 系列模型将输入音频拆分为 80 毫秒的片段。在处理每个片段后,模型会决定是继续监听还是将下一个单词输出为文本,从而动态控制转录前的上下文积累量。
等待时间越长,准确性越高,但延迟也越大。据 Meta 介绍,Muse Voice Transcribe 会根据每个单词的难度动态调整等待时长:简单的词更快输出,难的词则获得更多监听时间。Meta 通过强化学习训练了这一行为,在奖励低错误率的同时也鼓励缩短延迟。

无需额外系统即可实现说话人分离与句子检测
Meta 将剩余功能集成到同一模型中,无需依赖独立系统。在说话人归属方面,模型会在实时文本中标记说话人切换,并为每个段落打上 A 到 Z 的标识符。在句子边界检测方面,它会标记每段话语的开始和结束位置。这两项任务均与语音识别联合训练。
该模型能同时区分 20 多位说话人,并可处理超过一小时的长录音而无需后期处理。据 Meta 介绍,在一个八人同处一室的演示中,系统能实时把每句话归属到对应的说话人。
多语言支持是核心卖点
Meta 表示,Muse Voice Transcribe 的训练数据覆盖 70 多种语言,其中 25 种经过了深度测试。模型还能处理语码转换,也就是说话人在句子中途切换语言的情况。提供语言、关键词和上下文提示可进一步提升准确率,尤其是对"Meta"、"Muse"、"Menlo Park"这类专有名词。

Artificial Analysis 在独立评测中证实了 Meta 的说法。Muse Voice Transcribe 在说话人讲完英语后 0.16 秒内输出结果,词错误率为 3.1%。ElevenLabs Scribe v2 Realtime 为 3.6%、耗时 0.14 秒,AssemblyAI Universal-3.5 Pro Realtime 为 4.0%。Cartesia Ink-2 的成绩则视模型是自行判断语音结束还是依赖外部系统而定,在 3.4% 和 4.0% 之间。竞争相当激烈:OpenAI 已于 5 月发布了同样面向实时场景的 GPT-Realtime-Whisper,并在 7 月下调了转写模型的价格。
Meta 将此次发布与 CEO Mark Zuckerberg 提出的「个人超级智能」愿景挂钩。在一场预演演示中,Meta 员工表示,可靠的语音识别是个人 AI 智能体的基础,这些智能体能通过 AI 眼镜聆听真实对话。此前德国曾讨论禁止 Meta 的摄像眼镜,但德国联邦网络管理局最终决定不予追究。
可用性
Muse Voice Transcribe 现已驱动 Meta AI 和 Muse Code 中的语音输入功能,并可通过 Meta Model API 使用。用户只需在任何应用中按住「Fn」键即可体验。
Meta 在定价上大幅 undercut 市场。该模型每小时收费 $0.18(即每 1,000 分钟音频 $3),低于 Cartesia Ink-2 的 $4,也低于 ElevenLabs Scribe v2 Realtime 和 Deepgram Flux 的 $6.50。
这延续了 Muse Spark 1.1 和 Muse Spark 1.2 的策略:以价格而非峰值性能为主要竞争力。Meta 未披露该模型的参数量、训练数据规模或音频数据源,也不会开放权重。
2025 年夏季,Meta 将 AI 部门重组至 Superintelligence Labs 旗下,并从 OpenAI、Google DeepMind 和 Apple 招揽顶尖研究员,提供四年高达 $3 亿美元的薪酬包。不过并非所有人都留了下来,有些人在入职仅数周后便重返 OpenAI。