← 文章 / AI技术
The Decoder 4小时前 · 2026-09-06 18:39:18 · 2 阅读

Meta发布Muse Voice Transcribe:实时音频转录模型的实时平衡与多语言优势

Image description

核心要点

  • Meta 发布了 Muse Voice Transcribe,这是一款实时模型,无需依赖独立系统即可同时完成语音转录、断句和最多 20 人语音分离。
  • 该模型将音频切分为 80 毫秒的片段,并根据难度动态调整每个单词的延迟,在速度与准确性之间实现实时平衡。
  • Meta 以每小时 0.18 美元的价格 undercut OpenAI 和 ElevenLabs 等竞争对手。该模型支持 70 多种语言,现已在 Meta AI 中可用,也可通过 Meta Model API 调用。

Meta 的 Superintelligence Labs 发布了其首款实时音频感知模型。它能够在对话进行中同步完成语音转录、说话人区分和句子边界检测。

Spark 系列模型将输入音频拆分为 80 毫秒的片段。在处理每个片段后,模型会决定是继续监听还是将下一个单词输出为文本,从而动态控制转录前的上下文积累量。

等待时间越长,准确性越高,但延迟也越大。据 Meta 介绍,Muse Voice Transcribe 会根据每个单词的难度动态调整等待时长:简单的词更快输出,难的词则获得更多监听时间。Meta 通过强化学习训练了这一行为,在奖励低错误率的同时也鼓励缩短延迟。

Streudiagramm mit Wortfehlerrate auf der Y-Achse und Zeit bis zur finalen Transkription auf der X-Achse, Muse Voice Transcribe liegt bei rund 3,0 Prozent und 0,16 Sekunden unterhalb der gestrichelten bisherigen Pareto-Front aus Soniox, Cartesia und ElevenLabs.
自适应延迟改变了速度与准确性的权衡关系,因为模型可以逐词决定继续监听的时长。| 图片来源:Meta

无需额外系统即可实现说话人分离与句子检测

Meta 将剩余功能集成到同一模型中,无需依赖独立系统。在说话人归属方面,模型会在实时文本中标记说话人切换,并为每个段落打上 A 到 Z 的标识符。在句子边界检测方面,它会标记每段话语的开始和结束位置。这两项任务均与语音识别联合训练。

该模型能同时区分 20 多位说话人,并可处理超过一小时的长录音而无需后期处理。据 Meta 介绍,在一个八人同处一室的演示中,系统能实时把每句话归属到对应的说话人。

多语言支持是核心卖点

Meta 表示,Muse Voice Transcribe 的训练数据覆盖 70 多种语言,其中 25 种经过了深度测试。模型还能处理语码转换,也就是说话人在句子中途切换语言的情况。提供语言、关键词和上下文提示可进一步提升准确率,尤其是对"Meta"、"Muse"、"Menlo Park"这类专有名词。

柱状图 "AA-WER Streaming Index Final Transcription" 对比八款流式转写系统,Muse Voice Transcribe 以 3.1% 词错误率领先,AssemblyAI U3.5 Realtime Pro 和 Gemini 3.5 Transcribe Live 均为 4.0% 排在最后。
在 Artificial Analysis 2026 年 9 月 1 日的测试中,Muse Voice Transcribe 在检测到语音结束后生成的最终转写稿准确率最高。| 图片来源:Meta

Artificial Analysis 在独立评测中证实了 Meta 的说法。Muse Voice Transcribe 在说话人讲完英语后 0.16 秒内输出结果,词错误率为 3.1%。ElevenLabs Scribe v2 Realtime 为 3.6%、耗时 0.14 秒,AssemblyAI Universal-3.5 Pro Realtime 为 4.0%。Cartesia Ink-2 的成绩则视模型是自行判断语音结束还是依赖外部系统而定,在 3.4% 和 4.0% 之间。竞争相当激烈:OpenAI 已于 5 月发布了同样面向实时场景的 GPT-Realtime-Whisper,并在 7 月下调了转写模型的价格

Meta 将此次发布与 CEO Mark Zuckerberg 提出的「个人超级智能」愿景挂钩。在一场预演演示中,Meta 员工表示,可靠的语音识别是个人 AI 智能体的基础,这些智能体能通过 AI 眼镜聆听真实对话。此前德国曾讨论禁止 Meta 的摄像眼镜,但德国联邦网络管理局最终决定不予追究。

可用性

Muse Voice Transcribe 现已驱动 Meta AIMuse Code 中的语音输入功能,并可通过 Meta Model API 使用。用户只需在任何应用中按住「Fn」键即可体验。

Meta 在定价上大幅 undercut 市场。该模型每小时收费 $0.18(即每 1,000 分钟音频 $3),低于 Cartesia Ink-2 的 $4,也低于 ElevenLabs Scribe v2 Realtime 和 Deepgram Flux 的 $6.50。

这延续了 Muse Spark 1.1 和 Muse Spark 1.2 的策略:以价格而非峰值性能为主要竞争力。Meta 未披露该模型的参数量、训练数据规模或音频数据源,也不会开放权重。

2025 年夏季,Meta 将 AI 部门重组至 Superintelligence Labs 旗下,并从 OpenAI、Google DeepMind 和 Apple 招揽顶尖研究员,提供四年高达 $3 亿美元的薪酬包。不过并非所有人都留了下来,有些人在入职仅数周后便重返 OpenAI

原始来源: The Decoder

评论 (0)