← 文章 / 行业与公司动态
The Decoder 1小时前 · 2026-10-03 03:30:25 · 3 阅读

微软 AI 发布新一代语音转录与文本转语音模型,助力语音代理开发

微软 AI 发布了 MAI-Transcribe-2-Streaming,这是一款用于实时转录的新模型。微软表示,该模型在 Artificial Analysis 的准确率排行榜上位列第一。它能处理 60 种语言,并在 100 毫秒多一点的时间内输出首批部分结果。据微软称,这一特性允许语音代理在用户尚未说完一句完整的话时就作出响应。年底前,以入门价格计算,每小时音频的费用为 $0.54。

微软还发布了两个新的文本转语音模型。MAI-Voice-2.1 旨在用同一种声音说 23 种语言,且每种语言均带有母语口音。微软称,MAI-Voice-2.1-Flash 版本的延迟为 150 毫秒,每百万字符的价格从 $22 降至 $15。

这两个语音模型仅需几秒参考音频即可克隆人声,并内置安全措施以防止滥用。这些模型可通过 Microsoft Foundry 和 MAI Playground 等其他平台获取,两个语音模型也已在 OpenRouter 上线。在一项测试中,4000 名参与者中约有半数认为这些声音来自真人。

原始来源: The Decoder

评论 (0)