← 文章 / AI技术
The Decoder 2小时前 · 2026-09-27 19:29:42 · 1 阅读

Nvidia 免费开源 1 亿参数模型,可实时区分最多八位说话者

Nvidia 发布了 Nemotron 3 Diarization,这是一个能在对话中实时识别当前说话者的 AI 模型。该模型约有 1 亿参数,权重已在 Hugging Face 上免费开放。它最多可以区分八位说话者,还能检测出多人同时说话的情况。参与者更多、背景噪音大或有混响时,错误率会升高。配合Parakeet 这类语音识别系统,该模型可以生成带说话者标签的转录文本,不过标签只是"speaker_2"这样的匿名标识。它既支持录音文件,也支持实时音频。

柱状图:VoiceArena 基准测试中十二个英语对话合成模型的对比;NVIDIA Nemotron 3 以 14.7% 取得最佳成绩。
在 VoiceArena Diarization Benchmark v1 中,免费开放的 Nemotron 3 以 14.7% 的 DER(说话者错误率)领先,比上一代 Streaming Sortformer 表现好 41%。

音频缓冲区可在 30.4 秒到 0.32 秒之间设置四档,缓冲越短,准确率通常越低。在 VoiceArena 的 Diarization-Bench 上,该模型目前以 14.72% 的错误率排名第一,次优系统为 19.3%。这项基准测试标准很严格:重叠语音会计入评分,说话者切换时哪怕极小的错位也会被算作错误。与上一代 Streaming Sortformer 相比,在 1.04 秒缓冲设置下,新模型在八个测试场景中的错误率平均降低了 41%。

原始来源: The Decoder

评论 (0)