The Decoder 1小时前 · 2026-09-23 21:12:53 · 0 阅读
阿里发布 Qwen Audio 3.1,多模态模型上线,AI 音频价格最高降 95%
阿里巴巴AI团队Qwen正式发布Qwen-Audio 3.1,这是一组包含五个模型的系列,支持语音识别(ASR)、文本转语音(TTS)和实时交互。ASR模型在多方言和语言识别上有所改进,并自动清除语气词和重复内容。ASR-Next增加了带时间戳的多说话人识别功能,并能检测情绪、环境音和机器噪音。TTS支持多语言合成,自然地进行跨语言语音转换。用户通过简单的文本提示即可控制情绪、语速和风格,例如输入“用尖锐、威严的语气朗读,令人肃然起敬”。
TTS-Next结合语言模型与扩散模型,一次性生成语音、音效和背景音频。实时模型支持即说即听,可即时打断。根据Qwen介绍,当检测到说话人情绪低落时,系统会以更慢的语速和更具共情的方式回应。阿里巴巴还在大幅下调价格:TTS降价约70%,Realtime降约85%,ASR降幅最高达95%。更多详情可查看官方博客及Qwen Cloud。
原始来源: The Decoder