IT之家 1小时前 · 2026-09-19 15:27:05 · 3 阅读
阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,支持原文译文同帧同出
官方表示,在支持 60 种语言的基础上,Qwen3.8-LiveTranslate 新增三项能力让同传更广泛的应用于真实场景中:
实时说话人分离,每句话归属清晰,音色复刻更稳定;
原文译文同帧同出,双语同屏;
长上下文消歧,联系前文读懂当下,人名术语翻译更精准。
Qwen3.8-LiveTranslate 采用基于 Hybrid MoE 的 Thinker–Talker 双模块设计,通过 Interleave 方式衔接流式理解、文本输出与语音生成。其中,Thinker 把视频、音频、原文与译文编排进同一条因果序列,按时序交替排列、端到端产出,让理解与翻译在单一序列内完成;Talker 再结合译文和源音频,把译文合成为保留原说话人音色的译文语音。
在覆盖 14 个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,Qwen3.8-LiveTranslate 在翻译的忠实度、流畅度、简洁度以及说话人识别的错误率 DER(Diarization Error Rate,说话人分离错误率)四个维度上均优于目前行业主流实时同传系统。
官方在公开 FLEURS 音频测试集上评测了 70 个语言方向的实时同传表现。Qwen3.8-LiveTranslate 在翻译质量、字均延迟、语音识别准确率以及语音合成质量四个维度上领先于上一代以及当前主流实时同传系统。
IT之家附相关链接:
原始来源: IT之家