进阶 unsloth.ai 2026-10-07 22:27:00 · 6 阅读

第36章 使用 Unsloth 微调 TTS 模型

unsloth

下载

☰

下载

博客微调 TTS 模型 2025年5月2日 • 作者 Daniel & Michael 2025年5月15日 • 作者 Daniel & Michael 现在你可以在 Unsloth 中训练文本转语音(TTS)模型了!微调 TTS 模型能使其适配你的特定数据集、使用场景或期望的语音风格与语调。目标是为语音克隆、说话风格适应、语调调节、多语言支持及其他专业应用定制这些模型。

该支持还涵盖语音转文本(STT)模型,如 OpenAI 的 Whisper,以及标准 TTS 模型,如 Sesame 的 CSM、Orpheus,以及 transformers 支持的模型(例如 CrisperWhisper、Spark、Outte 等)。

与其他配置相比,使用 FA2 时,训练速度快约 1.5 倍,VRAM 占用减少 50%。

我们制作了免费笔记本,可在 Google Colab 上训练、运行和保存这些模型。部分模型不受 llama.cpp 支持,因此仅保存为 safetensors 格式,但其他模型应该可以正常工作。在此查看我们所有的 TTS(包括 CSM-1B、Whisper 等)笔记本。

在此阅读我们关于如何微调 TTS 模型的详细指南。

🔊 TTS 微调

训练过程与常规的 SFT 微调类似,但数据集包含带有转录文本的音频片段。我们使用一个名为 “Elise” 的数据集,它将 或 等情感标签嵌入转录文本中,从而触发与情感相匹配的表现力音频。

我们建议从 Orpheus-TTS-3B 开始,因为它基于 Llama 架构,因此易于训练且在许多地方具有兼容性。由于 TTS 模型通常较小,你可以使用 16 位 LoRA 进行训练,或者选择 FFT。加载 16 位 LoRA 模型很简单。

我们将大多数 TTS 模型(量化版和原版)上传到了 Hugging Face,链接在此。

确保你使用的是 Unsloth 的最新 pip 版本。要更新,请使用:pip install --upgrade --force-reinstall --no-cache-dir unsloth unsloth_zoo

💕 谢谢!特别感谢 Etherll 帮助我们实现 TTS 功能。当然也要感谢所有使用并分享 Unsloth 的人 - 我们非常感激。 🙏

一如既往,请加入我们的 Reddit 页面和 Discord 服务器以获取帮助或表示支持!你还可以在 Twitter 上关注我们并订阅我们的通讯。

感谢阅读!

Daniel & Michael Han 🦥

2025年5月15日

现在免费微调 TTS!

免费开始

加入我们的 Discord

评论 (0)