进阶 unsloth.ai 2026-10-07 22:27:00 · 6 阅读

第20章 利用 Unsloth 微调 Qwen 2.5 Coder:加速 2 倍与显存优化

unsloth

下载

☰

下载

博客 | Qwen 2.5 Coder 微调 | 2024年11月13日 • 作者 Daniel & Michael

Qwen 2.5 和 Qwen 2.5 Coder 模型现已获得支持。Unsloth 让 Qwen 2.5 的微调速度比 Flash Attention 2(FA2)+ Hugging Face(HF)快 2 倍,显存占用减少 60%。

我们上传了可在免费 Tesla T4 上微调的 Google Colab 笔记本:Qwen 2.5 Coder(14B)和 Qwen 2.5(7B)。原版模型只有 32K 上下文长度,Qwen 使用 YaRN 将其从 32B 扩展到 128K。我们上传了原生 128K 的 GGUF 文件,并在 Hugging Face 上建立了完整的 Qwen 2.5 模型合集。更新:2024年11月13日 - 修复了 GGUF 的 YaRN 配置,现在应该都能正常使用了!

所有模型上传请见这里。

✍️ Qwen 2.5 分析

我们还发现了一些 Qwen 2.5 模型的 bug,详见我们的推文:

`pad_token` 不应该设置为 `<|endoftext|>`,否则微调时会出现无限生成的问题。修复文件已上传到 Hugging Face。

Base 模型中的 `<|im_start|>` 和 `<|im_end|>` token 未经训练。如果你在 Base 模型上微调或推理,切勿在聊天模板中使用它们。

对 Base(左)和 Instruct(右)版本的嵌入做 PCA 分析,你会首先看到 BPE 的层级结构,同时也能发现 `<|im_start|>` 和 `<|im_end|>` 在 Base 模型中未经训练(位置重合),而在 Instruct 模型中则分开了。

💕 感谢大家!

一如既往,非常感谢所有使用和分享 Unsloth 的朋友,我们由衷感激。

欢迎加入我们的 Discord 服务器寻求帮助或表达支持!也可以在 Twitter 和 Substack 上关注我们。

感谢阅读!

Daniel & Michael Han 🦥

2024年11月13日

多模态微调 | 免费开始使用

加入我们的 Discord

评论 (0)