进阶 unsloth.ai 2026-10-07 22:27:00 · 7 阅读
第33章 使用 Unsloth 微调和运行 Llama 4
unsloth
下载
☰
下载
博客用 Unsloth 微调并运行 Llama 42025年4月7日 • 作者:Daniel & Michael2025年4月7日 • 作者:Daniel & MichaelMeta 全新 Llama 4 模型现在可以通过 Unsloth 进行微调和运行。
Llama 4 Scout(170亿参数,16 个专家)是同规模中表现最好的模型,支持 1000 万上下文窗口。
Llama 4 Maverick(170亿参数,128 个专家)在推理和编程方面超越了 GPT-4o,可与 DeepSeek v3 媲美。点击阅读 Llama 4 运行指南Unsloth 让 Llama-4-Scout(1090亿参数)的训练仅需 71GB 显存。Unsloth 是唯一支持 Llama 4 QLoRA 4-bit 训练的框架。Scout 可以在单张 H100 80GB 显卡上运行。与使用 Flash Attention 2 的环境相比,Unsloth 让 Llama 4 微调速度提升 1.5 倍、显存占用减少 50%、上下文长度扩展 8 倍。我们已在 Hugging Face 上传了 Llama 4 模型,包括动态 GGUF、动态 4-bit 和 16-bit 版本。16-bit 和 FP8 版本可以在任何环境运行(如 vLLM),但 4-bit 和 8-bit 版本仅支持在 Unsloth 上进行训练和推理。Unsloth 现在还全面支持:全参数微调、8-bit、预训练、所有 Transformer 架构模型(Mixtral、MOE、Cohere 等),以及任意训练算法(如结合 VLM 的 GRPO)。性能基准测试模型显存🦥 Unsloth 速度🦥 显存节省🦥 上下文延长🤗 Hugging Face+FA2Llama 4 Scout80GB1.5 倍>50%8 倍更长OOM我们在一张 80GB A100 上测试了 Llama-4-Scout-Instruct,对所有线性层(Q、K、V、O、gate、up 和 down)进行 4-bit QLoRA 训练,rank 为 32,batch size 为 1。我们将所有序列填充到固定的最大序列长度,以模拟长上下文微调的工作负载。
目前只有 🦥Unsloth 支持 Llama 4 Scout 的 4-bit QLoRA 微调。其他框架尚未支持 Llama 4 的 4-bit 微调,显存占用会显著增加(300GB 以上),经常导致显存溢出(OOM)错误。
为了确保公平对比,我们在所有平台上都用 LoRA(而非 QLoRA)对 Llama 4 Scout 进行了基准测试。否则,由于 Unsloth 对 QLoRA 的完善支持,其显存节省效果可达 400%。💕 感谢大家!非常感谢所有使用和分享 Unsloth 的用户,我们由衷感激。当然也要感谢构建这些模型的 Meta。🙏
一如既往,欢迎加入我们的 Reddit 页面和 Discord 服务器获取帮助或表达支持!你也可以在 Twitter 上关注我们,并订阅我们的 newsletter。感谢阅读!Daniel & Michael Han 🦥
7 Apr 2025 现在即可免费微调 Llama 4!立即免费开始 加入我们的 Discord
Llama 4 Scout(170亿参数,16 个专家)是同规模中表现最好的模型,支持 1000 万上下文窗口。
Llama 4 Maverick(170亿参数,128 个专家)在推理和编程方面超越了 GPT-4o,可与 DeepSeek v3 媲美。点击阅读 Llama 4 运行指南Unsloth 让 Llama-4-Scout(1090亿参数)的训练仅需 71GB 显存。Unsloth 是唯一支持 Llama 4 QLoRA 4-bit 训练的框架。Scout 可以在单张 H100 80GB 显卡上运行。与使用 Flash Attention 2 的环境相比,Unsloth 让 Llama 4 微调速度提升 1.5 倍、显存占用减少 50%、上下文长度扩展 8 倍。我们已在 Hugging Face 上传了 Llama 4 模型,包括动态 GGUF、动态 4-bit 和 16-bit 版本。16-bit 和 FP8 版本可以在任何环境运行(如 vLLM),但 4-bit 和 8-bit 版本仅支持在 Unsloth 上进行训练和推理。Unsloth 现在还全面支持:全参数微调、8-bit、预训练、所有 Transformer 架构模型(Mixtral、MOE、Cohere 等),以及任意训练算法(如结合 VLM 的 GRPO)。性能基准测试模型显存🦥 Unsloth 速度🦥 显存节省🦥 上下文延长🤗 Hugging Face+FA2Llama 4 Scout80GB1.5 倍>50%8 倍更长OOM我们在一张 80GB A100 上测试了 Llama-4-Scout-Instruct,对所有线性层(Q、K、V、O、gate、up 和 down)进行 4-bit QLoRA 训练,rank 为 32,batch size 为 1。我们将所有序列填充到固定的最大序列长度,以模拟长上下文微调的工作负载。
目前只有 🦥Unsloth 支持 Llama 4 Scout 的 4-bit QLoRA 微调。其他框架尚未支持 Llama 4 的 4-bit 微调,显存占用会显著增加(300GB 以上),经常导致显存溢出(OOM)错误。
为了确保公平对比,我们在所有平台上都用 LoRA(而非 QLoRA)对 Llama 4 Scout 进行了基准测试。否则,由于 Unsloth 对 QLoRA 的完善支持,其显存节省效果可达 400%。💕 感谢大家!非常感谢所有使用和分享 Unsloth 的用户,我们由衷感激。当然也要感谢构建这些模型的 Meta。🙏
一如既往,欢迎加入我们的 Reddit 页面和 Discord 服务器获取帮助或表达支持!你也可以在 Twitter 上关注我们,并订阅我们的 newsletter。感谢阅读!Daniel & Michael Han 🦥
7 Apr 2025 现在即可免费微调 Llama 4!立即免费开始 加入我们的 Discord
上一篇
第32章 本地运行 DeepSeek-V3-0324:Unsloth 动态量化 GGUF 实践指南
下一篇
第34章 Unsloth 发布 Dynamic v2.0 量化方案,支持主流大模型精度提升