进阶 unsloth.ai 2026-10-07 22:27:00 · 6 阅读
第19章 Unsloth 支持 Llama 3.2 视觉模型微调:提速 2 倍且大幅降低显存
unsloth
下载
☰
下载
BlogLlama 3.2 Vision 微调Nov 21, 2024 • By Daniel & MichaelUnsloth 现已支持视觉/多模态模型,包括 Meta 的 Llama 3.2(11B 和 90B)模型。与 Flash Attention 2(FA2)+ Hugging Face(HF)相比,Unsloth 能让视觉模型微调速度提升 1.5-2 倍,显存占用最高减少 70%,并支持 4-8 倍的上下文长度。
我们上传了 Google Colab 笔记本,可以在免费的 Tesla T4 上针对不同场景进行微调(只需把模型名改成你想要的那个):Llama 3.2 Vision (11B) - 放射影像用例:Colab • KaggleQwen 2 VL (7B) - 数学 OCR 转 LaTeX:Colab • KaggleMistral - Pixtral (12B) 2409 - 通用问答数据集:Colab我们还把所有视觉模型——包括 Llama 3.2 Vision、Llava、Pixtral 和 Qwen2 VL——以原始 16bit 和预量化 4bit(下载速度快 4 倍)两种格式上传到了 Hugging Face。别忘了在 Hugging Face 上关注我们,上传新模型时就能第一时间收到更新!目前只有 Instruct 版本的视觉语言模型(VLM)可用,base 版本的支持也在开发中。
12 月 24 日更新:Qwen 新推出的类 o1 视觉模型 QvQ(72B)现已支持,详见 QvQ collection。
所有模型上传记录见这里。分步教程即将发布在我们的文档网站上!👁️ 修复视觉相关 Bug在发布任何模型支持之前,我们都会优先确保一切准确无误、按预期运行。在这个过程中,我们发现并解决了大量问题,比如 chat template 中的 bug、显存占用问题等等。
例如,我们发现并修复了 Pixtral 在 Hugging Face 上的 chat template 问题,并为 Pixtral 添加了 SDPA 支持以降低显存占用。Pixtral 微调也能塞进 16GB 显存的 GPU 里,不过费了一些调整才搞定。我们还为其他模型加入了完整的 gradient checkpointing 支持,把显存占用从 20GB 以上降到了 5GB。此外还有许多其他 bug 修复!用 Unsloth 做视觉微调,效果最佳。💡 视觉微调细节微调视觉模型在各行各业都有大量应用场景,可以让模型适应特定任务和数据集。我们提供了 3 个视觉微调的示例。
1. 针对 X 光、CT 扫描和超声波影像的 Llama 3.2 Vision 微调——如何帮助医疗专业人员更快地分析医学影像。
2. 微调 Qwen 2 VL 实现手写转 LaTeX——无需手动输入即可轻松将复杂数学公式转录为 LaTeX。
3. 微调 Pixtral 12B 视觉模型以支持通用问答——可将通用问答数据集与更垂直的数据集拼接,防止微调后模型遗忘基础能力。
现在,您可以选择微调视觉模型的不同部分,例如仅微调视觉层、语言层,或注意力 / MLP 层!我们默认开启全部层!🌟 Qwen 2.5 + CoderQwen 2.5 和 Qwen 2.5 Coder 模型现已获得支持,我们还发现并修复了一些 bug。已上传 适用于免费 Tesla T4 微调的 Google Colab 笔记本:Qwen 2.5 Coder (14B)Qwen 2.5 (7B)原版模型仅支持 32K 上下文长度。Qwen 使用 YaRN 将其从 32B 扩展至 128K。我们上传了原生 128K 的 GGUF 文件,并在 Hugging Face 上构建了完整的 Qwen 2.5 模型合集。💕 感谢! 照例,衷心感谢所有使用并分享 Unsloth 的朋友,我们非常感激。也要特别感谢新晋支持者:Jeffrey、kaeru39 和 Uday! 🙏
欢迎加入我们的 Reddit 页面和 Discord 服务器获取帮助或表达支持!您也可以关注我们的 Twitter 并订阅通讯。感谢阅读!Daniel & Michael Han 🦥
2024 年 11 月 21 日多模态微调免费开始 加入我们的 Discord
我们上传了 Google Colab 笔记本,可以在免费的 Tesla T4 上针对不同场景进行微调(只需把模型名改成你想要的那个):Llama 3.2 Vision (11B) - 放射影像用例:Colab • KaggleQwen 2 VL (7B) - 数学 OCR 转 LaTeX:Colab • KaggleMistral - Pixtral (12B) 2409 - 通用问答数据集:Colab我们还把所有视觉模型——包括 Llama 3.2 Vision、Llava、Pixtral 和 Qwen2 VL——以原始 16bit 和预量化 4bit(下载速度快 4 倍)两种格式上传到了 Hugging Face。别忘了在 Hugging Face 上关注我们,上传新模型时就能第一时间收到更新!目前只有 Instruct 版本的视觉语言模型(VLM)可用,base 版本的支持也在开发中。
12 月 24 日更新:Qwen 新推出的类 o1 视觉模型 QvQ(72B)现已支持,详见 QvQ collection。
所有模型上传记录见这里。分步教程即将发布在我们的文档网站上!👁️ 修复视觉相关 Bug在发布任何模型支持之前,我们都会优先确保一切准确无误、按预期运行。在这个过程中,我们发现并解决了大量问题,比如 chat template 中的 bug、显存占用问题等等。
例如,我们发现并修复了 Pixtral 在 Hugging Face 上的 chat template 问题,并为 Pixtral 添加了 SDPA 支持以降低显存占用。Pixtral 微调也能塞进 16GB 显存的 GPU 里,不过费了一些调整才搞定。我们还为其他模型加入了完整的 gradient checkpointing 支持,把显存占用从 20GB 以上降到了 5GB。此外还有许多其他 bug 修复!用 Unsloth 做视觉微调,效果最佳。💡 视觉微调细节微调视觉模型在各行各业都有大量应用场景,可以让模型适应特定任务和数据集。我们提供了 3 个视觉微调的示例。
1. 针对 X 光、CT 扫描和超声波影像的 Llama 3.2 Vision 微调——如何帮助医疗专业人员更快地分析医学影像。
2. 微调 Qwen 2 VL 实现手写转 LaTeX——无需手动输入即可轻松将复杂数学公式转录为 LaTeX。
3. 微调 Pixtral 12B 视觉模型以支持通用问答——可将通用问答数据集与更垂直的数据集拼接,防止微调后模型遗忘基础能力。
现在,您可以选择微调视觉模型的不同部分,例如仅微调视觉层、语言层,或注意力 / MLP 层!我们默认开启全部层!🌟 Qwen 2.5 + CoderQwen 2.5 和 Qwen 2.5 Coder 模型现已获得支持,我们还发现并修复了一些 bug。已上传 适用于免费 Tesla T4 微调的 Google Colab 笔记本:Qwen 2.5 Coder (14B)Qwen 2.5 (7B)原版模型仅支持 32K 上下文长度。Qwen 使用 YaRN 将其从 32B 扩展至 128K。我们上传了原生 128K 的 GGUF 文件,并在 Hugging Face 上构建了完整的 Qwen 2.5 模型合集。💕 感谢! 照例,衷心感谢所有使用并分享 Unsloth 的朋友,我们非常感激。也要特别感谢新晋支持者:Jeffrey、kaeru39 和 Uday! 🙏
欢迎加入我们的 Reddit 页面和 Discord 服务器获取帮助或表达支持!您也可以关注我们的 Twitter 并订阅通讯。感谢阅读!Daniel & Michael Han 🦥
2024 年 11 月 21 日多模态微调免费开始 加入我们的 Discord