进阶 unsloth.ai 2026-10-07 22:27:00 · 6 阅读
第24章 如何运行 DeepSeek-R1 / R1 Zero
unsloth
下载
☰
下载
博客运行与微调 DeepSeek-R12025年1月20日 • 作者:Daniel & MichaelDeepSeek 新发布的 R1 模型刷新了推理性能基准,比肩 OpenAI 的 o1 模型。这是继不久前发布的、迄今最强开源 AI 模型 DeepSeek-V3 之后的又一力作。DeepSeek 还将 R1 蒸馏后在 Llama 3 和 Qwen 2.5 模型上进行了微调,也就是说你现在可以直接用 Unsloth 开箱即用地微调这些模型。
前往我们的合集查看 R1 模型系列的全部版本,包括 GGUF、4-bit 等:huggingface.co/collections/unsloth/deepseek-r1
2025年1月27日更新:我们发布了 DeepSeek-R1 的 1.58-bit 动态 GGUF 版本,体积缩小 80%,运行效果更好:1.58-bit Dynamic R1
2025年2月6日更新:你现在可以用 GRPO + Unsloth 训练自己的类 R1 推理模型🖥️ 如何运行 DeepSeek-R1 模型运行 DeepSeek-R1 并不容易:它的未量化 8-bit 版本高达 700GB,原始训练精度为 FP8。由于 GGUF 要求 FP16 格式,直接转换行不通,所以我们先将其转换为 FP16 再制作了 GGUF 版本。好消息是,DeepSeek 团队发布了 R1 的 Llama 和 Qwen 蒸馏版模型,体积小得多,可以在你自己的设备上轻松本地运行。
要运行 DeepSeek-R1 / R1-Zero,你需要安装开源工具包 llama.cpp——这是使用 GGUF 文件的原始框架。硬件要求:不需要 GPU,有内存的 CPU 即可,但要确保磁盘空间充足。🦙 使用 llama.cpp:以下步骤适用于 R1 蒸馏版和非蒸馏版模型,但请注意两者对硬件的要求不同。R1 的硬件要求见下文。别忘了 `<|User|>` 和 `<|Assistant|>` 这两个 token!——或者使用聊天模板格式化工具请获取最新版 `llama.cpp`:github.com/ggerganov/llama.cppQ8_0 K 量化缓存示例 注意 -no-cnv 会关闭自动对话模式
./llama.cpp/llama-cli \
--model unsloth/DeepSeek-R1-Distill-Llama-8B-GGUF/DeepSeek-R1-Distill-Llama-8B-Q4_K_M.gguf \
--cache-type-k q8_0 \
--threads 16 \
--prompt '<|User|>What is 1+1?<|Assistant|>' \
-no-cnv
输出示例:
好的,我需要弄清楚 1+1 等于多少。嗯,该从哪里开始呢?我记得在学校里学过,数字加法是很基础的内容,但我想确保自己真正理解了它。 让我想想,1 加 1。所以我有一个物品,再加一个。也许就像一个苹果加上另一个苹果。如果我有一个苹果,别人又给我一个,我现在就有两个苹果了。所以,1+1 应该是 2。这很有道理。 等等,但有时候数学可能会很棘手。会不会是别的结果?比如在某种不同的进制下?不过我觉得这个问题很直接,用的是常规数字,而不是二进制或十六进制之类的。 我还记得,在算术中,加法是合并数量。所以,如果你有数量为 1 的两个量,合并它们的总和就是 2。是的,这似乎是对的。 有没有什么情况下 1+1 不等于 2?我想不出来…… 如果你的 GPU(例如 RTX 4090)有 24GB 显存,你可以将多层模型卸载到 GPU 以加速处理。如果你有多个 GPU,可能可以卸载更多的层。 ./llama.cpp/llama-cli \
--model unsloth/DeepSeek-R1-Distill-Llama-8B-GGUF/DeepSeek-R1-Distill-Llama-8B-Q4_K_M.gguf
--cache-type-k q8_0
--threads 16
--prompt '<|User|>What is 1+1?<|Assistant|>'
--n-gpu-layers 20 \
-no-cnv
R1 / Zero 的硬件要求:不一定需要 GPU。你只需要一个拥有至少 48GB 内存和至少 250GB 磁盘空间的 CPU 即可。
虽然这是最低要求,但性能可能会非常慢。在最低配置硬件上,每秒生成的 token 数可能少于 1.5 个——但这并不意味着你不能进行实验!使用 GPU 会让你的推理速度更快。
以下是 DeepSeek-R1 GGUF 量化版本的详细信息表,包括磁盘空间需求:
⚙️微调 DeepSeek R1 微调推理模型仍是一个相对新兴的探索领域。不过,由于 DeepSeek 的蒸馏模型基于 Llama 和 Qwen 架构构建,它们开箱即用地与 Unsloth 完全兼容。 我们即将推出一份专门用于微调推理模型的示例 notebook。在此之前,你可以免费使用我们现有的 Llama 或 Qwen Colab notebook 进行微调。只需将模型名称更新为对应的名称即可。例如,将 'unsloth/Meta-Llama-3.1-8B' 替换为 'unsloth/DeepSeek-R1-Distill-Llama-8B-unsloth-bnb-4bit'。 你可以在这里查看我们当前所有的免费微调 notebook。💕 谢谢!照例,衷心感谢每一位使用和分享 Unsloth 的朋友——我们非常感激。🙏 一如既往,请务必加入我们的 Reddit 页面和 Discord 服务器,获取帮助或表达支持!你也可以在 Twitter 和订阅邮件中关注我们。感谢阅读! Daniel & Michael Han 🦥 2025年1月20日 现在就可以微调 Vision 模型!免费开始体验 加入我们的 Discord
前往我们的合集查看 R1 模型系列的全部版本,包括 GGUF、4-bit 等:huggingface.co/collections/unsloth/deepseek-r1
2025年1月27日更新:我们发布了 DeepSeek-R1 的 1.58-bit 动态 GGUF 版本,体积缩小 80%,运行效果更好:1.58-bit Dynamic R1
2025年2月6日更新:你现在可以用 GRPO + Unsloth 训练自己的类 R1 推理模型🖥️ 如何运行 DeepSeek-R1 模型运行 DeepSeek-R1 并不容易:它的未量化 8-bit 版本高达 700GB,原始训练精度为 FP8。由于 GGUF 要求 FP16 格式,直接转换行不通,所以我们先将其转换为 FP16 再制作了 GGUF 版本。好消息是,DeepSeek 团队发布了 R1 的 Llama 和 Qwen 蒸馏版模型,体积小得多,可以在你自己的设备上轻松本地运行。
要运行 DeepSeek-R1 / R1-Zero,你需要安装开源工具包 llama.cpp——这是使用 GGUF 文件的原始框架。硬件要求:不需要 GPU,有内存的 CPU 即可,但要确保磁盘空间充足。🦙 使用 llama.cpp:以下步骤适用于 R1 蒸馏版和非蒸馏版模型,但请注意两者对硬件的要求不同。R1 的硬件要求见下文。别忘了 `<|User|>` 和 `<|Assistant|>` 这两个 token!——或者使用聊天模板格式化工具请获取最新版 `llama.cpp`:github.com/ggerganov/llama.cppQ8_0 K 量化缓存示例 注意 -no-cnv 会关闭自动对话模式
./llama.cpp/llama-cli \
--model unsloth/DeepSeek-R1-Distill-Llama-8B-GGUF/DeepSeek-R1-Distill-Llama-8B-Q4_K_M.gguf \
--cache-type-k q8_0 \
--threads 16 \
--prompt '<|User|>What is 1+1?<|Assistant|>' \
-no-cnv
输出示例:
好的,我需要弄清楚 1+1 等于多少。嗯,该从哪里开始呢?我记得在学校里学过,数字加法是很基础的内容,但我想确保自己真正理解了它。 让我想想,1 加 1。所以我有一个物品,再加一个。也许就像一个苹果加上另一个苹果。如果我有一个苹果,别人又给我一个,我现在就有两个苹果了。所以,1+1 应该是 2。这很有道理。 等等,但有时候数学可能会很棘手。会不会是别的结果?比如在某种不同的进制下?不过我觉得这个问题很直接,用的是常规数字,而不是二进制或十六进制之类的。 我还记得,在算术中,加法是合并数量。所以,如果你有数量为 1 的两个量,合并它们的总和就是 2。是的,这似乎是对的。 有没有什么情况下 1+1 不等于 2?我想不出来…… 如果你的 GPU(例如 RTX 4090)有 24GB 显存,你可以将多层模型卸载到 GPU 以加速处理。如果你有多个 GPU,可能可以卸载更多的层。 ./llama.cpp/llama-cli \
--model unsloth/DeepSeek-R1-Distill-Llama-8B-GGUF/DeepSeek-R1-Distill-Llama-8B-Q4_K_M.gguf
--cache-type-k q8_0
--threads 16
--prompt '<|User|>What is 1+1?<|Assistant|>'
--n-gpu-layers 20 \
-no-cnv
R1 / Zero 的硬件要求:不一定需要 GPU。你只需要一个拥有至少 48GB 内存和至少 250GB 磁盘空间的 CPU 即可。
虽然这是最低要求,但性能可能会非常慢。在最低配置硬件上,每秒生成的 token 数可能少于 1.5 个——但这并不意味着你不能进行实验!使用 GPU 会让你的推理速度更快。
以下是 DeepSeek-R1 GGUF 量化版本的详细信息表,包括磁盘空间需求:
⚙️微调 DeepSeek R1 微调推理模型仍是一个相对新兴的探索领域。不过,由于 DeepSeek 的蒸馏模型基于 Llama 和 Qwen 架构构建,它们开箱即用地与 Unsloth 完全兼容。 我们即将推出一份专门用于微调推理模型的示例 notebook。在此之前,你可以免费使用我们现有的 Llama 或 Qwen Colab notebook 进行微调。只需将模型名称更新为对应的名称即可。例如,将 'unsloth/Meta-Llama-3.1-8B' 替换为 'unsloth/DeepSeek-R1-Distill-Llama-8B-unsloth-bnb-4bit'。 你可以在这里查看我们当前所有的免费微调 notebook。💕 谢谢!照例,衷心感谢每一位使用和分享 Unsloth 的朋友——我们非常感激。🙏 一如既往,请务必加入我们的 Reddit 页面和 Discord 服务器,获取帮助或表达支持!你也可以在 Twitter 和订阅邮件中关注我们。感谢阅读! Daniel & Michael Han 🦥 2025年1月20日 现在就可以微调 Vision 模型!免费开始体验 加入我们的 Discord