4GB显存也能跑!笔记本本地部署AI大模型完整教程
<font face="黑体">为什么要本地部署</font>AI? 1. 隐私安全:所有对话数据都在你自己电脑上,不会上传到云端 2. 免费无限用:不花一分钱API费用,想怎么聊就怎么聊 3. 离线可用:没网的时候也能用,出差、飞机上都不怕 4. 可定制:可以根据自己的需求微调模型,打造专属助手 |
一、部署前的准备工作
1.1 硬件要求
首先来看看你的电脑能不能跑。不用担心,要求真的不高:硬件 | 最低要求 | 推荐配置 |
显卡 | NVIDIA 4GB显存 | NVIDIA 6GB以上显存 |
内存 | 8GB | 16GB以上 |
存储 | 10GB空闲空间 | 20GB以上SSD |
系统 | Windows 10 / macOS 12 / Ubuntu 20.04 | Windows 11 / 最新macOS |
1.2 为什么选择Ollama?
市面上本地部署AI的工具不少,比如Text Generation WebUI、LM Studio等等,但为什么我首推Ollama?因为它真的太简单了:• 一键安装,下一步下一步就搞定,不用折腾环境• 模型管理命令简单,拉模型、删模型一行命令• 自动调用GPU加速,不用手动配置CUDA• 开源免费,持续更新,模型生态丰富• 支持Windows、macOS、Linux三大平台二、安装Ollama,五分钟搞定
2.1 下载与安装
第一步:打开Ollama官网,地址是 ollama.com。官网会自动识别你的操作系统,点击下载按钮就行。Windows用户下载.exe安装包,Mac用户下载.dmg镜像。Windows用户: 1. 双击下载的 OllamaSetup.exe 2. 一路点击"下一步" 3. 等待安装完成 4. 安装完成后,Ollama会自动在后台运行 |
2.2 验证安装是否成功
安装完成后,我们打开命令行工具(Windows按Win+R输入cmd,Mac打开终端),输入以下命令验证:ollama --version |
<font face="黑体">小提示</font> Windows用户如果提示"ollama不是内部或外部命令",只需要重启一下命令行工具,或者重启电脑就好了。这是因为环境变量还没生效。 |
2.3 常用命令速查表
Ollama的命令很简单,记住这几个就够用了:命令 | 作用 | 示例 |
ollama run 模型名 | 运行/对话 | ollama run qwen2:1.5b |
ollama list | 查看已安装的模型 | ollama list |
ollama pull 模型名 | 下载模型 | ollama pull qwen2:1.5b |
ollama rm 模型名 | 删除模型 | ollama rm qwen2:1.5b |
ollama --help | 查看帮助 | ollama --help |
三、选择适合小显存的AI模型
3.1 模型大小与显存对应关系
很多人搞不懂模型大小和显存的关系,我给大家整理了一张表,一看就明白:模型参数量 | 4bit量化后大小 | 需要显存 | 效果水平 |
1.5B | 约1GB | 2GB左右 | 日常问答够用 |
7B | 约4GB | 4-5GB | 接近ChatGPT水平 |
14B | 约8GB | 8-10GB | 专业领域可用 |
70B | 约40GB | 40GB以上 | 接近GPT-4水平 |
3.2 小显存推荐模型清单
根据我自己的测试,给小显存用户推荐这几个模型:模型名称 | 参数量 | 适合显存 | 特点 | 推荐指数 |
Qwen2-1.5B | 1.5B | 2GB以上 | 中文最好,最轻量 | ★★★★★ |
Qwen2-7B-Instruct | 7B | 6GB以上 | 中文最强,通用全能 | ★★★★☆ |
Llama3-8B-Instruct | 8B | 6GB以上 | 英文强,推理好 | ★★★★☆ |
Phi-3-mini | 3.8B | 4GB以上 | 微软出品,小巧强大 | ★★★★ |
Mistral-7B | 7B | 6GB以上 | 欧洲开源,代码不错 | ★★★☆ |
3.3 怎么选?给你个简单建议
选择建议 • 4GB显存:直接选 Qwen2:1.5b,中文效果不错,日常问答足够用• 6-8GB显存:首选 Qwen2:7b,中文最强,写代码、写文章都能打• 主要用英文:选 Llama3:8b,英文推理和代码能力更强• 追求小巧:Phi-3-mini 是3.8B大小,比7B小一半,效果也不差 |
四、运行你的第一个本地AI
4.1 命令行快速体验
理论讲完了,我们来实战一下。以Qwen2-1.5b为例,打开命令行,输入:ollama run qwen2:1.5b |
>>> 你好,请介绍一下你自己 <font face="Consolas">我是</font>Qwen,由阿里巴巴开发的大语言模型... >>> 写一个Python的Hello World程序 <font face="Consolas">当然可以,这是最简单的</font>Python程序: print("Hello, World!") |
4.2 安装可视化界面
命令行虽然方便,但总觉得不够直观。我们来装一个类似ChatGPT的网页界面,叫Open WebUI,体验和在线版一模一样。最简单的安装方式是用Docker:docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main |
pip install open-webui open-webui |
界面功能 Open WebUI功能非常丰富: • 类似ChatGPT的对话界面,支持多轮对话• 支持切换不同的模型• 支持对话历史保存和导出• 支持插件和扩展• 支持多人同时使用(家里的电脑可以当成AI服务器) |