← 文章 / AI技术
大伟学习笔记ww 4小时前 · 2026-09-19 16:27:01 · 3 阅读

4GB显存也能跑!笔记本本地部署AI大模型完整教程

最近很多朋友问我:我的电脑只有4GB显存,能不能本地跑AI大模型?答案是:完全可以!以前大家总觉得,本地部署AI是高端显卡玩家的专属。但随着模型量化技术的进步,现在哪怕是轻薄本、旧笔记本,也能流畅运行7B甚至14B参数的大模型。今天这篇教程,我就从零开始,手把手教你在小显存笔记本上部署属于自己的本地AI助手,全程免费、离线可用、隐私安全。

<font face="黑体">为什么要本地部署</font>AI?

1. 隐私安全:所有对话数据都在你自己电脑上,不会上传到云端 2. 免费无限用:不花一分钱API费用,想怎么聊就怎么聊 3. 离线可用:没网的时候也能用,出差、飞机上都不怕 4. 可定制:可以根据自己的需求微调模型,打造专属助手

一、部署前的准备工作

1.1 硬件要求

首先来看看你的电脑能不能跑。不用担心,要求真的不高:

硬件

最低要求

推荐配置

显卡

NVIDIA 4GB显存

NVIDIA 6GB以上显存

内存

8GB

16GB以上

存储

10GB空闲空间

20GB以上SSD

系统

Windows 10 / macOS 12 / Ubuntu 20.04

Windows 11 / 最新macOS

注意:没有NVIDIA显卡也没关系,CPU也能跑,就是速度会慢一些。现在的Intel/AMD新CPU跑1.5B模型也还可以接受。

1.2 为什么选择Ollama?

市面上本地部署AI的工具不少,比如Text Generation WebUI、LM Studio等等,但为什么我首推Ollama?因为它真的太简单了:• 一键安装,下一步下一步就搞定,不用折腾环境• 模型管理命令简单,拉模型、删模型一行命令• 自动调用GPU加速,不用手动配置CUDA• 开源免费,持续更新,模型生态丰富• 支持Windows、macOS、Linux三大平台

二、安装Ollama,五分钟搞定

2.1 下载与安装

第一步:打开Ollama官网,地址是 ollama.com。官网会自动识别你的操作系统,点击下载按钮就行。Windows用户下载.exe安装包,Mac用户下载.dmg镜像。

Windows用户: 1. 双击下载的 OllamaSetup.exe 2. 一路点击"下一步" 3. 等待安装完成 4. 安装完成后,Ollama会自动在后台运行

Mac用户更简单,打开.dmg文件,把Ollama拖到Applications文件夹就完事了。

2.2 验证安装是否成功

安装完成后,我们打开命令行工具(Windows按Win+R输入cmd,Mac打开终端),输入以下命令验证:

ollama --version

如果显示出版本号,比如 "ollama version is 0.3.0",那就说明安装成功了!

<font face="黑体">小提示</font>

Windows用户如果提示"ollama不是内部或外部命令",只需要重启一下命令行工具,或者重启电脑就好了。这是因为环境变量还没生效。

2.3 常用命令速查表

Ollama的命令很简单,记住这几个就够用了:

命令

作用

示例

ollama run 模型名

运行/对话

ollama run qwen2:1.5b

ollama list

查看已安装的模型

ollama list

ollama pull 模型名

下载模型

ollama pull qwen2:1.5b

ollama rm 模型名

删除模型

ollama rm qwen2:1.5b

ollama --help

查看帮助

ollama --help

三、选择适合小显存的AI模型

3.1 模型大小与显存对应关系

很多人搞不懂模型大小和显存的关系,我给大家整理了一张表,一看就明白:

模型参数量

4bit量化后大小

需要显存

效果水平

1.5B

约1GB

2GB左右

日常问答够用

7B

约4GB

4-5GB

接近ChatGPT水平

14B

约8GB

8-10GB

专业领域可用

70B

约40GB

40GB以上

接近GPT-4水平

这里说的"4bit量化"是什么意思呢?简单说就是把模型文件压缩,体积变小很多,效果损失很小,但显存占用大幅下降。这就是小显存能跑大模型的核心秘密。

3.2 小显存推荐模型清单

根据我自己的测试,给小显存用户推荐这几个模型:

模型名称

参数量

适合显存

特点

推荐指数

Qwen2-1.5B

1.5B

2GB以上

中文最好,最轻量

★★★★★

Qwen2-7B-Instruct

7B

6GB以上

中文最强,通用全能

★★★★☆

Llama3-8B-Instruct

8B

6GB以上

英文强,推理好

★★★★☆

Phi-3-mini

3.8B

4GB以上

微软出品,小巧强大

★★★★

Mistral-7B

7B

6GB以上

欧洲开源,代码不错

★★★☆

3.3 怎么选?给你个简单建议

选择建议

• 4GB显存:直接选 Qwen2:1.5b,中文效果不错,日常问答足够用• 6-8GB显存:首选 Qwen2:7b,中文最强,写代码、写文章都能打• 主要用英文:选 Llama3:8b,英文推理和代码能力更强• 追求小巧:Phi-3-mini 是3.8B大小,比7B小一半,效果也不差

四、运行你的第一个本地AI

4.1 命令行快速体验

理论讲完了,我们来实战一下。以Qwen2-1.5b为例,打开命令行,输入:

ollama run qwen2:1.5b

第一次运行的时候,Ollama会自动下载模型文件,大概1GB左右,根据你的网速需要等几分钟。下载完成后,你就看到一个对话界面了!直接输入问题就能和AI聊天,比如:

>>> 你好,请介绍一下你自己 <font face="Consolas">我是</font>Qwen,由阿里巴巴开发的大语言模型... >>> 写一个Python的Hello World程序 <font face="Consolas">当然可以,这是最简单的</font>Python程序: print("Hello, World!")

是不是很简单?输入 /bye 就可以退出对话。

4.2 安装可视化界面

命令行虽然方便,但总觉得不够直观。我们来装一个类似ChatGPT的网页界面,叫Open WebUI,体验和在线版一模一样。最简单的安装方式是用Docker:

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

没有Docker也没关系,直接用Python安装:

pip install open-webui open-webui

安装完成后,打开浏览器访问 http://localhost:3000,第一次打开注册一个管理员账号就行,完全本地,不用担心数据泄露。

界面功能

Open WebUI功能非常丰富: • 类似ChatGPT的对话界面,支持多轮对话• 支持切换不同的模型• 支持对话历史保存和导出• 支持插件和扩展• 支持多人同时使用(家里的电脑可以当成AI服务器)

五、小显存优化技巧

5.1 显存不够怎么办?

如果你的电脑显存真的很紧张,比如只有4GB,但又想跑7B模型,怎么办?第一招:换更小的量化版本。Ollama默认下载的是最合适的量化版本,你可以试试更小的,比如qwen2:7b-q4_0,比默认的更小。第二招:开启CPU offload。让一部分模型放到内存里跑,速度会慢一点,但至少能跑起来。第三招:关掉其他占用显存的程序。比如游戏、视频剪辑软件、浏览器的硬件加速都关掉。

5.2 常见问题解答

问:为什么我的模型跑起来很慢?答:大概率是没有调用GPU。检查一下是不是NVIDIA显卡,驱动是不是最新的。CPU跑模型本来就慢,要有心理准备。问:中文效果不好怎么办?答:一定要选专门优化过中文的模型,比如Qwen系列、Yi系列,不要用英文模型硬跑中文。问:模型存在哪里?怎么清理?答:Windows默认存在 C:\Users\你的用户名\.ollama\models 目录下。用 ollama list 看有哪些模型,ollama rm 模型名 删除就行。

写在最后

本地部署AI这件事,真的没有想象中那么难。以前可能要折腾半天环境、配置CUDA、解决各种依赖问题,现在有了Ollama这样的工具,五分钟就能搞定。当你在自己的笔记本上,不用联网,打开浏览器就能和一个本地运行的AI对话,那种感觉真的很奇妙。这就是属于你自己的、完全可控的AI助手。入门之后,你还可以继续探索:用RAG技术给AI加上你的私人知识库,用微调训练你自己的专属模型,或者试试多模态的视觉模型。技术在进步,工具在变简单,每个人都能拥有自己的本地AI。希望这篇教程能帮你迈出第一步。
原始来源: 大伟学习笔记ww

评论 (0)