← 文章 / AI技术
柒壹昂 21小时前 · 2026-09-05 23:00:10 · 4 阅读

0元部署本地AIAgent之《LM Studio》工具

上次写了篇 Ollama 部署本地大模型的文章DeepSeek Harness + Ollama 部署本地 AI Agent,实现token自由

这次折腾了一下 LM Studio——图形界面的桌面 App,点点点就能跑本地大模型,连 cmd 窗口都不用碰。本篇从下载到配置一条龙,全程截图。

为啥要折腾本地大模型?

不图别的,就图三点:

  • 研究——大模型到底怎么跑起来的、本地部署是个什么流程、推理需要哪些硬件;
  • 了解——为什么显存大小决定能跑多大的模型、量化为什么能把模型变小还能跑;
  • 成就感——从 0 到 1 把一个能聊天的 AI 装到自己电脑上,看着它真的回你第一句话,那种感觉是按个"在线按钮"得不到的。

第一步:下载与安装

打开官网 lmstudio.ai,点右上角 Download,按系统选版本(Windows / macOS / Linux 都有)。

下载完双击安装包,一路"下一步"。

进度条走完就装好了:

装好会自动弹出引导页,看一眼直接"下一步"就行:

⚡ 不用注册、不用登录,装完直接用。

第二步:先选对运行引擎——有显卡 vs 没显卡

这一步新手最容易忽略——LM Studio 装完默认用 NVIDIA 显卡(CUDA)后端,没显卡或显卡不对就直接报错。

打开 LM Studio,左侧菜单进「运行时」,在「运行时选择」里把 GGUF 改成你机器对应的引擎:

四种后端的区别:

引擎适用场景
CUDA 12 llama.cpp(推荐)有 NVIDIA 显卡,GPU 加速,最快
CPU llama.cpp没显卡 / 显卡不是 NVIDIA / 笔记本集显
CUDA llama.cpp老版 CUDA,CUDA 12 不兼容时备选
Vulkan llama.cppAMD 显卡或核显

没显卡怎么办? 直接选 CPU llama.cpp。速度慢点(7B 模型大概 5~15 token/s),但完全能跑起来,对聊天、问问题、写短文不影响。该花的钱还是花在 AI 算力上——啊不对,不花钱,CPU 是免费的

怎么看自己有没有 NVIDIA 显卡? Win+R 输 dxdiag →「显示」选项卡,看「芯片类型」是不是 NVIDIA 开头。

第三步:先把模型目录改了——不然 C 盘会爆

LM Studio 默认把模型放在 C 盘用户目录下,几个大模型下来你的 C 盘可能就红了。

打开 LM Studio,左侧菜单进「资源库」→ 顶部「模型目录」那张卡片,点「更改」:

建议改到 D 盘、E 盘这种大一点的非系统盘,比如 E:\models,一个 LM Studio 一个目录,省得到时候分不清哪些模型是哪儿的。

第四步:去模型市场挑一个

左侧菜单进「探索」,就是 LM Studio 的模型市场。模型来自 Hugging Face,但被整合进了友好得多的界面,搜索、筛选都很顺手。

举个例子,我随便挑个 Gemma 4 E2B 看看:

右侧详情页能看到参数量、架构、支持的功能(视觉、工具、思考等),点「下载」就完事。

第五步:GGUF 量化怎么选?Q4 / Q6 / Q8 的精度取舍

点开下载下拉,你会发现同一个模型经常有好几个版本:Q4_K_M、Q6_K、Q8_0……这些数字到底啥意思?

Q = Quantization(量化),数字代表平均每个权重占多少 bit:Q4 = 4-bit,Q6 = 6-bit,Q8 = 8-bit。数字越大,模型体积越大、推理越慢,但精度(accuracy)越高——就像把一张高清照片压成不同清晰度的 JPG,Q4 又小又快但细节会糊,Q8 尽量保留原版但文件大。

以 Gemma 4 E2B 为例,三档差别如下:

量化档位平均精度模型体积适合场景
Q4_K_M(推荐)4-bit4.4 GB16 GB 内存的笔记本首选
Q6_K6-bit4.8 GB想再聪明一点点的折中档
Q8_08-bit5.9 GB显存/内存宽裕,追求最佳效果

经验之谈:内存 16 GB 默认选 Q4_K_M;32 GB 可以上 Q6_K;64 GB 以上或独显 8 GB+ 才考虑 Q8_0。盲选 Q8 不一定更聪明,但电脑一定会先卡给你看。

第六步:上下文长度调到多少?

下载完模型,左侧菜单进「本地模型默认设置」:

顶部有个「最小 AutoFit 上下文长度」,默认 16384(也就是 16K)。这个数字代表模型一次能"看见"多长的对话。

  • 普通问答、写短文:4096 够用;
  • 让它读长文档、做总结:8192 ~ 16384 比较稳;
  • 想让它"翻书找答案"那种长上下文场景:拉到 32768、65536 都行。

⚠️ 不是越大越好——上下文越长,占的显存/内存越多,超出硬件承受范围模型直接加载失败。AutoFit 这个值就是个安全线,调到硬件能 hold 住的最高就行。

第七步:要不要开本地 API?

如果你只是想本地聊聊天,到第六步就够了。

但如果你想让 LM Studio 给其他 AI Agent、脚本、第三方工具当模型源(和上次讲 Ollama 时一样),那就打开本地 API 服务:

左侧菜单进「本地模型 API」→ 把顶部「本地 API 服务」开关打开:

服务跑起来后,基础 URL 是 http://localhost:1234/v1,兼容 OpenAI 接口格式。任何支持自定义 OpenAI 兼容端点的工具都能直接对接——填这个 URL、模型名填你刚下的那个,就完事了。

这就是 LM Studio 比 Ollama 更香的地方之一:开 API 不需要敲一行命令,连配置文件都不用动,界面上一个开关搞定。

第八步:跟模型聊起来——确认一切正常

前面 7 步都在调配置,现在终于到了「出结果」的时候。

左侧菜单进「聊天」,顶部右侧下拉选你刚下的那个模型(比如我用的是 Gemma 4 E2B),输入框随便问一句,比如「你是什么模型?」或「你能干什么?」,回车:

等了十几秒(CPU 模式会慢点,GPU 加速下更快),模型开始回话:

我是一个大型语言模型,由 Google DeepMind 开发……在当前的设置中,我作为 LM Studio Bionic 中的一个智能体运行。

我可以为您提供以下帮助:

1. 知识工作与研究:协助您进行信息检索、总结、分析和知识学习。

2. 编程与编码:帮助您编写、调试、审查代码……

3. 文件操作:可以与工作空间中的文件进行交互……

4. 多媒体处理:处理和理解文本信息……

5. 对话交流:进行轻松的聊天和问答。

右下角能看到当前加载的模型名字(Gemma 4 E2B 开启)、底部有上下文 token 计数(截图里显示 6051)。看到这些标识就说明:

✅ 模型加载成功
✅ 上下文设置生效
✅ 引擎跑通(GPU 加速或 CPU 模式都正常)

这就算搞定了——本地 AI 上线。

几个小 Tips

🔹 下次启动
模型会自动出现在左侧「已加载的实例」里,对话窗口直接选就行,不用每次重新下载。

🔹 跑得卡
量化档位往下拉一档(Q8 → Q4)、上下文长度往下降一半,关掉浏览器和其他吃内存的进程,基本能救回来。

🔹 模型从哪儿下
LM Studio 里的模型都来自 Hugging Face,但界面友好太多——不用 clone 仓库、不用找 gguf 链接、不用纠结文件名,搜索 → 点下载 → 等进度条结束,就这三步。

🔹 想多设备共享
LM Link 功能可以把手机、平板、其他电脑都连过来用同一个模型,相当于一个局域网内的本地 AI 共享中心,自己玩或者小团队都用得上。

写在最后:LM Studio 和 Ollama 到底选谁?

这问题被问过太多次了,直接给结论——

维度LM StudioOllama
上手难度点点点,纯图形界面要敲命令
模型管理界面化、可视化下载进度命令行 pull
开 API开关一拨即可默认开启(11434)
资源占用略高(图形界面本身)更轻、更省
自动化/脚本不太行很行,shell 友好
多平台一致性Win/macOS/Linux 都有主要服务类系统

怎么选

  • 普通用户、就想本地聊个天 → LM Studio
  • 要接脚本、接 Agent、做自动化 → Ollama 更顺手
  • 跟我一样既想 UI 又想自动化 → 两个都装,各用各的

其实不管你最后选哪个,走过一遍这个流程,下次看见"ollama"或者"vllm"这种命令也不会慌了——本地大模型的原理是通的,今天这 7 步就是入门票。

本地也好,在线也好,能用着顺手就是好工具。

原始来源: 柒壹昂

评论 (0)