从 NAS 到AI服务器:本地数据和大模型到底该怎么配合?

一台 NAS、一张 T4,让我重新理解了什么叫"AI 算力"
从一台飞牛 NAS 的真实实验,看本地 AI、云端大模型与企业 AI 算力如何协同
—————

我最早 NAS 的时候,从没想过有一天会往里面插一张 GPU。
那是一台很普通的PC,我装了飞牛 NAS,CPU 是 Intel i7-6700,内存只有 8GB,一块闲置的SATA固态盘。闲置在角落里吃灰已经很久了,直到后来飞牛更新了一些ai相关应用,半年前我曾经就往里面插过 Tesla T4,只不过当时还不能很好的驱动,那时候的我也没有Agent来帮我协助操作。
直到最近,不死心的我又往里插了一张 Tesla T4。
然后,有些事情开始悄悄发生变化。
而这件事,比"NAS 变聪明"本身,意义更大。
一、NAS 过去只解决一件事:文件放在哪里
普通人对 NAS 的认知,基本就是五件事:存照片、存视频、备份、跑个下载、当个影音库。
我自己用 NAS 好几年。前几年的感受是:东西是存下来了,但要用的时候,基本找不到。
• 几十份产品 PDF
• 几百份技术资料
• 历史上的项目方案
• 各种合同、说明书、项目材料
它们都好好地躺在 NAS 里,目录分得清清楚楚。
但当你想用的时候,会面临一个尴尬:
**NAS 能告诉你"文件在哪里",但不能告诉你"文件里讲了什么"。**
你想找一份讲 GPU 服务器散热方案的文档,记得大概有这么个东西,但忘了文件名。你唯一能用的,就是关键词搜索。
可关键词搜索的逻辑,是"完全匹配"。
它不会理解"GPU 服务器"和"显卡服务器"其实是同一类东西;也不会理解"散热"和"风冷"、"液冷"在讲的是同一件事。
这就是我说的:文件虽然都保存下来了,但它们基本是死的。
它们就在那里,但你摸不到、用不上、读不懂。
二、AI 让我重新思考 NAS
ChatGPT 这类大模型出来之后,大家讨论的几乎都是:这个 AI 怎么写代码、怎么写作文、怎么解奥赛题。
但作为一个 NAS 重度用户,真正让我心里一动的是另一件事:
**企业里、个人手里真正有价值的资料,从来不在互联网上,而是在自己硬盘里。**
• 公司内部的产品资料
• 多年积累的技术文档
• 历史上的项目方案
• 客户合同、设备说明书、培训资料
这些才是真正的"知识"。但过去,它们只能用关键词搜索,或者干脆靠脑子记忆。
AI 时代真正有意思的变化是:我们终于有办法,让 AI 去"读"这些资料,再去"回答"问题。
这件事有个专门的说法,叫 RAG(Retrieval-Augmented Generation)。一句话讲:
**先从自己的资料库里找出最相关的几段内容,再让大模型根据这些内容回答。**
问题来了:怎么让 AI 真的能"读懂"我的资料?
最简单的做法,就是丢给 ChatGPT,让云端 AI 帮你处理。
但这条路,有几个绕不开的问题:
• 隐私 — 合同、内部资料,真的能传出去?
• 可控 — 模型随时变,今天能回答,明天可能就变。
• 长期 — 数据持续产生,全部走云端,成本会越涨越高。
于是我把目光,重新放回了自己的 NAS。
但这一次,我不再只是把它当成"硬盘盒子"。
三、我那台旧 NAS,真的还能再战吗
先看一眼我的硬件。不是炫耀配置,恰恰相反,这是反例。
• CPU:Intel i7-6700(2015 年发布的处理器,4 核 8 线程)
• 内存:8GB DDR4
• 显卡(新加的):NVIDIA Tesla T4 16GB
• 系统:飞牛 fnOS(基于 Debian 12)
这是 2026 年来看,基本属于"老古董"级别的家用平台。
但我决定用它来试试做本地 AI 知识库。原因有三:
它本来就是 7×24 小时开机的,继续压榨一下。
我手头正好有一张闲置的 T4,扔在那里也浪费。
我想验证一个想法:真正的瓶颈,到底是模型,还是硬件?
关于 T4,我不想吹它。它不是 4090,也不是 H100,跑不了 70B 的大模型。
但客观说,T4 还是有几个非常适合本地实验 / 小规模应用的优点:
• 16GB 显存 — 跑中等规模 Embedding 和 Rerank 模型绰绰有余。
• 功耗友好 — 70W 出头,普通家用插座带得动。
• 半高卡 / 被动散热 — 适合装在小机箱、NAS 一类设备里。
• 定位就是推理卡 — 不是训练卡。
这个组合一句话总结:硬件一般,但够用,够用就好。

四、我在 NAS 里面搭了一套什么东西
整套东西的"骨架",是这样的:
• 飞牛 NAS 之上,挂载着文件资料(PDF / Word / Markdown)。
• 文件进入 WeKnora,做文档解析、切片、知识库管理、向量检索、RAG 问答。
• WeKnora 同时调用两个本地 AI 能力:Ollama 上的 Qwen3-Embedding-4B(做语义向量化)、以及一个独立 Rerank 服务上的 Qwen3-Reranker-0.6B(做相关性重排序)。
• 最终生成的回答,可以基于本地资料,再叠加云端大模型的推理能力。
• 所有这些,跑在 NVIDIA Tesla T4 16GB 这块推理卡上。
其中:
• WeKnora(v0.8.0,5 容器运行中)是整个 RAG 的大脑,负责文档解析、向量检索、问答界面;
• Ollama(0.34.0,宿主机 systemd 安装)跑 Embedding 模型,把文字变成向量;
• Qwen3-Reranker-0.6B 作为独立 Rerank 服务(系统服务 `qwen3-reranker.service`,端口 8002),负责对召回结果重排序。
我并没有自己写一行深度学习代码,也没去研究 CUDA 优化。这一套,本质上是把现成的开源组件在 NAS 里拼起来。
需要承认的是:这套东西不是"我发明的",而是"我跑通的"。
这个区分,我想如实讲清楚。

但真正跑起来之后,我开始意识到一件事:
我之前对"AI"的理解,有点窄。
五、AI 不只是"大模型聊天"
这是这篇文章,我想特别加的一段。
在我之前的认知里,"AI"基本等于"聊天机器人"。ChatGPT、文心一言、通义千问、豆包……它们最显眼的本事,就是和人对话、写东西、回答问题。
但当我在 NAS 上把整套东西跑通之后,我才发现:
**我本地的 Qwen3-Embedding-4B,不会聊天。**
**Qwen3-Reranker-0.6B,也不会聊天。**
**但它们,都是货真价实的 AI 模型。**
它们的工作是:
• Embedding:把文档和问题,变成一组"语义数字";
• Reranker:判断哪些资料和用户问题最相关。
这两个活,大语言模型其实也能干,但用大语言模型去做"检索 + 排序",既贵又慢。
用专门的小模型去做,又快又便宜。
这件事给我最大的启发是:
**不是所有 AI 都必须负责"聊天"。**
AI 这个词,远比我们想象得要大。
大语言模型(LLM)只是 AI 的一个分支。AI 还包括很多其他类型:
• Embedding 模型 — 负责语义检索
• Reranker 模型 — 负责相关性重排序
• OCR — 把图片里的文字认出来
• ASR — 把语音转成文字
• 视觉模型 — 看图、看视频
• 分类模型 — 把文档自动归类
• 异常检测模型 — 在日志里找异常
• Agent 框架 — 把多个 AI 任务串起来
如果用一个类比:
**大语言模型更像综合能力很强的"通才专家"**
**Embedding 和 Reranker 更像分工明确的"专业检索员"**
它们不是高低关系,只是工作不同。
而这件事,直接改变了我们看"AI 服务器"的方式。
以前我们看一台 AI 服务器,问的往往是:
"能跑多少 B 的大模型?"
但更准确的问题也许是:
**"这台服务器,能承担多少种 AI 工作?"**
包括:
• Embedding(语义检索)
• Rerank(重排序)
• OCR(扫描件识别)
• ASR(语音转文字)
• 视觉模型(图像 / 视频识别)
• 分类 / 标签(文档自动归类)
• 异常检测(日志分析)
• 数据清洗(向量化)
• 本地 LLM(对话 / 总结)
• Agent(多步任务编排)
这些,都是 AI 算力的"工作清单"。
采购 AI 服务器的时候,不能只看"能跑多大的模型",还要看"能承担多少种 AI 活"。

六、Embedding 和 Reranker 到底分别在干什么
这是整篇文章里,我最想讲清楚的一段。
因为很多人(包括我自己在接触之前)都被这两个词劝退过。
假设你的知识库里有 10 万段文字。
某天,你问了一个问题:
"哪款服务器适合做 GPU 训练?"
传统搜索是这样做的:把"GPU 训练"和资料里的文字一对一比对,谁包含"GPU"或"训练"就把谁捞出来。
结果会非常糟。讲 GPU 服务器采购的内容,可能写的是"显卡服务器"、"GPU 机器";讲 GPU 训练的内容,可能压根不含"GPU"这个词。
而 Embedding,干的就是这件事:
**把每一段文字,变成一串 AI 能比较"语义相似度"的数字。**
比如"GPU 训练"、"显卡服务器"、"AI 训练用机"这三段话,虽然字面不一样,但因为意思接近,它们的数字也会接近。
这样一来,你不再需要"字面匹配",你可以做"意思匹配"。
这一步,通常叫"召回"。它会从 10 万段里,先粗筛出大概 20 段可能相关的内容。
但 20 段还是太多。怎么办?
这时候,Reranker 出场了。
**把这 20 段拿过来,再仔细判断一下,挑出最相关的几段。**
相当于"初选之后再做一次复赛"。
最后,大模型拿到这几段最相关的资料,组织成一段自然语言回答,交给你。
为什么 Embedding 和 Reranker 都需要?
只用 Embedding,精度不够;对所有资料都让 Reranker 看一遍,太慢太贵。
两步一起用,又快又准。 这是过去几年 RAG 系统几乎所有方案都在用的范式。
我自己跑的是这两个模型:
• Qwen3-Embedding-4B — 用来做语义检索,向量维度 2560
• Qwen3-Reranker-0.6B — 用来做二次重排序
**我的实际测试(本机)**
>
**Embedding(Qwen3-Embedding-4B,2560 维)**
- 1 条问题约 68 毫秒
- 8 条约 331 毫秒
- 16 条约 513 毫秒
- 显存占用约 4026 MiB
>
**Reranker(Qwen3-Reranker-0.6B)**
- 5 段约 231 毫秒
- 10 段约 206 毫秒
- 20 段约 658 毫秒
- 显存占用约 1342 MiB
>
**两模型同时运行**:合计 5371 MiB / 15360 MiB(T4 总显存),剩余约 9989 MiB。
>
**以上均为本次 NAS 实际测试结果。**
>
在我目前的使用场景下,整体响应已经比较流畅。
七、本地 AI + 云端大模型,各做自己最擅长
跑通以后,我开始重新理解"本地 AI"和"云端 AI"的关系。
很多人在聊这件事的时候,容易讲成对立:
"本地安全,云端智能。"
"本地慢,云端快。"
但真正跑起来以后,我的感觉不是这样。
更准确的描述是:本地和云端,各做自己最擅长的事情。
我那台 NAS(以及它跑的全部东西:文件、向量库、Embedding、Rerank、文档解析),干的是这些活:
• 把资料放在自己硬盘里
• 解析 PDF / Word
• 把每段话变成向量
• 把用户问题也变成向量
• 在向量数据库里找最像的若干段
• 让 Reranker 再筛出最相关的几段
完整资料库、文档解析、向量化、召回和重排都留在本地完成。如果最终需要调用云端大模型,再按需发送经过筛选的少量必要上下文(例如 Top 5)。
而云端的大模型,在我这套架构里,干的是另一件事:
• 拿到本地筛好的几段资料
• 理解这些内容
• 做复杂推理
• 组织成一段自然语言
• 给出能让人读懂的答案
这两层,不是谁替代谁,是接力跑。

用一句话总结:
**本地负责:"数据在哪里 / 哪些资料相关 / 哪些内容应该被送给模型"**
**云端负责:"这些内容意味着什么 / 怎么回答 / 怎么推理 / 怎么生成"**
所以更准确的判断是:
**不是所有 AI 都必须跑在本地,也不是所有数据都应该直接送到云端。**
而是要看:这份资料有多敏感 / 这个问题有多复杂 / 这次回答需要多强的推理。
一种稳妥的策略:数据分级
如果一家企业想这么做,一种思路是:
• 普通数据(公开资料、可公开的内部培训)→ 可以走云端大模型
• 敏感数据(内部技术方案、产品价格、合同草稿)→ 用本地私有模型
• 高度敏感数据(核心研发、未公开客户信息)→ 完全本地闭环,连云端都不调用
这是一种灵活组合,而不是非此即彼。
我必须如实讲清楚一件事:
**如果最终仍然要调用云端大模型,RAG 检索出来的那几段上下文,通常仍会发到云端。**
**所以"本地"并不等于"100% 不出本地"。**
**但"完整资料库保留在本地",本身已经是一个巨大差别。**
**本地部署提升了数据与模型调用链的可控性。**
八、一台 NAS,其实藏着企业 AI 平台的缩小版
当我把这件事跑通以后,有一天突然冒出一个想法:
**如果把这套 NAS 架构放大到企业级,会怎样?**
不是让它性能变强,而是把每个组件的"角色"放大。
如果把同样的架构思路放到企业环境,核心组件的对应关系大致是:
• 飞牛 NAS → 企业本地服务器
• Tesla T4 单卡 → 企业 GPU 算力(单卡 / 多卡)
• 几百份个人资料 → 大规模企业数据
• WeKnora → 企业知识库 / RAG 平台
• Qwen3 Embedding → 企业级语义检索服务
• Qwen3 Reranker → 企业级内容重排服务
• 云端大模型 → 企业统一大模型入口
• 个人问答 → 企业 AI 助手 / Agent
你会发现:
**本质的架构,没有变。**
**变的是:规模、并发、可靠性、权限、算力、数据量。**
换句话说:
**企业未来可能要建的那套"AI 基础设施",和我这台 NAS 干的事情,几乎是同一件事。**
**只是规模不一样。**

这才是这次折腾,真正的「复利」。
它让我看到了一种正在成型的企业 IT 新形态:
**数据在本地,智能按需调用,大模型在云端,但选择权在企业自己手里。**
九、它可以长出什么?企业里能想到的几个场景
到这里,我想用一种"探索性"的方式,讲讲这套架构放大以后,可能在企业里长出什么。
**注意:以下场景是基于"我的 NAS 架构"做的合理延伸,不是"我已经在企业里实现"的内容。**
场景 1:产品知识库
制造 / IT 企业,内部常积累:产品规格书、兼容性列表、售后资料、培训手册。
放大后:本地服务器完成检索,员工直接问,AI 给出答案。
场景 2:招投标 / 项目资料
多年积累的招标文件、投标文件、技术方案、合同、项目复盘材料。
放大后:AI 辅助检索相似项目、查找历史条款、辅助整理材料。
注意:写"辅助",不写"代替"投标人员 / 法务。
场景 3:高校 / 科研单位
论文、科研项目、实验资料、设备资料、政策文件。
放大后:形成内部科研知识库,方便跨课题组检索。
场景 4:医院
设备说明书、内部制度、培训资料、科研材料。
放大后:辅助内部知识检索、规章制度查询、文献定位。
注意:只做"知识检索",不延伸到诊断、治疗、医疗决策。
场景 5:政府 / 事业单位
制度、政策文件、历史档案、会议材料。
放大后:形成内部政策知识库,权限分级、边界清晰。
场景 6:企业运维
服务器日志、监控告警、故障案例、设备说明。
放大后:AI 协助日志分析、故障定位、运维知识问答。
这 6 个场景不是"我跑通的功能",也不是"哪个产品的清单",而是"我这套 NAS 架构放大以后,逻辑上能长出来的方向"。

一个更上层的视角:三层 AI 架构
如果把上面这些场景抽象一下,可以总结成一个三层 AI 架构:
第一层:数据层 — 负责"拥有知识"
• NAS、企业存储、数据库、业务系统、文档库、历史项目数据
第二层:本地 AI 算力层 — 负责"找到 / 处理知识"
• Embedding、Reranker、OCR、ASR、视觉模型、分类模型、向量数据库、本地 LLM
• 这一层也是企业级 GPU Server / AI Server 真正发挥价值的地方
第三层:大模型智能层 — 负责"使用知识"
• 推理、总结、生成、规划、Agent 决策、跨领域分析
• 可以是本地大模型、私有云模型、公有云模型
这三层互相配合,是接力跑,不是替代。
用一句话总结:
**数据层负责"拥有知识",本地 AI 层负责"找到知识",大模型层负责"使用知识"。**

**未来企业采购 AI 算力服务器,可能不只是看"能跑多大的模型",还要看"这三层是否能完整搭起来"。**
十、为什么企业需要本地 AI 算力
到这里,你可能还是会问:
"那为什么不直接用云端 AI 呢?"
我能想到的四个原因,都是相对克制的:
1. 数据:AI 要服务业务,就要靠近业务数据
企业真正有价值的资料,大部分就在本地。合同、报价、内部技术方案、生产数据……这些数据不会自动跑到云上去。
如果 AI 想真正服务业务,就要靠近这些数据。
2. 隐私 / 权限:不是所有数据都适合云端
企业里有些数据适合云端,有些不适合,有些只能留在本地。
企业需要"选择权"。 不是"全部给云端",也不是"全部锁死本地",而是可以分级调用。
3. 成本:高频固定任务,完全走云端不一定是最优
Embedding、OCR、分类、Rerank 这些任务,调用频率高,每次内容不长。长期完全走云端 API,成本会持续上升。本地 GPU 承担这些"固定工作量",可能更合适。
注意,我不绝对地说"一定更便宜"——但这确实是一种可以比较的方案。
4. 可控:模型、数据、版本、权限、调用链
这是云端 AI 几乎给不了的事:
• 模型版本自己定
• 数据脱敏自己做
• 知识库自己重建
• 权限自己管理
• 调用链自己审计
对一些行业(金融、医疗、政府、央国企)来说,"可控"比"强大"更重要。
十一、当然,它也有边界
我必须把"它也不是万能的"这一章写清楚。
这篇文章如果只讲"用了本地 AI 一切问题自动解决",那是不真实的。
硬件的限制
我这台机器只有 8GB 内存,两个模型同时加载时,系统可用 RAM 只剩约 3.1 GiB,已经是明显瓶颈。T4 16GB 显存听起来不少,但如果你想同时跑 14B / 32B 的对话模型,就完全不够。我的策略是:小模型 + RAG,代替大模型硬扛。
这条路在企业放大以后,需要更强的算力 / 更多的 GPU / 更完善的硬件规划。
知识库质量
AI 回答质量,非常依赖:
• 文档本身质量
• 切片方式(把长文档切成多段)
• Embedding 模型选择
• 召回参数、Reranker 阈值
• 提示词工程
装上模型不等于一切问题自动解决。 调优是长期活。
AI 可能"幻觉"
AI 可能一本正经地胡说八道。
真正重要的信息,仍然需要核对原文。
边界(必须讲清楚)
"本地 AI"不等于"100% 绝对安全"。
如果最终仍然要调用云端大模型,RAG 检索出来的那几段上下文,通常仍会发到云端。
所以更准确的表述是:
**完整资料库保留在本地,本地 AI 先完成检索和筛选,再根据业务和数据敏感等级,决定是否将少量必要上下文交给云端模型。**
这种表述,既不夸大,又对企业 IT 友好。
十二、AI 时代,服务器可能要回答一个新问题
到这里,我想直接说一些更"放大"的话。
以前我们采购服务器,关心的问题往往是:
• CPU 有多少核
• 内存有多大
• 硬盘能放多少数据
• 电源稳不稳
• 网络够不够
但 AI 时代,也许还会多一个问题:
**这台服务器,有多少 AI 算力?**
因为未来服务器,不仅要存数据、跑业务,它可能还需要:
• 读文档
• 理解图片
• 处理语音
• 搜索知识
• 分析日志
• 运行 AI Agent
我这台 NAS,只是一个很小的实验。
但它让我第一次直观地看到:
**AI 算力和企业数据结合之后,服务器可能会拥有一种完全不同的价值。**
它不再只是"数据的仓库",它会开始成为"数据 + 算力 + 智能"的交汇点。
—————
最后,留下三个观点:
观点一:
**AI 不只是大语言模型。**
Embedding、Reranker、OCR、视觉、语音,都是 AI。
观点二:
**未来企业 AI,可能不是"纯本地"或者"纯云端",而是"本地 + 云端"按需组合。**
根据数据、成本、安全、性能,灵活搭配。
观点三:
**AI 时代的服务器,可能不仅承担存储、计算、数据库,还会开始承担"企业 AI 算力"。**
我的 NAS,只是这个变化的一个很小缩影。
—————
我没有写"赶紧买 AI 服务器"。
我也没有写"本地 AI 一统天下"。
我只是想说:
**以后一个单位采购服务器的时候,是不是除了 CPU、内存、硬盘,也应该开始考虑 AI 算力?**
这个问题的答案,可能比"AI 服务器时代来了"重要得多。
—————
如果你也在折腾 NAS、本地 AI、企业知识库或 AI 算力,欢迎继续关注。
后面我会继续分享这套系统的实际使用、模型部署,以及企业 AI 场景的一些探索。