← 文章 / 云原生与基础设施
DX智算局 1小时前 · 2026-09-12 00:53:09 · 2 阅读

从 NAS 到AI服务器:本地数据和大模型到底该怎么配合?

一台 NAS、一张 T4,让我重新理解了什么叫"AI 算力"

从一台飞牛 NAS 的真实实验,看本地 AI、云端大模型与企业 AI 算力如何协同

—————

我最早 NAS 的时候,从没想过有一天会往里面插一张 GPU。

那是一台很普通的PC,我装了飞牛 NAS,CPU 是 Intel i7-6700,内存只有 8GB,一块闲置的SATA固态盘。闲置在角落里吃灰已经很久了,直到后来飞牛更新了一些ai相关应用,半年前我曾经就往里面插过 Tesla T4,只不过当时还不能很好的驱动,那时候的我也没有Agent来帮我协助操作。

直到最近,不死心的我又往里插了一张 Tesla T4。

然后,有些事情开始悄悄发生变化。

而这件事,比"NAS 变聪明"本身,意义更大。

一、NAS 过去只解决一件事:文件放在哪里

普通人对 NAS 的认知,基本就是五件事:存照片、存视频、备份、跑个下载、当个影音库。

我自己用 NAS 好几年。前几年的感受是:东西是存下来了,但要用的时候,基本找不到。

• 几十份产品 PDF

• 几百份技术资料

• 历史上的项目方案

• 各种合同、说明书、项目材料

它们都好好地躺在 NAS 里,目录分得清清楚楚。

但当你想用的时候,会面临一个尴尬:

**NAS 能告诉你"文件在哪里",但不能告诉你"文件里讲了什么"。**

你想找一份讲 GPU 服务器散热方案的文档,记得大概有这么个东西,但忘了文件名。你唯一能用的,就是关键词搜索。

可关键词搜索的逻辑,是"完全匹配"。

它不会理解"GPU 服务器"和"显卡服务器"其实是同一类东西;也不会理解"散热"和"风冷"、"液冷"在讲的是同一件事。

这就是我说的:文件虽然都保存下来了,但它们基本是死的。

它们就在那里,但你摸不到、用不上、读不懂。

二、AI 让我重新思考 NAS

ChatGPT 这类大模型出来之后,大家讨论的几乎都是:这个 AI 怎么写代码、怎么写作文、怎么解奥赛题。

但作为一个 NAS 重度用户,真正让我心里一动的是另一件事:

**企业里、个人手里真正有价值的资料,从来不在互联网上,而是在自己硬盘里。**

• 公司内部的产品资料

• 多年积累的技术文档

• 历史上的项目方案

• 客户合同、设备说明书、培训资料

这些才是真正的"知识"。但过去,它们只能用关键词搜索,或者干脆靠脑子记忆。

AI 时代真正有意思的变化是:我们终于有办法,让 AI 去"读"这些资料,再去"回答"问题。

这件事有个专门的说法,叫 RAG(Retrieval-Augmented Generation)。一句话讲:

**先从自己的资料库里找出最相关的几段内容,再让大模型根据这些内容回答。**

问题来了:怎么让 AI 真的能"读懂"我的资料?

最简单的做法,就是丢给 ChatGPT,让云端 AI 帮你处理。

但这条路,有几个绕不开的问题:

• 隐私 — 合同、内部资料,真的能传出去?

• 可控 — 模型随时变,今天能回答,明天可能就变。

• 长期 — 数据持续产生,全部走云端,成本会越涨越高。

于是我把目光,重新放回了自己的 NAS。

但这一次,我不再只是把它当成"硬盘盒子"。

三、我那台旧 NAS,真的还能再战吗

先看一眼我的硬件。不是炫耀配置,恰恰相反,这是反例。

• CPU:Intel i7-6700(2015 年发布的处理器,4 核 8 线程)

• 内存:8GB DDR4

• 显卡(新加的):NVIDIA Tesla T4 16GB

• 系统:飞牛 fnOS(基于 Debian 12)

这是 2026 年来看,基本属于"老古董"级别的家用平台。

但我决定用它来试试做本地 AI 知识库。原因有三:

它本来就是 7×24 小时开机的,继续压榨一下。

我手头正好有一张闲置的 T4,扔在那里也浪费。

我想验证一个想法:真正的瓶颈,到底是模型,还是硬件?

关于 T4,我不想吹它。它不是 4090,也不是 H100,跑不了 70B 的大模型。

但客观说,T4 还是有几个非常适合本地实验 / 小规模应用的优点:

• 16GB 显存 — 跑中等规模 Embedding 和 Rerank 模型绰绰有余。

• 功耗友好 — 70W 出头,普通家用插座带得动。

• 半高卡 / 被动散热 — 适合装在小机箱、NAS 一类设备里。

• 定位就是推理卡 — 不是训练卡。

这个组合一句话总结:硬件一般,但够用,够用就好。

四、我在 NAS 里面搭了一套什么东西

整套东西的"骨架",是这样的:

• 飞牛 NAS 之上,挂载着文件资料(PDF / Word / Markdown)。

• 文件进入 WeKnora,做文档解析、切片、知识库管理、向量检索、RAG 问答。

• WeKnora 同时调用两个本地 AI 能力:Ollama 上的 Qwen3-Embedding-4B(做语义向量化)、以及一个独立 Rerank 服务上的 Qwen3-Reranker-0.6B(做相关性重排序)。

• 最终生成的回答,可以基于本地资料,再叠加云端大模型的推理能力。

• 所有这些,跑在 NVIDIA Tesla T4 16GB 这块推理卡上。

其中:

• WeKnora(v0.8.0,5 容器运行中)是整个 RAG 的大脑,负责文档解析、向量检索、问答界面;

• Ollama(0.34.0,宿主机 systemd 安装)跑 Embedding 模型,把文字变成向量;

• Qwen3-Reranker-0.6B 作为独立 Rerank 服务(系统服务 `qwen3-reranker.service`,端口 8002),负责对召回结果重排序。

我并没有自己写一行深度学习代码,也没去研究 CUDA 优化。这一套,本质上是把现成的开源组件在 NAS 里拼起来。

需要承认的是:这套东西不是"我发明的",而是"我跑通的"。

这个区分,我想如实讲清楚。

但真正跑起来之后,我开始意识到一件事:

我之前对"AI"的理解,有点窄。

五、AI 不只是"大模型聊天"

这是这篇文章,我想特别加的一段。

在我之前的认知里,"AI"基本等于"聊天机器人"。ChatGPT、文心一言、通义千问、豆包……它们最显眼的本事,就是和人对话、写东西、回答问题。

但当我在 NAS 上把整套东西跑通之后,我才发现:

**我本地的 Qwen3-Embedding-4B,不会聊天。**          
**Qwen3-Reranker-0.6B,也不会聊天。**          
**但它们,都是货真价实的 AI 模型。**

它们的工作是:

• Embedding:把文档和问题,变成一组"语义数字";

• Reranker:判断哪些资料和用户问题最相关。

这两个活,大语言模型其实也能干,但用大语言模型去做"检索 + 排序",既贵又慢。

用专门的小模型去做,又快又便宜。

这件事给我最大的启发是:

**不是所有 AI 都必须负责"聊天"。**

AI 这个词,远比我们想象得要大。

大语言模型(LLM)只是 AI 的一个分支。AI 还包括很多其他类型:

• Embedding 模型 — 负责语义检索

• Reranker 模型 — 负责相关性重排序

• OCR — 把图片里的文字认出来

• ASR — 把语音转成文字

• 视觉模型 — 看图、看视频

• 分类模型 — 把文档自动归类

• 异常检测模型 — 在日志里找异常

• Agent 框架 — 把多个 AI 任务串起来

如果用一个类比:

**大语言模型更像综合能力很强的"通才专家"**          
**Embedding 和 Reranker 更像分工明确的"专业检索员"**

它们不是高低关系,只是工作不同。

而这件事,直接改变了我们看"AI 服务器"的方式。

以前我们看一台 AI 服务器,问的往往是:

"能跑多少 B 的大模型?"

但更准确的问题也许是:

**"这台服务器,能承担多少种 AI 工作?"**

包括:

• Embedding(语义检索)

• Rerank(重排序)

• OCR(扫描件识别)

• ASR(语音转文字)

• 视觉模型(图像 / 视频识别)

• 分类 / 标签(文档自动归类)

• 异常检测(日志分析)

• 数据清洗(向量化)

• 本地 LLM(对话 / 总结)

• Agent(多步任务编排)

这些,都是 AI 算力的"工作清单"。

采购 AI 服务器的时候,不能只看"能跑多大的模型",还要看"能承担多少种 AI 活"。

六、Embedding 和 Reranker 到底分别在干什么

这是整篇文章里,我最想讲清楚的一段。

因为很多人(包括我自己在接触之前)都被这两个词劝退过。

假设你的知识库里有 10 万段文字。

某天,你问了一个问题:

"哪款服务器适合做 GPU 训练?"

传统搜索是这样做的:把"GPU 训练"和资料里的文字一对一比对,谁包含"GPU"或"训练"就把谁捞出来。

结果会非常糟。讲 GPU 服务器采购的内容,可能写的是"显卡服务器"、"GPU 机器";讲 GPU 训练的内容,可能压根不含"GPU"这个词。

而 Embedding,干的就是这件事:

**把每一段文字,变成一串 AI 能比较"语义相似度"的数字。**

比如"GPU 训练"、"显卡服务器"、"AI 训练用机"这三段话,虽然字面不一样,但因为意思接近,它们的数字也会接近。

这样一来,你不再需要"字面匹配",你可以做"意思匹配"。

这一步,通常叫"召回"。它会从 10 万段里,先粗筛出大概 20 段可能相关的内容。

但 20 段还是太多。怎么办?

这时候,Reranker 出场了。

**把这 20 段拿过来,再仔细判断一下,挑出最相关的几段。**

相当于"初选之后再做一次复赛"。

最后,大模型拿到这几段最相关的资料,组织成一段自然语言回答,交给你。

为什么 Embedding 和 Reranker 都需要?

只用 Embedding,精度不够;对所有资料都让 Reranker 看一遍,太慢太贵。

两步一起用,又快又准。 这是过去几年 RAG 系统几乎所有方案都在用的范式。

我自己跑的是这两个模型:

• Qwen3-Embedding-4B — 用来做语义检索,向量维度 2560

• Qwen3-Reranker-0.6B — 用来做二次重排序

**我的实际测试(本机)**

>

**Embedding(Qwen3-Embedding-4B,2560 维)**          
- 1 条问题约 68 毫秒          
- 8 条约 331 毫秒          
- 16 条约 513 毫秒          
- 显存占用约 4026 MiB

>

**Reranker(Qwen3-Reranker-0.6B)**          
- 5 段约 231 毫秒          
- 10 段约 206 毫秒          
- 20 段约 658 毫秒          
- 显存占用约 1342 MiB

>

**两模型同时运行**:合计 5371 MiB / 15360 MiB(T4 总显存),剩余约 9989 MiB。

>

**以上均为本次 NAS 实际测试结果。**

>

在我目前的使用场景下,整体响应已经比较流畅。

七、本地 AI + 云端大模型,各做自己最擅长

跑通以后,我开始重新理解"本地 AI"和"云端 AI"的关系。

很多人在聊这件事的时候,容易讲成对立:

"本地安全,云端智能。"

"本地慢,云端快。"

但真正跑起来以后,我的感觉不是这样。

更准确的描述是:本地和云端,各做自己最擅长的事情。

我那台 NAS(以及它跑的全部东西:文件、向量库、Embedding、Rerank、文档解析),干的是这些活:

• 把资料放在自己硬盘里

• 解析 PDF / Word

• 把每段话变成向量

• 把用户问题也变成向量

• 在向量数据库里找最像的若干段

• 让 Reranker 再筛出最相关的几段

完整资料库、文档解析、向量化、召回和重排都留在本地完成。如果最终需要调用云端大模型,再按需发送经过筛选的少量必要上下文(例如 Top 5)。

而云端的大模型,在我这套架构里,干的是另一件事:

• 拿到本地筛好的几段资料

• 理解这些内容

• 做复杂推理

• 组织成一段自然语言

• 给出能让人读懂的答案

这两层,不是谁替代谁,是接力跑。

用一句话总结:

**本地负责:"数据在哪里 / 哪些资料相关 / 哪些内容应该被送给模型"**          
**云端负责:"这些内容意味着什么 / 怎么回答 / 怎么推理 / 怎么生成"**

所以更准确的判断是:

**不是所有 AI 都必须跑在本地,也不是所有数据都应该直接送到云端。**

而是要看:这份资料有多敏感 / 这个问题有多复杂 / 这次回答需要多强的推理。

一种稳妥的策略:数据分级

如果一家企业想这么做,一种思路是:

• 普通数据(公开资料、可公开的内部培训)→ 可以走云端大模型

• 敏感数据(内部技术方案、产品价格、合同草稿)→ 用本地私有模型

• 高度敏感数据(核心研发、未公开客户信息)→ 完全本地闭环,连云端都不调用

这是一种灵活组合,而不是非此即彼。

我必须如实讲清楚一件事:

**如果最终仍然要调用云端大模型,RAG 检索出来的那几段上下文,通常仍会发到云端。**          
**所以"本地"并不等于"100% 不出本地"。**          
**但"完整资料库保留在本地",本身已经是一个巨大差别。**          
**本地部署提升了数据与模型调用链的可控性。**

八、一台 NAS,其实藏着企业 AI 平台的缩小版

当我把这件事跑通以后,有一天突然冒出一个想法:

**如果把这套 NAS 架构放大到企业级,会怎样?**

不是让它性能变强,而是把每个组件的"角色"放大。

如果把同样的架构思路放到企业环境,核心组件的对应关系大致是:

• 飞牛 NAS → 企业本地服务器

• Tesla T4 单卡 → 企业 GPU 算力(单卡 / 多卡)

• 几百份个人资料 → 大规模企业数据

• WeKnora → 企业知识库 / RAG 平台

• Qwen3 Embedding → 企业级语义检索服务

• Qwen3 Reranker → 企业级内容重排服务

• 云端大模型 → 企业统一大模型入口

• 个人问答 → 企业 AI 助手 / Agent

你会发现:

**本质的架构,没有变。**          
**变的是:规模、并发、可靠性、权限、算力、数据量。**

换句话说:

**企业未来可能要建的那套"AI 基础设施",和我这台 NAS 干的事情,几乎是同一件事。**          
**只是规模不一样。**

这才是这次折腾,真正的「复利」。

它让我看到了一种正在成型的企业 IT 新形态:

**数据在本地,智能按需调用,大模型在云端,但选择权在企业自己手里。**

九、它可以长出什么?企业里能想到的几个场景

到这里,我想用一种"探索性"的方式,讲讲这套架构放大以后,可能在企业里长出什么。

**注意:以下场景是基于"我的 NAS 架构"做的合理延伸,不是"我已经在企业里实现"的内容。**

场景 1:产品知识库

制造 / IT 企业,内部常积累:产品规格书、兼容性列表、售后资料、培训手册。

放大后:本地服务器完成检索,员工直接问,AI 给出答案。

场景 2:招投标 / 项目资料

多年积累的招标文件、投标文件、技术方案、合同、项目复盘材料。

放大后:AI 辅助检索相似项目、查找历史条款、辅助整理材料。

注意:写"辅助",不写"代替"投标人员 / 法务。

场景 3:高校 / 科研单位

论文、科研项目、实验资料、设备资料、政策文件。

放大后:形成内部科研知识库,方便跨课题组检索。

场景 4:医院

设备说明书、内部制度、培训资料、科研材料。

放大后:辅助内部知识检索、规章制度查询、文献定位。

注意:只做"知识检索",不延伸到诊断、治疗、医疗决策。

场景 5:政府 / 事业单位

制度、政策文件、历史档案、会议材料。

放大后:形成内部政策知识库,权限分级、边界清晰。

场景 6:企业运维

服务器日志、监控告警、故障案例、设备说明。

放大后:AI 协助日志分析、故障定位、运维知识问答。

这 6 个场景不是"我跑通的功能",也不是"哪个产品的清单",而是"我这套 NAS 架构放大以后,逻辑上能长出来的方向"。

一个更上层的视角:三层 AI 架构

如果把上面这些场景抽象一下,可以总结成一个三层 AI 架构:

第一层:数据层 — 负责"拥有知识"

• NAS、企业存储、数据库、业务系统、文档库、历史项目数据

第二层:本地 AI 算力层 — 负责"找到 / 处理知识"

• Embedding、Reranker、OCR、ASR、视觉模型、分类模型、向量数据库、本地 LLM

• 这一层也是企业级 GPU Server / AI Server 真正发挥价值的地方

第三层:大模型智能层 — 负责"使用知识"

• 推理、总结、生成、规划、Agent 决策、跨领域分析

• 可以是本地大模型、私有云模型、公有云模型

这三层互相配合,是接力跑,不是替代。

用一句话总结:

**数据层负责"拥有知识",本地 AI 层负责"找到知识",大模型层负责"使用知识"。**

**未来企业采购 AI 算力服务器,可能不只是看"能跑多大的模型",还要看"这三层是否能完整搭起来"。**

十、为什么企业需要本地 AI 算力

到这里,你可能还是会问:

"那为什么不直接用云端 AI 呢?"

我能想到的四个原因,都是相对克制的:

1. 数据:AI 要服务业务,就要靠近业务数据

企业真正有价值的资料,大部分就在本地。合同、报价、内部技术方案、生产数据……这些数据不会自动跑到云上去。

如果 AI 想真正服务业务,就要靠近这些数据。

2. 隐私 / 权限:不是所有数据都适合云端

企业里有些数据适合云端,有些不适合,有些只能留在本地。

企业需要"选择权"。 不是"全部给云端",也不是"全部锁死本地",而是可以分级调用。

3. 成本:高频固定任务,完全走云端不一定是最优

Embedding、OCR、分类、Rerank 这些任务,调用频率高,每次内容不长。长期完全走云端 API,成本会持续上升。本地 GPU 承担这些"固定工作量",可能更合适。

注意,我不绝对地说"一定更便宜"——但这确实是一种可以比较的方案。

4. 可控:模型、数据、版本、权限、调用链

这是云端 AI 几乎给不了的事:

• 模型版本自己定

• 数据脱敏自己做

• 知识库自己重建

• 权限自己管理

• 调用链自己审计

对一些行业(金融、医疗、政府、央国企)来说,"可控"比"强大"更重要。

十一、当然,它也有边界

我必须把"它也不是万能的"这一章写清楚。

这篇文章如果只讲"用了本地 AI 一切问题自动解决",那是不真实的。

硬件的限制

我这台机器只有 8GB 内存,两个模型同时加载时,系统可用 RAM 只剩约 3.1 GiB,已经是明显瓶颈。T4 16GB 显存听起来不少,但如果你想同时跑 14B / 32B 的对话模型,就完全不够。我的策略是:小模型 + RAG,代替大模型硬扛。

这条路在企业放大以后,需要更强的算力 / 更多的 GPU / 更完善的硬件规划。

知识库质量

AI 回答质量,非常依赖:

• 文档本身质量

• 切片方式(把长文档切成多段)

• Embedding 模型选择

• 召回参数、Reranker 阈值

• 提示词工程

装上模型不等于一切问题自动解决。 调优是长期活。

AI 可能"幻觉"

AI 可能一本正经地胡说八道。

真正重要的信息,仍然需要核对原文。

边界(必须讲清楚)

"本地 AI"不等于"100% 绝对安全"。

如果最终仍然要调用云端大模型,RAG 检索出来的那几段上下文,通常仍会发到云端。

所以更准确的表述是:

**完整资料库保留在本地,本地 AI 先完成检索和筛选,再根据业务和数据敏感等级,决定是否将少量必要上下文交给云端模型。**

这种表述,既不夸大,又对企业 IT 友好。

十二、AI 时代,服务器可能要回答一个新问题

到这里,我想直接说一些更"放大"的话。

以前我们采购服务器,关心的问题往往是:

• CPU 有多少核

• 内存有多大

• 硬盘能放多少数据

• 电源稳不稳

• 网络够不够

但 AI 时代,也许还会多一个问题:

**这台服务器,有多少 AI 算力?**

因为未来服务器,不仅要存数据、跑业务,它可能还需要:

• 读文档

• 理解图片

• 处理语音

• 搜索知识

• 分析日志

• 运行 AI Agent

我这台 NAS,只是一个很小的实验。

但它让我第一次直观地看到:

**AI 算力和企业数据结合之后,服务器可能会拥有一种完全不同的价值。**

它不再只是"数据的仓库",它会开始成为"数据 + 算力 + 智能"的交汇点。

—————

最后,留下三个观点:

观点一:

**AI 不只是大语言模型。**          
Embedding、Reranker、OCR、视觉、语音,都是 AI。

观点二:

**未来企业 AI,可能不是"纯本地"或者"纯云端",而是"本地 + 云端"按需组合。**          
根据数据、成本、安全、性能,灵活搭配。

观点三:

**AI 时代的服务器,可能不仅承担存储、计算、数据库,还会开始承担"企业 AI 算力"。**          
我的 NAS,只是这个变化的一个很小缩影。

—————

我没有写"赶紧买 AI 服务器"。

我也没有写"本地 AI 一统天下"。

我只是想说:

**以后一个单位采购服务器的时候,是不是除了 CPU、内存、硬盘,也应该开始考虑 AI 算力?**

这个问题的答案,可能比"AI 服务器时代来了"重要得多。

—————

如果你也在折腾 NAS、本地 AI、企业知识库或 AI 算力,欢迎继续关注。

后面我会继续分享这套系统的实际使用、模型部署,以及企业 AI 场景的一些探索。

原始来源: DX智算局

评论 (0)