别只聊大模型了!AIInfra才是背后真正的“隐形地基”
如今刷到任何AI相关内容,大家都在聊模型参数、效果排名、Agent玩法,却很少有人提一个更底层的核心概念——AI Infra。
很多人不知道:你能用几块钱就能调用千亿参数的大模型、能让上万人同时在线对话不卡顿、几十万字的长上下文能秒读不崩溃,靠的根本不只是算法厉害,更是背后一整套AI基础设施在默默支撑。
这篇文章就用人人能懂的方式,把AI Infra讲透,顺便搞懂vLLM、SGLang这些业内天天提的推理框架,以及KVCache到底是怎么给大模型提速的。
01一、到底什么是AI Infra?
AI Infra的全称是AI Infrastructure,也就是人工智能基础设施。
打个最通俗的比方: 如果把大模型比作一辆性能跑车,算法工程师负责调教发动机、优化动力,让车的极速更快; 那AI Infra就是修建高速公路、搭建加油站、设计交通调度系统——它不负责让单车“跑得更快”,但负责让千万辆车能同时上路、跑起来不堵车、通行成本还能打下来。
一句话总结:算法团队关心“模型准不准”,AI Infra团队关心“模型能不能跑、扛不扛得住用、跑一次花多少钱”。
广义和狭义,别搞混
- 广义AI Infra:从硬件机房到软件平台全套都算,也就是“算力+网络+存储+软件”的整体,行业报告里的市场规模基本都是这个口径。
- 狭义AI Infra:特指软件层面的核心基建,也是业内技术岗位的核心工作——不碰硬件机房,专门做训练/推理框架开发、算力调度、模型服务化优化,把硬件算力真正变成可用的AI服务。
和传统IT基建有啥不一样?
普通的后端基建管的是CPU、内存、硬盘,解决的是网站、APP的高并发访问问题。 而AI Infra全程围着GPU转,核心要解决的是显存不够用、多卡通信慢、算力利用率低、推理延迟高这些大模型独有的难题——这些问题传统技术栈根本解决不了。

02二、一文看懂AI Infra完整五层架构
AI Infra是典型的分层架构,从下到上一共五层,越往下越偏硬件,越往上越贴近业务。

1. 硬件算力层:所有AI能力的“体力来源”
这是最底层的物理底座,我们常听的H100、A100显卡,还有AI服务器集群、液冷机房都在这一层。 它的核心作用就一个:提供原始算力。大模型训练和推理的所有计算,最终都要落到这一层的芯片上完成。
2. 高速互联层:多卡之间的“信息高速公路”
大模型训练往往需要成千上万张显卡一起工作,如果卡和卡之间、服务器和服务器之间传数据太慢,就会出现“算力闲着等数据”的情况,再强的显卡也发挥不出来。 这一层的NVLink、InfiniBand、RDMA高速网络,就是解决多机多卡的高速通信问题,让数据传输不拖算力的后腿。
3. 存储层:AI世界的“数据仓库”
用来存放所有AI相关的数据:训练用的海量数据集、训练好的模型权重文件、推理过程中的缓存数据、业务用户的数据等等。 针对不同场景会用不同的存储方案,比如训练用高吞吐的分布式文件系统,推理用低延迟的本地SSD和对象存储。
4. 核心中间件层:软件AI Infra的核心
这是整个AI Infra最核心的软件层,往上承接模型算法,往下对接硬件算力,也是技术含量最高的部分。
- 训练方向:DeepSpeed、Megatron-LM这些分布式训练框架,解决大模型拆到多卡上训练的问题
- 推理方向:vLLM、SGLang这些推理框架,解决模型推理慢、显存浪费、并发低的问题
- 调度方向:K8s GPU调度系统,给不同任务分配显卡资源,提升整体利用率
5. MLOps平台层:AI的“全生命周期管家”
负责模型从实验室到上线的全流程管理,包括模型版本控制、训练过程监控、推理服务的弹性扩缩容、日志告警、成本核算等等。 简单说就是让模型开发、上线、运维的整个流程标准化、自动化,不用每次都手动折腾。
03三、两大主流推理框架:vLLM和SGLang怎么选?
很多人刚接触AI Infra时,总会被vLLM、SGLang这些名词搞晕。其实它们都是大模型推理框架,作用就是给原生的模型推理做深度优化。
打个比方:原生PyTorch跑出来的模型,就像一个毛坯房,能住但是不舒服、空间利用率低;推理框架就是给它做精装修+空间改造,同样的面积,能住更多人,住得还更舒服。
目前业内最主流的就是vLLM和SGLang。
vLLM:通用推理的行业标杆
vLLM由加州大学伯克利分校团队开发,是现在工业界用得最多的推理框架,堪称通用推理场景的“标准答案”。
它最核心的突破就是发明了PagedAttention技术,彻底解决了KVCache的显存碎片问题,直接把GPU显存利用率从30%左右拉到了90%以上,单张显卡能扛的并发请求数直接翻了好几倍。
它的优势很明显:
- 显存管理做到了极致,通用场景下性能拉满
- 生态特别完善,几乎所有主流大模型都支持
- 兼容OpenAI的接口,上手就能用,改造成本极低
绝大多数场景,比如普通对话、文案生成、RAG问答,用vLLM都是最稳妥的选择。

SGLang:Agent与结构化输出的新王者
SGLang是近两年快速崛起的新一代推理框架,更偏向复杂的AI场景。 如果说vLLM是把“通用文本生成”做到了极致,那SGLang就是把“结构化输出、工具调用、多轮Agent对话”的体验拉满了。
它的核心亮点:
- 结构化输出原生加速:需要严格输出JSON、执行函数调用的时候,它的延迟比vLLM低很多
- RadixAttention前缀缓存:自动识别多个请求里相同的前缀内容,共享缓存,在多轮对话、RAG场景下特别省算力
- 支持更灵活的编程逻辑,可以很方便地实现复杂的Agent任务
简单总结:普通生成选vLLM,做Agent、工具调用、结构化输出优先考虑SGLang。

04四、KVCache:大模型提速的核心秘密
聊AI推理优化,永远绕不开KVCache。它是所有推理优化的基础,也是理解vLLM等框架的核心前提。
KVCache到底是啥?
大语言模型生成文字是“一个字一个字往外蹦”的,每生成一个新的字(Token),都要把之前所有的输入和输出内容,一起放进注意力层里计算一遍。 如果每次生成新字,都从头重新计算所有历史内容的注意力,就会产生巨量的重复计算,速度会特别慢。
KVCache的思路特别朴素:把之前算过的结果缓存起来,下次生成新字的时候直接复用,只需要计算新增的那一个字就行。 就像你做数学题,前面的步骤算完就写在草稿纸上,后面每算一步只需要加新的计算,不用从头到尾再算一遍。

这个简单的改动,带来的收益是巨大的:
- 推理速度直接提升数倍
- 上下文越长,加速效果越明显
但它也带来了新的问题:
- 缓存会一直占用显存,对话越长、并发越多,显存占用就越大
- 传统的连续显存分配方式,很容易产生显存碎片——就像停车场里乱停的车,看着有空地,但是停不进去新车,造成大量浪费

PagedAttention:给显存做“车位规划”
vLLM的PagedAttention,就是专门解决显存碎片问题的。 它借鉴了操作系统里“虚拟内存分页”的思路:把整块显存切成一个个固定大小的“块”,每个请求的KVCache可以分散存放在不同的块里,通过一张“映射表”来管理顺序。
打个比方:
- 传统方式:每个请求占一整段连续的车位,车开走后剩下的空车位大小不一,新车停不进去
- PagedAttention:把停车场划成统一大小的标准车位,每辆车可以停多个车位,有空位就能停,空间几乎不浪费
就这一个改动,直接让显存利用率翻了2-3倍,单卡能承载的并发量直接上了一个台阶,堪称大模型推理工程化的里程碑。
还有哪些常见的推理优化?
除了KVCache和PagedAttention,业内还有几个常用的优化手段:
- 连续批处理:不用等一批请求全部生成完再处理下一批,边生成边插入新请求,让GPU一直满负荷工作
- 模型量化:把模型权重从16位压缩成8位甚至4位,显存占用减半,计算速度还能更快
- 投机解码:用一个小模型先“猜”后面的字,再用大模型一次性验证,减少大模型的串行计算次数
05五、为什么AI Infra越来越重要?
如今大模型的算法差距正在快速缩小,真正决定AI产品体验和成本的,已经慢慢变成了底层的AI Infra。
同样的硬件配置,优秀的AI Infra方案能让推理成本下降一半、吞吐量提升一倍;同样的模型,好的基建优化能让用户感觉“响应更快、从不卡顿”。
未来AI要真正规模化落地,瓶颈绝不会是算法,而是能不能用更低的成本、更高的效率,把AI能力输送给每一个用户。而AI Infra,就是支撑这一切的隐形地基。
#AI #AIInfra