为什么AI大模型不靠CPU,反而把显卡价格炒上了天?
“电脑的核心大脑不是一直都叫 CPU 吗?
GPU(显卡) 难道不是用来打游戏、做 3D 渲染的?
怎么 ChatGPT、Claude 这些满嘴跑文字的 AI 大模型一出来,全世界都在疯抢显卡,英伟达老板黄仁勋的身价还直接坐上了火箭?”
AI 大模型不是大量的文字运算吗?跟图形图像到底有啥关系?
一句话先说结论:
大模型背后不是图像,而是海量的“矩阵乘法”;而 GPU 本质上不是“图像处理器”,而是一台“超级多核的并行矩阵计算器”。
一、 电脑不是主要依赖 CPU 吗?
在传统软件开发中(比如写 iOS App、做网站后台、跑数据库),确实是CPU 占绝对主导。
如果把计算机芯片比作干活的团队:
- CPU 是“老教授 / 精英特种兵”:
它的核心数量很少(通常 8 核、16 核、几十核),但单核性能极强,主频极高,配备了极其复杂的控制单元。 - CPU 的绝对强项:
擅长处理复杂的逻辑控制与条件跳转(各种代码里的if-else)。
在传统的业务场景里,用户在手机上点一个按钮,触发路由跳转,网络请求数据,解析 JSON,存入本地数据库。这种任务每一步都严格依赖上一步的结果,是高度串行(Sequential)的,由思维严谨的老教授按顺序处理最高效。
二、 GPU 是做图形渲染的,怎么就跨界了?
这其实是技术史上一次精彩的“跨界巧合”。
你在玩 3D 游戏或看渲染动画时,屏幕上有几百万个像素点。
如果要渲染一个三维角色的光影,本质上是把空间坐标投影到二维屏幕上,并计算每个像素的颜色与光照。这个过程在数学上,核心就是三维空间坐标的几何变换,用到的数学工具全都是:线性代数、矩阵乘法(Matrix Multiplication)和点积(Dot Product)。
更关键的是:屏幕第 100 行第 200 列像素的颜色,跟屏幕另一角像素的计算往往没有先后依赖关系。它们可以“同时算”。
为了跑满游戏画面,英伟达等厂商把 GPU 设计成了一个完全不同的物种:
- GPU 是“几万个只会算乘法的小学生”:
单个核心极其弱小,根本处理不了复杂的逻辑跳转。 - GPU 的绝活:大规模并行计算(Parallel Computing)。
它拥有成千上万个核心。给一万个小学生一人发一张简单的算式,口令一响,一瞬间同时算完。

三、 AI 大模型算的是什么?跟图像有关系吗?
大模型跟“图像”没有任何关系,但它的底层数学形态,和图形渲染完全重合。
大模型的底层架构是Transformer。它在训练和推理的时候,做的事情拆解开来是这样的:
- 分词与向量化: 把一段文字切成 Token,每个 Token 变成一个上千维的向量(一串数字)。
- 计算核心: 让输入向量与模型内部数百亿、上千亿个权重参数,进行密集的矩阵乘法。
- 计算规模: 推理时每吐出一个字,模型内部几百亿个浮点数就要和当前上下文做一次完整的矩阵运算;训练一个千亿模型,需要进行上千亿亿次以上的浮点运算。
关键的碰撞点来了:
- 让 CPU 去算大模型:
相当于让一个数学老教授拿笔按顺序算一万亿道乘法题。哪怕他算得再快,也是单兵作战,速度慢到猴年马月。 - 让 GPU 去算大模型:
成千上万个小学生同时开工,一微秒全员交卷,下一个字立刻就生成出来了。
所以,大模型根本不需要 GPU 的“画面输出能力”。
现代数据中心里昂贵的 AI 专用显卡(比如 H100、B200),甚至连插显示器的接口都彻底拔掉了——它们脱掉“显卡”的外衣,本质就是一台纯粹的并行矩阵计算怪兽。
四、 为什么 GPU 的价格会被彻底引爆?
除了“小学生数量多”,还有两个致命优势让 CPU 望尘莫及:
- 恐怖的显存带宽(高带宽内存 HBM):
一个千亿参数模型的权重文件高达几百 GB。不仅运算要快,把几百 GB 权重从内存塞进核心的速度也必须极快。GPU 的显存带宽(每秒几 TB)比普通 CPU 的内存带宽快了整整一个数量级。不仅算得快,“搬砖”速度更是降维打击。 - 不可撼动的 CUDA 软件生态:
早在 2006 年,英伟达就推出了 CUDA,允许程序员用代码直接调用 GPU 的核心来做通用数学计算,而不再局限于游戏渲染。当现代深度学习与大模型爆发时,全世界的 AI 框架(PyTorch、TensorFlow)底层几乎都是基于 CUDA 写的,构筑了极深的软件护城河。
科技的发展充满戏剧性。
几十年前,硬件工程师为了让玩家更流畅地玩 3D 游戏,硬生生点出了 GPU 这种专门做“海量并发矩阵运算”的技能树。
谁也没想到,几十年后,人类点亮通用人工智能(AGI)所需的巨量数学计算,正好精准撞在了这棵技能树上。