诌首小诗解烦忧 1小时前 · 2026-09-14 07:06:26 · 1 阅读
从CPU、GPU、NPU到当前AI大模型的架构
人类对计算机器的探索,始终是一部在“通用控制”与“专用能效”之间反复摇摆的演进史。当人工智能的浪潮从理论推演迈入以大语言模型(LLM)为代表的工业化落地阶段,底层的计算范式经历了一场翻天覆地的重塑。从早期的中央处理器(CPU),到图形处理器(GPU),再到针对张量运算深度特化的神经网络处理器(NPU),硅片物理结构的演进与上层算法架构的收敛形成了一场精妙的共振。 拨开复杂的工程术语,整个人工智能计算体系在本质上可以归结为两个物理实体的映射:微观芯片上成千上万个乘法累加器(MAC)的组织形式,以及宏观算法中数据流的拓扑逻辑。
一、 算力底座的物理分野:从“简化CPU”到“级联乘加器” 在经典的计算体系结构中,CPU 始终是复杂控制流的绝对统治者。为了追求极低的单线程延迟,CPU 的硅片表面被大量多级缓存(L1/L2/L3 Cache)、分支预测器和乱序推测执行单元所占据。在 CPU 的世界里,真正的算术逻辑单元(ALU)只占很小一部分面积。这种设计擅长处理充满逻辑跳转的代码,但在面对浩瀚的矩阵运算时,其高昂的控制开销显得极其低效。 GPU 的崛起打破了这一格局。GPU 本质上是大规模并行的“简化版 CPU”。它大幅剥离了复杂的预测分支逻辑,将晶体管省下来用于大量复制基础计算单元,并通过线程束调度(Warp Scheduler)以成千上万个线程的高并发切换来掩盖数据访存的延迟。虽然 GPU 极大地拉高了并行吞吐量,但其底层的冯·诺依曼底色依然鲜明:每个计算核心依然遵循“取指、译码、读寄存器、计算、写回”的标准周期。在大规模计算中,数据反复穿梭于寄存器堆与缓存之间的能量消耗,往往数倍于乘加运算本身的物理功耗。为了把能效推向物理极限,NPU(神经网络处理器)应运而生。如果说 GPU 是成百上千个动作敏捷但各自独立的装配工人,那么 NPU 就是一条紧密咬合、严丝合缝的自动化装配流水线。 NPU 抛弃了指令译码与硬件缓存管理机制,其核心构件是由处理单元(PE)紧密互联构成的“脉动阵列”(Systolic Array)。在每一个极简的 PE 单元内部,通常仅保留最核心的乘加器(MAC)和基础暂存器。 NPU 能够实现数量级能效跃迁的关键,在于**“并行 + 级联”**的数据流动机制:数据从阵列边缘泵入,像心脏血液脉动一样,沿着横向与纵向在相邻的 PE 之间逐级定向流动与累加。输入特征被横向推移,权重在本地静止,累加和则垂直下落流出。操作数在阵列内部被连续复用几十甚至上百次,直接规避了反复读写片外主存的巨大代价。正是这种结构,促使许多大模型企业走上自研 NPU 与专用 ASIC 的道路。通过将特定的 Transformer 算子(如自注意力投影、RMSNorm、SwiGLU)直接硬编码进片上流水线,算法与硅片达成了几乎 1:1 的物理映射。
二、 算法本质:多层级联的并行矩阵系统 在微观上,硬件走向了并行的乘累加;在宏观上,当前的深度神经网络(DNN)展现出了惊人的数学对称性:它在本质上就是一个多层级联的并行乘法累加系统。单个神经元的基础公式为 y = \sigma(\sum w_i x_i + b)。其中主体的加权求和,在硬件底层对应着纯粹的通用矩阵乘法(GEMM)。同层之内的上万个神经元互不干扰,在空间上展现出纯粹的“横向并行”;而层与层之间则环环相扣,构成了有向无环图的“纵向级联”。在这个庞大的乘加海洋中,仅穿插了极少但不可或缺的非线性激活函数与归一化算子,以赋予模型弯曲高维表征空间、拟合现实世界复杂逻辑的数学能力。然而,一个反直觉的现象引发了业界的长期探讨:既然万亿参数的大模型能够展现出惊人的通用推理能力,为什么它的纵向层数往往只有几十层到一百多层(如 7B 级别常为 32 层,70B 级别常为 80 层,即使 400B 巨型模型也鲜有超过 130 层),而不能无限制堆叠到成千上万层? 这直接涉及大模型的尺度律(Scaling Law)以及深度与宽度的物理权衡:——串行延迟硬约束:在自回归文本生成(Decode)阶段,每一层必须等待前一层的计算彻底完成才能启动。过深的纵向层数意味着生成单个 Token 的硬件穿透延迟极高,受制于光速传播与访存延迟,系统的输出速度(TPS)会迅速劣化至不可用。——细粒度尺度律的指引:早期的 Kaplan 尺度律认为模型性能主要取决于总参数量,对宽深比例不敏感;但近年更精细的研究表明,最优宽度(Width)的扩展速率应接近最优深度(Depth)的三倍。当层数越过临界深度后,特征在深层趋向于恒等变换,边际收益急剧递减,更伴随反向传播梯度退化的风险。——MoE 的横向突围:为了在不增加纵向深度、不增加单 Token 推理延迟的前提下无限扩充参数容量,**混合专家模型(MoE)**应运而生。MoE 将占据绝大部分参数的 FFN 层横向复制出成百上千个专家,通过轻量级门控路由网络动态挑选 Top-K 专家激活。它将深度严格锁死在几十层,使模型具备数千亿的静态知识容量,而在单步运算中仅激活几十亿参数,完成了计算预算与参数容量的彻底解耦。
三、 信号处理视角的审视:FIR 路线的辉煌与代价 从信号处理与控制理论的高维视角审视,当前的大模型架构隐藏着一个更为深刻的特质:几乎所有主流大模型在推理时都遵循纯前向传播,呈现出类似有限冲激响应(FIR)滤波器的系统特性。 在数字信号处理中,FIR 滤波器没有内生反馈回路,当前输出仅取决于有限历史输入的加权卷积;而无限冲激响应(IIR)滤波器则引入了输出反向连接,借助内生反馈,IIR 往往能以极低的阶数和参数量,实现与极高阶 FIR 相匹敌的滤波特性。 人脑正是典型的强非线性、连续演化的时变 IIR 系统。人脑皮层高级区域向初级区域的反向投射轴突数量甚至超过了前馈轴突,丘脑与皮层之间构成了极其紧密的往复闭环震荡回路。借助局部神经回路之间的双向反馈,几十上百个神经元构成的耦合相空间即可演化出指数级(O(2^N) 或更高)的可达状态数与多稳态吸引子。正因如此,人脑仅凭 20 瓦的微弱功耗和有限的物理体积,就支撑起了近乎无穷的联想、思维演化与持久的工作记忆。 反观纯前向的大模型,由于缺乏反馈自旋机制,系统的有效状态空间严重退化,基本上与滑动窗口的抽头单元数量呈线性关系。为了捕获长程依赖,当前架构不得不采取极其昂贵的“暴力穷举”手段:显式维护海量 KV Cache,由于无法内生维持紧凑的高维隐藏状态,模型必须把过去所有的输入 Token 巨细靡遗地缓存到显存中,使得显存占用与访存带宽随着上下文线性飙升,直接撞上了硬件层面的“内存墙”。 既然 IIR 架构拥有远超 FIR 的能效比和指数级状态容量,为何当前 AI 体系没有全面倒向 IIR? 核心症结在于现代芯片的并行物理特征与工业软件工程对“确定性”的严苛要求:——硬件并行的惩罚:IIR 的时间因果反馈使得 y_t 必须等待 y_{t-1},这彻底破坏了 GPU 和 NPU 赖以生存的空间矩阵并行环境。大模型工业界宁愿堆砌百倍的参数与高阶 FIR 抽头,换取矩阵乘加在芯片流水线上的完全饱和吞吐。——训练稳定性的噩梦:IIR 结构在神经网络中对应着循环神经网络(RNN)及其变体。在复杂的非线性空间中,反馈环路经过时间轴反向传播(BPTT)极易引发极点失稳,滑向数值梯度爆炸或消失。——“工具属性”与“天才/疯子”的矛盾:工作在“混沌边缘”(Edge of Chaos)的非线性 IIR 动力系统具有极强的初值敏感性。微小的扰动可能诱发巨大的状态发散——它固然能带来跳跃性的自发联想与灵感(天才),但也伴随着概念漂移、不可复现乃至系统死锁震荡(疯子)的致命风险。这与现代工业对 AI“输出可复现、安全可控、边界清晰”的工具属性背道而驰。
四、 范式跃迁:分层混合架构与测试时动态自适应 面对纯前向 FIR 的资源枯竭与纯 IIR 的失稳风险,计算体系结构的终极演进并非“非此即彼”的零和博弈,而是走向一种在大体量确定性前馈(FIR)框架中局部嵌入非线性自反馈(IIR)的分层混合架构。 在这一构想中,系统呈现出双重结构的精妙协同:——宏观外层:受控的前向 FIR 骨架。承担长期记忆与确定性执行器的角色,保持端到端的梯度平滑流通与高并发矩阵乘法吞吐,充当整个智能体的“理性边界与安全护栏”;——微观内层:局部的 IIR 循环腔体。在网络的特定语义抽象层,引入轻量的局部自反馈连接,受控地演化数步动力学迭代,为系统注入低功耗的概念联想与高维表征补全能力。 尤为具有革命性的是,这一局部 IIR 模块甚至可以完全免去繁重的离线预训练,转而在推理运行过程中执行轻量化的“测试时自适应”(Test-Time Adaptation)。 这一机制在现代学术界已初露锋芒,例如斯坦福大学等团队提出的 TTT(Test-Time Training)架构,以及探索将静态 Transformer 与选择性状态空间模型(Mamba)相结合的混合设计。在运行时,外层静态权重犹如固化通识的大脑皮层,保持冻结以规避灾难性遗忘;而局部的动态单元则类似于海马体,通过局部的自监督步长或基于物理联想的赫布法则(Hebbian Learning),随输入文本在线更新内部参数。海量的上下文信息不再被庞大笨重的 KV Cache 机械式存储,而是被实时“吸收消化”为局部反馈连接的内部权重。 当任务结束,这些微观权重即可一键重置,或者选择性地整合沉淀。这种设计在物理沙盒内完成了创造性发散,将状态失控的隐患牢牢钳制在局域之内。
结语 从 CPU 的串行控制,到 GPU 的多线程并发,再到 NPU 的脉动级联,硬件的设计哲学一直在随着张量运算的形态不断蜕变。而当前大模型架构在经历从单纯加深到横向拓宽、从稠密网络到稀疏 MoE 的演进后,正逐渐逼近纯前馈体系的物理极值。 将人类工程学最坚固的“确定性前馈框架”与大自然进化出的“非线性内生反馈”深度融合,在硅基芯片的规整矩阵上容纳受控的微观动态学习,不仅是解决算力与内存墙困境的关键路径,更预示着人工智能计算架构从机械查表迈向真正具备类脑生机的新纪元。
一、 算力底座的物理分野:从“简化CPU”到“级联乘加器” 在经典的计算体系结构中,CPU 始终是复杂控制流的绝对统治者。为了追求极低的单线程延迟,CPU 的硅片表面被大量多级缓存(L1/L2/L3 Cache)、分支预测器和乱序推测执行单元所占据。在 CPU 的世界里,真正的算术逻辑单元(ALU)只占很小一部分面积。这种设计擅长处理充满逻辑跳转的代码,但在面对浩瀚的矩阵运算时,其高昂的控制开销显得极其低效。 GPU 的崛起打破了这一格局。GPU 本质上是大规模并行的“简化版 CPU”。它大幅剥离了复杂的预测分支逻辑,将晶体管省下来用于大量复制基础计算单元,并通过线程束调度(Warp Scheduler)以成千上万个线程的高并发切换来掩盖数据访存的延迟。虽然 GPU 极大地拉高了并行吞吐量,但其底层的冯·诺依曼底色依然鲜明:每个计算核心依然遵循“取指、译码、读寄存器、计算、写回”的标准周期。在大规模计算中,数据反复穿梭于寄存器堆与缓存之间的能量消耗,往往数倍于乘加运算本身的物理功耗。为了把能效推向物理极限,NPU(神经网络处理器)应运而生。如果说 GPU 是成百上千个动作敏捷但各自独立的装配工人,那么 NPU 就是一条紧密咬合、严丝合缝的自动化装配流水线。 NPU 抛弃了指令译码与硬件缓存管理机制,其核心构件是由处理单元(PE)紧密互联构成的“脉动阵列”(Systolic Array)。在每一个极简的 PE 单元内部,通常仅保留最核心的乘加器(MAC)和基础暂存器。 NPU 能够实现数量级能效跃迁的关键,在于**“并行 + 级联”**的数据流动机制:数据从阵列边缘泵入,像心脏血液脉动一样,沿着横向与纵向在相邻的 PE 之间逐级定向流动与累加。输入特征被横向推移,权重在本地静止,累加和则垂直下落流出。操作数在阵列内部被连续复用几十甚至上百次,直接规避了反复读写片外主存的巨大代价。正是这种结构,促使许多大模型企业走上自研 NPU 与专用 ASIC 的道路。通过将特定的 Transformer 算子(如自注意力投影、RMSNorm、SwiGLU)直接硬编码进片上流水线,算法与硅片达成了几乎 1:1 的物理映射。
二、 算法本质:多层级联的并行矩阵系统 在微观上,硬件走向了并行的乘累加;在宏观上,当前的深度神经网络(DNN)展现出了惊人的数学对称性:它在本质上就是一个多层级联的并行乘法累加系统。单个神经元的基础公式为 y = \sigma(\sum w_i x_i + b)。其中主体的加权求和,在硬件底层对应着纯粹的通用矩阵乘法(GEMM)。同层之内的上万个神经元互不干扰,在空间上展现出纯粹的“横向并行”;而层与层之间则环环相扣,构成了有向无环图的“纵向级联”。在这个庞大的乘加海洋中,仅穿插了极少但不可或缺的非线性激活函数与归一化算子,以赋予模型弯曲高维表征空间、拟合现实世界复杂逻辑的数学能力。然而,一个反直觉的现象引发了业界的长期探讨:既然万亿参数的大模型能够展现出惊人的通用推理能力,为什么它的纵向层数往往只有几十层到一百多层(如 7B 级别常为 32 层,70B 级别常为 80 层,即使 400B 巨型模型也鲜有超过 130 层),而不能无限制堆叠到成千上万层? 这直接涉及大模型的尺度律(Scaling Law)以及深度与宽度的物理权衡:——串行延迟硬约束:在自回归文本生成(Decode)阶段,每一层必须等待前一层的计算彻底完成才能启动。过深的纵向层数意味着生成单个 Token 的硬件穿透延迟极高,受制于光速传播与访存延迟,系统的输出速度(TPS)会迅速劣化至不可用。——细粒度尺度律的指引:早期的 Kaplan 尺度律认为模型性能主要取决于总参数量,对宽深比例不敏感;但近年更精细的研究表明,最优宽度(Width)的扩展速率应接近最优深度(Depth)的三倍。当层数越过临界深度后,特征在深层趋向于恒等变换,边际收益急剧递减,更伴随反向传播梯度退化的风险。——MoE 的横向突围:为了在不增加纵向深度、不增加单 Token 推理延迟的前提下无限扩充参数容量,**混合专家模型(MoE)**应运而生。MoE 将占据绝大部分参数的 FFN 层横向复制出成百上千个专家,通过轻量级门控路由网络动态挑选 Top-K 专家激活。它将深度严格锁死在几十层,使模型具备数千亿的静态知识容量,而在单步运算中仅激活几十亿参数,完成了计算预算与参数容量的彻底解耦。
三、 信号处理视角的审视:FIR 路线的辉煌与代价 从信号处理与控制理论的高维视角审视,当前的大模型架构隐藏着一个更为深刻的特质:几乎所有主流大模型在推理时都遵循纯前向传播,呈现出类似有限冲激响应(FIR)滤波器的系统特性。 在数字信号处理中,FIR 滤波器没有内生反馈回路,当前输出仅取决于有限历史输入的加权卷积;而无限冲激响应(IIR)滤波器则引入了输出反向连接,借助内生反馈,IIR 往往能以极低的阶数和参数量,实现与极高阶 FIR 相匹敌的滤波特性。 人脑正是典型的强非线性、连续演化的时变 IIR 系统。人脑皮层高级区域向初级区域的反向投射轴突数量甚至超过了前馈轴突,丘脑与皮层之间构成了极其紧密的往复闭环震荡回路。借助局部神经回路之间的双向反馈,几十上百个神经元构成的耦合相空间即可演化出指数级(O(2^N) 或更高)的可达状态数与多稳态吸引子。正因如此,人脑仅凭 20 瓦的微弱功耗和有限的物理体积,就支撑起了近乎无穷的联想、思维演化与持久的工作记忆。 反观纯前向的大模型,由于缺乏反馈自旋机制,系统的有效状态空间严重退化,基本上与滑动窗口的抽头单元数量呈线性关系。为了捕获长程依赖,当前架构不得不采取极其昂贵的“暴力穷举”手段:显式维护海量 KV Cache,由于无法内生维持紧凑的高维隐藏状态,模型必须把过去所有的输入 Token 巨细靡遗地缓存到显存中,使得显存占用与访存带宽随着上下文线性飙升,直接撞上了硬件层面的“内存墙”。 既然 IIR 架构拥有远超 FIR 的能效比和指数级状态容量,为何当前 AI 体系没有全面倒向 IIR? 核心症结在于现代芯片的并行物理特征与工业软件工程对“确定性”的严苛要求:——硬件并行的惩罚:IIR 的时间因果反馈使得 y_t 必须等待 y_{t-1},这彻底破坏了 GPU 和 NPU 赖以生存的空间矩阵并行环境。大模型工业界宁愿堆砌百倍的参数与高阶 FIR 抽头,换取矩阵乘加在芯片流水线上的完全饱和吞吐。——训练稳定性的噩梦:IIR 结构在神经网络中对应着循环神经网络(RNN)及其变体。在复杂的非线性空间中,反馈环路经过时间轴反向传播(BPTT)极易引发极点失稳,滑向数值梯度爆炸或消失。——“工具属性”与“天才/疯子”的矛盾:工作在“混沌边缘”(Edge of Chaos)的非线性 IIR 动力系统具有极强的初值敏感性。微小的扰动可能诱发巨大的状态发散——它固然能带来跳跃性的自发联想与灵感(天才),但也伴随着概念漂移、不可复现乃至系统死锁震荡(疯子)的致命风险。这与现代工业对 AI“输出可复现、安全可控、边界清晰”的工具属性背道而驰。
四、 范式跃迁:分层混合架构与测试时动态自适应 面对纯前向 FIR 的资源枯竭与纯 IIR 的失稳风险,计算体系结构的终极演进并非“非此即彼”的零和博弈,而是走向一种在大体量确定性前馈(FIR)框架中局部嵌入非线性自反馈(IIR)的分层混合架构。 在这一构想中,系统呈现出双重结构的精妙协同:——宏观外层:受控的前向 FIR 骨架。承担长期记忆与确定性执行器的角色,保持端到端的梯度平滑流通与高并发矩阵乘法吞吐,充当整个智能体的“理性边界与安全护栏”;——微观内层:局部的 IIR 循环腔体。在网络的特定语义抽象层,引入轻量的局部自反馈连接,受控地演化数步动力学迭代,为系统注入低功耗的概念联想与高维表征补全能力。 尤为具有革命性的是,这一局部 IIR 模块甚至可以完全免去繁重的离线预训练,转而在推理运行过程中执行轻量化的“测试时自适应”(Test-Time Adaptation)。 这一机制在现代学术界已初露锋芒,例如斯坦福大学等团队提出的 TTT(Test-Time Training)架构,以及探索将静态 Transformer 与选择性状态空间模型(Mamba)相结合的混合设计。在运行时,外层静态权重犹如固化通识的大脑皮层,保持冻结以规避灾难性遗忘;而局部的动态单元则类似于海马体,通过局部的自监督步长或基于物理联想的赫布法则(Hebbian Learning),随输入文本在线更新内部参数。海量的上下文信息不再被庞大笨重的 KV Cache 机械式存储,而是被实时“吸收消化”为局部反馈连接的内部权重。 当任务结束,这些微观权重即可一键重置,或者选择性地整合沉淀。这种设计在物理沙盒内完成了创造性发散,将状态失控的隐患牢牢钳制在局域之内。
结语 从 CPU 的串行控制,到 GPU 的多线程并发,再到 NPU 的脉动级联,硬件的设计哲学一直在随着张量运算的形态不断蜕变。而当前大模型架构在经历从单纯加深到横向拓宽、从稠密网络到稀疏 MoE 的演进后,正逐渐逼近纯前馈体系的物理极值。 将人类工程学最坚固的“确定性前馈框架”与大自然进化出的“非线性内生反馈”深度融合,在硅基芯片的规整矩阵上容纳受控的微观动态学习,不仅是解决算力与内存墙困境的关键路径,更预示着人工智能计算架构从机械查表迈向真正具备类脑生机的新纪元。
原始来源: 诌首小诗解烦忧