← 文章 / 芯片硬件
虎嗅 3小时前 · 2026-09-29 22:27:07 · 2 阅读

从HBM 限高到NAND 加量,英伟达vs 存力到底谁拿捏谁?

本文来自微信公众号: 海豚研究 ,作者:海豚君,原文标题:《从 HBM 限高到 NAND 加量,英伟达 vs 存力到底谁拿捏谁?》

在上篇文章中存力接棒算力,HBM为什么“脱颖而出”?,海豚君从底层技术出发,回答了AI对存力的需求为何"突然"爆发,以及HBM凭什么成为高性能GPU的首选内存,并介绍了HBM内存技术的核心概念与逻辑。那么随着AI技术的发展,内存技术又将如何演变,以实现更大的容量和更快的带宽?

恰巧,近期业内也出现了两个看似矛盾的信号:一边是HBM路线图继续加码,堆叠层数从12层走向16层、20层;另一边据SemiAnalysis,英伟达下一代Rubin Ultra的HBM可能从16层一路砍到8层,同时以闪存颗粒为基础的HBF,也在试图从HBM手中分走一部分容量需求。

HBM是否会被取代,还是会更加稀缺?HBM究竟该不该继续堆高?本篇我们就沿着上篇结尾留下的容量、带宽和成本三条线索,主要讨论以下几个问题:

1)要继续扩大内存容量,行业有哪几条路可走?各自的代价是什么?为什么HBM的层数反而可能不增反减?

2)为什么带宽比容量更难提升?瓶颈卡在哪里,后续又有哪些突破口?

3)不同的场景下,哪条技术路线更可能被选择?对产业链以及内存厂商的话语权会有何影响?

以下是正文

一、扩大容量,有哪些途径?

先从如何继续加大内存容量的问题出发,目前业内有两个并行的方向:一是突破工艺上限,把单颗内存做得更强,代价是更复杂的工艺、更高的成本和可能更低的良率;二是更侧重性价比,不追求单颗性能,转而以数量取胜,用不同规格的产品匹配不同层级的需求。

1.1、路径一:更强的单颗性能

a.继续堆更多层

最直接的方法是沿着现有路径继续增加堆叠层数:HBM3E为12层,部分HBM4/4E将做到16层,HBM5路线图则指向20层。

但加层并没有说起来那么简单。HBM与XPU共同封装、共用底座和顶盖,因此内存堆的总高度是受限的:HBM3E及之前的规范上限为720um,HBM4放宽到775um。

限高之下要塞进更多层,只能:①把单层DRAM颗粒削薄;②压缩层间空隙,把微凸点(micro-bump)做小,甚至去掉微凸点,让上下两层的铜触点直接做铜铜键合(Cu-Cu Bonding)。

但更精密的工艺意味着更高的成本和更低的良率:①削薄后的硅片强度下降,更易翘曲或在堆叠中损坏;②层间空隙缩小,散热和绝缘填充都更难,热压工艺(TC-NCF)已难以胜任,需转向海力士的回流焊(MR-MUF)或混合键合;③层数越多,对供电、传输和散热的要求越高,TSV需要做得更密、孔径更窄。

简单来说,这条路径是用更难的工艺和更高的成本换单颗容量,对内存厂的要求更高,好处是新增的容量都能享受首排内存的高带宽。

b.绕过限高的偷懒方法

另一个“走捷径”的办法是变相加高堆叠高度:如下图,把GPU下方的中介层垫高,在两者顶部仍然齐平的前提下,让内存堆可用的高度提升到约800um。

这样可以少削薄甚至不削薄颗粒就多塞几层,省下复杂工艺带来的成本和良率损失。但能挤出的空间有限:从720um到800um,按每层宽度只比45um略有减少,最多只能再多放2层。

1.2、路径二:多放存储,以量取胜

a.多排内存:前排保速度,后排给容量

另一条路是增加内存的数量。由于紧贴XPU的位置有限,新增的内存大概率只能放在后排:这省去了加密堆叠的工艺难题,代价是后排内存的带宽势必更低。

这里后排用什么内存、怎么封装都有选择:①规格上,除了下图中的HBM,也可以用普通DDR,乃至基于NAND的HBF(后文展开),单位容量成本更低;

②封装上,后排既可以和XPU一起放在硅中介层上(速度快,但贵且中介层面积有限),也可以放到次一级的基板甚至PCB上(速度慢,但便宜、空间充裕)。

③但后排不能无限加,带宽是最大的瓶颈:因后排内存的数据需前排内存中转,整个多排内存的最大带宽,受限于首排HBM和XPU间的带宽。如下图的示例,若首排HBM与XPU之间的带宽为4TB/s,在扣除自身需要和XPU通讯占用的2TB/s带宽后,能用于替后排内存中转传输的带宽就只能有2TB/s,若再加第三排内存就依次减少。

b.HBF:更便宜的选择?

前文已提到,为了降低单位存储的价格,行业有考虑用其他规格存储来代替HBM,其中一个重要选项是HBF—即高带宽闪存(High Bandwidth Flash)。正如其名,它的结构基本是HBM的复刻:多层堆叠、TSV贯通连接上下、与XPU共同封装,只是把DRAM颗粒换成了NAND颗粒。

值得一提的是,NAND本身就是3D结构,为什么HBF还要像HBM一样多片堆叠?

原因在于,NAND的“3D”是存储单元层的堆叠,只加容量、不加读出通道:同一串单元共用一套读出电路,每次只能读其中一层。

HBF的额外带宽来自并行:单片die内部划分成大量小阵列同时读出(下图右),再用TSV把16片die堆叠起来同时输出。普通NAND 3D架构虽然也叠容量,却挂在同一条总线上轮流传输(具体情况请见海豚君对NAND的研究)。

与HBM相比,HBF的优劣势都很鲜明:

①优势--容量大、便宜、省电:计划于2026年末至27年初推出的HBF Gen1(16层堆叠),单堆容量可达512GB,而16层HBM4只有48GB;HBF单GB价格据调研可能只有HBM的1/5~1/10左右。且NAND颗粒天生功耗和散热需求相对更低。

②带宽做到同一量级:凭借类似的堆叠和共同封装工艺,据公司披露HBF Gen1读取带宽可达1.6TB/s(写入慢很多),约为HBM4规范最高带宽的55%。

③但NAND天生延迟高、写入慢、按块读取、擦写寿命有限,注定无法取代HBM:其读取延迟约1~10us,DRAM仅约0.1us,写入还要再慢10~100倍;按块读取则意味着每次都会夹带不需要的数据,实际有效带宽要打折扣。

因此HBF只适合不需要频繁读写的数据,如全量模型参数(非激活)、压缩后的上下文缓存、暂未调用的MoE专家参数等。

c.混合架构,最可能的结局?

以上讨论的各种方法,在传输速度、容量、成本这三者上都无法兼备,因而目前业内展望的一个最可能的远期解是,采取多级、混合的存储架构。例如在XPU芯片的一侧共同封装HBM提供高传输速度,负责需高频读写的数据,另一侧封装HBF提供更大的容量,负责相对更低频的数据。

更远期的HBM7设想中,还会再加一层走PCIe协议的池化存储,让每颗XPU都能共享调用整个系统的DRAM、SSD和HBF。各级存储各司其职:HBM放最常用的参数和KV缓存,DDR和HBF次之,SSD等池化存储存放不太被调用的“冷”数据。

1.3、HBM层数会不增反减?

近期另一个热议的市场观点:HBM的层数可能不增反减。起因是英伟达下一代Rubin Ultra:每个计算核心配4颗HBM,最初规格为16层,后据供应链反馈降为12层,最近又传出可能改为8层。

每颗GPU的HBM总容量也随之从768GB砍半再砍半至192GB。需要注意,以上变动均未经英伟达官方确认,只代表其在考虑不同选项。

XPU厂商可能“降级”用更少层数的HBM,除了堆高本身工艺难、成本高,还有三个原因:

①DRAM晶圆产能有限:目前要产出同等GB容量,HBM消耗的DRAM晶圆本已是常规DRAM的3~4倍。

而若堆叠层数继续加高,对DRAM晶圆损耗会更大。这样同样产线数量(产能)下,能产出的存储总容量反而会变少。而DRAM新增产能需要时间,据下图投行预测,24~26年晶圆产能增长有限,27年才会有较多释放。

因此DRAM圆晶产能有限,应当是HBM层数短期内或许无法继续堆高的主要卡点。

②互联规模扩大,系统总容量不降反升:即便单颗GPU的内存变少,Scale-up技术让单个机柜内互联的GPU数量大幅增加,系统总容量反而大增。

如下图,B300单颗GPU配8颗12层HBM3E、共288GB,一个机柜最多互联72颗,总容量约20TB;而Rubin Ultra单颗GPU即便只配8颗8层HBM、共192GB,最多可互联576颗,系统共享的总容量达110TB。单颗容量少了1/3,系统总容量却是前者的5倍上下。

可见,降层数本质上也是在产能有限的情况下,压降工艺难度和成本,以数量取胜。它有合理性,但也带来两个新问题:

①瓶颈转向Base Die和共同封装产能:用更多颗低层数HBM,省下了DRAM晶圆,却要消耗共同封装产能。关键从内存厂自身的扩产速度,变成了能从台积电(以及三星、Intel)锁定多少产能。

②拉高对互联的要求:堆叠层数由高降低低,更大占地面积要求更多共封产能,节省的产量转化为DRAM产品,但市场对存储的需求是不断增加的。这对内存池化要求自然会拉高。

压力就传到了提高内存利用率的连接技术上:

a.超量GPU互联下的HBM存储共享:Rubin Ultra就是在降低了HBM层数的情况下,从原本的72个GPU互联,拉高到柜内144个、跨柜576个GPU Scale-up,这样这个群组内,每个GPU上配的HBM也在同一地址上互联,从而实现更大的共享HBM存储池,用来承载围绕GPU运算和存模型参数的存储需求。

b.DRAM内存池化:是用CXL交换芯片做普通DRAM的内存池化,用这种交换芯片把一个个DRAM芯片组成一个大的内存池(类似用NVLINK把多个GPU连在一起),主要用来承载长对话和Agent模式所产生大量上下文数据。

此外,英伟达还通过CMX产品,也做一个NAND池化平台,来承载上下文记忆中使用频率不如DRAM的那部分。

二、封装与带宽,另两个关键要素

从层数之争可以看到两个关键变量:①带宽能否继续显著提升,只有带宽跟得上,堆高层数才有价值;②共同封装和Base Die产能是否充足,只有产能跟得上,降层数、多颗数的路才走得通。这就引出本部分的讨论:封装与带宽。

2.1、CoWoS封装

上篇已提到,HBM的高带宽离不开与XPU共同封装在硅中介层上。这一环节目前主要依赖台积电的CoWoS工艺(Chip-on-Wafer-on-Substrate),该技术顾名思义分为三层:最顶层的芯片(Chip),中层的中介层(Wafer),和最底层的基板(Substrate)。

其主要作用类似一个沙漏,把纳米级精度的芯片线路逐层放大,最终接到毫米级精度的主板上。(下图可见,芯片和中介层间由微凸点连接,中介层和基板之间是C4凸点,基板和PCB板之间是BGA焊球,每层连接精度逐步变低)

CoWoS有S、R、L三个变种,差别在中介层:S(Silicon)是整块硅中介层;R(RDL)用类似PCB的铜线加绝缘层复合结构;L(LSI,局部硅互联)则是两者的结合。

①CoWoS-S的问题除了贵,更在于面积受限:硅中介层全部用硅基裸芯,光刻单次曝光的最大面积约858mm²,更大就要多次拼接,拼得越多良率越低,目前最大只能做到单次曝光面积的约3.3倍。

②CoWoS-R即中介层的材质由硅片换为RDL,后者制作方式和PCB类似,由铜、绝缘层、塑封等堆叠而成。无需半导体工艺制造,因而成本更低、面积可以更大,但支持的线路精度也低,不适用于HBM场景,就不过多讨论。

③CoWoS-L则以RDL为主体,只在HBM与XPU连接处等需要高精度的位置嵌入小块硅桥。依靠该技术,单片中介层的面积已能做到单次曝光的5.5倍,英伟达从B200系列起就已采用。

④Intel和三星等公司也都有类似的共同封装工艺,其中Intel的EMIB工艺更加简单,去掉了中介层只有基板层。对需要高精度连接的部分,直接在基板内嵌入硅片层。不过目前EMIB技术基本仅用于Intel内部产品,外部客户如TPU和Trainium芯片,据报道仍在接触并测试该技术。

⑤从投行们统计预测的CoWoS产能数据,我们能看到:CoWoS-L确实已是主流方案,使用占比在60%以上。且相比DRAM晶圆的产能直到27年才会有一定释放(增长15%~20%),CoWoS的产能增长确实更快,27年就相比26年翻倍。

因此,选择用更多数量的低堆叠层数的HBM,而非数量更少但层数更高的HBM,从产能角度有其合理性。

⑥小结来看,CoWoS-L和EMIB工艺,都帮助降低封装的成本,并增加了芯片的最大封装面积,让单颗GPU芯片内能装配更多数量的内存,也是前文提到的GPU内封装多排内存的技术前提。

2.2、位宽和速率无法兼得?带宽还能如何提升?

单个内存的带宽=位宽(并行的道路条数)×速率(每条路上数据跑的速度)。一颗GPU的整体内存带宽=单个内存带宽×内存个数。靠增加内存个数来提升系统总带宽很简单直白,最大的限制就是XPU四周有没有足够的空间安装更多数量的HBM。因此我们把重点缩窄到如何提升单个内存的带宽上。

而单个内存带宽的高低,取决于内部带宽和外部带宽两个部分。内部带宽,是数据经内存块(Bank)汇总到其所在的内存层(Layer),再经TSV把整个堆栈(Stack)的信息汇总到基底层(Base Die),这一串流程的速度;外部带宽则是指Base Die把数据经中介层送到XPU的速度。

因此,内存带宽想要提升,需内部和外部共同提速。

这里直接给个结论,目前瓶颈和难度更多在外部带宽,难点更多在基底层和中介层的设计和制造。内部传输,毕竟传输的距离更短,且可以靠加密TSV通路的数量来提升。技术可行且实现路径比较清晰。

这里再给一个结论,位宽和速率看似是携手帮助提升带宽的“合作伙伴”,但实际两者更像是相互制约、相互竞争资源的“对手”。

从历代HBM看:HBM1到HBM3E,位宽一直是1024位,带宽提升几乎全靠速率(增长了8~10倍),但速率的提升也在放缓,从每代翻倍降到每代提升1/4~1/2;而到了位宽翻倍的HBM4,一开始标准速率是原地踏步都为8TB/s,后续才有所提升,可见两者不易同时提升。

那么制约位宽、速率提升各自的决定因素有哪些?为何位宽和速率是相互竞争关系?后续带宽还能不能继续大幅提升?这里涉及较多晦涩的术语,海豚君会尝试以更通俗易懂的类比方式来解释。

①位宽比较容易理解,即内存和XPU间的通讯线路数量,其决定公式大致是:位宽=线路占用的总面积/(线宽+线间距)。因此要提高位宽,要么需要线路的宽度和间距更窄(对应更高精度的刻蚀工艺);要么就需要在中介层上有更多的面积用于刻蚀通讯线路,同时HBM Base Die和XPU内的PHY面积也需要增大。

②速率是指单条线路每秒能传多少比特数据,好比水管里的水流速度:源头水压越大、水管越短越粗,水流越快。

对应到芯片,一是类似于水龙头的Base Die,需要以更高的频率和电压来发送信号,功耗和散热压力随之上升。这也是Base Die要交给台积电等以先进工艺代工的原因之一;

二是线路要短、要粗,线与线之间还要留足间距以防串扰。矛盾就在这里:位宽要求线细、排密,速率要求线粗、间距大,两者在同一块有限的面积里互相争抢。

③因此,要继续显著提升带宽,大致有三条路:一是改进Base Die的设计和工艺,让信号发得更快、更准;二是改进中介层,如加强线路屏蔽、增加布线层数;三是缩短线路,位宽和速率在线宽上冲突,在线长上却不冲突,例如未来把HBM直接叠在XPU上方或下方的3D封装。

三、做强单颗,还是以量取胜?抉择在哪?

以上分别讨论了提升容量和带宽的路径:提升容量的路多且方向各异,本质都是在成本、容量、带宽三者间取舍;提升带宽则殊途同归,需要在Base Die、中介层和封装上死磕。

接下来的问题是:行业会优先解决容量还是带宽?这又会如何影响内存厂的地位?我们先从最直接的成本入手。

3.1、HBM比其他内存贵多少?

虽然HBF尚未正式量产,无从得知其最终的实际成本。但由于HBF的结构和制作方法和HBM基本无异,区别仅在前者用NAND颗粒而后者用DRAM颗粒。那么从两种颗粒间的定价差异能窥得一二。

那么根据TrendForce统计的最新合约价格可见,DRAM和NAND相同容量的价差超8x,DRAM(DDR5规格)的单GB售价约为$16,而NAND(MLC规格)的单GB售价仅$1.9。

更重要的制造成本上,根据外行测算,HBM的单GB制造成本近期接近$5,且随着规格提升有进一步走高趋势。而常规DRAM的单GB成本不到$1.2,且因工艺成熟还在继续走低。这和HBM的晶圆损耗约是传统DRAM 3~4x的说法大体一致。

至于HBF,虽NAND颗粒相比DRAM便宜很多,但复杂的堆叠和封装成本是相近的。根据不同的信息源,有说HBF的成本是HBM的1/8,有说HBF的成本是传统NAND的10x,则对应HBF每GB成本约$0.5-$1,相当于HBM的1/5~1/10。

但HBF本质是牺牲带宽换高容量,HBF相比HBM每GB的价格折扣,正巧和HBF带宽相比HBM的差距基本相当。

另一个值得关注的现象是:HBM成本约为常规DRAM的4倍,售价差距却在迅速缩小,近几个月常规DRAM售价已达HBM的80%以上。海力士管理层年初曾表示,HBM毛利率仅约60%,常规DRAM则可达80%以上,成本低、工艺简单的常规DRAM反而更赚钱。

原因在于,HBM只供少数大客户、以长约锁价,无法灵活调整;常规DRAM客户分散,可以随行就市提价。这也印证了上篇的观点:HBM工艺虽复杂,但因绑定少数大客户,内存厂的议价权和价值量占比反而更低。不过据报道,新一轮HBM合约价有望从$15~17/GB上调至$20~30/GB,毛利率劣势将有所缓解。

3.2、容量和带宽,哪个更重要?

回到HBF与HBM的对比:若容量更重要,HBF更具性价比;若更看重带宽,HBM反而便宜一个数量级。这也印证了海豚君的判断:技术路线的选择,很大程度上取决于未来的卡点更多在容量还是在带宽。

卡在容量,后排内存、HBF替代等路径更可行;卡在带宽,就只能死磕首排内存的性能,或靠互联增加系统内的GPU和内存数量,代价也更高。

那么,哪些情形会让卡点更多落在容量或带宽上?

①容量需求增长更快的情形:模型参数不再大跨步提升(如从10T量级迈向100T量级),增长主要来自用户渗透率提升、上下文变长,或更多无需推理的执行场景。

②带宽要求更高的情形:模型总参数和激活参数继续大幅提升,推理的思维链和上下文更长,用户对Token生成速度的要求也更高。

3.3、三种情形:谁是卡点,谁赢得更多

我们分情境假设来看:

①情境一,模型参数平稳,增长主要来自用户数、上下文长度和Agent执行场景的扩张,对应前文"容量需求增长更快"的情形。

技术上,单颗HBM的层数和带宽都无需大幅提升,新增容量更多由后排内存、常规DDR和HBF来承接,分层混合的存储架构会更快落地。

此时工艺难度不再是主要矛盾,问题变成纯粹的供需匹配。存储更像回到传统的大宗商品逻辑:价格主要由供需决定,随着27年后新增产能释放和工艺成熟,单位成本和价格会逐步下行。

受益更多的是产能规模大、成本控制好的厂商,以及承接新增容量需求的NAND产业链(HBF、企业级SSD)。但这也是三种情境中最"周期"的一种:一旦各家(包括长鑫等新进入者)产能集中释放,价格下行压力最大,内存厂的超额利润也最难维持。

②情境二:带宽成为主要瓶颈——价值向封装和代工外溢

这对应"带宽要求更高"的情形:模型总参数和激活参数继续大跨步提升,推理的思维链更长,用户对生成速度的要求也更高。

技术上,层数未必继续走高,甚至可能像SemiAnalysis所说的"降层多颗"。竞争焦点从堆叠转向Base Die的信号速率、中介层布线和3D封装,卡点因此落在台积电的CoWoS和先进制程Base Die产能上。

存储系统的总成本和稀缺性大概率继续走高,但稀缺溢价更多被封装和代工环节拿走。Base Die越来越多由客户主导设计、交由台积电制造,HBM进一步定制化,内存厂的角色更接近"颗粒供应商",对少数大客户的依赖也更深。

受益最多的是台积电。内存厂之间,能自行提供Base Die和封装"一条龙"方案的主要是三星。

③情境三:容量和带宽双双告急——内存的"超级周期"

即参数规模再上台阶(如从10T量级迈向100T量级),同时用户和上下文也在持续扩张。

技术上,所有路径都要同时推进:单颗层数大概率要继续堆高,同时带宽也要提升,这时内存的稀缺性和价格大概率会有最大的提升。DRAM晶圆和封装产能双双告急。其中DRAM晶圆扩产更慢,可能成为最硬的卡点。

这时内存厂和封装厂的价值都会提升,且相比情境二,内存厂的议价权相对更高。因为高层数堆叠的良率和键合工艺等是由内存厂把控的。

需要注意,三种情境并非互斥。训练和前沿推理更吃带宽,大规模Agent推理更吃容量;英伟达、AMD和各家ASIC也可能选择不同的HBM配置。现实更可能是几种情境并存,对应前文的分层混合架构,区别只在于哪一种占主导。

3.4、尾声

回顾全篇,容量上,往高处堆(更多层、更薄的颗粒、更先进的键合),能让新增的每一GB都挂在首排HBM的全速通道上,代价是工艺难度、良率和DRAM晶圆消耗的全面走高。用更多占地面积往多处摆(多排内存、HBF、少层多颗),虽然工艺要求和单位成本更低,但要么牺牲带宽,要么把压力转嫁给Base Die和CoWoS产能。

带宽上则几乎没有捷径。位宽和速率相互掣肘,要继续大幅提速,只能在Base Die、中介层和3D封装几个方向上死磕,而这些环节恰恰大多不在内存厂自己手里。

至于最终走哪条路,在于AI接下来的需求更多卡在容量还是卡在带宽。卡在容量,存储回归走量逻辑,产能和成本是胜负手;卡在带宽,封装和代工环节的话语权上升,内存厂的议价权反而可能被稀释。

而若两者同时告急,内存自身的工艺和产能会成为最硬的卡点,内存厂在产业链中的分量也最重。

目前海豚君认为,容量需求提升是最高确定性,用户、用量和Agent场景渗透率大概率是持续走高的。后续的关键就是看大模型参数规模提升斜率,来确认带宽的提升速度要求。

后续判断落在哪种情境,可以重点跟踪几个信号:

①英伟达、AMD及各家ASIC新品最终采用的HBM层数和颗数;

②HBM4E的实际运行速率,以及HBM5位宽翻倍的落地节奏;

③CoWoS与DRAM晶圆产能的相对扩张速度;

④HBF在27年前后的首批导入情况等等。

至此,海豚君已完成了对存储技术的梳理,且技术路线的分歧,最终都会落到每一家厂商身上。

在下一篇中,海豚君将把视角从行业拉回公司,从技术拉回到供需匹配,各厂商与核心客户绑定的深浅,以及后续厂商们具体的业绩走势,看看谁更可能胜出。敬请期待!

原始来源: 虎嗅

评论 (0)