← 文章 / 行业与公司动态
快科技 4小时前 · 2026-09-25 00:24:06 · 1 阅读

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

AI 领域现在最缺什么?算力,一定是算力。

在国内,算力几乎是制约几家大模型厂商发展的最重要的环节。训练需要算力,国产大模型都陆续迈进几万亿的参数了;模型练好了有了用户,越好的模型用户越多,越需要算力,算力跟不上,体验就变差。

高端的英伟达算力卡不卖给我们,低端的也要多花钱、排队来。

所以国产算力卡即使不如英伟达的那么好用成熟,国内的大模型也不敢一根筋的吊在英伟达身上,华为昇腾、寒武纪、壁仞都在国产算力上有自己的一席之地。

要说现在算力领域最时髦的词儿,一定是 “ 超节点( SuperPod ) ”。在国产显卡领域,这个词儿并不让人陌生,但这种形态的产品其实是英伟达第一个做出来的。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

早在 2019 年以前,虽然那时候还没有大模型,但语音识别、图像识别之类的服务,也已经催生了大算力的需求了。单卡能力有限,人们很容易就想到把多张显卡拼起来的方式获得更大算力。

人们以为用 100 张卡拼在一起能得到 100 张卡的算力,结果能用出来 3 - 4 成就不错了。究其原因,粗暴的把这些卡连在一起,但通信协议带宽差,数据流通起来太差,另一个是各家攒起来的服务器没有标准化,模块适配度和稳定性也差。

所以英伟达推出了一套自研 NVLink 高速互联协议、再加上 InfiniBand 组网、给服务器里适配专属硬件和软件。

16 张 V100 GPU 拼成了一个超节点,最多把 96 台超节点服务器里的 1536 张卡通过组网互拼,这种显卡打包套装就是超节点集群( SuperPOD )。

业内说英伟达把原来的显卡利用率从 4 成提升至了 8 成,而且因为整体性很高,企业几乎开箱即用,有效算力高,所以大家特别买账。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了
英伟达在超节点上的演进

而咱们国产显卡,要说单卡性能,相比英伟达的最新显卡肯定是远远不如。但超节点给了我们一个思路,单卡不太行,但是如果组合成超节点,只要系统开销能稳定住,拼数量的话,我们没问题啊,咱不最擅长大力出奇迹嘛。

去年华为 CloudMatrix 384 出来的时候,国内显卡终于算在超节点上迈出去了。正巧遇到 DeepSeek 横空出世,推理训练火得一塌糊涂,不同于预训练对于算力的庞大需求,384 超节点恰好能满足推理需求,就也把它带火了。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

今年上半年,昇腾 950 的组成的超节点也开始交付了,单机柜 64 卡,16 个机柜,共 1024 张显卡为统一编址的超节点。作为对比,英伟达由 NVLink 连接的单一高速互联超节点 NVL72 里是 72 张 GB200。

如果不考虑 CUDA 生态,从超节点的某些纸面参数来看,昇腾 950 超节点已有和英伟达最新的超节点有一战之力。

上周华为全连接大会上,华为把基于昇腾 960 的单一超节点规模推向了 4096 张显卡( 明年一、三季度交付 )。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

昇腾 960 本来就比 950 性能提升一倍,而整体的互联架构相比 950 的更进一步,时延、统一内存池的优化都又有提升。

华为超节点里昇腾的名字大家最熟知,但让它发挥出超节点魅力的其他关键技术,反而大家很少知道。

在我看来,排头的必须是华为 “ 灵衢协议( UnifiedBus ) ”。就像我前面说到的,制约服务器算力发展的,最重要的就是数据互通,其实也就是协议问题。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

以前不同零件、模块、节点、集群都有自己一套协议,非常碎片化,数据需要不停的反复转换,不仅延迟极高,还浪费算力。英伟达因此弄出来 NVLink+InfiniBand 协议来解决它。

咱也知道,华为是靠通信起家,来重新给设计一套互联协议这不是手拿把掐,不管是服务器内部、节点之间、集群之间都可以用灵衢来通信,相比英伟达节点内外分层传递数据的方式,灵衢显然更加统一。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

而且为了让更多厂家跟进这个灵衢,华为还把这个给开源了。在华为超节点的发展上,我愿称【灵衢协议】是其灵魂技术,有了它打底,才让其他技术发挥了更大的作用。

协议部分打通了,这次华为在硬件上也搞了一个大新闻,他们刚发布了业内第一个基于 NPO 的光互联产品 Hi-One。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

2026 A 股最火的是啥,不就是光模块嘛,为啥这么火,就是因为在训练大模型的时候,为了能顺利的保证柜间通信稳定,必须用光模块来把信号相互传递出去。

为什么不用电缆来传信号呢?因为不仅长距离高速电信号的电磁问题和衰减问题根本解决不了,而且功耗也会夸张到离谱,用光信号才能保证速率和功耗。

一般英伟达万卡级别的超节点集群配备 4.5 万~5 万颗光模块,可想而知行业对光模块的需求。

大家可以看到底下这张图左边就是传统光模块的样子,放在机柜背部密密麻麻的,其实这样排布,光模块离显卡芯片还有几十到 100cm 距离,这部分必须走电信号,为了保证电信号无误,需要专门的 DSP 进行时钟恢复和信号重整,功耗很大。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

但华为的这个 Hi-One 不同,它用了最新的 NPO ( 近封装光学 )技术,也就是把光引擎尽可能的放在芯片 5cm 以内的地方( 上图的右边 ),可以省去绝大部分电路传输的开销。

而且 Hi-One 内置多通道激光器,每根光纤又用到了波分复用技术,一个光纤就可以传输多种信号。

华为说自己用 5500个 Hi-One 就能替代原本 4.8 万颗( 800G )光模块,数量上一下减少了 90%,信号更可靠了,功耗还大幅降低了,三赢。

然后今年华为其实还有一个技术挺值得说的,叫鲲鹏超节点。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

鲲鹏是华为的 CPU 芯片系列,其实年初在 MWC 上我就见过鲲鹏超节点,但那时候它主要还是负责在银行等比较吃数据库的本地部署服务器上,最多 16 个节点。

结果今年大模型开始强调 Agent,对 CPU 的重视大幅提升。咱之前也出过科普,Agent 要跑代码、调浏览器和数据库、处理文件、管上下文,在不同工具之间来回调度,这都是 CPU 的活。尤其是现在的大模型的 Agent 的开销是以万计,不配强一点儿的 CPU,都负载不起来。

所以,今年开始,英特尔 AMD 的股价也跟着狠狠的吃了一口肉,英伟达也开始做专门面向 Agent 计算的 Vera CPU。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

这次鲲鹏超节点,型号本身没有变,还是鲲鹏 950,但它的最多支持的节点数进化到了 4096 个,统一内存池升高到了 256TB,内存利用率和速度变快了,AI 的沙箱启动速度也比传统服务器方案提升 30 倍,用数量和架构补足单个 CPU 性能的落后问题。

据悉下一代鲲鹏 960 就要用上韬定律了,到时候性能应该会更强一些。。

其实这次华为全连接大会还公布了一些其他的技术,比如 OceanStor M900,一个面向大模型上下文记忆的 PB 级存储的产品,节省计算和存储之间的数据搬运时间;远近内存统一编制技术,让超节点全局内存统一编址,让处理器能够更快更方便地访问本地内存和其他节点的内存……

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

以上提到的这些,昇腾 960 负责 AI 计算,鲲鹏超节点负责通算与 Agent 运行,OceanStor M900 负责记忆,灵衢和 Hi-ONE 把它们连接起来,最终组成 Agentic AI超节点集群,共同优化了华为超节点的性能。

在我看来,华为这套东西在工程上确实走得挺前面的。比单卡算力,我们确实不如国外,甚至可以说差得远,但是幸亏超节点看的是综合性能,比拼的是系统构架的优化能力。

以后大模型参数要奔 10T 了,行那我们就配 10 万张卡的超节点集群。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

我觉得华为能把这个事儿做到这个份儿,其实和它在各个领域都有所积累离不开。协议能做、芯片能自己设计、常年跟数据打交道……

就像在上面写到 Hi-One 时,其实我挺好奇的,怎么华为会是业内第一个做出来量产 NPO 产品的厂家?看起来和华为的能力也不搭呀,难道华为在这方面有积累?当我把这个问题抛给 AI,它跟我说:

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

华为做光通信已经有 30 年了,其实也是研究怎么用光纤传输超大量的高速数据。以前用在运营商骨干网、接入网的光技术,换个方式跑到了超节点里。

像 oDSP 光数字信号处理器、WDM 波分复用、硅光技术等都是可以复用的。

不夸张的说,可能超节点里面的各个方面,华为在以前都或多或少涉及到,加上工程化能力强,全套都可以自主自导,于是现在拿出来的东西足够让业内惊艳。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

英伟达肯定也想全套自己来,不想被供应商拖了后腿,说不羡慕肯定是假的,但确实没有这么多积累,一下子铺不了这么大。

今年上半年老黄曾经在播客上说:“ DeepSeek 首次跑在华为芯片上,对美国来说将是一个可怕的结果 ”,但当时大家普遍认为华为搞定不了大模型的预训练,只能做些推理训练,老黄说这话是为了让特朗普尽快的开放中国市场,把钱捞到手。

DeepSeek选华为对美国是个可怕的结果?现在我信黄仁勋了

可当华为上周把这些东西公布之后,我信老黄说这话是发自真心的,可能他很早就知道了华为正在研究的这些技术,并且进步飞速。按照华为已经公布的纸面参数上,已经不虚于英伟达,单卡性能不够,万卡、百万卡来凑,到最后大家拼的是有效算力嘛。

就像韬定律一样,真正颠覆性的创新?好像没有。但是各个细节多抠一抠,照样能发挥出让人难以忽视的威力来。

现在拦路虎就剩下如何把量产给提上来,以及 CANN 什么时候站起来替代 CUDA。这两个事儿,一时半会儿解决不,前面的突破要等国产光刻机,后面那个只能靠大家不断使用给一步步优化了,总归现在比当初刚开始用昇腾的情况好多了。

而且,我们之前在 WAIC 上看到,其他国产显卡厂商都在发力超节点,也都各有成果。

美国费了半天劲,国产 AI 大模型争气的有好几个,算力系统也没被卡着脖子,这感觉真爽啊。

原始来源: 快科技

评论 (0)