华为更新AI加速器路线图:下一代Ascend NPU提前发布,Ascend 960PR FP4性能翻倍
华为在年度华为全联接大会上更新了其 AI 硬件路线图,不仅增加了新的加速器和配套处理器,还提前了下一代 Ascend 960 加速器的发布计划。具体来说,华为加速了 Ascend 960 的开发进度,公布了 Ascend 970 和 980 的规格,引入了基于 UnifiedBus 的 Peerium 架构,并扩展了其垂直整合的 AI 基础设施产品线。
目前,华为正处于架构转型的关键阶段:过去近十年,其 Ascend 加速器(或称神经网络处理单元,这是该公司的官方称谓)一直采用 SIMD 架构,而新一代架构则融合了 SIMD+SIMT,将基于向量的处理与线程级并行性相结合。这一变革旨在提升多种 AI 负载下的硬件利用率和性能,其中 SIMD 负责数据并行操作,SIMT 则擅长处理分支密集的工作负载。
首批采用华为新架构的 Ascend NPU 包括用于预填充(prefill)和推荐场景的 Ascend 950PR,以及用于解码(decoding)和训练场景的 Ascend 950DT。华为在活动中表示,Ascend 950 平台正逐渐获得市场认可,Atlas 950 SuperPoD 系统已投入大规模商用,但公司未透露更多细节。华为称,面向训练的 Ascend 950DT 测试已取得“良好成效”,预计明年会有大量中国 AI 开发者开始在基于 950DT 的系统中训练模型。同时,华为承认其产能仍不足以完全满足国内需求。
事实上,2025 年 9 月,华为公布了 Atlas 950 SuperPoD 的最大配置:包括 2,048 颗鲲鹏 950 CPU、8,192 颗 Ascend 950DT NPU、160 个机柜(128 个计算机柜 + 32 个通信机柜)、8 FP8 EFLOPS、16 FP4 EFLOPS 算力,以及 16 PB/s 的总互连带宽。然而,2026 年 7 月,华为公开展示了一套实际部署的 Atlas 950 SuperPoD,仅包含 256 颗 CPU 和 1,024 张加速卡,远低于其最大配置。尽管公司仍将该架构描述为可扩展至 8,192 颗 NPU,但其官网并未列出此规格,因此外界不禁猜测,究竟哪些系统正在实现大规模商用。
目前来看,Atlas 950 SuperPod 的落地速度似乎并不快,可能是供应不足,也可能是因为其全新架构需要软件大幅重构。无论如何,Atlas 950 SuperPod 在很多方面更像是一次试水,为性能更强的 Ascend 960 系列加速器及其后续产品铺路。
说到 Ascend 960,这一系列将从 Ascend 960DT 起步,预计 2027 年第一季度正式上市,比原计划提前了三个季度。
Ascend 960DT 加速器预计可提供 2 FP8 PFLOPS 和 4 FP4 PFLOPS 的算力,搭载 288 GB(推测为 HiZQ 内存)、带宽达 9.6 TB/s,并配备 2.2 TB/s 的互连带宽。