← 文章 / 芯片硬件
TechRadar 1小时前 · 2026-09-22 06:54:37 · 2 阅读

华为 Ascend 960 SuperPoD 意欲超越 Nvidia:960E 集成逾 4000 个 NPU,UnifiedBus 互联支持 10 万亿参数模型


  • 华为 Ascend 960 路线图依靠规模、内存和更快的互联技术
  • UnifiedBus 连接成千上万的处理器,同时减少 AI 系统内部的通信瓶颈
  • Atlas 960 路线图实现 15,488 个处理器和 34 PB/s 带宽

华为正在扩展其 Ascend 平台,更大规模的设计可处理多达 10 万亿参数的 AI 模型。

该公司正在推进 UnifiedBus——一种降低通信开销的互联架构,旨在连接处理器、内存和存储。

这种策略为华为提供另一种方式,以弥补个别 Ascend 加速器在硬件上面临的局限性,而 Nvidia 的产品正在这点上形成约束。

Latest Videos FromTechRadarWatch full video here:

华为扩展 Ascend 960 系统

华为 Atlas 960 SuperPoD 路线图要求构建最多 15,488 个 Ascend 960 处理器的系统,相比之前 8,192 个处理器的配置有所提升。

公司称该系统可提供 30 EFLOPS 的 FP8 计算能力,采用 FP4 时达 60 EFLOPS,同时配备 4,460 TB 内存容量。

其互联带宽定为 34 PB/s,华为预计训练性能可达每秒 1590 万 tokens。

华为还加速了 Ascend 960 系列的开发,其中 960DT 计划于 2027 年第一季度推出,960PR 则定于 2027 年第三季度发布。

公司表示两个版本都将比之前预期提前发布,华为称性能提升已超过最初路线图目标。

"我们正在按每年一代的节奏演进 Ascend 芯片系列,"华为副董事长兼轮值董事长王承(David Wang)表示。

"在 2028 年和 2029 年,我们将分别推出 Ascend 970 和 980 芯片。得益于 Tau(τ)Scaling Law,它们的计算规格将继续翻倍,你还能看到巨大的进步……"

UnifiedBus 在 Atlas 960E 中连接 4,096 个 NPU

UnifiedBus 是华为专为大型 AI 计算系统设计的一种互连架构,用于连接处理器、内存及其他组件。

华为在 Atlas 960E 中应用了 UnifiedBus。作为 960 系列的一个变体,Atlas 960E 可连接最多 4,096 个 NPU,并让这些处理器能够访问整个 SuperPoD 内的共享内存。

该系统将 UnifiedBus 与 Hi-ONE 光技术相结合,使高速光连接更深入地延伸至计算系统内部。

其方法采用近封装光器件(NPO),将光组件部署在更接近处理器的位置,从而提升传输速度并降低能耗。

华为表示,这种设计有助于 SuperPoD 在数千个处理器之间高效传输数据,而无需完全依赖计算系统外部的传统光连接。

Atlas 960E 可以使用约 5,500 个 Hi-ONE 单元,取代原本所需的约 48,000 个传统 800G 光模块。

这一配置可将处理器互连系统的功耗降低 550 千瓦以上。

该架构还赋予 Atlas 960E 8 EFLOPS 的 FP8 计算性能,华为声称其支持包含多达 10 万亿参数的模型。

Atlas 960E 系统还可连接至包含 51.2 万个 NPU 的 SuperCluster,且该架构最终支持百万级处理器配置。

大型系统的重要性在于,华为不能仅靠单个加速器的性能来缩小与 Nvidia 的差距。

其策略是通过增加处理器数量并加速通信,让数千颗芯片在共享的计算环境中协同工作。

因此,UnifiedBus 变得至关重要,因为在高负载的 AI 训练和推理任务中,成千上万个处理器需要持续交换数据。


Google logo on a black background next to text reading 'Click to follow TechRadar'

原始来源: TechRadar

评论 (0)