Meta 携手韩国初创 Panmnesia 构建 CXL 架构,单域支持近千块 AI GPU
- Meta 希望在一个一致的数据中心域内运行近 1000 块 AI GPU
- Panmnesia 的 CXL 设计将 CPU、加速器和内存跨多个机架连接起来
- 该架构将每个 CPU 的加速器协调数量从 2 个提升至 16 个
Meta 正与 Panmnesia 合作,设计一种数据中心架构,旨在让数千个处理器在一个统一一致的环境中协同工作。
该方案采用 CXL(Compute Express Link)协议,在无需传统网络连接的情况下,将多个机架中的 CPU、加速器和内存互连起来。
这一架构能够将多达 960 个 AI 加速器纳入同一一致性域,使其性能相当于一套由近 1000 块 GPU 组成的单一系统。
Latest Videos FromTechRadarWatch full video here:CXL 架构扩展加速器连接性
当 AI 训练系统整合数百甚至数千个加速器以处理海量数据时,这一问题变得愈发棘手。
每个加速器都必须经历重复的计算阶段,这意味着任何一个部件的延迟都会迫使其他设备等待后才能继续工作。
因此,研究团队致力于减少机架间不可预测的通信延迟。在单个系统之外,机架间连接通常由以太网或 InfiniBand 网络处理。
这些网络需要数据包处理和软件协调,随着工作负载扩展到更多服务器,这种机制会引入更大的延迟波动。
相比之下,CXL 提供共享一致性机制,使处理器、加速器和内存能够在一个互联的资源环境中协同运作。
提议的架构增加了专用硬件,旨在使通信路径和处理行为在更大的网络中保持一致。
Panmnesia 的设计采用高扇出交换机、链路加速单元和网络控制器来管理整个系统的流量。
这些组件按照托盘、Pod 和互连结构的方式组织,借鉴了通常用于安排半导体芯片内部功能模块的组织原则。
该公司表示,其 fabric controller 和 link acceleration unit 已完成硅验证,交换芯片也已流片。
据报道,在产品商业化研发仍在进行的同时,预量产硅片已开始供应。
单个一致性域最多可容纳 960 个加速器
该评测将这一设计方案与 NVIDIA 的 GB200 NVL72 进行了对比,后者由一颗 CPU 通过 NVLink-C2C 直接协调两个加速器。
而在 Panmnesia 的架构下,一颗 CPU 可以协调 16 个加速器,相比这一参考配置提升了 8 倍。
根据公布的设计,约 60 个这样的分组可组成一个包含大约 960 个加速器的一致性域。
跨机架访问延迟也有望从微秒级降至几百纳秒,大约降低了一个数量级。
这种架构还支持在单个设备发生故障时单独更换,而不必让整台服务器下线。
这种分离设计可以减少故障时被移除的正常硬件数量,不过实际收益仍取决于具体实现。
Panmnesia CEO Myoungsoo Jung 在发布时表示:“CXL 能让整个数据中心作为单一计算系统运行。”
该架构仍面临物理限制,因为电信号 CXL 在 128 GT/s 下配合两个 retimer,传输距离只有大约 7 米。
因此,Panmnesia 提出用光 CXL 链路来实现更长距离的传输,并表示已完成该方案的概念验证硬件测试。