← 文章 / AI技术
量子位 6小时前 · 2026-09-24 22:22:57 · 3 阅读

PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍

随着大模型对算力需求持续攀升,GPU卡的采购成本、供给约束持续加剧。

AI推理的竞争正在悄然发生转向:不再单纯比拼“谁能够买到性能最顶级的硬件”,而是转向“谁可以把手中已有的算力资源用得更值”。

很多GPU卡,开源框架能够完成模型加载、权重下载、服务拉起,实现“能跑起来”,但实际压测性能往往远低于官方宣传水平。模型本身没有缺陷,硬件也可正常工作,性能损失的核心,来自模型框架与硬件之间存在的性能鸿沟。

这类GPU卡没有高速卡间互联,同时不在主流开源框架官方验证矩阵中。直接使用社区默认部署方案,会出现算子自动回退至低效通用实现、集合通信沿用NVLink硬件的调优参数、显存与并行配置沿用其他硬件默认值等一系列问题。硬件本身具备的算力潜力,被软件层的适配短板所禁锢。

是石科技(METASTONE)是一家“独立第三方全栈算力运营商”的科技企业。不绑定任何特定大模型厂商,致力于为客户提供涵盖硬件、组网、调度、优化与运营的一站式全栈算力交付服务。

凭借源自国家级计算中心的丰富经验,公司确保了算力集群高达99.95%以上的安全稳定运行(SLA)。目前,是石科技已纳管超过20000P的算力资源,运营10多个智算中心,拥有2个国家级超算中心。团队成员曾荣获3项戈登·贝尔奖,具备深厚的超大规模集群全栈技术服务实力等。

是石科技自研Meta-Infer高效部署引擎,是面向异构加速芯片的企业级高性能大模型推理引擎,尝试通过纯软件优化手段弥合这道硬件-框架之间的缝隙,在不改动模型结构、不修改任务语义的前提下,充分挖掘GPU卡架构硬件的推理能力,为行业提供一种可能性:

依靠软件优化,成本更低的GPU卡,有机会在部分推理业务指标上,逼近原本需要更高端GPU才能实现的服务能力。

Meta-Infer高效推理引擎的整套优化逻辑,分为两大关键阶段:

  • 算模协同,释放被硬件差异屏蔽的高性能路径;
  • 通算重构,打通瓶颈,充分榨干硬件资源。

最终将沉淀为Meta-Infer高效推理引擎的四项核心能力:内核补齐、算子优化与通信重构、并行与容量调优、缓存复用。

主流推理框架内置了大量高性能算子,但对于不在官方验证清单的长尾硬件,框架不会报错,只会静默绕开加速路径,降级运行低效通用逻辑。

很多高性能内核并非缺失,只是元数据、页尺寸、硬件内核适配不匹配,导致无法被触发执行。

Meta-Infer高效推理引擎,通过内核补齐完成适配修复:

  • 对齐硬件与框架之间的元数据定义,修正页尺寸配置,解锁原生高性能算子路径;
  • 替换不适配硬件的老旧计算内核,切换为面向目标硬件深度调优的实现;
  • 扩大通信快路径的生效阈值,让更多规模的通信任务避开慢速回退逻辑。
△该图由是石科技提供

以DeepSeek-V4.1-Flash为例,在8张PCIe-Only显卡环境的社区Day0基线版本中,输入吞吐仅1932 tok/s。

经过算模协同阶段的修复适配,补齐sparse-MLA Prefill快路径,替换FP8稠密GEMM慢内核,扩大PCIe-IPC通信快路径覆盖范围,吞吐直接提升至5850 tok/s。

这一阶段的提升,并不是创造全新算法,而是把硬件与框架本就具备、却被适配问题锁住的性能释放出来。

△该图由是石科技提供 △该图由是石科技提供

同样的思路也复现在DeepSeek-V4-Flash、GLM5.3等模型上:修正注意力头补齐的冗余计算,对KV缓存标记逻辑做向量化加速,适配硬件特性重构算子拆分逻辑,拓展CUDA计算图覆盖范围,让更多请求批次可以进入加速图执行。仅仅完成算模协同,多款模型就拿到20%-33%不等的吞吐增益。

完成硬件适配、解锁加速路径之后,性能瓶颈会进一步转移到通信开销、并行调度、显存分配、重复计算等环节。PCIe-Only架构卡间通信带宽远低于NVLink,如果直接套用面向高速互联硬件的默认策略,GPU会花大量时间等待通信完成,算力资源被闲置浪费。

2、算子优化与通信重构

依托算子优化与通信重构,Meta-Infer高效推理引擎对注意力、投影等关键算子做算子融合,压缩单步计算耗时;将计算任务和集合通信做时间重叠掩盖,把统计类计算嵌入通信间隙并行执行;改写集合通信逻辑适配PCIe带宽特性,降低消息传输带来的等待开销。

3、并行与容量调优

在此基础上开展并行与容量调优,放弃框架全局固化的并行参数,针对Prefill预填充、Decode生成不同运行阶段差异化配置张量并行、上下文并行策略;结合硬件显存特性,动态调整静态显存占比、KV缓存容量参数,规避显存溢出与算子回退;面向不同业务负载,灵活匹配流水线、张量并行的组合形态,让高并发短请求、超长上下文请求都可以拿到最优执行配置。

4、缓存复用

面向长文本、视频生成场景,缓存复用能力提供风险感知的缓存复用机制,根据实时生成状态动态判断缓存复用与刷新时机,在不牺牲输出质量的前提下削减重复计算与显存读写。

在DeepSeek-V4.1-Flash的实践中,完成算模协同之后,经过通算重构的全套调优:注意力算子融合、合理裁剪投机解码草稿长度、计算通信重叠、区分Prefill/Decode并行策略、重新调校显存容量参数,输入吞吐从5850 tok/s进一步提升至13274 tok/s,整体实现6.87倍吞吐提升,并且支持1M超长上下文。

这套方法论具备通用性,覆盖文本大模型、长上下文、视频生成多类任务:

DeepSeek-V4-Flash:经过全套优化输入吞吐从14546 tok/s提升至22584 tok/s,提升1.55倍;

GLM5.3:输入吞吐自3236.78 tok/s提升至6222.72 tok/s,提升1.92倍;P95首Token时延从141.6秒下降至46.6秒,上下文支持上限从27万Token拓展到105万Token;

在相同并发点配对比较下,B300的输入吞吐约为这台8卡整机的4.9–5.6倍(DeepSeek-V4-Flash,B300侧按SGLang cookbook推荐参数配置,C8输入33,937 / C256 60,486 tok/s),GLM-5.3 ¹上这一比值为3.5–4.7倍(B300侧C8输入16,384 / C64 23,503 tok/s)。

MiniMax H3视频生成模型:依托稀疏注意力、自研风险感知缓存复用、Turbo LoRA多手段组合,15秒参考图生视频端到端生成速度提升2.48倍,峰值显存与原始稠密基线保持持平。

△该图由是石科技提供

单机8卡整机配置,文生视频最高吞吐达到基线的5.33倍,参考图生视频达到基线的4.98倍,在不明显损失画质的前提下大幅缩短视频生成耗时。

把这组整机吞吐放到顶级GPU的同一把标尺上,差距比直觉更小:在统一整机口径下(单机8卡、5秒 / 768P / 16:9),文生视频296条/时、参考图生视频131条/时,对应B300的439条/时、225条/时,分别约为其67%和58%(B300侧按SGLang cookbook推荐参数配置,取16实例、每实例Inflight=1的最优档;其中文生视频对照的是B300的FL2VA结果)。

如果进一步按整机吞吐折算,在几乎无损的Ours Cache方案下,约2.6台6000D可对应1台B300的文生视频吞吐,参考图生视频约为2.9台;在Ours Cache + LoRA方案下,这一比例进一步缩小到约1.5台和1.7台。

硬件本身没有变化,性能差距的缩小主要来自软件栈、缓存策略与模型优化方式的组合。

下面这段是参考图生视频(Ref2VA)任务的同题对照,Dense基线、Cache-DiT、Turbo LoRA与本文方案并排呈现。

国产GPU卡:同一套方法论同样成立

Meta-Infer高效推理引擎也在国产GPU上完成了验证。

国产GPU往往也不在主流框架的官方验证矩阵内,因此需要针对具体硬件重新梳理执行路径。

例如,注意力模块需要显式启用面向该平台优化的NSA稀疏注意力实现,避免回退到低效路径;Shared Expert融合等默认面向NVIDIA/AMD平台的特性则需要关闭,以绕开不适配实现。

通信策略也需要根据推理阶段分别配置,Prefill采用偏吞吐优化的DeepEP normal模式,Decode采用偏时延优化的low_latency模式,并将Shared Expert与Routed Expert拆分到两条stream中并行提交,以进一步与集合通信重叠。

其中,仅将Shared Expert与Routed Expert改为并行提交,就在35组同配置配对测试中带来了11.26%的吞吐提升。

这说明对于国产算力而言,“能跑起来”同样只是第一步。

通过针对执行路径、通信模式和并行策略进行系统适配,仍可以进一步释放硬件的实际推理性能,使其更接近规模化生产服务所需的性能水平。

长尾硬件的新思路:“能跑起来”不是终点

全部优化工作均收敛在Meta-Infer高效推理引擎内部,全程无需改动模型权重与模型结构,不改变原有业务任务语义。

对于开源社区大量不在官方验证矩阵内的长尾硬件,行业过往现状往往是:新模型发布,权重可以下载、服务可以拉起,做到“能跑起来”,工作就宣告结束。

但这套实践证明,“能跑”和“可用、可规模化对外提供生产服务”之间,还存在巨大的软件优化空间。

在硬件供给存在约束、高端算力成本居高不下的大背景下,Meta-Infer高效推理引擎代表了一条新路线——不必一味追逐最顶级硬件,通过内核补齐、算子通信重构、并行容量调优、缓存复用这套软件体系,充分挖掘现有PCIe架构硬件的潜力。

这为大模型推理业务带来一种值得关注的可能性:借助深度软件优化,成本更友好的PCIe GPU,有机会在部分推理业务指标上向更高端硬件的服务能力靠拢。

硬件的上限由芯片决定,但硬件能实际发挥出多少能力,则由软件决定。

¹ 无损NVFP4量化版本:模型权重以NVFP4部署,保持既有模型计算定义,未引入额外精度损失。

*本文系量子位获授权刊载,观点仅为原作者所有。

原始来源: 量子位

评论 (0)