在NVL72域内分布专家执行,扩大agent并发请求的有效批处理规模
利用Wide Expert Parallelism、DeepEP等技术均衡专家负载,扩大并发批处理规模
NVIDIA 开发的 LLM 推理优化引擎,vLLM 的直接竞品