内核直接作用于 CuPy 数组或 PyTorch 张量,无需复制数据
cuda.core 使用标准 CUDA 上下文,其他组件可共享设备、流和内存
NumPy/SciPy 兼容的 GPU 加速数组库,由 Chainer 团队开发