推理引擎与模型部署
发现优质的推理引擎与模型部署工具,基于用户评价、使用数据与活跃度综合排序。
热门推荐 22 款

Ollama
免费增值Ollama 是一款开源本地大语言模型运行工具,支持一键下载并运行 Llama、Qwen、Mistral 等主流开源 LLM,无需依赖云端 API,数据完全在本地处理,保障隐私安全。提供简洁的命令行交互和 REST API,便于集成到开发工作流中,同时支持 macOS、Linux 和 Windows 平台。适用于本地模型调试、离线开发、隐私敏感场景以及 AI 应用的快速原型验证。

llama.cpp
免费llama.cpp 是一个基于C/C++的高性能本地大语言模型推理引擎,无需依赖GPU即可在消费级硬件上高效运行各类开源LLM。它通过量化技术(如GGUF格式)和底层算子优化,在CPU、苹果Apple Silicon以及多种AI加速器上实现低显存占用与快速推理,大幅降低了本地部署大模型的门槛。开发者可借助其简洁的API和丰富的模型生态,在个人电脑、边缘设备或私有服务器上构建离线对话、文本生成与智能代理等应用,兼顾数据隐私与运行效率。

Groq
Groq 是一家提供 AI 推理服务的厂商,核心产品为自研 LPU(Language Processing Unit)推理芯片及配套的 GroqCloud 云服务平台。

Cog
免费专为机器学习设计的容器化解决方案,简化环境配置与模型部署流程。

vLLM
免费用于大语言模型的高吞吐量和内存高效的推理和服务引擎

AscendNPU-IR
免费AscendNPU-IR 是基于 MLIR 构建的昇腾 AI 处理器编译中间表示,提供完备的算子表达能力,通过编译优化提升昇腾硬件的计算效率,并支持生态框架集成与深度调优。

Open WebUI
免费Open WebUI 是一款面向大语言模型的用户友好交互界面,原生支持 Ollama 和 OpenAI API 兼容的后端服务。它提供开箱即用的对话管理、RAG 文档检索、多模型切换以及可扩展的插件生态,让用户无需编写代码即可完成本地或云端 LLM 的部署与调试。适用于个人开发者搭建私有 ChatGPT 替代方案、企业内部知识库问答以及团队协作中的模型效果评估与 Prompt 调试场景。

BentoML
免费最简方式部署AI应用与模型——快速构建模型推理API、任务队列、LLM应用及多模型流水线等。

TensorRT-LLM
NVIDIA 开发的 LLM 推理优化引擎,vLLM 的直接竞品
AMCT
免费AMCT是华为CANN提供的昇腾AI处理器模型压缩工具,支持量化、剪枝、蒸馏等技术,帮助用户在不损失精度的情况下减少模型大小和计算量,提升推理效率。

SGLang
免费SGLang 是面向大语言模型与多模态模型的高性能推理服务框架

MLX-VLM
免费MLX-VLM 让你在 Mac 上通过 MLX 轻松推理和微调视觉语言模型(VLMs)。

llmfit
免费Rust 编写的终端工具,自动检测硬件信息并推荐适合本地运行的 LLM。从质量、速度、适配度、上下文等维度评估模型,帮助用户选择最合适的本地大语言模型。

LocalAI
免费免费的开源 OpenAI 替代品

Cherry Studio
免费Cherry Studio 是一款支持多个 LLM 提供商的桌面客户端,聚合 OpenAI、Anthropic、Google 等模型于统一界面,提供本地对话管理、主题自定义、会话分组等功能,让用户便捷地切换和使用不同 AI 助手。

vllm-omni
免费vLLM-Omni 是由 vLLM 官方开源的全模态推理与服务框架,在 vLLM 基础上扩展了图像、视频、音频的输入与生成能力,同时支持自回归模型与扩散 Transformer。该框架为开发者提供了统一的接口来部署和推理多模态大模型,可用于构建 AI 应用、聊天机器人、图像生成服务等场景。

TorchAir
免费TorchAir 是华为昇腾推出的开源工具,支持用户基于 PyTorch 框架和 torch_npu 插件在昇腾 NPU 上使用图模式进行推理。它自动将动态图编译为静态图,充分利用 NPU 硬件加速能力,显著提升推理性能并降低显存占用。

LiteRT-LM
免费LiteRT-LM 是 Google 推出的用于在边缘设备部署大语言模型的高性能推理框架

Triton Inference Server GE Backend
免费ge-backend 是基于 Triton Inference Server 框架开发的 GE 后端适配器,用于对接昇腾 NPU 生态,实现传统 CV 和 NLP 模型的服务化推理部署。它让开发者能够在 Triton 上无缝加载模型并运行在昇腾硬件上,降低异构计算迁移成本。

KServe
免费专为 Kubernetes 上的多框架部署而生的标准化分布式生成式与预测式 AI 推理平台,轻松实现规模化扩展