← 文章 / 开源项目
NVIDIA 开发者博客 39分钟前 · 2026-09-01 05:12:16 · 1 阅读

两条命令搞定从开源模型 Checkpoint 到 TensorRT 推理部署:NVIDIA TensorRT Model Connect 实战

开源 AI 模型迭代速度前所未有,但要将其真正落地到原生应用中,往往仍需要针对每个模型单独编写转换、预处理、后处理和运行时代码。

NVIDIA TensorRT Model Connect 这套开源参考实现正是为了解决这一问题。它演示了如何在原生 C++ 应用中使用 NVIDIA TensorRT 运行所支持的模型,你可以直接使用、检查、修改和扩展这些实现。Model Connect 的设计目标是:在 TensorRT 能够运行的任何环境中,支撑整个开源模型生态。

本文将介绍 NVIDIA TensorRT Model Connect 的定位,以及如何仅用两条命令,把一个 Hugging Face 上的模型部署为原生 C++ 推理服务。同时也会讲解它提供的两套 API 层级、如何集成自定义 GPU kernel,以及该项目如何紧跟开源模型生态的步伐持续演进。

Diagram showing the out-of-framework deployment pipeline from PyTorch Model (research checkpoint) to ONNX or TorchScript (exchange format) to TensorRT Engine (optimized inference) to C++ Production (native runtime). Dashed arrows indicate fragile steps that block or delay deployment, with failure modes labeled at each transition: export failures and unsupported operations, operator gaps and accuracy re-validation, and custom C++ plugins and compounding maintenance.
图 1. 框架外部署瓶颈
Diagram showing the TensorRT Model Connect stack. Model weights from a Hugging Face or local checkpoint feed into TensorRT Model Connect, which contains model implementations across 80+ model families including Nemotron Speech and Qwen 3 VL, continuously extended by an Agentic Model Implementation Workflow. The model implementation and weights combine into a User Application layer, which is built on three stacked components: Model Connect Task APIs supporting Text, Vision, and Audio; TensorRT; and hardware targets including X86, ARM, DRIVE AGX, and Jetson AGX.
图 2. NVIDIA TensorRT Model Connect 技术栈

如何用两条命令完成从模型 ID 到原生 C++ 推理的部署

把模型推向生产,不应该要求开发者精通编译器。Model Connect 将部署拆成两个阶段,两个阶段之间靠一个产物衔接。

1. 构建部署包(Python CLI)

对于受支持的模型,第一阶段是从 Hugging Face 模型 ID 或本地 checkpoint 构建部署包:

trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle

部署包内含 TensorRT engines 以及运行时所需的模型相关资源。

2. 加载并运行(C++)

第二阶段由一个原生 C++ 应用加载部署包,并使用任务级别的输入输出:

#include <trtmc/pipeline.h>
auto pipeline = trtmc::load("qwen3-0.6b.bundle");
auto result   = pipeline->generate("Explain why native inference matters.", {.max_new_tokens = 20});
std::cout << result.text << std::endl;

Model Connect 会处理 checkpoint 映射、TensorRT engine 构建、预处理、运行时编排以及后处理。你可以直接拿到一套完整可用的实现,不必为每个模型家族都重做一遍集成。

你可以用 Python 来准备模型,但部署后的应用以原生方式运行,生产运行时不需要 PyTorch 或 Python 解释器。

两种 API 层级,同一个起点

Model Connect 提供两层 C++ API。使用语义层 API 时,你可以直接操作熟悉的输入输出,比如 prompt、图像和音频,Model Connect 负责模型特有的预处理、执行和后处理。

如果需要更多控制,模块层 API 允许你直接使用命名后的 tensor 以及各个 TensorRT 组件,自定义推理流水线。两套 API 共享同一套 Model Connect 实现,因此你可以先从简单的任务级接口入手,只在需要时再去定制流水线。

使用自定义 kernel 扩展 TensorRT Model Connect

TVM FFI 提供了一种与语言无关的接口,用于调用 GPU 内核,而无需将调用方与内核的实现框架或运行时紧密耦合。通过 TensorRT Model Connect 使用 TVM FFI,你可以在 TensorRT 继续执行推理流水线其余部分的同时,将模型的特定部分替换为自定义 GPU 内核。这样可以更轻松地集成专用或新开发的内核,而无需围绕单独的运行时重建应用。完整示例可参阅 Bring Your Own Kernel 教程

面向开放模型生态的参考实现

Model Connect 并不是一个新的推理框架,也不会取代 TensorRT。它是一座桥梁:一边连接开放模型的端到端推理体验,另一边连接 TensorRT 将计算图转化为 GPU 加速引擎的能力。

每个模型的实现都服务于三个目的:

  • 在原生支持 TensorRT 的应用中运行已支持的开放模型
  • 通过一份完整、可审查的实现来学习模型及其推理流水线
  • 在此基础上扩展,以适配相关架构、自定义检查点或应用需求

这为更广泛的生态系统提供了一条更清晰的路径:从一个模型 ID 即可完成 TensorRT 部署。应用开发者可以直接基于可运行的代码起步;社区贡献者也能复用已有模式来添加对新模型的支持,而不必从零开始。

目标很简单:只要 TensorRT 可用,你就应该能通过一条一致的 Model Connect 路径来运行已支持的开放模型。

AI 原生构建,与开放模型同步演进

开放模型生态变化很快,新的架构和检查点不断涌现,因此参考库也必须以同样的速度迭代。

Model Connect 作为一个 AI 原生软件项目 构建而成:编码智能体在人类的指导和审核下生成实现代码、测试、集成与文档。这使得项目能够在保持一致架构和用户体验的同时,并行地开发和验证多个模型的实现。

Model Connect 通过每夜发布来缩短从新模型、用户反馈或社区贡献到可用实现之间的路径。自动化验证仍然是发布的把关环节,更快的迭代节奏能让你更快获得新模型支持、问题修复和体验改进。

交付完整的 TensorRT 工作流

Model Connect 构建于 TensorRT 之上,因此性能始终是核心。对于已支持和验证的工作负载,Model Connect 能够提供比 torch.compile 更快的推理速度,并且随着项目演进,每个实现都会持续被测试和优化。

性能不应以牺牲易用性为代价。Model Connect 将完整的工作流整合在一起:查找模型 ID、构建模型、从 C++ 加载,并在需要时进行适配。你既能以简洁的方式获得高性能的 TensorRT 推理,又能对底层推理流程进行检查、定制和优化。

开始使用 NVIDIA TensorRT Model Connect

访问 NVIDIA/TensorRT-Model-Connect GitHub 仓库,查看已支持的实现并构建模型包。你可以直接使用某个实现,也可以根据自身应用加以改造,还可以贡献新的模型支持,帮助下一位开发者将更多开源模型接入 TensorRT。

想用无需复杂搭建的 AI 原生方式快速上手?在你有权限访问的任意目录下打开终端,将以下提示词粘贴到编码代理中,片刻之后即可完成一次完整的部署。

/goal 将 https://github.com/NVIDIA/TensorRT-Model-Connect.git 克隆到
当前工作空间下的新目录 TensorRT-Model-Connect 中。检测当前 GPU
的 compute capability,修改仓库的开发 Docker 镜像,构建并启动容器,
安装 TensorRT-Model-Connect,仅针对该 SM 编译 CLI、TensorRT 后端
以及所有原生模型 DSO,然后构建并运行端到端的 Qwen/Qwen3-0.6B
冒烟测试。不要提交或推送任何更改。报告测试结果,并展示推理运行
的完整命令、输入与输出。

关于模型覆盖范围、架构细节以及完整的开发者指南,请参阅 TensorRT Model Connect 文档

原始来源: NVIDIA 开发者博客

评论 (0)