返回快讯列表
工具上新

NVIDIA 发布 TensorRT Model Connect,两条命令把开源模型塞进 C++ 应用

NVIDIA 于 8 月 28 日推出 TensorRT Model Connect,用 trtmc build 打包再用 C++ 加载,生产运行时不需要 PyTorch 和 Python 解释器,覆盖 80 多个模型家族。

NVIDIA 在 8 月 28 日发布 TensorRT Model Connect,文章开头先划清了边界。它不是新的推理框架,也不用来替代 TensorRT。官方给的定位是一批可读、可改、可扩展的参考实现,作用是把开源模型接进原生 C++ 应用。

流程是两步。先在 Python 侧执行 trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle,输入可以是 Hugging Face 的模型 ID,也可以是本地 checkpoint,产出一个装着 TensorRT engine 和模型专属运行时资产的 bundle。然后在 C++ 侧引入 trtmc/pipeline.h,用 trtmc 的 load 加载这个 bundle,调 generate 拿结果。Python 只在准备阶段出现,部署之后的生产运行时不需要 PyTorch,也不需要 Python 解释器。

接口分两层。语义 API 按任务组织,接受提示词、图像、音频这类常规输入,预处理、执行和后处理都替你包好。模块级 API 直接操作具名张量和单个 TensorRT 组件。两层落在同一套实现上,需要更细的控制时再往下走一层。自定义算子走 TVM FFI 接入,可以只把模型里的某一块换成自己的 GPU kernel,其余部分仍然由 TensorRT 跑。

覆盖范围官方标的是 80 多个模型家族,举的例子是 Nemotron Speech 和 Qwen 3 VL,硬件覆盖 x86、Arm、DRIVE AGX 和 Jetson AGX。发布节奏是每夜构建,实现、测试和文档由编码 agent 生成再经人工复核。文章称在已验证的工作负载上它比 torch.compile 更快,但全文没有给出任何吞吐、延迟数字或者硬件配置。

更多快讯