TensorRT Model Connect - 开源模型部署工具,两命令转C+
Key takeaway: TensorRT Model Connect(TRTMC)是 NVIDIA 于 2026 年 8 月 18 日以 Apache-2.0 协议在 GitHub 开源的一款模型部署工具,旨在将 Hugging Face 或本地模型检查点直接转换为原生 C++ 推理引擎。开发者仅需 `trtmc build` 和 `trtmc run` 两条命令即可完成部署,全程无需导出 ONNX 中间格式,构建产物为版本化的 .bundle 文件,运行时完全脱离 PyTorch 环境。该项目由 OpenAI Codex Agent 在人类监督下构建,代表了 AI 辅助开发部署工具的范式转变。TRTMC 提供覆盖 105 个模型系列、76 个模型家族的参考实现,包括 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型以及 Whisper 语音模型。性能验证方面,在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%。其技术架构将构建阶段与运行时解耦,提供统一的 C++ 任务 API(generate、transcribe、embed 等),并支持 NVIDIA 全系列 GPU(如 A100、H100、Jetson),可实现云端到边缘的全场景部署,适用于大模型推理服务、边缘 AI 推理、C++ 应用集成与模型快速评估。该工具通过版本化 .bundle 天然支持模型回滚与灰度发布,为生产环境提供了高一致性的交付单元。
- TensorRT Model Connect 是 NVIDIA 开源的模型部署工具,通过两条命令将 Hugging Face 模型直接转换为原生 C++ 推理引擎,无需导出 ONNX。
- 构建产物为版本化的 .bundle 文件,包含完整权重与优化配置,运行时完全脱离 PyTorch 环境,支持云端和边缘 GPU。
- 由 OpenAI Codex Agent 在人类监督下完成开发,代表了 AI 辅助构建部署工具的一次范式转变。
- 已覆盖 105 个模型系列,包括 Qwen、Llama、Mistral、DeepSeek 和 Whisper 等主流模型。
- 在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%,展现了稳定的生产级效率。
- 提供统一的 C++ 任务 API(generate、transcribe、embed 等),支持模型版本管理与回滚,简化了生产部署与灰度发布。
对于每一个在深夜与 ONNX 导出、PyTorch 运行时依赖搏斗的部署工程师,NVIDIA 开源的 TensorRT Model Connect 堪称一份及时雨。它不仅将模型到 C++ 推理引擎的流程压缩为两条命令,更直接摒弃了中间格式这一历史包袱,用版本化的 .bundle 和纯 C++ 运行时彻底解耦训练与推理。更值得思考的是,这个项目本身由 OpenAI Codex Agent 主导开发——部署工具正在被 AI 重写,而它要部署的也正是 AI 模型。这短短几百字的产品公告,折射出整个 MLOps 栈加速向自动化、原生化演进的信号。我们推荐所有关注模型生产化的团队立即研读其设计理念与性能基准,这种范式级的简化不仅关乎效率,更可能改变边缘与云端部署的成本结构。
TensorRT Model Connect 是 NVIDIA 开源的模型部署工具,通过两条命令将 Hugging Face 模型直接转换为原生 C++ 推理引擎,无需导出 ONNX。
—— 络石智能编辑部 · Editor's PickTensorRT Model Connect - 开源模型部署工具,两命令转C+
产品概述
TensorRT Model Connect(简称 TRTMC)是 NVIDIA 于2026年8月18日发布的开源工具项目,已在 GitHub 上以 Apache-2.0 协议公开。该工具可将 Hugging Face 或本地模型检查点通过两条命令直接转换为原生 C++ 推理引擎,全程无需导出中间格式 ONNX,构建产物为版本化的 .bundle 文件,运行时无需 PyTorch 环境。TRTMC 由 OpenAI Codex Agent 在人类监督下构建完成,代表了 AI 模型部署流程的一次重要范式转变。
核心功能
两命令完成模型部署:开发者只需执行trtmc build构建模型,再用trtmc run运行推理,整个过程零配置、零中间格式,大幅简化了从训练框架到生产推理的部署路径。构建后的 .bundle 文件可通过 C++ 任务 API(generate、transcribe、embed 等)直接调用推理能力。
原生 C++ 推理运行时:TRTMC 提供纯 C++ 推理运行时,运行时不再依赖 PyTorch 环境,真正实现训练与推理的解耦。生成的 .bundle 文件可通过trtmc::load接口在 C++ 服务、嵌入式应用或机器人控制栈中直接加载运行,适合边缘设备和生产环境部署。
105个模型系列覆盖:TRTMC 提供面向105个模型系列、76个模型家族的参考实现,涵盖 Qwen、Llama、Mistral、DeepSeek 等主流开源大模型,以及 Whisper 等语音模型。模型覆盖范围持续扩展,不断有新模型通过自动化工作流加入支持列表。
性能验证基准:2026年7月29日的 GB300 快照测试显示,102个 profile 的推理性能较声明基准提升超过5%,在实际生产场景中展现出稳定的性能收益。TRTMC 提供了详细的性能基准数据,开发者可参考对比不同模型的实际推理效率。
技术架构
构建阶段与运行时分离:TRTMC 将模型构建阶段(build)与推理运行时(runtime)完全分离,构建产物 .bundle 为版本化快照,包含完整的模型权重与优化配置,可独立交付到任意部署环境,确保生产环境的一致性。
版本化的 .bundle 产物:每个构建产物包含版本信息,天然支持模型的版本管理和回滚,便于生产环境的模型迭代与灰度发布,开发者可通过 bundle 版本快速定位和复现特定版本的推理行为。
C++ 任务 API:提供统一的任务抽象接口(generate、transcribe、embed、segment 等),开发者无需关心底层 TensorRT 细节,直接调用高层 API 即可完成推理,降低了 C++ 推理开发的技术门槛。
跨平台支持:基于 NVIDIA TensorRT 生态,支持 NVIDIA 全系列 GPU 硬件,包括数据中心 GPU(如 A100、H100)和边缘 GPU(如 Jetson 系列),满足从云端到边缘的全场景推理部署需求。
应用场景
大模型云端推理服务:在 NVIDIA GPU 服务器上快速部署 Qwen、Llama 等开源大模型,构建私有化的模型推理 API 服务,无需手动管理 ONNX 导出和 TensorRT 优化。
边缘 AI 推理:在嵌入式 NVIDIA Jetson 设备上部署轻量级模型,实现本地化的 AI 推理能力,适用于机器人、智能摄像头、工业终端等边缘场景。
C++ 应用集成:将大模型推理能力嵌入已有的 C++ 后端服务、游戏引擎、机器人控制系统等,无需引入 Python 运行时依赖,降低系统复杂度。
模型快速评估:开发者可通过 TRTMC 快速构建不同模型的推理服务,对比各模型在特定任务上的实际推理效率和输出质量,加速模型选型决策。
适用人群
AI 算法工程师、后端开发工程师、DevOps/MLOps 工程师、机器人控制系统开发者、边缘计算开发者、深度学习研究者和高校师生。
发布与支持
- 发布时间:2026年8月18日
- 开源协议:Apache-2.0(带 LLVM 例外条款)
- 官方仓库: https://github.com/NVIDIA/TensorRT-Model-Connect
- 技术文档: https://nvidia.github.io/TensorRT-Model-Connect/
团队信息
AI产品库官方
由 AI 猎手自动发现
Tags
Related Topics
Expert Comment
This article is curated by the editorial team from public sources for reference only.