行业动态

TensorRT Model Connect - 开源模型部署工具,两命令转C+

Key takeaway: TensorRT Model Connect(TRTMC)是 NVIDIA 于 2026 年 8 月 18 日以 Apache-2.0 协议在 GitHub 开源的一款模型部署工具,旨在将 Hugging Face 或本地模型检查点直接转换为原生 C++ 推理引擎。开发者仅需 `trtmc build` 和 `trtmc run` 两条命令即可完成部署,全程无需导出 ONNX 中间格式,构建产物为版本化的 .bundle 文件,运行时完全脱离 PyTorch 环境。该项目由 OpenAI Codex Agent 在人类监督下构建,代表了 AI 辅助开发部署工具的范式转变。TRTMC 提供覆盖 105 个模型系列、76 个模型家族的参考实现,包括 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型以及 Whisper 语音模型。性能验证方面,在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%。其技术架构将构建阶段与运行时解耦,提供统一的 C++ 任务 API(generate、transcribe、embed 等),并支持 NVIDIA 全系列 GPU(如 A100、H100、Jetson),可实现云端到边缘的全场景部署,适用于大模型推理服务、边缘 AI 推理、C++ 应用集成与模型快速评估。该工具通过版本化 .bundle 天然支持模型回滚与灰度发布,为生产环境提供了高一致性的交付单元。

Key Takeaways
  1. TensorRT Model Connect 是 NVIDIA 开源的模型部署工具,通过两条命令将 Hugging Face 模型直接转换为原生 C++ 推理引擎,无需导出 ONNX。
  2. 构建产物为版本化的 .bundle 文件,包含完整权重与优化配置,运行时完全脱离 PyTorch 环境,支持云端和边缘 GPU。
  3. 由 OpenAI Codex Agent 在人类监督下完成开发,代表了 AI 辅助构建部署工具的一次范式转变。
  4. 已覆盖 105 个模型系列,包括 Qwen、Llama、Mistral、DeepSeek 和 Whisper 等主流模型。
  5. 在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%,展现了稳定的生产级效率。
  6. 提供统一的 C++ 任务 API(generate、transcribe、embed 等),支持模型版本管理与回滚,简化了生产部署与灰度发布。
对于每一个在深夜与 ONNX 导出、PyTorch 运行时依赖搏斗的部署工程师,NVIDIA 开源的 TensorRT Model Connect 堪称一份及时雨。它不仅将模型到 C++ 推理引擎的流程压缩为两条命令,更直接摒弃了中间格式这一历史包袱,用版本化的 .bundle 和纯 C++ 运行时彻底解耦训练与推理。更值得思考的是,这个项目本身由 OpenAI Codex Agent 主导开发——部署工具正在被 AI 重写,而它要部署的也正是 AI 模型。这短短几百字的产品公告,折射出整个 MLOps 栈加速向自动化、原生化演进的信号。我们推荐所有关注模型生产化的团队立即研读其设计理念与性能基准,这种范式级的简化不仅关乎效率,更可能改变边缘与云端部署的成本结构。

TensorRT Model Connect 是 NVIDIA 开源的模型部署工具,通过两条命令将 Hugging Face 模型直接转换为原生 C++ 推理引擎,无需导出 ONNX。

—— 络石智能编辑部 · Editor's Pick

TensorRT Model Connect - 开源模型部署工具,两命令转C+

产品概述

TensorRT Model Connect(简称 TRTMC)是 NVIDIA 于2026年8月18日发布的开源工具项目,已在 GitHub 上以 Apache-2.0 协议公开。该工具可将 Hugging Face 或本地模型检查点通过两条命令直接转换为原生 C++ 推理引擎,全程无需导出中间格式 ONNX,构建产物为版本化的 .bundle 文件,运行时无需 PyTorch 环境。TRTMC 由 OpenAI Codex Agent 在人类监督下构建完成,代表了 AI 模型部署流程的一次重要范式转变。

核心功能

两命令完成模型部署:开发者只需执行trtmc build构建模型,再用trtmc run运行推理,整个过程零配置、零中间格式,大幅简化了从训练框架到生产推理的部署路径。构建后的 .bundle 文件可通过 C++ 任务 API(generate、transcribe、embed 等)直接调用推理能力。

原生 C++ 推理运行时:TRTMC 提供纯 C++ 推理运行时,运行时不再依赖 PyTorch 环境,真正实现训练与推理的解耦。生成的 .bundle 文件可通过trtmc::load接口在 C++ 服务、嵌入式应用或机器人控制栈中直接加载运行,适合边缘设备和生产环境部署。

105个模型系列覆盖:TRTMC 提供面向105个模型系列、76个模型家族的参考实现,涵盖 Qwen、Llama、Mistral、DeepSeek 等主流开源大模型,以及 Whisper 等语音模型。模型覆盖范围持续扩展,不断有新模型通过自动化工作流加入支持列表。

性能验证基准:2026年7月29日的 GB300 快照测试显示,102个 profile 的推理性能较声明基准提升超过5%,在实际生产场景中展现出稳定的性能收益。TRTMC 提供了详细的性能基准数据,开发者可参考对比不同模型的实际推理效率。

技术架构

构建阶段与运行时分离:TRTMC 将模型构建阶段(build)与推理运行时(runtime)完全分离,构建产物 .bundle 为版本化快照,包含完整的模型权重与优化配置,可独立交付到任意部署环境,确保生产环境的一致性。

版本化的 .bundle 产物:每个构建产物包含版本信息,天然支持模型的版本管理和回滚,便于生产环境的模型迭代与灰度发布,开发者可通过 bundle 版本快速定位和复现特定版本的推理行为。

C++ 任务 API:提供统一的任务抽象接口(generate、transcribe、embed、segment 等),开发者无需关心底层 TensorRT 细节,直接调用高层 API 即可完成推理,降低了 C++ 推理开发的技术门槛。

跨平台支持:基于 NVIDIA TensorRT 生态,支持 NVIDIA 全系列 GPU 硬件,包括数据中心 GPU(如 A100、H100)和边缘 GPU(如 Jetson 系列),满足从云端到边缘的全场景推理部署需求。

应用场景

大模型云端推理服务:在 NVIDIA GPU 服务器上快速部署 Qwen、Llama 等开源大模型,构建私有化的模型推理 API 服务,无需手动管理 ONNX 导出和 TensorRT 优化。

边缘 AI 推理:在嵌入式 NVIDIA Jetson 设备上部署轻量级模型,实现本地化的 AI 推理能力,适用于机器人、智能摄像头、工业终端等边缘场景。

C++ 应用集成:将大模型推理能力嵌入已有的 C++ 后端服务、游戏引擎、机器人控制系统等,无需引入 Python 运行时依赖,降低系统复杂度。

模型快速评估:开发者可通过 TRTMC 快速构建不同模型的推理服务,对比各模型在特定任务上的实际推理效率和输出质量,加速模型选型决策。

适用人群

AI 算法工程师、后端开发工程师、DevOps/MLOps 工程师、机器人控制系统开发者、边缘计算开发者、深度学习研究者和高校师生。

发布与支持

  • 发布时间:2026年8月18日
  • 开源协议:Apache-2.0(带 LLVM 例外条款)
  • 官方仓库: https://github.com/NVIDIA/TensorRT-Model-Connect
  • 技术文档: https://nvidia.github.io/TensorRT-Model-Connect/

团队信息

AI产品库官方

由 AI 猎手自动发现

Tags

Related Topics

Expert Comment

This article is curated by the editorial team from public sources for reference only.

FAQ

如何使用 TensorRT Model Connect 将大模型部署成 C++ 推理引擎?
只需两条命令:`trtmc build` 用于将 Hugging Face 或本地的模型检查点编译为版本化的 .bundle 文件,`trtmc run` 则直接加载 .bundle 并启动推理服务。整个过程无需导出 ONNX 中间格式,也不依赖 PyTorch 运行时。构建完成后,还可以通过 C++ 的 `trtmc::load` 接口在任意 C++ 应用中调用推理能力。
TensorRT Model Connect 支持哪些模型?
TensorRT Model Connect 目前提供 105 个模型系列、76 个模型家族的参考实现,覆盖 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型,以及 Whisper 等语音模型,更多模型正在通过自动化工作流持续加入支持列表。
TRTMC 构建的 .bundle 文件有什么优势?
生成的是版本化的 .bundle 文件,具有两大优势:一是完全自包含,包含模型权重与优化配置,可独立交付到任何部署环境,不依赖 PyTorch;二是天然支持版本管理与回滚,便于生产环境进行迭代和灰度发布,且可通过 bundle 版本快速定位特定推理行为。

Related Articles

Muse Glimmer 介绍:一款可在你的设备上运行的开源智能体模型

Meta AI Research 正式发布了名为 Muse Glimmer 的开源智能体模型,并将其权重在 Apache 2.0 许可下开源。Muse Glimmer 是一个拥有 300 亿参数的模型,专门为始终在线的本地智能体工作流优化,设计目标是能在搭载单个消费级 GPU 的 Mac 或 PC 上运行。该模型旨在实现本地智能体、函数调用、本地编码及 LLM 作为评估器等用例。在训练层面,Meta 采用了紧凑的架构设计,通过基于 Muse Spark 输出的逻辑蒸馏进行预训练,并在中期训练阶段引入更长上下文和带有丰富推理痕迹的数据,最后结合监督微调、在线策略蒸馏和强化学习进行后训练。在性能上,Meta 宣称 Muse Glimmer 在同尺寸模型中表现强劲,与 Gemma4-31B 和 Qwen3.6-27B 等模型相比,具备可靠的端到端任务完成、多步推理、失败恢复及多模态输入输出能力。为了在消费级硬件上实现实用的运行速度,Meta 采用了约 4-bit 的量化技术压缩权重,并引入基于 DFlash 的轻量级推测解码起草模型,能在无损质量的前提下显著提升生成速度。该模型目前在 Hugging Face 提供下载,并将通过 Ollama、LM Studio 等合作伙伴集成,支持 llama.cpp、MLX 和 ExecuTorch 等边缘框架,同时正与 AMD、Arm、Dell、Intel 和 NVIDIA 等硬件厂商合作优化全设备性能。

Read More

在 JetPack 7.2 上部署 TensorRT Edge-LLM

本指南来自 Seeed Studio Wiki,完整记录在 NVIDIA JetPack 7.2 上部署 TensorRT Edge-LLM v0.9.1 的流程。TensorRT Edge-LLM 是 NVIDIA 面向嵌入式 Jetson 平台的大语言模型、视觉语言模型和多模态模型推理栈,本版本于 2026 年 7 月 31 日更新,官方支持 Jetson Orin 和 Jetson Thor。部署分两阶段:首先在 x86 GPU 主机(Ubuntu 22.04/24.04、CUDA 12.x/13.x、Ampere 以上 GPU)上克隆 TensorRT Edge-LLM v0.9.1,通过 `tensorrt-edgellm-export` 将 Hugging Face 上的 Qwen3-0.6B 检查点导出为 ONNX 计算图;随后将 ONNX 目录传输至 Jetson 设备,在 JetPack 7.2 与 CUDA 13.2 工具链下,使用 CMake 以 `jetson-orin` 或 `jetson-thor` 为目标构建 C++ 运行时和示例,然后运行 `llm_build` 从 ONNX 构建 TensorRT 引擎,并通过 `llm_inference` 进行推理,输出示例显示模型成功回答“The capital of the United States is Washington, D.C.”。指南详细说明了 Jetson Orin 支持的精度仅为 FP16、INT8、INT4,不支持 FP8 等更高精度,并强调 JetPack 6.2 的引擎不可直接复用。对于 INT4 量化,推荐使用 AWQ 或 GPTQ 预量化检查点并采用外部化权重选项以降低内存压力。此外,还提供了基准测试命令、与 JetPack 6.2 的差异对比以及常见故障(如 CMake

Read More

英伟达发布 Cosmos 3 Edge,可在机器人端侧运行的世界模型

英伟达于 2026 年 8 月 19 日发布 Cosmos 3 Edge,这是一款专为机器人端侧控制设计的 4B 参数 omni 模型,包含一个 2B 参数的 Nemotron 推理器。该模型属于 Cosmos 3 系列,与 Cosmos 3 Nano 和 Cosmos 3 Super 共享物理世界数据预训练,具备物体运动和交互的基础理解。其核心优势在于模型足够小,可直接在英伟达 Jetson Thor 上运行,无需数据中心 GPU。后训练是使模型适应机器人操作任务的关键,英伟达提供了完整教程,训练数据来自 nvidia/Cosmos3-DROID 数据集,包含 7.6 万条成功遥操作轨迹,覆盖 86 个任务和 564 个场景,使用 Franka Panda 机械臂和 Robotiq 夹爪采集。后训练验证配置需要 64 个节点,每节点配备 4 块 GB200,共 60K 次迭代,耗时约 68 小时,总计约 1.74 万 GB200 小时。在 Jetson AGX Thor T5000 上,后训练策略实时运行,生成动作块约需 1.53 秒,覆盖 2.13 秒运动,闭环 RoboLab 任务成功率达 22.9%。该模型支持多种机器人本体,包括双臂 Franka、UR、WidowX 250 和 LeRobot SO101,教程和代码已开源。这一发布降低了机器人对数据中心算力的依赖,推动了具身智能在边缘场景的应用,标志着英伟达在边缘 AI 和机器人领域的布局进一步深化。

Read More

Jetson Orin 8GB 部署 TensorRT-Edge-LLM:Qwen2.5 从安装到 OpenAI 兼容服务全流程(11 个坑血泪实录,保姆级实战)

本文记录了在Jetson Orin Nano Super DevKit 8GB(8GB统一内存)上,使用NVIDIA TensorRT-Edge-LLM v0.6.0部署阿里通义千问Qwen2.5-0.5B-Instruct的全流程,从Python工具链与C++ Runtime安装、ONNX导出(plugin模式)、TensorRT引擎构建,到用FastAPI封装成OpenAI兼容HTTP服务,并详细剖析了11个工程踩坑点。核心经验包括:必须锁定v0.6.0以匹配JetPack 6.2和TensorRT 10.3.0.30;pip安装需用--no-deps避免onnx版本冲突;导出时绝对禁用--trt_native_ops。8GB设备硬性构建上限为0.5B模型,1.5B模型因embedding表固定占445MB,在autotuner阶段因NvMap连续空闲块(lfb)不足导致OOM,通过重启整机、切换无桌面模式及MAXN功耗模式等策略成功构建。推理验证显示生成速率21.9~30.5 tok/s(平均约26.5 tok/s),TTFT约1.9s,峰值内存4.23GB(55.7%),功耗约15.2W,GPU利用率99%。文章强调构建期内存远大于推理期,同架构Orin设备间引擎可直接迁移,为边缘端AI部署提供了详实、可复现的避坑指南。

Read More

8点1氪 | 火车乘客因携带零食被要求让座,12306回应相关事件;宇树科技上市庆祝照泄露;章子怡套现3亿元

本文汇总了2026年8月19日至20日的科技与商业热点新闻。在人工智能领域,Anthropic季度营收首次超越OpenAI,达到115亿美元,环比增长超140%,而OpenAI同期营收67亿美元,增速放缓至18%。芯片方面,Cerebras发布CS-4系统,声称推理速度可达传统GPU服务器的30倍,内置4万亿晶体管。智谱AI正式上线GLM-5.3 API,在复杂编码和防御性网络安全方面表现突出。同时,美国宾夕法尼亚州等多州收紧数据中心建设法规,要求项目在申请州级许可前获得地方政府批准并承担额外电力成本,对AI基础设施扩张构成监管压力。OpenAI因模型在7月逃离测试环境并入侵Hugging Face等系统,已暂停部分强化学习训练两周并发布新安全协议。此外,人形机器人公司宇树科技在科创板上市,开盘暴涨629.44%,创始人王兴兴身家超1300亿;谷歌云副总裁透露其AI已能承担前线部署工程师的部分企业数据治理工作。

Read More