行业实践

在 JetPack 7.2 上部署 TensorRT Edge-LLM

核心结论:本指南来自 Seeed Studio Wiki,完整记录在 NVIDIA JetPack 7.2 上部署 TensorRT Edge-LLM v0.9.1 的流程。TensorRT Edge-LLM 是 NVIDIA 面向嵌入式 Jetson 平台的大语言模型、视觉语言模型和多模态模型推理栈,本版本于 2026 年 7 月 31 日更新,官方支持 Jetson Orin 和 Jetson Thor。部署分两阶段:首先在 x86 GPU 主机(Ubuntu 22.04/24.04、CUDA 12.x/13.x、Ampere 以上 GPU)上克隆 TensorRT Edge-LLM v0.9.1,通过 `tensorrt-edgellm-export` 将 Hugging Face 上的 Qwen3-0.6B 检查点导出为 ONNX 计算图;随后将 ONNX 目录传输至 Jetson 设备,在 JetPack 7.2 与 CUDA 13.2 工具链下,使用 CMake 以 `jetson-orin` 或 `jetson-thor` 为目标构建 C++ 运行时和示例,然后运行 `llm_build` 从 ONNX 构建 TensorRT 引擎,并通过 `llm_inference` 进行推理,输出示例显示模型成功回答“The capital of the United States is Washington, D.C.”。指南详细说明了 Jetson Orin 支持的精度仅为 FP16、INT8、INT4,不支持 FP8 等更高精度,并强调 JetPack 6.2 的引擎不可直接复用。对于 INT4 量化,推荐使用 AWQ 或 GPTQ 预量化检查点并采用外部化权重选项以降低内存压力。此外,还提供了基准测试命令、与 JetPack 6.2 的差异对比以及常见故障(如 CMake

核心要点
  1. TensorRT Edge-LLM v0.9.1 是 NVIDIA 针对嵌入式 Jetson 平台的大模型推理栈,2026 年 7 月 31 日更新,JetPack 7.2 是其官方支持环境。
  2. 部署流程分为 x86 主机端导出 ONNX 和 Jetson 端构建引擎并运行推理,当前指南以 Qwen3-0.6B 为例演示 FP16 工作流。
  3. Jetson Orin 支持 FP16、INT8、INT4 运行时精度,不支持 FP8、MXFP8 等,JetPack 6.2 的引擎不能直接复制到 7.2 使用。
  4. 构建时需启用 CuTe DSL 以支持 Qwen3.5 等模型路径,CMake 配置中 CUDA 工具链版本固定为 13.2。
  5. 对于 INT4 模型,推荐使用外部化权重选项(如 `--externalize-weights int4_ffn`)以降低 Orin 设备的内存压力。
  6. 提供了引擎构建、基准测试和故障排查说明,包括内存不足、CUDA 版本不匹配等常见问题的解决方案。
NVIDIA 的 TensorRT Edge-LLM 是当前嵌入式平台部署大模型的关键工具,JetPack 7.2 的正式支持为 Jetson Orin 和 Thor 用户打通了官方路径。这篇来自 Seeed Studio Wiki 的指南以 Qwen3-0.6B 为例,完整演示了从 x86 导出 ONNX 到 Jetson 端构建引擎、运行推理的全流程,并给出了 INT4 量化、基准测试和故障排查的实用建议。对于正在将大模型能力推向边缘侧的前线部署工程师,这是一份难得的实操说明书,建议收藏并在实际项目中快速验证复现。

TensorRT Edge-LLM v0.9.1 是 NVIDIA 针对嵌入式 Jetson 平台的大模型推理栈,2026 年 7 月 31 日更新,JetPack 7.2 是其官方支持环境。

—— 络石智能编辑部 · 编辑推荐

在 JetPack 7.2 上部署 TensorRT Edge-LLM

概述​

TensorRT Edge-LLM 是 NVIDIA 面向嵌入式 NVIDIA 平台部署大语言模型、视觉语言模型、多模态模型以及部分视觉-语言-动作工作负载的高性能推理栈。它提供检查点导出流水线、TensorRT 引擎构建器、优化的 C++ 运行时、示例以及一个实验性的兼容 OpenAI 的服务器。

JetPack 7.2 是 Jetson Orin 官方支持的 TensorRT Edge-LLM 路径。Jetson Thor 在 JetPack 7.x 上也受支持。本指南固定使用 TensorRT Edge-LLM v0.9.1,这是在本页面于 2026 年 7 月 31 日 更新时最新发布的版本。

note

本指南中的截图复用了 JetPack 6.2 教程中现有的 TensorRT Edge-LLM 工作流图片。整体的主机导出与目标端引擎工作流是相同的,但在 v0.9.1 中,命令名称、构建标志、版本号和控制台输出可能有所不同。

平台矩阵​

| 目标平台 | 软件发行版 | CMake 目标 | CUDA toolkit 值 | 运行时精度 | | --- | --- | --- | --- | --- | | Jetson Orin | JetPack 7.2 | jetson-orin | 13.2 | FP16, INT8, INT4 | | Jetson Thor | JetPack 7.2 | jetson-thor | 13.2 | 请查看每个模型和精度对应的支持模型矩阵。 |

warning

TensorRT Edge-LLM v0.9.1 在 Jetson Orin 上不支持 FP8、MXFP8、FP4 或 NVFP4 运行时精度。请为 Orin 使用 FP16、INT8 或 INT4 检查点。不要将 JetPack 6.2 上构建的 TensorRT 引擎复制到 JetPack 7.2 中;应在目标 JetPack 7.2 系统上重新构建引擎。

部署分为两个阶段:

  1. 在 x86 GPU 主机上导出:安装 Python 工具并将 Hugging Face 检查点导出为 ONNX。
  2. 在 Jetson 上构建并运行:编译 C++ 运行时,从 ONNX 构建 TensorRT 引擎并运行推理。

第 1 部分:在 x86 GPU 主机上导出模型​

主机要求​

  • 运行 Ubuntu 22.04 或 24.04 的 x86-64 Linux
  • 计算能力 8.0+ 的 NVIDIA Ampere 或更新架构 GPU
  • CUDA 12.x 或 13.x
  • Python 3.10 及以上
  • 足够的 RAM、显存和磁盘空间以容纳所选检查点

模型导出可能需要数倍于检查点大小的主机 RAM 和显存。在迁移到更大或量化模型之前,请先从小型的 Qwen3-0.6B FP16 示例开始。

克隆并安装 v0.9.1​

git clone --branch v0.9.1 --depth 1 https://github.com/NVIDIA/TensorRT-Edge-LLM.gitcd TensorRT-Edge-LLMgit submodule update --init --recursivepython3 -m venv venvsource venv/bin/activatepython -m pip install --upgrade pippip install .

当你需要检查点量化、LoRA 合并、词表裁剪或分词器辅助工具时,再安装可选工具依赖:

pip install ".[tools]"

验证当前命令行接口:

tensorrt-edgellm-export --helptensorrt-edgellm-quantize --help

将 Qwen3-0.6B 导出为 ONNX​

下面的示例直接导出 FP16 检查点。FP16 在 Jetson Orin 上受支持,并且可以让首次验证工作流保持简单。

export EDGE_LLM_PATH=$HOME/TensorRT-Edge-LLMexport WORKSPACE_DIR=$HOME/tensorrt-edgellm-workspaceexport MODEL_NAME=Qwen3-0.6Bexport PYTHONPATH=$EDGE_LLM_PATH:$PYTHONPATHmkdir -p "$WORKSPACE_DIR"cd "$WORKSPACE_DIR"tensorrt-edgellm-export \  Qwen/Qwen3-0.6B \  "$WORKSPACE_DIR/$MODEL_NAME/onnx"

导出的 LLM 计算图应位于:

$WORKSPACE_DIR/Qwen3-0.6B/onnx/llm

可选:在 Jetson Orin 上使用 INT4 检查点​

对于 Orin 设备上的更大模型,请使用在官方支持模型矩阵中标记为 INT4 AWQ 或 INT4 GPTQ 的检查点。预量化检查点可以直接导出。外置 INT4 权重可以在内存受限的 Orin 设备上降低引擎构建时的内存压力。

tensorrt-edgellm-export \  /path/to/supported-int4-checkpoint \  "$WORKSPACE_DIR//onnx" \  --externalize-weights int4_ffn

对于 INT4 MoE 检查点,请添加 TensorRT Edge-LLM 文档中给出的、针对模型家族的外置权重选项。始终在支持模型矩阵中核对具体检查点和精度。

将 ONNX 目录传输到 Jetson​

创建目标目录并复制导出的模型:

ssh @ \  "mkdir -p ~/tensorrt-edgellm-workspace/$MODEL_NAME"scp -r \  "$WORKSPACE_DIR/$MODEL_NAME/onnx" \  @:~/tensorrt-edgellm-workspace/$MODEL_NAME/

第 2 部分:在 JetPack 7.2 上构建 TensorRT Edge-LLM​

下面的主要工作流以 Jetson Orin 为目标。后文将给出 Jetson Thor 的配置。

验证 JetPack 7.2​

在 Jetson 设备上,检查 Jetson Linux 发行版、CUDA 编译器和 TensorRT 软件包:

cat /etc/nv_tegra_releasenvcc --versiondpkg -l | grep -E 'tensorrt|libnvinfer'

对于 v0.9.1 的 JetPack 7.2 构建矩阵,nvcc --version 应与构建配置所需的 CUDA 13.2 工具链匹配。

安装构建依赖​

sudo apt updatesudo apt install -y cmake build-essential git

在 Jetson 上克隆匹配的发行版​

主机导出和目标运行时请使用相同的 TensorRT Edge-LLM 发行版:

cd ~git clone --branch v0.9.1 --depth 1 https://github.com/NVIDIA/TensorRT-Edge-LLM.gitcd TensorRT-Edge-LLMgit submodule update --init --recursive

为 Jetson Orin 配置并构建​

cd ~/TensorRT-Edge-LLMmkdir -p buildcd buildcmake .. \  -DCMAKE_BUILD_TYPE=Release \  -DTRT_PACKAGE_DIR=/usr \  -DCMAKE_TOOLCHAIN_FILE=cmake/aarch64_linux_toolchain.cmake \  -DEMBEDDED_TARGET=jetson-orin \  -DCUDA_CTK_VERSION=13.2 \  -DENABLE_CUTE_DSL=ALLcmake --build . -j"$(nproc)"

已启用 CuTe DSL 内核,因为当前 Qwen3.5 和其他受支持的模型路径需要它们。

验证示例是否已构建:

./examples/llm/llm_build --help./examples/llm/llm_inference --help

Jetson Thor 构建变体​

在搭载 JetPack 7.2 的 Jetson Thor 上,使用相同的构建步骤,但更改嵌入式目标:

cmake .. \  -DCMAKE_BUILD_TYPE=Release \  -DTRT_PACKAGE_DIR=/usr \  -DCMAKE_TOOLCHAIN_FILE=cmake/aarch64_linux_toolchain.cmake \  -DEMBEDDED_TARGET=jetson-thor \  -DCUDA_CTK_VERSION=13.2 \  -DENABLE_CUTE_DSL=ALL

构建 TensorRT 引擎​

在 Jetson 设备上,设置工作区并从导出的 ONNX 计算图构建引擎:

export WORKSPACE_DIR=$HOME/tensorrt-edgellm-workspaceexport MODEL_NAME=Qwen3-0.6Bcd ~/TensorRT-Edge-LLM./build/examples/llm/llm_build \  --onnxDir "$WORKSPACE_DIR/$MODEL_NAME/onnx/llm" \  --engineDir "$WORKSPACE_DIR/$MODEL_NAME/engines" \  --maxBatchSize 1 \  --maxInputLen 1024 \  --maxKVCacheCapacity 4096

引擎构建时间和峰值内存取决于模型、精度、最大输入长度、KV 缓存容量以及 Jetson 的内存配置。

运行 C++ 推理​

创建一个请求文件:

cat > "$WORKSPACE_DIR/input.json" <<'EOF'{  "batch_size": 1,  "temperature": 1.0,  "top_p": 1.0,  "top_k": 50,  "max_generate_length": 128,  "requests": [    {      "messages": [        {          "role": "user",          "content": "What is the capital of the United States?"        }      ]    }  ]}EOF

运行推理:

cd ~/TensorRT-Edge-LLM./build/examples/llm/llm_inference \  --engineDir "$WORKSPACE_DIR/$MODEL_NAME/engines" \  --inputFile "$WORKSPACE_DIR/input.json" \  --outputFile "$WORKSPACE_DIR/output.json"

查看结果:

cat "$WORKSPACE_DIR/output.json"

响应中应包含类似如下的生成文本:

{  "responses": [    {      "output_text": "The capital of the United States is Washington, D.C.",      "request_idx": 0,      "batch_idx": 0    }  ]}

对引擎进行基准测试​

使用 llm_bench 进行预填充和解码的合成测量:

./build/examples/llm/llm_bench \  --engineDir "$WORKSPACE_DIR/$MODEL_NAME/engines" \  --mode prefill

在比较 JetPack 6.2 和 JetPack 7.2 时记录以下数值:

  • 引擎构建期间的系统峰值内存
  • 引擎加载后的内存占用
  • 首个 token 的生成时间
  • 提示处理吞吐量
  • 解码吞吐量
  • GPU 频率、电源模式、温度和整板功耗

与 JetPack 6.2 工作流的差异​

| 项目 | JetPack 6.2 兼容路径 | JetPack 7.2 支持路径 | | --- | --- | --- | | Jetson Orin 状态 | 兼容 | 官方支持并经过测试 | | CUDA 构建值 | 12.6 | 13.2 | | CMake 目标 | jetson-orin | jetson-orin | | Orin 上的运行时精度 | FP16, INT8, INT4 | FP16, INT8, INT4 | | CuTe DSL | 依赖发行版 | 对当前模型路径使用 -DENABLE_CUTE_DSL=ALL 启用 | | 引擎复用 | 为 JetPack 6.2 重新构建 | 为 JetPack 7.2 重新构建 |

故障排查​

CMake 找不到 TensorRT​

确认 JetPack 已安装 TensorRT 开发软件包,并且库位于 /usr 下:

dpkg -l | grep -E 'tensorrt|libnvinfer'ls /usr/include/NvInfer.h

CUDA 版本不匹配​

不要仅为了绕过配置检查而更改 CUDA_CTK_VERSION。请确认设备正在运行预期的 JetPack 7.2 镜像,并且 nvcc 解析到的是该 JetPack 的 CUDA 工具包。

引擎构建被终止或内存不足​

  • 从 Qwen3-0.6B FP16 开始。
  • 在 Jetson Orin 上为更大的模型使用受支持的 INT4 检查点。
  • 在支持的情况下使用外部化的 INT4 权重。
  • 在第一次验证运行时减小 maxInputLenmaxKVCacheCapacity
  • 在构建引擎之前停止无关的容器和占用内存较多的服务。

模型或精度被拒绝​

查看 TensorRT Edge-LLM 支持模型矩阵。模型系列受支持并不意味着每个检查点、精度、视觉编码器或推测解码器组合都在每个平台的 Jetson 上受支持。

后续步骤​

  • 为更大的 Jetson Orin 模型添加 INT4 LLM 工作流。
  • 使用受支持的 Qwen-VL、InternVL、Phi 多模态或 Gemma 检查点添加 VLM 推理。
  • 评估实验性的高级 Python API 和兼容 OpenAI 的服务器。
  • 使用 Rapid Prototyping on Jetson with NVIDIA Skills 来自动化设备检查、内存审计和基准测试收集。

Last updated on Jul 31, 2026 by Dongxu Jin

标签

相关主题

专家点评

本文由编辑团队收录整理,内容来源于公开信息,仅供参考。

常见问题

如何在 JetPack 7.2 上部署 TensorRT Edge-LLM?
部署分为两个阶段。首先在一台装有 Ubuntu 22.04/24.04、NVIDIA Ampere 或更新架构 GPU、CUDA 12.x/13.x 的 x86 主机上,拉取 TensorRT Edge-LLM v0.9.1 并安装 Python 工具,执行 `tensorrt-edgellm-export` 命令将 Hugging Face 检查点(如 Qwen3-0.6B)导出为 ONNX 计算图,然后通过 SCP 将 ONNX 目录传输到 Jetson。接着在 Jetson Orin 上,先确认系统的 JetPack 7.2 和 CUDA 13.2 工具链,再克隆匹配的 v0.9.1 源码,使用 CMake 以 `jetson-orin` 目标构建 C++ 运行时和示例,最后运行 `llm_build` 从 ONNX 构建 TensorRT 引擎,并通过 `llm_inference` 执行推理。
JetPack 7.2 上的 TensorRT Edge-LLM 支持哪些 Jetson 平台和精度?
JetPack 7.2 下的 TensorRT Edge-LLM v0.9.1 官方支持 Jetson Orin 和 Jetson Thor。Jetson Orin 上可用的运行时精度为 FP16、INT8、INT4,不支持 FP8、MXFP8 等更高精度。Jetson Thor 的详细精度支持需查看每个模型的支持矩阵,但其构建配置与 Orin 类似,只需将 CMake 目标改为 `jetson-thor`。
如何在 Jetson Orin 上构建 INT4 量化的 TensorRT 引擎?
以 Qwen3-0.6B 为例,在主机上执行 `tensorrt-edgellm-export Qwen/Qwen3-0.6B /path/to/onnx` 即可导出 FP16 的 ONNX 模型。如需在内存受限的 Orin 上运行更大模型,建议使用已在支持矩阵中标记为 INT4 AWQ 或 INT4 GPTQ 的预量化检查点,并添加 `--externalize-weights int4_ffn` 选项以降低引擎构建时的内存压力。

相关文章

在 JetPack 7.2 和 Jetson AGX Orin 上使用 TensorRT 部署全权重 GR00T N1.7

本文来自 Seeed Studio Wiki,是一篇详细的技术教程,指导如何在 JetPack 7.2 和 Jetson AGX Orin 边缘计算设备上,使用 TensorRT 部署全权重的 NVIDIA Isaac GR00T N1.7 机器人策略模型。与以往仅加速 DiT 组件的工作流不同,本教程实现了对 Vision Transformer (ViT)、Large Language Model (LLM)、视觉-语言自注意力、状态编码器、动作编码器、DiT 动作专家和动作解码器全部七个组件的 TensorRT 引擎构建。教程采用本地 LeRobot 数据集和本地 Qwen3-VL-2B-Instruct 主干模型,实现了完全离线的推理流水线,避免了 Hugging Face Hub 的网络依赖。经过验证,整个 TensorRT 构建过程耗时约 3 分 37 秒,最终生成七个 .engine 文件。在推理性能方面,全 TensorRT 流水线处理每个 16 步动作预测块耗时约 0.2755 秒,相当于每秒 3.63 个块。文章还提供了 PyTorch 与 TensorRT 输出的数值对比,结果显示最终动作的余弦相似度高达 0.997426,验证了模型转换的精度。此外,文章详细列出了存储与内存规划(至少需要 45-50 GB 空间)、环境配置、故障排查以及连接实体机器人前的安全警告和检查清单,是一份从模型导出到边缘推理的完整工程实践指南。

阅读全文

TensorRT Model Connect - 开源模型部署工具,两命令转C+

TensorRT Model Connect(TRTMC)是 NVIDIA 于 2026 年 8 月 18 日以 Apache-2.0 协议在 GitHub 开源的一款模型部署工具,旨在将 Hugging Face 或本地模型检查点直接转换为原生 C++ 推理引擎。开发者仅需 `trtmc build` 和 `trtmc run` 两条命令即可完成部署,全程无需导出 ONNX 中间格式,构建产物为版本化的 .bundle 文件,运行时完全脱离 PyTorch 环境。该项目由 OpenAI Codex Agent 在人类监督下构建,代表了 AI 辅助开发部署工具的范式转变。TRTMC 提供覆盖 105 个模型系列、76 个模型家族的参考实现,包括 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型以及 Whisper 语音模型。性能验证方面,在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%。其技术架构将构建阶段与运行时解耦,提供统一的 C++ 任务 API(generate、transcribe、embed 等),并支持 NVIDIA 全系列 GPU(如 A100、H100、Jetson),可实现云端到边缘的全场景部署,适用于大模型推理服务、边缘 AI 推理、C++ 应用集成与模型快速评估。该工具通过版本化 .bundle 天然支持模型回滚与灰度发布,为生产环境提供了高一致性的交付单元。

阅读全文

Jetson Orin 8GB 部署 TensorRT-Edge-LLM:Qwen2.5 从安装到 OpenAI 兼容服务全流程(11 个坑血泪实录,保姆级实战)

本文记录了在Jetson Orin Nano Super DevKit 8GB(8GB统一内存)上,使用NVIDIA TensorRT-Edge-LLM v0.6.0部署阿里通义千问Qwen2.5-0.5B-Instruct的全流程,从Python工具链与C++ Runtime安装、ONNX导出(plugin模式)、TensorRT引擎构建,到用FastAPI封装成OpenAI兼容HTTP服务,并详细剖析了11个工程踩坑点。核心经验包括:必须锁定v0.6.0以匹配JetPack 6.2和TensorRT 10.3.0.30;pip安装需用--no-deps避免onnx版本冲突;导出时绝对禁用--trt_native_ops。8GB设备硬性构建上限为0.5B模型,1.5B模型因embedding表固定占445MB,在autotuner阶段因NvMap连续空闲块(lfb)不足导致OOM,通过重启整机、切换无桌面模式及MAXN功耗模式等策略成功构建。推理验证显示生成速率21.9~30.5 tok/s(平均约26.5 tok/s),TTFT约1.9s,峰值内存4.23GB(55.7%),功耗约15.2W,GPU利用率99%。文章强调构建期内存远大于推理期,同架构Orin设备间引擎可直接迁移,为边缘端AI部署提供了详实、可复现的避坑指南。

阅读全文

腾讯混元AI Infra如何优化Hy3 Preview:一次大模型推理性能提升的技术拆解

本文详细介绍了腾讯混元AI Infra推理团队针对旗舰大模型Hy3 Preview(采用GQA+MoE混合架构,原生支持256K超长上下文)在NVIDIA Hopper卡上的推理性能优化实践。面对Hopper卡算力较低、显存紧凑等限制,团队从算子优化与融合、并行策略、多级缓存、MTP异步调度、量化与稀疏五大维度进行全栈优化。在算子优化上,提出动态调度负载均衡的Attention算子(混合长度batch加速1.59x-1.76x),双BF16重构FP32 Router GEMM(加速2.86x-3.22x),FusedMoE流水线重构(相比vLLM等加速1.2x-1.6x)。算子融合方面,实现Fused Rope+Norm+Quant+Store KV(加速约5x),Fused AllReduce+Norm+Add(加速1.68x),采样融合算子(加速2.5x-5.5x),以及Gemm+Comm通算融合(加速1.68x-1.81x)。并行策略上,采用TPSP Prefill优化(TTFT降低24.5%-29.9%)和DP+EP Decode架构(吞吐提升15.7%-44.7%)。多级缓存构建GPU-CPU-KVStore三级体系以降低重复Prefill。MTP异步调度优化消除CPU气泡,端到端提升10%-20%。量化方面,在AngelSlim框架中通过GPTQ权重重建、激活平滑、Hadamard旋转和QAT微调实现W8A8C8无损量化,吞吐提升28%+;并应用Stem稀疏注意力算法及HPC-BSA算子,在128K上下文下Prefill延迟降低3.6倍,精度持平。文章为Hopper架构下大模型推理部署提供了系统级优化范本。

阅读全文

英伟达发布 Cosmos 3 Edge,可在机器人端侧运行的世界模型

英伟达于 2026 年 8 月 19 日发布 Cosmos 3 Edge,这是一款专为机器人端侧控制设计的 4B 参数 omni 模型,包含一个 2B 参数的 Nemotron 推理器。该模型属于 Cosmos 3 系列,与 Cosmos 3 Nano 和 Cosmos 3 Super 共享物理世界数据预训练,具备物体运动和交互的基础理解。其核心优势在于模型足够小,可直接在英伟达 Jetson Thor 上运行,无需数据中心 GPU。后训练是使模型适应机器人操作任务的关键,英伟达提供了完整教程,训练数据来自 nvidia/Cosmos3-DROID 数据集,包含 7.6 万条成功遥操作轨迹,覆盖 86 个任务和 564 个场景,使用 Franka Panda 机械臂和 Robotiq 夹爪采集。后训练验证配置需要 64 个节点,每节点配备 4 块 GB200,共 60K 次迭代,耗时约 68 小时,总计约 1.74 万 GB200 小时。在 Jetson AGX Thor T5000 上,后训练策略实时运行,生成动作块约需 1.53 秒,覆盖 2.13 秒运动,闭环 RoboLab 任务成功率达 22.9%。该模型支持多种机器人本体,包括双臂 Franka、UR、WidowX 250 和 LeRobot SO101,教程和代码已开源。这一发布降低了机器人对数据中心算力的依赖,推动了具身智能在边缘场景的应用,标志着英伟达在边缘 AI 和机器人领域的布局进一步深化。

阅读全文