行业实践

在 JetPack 7.2 上部署 TensorRT Edge-LLM

Key takeaway: 本指南来自 Seeed Studio Wiki,完整记录在 NVIDIA JetPack 7.2 上部署 TensorRT Edge-LLM v0.9.1 的流程。TensorRT Edge-LLM 是 NVIDIA 面向嵌入式 Jetson 平台的大语言模型、视觉语言模型和多模态模型推理栈,本版本于 2026 年 7 月 31 日更新,官方支持 Jetson Orin 和 Jetson Thor。部署分两阶段:首先在 x86 GPU 主机(Ubuntu 22.04/24.04、CUDA 12.x/13.x、Ampere 以上 GPU)上克隆 TensorRT Edge-LLM v0.9.1,通过 `tensorrt-edgellm-export` 将 Hugging Face 上的 Qwen3-0.6B 检查点导出为 ONNX 计算图;随后将 ONNX 目录传输至 Jetson 设备,在 JetPack 7.2 与 CUDA 13.2 工具链下,使用 CMake 以 `jetson-orin` 或 `jetson-thor` 为目标构建 C++ 运行时和示例,然后运行 `llm_build` 从 ONNX 构建 TensorRT 引擎,并通过 `llm_inference` 进行推理,输出示例显示模型成功回答“The capital of the United States is Washington, D.C.”。指南详细说明了 Jetson Orin 支持的精度仅为 FP16、INT8、INT4,不支持 FP8 等更高精度,并强调 JetPack 6.2 的引擎不可直接复用。对于 INT4 量化,推荐使用 AWQ 或 GPTQ 预量化检查点并采用外部化权重选项以降低内存压力。此外,还提供了基准测试命令、与 JetPack 6.2 的差异对比以及常见故障(如 CMake

Key Takeaways
  1. TensorRT Edge-LLM v0.9.1 是 NVIDIA 针对嵌入式 Jetson 平台的大模型推理栈,2026 年 7 月 31 日更新,JetPack 7.2 是其官方支持环境。
  2. 部署流程分为 x86 主机端导出 ONNX 和 Jetson 端构建引擎并运行推理,当前指南以 Qwen3-0.6B 为例演示 FP16 工作流。
  3. Jetson Orin 支持 FP16、INT8、INT4 运行时精度,不支持 FP8、MXFP8 等,JetPack 6.2 的引擎不能直接复制到 7.2 使用。
  4. 构建时需启用 CuTe DSL 以支持 Qwen3.5 等模型路径,CMake 配置中 CUDA 工具链版本固定为 13.2。
  5. 对于 INT4 模型,推荐使用外部化权重选项(如 `--externalize-weights int4_ffn`)以降低 Orin 设备的内存压力。
  6. 提供了引擎构建、基准测试和故障排查说明,包括内存不足、CUDA 版本不匹配等常见问题的解决方案。
NVIDIA 的 TensorRT Edge-LLM 是当前嵌入式平台部署大模型的关键工具,JetPack 7.2 的正式支持为 Jetson Orin 和 Thor 用户打通了官方路径。这篇来自 Seeed Studio Wiki 的指南以 Qwen3-0.6B 为例,完整演示了从 x86 导出 ONNX 到 Jetson 端构建引擎、运行推理的全流程,并给出了 INT4 量化、基准测试和故障排查的实用建议。对于正在将大模型能力推向边缘侧的前线部署工程师,这是一份难得的实操说明书,建议收藏并在实际项目中快速验证复现。

TensorRT Edge-LLM v0.9.1 是 NVIDIA 针对嵌入式 Jetson 平台的大模型推理栈,2026 年 7 月 31 日更新,JetPack 7.2 是其官方支持环境。

—— 络石智能编辑部 · Editor's Pick

在 JetPack 7.2 上部署 TensorRT Edge-LLM

概述​

TensorRT Edge-LLM 是 NVIDIA 面向嵌入式 NVIDIA 平台部署大语言模型、视觉语言模型、多模态模型以及部分视觉-语言-动作工作负载的高性能推理栈。它提供检查点导出流水线、TensorRT 引擎构建器、优化的 C++ 运行时、示例以及一个实验性的兼容 OpenAI 的服务器。

JetPack 7.2 是 Jetson Orin 官方支持的 TensorRT Edge-LLM 路径。Jetson Thor 在 JetPack 7.x 上也受支持。本指南固定使用 TensorRT Edge-LLM v0.9.1,这是在本页面于 2026 年 7 月 31 日 更新时最新发布的版本。

note

本指南中的截图复用了 JetPack 6.2 教程中现有的 TensorRT Edge-LLM 工作流图片。整体的主机导出与目标端引擎工作流是相同的,但在 v0.9.1 中,命令名称、构建标志、版本号和控制台输出可能有所不同。

平台矩阵​

| 目标平台 | 软件发行版 | CMake 目标 | CUDA toolkit 值 | 运行时精度 | | --- | --- | --- | --- | --- | | Jetson Orin | JetPack 7.2 | jetson-orin | 13.2 | FP16, INT8, INT4 | | Jetson Thor | JetPack 7.2 | jetson-thor | 13.2 | 请查看每个模型和精度对应的支持模型矩阵。 |

warning

TensorRT Edge-LLM v0.9.1 在 Jetson Orin 上不支持 FP8、MXFP8、FP4 或 NVFP4 运行时精度。请为 Orin 使用 FP16、INT8 或 INT4 检查点。不要将 JetPack 6.2 上构建的 TensorRT 引擎复制到 JetPack 7.2 中;应在目标 JetPack 7.2 系统上重新构建引擎。

部署分为两个阶段:

  1. 在 x86 GPU 主机上导出:安装 Python 工具并将 Hugging Face 检查点导出为 ONNX。
  2. 在 Jetson 上构建并运行:编译 C++ 运行时,从 ONNX 构建 TensorRT 引擎并运行推理。

第 1 部分:在 x86 GPU 主机上导出模型​

主机要求​

  • 运行 Ubuntu 22.04 或 24.04 的 x86-64 Linux
  • 计算能力 8.0+ 的 NVIDIA Ampere 或更新架构 GPU
  • CUDA 12.x 或 13.x
  • Python 3.10 及以上
  • 足够的 RAM、显存和磁盘空间以容纳所选检查点

模型导出可能需要数倍于检查点大小的主机 RAM 和显存。在迁移到更大或量化模型之前,请先从小型的 Qwen3-0.6B FP16 示例开始。

克隆并安装 v0.9.1​

git clone --branch v0.9.1 --depth 1 https://github.com/NVIDIA/TensorRT-Edge-LLM.gitcd TensorRT-Edge-LLMgit submodule update --init --recursivepython3 -m venv venvsource venv/bin/activatepython -m pip install --upgrade pippip install .

当你需要检查点量化、LoRA 合并、词表裁剪或分词器辅助工具时,再安装可选工具依赖:

pip install ".[tools]"

验证当前命令行接口:

tensorrt-edgellm-export --helptensorrt-edgellm-quantize --help

将 Qwen3-0.6B 导出为 ONNX​

下面的示例直接导出 FP16 检查点。FP16 在 Jetson Orin 上受支持,并且可以让首次验证工作流保持简单。

export EDGE_LLM_PATH=$HOME/TensorRT-Edge-LLMexport WORKSPACE_DIR=$HOME/tensorrt-edgellm-workspaceexport MODEL_NAME=Qwen3-0.6Bexport PYTHONPATH=$EDGE_LLM_PATH:$PYTHONPATHmkdir -p "$WORKSPACE_DIR"cd "$WORKSPACE_DIR"tensorrt-edgellm-export \  Qwen/Qwen3-0.6B \  "$WORKSPACE_DIR/$MODEL_NAME/onnx"

导出的 LLM 计算图应位于:

$WORKSPACE_DIR/Qwen3-0.6B/onnx/llm

可选:在 Jetson Orin 上使用 INT4 检查点​

对于 Orin 设备上的更大模型,请使用在官方支持模型矩阵中标记为 INT4 AWQ 或 INT4 GPTQ 的检查点。预量化检查点可以直接导出。外置 INT4 权重可以在内存受限的 Orin 设备上降低引擎构建时的内存压力。

tensorrt-edgellm-export \  /path/to/supported-int4-checkpoint \  "$WORKSPACE_DIR//onnx" \  --externalize-weights int4_ffn

对于 INT4 MoE 检查点,请添加 TensorRT Edge-LLM 文档中给出的、针对模型家族的外置权重选项。始终在支持模型矩阵中核对具体检查点和精度。

将 ONNX 目录传输到 Jetson​

创建目标目录并复制导出的模型:

ssh @ \  "mkdir -p ~/tensorrt-edgellm-workspace/$MODEL_NAME"scp -r \  "$WORKSPACE_DIR/$MODEL_NAME/onnx" \  @:~/tensorrt-edgellm-workspace/$MODEL_NAME/

第 2 部分:在 JetPack 7.2 上构建 TensorRT Edge-LLM​

下面的主要工作流以 Jetson Orin 为目标。后文将给出 Jetson Thor 的配置。

验证 JetPack 7.2​

在 Jetson 设备上,检查 Jetson Linux 发行版、CUDA 编译器和 TensorRT 软件包:

cat /etc/nv_tegra_releasenvcc --versiondpkg -l | grep -E 'tensorrt|libnvinfer'

对于 v0.9.1 的 JetPack 7.2 构建矩阵,nvcc --version 应与构建配置所需的 CUDA 13.2 工具链匹配。

安装构建依赖​

sudo apt updatesudo apt install -y cmake build-essential git

在 Jetson 上克隆匹配的发行版​

主机导出和目标运行时请使用相同的 TensorRT Edge-LLM 发行版:

cd ~git clone --branch v0.9.1 --depth 1 https://github.com/NVIDIA/TensorRT-Edge-LLM.gitcd TensorRT-Edge-LLMgit submodule update --init --recursive

为 Jetson Orin 配置并构建​

cd ~/TensorRT-Edge-LLMmkdir -p buildcd buildcmake .. \  -DCMAKE_BUILD_TYPE=Release \  -DTRT_PACKAGE_DIR=/usr \  -DCMAKE_TOOLCHAIN_FILE=cmake/aarch64_linux_toolchain.cmake \  -DEMBEDDED_TARGET=jetson-orin \  -DCUDA_CTK_VERSION=13.2 \  -DENABLE_CUTE_DSL=ALLcmake --build . -j"$(nproc)"

已启用 CuTe DSL 内核,因为当前 Qwen3.5 和其他受支持的模型路径需要它们。

验证示例是否已构建:

./examples/llm/llm_build --help./examples/llm/llm_inference --help

Jetson Thor 构建变体​

在搭载 JetPack 7.2 的 Jetson Thor 上,使用相同的构建步骤,但更改嵌入式目标:

cmake .. \  -DCMAKE_BUILD_TYPE=Release \  -DTRT_PACKAGE_DIR=/usr \  -DCMAKE_TOOLCHAIN_FILE=cmake/aarch64_linux_toolchain.cmake \  -DEMBEDDED_TARGET=jetson-thor \  -DCUDA_CTK_VERSION=13.2 \  -DENABLE_CUTE_DSL=ALL

构建 TensorRT 引擎​

在 Jetson 设备上,设置工作区并从导出的 ONNX 计算图构建引擎:

export WORKSPACE_DIR=$HOME/tensorrt-edgellm-workspaceexport MODEL_NAME=Qwen3-0.6Bcd ~/TensorRT-Edge-LLM./build/examples/llm/llm_build \  --onnxDir "$WORKSPACE_DIR/$MODEL_NAME/onnx/llm" \  --engineDir "$WORKSPACE_DIR/$MODEL_NAME/engines" \  --maxBatchSize 1 \  --maxInputLen 1024 \  --maxKVCacheCapacity 4096

引擎构建时间和峰值内存取决于模型、精度、最大输入长度、KV 缓存容量以及 Jetson 的内存配置。

运行 C++ 推理​

创建一个请求文件:

cat > "$WORKSPACE_DIR/input.json" <<'EOF'{  "batch_size": 1,  "temperature": 1.0,  "top_p": 1.0,  "top_k": 50,  "max_generate_length": 128,  "requests": [    {      "messages": [        {          "role": "user",          "content": "What is the capital of the United States?"        }      ]    }  ]}EOF

运行推理:

cd ~/TensorRT-Edge-LLM./build/examples/llm/llm_inference \  --engineDir "$WORKSPACE_DIR/$MODEL_NAME/engines" \  --inputFile "$WORKSPACE_DIR/input.json" \  --outputFile "$WORKSPACE_DIR/output.json"

查看结果:

cat "$WORKSPACE_DIR/output.json"

响应中应包含类似如下的生成文本:

{  "responses": [    {      "output_text": "The capital of the United States is Washington, D.C.",      "request_idx": 0,      "batch_idx": 0    }  ]}

对引擎进行基准测试​

使用 llm_bench 进行预填充和解码的合成测量:

./build/examples/llm/llm_bench \  --engineDir "$WORKSPACE_DIR/$MODEL_NAME/engines" \  --mode prefill

在比较 JetPack 6.2 和 JetPack 7.2 时记录以下数值:

  • 引擎构建期间的系统峰值内存
  • 引擎加载后的内存占用
  • 首个 token 的生成时间
  • 提示处理吞吐量
  • 解码吞吐量
  • GPU 频率、电源模式、温度和整板功耗

与 JetPack 6.2 工作流的差异​

| 项目 | JetPack 6.2 兼容路径 | JetPack 7.2 支持路径 | | --- | --- | --- | | Jetson Orin 状态 | 兼容 | 官方支持并经过测试 | | CUDA 构建值 | 12.6 | 13.2 | | CMake 目标 | jetson-orin | jetson-orin | | Orin 上的运行时精度 | FP16, INT8, INT4 | FP16, INT8, INT4 | | CuTe DSL | 依赖发行版 | 对当前模型路径使用 -DENABLE_CUTE_DSL=ALL 启用 | | 引擎复用 | 为 JetPack 6.2 重新构建 | 为 JetPack 7.2 重新构建 |

故障排查​

CMake 找不到 TensorRT​

确认 JetPack 已安装 TensorRT 开发软件包,并且库位于 /usr 下:

dpkg -l | grep -E 'tensorrt|libnvinfer'ls /usr/include/NvInfer.h

CUDA 版本不匹配​

不要仅为了绕过配置检查而更改 CUDA_CTK_VERSION。请确认设备正在运行预期的 JetPack 7.2 镜像,并且 nvcc 解析到的是该 JetPack 的 CUDA 工具包。

引擎构建被终止或内存不足​

  • 从 Qwen3-0.6B FP16 开始。
  • 在 Jetson Orin 上为更大的模型使用受支持的 INT4 检查点。
  • 在支持的情况下使用外部化的 INT4 权重。
  • 在第一次验证运行时减小 maxInputLenmaxKVCacheCapacity
  • 在构建引擎之前停止无关的容器和占用内存较多的服务。

模型或精度被拒绝​

查看 TensorRT Edge-LLM 支持模型矩阵。模型系列受支持并不意味着每个检查点、精度、视觉编码器或推测解码器组合都在每个平台的 Jetson 上受支持。

后续步骤​

  • 为更大的 Jetson Orin 模型添加 INT4 LLM 工作流。
  • 使用受支持的 Qwen-VL、InternVL、Phi 多模态或 Gemma 检查点添加 VLM 推理。
  • 评估实验性的高级 Python API 和兼容 OpenAI 的服务器。
  • 使用 Rapid Prototyping on Jetson with NVIDIA Skills 来自动化设备检查、内存审计和基准测试收集。

Last updated on Jul 31, 2026 by Dongxu Jin

Tags

Related Topics

Expert Comment

This article is curated by the editorial team from public sources for reference only.

FAQ

如何在 JetPack 7.2 上部署 TensorRT Edge-LLM?
部署分为两个阶段。首先在一台装有 Ubuntu 22.04/24.04、NVIDIA Ampere 或更新架构 GPU、CUDA 12.x/13.x 的 x86 主机上,拉取 TensorRT Edge-LLM v0.9.1 并安装 Python 工具,执行 `tensorrt-edgellm-export` 命令将 Hugging Face 检查点(如 Qwen3-0.6B)导出为 ONNX 计算图,然后通过 SCP 将 ONNX 目录传输到 Jetson。接着在 Jetson Orin 上,先确认系统的 JetPack 7.2 和 CUDA 13.2 工具链,再克隆匹配的 v0.9.1 源码,使用 CMake 以 `jetson-orin` 目标构建 C++ 运行时和示例,最后运行 `llm_build` 从 ONNX 构建 TensorRT 引擎,并通过 `llm_inference` 执行推理。
JetPack 7.2 上的 TensorRT Edge-LLM 支持哪些 Jetson 平台和精度?
JetPack 7.2 下的 TensorRT Edge-LLM v0.9.1 官方支持 Jetson Orin 和 Jetson Thor。Jetson Orin 上可用的运行时精度为 FP16、INT8、INT4,不支持 FP8、MXFP8 等更高精度。Jetson Thor 的详细精度支持需查看每个模型的支持矩阵,但其构建配置与 Orin 类似,只需将 CMake 目标改为 `jetson-thor`。
如何在 Jetson Orin 上构建 INT4 量化的 TensorRT 引擎?
以 Qwen3-0.6B 为例,在主机上执行 `tensorrt-edgellm-export Qwen/Qwen3-0.6B /path/to/onnx` 即可导出 FP16 的 ONNX 模型。如需在内存受限的 Orin 上运行更大模型,建议使用已在支持矩阵中标记为 INT4 AWQ 或 INT4 GPTQ 的预量化检查点,并添加 `--externalize-weights int4_ffn` 选项以降低引擎构建时的内存压力。

Related Articles

在 JetPack 7.2 和 Jetson AGX Orin 上使用 TensorRT 部署全权重 GR00T N1.7

本文来自 Seeed Studio Wiki,是一篇详细的技术教程,指导如何在 JetPack 7.2 和 Jetson AGX Orin 边缘计算设备上,使用 TensorRT 部署全权重的 NVIDIA Isaac GR00T N1.7 机器人策略模型。与以往仅加速 DiT 组件的工作流不同,本教程实现了对 Vision Transformer (ViT)、Large Language Model (LLM)、视觉-语言自注意力、状态编码器、动作编码器、DiT 动作专家和动作解码器全部七个组件的 TensorRT 引擎构建。教程采用本地 LeRobot 数据集和本地 Qwen3-VL-2B-Instruct 主干模型,实现了完全离线的推理流水线,避免了 Hugging Face Hub 的网络依赖。经过验证,整个 TensorRT 构建过程耗时约 3 分 37 秒,最终生成七个 .engine 文件。在推理性能方面,全 TensorRT 流水线处理每个 16 步动作预测块耗时约 0.2755 秒,相当于每秒 3.63 个块。文章还提供了 PyTorch 与 TensorRT 输出的数值对比,结果显示最终动作的余弦相似度高达 0.997426,验证了模型转换的精度。此外,文章详细列出了存储与内存规划(至少需要 45-50 GB 空间)、环境配置、故障排查以及连接实体机器人前的安全警告和检查清单,是一份从模型导出到边缘推理的完整工程实践指南。

Read More

TensorRT Model Connect - 开源模型部署工具,两命令转C+

TensorRT Model Connect(TRTMC)是 NVIDIA 于 2026 年 8 月 18 日以 Apache-2.0 协议在 GitHub 开源的一款模型部署工具,旨在将 Hugging Face 或本地模型检查点直接转换为原生 C++ 推理引擎。开发者仅需 `trtmc build` 和 `trtmc run` 两条命令即可完成部署,全程无需导出 ONNX 中间格式,构建产物为版本化的 .bundle 文件,运行时完全脱离 PyTorch 环境。该项目由 OpenAI Codex Agent 在人类监督下构建,代表了 AI 辅助开发部署工具的范式转变。TRTMC 提供覆盖 105 个模型系列、76 个模型家族的参考实现,包括 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型以及 Whisper 语音模型。性能验证方面,在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%。其技术架构将构建阶段与运行时解耦,提供统一的 C++ 任务 API(generate、transcribe、embed 等),并支持 NVIDIA 全系列 GPU(如 A100、H100、Jetson),可实现云端到边缘的全场景部署,适用于大模型推理服务、边缘 AI 推理、C++ 应用集成与模型快速评估。该工具通过版本化 .bundle 天然支持模型回滚与灰度发布,为生产环境提供了高一致性的交付单元。

Read More

Jetson Orin 8GB 部署 TensorRT-Edge-LLM:Qwen2.5 从安装到 OpenAI 兼容服务全流程(11 个坑血泪实录,保姆级实战)

本文记录了在Jetson Orin Nano Super DevKit 8GB(8GB统一内存)上,使用NVIDIA TensorRT-Edge-LLM v0.6.0部署阿里通义千问Qwen2.5-0.5B-Instruct的全流程,从Python工具链与C++ Runtime安装、ONNX导出(plugin模式)、TensorRT引擎构建,到用FastAPI封装成OpenAI兼容HTTP服务,并详细剖析了11个工程踩坑点。核心经验包括:必须锁定v0.6.0以匹配JetPack 6.2和TensorRT 10.3.0.30;pip安装需用--no-deps避免onnx版本冲突;导出时绝对禁用--trt_native_ops。8GB设备硬性构建上限为0.5B模型,1.5B模型因embedding表固定占445MB,在autotuner阶段因NvMap连续空闲块(lfb)不足导致OOM,通过重启整机、切换无桌面模式及MAXN功耗模式等策略成功构建。推理验证显示生成速率21.9~30.5 tok/s(平均约26.5 tok/s),TTFT约1.9s,峰值内存4.23GB(55.7%),功耗约15.2W,GPU利用率99%。文章强调构建期内存远大于推理期,同架构Orin设备间引擎可直接迁移,为边缘端AI部署提供了详实、可复现的避坑指南。

Read More

腾讯混元AI Infra如何优化Hy3 Preview:一次大模型推理性能提升的技术拆解

本文详细介绍了腾讯混元AI Infra推理团队针对旗舰大模型Hy3 Preview(采用GQA+MoE混合架构,原生支持256K超长上下文)在NVIDIA Hopper卡上的推理性能优化实践。面对Hopper卡算力较低、显存紧凑等限制,团队从算子优化与融合、并行策略、多级缓存、MTP异步调度、量化与稀疏五大维度进行全栈优化。在算子优化上,提出动态调度负载均衡的Attention算子(混合长度batch加速1.59x-1.76x),双BF16重构FP32 Router GEMM(加速2.86x-3.22x),FusedMoE流水线重构(相比vLLM等加速1.2x-1.6x)。算子融合方面,实现Fused Rope+Norm+Quant+Store KV(加速约5x),Fused AllReduce+Norm+Add(加速1.68x),采样融合算子(加速2.5x-5.5x),以及Gemm+Comm通算融合(加速1.68x-1.81x)。并行策略上,采用TPSP Prefill优化(TTFT降低24.5%-29.9%)和DP+EP Decode架构(吞吐提升15.7%-44.7%)。多级缓存构建GPU-CPU-KVStore三级体系以降低重复Prefill。MTP异步调度优化消除CPU气泡,端到端提升10%-20%。量化方面,在AngelSlim框架中通过GPTQ权重重建、激活平滑、Hadamard旋转和QAT微调实现W8A8C8无损量化,吞吐提升28%+;并应用Stem稀疏注意力算法及HPC-BSA算子,在128K上下文下Prefill延迟降低3.6倍,精度持平。文章为Hopper架构下大模型推理部署提供了系统级优化范本。

Read More

英伟达发布 Cosmos 3 Edge,可在机器人端侧运行的世界模型

英伟达于 2026 年 8 月 19 日发布 Cosmos 3 Edge,这是一款专为机器人端侧控制设计的 4B 参数 omni 模型,包含一个 2B 参数的 Nemotron 推理器。该模型属于 Cosmos 3 系列,与 Cosmos 3 Nano 和 Cosmos 3 Super 共享物理世界数据预训练,具备物体运动和交互的基础理解。其核心优势在于模型足够小,可直接在英伟达 Jetson Thor 上运行,无需数据中心 GPU。后训练是使模型适应机器人操作任务的关键,英伟达提供了完整教程,训练数据来自 nvidia/Cosmos3-DROID 数据集,包含 7.6 万条成功遥操作轨迹,覆盖 86 个任务和 564 个场景,使用 Franka Panda 机械臂和 Robotiq 夹爪采集。后训练验证配置需要 64 个节点,每节点配备 4 块 GB200,共 60K 次迭代,耗时约 68 小时,总计约 1.74 万 GB200 小时。在 Jetson AGX Thor T5000 上,后训练策略实时运行,生成动作块约需 1.53 秒,覆盖 2.13 秒运动,闭环 RoboLab 任务成功率达 22.9%。该模型支持多种机器人本体,包括双臂 Franka、UR、WidowX 250 和 LeRobot SO101,教程和代码已开源。这一发布降低了机器人对数据中心算力的依赖,推动了具身智能在边缘场景的应用,标志着英伟达在边缘 AI 和机器人领域的布局进一步深化。

Read More