行业动态

英伟达发布 Cosmos 3 Edge,可在机器人端侧运行的世界模型

Key takeaway: 英伟达于 2026 年 8 月 19 日发布 Cosmos 3 Edge,这是一款专为机器人端侧控制设计的 4B 参数 omni 模型,包含一个 2B 参数的 Nemotron 推理器。该模型属于 Cosmos 3 系列,与 Cosmos 3 Nano 和 Cosmos 3 Super 共享物理世界数据预训练,具备物体运动和交互的基础理解。其核心优势在于模型足够小,可直接在英伟达 Jetson Thor 上运行,无需数据中心 GPU。后训练是使模型适应机器人操作任务的关键,英伟达提供了完整教程,训练数据来自 nvidia/Cosmos3-DROID 数据集,包含 7.6 万条成功遥操作轨迹,覆盖 86 个任务和 564 个场景,使用 Franka Panda 机械臂和 Robotiq 夹爪采集。后训练验证配置需要 64 个节点,每节点配备 4 块 GB200,共 60K 次迭代,耗时约 68 小时,总计约 1.74 万 GB200 小时。在 Jetson AGX Thor T5000 上,后训练策略实时运行,生成动作块约需 1.53 秒,覆盖 2.13 秒运动,闭环 RoboLab 任务成功率达 22.9%。该模型支持多种机器人本体,包括双臂 Franka、UR、WidowX 250 和 LeRobot SO101,教程和代码已开源。这一发布降低了机器人对数据中心算力的依赖,推动了具身智能在边缘场景的应用,标志着英伟达在边缘 AI 和机器人领域的布局进一步深化。

Key Takeaways
  1. 英伟达于 2026 年 8 月 19 日发布 4B 参数世界模型 Cosmos 3 Edge,专为机器人端侧控制设计,可在 Jetson Thor 上直接运行。
  2. 该模型包含一个 2B 参数的 Nemotron 推理器,基于 Cosmos 3 系列预训练,具备对物体运动和交互的基础理解。
  3. 后训练数据来自 nvidia/Cosmos3-DROID 数据集,包含 7.6 万条成功遥操作轨迹,覆盖 86 个任务和 564 个场景。
  4. 后训练验证配置使用 64 节点各 4 块 GB200,共 60K 次迭代,耗时约 68 小时,总计约 1.74 万 GB200 小时。
  5. 在 Jetson AGX Thor T5000 上,模型生成动作块约 1.53 秒,覆盖 2.13 秒运动,实现实时连续控制,闭环成功率达 22.9%。
  6. Cosmos 3 Edge 支持多种机器人本体,包括双臂 Franka、UR、WidowX 250 和 LeRobot SO101,教程和代码已开源。
英伟达这次发布的 Cosmos 3 Edge,核心看点在于它为具身智能的“去中心化”算力部署提供了一条清晰的路径。过去,世界模型通常需要云端庞大算力支持,而 4B 参数量成功跑在 Jetson Thor 端侧,意味着机器人实现实时物理推理的门槛大幅降低。这是一篇对前线部署工程师(FDE)极具参考价值的技术发布,因为它不仅给出了模型,还配套了从后训练到部署的完整教程与数据,是从实验室走向产业落地的关键一步。

英伟达于 2026 年 8 月 19 日发布 4B 参数世界模型 Cosmos 3 Edge,专为机器人端侧控制设计,可在 Jetson Thor 上直接运行。

—— 络石智能编辑部 · Editor's Pick

英伟达发布 Cosmos 3 Edge,可在机器人端侧运行的世界模型

英伟达推出4B参数世界模型Cosmos 3 Edge,用于机器人端侧控制。

来源:NVIDIA Developer Blog · 2026-08-20 00:00 北京 ·

字号 A A A A

英伟达于 2026 年 8 月 19 日发布 Cosmos 3 Edge,这是一款专为机器人端侧控制设计的 4B 参数 omni 模型,包含一个 2B 参数的 Nemotron 推理器。该模型属于 Cosmos 3 系列,与 Cosmos 3 Nano 和 Cosmos 3 Super 使用相同的物理世界数据预训练,因此具备对物体运动和交互的基础理解。其关键优势在于模型足够小,可直接在英伟达 Jetson Thor 上运行,无需依赖数据中心 GPU。

后训练是使模型适应机器人操作任务的关键步骤。英伟达提供了完整的教程,指导开发者将 Cosmos 3 Edge 后训练为操作策略,并在 Jetson Thor 上部署。训练数据来自 nvidia/Cosmos3-DROID 数据集,包含 7.6 万条成功遥操作轨迹,约 350 小时,覆盖 86 个任务和 564 个场景,使用 Franka Panda 机械臂和 Robotiq 夹爪采集。数据以 LeRobotDataset v3.0 格式提供,分辨率为 640×360。训练前需过滤空闲帧、选择成功演示,并进行随机裁剪、缩放和颜色抖动增强。

后训练过程需要强大的计算资源。英伟达验证的配置使用 64 个节点,每个节点配备 4 块 GB200,共 60K 次迭代,耗时约 68 小时,总计约 1.74 万 GB200 小时。这属于基础模型后训练,而非单 GPU微调,开发者需提前规划算力。训练超参数包括:动作空间为 8 维绝对关节位置(7 关节 + 夹爪),观测为三摄像头画布(腕部 360×640,两个外部视图 180×320),动作块为 15 Hz 下 32 个未来动作,学习率 2e-4,全局批大小 8192。

在 Jetson AGX Thor T5000 上,后训练的策略模型能够实时运行。推理时,模型生成一个动作块约需 1.53 秒(640×540 分辨率、15 Hz),而一个动作块覆盖约 2.13 秒的机器人运动。由于下一个动作块在当前块完成前已准备好,机械臂可连续运动,无需数据中心 GPU 介入。在闭环 RoboLab 任务中,该策略达到 22.9% 的成功率。这证明 4B 世界模型可以作为实用的实时端侧策略骨干。

英伟达强调,Cosmos 3 Edge 支持多种机器人本体,包括双臂 Franka、UR、WidowX 250 和 LeRobot SO101。开发者可将自有数据转换为 LeRobot Dataset v3 格式,并针对不同本体配置动作空间、相机布局和归一化设置。教程中的所有步骤均可从开源 cosmos-framework 仓库复现,发布的检查点已在 HuggingFace 上提供。

这一发布对机器人领域具有重要意义。世界模型此前因体积庞大难以在设备端部署,而 Cosmos 3 Edge 通过后训练实现了端侧实时推理,降低了机器人对数据中心算力的依赖,可能推动具身智能在边缘场景的广泛应用。对于 AI 产业投资者而言,这标志着英伟达在边缘 AI 和机器人领域的布局进一步深化,有望带动相关硬件和软件生态的发展。

阅读原文 · NVIDIA Developer Blog ↗

Tags

Related Topics

Expert Comment

This article is curated by the editorial team from public sources for reference only.

FAQ

什么是英伟达的 Cosmos 3 Edge 模型?
Cosmos 3 Edge 是英伟达于 2026 年 8 月 19 日发布的一款 4B 参数世界模型,专门用于机器人端侧控制。它包含一个 2B 参数的 Nemotron 推理器,最大的优势是模型体积足够小,可以直接在英伟达 Jetson Thor 边缘计算设备上运行,无需依赖数据中心 GPU。
Cosmos 3 Edge 在 Jetson Thor 上的推理速度有多快?
在 Jetson AGX Thor T5000 上,Cosmos 3 Edge 后训练的策略模型生成一个动作块约需 1.53 秒,而该动作块覆盖约 2.13 秒的机器人运动。由于下一个动作块可在当前动作完成前生成,因此机械臂能够实现连续、实时的运动,无需数据中心介入。
对 Cosmos 3 Edge 进行后训练需要多大的算力?
整个后训练过程需要强大的计算资源。英伟达验证的配置是使用 64 个节点,每个节点配备 4 块 GB200 GPU,总计进行 60,000 次迭代,耗时约 68 小时,总计消耗约 17,400 GB200 小时。

Related Articles

TensorRT Model Connect - 开源模型部署工具,两命令转C+

TensorRT Model Connect(TRTMC)是 NVIDIA 于 2026 年 8 月 18 日以 Apache-2.0 协议在 GitHub 开源的一款模型部署工具,旨在将 Hugging Face 或本地模型检查点直接转换为原生 C++ 推理引擎。开发者仅需 `trtmc build` 和 `trtmc run` 两条命令即可完成部署,全程无需导出 ONNX 中间格式,构建产物为版本化的 .bundle 文件,运行时完全脱离 PyTorch 环境。该项目由 OpenAI Codex Agent 在人类监督下构建,代表了 AI 辅助开发部署工具的范式转变。TRTMC 提供覆盖 105 个模型系列、76 个模型家族的参考实现,包括 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型以及 Whisper 语音模型。性能验证方面,在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%。其技术架构将构建阶段与运行时解耦,提供统一的 C++ 任务 API(generate、transcribe、embed 等),并支持 NVIDIA 全系列 GPU(如 A100、H100、Jetson),可实现云端到边缘的全场景部署,适用于大模型推理服务、边缘 AI 推理、C++ 应用集成与模型快速评估。该工具通过版本化 .bundle 天然支持模型回滚与灰度发布,为生产环境提供了高一致性的交付单元。

Read More

在 JetPack 7.2 上部署 TensorRT Edge-LLM

本指南来自 Seeed Studio Wiki,完整记录在 NVIDIA JetPack 7.2 上部署 TensorRT Edge-LLM v0.9.1 的流程。TensorRT Edge-LLM 是 NVIDIA 面向嵌入式 Jetson 平台的大语言模型、视觉语言模型和多模态模型推理栈,本版本于 2026 年 7 月 31 日更新,官方支持 Jetson Orin 和 Jetson Thor。部署分两阶段:首先在 x86 GPU 主机(Ubuntu 22.04/24.04、CUDA 12.x/13.x、Ampere 以上 GPU)上克隆 TensorRT Edge-LLM v0.9.1,通过 `tensorrt-edgellm-export` 将 Hugging Face 上的 Qwen3-0.6B 检查点导出为 ONNX 计算图;随后将 ONNX 目录传输至 Jetson 设备,在 JetPack 7.2 与 CUDA 13.2 工具链下,使用 CMake 以 `jetson-orin` 或 `jetson-thor` 为目标构建 C++ 运行时和示例,然后运行 `llm_build` 从 ONNX 构建 TensorRT 引擎,并通过 `llm_inference` 进行推理,输出示例显示模型成功回答“The capital of the United States is Washington, D.C.”。指南详细说明了 Jetson Orin 支持的精度仅为 FP16、INT8、INT4,不支持 FP8 等更高精度,并强调 JetPack 6.2 的引擎不可直接复用。对于 INT4 量化,推荐使用 AWQ 或 GPTQ 预量化检查点并采用外部化权重选项以降低内存压力。此外,还提供了基准测试命令、与 JetPack 6.2 的差异对比以及常见故障(如 CMake

Read More

Fuzzball将英伟达DGX Spark转化为可随时运行的任意规模AI开发与推理环境

2026年7月(具体日期不详),CIQ宣布其Fuzzball人工智能与高性能计算编排平台已为NVIDIA DGX Spark提供可投入生产使用的AI计算与推理环境,后续计划支持更多平台。Fuzzball可将AI模型从构思到推理服务上线的周期从数月压缩至数天,单台DGX Spark在启用首日即可成为全功能AI开发部署环境,内置数百个工作流模板,无需重构即可扩展至数千块GPU,还可无缝迁移至NVIDIA GB300 NVL72等更大规模GPU部署。该方案主要面向需保障数据不出本地的Sovereign AI场景,打通本地DGX Spark、现有高性能计算集群与云GPU资源的统一运营模型,消除AI团队与高性能计算团队的运营割裂问题,解决此前受监管行业机构必须在AI投产与数据自主可控之间二选一的痛点。CIQ还宣布将于2026年7月16日太平洋夏令时12:00举办题为“借助Fuzzball部署您的专属大语言模型并推进至生产环境”的网络研讨会,开放公开注册。该方案体现出面向主权AI、本地到云的统一编排以及工作流一键扩展等关键能力,针对金融、医疗等强监管行业的AI落地需求提供了工程化解决路径。

Read More

Jetson Orin 8GB 部署 TensorRT-Edge-LLM:Qwen2.5 从安装到 OpenAI 兼容服务全流程(11 个坑血泪实录,保姆级实战)

本文记录了在Jetson Orin Nano Super DevKit 8GB(8GB统一内存)上,使用NVIDIA TensorRT-Edge-LLM v0.6.0部署阿里通义千问Qwen2.5-0.5B-Instruct的全流程,从Python工具链与C++ Runtime安装、ONNX导出(plugin模式)、TensorRT引擎构建,到用FastAPI封装成OpenAI兼容HTTP服务,并详细剖析了11个工程踩坑点。核心经验包括:必须锁定v0.6.0以匹配JetPack 6.2和TensorRT 10.3.0.30;pip安装需用--no-deps避免onnx版本冲突;导出时绝对禁用--trt_native_ops。8GB设备硬性构建上限为0.5B模型,1.5B模型因embedding表固定占445MB,在autotuner阶段因NvMap连续空闲块(lfb)不足导致OOM,通过重启整机、切换无桌面模式及MAXN功耗模式等策略成功构建。推理验证显示生成速率21.9~30.5 tok/s(平均约26.5 tok/s),TTFT约1.9s,峰值内存4.23GB(55.7%),功耗约15.2W,GPU利用率99%。文章强调构建期内存远大于推理期,同架构Orin设备间引擎可直接迁移,为边缘端AI部署提供了详实、可复现的避坑指南。

Read More

腾讯混元AI Infra如何优化Hy3 Preview:一次大模型推理性能提升的技术拆解

本文详细介绍了腾讯混元AI Infra推理团队针对旗舰大模型Hy3 Preview(采用GQA+MoE混合架构,原生支持256K超长上下文)在NVIDIA Hopper卡上的推理性能优化实践。面对Hopper卡算力较低、显存紧凑等限制,团队从算子优化与融合、并行策略、多级缓存、MTP异步调度、量化与稀疏五大维度进行全栈优化。在算子优化上,提出动态调度负载均衡的Attention算子(混合长度batch加速1.59x-1.76x),双BF16重构FP32 Router GEMM(加速2.86x-3.22x),FusedMoE流水线重构(相比vLLM等加速1.2x-1.6x)。算子融合方面,实现Fused Rope+Norm+Quant+Store KV(加速约5x),Fused AllReduce+Norm+Add(加速1.68x),采样融合算子(加速2.5x-5.5x),以及Gemm+Comm通算融合(加速1.68x-1.81x)。并行策略上,采用TPSP Prefill优化(TTFT降低24.5%-29.9%)和DP+EP Decode架构(吞吐提升15.7%-44.7%)。多级缓存构建GPU-CPU-KVStore三级体系以降低重复Prefill。MTP异步调度优化消除CPU气泡,端到端提升10%-20%。量化方面,在AngelSlim框架中通过GPTQ权重重建、激活平滑、Hadamard旋转和QAT微调实现W8A8C8无损量化,吞吐提升28%+;并应用Stem稀疏注意力算法及HPC-BSA算子,在128K上下文下Prefill延迟降低3.6倍,精度持平。文章为Hopper架构下大模型推理部署提供了系统级优化范本。

Read More