具身智能

标签「具身智能」下的文章

共 3 篇文章

英伟达发布 Cosmos 3 Edge,可在机器人端侧运行的世界模型

英伟达于 2026 年 8 月 19 日发布 Cosmos 3 Edge,这是一款专为机器人端侧控制设计的 4B 参数 omni 模型,包含一个 2B 参数的 Nemotron 推理器。该模型属于 Cosmos 3 系列,与 Cosmos 3 Nano 和 Cosmos 3 Super 共享物理世界数据预训练,具备物体运动和交互的基础理解。其核心优势在于模型足够小,可直接在英伟达 Jetson Thor 上运行,无需数据中心 GPU。后训练是使模型适应机器人操作任务的关键,英伟达提供了完整教程,训练数据来自 nvidia/Cosmos3-DROID 数据集,包含 7.6 万条成功遥操作轨迹,覆盖 86 个任务和 564 个场景,使用 Franka Panda 机械臂和 Robotiq 夹爪采集。后训练验证配置需要 64 个节点,每节点配备 4 块 GB200,共 60K 次迭代,耗时约 68 小时,总计约 1.74 万 GB200 小时。在 Jetson AGX Thor T5000 上,后训练策略实时运行,生成动作块约需 1.53 秒,覆盖 2.13 秒运动,闭环 RoboLab 任务成功率达 22.9%。该模型支持多种机器人本体,包括双臂 Franka、UR、WidowX 250 和 LeRobot SO101,教程和代码已开源。这一发布降低了机器人对数据中心算力的依赖,推动了具身智能在边缘场景的应用,标志着英伟达在边缘 AI 和机器人领域的布局进一步深化。

阅读全文

在 JetPack 7.2 和 Jetson AGX Orin 上使用 TensorRT 部署全权重 GR00T N1.7

本文来自 Seeed Studio Wiki,是一篇详细的技术教程,指导如何在 JetPack 7.2 和 Jetson AGX Orin 边缘计算设备上,使用 TensorRT 部署全权重的 NVIDIA Isaac GR00T N1.7 机器人策略模型。与以往仅加速 DiT 组件的工作流不同,本教程实现了对 Vision Transformer (ViT)、Large Language Model (LLM)、视觉-语言自注意力、状态编码器、动作编码器、DiT 动作专家和动作解码器全部七个组件的 TensorRT 引擎构建。教程采用本地 LeRobot 数据集和本地 Qwen3-VL-2B-Instruct 主干模型,实现了完全离线的推理流水线,避免了 Hugging Face Hub 的网络依赖。经过验证,整个 TensorRT 构建过程耗时约 3 分 37 秒,最终生成七个 .engine 文件。在推理性能方面,全 TensorRT 流水线处理每个 16 步动作预测块耗时约 0.2755 秒,相当于每秒 3.63 个块。文章还提供了 PyTorch 与 TensorRT 输出的数值对比,结果显示最终动作的余弦相似度高达 0.997426,验证了模型转换的精度。此外,文章详细列出了存储与内存规划(至少需要 45-50 GB 空间)、环境配置、故障排查以及连接实体机器人前的安全警告和检查清单,是一份从模型导出到边缘推理的完整工程实践指南。

阅读全文

库萨科技发布全模态具身模型Kusa Omni-CTS与专用操作系统Kusa OS,助力城市服务机器人从"执行者"变为"思考者"

2026年7月2日,库萨科技正式发布面向具身智能的全模态具身模型 Kusa Omni-CTS 与专用操作系统 Kusa OS,旨在推动城市服务机器人从被动执行指令的“执行者”向主动理解物理世界的“思考者”转变。Kusa Omni-CTS 模型实现了视觉空间感知、语义与先验指令、本体感知与动力学三大模态的原生融合,让机器人能通过物理交互“感受”环境;采用连续时空表征完成跨模态异步特征对齐,解耦传感器硬件时间同步依赖;并引入反事实推演机制,在高维空间中对动作后果进行符合物理动力学限制的预判与试错,确保决策安全。Kusa OS 是专为边缘侧设计的操作系统,实现小于1毫秒的系统时延和仅50微秒的极致抖动控制,通过确定性调度保障紧急制动等硬实时任务的最高优先级。该系统提供统一硬件抽象接口,支持“一脑多形”,已在库萨0.5吨级、1.5吨级、3吨级城市服务机器人产品中部署,并在超40座城市的复杂环境中得到验证。两者协同构成库萨的城市服务具身智能技术基座。

阅读全文