H100

Articles related to "H100"

2 articles in total

TensorRT Model Connect - 开源模型部署工具,两命令转C+

TensorRT Model Connect(TRTMC)是 NVIDIA 于 2026 年 8 月 18 日以 Apache-2.0 协议在 GitHub 开源的一款模型部署工具,旨在将 Hugging Face 或本地模型检查点直接转换为原生 C++ 推理引擎。开发者仅需 `trtmc build` 和 `trtmc run` 两条命令即可完成部署,全程无需导出 ONNX 中间格式,构建产物为版本化的 .bundle 文件,运行时完全脱离 PyTorch 环境。该项目由 OpenAI Codex Agent 在人类监督下构建,代表了 AI 辅助开发部署工具的范式转变。TRTMC 提供覆盖 105 个模型系列、76 个模型家族的参考实现,包括 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型以及 Whisper 语音模型。性能验证方面,在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%。其技术架构将构建阶段与运行时解耦,提供统一的 C++ 任务 API(generate、transcribe、embed 等),并支持 NVIDIA 全系列 GPU(如 A100、H100、Jetson),可实现云端到边缘的全场景部署,适用于大模型推理服务、边缘 AI 推理、C++ 应用集成与模型快速评估。该工具通过版本化 .bundle 天然支持模型回滚与灰度发布,为生产环境提供了高一致性的交付单元。

Read More

Physical AI迎来首个端边云统一推理运行时:北邮、北大、清华、明体科技等联合推出PhyAI

来自北京邮电大学、北京大学、清华大学、南京大学、明体科技及面壁智能的联合团队推出了 PhyAI,这是首个面向 Physical AI 的端边云统一推理运行时。针对当前具身智能在离线评测、云端强化学习 Rollout、端侧实时控制、工厂服务等四类场景中需维护四套代码、迁移成本高及效率参差不齐的问题,PhyAI 实现了单套代码的全场景无缝迁移。其核心架构包含 Model Adapter 和 Scheduler,统一管理调度、算子融合与多卡并行。在 Benchmark 评估中,PhyAI 相对官方实现产生了 1.40 倍至 4.65 倍的显著加速,例如将 MiniCPM-Robot 在 H100 上的推理延迟从 105.38ms 骤降至 22.64ms;在多机器人真机并行场景中,延迟最高降低 2.3 倍并消除了卡顿。文章提出了关键分析模型“Control-Time Roofline”,指出在算力过剩的 GPU 上,物理环境响应已成为新瓶颈,单纯降低模型推理延迟无法线性提升机器人的整体控制频率,这为具身智能算法与硬件的协同设计提供了全新的量化依据。

Read More