NPU

Articles related to "NPU"

3 articles in total

借助AMD Vitis AI的GStreamer加速边缘AI流水线

本文介绍如何使用 AMD Vitis AI 和 VVAS 工具链加速边缘 AI 视频分析流水线的开发与部署。文章从端到端视角剖析了从训练好的 PyTorch/TensorFlow 模型到在第二代 Versal AI Edge 系列自适应 SoC 上实时运行 NPU 推理的完整流程。核心工具包括:AMD Quark 量化工具支持 BF16、FP16 和 INT8 精度模式,并可通过混合精度解决 YOLO 等模型后处理的精度损失;Vitis AI 编译器自动完成算子融合、内存调度及 CPU/NPU 分区,支持数据并行和张量并行;ONNX Runtime + Vitis AI Execution Provider 和原生 VART-ML 运行时分别适配快速原型与量产级零拷贝执行。在视频流水线集成侧,基于 GStreamer 的 VVAS 通过插件(vvas_xinfer、vvas_xoverlay 等)及 JSON 配置,编排采集、预处理、推理、后处理与渲染,并原生支持空间分区、时间共享和 DMA-BUF 零拷贝等高级部署特性。文中以 YOLOX 检测示例演示了单条 gst-launch 命令即可描述完整流水线。预构建 Docker 镜像和 VEK385 评估板启动镜像使上手时间缩短至数分钟,Python/C++ API 覆盖从原型到量产。这些能力可使团队将更少时间花在底层集成上,更多聚焦于应用开发与性能优化。

Read More

YOLOv10在土星云SE110S系列边缘计算设备上的部署实战

本文详细介绍了将YOLOv10目标检测模型部署到国产边缘计算设备土星云SE110S系列的全流程实战,涵盖模型转换、编译与推理优化。YOLOv10采用一致双重分配策略实现NMS-Free端到端检测,相较YOLOv8-S减少约23%参数量、28%计算量,推理延迟降低约30%,非常适合边缘部署。土星云SE110S系列由国科环宇推出,提供SE110S-WC08(7.2 TOPS)、SE110S-WB16(16 TOPS)和SE110S-WA32(32 TOPS)三款型号,支持INT8/FP16/FP32混合精度推理和BMCV硬件加速。部署流程包括:通过Ultralytics导出ONNX模型(opset 11),使用TPU-MLIR工具链将ONNX编译为BModel,并推荐INT8量化,校准集200-500张图片。在SE110S-WA32上,INT8量化配合BMCV加速可实现110+ FPS(单路1080P),精度损失控制在5%以内(COCO val2017 AP@0.5:0.95从0.463降至0.443)。文章还给出了智慧安防、工业质检、智慧交通等多个边缘AI视觉场景的选型与优化建议,展示了YOLOv10在国产边缘硬件上的成熟落地能力。

Read More

为什么边缘计算终于有了它的杀手级应用?

本文梳理了海外多位专家在近期专题讨论会上关于边缘计算的关键观点,核心结论是AI推理正成为边缘计算真正的杀手级应用。美国铁塔公司的Jim Poole指出,过去十年MEC(多接入边缘计算)像“拿着钉子找锤子”,基础设施超前部署却缺乏规模化业务需求;如今生成式AI和智能体带来的上行数据爆炸——爱立信的Joe Constantine援引《爱立信移动市场报告》数据称,全球数据流量到2029年将增长两倍,上行链路流量到2035年将增长10倍——正迫使计算能力从集中云向边缘扩散。高通的Koymen博士认为用户行为正从下行视频消费转向上行AI生成流量,智能体数据将超过人类生成数据。英特尔Agarwal警告避免重蹈私有无线网络覆辙,仲量联行Sean Farney则断言边缘AI推理让基础设施领域重新变得性感。新一代AI系统功率密度已跃升至每机柜150-200kW,甚至谷歌展示1MW方案,液冷和现场发电将成为标配。专家预测到2028-2029年,6G商用、75%流量运行于5G、行业争论转向SLA和四级/五级自动化,人形机器人可能进入数据中心。文章最后指出电力、人才和数据是落地的三大瓶颈,高质量数据体系将成为AI竞争的核心护城河。

Read More