NPU

标签「NPU」下的文章

共 3 篇文章

借助AMD Vitis AI的GStreamer加速边缘AI流水线

本文介绍如何使用 AMD Vitis AI 和 VVAS 工具链加速边缘 AI 视频分析流水线的开发与部署。文章从端到端视角剖析了从训练好的 PyTorch/TensorFlow 模型到在第二代 Versal AI Edge 系列自适应 SoC 上实时运行 NPU 推理的完整流程。核心工具包括:AMD Quark 量化工具支持 BF16、FP16 和 INT8 精度模式,并可通过混合精度解决 YOLO 等模型后处理的精度损失;Vitis AI 编译器自动完成算子融合、内存调度及 CPU/NPU 分区,支持数据并行和张量并行;ONNX Runtime + Vitis AI Execution Provider 和原生 VART-ML 运行时分别适配快速原型与量产级零拷贝执行。在视频流水线集成侧,基于 GStreamer 的 VVAS 通过插件(vvas_xinfer、vvas_xoverlay 等)及 JSON 配置,编排采集、预处理、推理、后处理与渲染,并原生支持空间分区、时间共享和 DMA-BUF 零拷贝等高级部署特性。文中以 YOLOX 检测示例演示了单条 gst-launch 命令即可描述完整流水线。预构建 Docker 镜像和 VEK385 评估板启动镜像使上手时间缩短至数分钟,Python/C++ API 覆盖从原型到量产。这些能力可使团队将更少时间花在底层集成上,更多聚焦于应用开发与性能优化。

阅读全文

边缘端LLM卸载故事:Synaptics Torq™如何实现高效Gemma™推理

本文探讨了Synaptics公司与Google Research合作,在其Astra SL2610产品线中集成Torq NPU,以高效运行Google的Gemma 3 270M大语言模型的边缘推理解决方案。文章指出,边缘设备部署LLM面临动态执行、激活函数算力消耗高和内存带宽三大瓶颈,标准CPU和普通NPU难以高效应对。为此,Torq NPU采用了三项核心技术支柱:第一,通过静态模型转换将动态计算图预分配为静态张量,确保硬件利用率和执行可预测性;第二,基于硬件优化的查找表(LUT)和线性插值加速GELU和Softmax激活函数,分别实现10倍和12.5倍的推理加速;第三,采用感知敏感度的混合精度权重量化策略,将84%的层压缩至4-bit精度,关键层保留8-bit,平均位宽降至4.3 bits,在保持模型精度的同时提升2.7倍有效吞吐量。综合三项优化,Torq NPU使Gemma 3推理速度整体提升3.5倍,实现了数据隐私、离线可靠、低延迟和低成本的边缘AI优势。该技术适用于IoT边缘AI处理器,支持离线语言翻译、工具调用和文档摘要等应用场景。

阅读全文

为什么边缘计算终于有了它的杀手级应用?

本文梳理了海外多位专家在近期专题讨论会上关于边缘计算的关键观点,核心结论是AI推理正成为边缘计算真正的杀手级应用。美国铁塔公司的Jim Poole指出,过去十年MEC(多接入边缘计算)像“拿着钉子找锤子”,基础设施超前部署却缺乏规模化业务需求;如今生成式AI和智能体带来的上行数据爆炸——爱立信的Joe Constantine援引《爱立信移动市场报告》数据称,全球数据流量到2029年将增长两倍,上行链路流量到2035年将增长10倍——正迫使计算能力从集中云向边缘扩散。高通的Koymen博士认为用户行为正从下行视频消费转向上行AI生成流量,智能体数据将超过人类生成数据。英特尔Agarwal警告避免重蹈私有无线网络覆辙,仲量联行Sean Farney则断言边缘AI推理让基础设施领域重新变得性感。新一代AI系统功率密度已跃升至每机柜150-200kW,甚至谷歌展示1MW方案,液冷和现场发电将成为标配。专家预测到2028-2029年,6G商用、75%流量运行于5G、行业争论转向SLA和四级/五级自动化,人形机器人可能进入数据中心。文章最后指出电力、人才和数据是落地的三大瓶颈,高质量数据体系将成为AI竞争的核心护城河。

阅读全文