边缘端LLM卸载故事:Synaptics Torq™如何实现高效Gemma™推理
本文探讨了Synaptics公司与Google Research合作,在其Astra SL2610产品线中集成Torq NPU,以高效运行Google的Gemma 3 270M大语言模型的边缘推理解决方案。文章指出,边缘设备部署LLM面临动态执行、激活函数算力消耗高和内存带宽三大瓶颈,标准CPU和普通NPU难以高效应对。为此,Torq NPU采用了三项核心技术支柱:第一,通过静态模型转换将动态计算图预分配为静态张量,确保硬件利用率和执行可预测性;第二,基于硬件优化的查找表(LUT)和线性插值加速GELU和Softmax激活函数,分别实现10倍和12.5倍的推理加速;第三,采用感知敏感度的混合精度权重量化策略,将84%的层压缩至4-bit精度,关键层保留8-bit,平均位宽降至4.3 bits,在保持模型精度的同时提升2.7倍有效吞吐量。综合三项优化,Torq NPU使Gemma 3推理速度整体提升3.5倍,实现了数据隐私、离线可靠、低延迟和低成本的边缘AI优势。该技术适用于IoT边缘AI处理器,支持离线语言翻译、工具调用和文档摘要等应用场景。
Read More →