边缘端LLM卸载故事:Synaptics Torq™如何实现高效Gemma™推理
Key takeaway: 本文探讨了Synaptics公司与Google Research合作,在其Astra SL2610产品线中集成Torq NPU,以高效运行Google的Gemma 3 270M大语言模型的边缘推理解决方案。文章指出,边缘设备部署LLM面临动态执行、激活函数算力消耗高和内存带宽三大瓶颈,标准CPU和普通NPU难以高效应对。为此,Torq NPU采用了三项核心技术支柱:第一,通过静态模型转换将动态计算图预分配为静态张量,确保硬件利用率和执行可预测性;第二,基于硬件优化的查找表(LUT)和线性插值加速GELU和Softmax激活函数,分别实现10倍和12.5倍的推理加速;第三,采用感知敏感度的混合精度权重量化策略,将84%的层压缩至4-bit精度,关键层保留8-bit,平均位宽降至4.3 bits,在保持模型精度的同时提升2.7倍有效吞吐量。综合三项优化,Torq NPU使Gemma 3推理速度整体提升3.5倍,实现了数据隐私、离线可靠、低延迟和低成本的边缘AI优势。该技术适用于IoT边缘AI处理器,支持离线语言翻译、工具调用和文档摘要等应用场景。
- 边缘设备运行LLM的主要挑战包括动态序列长度、昂贵的GELU/Softmax激活函数以及内存带宽瓶颈。
- Synaptics Torq NPU与Google Research合作,采用异构架构,集成自研T1核心与Google Coral NPU核心以加速AI推理。
- 编译器工具链通过静态模型转换,将动态KV缓存预分配为静态张量,确保边缘推理的稳定和高效执行。
- Torq NPU利用硬件查找表技术(LUT)实现GELU和Softmax的硬件级加速,分别取得了10倍和12.5倍的加速效果。
- 通过敏感度导向的混合精度量化,模型平均位宽降至4.3 bits,在几乎无损精度的情况下,有效吞吐量提升2.7倍。
- 结合三项优化技术,Gemma 3 270M模型在Torq NPU上的推理速度整体提升了3.5倍。
- 开发人员可以通过Synaptics Astra SL2610开发套件和GitHub示例库体验和实施该技术。
在边缘AI落地难的当下,Synaptics与Google的深度合作提供了一个极具参考价值的硬件工程范本。本文不仅厘清了LLM在边缘端推理的三大技术瓶颈,更详细拆解了Torq NPU从计算图优化到硬件级数学加速的全栈解决方案。对于正在评估边缘AI方案的架构师和产品经理来说,文中关于混合精度量化、2.7倍吞吐量提升以及12.5倍Softmax加速的具体数据,都是关键的选型参考。如果你关心如何让大模型跑在IoT设备上,这篇文章值得仔细研读。
边缘设备运行LLM的主要挑战包括动态序列长度、昂贵的GELU/Softmax激活函数以及内存带宽瓶颈。
—— 络石智能编辑部 · Editor's Pick边缘端LLM卸载故事:Synaptics Torq™如何实现高效Gemma™推理
这篇博文最初发布于Synaptics网站。经Synaptics许可在此重印。
如今,开发者和系统架构师面临着日益增长的需求,即在设备上实现大型语言模型变体。他们承受着压力,要在资源受限的设备上支持Transformer模型,以确保数据隐私、消除云API费用,并提供离线可靠性。在设备端执行也正成为满足严格安全法规(如欧洲《网络弹性法案》(CRA))的必要条件,同时提供交互式AI助手所需的即时延迟。
挑战在于,大多数边缘硬件并非针对LLM的动态执行模式、激活瓶颈和内存移动需求而设计。在标准CPU上运行具有数亿参数的Transformer模型,其效率远低于在专用硬件上本地运行。当AI工作负载在主机核心(无论是Arm®、RISC-V还是x86)上运行时,会消耗应用程序栈其余部分所需的计算能力,迫使开发者在系统功能上做出妥协。这明确产生了将这些模型卸载到高效、可扩展的NPU实现上的需求。
标准NPU通常因以下几个原因难以处理这些工作负载:
- 像Gemma 3 270M这样的Transformer模型本质上是动态的,序列长度和注意力掩码在对话过程中会增长。大多数典型的边缘NPU需要静态运行时,无法有效管理这些变化的张量维度。
- LLM依赖昂贵的激活函数(如GELU和Softmax),这些函数需要复杂的迭代数学运算,从而在通用加速器上造成延迟和功耗瓶颈。
- 内存带宽(而非原始计算能力)通常是主要瓶颈,导致NPU在等待庞大权重矩阵从内存中到达时处于空闲状态。
现代边缘设备需要异构边缘AI架构,能够混合搭配子系统以加速推理的不同方面。这使得AI加速能够完全卸载到专用引擎,从而释放主机CPU用于标准应用程序任务。这些架构实现了优雅的回退和灵活的实现路径,从“一刀切”的解决方案转向更可扩展、更对开发者友好的硬件世代。
为了克服这些根深蒂固的硬件和软件障碍,Synaptics和Google Research携手合作,为边缘智能提供了可扩展的、最先进的解决方案。这一合作利用了专为满足现代Transformer模型独特需求而设计的新一代边缘AI芯片。该解决方案建立在三大支柱之上。
Synaptics和Google的合作
Synaptics Astra™ SL2610产品线是业界首款集成Google Research Coral NPU™的IoT边缘AI处理器系列。Torq NPU体现了异构理念,它集成了Synaptics开发的Transformer能力核心(T1)和Google开发的标量RISC-V核心(Coral NPU),两者协同工作,提供高效、设备端的多模态AI。
Gemma 3内部:架构与需求
Google的Gemma 3 270M是一个紧凑型、指令调优的语言模型。其内部需求包括18个Transformer层,这些层使用GELU激活、Softmax机制和大量矩阵乘法。这些层造成了显著的内存和计算瓶颈,需要特定的优化。
Google Gemma 3 270M紧凑且指令调优的架构使Coralboard能够作为高性能、设备端的对话助手。通过将这些Transformer工作负载卸载到Torq NPU,系统确保了高级边缘应用所需的数据隐私和离线可靠性。
这种本地计算能力促进了通过自然语言进行工具调用,模型充当智能接口,解释用户意图并触发特定的设备端功能。该平台实时生成token的能力还允许离线语言翻译、自然语言工具调用以及高效的消息摘要或文档处理,而无需承担基于云API的成本或延迟。
然而,在受限的边缘硬件上高效提供这些体验,需要克服几个基本的LLM推理瓶颈。Torq NPU工具链通过三个关键的优化支柱应对这些挑战:
支柱1:静态模型转换以实现可预测执行
与动态的云运行时不同,像Torq NPU这样的边缘加速器需要具有固定张量维度的静态运行时。我们的编译器工具链将动态图转换为静态图以提供稳定性。转换过程用预分配的静态张量替换增长的KV缓存,并实现静态注意力掩码和位置编码。通过将复杂的训练框架图简化为标准操作,我们确保了最大硬件利用率和可预测的执行时序。
支柱2:硬件加速的激活函数
GELU和Softmax的迭代数学计算在通用硬件上消耗大量能量。Torq通过将输入域分解为使用硬件优化查找表和线性插值处理的区域来近似复杂激活函数。这避免了重复的指数、除法和其他计算开销大的操作。
我们通过用这些紧凑表替换复杂数学,实现了GELU的10倍加速。对于Softmax,我们通过将操作分解为指数和倒数查找表来实现无除法注意力机制。我们最近的实验表明,使用这种LUT方法,我们为Softmax实现了12.5倍的推理加速。
支柱3:混合精度权重量化
内存带宽是Astra平台上LLM推理的主要瓶颈。我们通过灵敏度引导压缩来解决这一问题,即根据层特定的容差进行量化。我们的策略将84%的层压缩为4位精度,同时将16%的敏感层(如语言建模头)保留为8位精度以保持准确性。
使用这种方法,我们将权重从16位精度平均降低到仅4.3位,模型保真度损失极小。系统以压缩格式存储这些权重,并在它们流式传输到计算单元时,通过即时反量化将其恢复为bf16精度,从而实现2.7倍的有效吞吐量提升。我们还裁剪了词汇表并提高了运行时DMA效率,有助于更快的推理。
综合结果:现实世界的边缘AI
通过结合这三大支柱,Torq NPU将推理速度提高了3.5倍。它还消除了动态分配开销,实现了10倍更快的激活函数,并提供了显著的内存带宽改进。这带来了本地执行的全部边缘优势,包括数据隐私、离线可靠性、即时延迟和降低的云成本。
开发者可以通过访问Torq示例/演示GitHub仓库来探索这项技术,查看实现和文档。要开始硬件评估,您可以购买Synaptics Astra SL2610(Machina)开发套件。请关注此空间,以获取官方发布和即将推出的新型Synaptics Coralboard的可用性信息,我们将持续跟进Google I/O 2026公告的最新进展。
Karthikeyan Shanmuga Vadivel 计算机视觉架构总监
Tags
Related Topics
Expert Comment
This article is curated by the editorial team from public sources for reference only.