行业实践

边缘端LLM卸载故事:Synaptics Torq™如何实现高效Gemma™推理

Key takeaway: 本文探讨了Synaptics公司与Google Research合作,在其Astra SL2610产品线中集成Torq NPU,以高效运行Google的Gemma 3 270M大语言模型的边缘推理解决方案。文章指出,边缘设备部署LLM面临动态执行、激活函数算力消耗高和内存带宽三大瓶颈,标准CPU和普通NPU难以高效应对。为此,Torq NPU采用了三项核心技术支柱:第一,通过静态模型转换将动态计算图预分配为静态张量,确保硬件利用率和执行可预测性;第二,基于硬件优化的查找表(LUT)和线性插值加速GELU和Softmax激活函数,分别实现10倍和12.5倍的推理加速;第三,采用感知敏感度的混合精度权重量化策略,将84%的层压缩至4-bit精度,关键层保留8-bit,平均位宽降至4.3 bits,在保持模型精度的同时提升2.7倍有效吞吐量。综合三项优化,Torq NPU使Gemma 3推理速度整体提升3.5倍,实现了数据隐私、离线可靠、低延迟和低成本的边缘AI优势。该技术适用于IoT边缘AI处理器,支持离线语言翻译、工具调用和文档摘要等应用场景。

Key Takeaways
  1. 边缘设备运行LLM的主要挑战包括动态序列长度、昂贵的GELU/Softmax激活函数以及内存带宽瓶颈。
  2. Synaptics Torq NPU与Google Research合作,采用异构架构,集成自研T1核心与Google Coral NPU核心以加速AI推理。
  3. 编译器工具链通过静态模型转换,将动态KV缓存预分配为静态张量,确保边缘推理的稳定和高效执行。
  4. Torq NPU利用硬件查找表技术(LUT)实现GELU和Softmax的硬件级加速,分别取得了10倍和12.5倍的加速效果。
  5. 通过敏感度导向的混合精度量化,模型平均位宽降至4.3 bits,在几乎无损精度的情况下,有效吞吐量提升2.7倍。
  6. 结合三项优化技术,Gemma 3 270M模型在Torq NPU上的推理速度整体提升了3.5倍。
  7. 开发人员可以通过Synaptics Astra SL2610开发套件和GitHub示例库体验和实施该技术。
在边缘AI落地难的当下,Synaptics与Google的深度合作提供了一个极具参考价值的硬件工程范本。本文不仅厘清了LLM在边缘端推理的三大技术瓶颈,更详细拆解了Torq NPU从计算图优化到硬件级数学加速的全栈解决方案。对于正在评估边缘AI方案的架构师和产品经理来说,文中关于混合精度量化、2.7倍吞吐量提升以及12.5倍Softmax加速的具体数据,都是关键的选型参考。如果你关心如何让大模型跑在IoT设备上,这篇文章值得仔细研读。

边缘设备运行LLM的主要挑战包括动态序列长度、昂贵的GELU/Softmax激活函数以及内存带宽瓶颈。

—— 络石智能编辑部 · Editor's Pick

边缘端LLM卸载故事:Synaptics Torq™如何实现高效Gemma™推理

这篇博文最初发布于Synaptics网站。经Synaptics许可在此重印。

如今,开发者和系统架构师面临着日益增长的需求,即在设备上实现大型语言模型变体。他们承受着压力,要在资源受限的设备上支持Transformer模型,以确保数据隐私、消除云API费用,并提供离线可靠性。在设备端执行也正成为满足严格安全法规(如欧洲《网络弹性法案》(CRA))的必要条件,同时提供交互式AI助手所需的即时延迟。

挑战在于,大多数边缘硬件并非针对LLM的动态执行模式、激活瓶颈和内存移动需求而设计。在标准CPU上运行具有数亿参数的Transformer模型,其效率远低于在专用硬件上本地运行。当AI工作负载在主机核心(无论是Arm®、RISC-V还是x86)上运行时,会消耗应用程序栈其余部分所需的计算能力,迫使开发者在系统功能上做出妥协。这明确产生了将这些模型卸载到高效、可扩展的NPU实现上的需求。

标准NPU通常因以下几个原因难以处理这些工作负载:

  1. 像Gemma 3 270M这样的Transformer模型本质上是动态的,序列长度和注意力掩码在对话过程中会增长。大多数典型的边缘NPU需要静态运行时,无法有效管理这些变化的张量维度。
  2. LLM依赖昂贵的激活函数(如GELU和Softmax),这些函数需要复杂的迭代数学运算,从而在通用加速器上造成延迟和功耗瓶颈。
  3. 内存带宽(而非原始计算能力)通常是主要瓶颈,导致NPU在等待庞大权重矩阵从内存中到达时处于空闲状态。

现代边缘设备需要异构边缘AI架构,能够混合搭配子系统以加速推理的不同方面。这使得AI加速能够完全卸载到专用引擎,从而释放主机CPU用于标准应用程序任务。这些架构实现了优雅的回退和灵活的实现路径,从“一刀切”的解决方案转向更可扩展、更对开发者友好的硬件世代。

为了克服这些根深蒂固的硬件和软件障碍,Synaptics和Google Research携手合作,为边缘智能提供了可扩展的、最先进的解决方案。这一合作利用了专为满足现代Transformer模型独特需求而设计的新一代边缘AI芯片。该解决方案建立在三大支柱之上。

Synaptics和Google的合作

Synaptics Astra™ SL2610产品线是业界首款集成Google Research Coral NPU™的IoT边缘AI处理器系列。Torq NPU体现了异构理念,它集成了Synaptics开发的Transformer能力核心(T1)和Google开发的标量RISC-V核心(Coral NPU),两者协同工作,提供高效、设备端的多模态AI。

Gemma 3内部:架构与需求

Google的Gemma 3 270M是一个紧凑型、指令调优的语言模型。其内部需求包括18个Transformer层,这些层使用GELU激活、Softmax机制和大量矩阵乘法。这些层造成了显著的内存和计算瓶颈,需要特定的优化。

Google Gemma 3 270M紧凑且指令调优的架构使Coralboard能够作为高性能、设备端的对话助手。通过将这些Transformer工作负载卸载到Torq NPU,系统确保了高级边缘应用所需的数据隐私和离线可靠性。

这种本地计算能力促进了通过自然语言进行工具调用,模型充当智能接口,解释用户意图并触发特定的设备端功能。该平台实时生成token的能力还允许离线语言翻译、自然语言工具调用以及高效的消息摘要或文档处理,而无需承担基于云API的成本或延迟。

然而,在受限的边缘硬件上高效提供这些体验,需要克服几个基本的LLM推理瓶颈。Torq NPU工具链通过三个关键的优化支柱应对这些挑战:

支柱1:静态模型转换以实现可预测执行

与动态的云运行时不同,像Torq NPU这样的边缘加速器需要具有固定张量维度的静态运行时。我们的编译器工具链将动态图转换为静态图以提供稳定性。转换过程用预分配的静态张量替换增长的KV缓存,并实现静态注意力掩码和位置编码。通过将复杂的训练框架图简化为标准操作,我们确保了最大硬件利用率和可预测的执行时序。

支柱2:硬件加速的激活函数

GELU和Softmax的迭代数学计算在通用硬件上消耗大量能量。Torq通过将输入域分解为使用硬件优化查找表和线性插值处理的区域来近似复杂激活函数。这避免了重复的指数、除法和其他计算开销大的操作。

我们通过用这些紧凑表替换复杂数学,实现了GELU的10倍加速。对于Softmax,我们通过将操作分解为指数和倒数查找表来实现无除法注意力机制。我们最近的实验表明,使用这种LUT方法,我们为Softmax实现了12.5倍的推理加速。

支柱3:混合精度权重量化

内存带宽是Astra平台上LLM推理的主要瓶颈。我们通过灵敏度引导压缩来解决这一问题,即根据层特定的容差进行量化。我们的策略将84%的层压缩为4位精度,同时将16%的敏感层(如语言建模头)保留为8位精度以保持准确性。

使用这种方法,我们将权重从16位精度平均降低到仅4.3位,模型保真度损失极小。系统以压缩格式存储这些权重,并在它们流式传输到计算单元时,通过即时反量化将其恢复为bf16精度,从而实现2.7倍的有效吞吐量提升。我们还裁剪了词汇表并提高了运行时DMA效率,有助于更快的推理。

综合结果:现实世界的边缘AI

通过结合这三大支柱,Torq NPU将推理速度提高了3.5倍。它还消除了动态分配开销,实现了10倍更快的激活函数,并提供了显著的内存带宽改进。这带来了本地执行的全部边缘优势,包括数据隐私、离线可靠性、即时延迟和降低的云成本。

开发者可以通过访问Torq示例/演示GitHub仓库来探索这项技术,查看实现和文档。要开始硬件评估,您可以购买Synaptics Astra SL2610(Machina)开发套件。请关注此空间,以获取官方发布和即将推出的新型Synaptics Coralboard的可用性信息,我们将持续跟进Google I/O 2026公告的最新进展。

Karthikeyan Shanmuga Vadivel 计算机视觉架构总监

Tags

Related Topics

Expert Comment

This article is curated by the editorial team from public sources for reference only.

FAQ

Synaptics Torq NPU是如何加速Gemma 3 270M模型在边缘设备上的推理的?
Torq NPU通过三大核心支柱技术实现高效推理。第一,它将Gemma 3的动态计算图转换为静态图,预分配KV Cache等张量以消除运行时开销。第二,它对GELU和Softmax这类高成本激活函数进行硬件加速,使用查找表(LUT)技术分别实现了10倍和12.5倍的运算加速。第三,它采用混合精度权重量化,将84%的网络层压缩至4-bit,关键层保留8-bit,使平均位宽降至4.3 bits,在保持精度的同时将有效吞吐量提升2.7倍。综合这些优化,最终模型推理速度整体提升了3.5倍。
边缘设备上运行大语言模型面临哪些主要挑战?
主要面临三大挑战。首先是动态执行瓶颈,对话产生的序列长度和注意力掩码不断增长,而大多数边缘NPU要求静态运行时。其次是激活函数瓶颈,LLM依赖的GELU和Softmax等函数需要复杂的迭代数学运算,在通用硬件上造成巨大延迟和功耗。最后是内存带宽瓶颈,大规模权重矩阵的读取速度远跟不上NPU的计算吞吐,导致昂贵的计算单元常处于空闲等待状态。
如何获取Synaptics Torq NPU的开发资源来评估其性能?
开发者有两个主要途径。软件层面,可以访问Synaptics在GitHub上提供的Torq examples/demos代码库,获取基于Gemma 3的完整实现和文档。硬件层面,可以购买Synaptics Astra SL2610(Machina)开发套件进行实际的硬件评估。

Related Articles

借助AMD Vitis AI的GStreamer加速边缘AI流水线

本文介绍如何使用 AMD Vitis AI 和 VVAS 工具链加速边缘 AI 视频分析流水线的开发与部署。文章从端到端视角剖析了从训练好的 PyTorch/TensorFlow 模型到在第二代 Versal AI Edge 系列自适应 SoC 上实时运行 NPU 推理的完整流程。核心工具包括:AMD Quark 量化工具支持 BF16、FP16 和 INT8 精度模式,并可通过混合精度解决 YOLO 等模型后处理的精度损失;Vitis AI 编译器自动完成算子融合、内存调度及 CPU/NPU 分区,支持数据并行和张量并行;ONNX Runtime + Vitis AI Execution Provider 和原生 VART-ML 运行时分别适配快速原型与量产级零拷贝执行。在视频流水线集成侧,基于 GStreamer 的 VVAS 通过插件(vvas_xinfer、vvas_xoverlay 等)及 JSON 配置,编排采集、预处理、推理、后处理与渲染,并原生支持空间分区、时间共享和 DMA-BUF 零拷贝等高级部署特性。文中以 YOLOX 检测示例演示了单条 gst-launch 命令即可描述完整流水线。预构建 Docker 镜像和 VEK385 评估板启动镜像使上手时间缩短至数分钟,Python/C++ API 覆盖从原型到量产。这些能力可使团队将更少时间花在底层集成上,更多聚焦于应用开发与性能优化。

Read More

FDEs:建设能力,而非依赖性

本文来自 Cohere 官方博客,发表于 2026 年 8 月 27 日,探讨了模型供应商的前线部署工程师(Forward-deployed engineers, FDEs)在企业 AI 生产部署中的独特价值与如何避免供应商锁定。文章指出,根据 Deloitte 2026 年企业 AI 报告,仅 25% 的组织将 40% 以上的 AI 试点推入生产,部署已成为主要瓶颈。相比第三方服务,模型供应商 FDE 拥有更深的产品专业知识、内部工程团队访问权和对底层技术的第一手诊断能力,能够从产品层面而非仅通过变通方案解决问题,如 Cohere 的 FDE 曾为客户重建因工具调用和上下文限制而失败的会议简报生成智能体,并修改了 Slack 集成。然而,FDE 介入可能带来运营依赖风险,即企业拥有系统却不具备自主运营能力。Cohere 的对策是将能力构建内嵌于交付模型:FDE 与客户团队并肩工作,通过共同架构、集成、部署和故障排除转移隐性知识;举办客户赋能会议,培养内部“冠军”;以及帮助客户建立涵盖核心功能的测试套件,使其能独立验证模型版本和配置变更后的系统行为。最终目标是通过深度合作减少对供应商的长期依赖,让客户具备运营、评估、排错和扩展 AI 系统的独立能力。文章结尾还提供了 Cohere 的 FDE 招聘信息。

Read More

前向部署工程师:弥合人工智能价值差距的角色

OpenAI 为前线部署工程师(Forward Deployed Engineer, FDE)开出 28 万美元底薪,Handshake 等公司薪资超 30 万美元,折射出 AI 产业最核心的矛盾:大模型的泛化能力与真实企业流程之间存在巨大的“最后一英里”鸿沟。文章指出,Anthropic 虽宣称要培训数万名工程师,目前仅完成 86 名,进一步验证了这一人才缺口。FDE 并非传统软件工程师,而是集商业敏锐度、技术交付和部署所有权于一体的混合专家,核心能力在于寻找“高杠杆点”——即在最小技术构建下撬动最大工作量的环节,例如在保险理赔流程中仅检查材料完整性,而不自动决策。技术交付侧,搭建 50-100 例正确评估集(evals)被视为关键技能,Claude code sessions 的研究证实领域专家验证成功率是新手的两倍。文章提出了 30 天快速验证框架(分析-验证-构建-反馈),强调企业应放弃影子 AI 的散乱试验和漫长的咨询项目,转向受治理、主权可控的“方案优先”(Solution-First)模式。Ability.ai 推出的主权基础设施 Trinity 和托管代理运维服务,正试图让企业无需自招天价 FDE 也能获得同样的落地效果。文章最终落脚于治理与所有权:只有将领域知识、安全护栏与快速迭代工程结合,组织才能真正将通用 AI 转化为可度量的财务回报。

Read More

明略科技CEO谈FDE:12年前已研究,企业AI交付方式生变

明略科技CEO吴明辉在2026年世界机器人大会上表示,公司12年前已开始研究FDE(前线部署工程师)角色,并指出当前FDE需要比传统软件部署做得更深:既要将Agent接入真实业务,也要将现场能力沉淀回后台。2026年5月,OpenAI专门成立Deployment Company,将FDE派驻企业完成需求发现、系统设计、开发和上线;6月,Anthropic宣布与IT服务商DXC合作,计划培训数万名Claude认证FDE;8月18日,腾讯云将智能体开发平台AI应用工程师认证更名为ADP前沿部署工程师认证。这些动作指向企业AI落地的“最后一公里”问题。明略科技将原有营销智能、数据治理等能力转为Agentic Services交付,并拟取得普联软件控制权,将FDE和Agent基础设施带入其服务的石油石化、煤炭电力等大型集团客户。普联软件收入从2021年5.82亿元增至2025年8.25亿元,但净利率从2021年下滑超15个百分点至8.09%,呈现“越干越不赚钱”态势,Agent时代试图通过提高人效杠杆率来改变这一线性增长困局。实践层面,蒙牛已从28个事业部选拔约200名AI先行官,建立L1到L3认证体系,L3员工需具备搭Agent、理解业务需求并形成解决方案的能力;宁夏西鲜记总经理张立非用阿里AI编程工具Qoder三个多月搭出养殖管理系统,成本仅几万元,而外部定制方案报价曾达百万元级。文章认为FDE更像一条仍在移动的边界,岗位远未定型,Agent时代的企业AI市场正重新分工。

Read More

让AI应用在现实中发挥作用所需了解的知识

Andrew Ng在本文中系统阐述了构建和部署真实可用AI应用所需的核心技能体系,回应了AI工程化的关键挑战:如何在不可预测的AI组件之上构建可靠的软件系统。文章指出,AI应用与传统软件的本质区别在于LLM输出的不确定性,这使得开发过程成为高度迭代的“构建-检查-决策”循环,而非线性规划。核心技能分为六个维度:(1)LLM基础——理解分词、生成机制、上下文窗口、缓存命中、知识截止、推理强度、采样参数及工具调用等,以做出正确的模型选型和微调决策;(2)数据接地——超越早期RAG向量搜索,掌握向量索引、知识图谱、结构化数据语义层等多种技术,构建从文档(文本、PDF、HTML、图片)到LLM就绪输入的清洗管道;(3)智能体系统构建——涵盖从预定工作流到自主决策循环的架构光谱,涉及工具选择(MCP、CLI、沙箱执行环境)、记忆架构、长期会话上下文管理、多智能体编排及生产安全(护栏、对抗输入、数据外泄防范);(4)评估驱动开发——Andrew Ng认为这是区分AI工程师水平的最重要特质,需要结合系统轨迹分析、探索性数据分析与产品业务洞察来设计评估指标,并根据项目阶段选择确定性评估、LLM-as-a-Judge或人工评审等方法,形成驱动系统化迭代的闭环;(5)生产运维——由于不可预测性、成本和延迟的特殊性,需要建立可观测性机制跟踪性能、检测漂移、应对提示注入安全事件,并通过回归测试和CI/CD统计评估进行模型优化、蒸馏和工作流简化;(6)机器学习基础——理解监督学习和强化学习原理,掌握偏差/方差、错误分析、数据工程等核心心智框架。

Read More