AI芯片

Articles tagged "AI芯片"

2 articles in total

边缘端LLM卸载故事:Synaptics Torq™如何实现高效Gemma™推理

本文探讨了Synaptics公司与Google Research合作,在其Astra SL2610产品线中集成Torq NPU,以高效运行Google的Gemma 3 270M大语言模型的边缘推理解决方案。文章指出,边缘设备部署LLM面临动态执行、激活函数算力消耗高和内存带宽三大瓶颈,标准CPU和普通NPU难以高效应对。为此,Torq NPU采用了三项核心技术支柱:第一,通过静态模型转换将动态计算图预分配为静态张量,确保硬件利用率和执行可预测性;第二,基于硬件优化的查找表(LUT)和线性插值加速GELU和Softmax激活函数,分别实现10倍和12.5倍的推理加速;第三,采用感知敏感度的混合精度权重量化策略,将84%的层压缩至4-bit精度,关键层保留8-bit,平均位宽降至4.3 bits,在保持模型精度的同时提升2.7倍有效吞吐量。综合三项优化,Torq NPU使Gemma 3推理速度整体提升3.5倍,实现了数据隐私、离线可靠、低延迟和低成本的边缘AI优势。该技术适用于IoT边缘AI处理器,支持离线语言翻译、工具调用和文档摘要等应用场景。

Read More

推理成本砍掉一半以上,OpenAI摸着DeepSeek过河

2026年7月2日,36氪旗下“字母AI”报道,OpenAI正通过系统优化方案将模型推理成本降低超过一半,这一方案主要是受DeepSeek在KV cache压缩上的经验启发。援引外媒消息称,OpenAI在内存效率方面取得重大突破,来自一个从OpenAI剥离出的团队,其核心优化方向是KV cache的改进。KV cache是模型生成时存放前文“笔记”的热数据,必须存放在高带宽存储器HBM中,是推理成本的关键。OpenAI此前在2024年10月已通过Prompt Caching机制降低延迟和输入成本,而DeepSeek早在2024年5月便在DeepSeek-V2中通过Multi-head Latent Attention(MLA)将KV cache压缩了93.3%,提升吞吐量至5.76倍。文章进一步分析了HBM与KV cache的关系,指出虽然单请求HBM需求可能下降,但总需求未必下降,因为推理成本下降后厂商会去追求更长上下文和更高并发。在硬件层面,OpenAI已推出自研AI芯片Jalapeño,并已与Cerebras签订超100亿美元推理算力协议。文章强调,OpenAI年亏损209亿美元,正通过“软件+硬件”双路径全力降低推理成本,为上市铺路。这些举措将深刻影响大模型推理架构竞争格局。

Read More