AWQ

与「AWQ」相关的文章

共 2 篇文章

在 JetPack 7.2 上部署 TensorRT Edge-LLM

本指南来自 Seeed Studio Wiki,完整记录在 NVIDIA JetPack 7.2 上部署 TensorRT Edge-LLM v0.9.1 的流程。TensorRT Edge-LLM 是 NVIDIA 面向嵌入式 Jetson 平台的大语言模型、视觉语言模型和多模态模型推理栈,本版本于 2026 年 7 月 31 日更新,官方支持 Jetson Orin 和 Jetson Thor。部署分两阶段:首先在 x86 GPU 主机(Ubuntu 22.04/24.04、CUDA 12.x/13.x、Ampere 以上 GPU)上克隆 TensorRT Edge-LLM v0.9.1,通过 `tensorrt-edgellm-export` 将 Hugging Face 上的 Qwen3-0.6B 检查点导出为 ONNX 计算图;随后将 ONNX 目录传输至 Jetson 设备,在 JetPack 7.2 与 CUDA 13.2 工具链下,使用 CMake 以 `jetson-orin` 或 `jetson-thor` 为目标构建 C++ 运行时和示例,然后运行 `llm_build` 从 ONNX 构建 TensorRT 引擎,并通过 `llm_inference` 进行推理,输出示例显示模型成功回答“The capital of the United States is Washington, D.C.”。指南详细说明了 Jetson Orin 支持的精度仅为 FP16、INT8、INT4,不支持 FP8 等更高精度,并强调 JetPack 6.2 的引擎不可直接复用。对于 INT4 量化,推荐使用 AWQ 或 GPTQ 预量化检查点并采用外部化权重选项以降低内存压力。此外,还提供了基准测试命令、与 JetPack 6.2 的差异对比以及常见故障(如 CMake

阅读全文

Qwen3-32B本地部署实战:LoRA微调+vLLM推理+Docker交付

本文是一份针对阿里巴巴通义千问系列开源大模型 Qwen3-32B 的本地化工程部署与微调实战指南。文章围绕“LoRA 微调 + vLLM 推理 + Docker 容器化交付”这一技术路径,详细记录了从环境准备、模型下载与格式转换、Docker 镜像构建、vLLM 高性能推理服务上线、到基于 Swift 框架的 LoRA 领域微调及效果验证的完整流程。核心观点强调 Qwen3-32B 作为“甜点规模”模型,在 A100-80G 单卡上即可完成推理,双卡可实现高吞吐服务,且 MMLU、CMMLU 等评测稳居开源第一梯队。技术选型深度对比了 vLLM 与 TGI 的架构差异,指出 PagedAttention 机制使 32K 长文本推理显存占用比 TGI 低 58%,吞吐量高出 2.8 倍。在 LoRA 配置上,通过梯度分析锁定 q_proj 和 v_proj 为核心目标模块,并给出 balanced 方案(q_proj+v_proj+gate_proj+down_proj,rank=8)在显存占用 31.5GB 下实现 ROUGE-L 提升 4.1 的实测数据。文章还重点描述了 Docker 从零构建的可复现策略、应对冷启动的预热技巧、QWEN 官方 AWQ 量化加速方案,以及显存溢出、模型加载失败等血泪教训。本文面向面临模型本地化、业务定制与生产环境落地的工程师,提供了可复现、可迭代、可交付的完整工作流,具有极强的工程参考价值。

阅读全文