LLM 量化部署实战:GPTQ 与 AWQ 方案深度解析
引言:量化是让大模型\”跑得动\”的关键
大模型的参数量动辄几十亿、上百亿,直接以 FP16 精度部署,显存需求巨大,普通硬件根本跑不动。例如,一个 7B 参数的模型,FP16 精度下需要约 14GB 显存;而 70B 参数的模型,则需要上百 GB 显存,远超单卡能力。
量化(Quantization)正是解决这一问题的核心技术。它通过降低数值精度,减少模型的显存占用和计算量,从而让大模型能在更低的硬件成本下高效运行。在众多量化方案中,GPTQ 和 AWQ 是当前最主流、应用最广泛的两条技术路线。本文将从原理到实战,深度解析这两大方案。
一、量化技术的基本原理
1.1 什么是量化
量化是将模型权重从高精度(如 FP16、FP32)转换为低精度(如 INT8、INT4)的过程。核心思想是:用更少的比特数表示数值,从而减少存储和计算开销。
1.2 量化的收益
- 显存占用降低:INT8 量化可将模型体积压缩至 25%,INT4 可进一步压缩。
-
- 推理速度提升:低精度计算更快,吞吐量可提升 3-5 倍。
-
- 成本降低:更低的硬件要求,更低的部署成本。<

