LLM 量化方法对比与内存估算
对比三种主流 LLM 权重量化方案 —— GPTQ、AWQ、GGUF —— 的算法思路、硬件适配、速度质量权衡,并给出基于参数量和量化级别的模型内存需求估算公式与常见硬件选型参考。
Summary
文档将 GPTQ、AWQ、GGUF 三个方案从九个维度进行并列比较:
- 算法:GPTQ 基于 OBQ 误差补偿;AWQ 采用激活感知方式保护重要权重;GGUF 使用 k-means 聚类实现混合精度。
- 硬件与速度:GPTQ / AWQ 仅支持 NVIDIA GPU + CUDA,GPU 推理速度 GPTQ 最快、AWQ 次之,但不支持 CPU;GGUF 支持 CPU、GPU 和 Apple Silicon,是 CPU 场景的唯一实用选择。
- 质量与格式:AWQ 量化质量最高,GPTQ 与 GGUF 中等;GPTQ / AWQ 输出多文件,GGUF 为单文件,消费级使用更友好。
- 生态:vLLM 支持 GPTQ、原生支持 AWQ,GGUF 仅有限支持;长上下文表现 AWQ 较好。
内存估算采用经验公式:
模型内存需求 ≈ 参数量 × 每参数字节数 × 1.2
其中 1.2 为覆盖 KV 缓存及临时空间的 overhead 系数。据此给出 7B/13B/70B 在 Q4_K_M(约 0.5 字节/参数)和 Q8_0(1 字节/参数)下的内存需求表(如 7B Q4_K_M 约 4.2 GB,70B Q4_K_M 约 42 GB)。
结合常见硬件给出了实际选型建议:16 GB 统一内存的 Mac 可流畅跑 7B Q4_K_M;24 GB 设备可舒适运行 13B Q4_K_M;48/64 GB 设备可勉强或流畅运行 70B Q4_K_M;RTX 4090 24 GB 显存只适合 13B 以下,70B 需 CPU-GPU 混合推理;纯 CPU 只能用 GGUF,7B Q4_K_M 最实用。同时强调实际可用空间约为标称容量的 60–70%,不宜贴上限选型。
Key Claims
- GPU 推理场景首选 GPTQ 或 AWQ,AWQ 在质量和长上下文上更优,且得到 vLLM 原生支持。
- CPU 与 Apple Silicon 场景只适合 GGUF,其单文件分发和统一内存优势明显。
- 模型内存需求可按
参数量 × 每参数字节数 × 1.2快速估算,实际可用容量需在硬件标称容量基础上保留 30–40% 余量。 - Apple 统一内存架构省去 CPU/GPU 数据复制,运行 GGUF 时的内存利用率高于传统 CPU + 独显方案。
Suggested Links
- GPTQ
- AWQ
- GGUF
- vLLM