模型优化¶
量化 / 剪枝 / 蒸馏 / 稀疏化
量化方法对比¶
| 方法 | 精度 | 显存节省 | 速度 | 质量损失 | 链接 |
|---|---|---|---|---|---|
| GGUF (llama.cpp) | INT4/INT8 | 大 | 快 | 小 | https://github.com/ggerganov/llama.cpp |
| GPTQ | INT4 | 大 | 中 | 中 | https://github.com/AutoGPTQ/AutoGPTQ |
| AWQ | INT4 | 大 | 快 | 小 | https://github.com/casper-hansen/AutoAWQ |
| SmoothQuant | W8A8 | 中 | 快 | 小 | — |
| FP8 | E4M3/E5M2 | 中 | 快 | 小 | — |
知识蒸馏¶
- Teacher-Student 范式
- 软标签蒸馏(KL 散度)
- 任务蒸馏:大模型 → 小模型
剪枝与稀疏化¶
- 非结构化剪枝:单个权重置零
- 结构化剪枝:移除整个通道/头
- Wanda / SparseGPT — LLM 一次性剪枝
练习¶
- 用 AutoGPTQ 将模型量化为 INT4,对比精度
- 用 llama.cpp GGUF 量化部署,测试推理速度
- 用 AWQ 量化,对比 GPTQ 效果
资源¶
| 资源 | 链接 |
|---|---|
| AutoGPTQ | https://github.com/AutoGPTQ/AutoGPTQ |
| AutoAWQ | https://github.com/casper-hansen/AutoAWQ |
| llama.cpp 量化文档 | https://github.com/ggerganov/llama.cpp/blob/master/examples/quantize/README.md |