跳转至

模型优化

量化 / 剪枝 / 蒸馏 / 稀疏化

量化方法对比

方法 精度 显存节省 速度 质量损失 链接
GGUF (llama.cpp) INT4/INT8 https://github.com/ggerganov/llama.cpp
GPTQ INT4 https://github.com/AutoGPTQ/AutoGPTQ
AWQ INT4 https://github.com/casper-hansen/AutoAWQ
SmoothQuant W8A8
FP8 E4M3/E5M2

知识蒸馏

  • Teacher-Student 范式
  • 软标签蒸馏(KL 散度)
  • 任务蒸馏:大模型 → 小模型

剪枝与稀疏化

  • 非结构化剪枝:单个权重置零
  • 结构化剪枝:移除整个通道/头
  • Wanda / SparseGPT — LLM 一次性剪枝

练习

  • 用 AutoGPTQ 将模型量化为 INT4,对比精度
  • 用 llama.cpp GGUF 量化部署,测试推理速度
  • 用 AWQ 量化,对比 GPTQ 效果

资源

资源 链接
AutoGPTQ https://github.com/AutoGPTQ/AutoGPTQ
AutoAWQ https://github.com/casper-hansen/AutoAWQ
llama.cpp 量化文档 https://github.com/ggerganov/llama.cpp/blob/master/examples/quantize/README.md