系统部署与推理¶
第五阶段:模型优化 + 推理引擎 + 服务化
子目录¶
- 模型优化 — 量化 / 剪枝 / 蒸馏
- 推理引擎 — llama.cpp / vLLM / TensorRT / ONNX Runtime
- 服务化 — Go 网关 / 负载均衡 / 流式输出 / 监控
- 本地大模型部署(顶层) — Ollama / llama.cpp / vLLM / LM Studio
学习目标¶
- 理解 INT4/INT8 量化原理,部署量化模型
- 用 llama.cpp 部署本地 7B 模型,提供 HTTP 服务
- 用 vLLM 部署高吞吐推理服务
- 用 Go 实现推理网关(限流 + 流式代理)
推荐资源¶
| 资源 | 链接 |
|---|---|
| llama.cpp | https://github.com/ggerganov/llama.cpp |
| vLLM | https://github.com/vllm-project/vllm |
| Ollama | https://github.com/ollama/ollama |
| TensorRT 指南 | https://docs.nvidia.com/deeplearning/tensorrt/ |