跳转至

系统部署与推理

第五阶段:模型优化 + 推理引擎 + 服务化

子目录

学习目标

  • 理解 INT4/INT8 量化原理,部署量化模型
  • 用 llama.cpp 部署本地 7B 模型,提供 HTTP 服务
  • 用 vLLM 部署高吞吐推理服务
  • 用 Go 实现推理网关(限流 + 流式代理)

推荐资源

资源 链接
llama.cpp https://github.com/ggerganov/llama.cpp
vLLM https://github.com/vllm-project/vllm
Ollama https://github.com/ollama/ollama
TensorRT 指南 https://docs.nvidia.com/deeplearning/tensorrt/