跳转至

服务化

Go 网关 / 负载均衡 / 流式输出 / 监控 / CI/CD

架构设计

Text Only
1
2
3
4
5
6
7
Client → Go API Gateway → 后端推理实例集群
        负载均衡 / 限流 / 缓存
        流式代理 (SSE / WebSocket)
        Prometheus + Grafana 监控

Go 推理网关

  • 限流 — Token 速率限制 / 请求频率限制
  • 流式代理 — SSE 流式转发,打字机效果
  • 请求合并 — Continuous Batching 前端适配
  • 缓存 — 相同 Prompt 结果缓存(语义缓存)
  • 模型路由 — 根据复杂度路由到不同模型

监控与可观测性

  • 指标 — QPS / 延迟 P50/P95/P99 / Token 吞 / GPU 利用率
  • 日志 — 请求日志 / 模型输出日志 / 错误追踪
  • 告警 — 延迟飙升 / 错误率上升 / GPU OOM
  • 工具 — Prometheus + Grafana / OpenTelemetry

安全

  • Prompt 注入防御
  • 内容审核 / 敏感信息脱敏
  • API Key 管理 / 速率限制
  • 数据合规(国内模型备案)

CI/CD

  • Prompt 版本管理 + A/B 测试
  • 模型迭代:自动评估 → 灰度发布
  • 输出质量回归测试

练习

  • 用 Go 实现 SSE 流式代理
  • 用 Go 实现推理服务负载均衡
  • 部署 Prometheus + Grafana 监控推理服务

资源

资源 链接
go-onnxruntime https://github.com/yalue/onnxruntime_go
Ollama (Go 实现) https://github.com/ollama/ollama
Prometheus https://prometheus.io/
Grafana https://grafana.com/