跳转至

text-generation-webui 本地部署配置

Oobabooga 开发的 Web UI,支持多种后端,图形化配置和对话


系统要求

项目 最低要求 推荐
Python 3.10+ 3.11
内存 8 GB 16 GB+
GPU 可选 NVIDIA RTX 3060+
磁盘 10 GB SSD 50 GB+

安装

一键安装

Bash
1
2
3
4
5
git clone https://github.com/oobabooga/text-generation-webui
cd text-generation-webui
./start_linux.sh  # Linux
./start_macos.sh  # macOS
./start_windows.bat  # Windows

手动安装

Bash
1
2
3
4
conda create -n textgen python=3.11
conda activate textgen
pip install -r requirements.txt
python server.py

Docker

Bash
1
2
3
4
5
docker run -d \
  -p 7860:7860 \
  -v $PWD/models:/app/models \
  --gpus all \
  oobabooga/text-generation-webui

支持的后端

后端 说明 模型格式
llama.cpp 默认推荐 GGUF
ExLlamaV2 高速推理 EXL2
AutoGPTQ GPTQ 量化 GPTQ
HuggingFace Transformers 通用 Safetensors
vLLM 高吞吐 Safetensors

使用流程

  1. 访问 http://localhost:7860
  2. Model 标签 → 下载模型(HuggingFace)
  3. 选择后端和模型
  4. Chat 标签 → 开始对话
  5. Parameters 标签 → 调整推理参数

关键参数

参数 说明 推荐值
Temperature 随机性 0.7
Top P 核采样 0.9
Top K Top-K 采样 40
Repetition Penalty 重复惩罚 1.1
Max New Tokens 最大生成数 512
Context Length 上下文长度 4096
GPU Memory GPU 显存限制 按卡设置

API 服务

Bash
1
2
3
4
5
6
7
8
# 启动 API 模式
python server.py --api --listen

# 调用
curl http://localhost:5000/v1/chat/completions -d '{
  "model": "qwen2.5-7b",
  "messages": [{"role": "user", "content": "你好"}]
}'

Extensions 扩展

  • SuperBooga — 超级文档检索(RAG)
  • OpenAI API — 暴露 OpenAI 兼容接口
  • Whisper STT — 语音输入
  • Silero TTS — 语音输出
  • Training — LoRA 微调

练习清单

  • 安装 text-generation-webui
  • 下载 GGUF 模型,切换后端测试
  • 调整参数对比生成效果
  • 开启 API 模式,用 Python 调用
  • 安装并使用一个 Extension