text-generation-webui 本地部署配置
Oobabooga 开发的 Web UI,支持多种后端,图形化配置和对话
系统要求
| 项目 |
最低要求 |
推荐 |
| Python |
3.10+ |
3.11 |
| 内存 |
8 GB |
16 GB+ |
| GPU |
可选 |
NVIDIA RTX 3060+ |
| 磁盘 |
10 GB |
SSD 50 GB+ |
安装
一键安装
| Bash |
|---|
| git clone https://github.com/oobabooga/text-generation-webui
cd text-generation-webui
./start_linux.sh # Linux
./start_macos.sh # macOS
./start_windows.bat # Windows
|
手动安装
| Bash |
|---|
| conda create -n textgen python=3.11
conda activate textgen
pip install -r requirements.txt
python server.py
|
Docker
| Bash |
|---|
| docker run -d \
-p 7860:7860 \
-v $PWD/models:/app/models \
--gpus all \
oobabooga/text-generation-webui
|
支持的后端
| 后端 |
说明 |
模型格式 |
| llama.cpp |
默认推荐 |
GGUF |
| ExLlamaV2 |
高速推理 |
EXL2 |
| AutoGPTQ |
GPTQ 量化 |
GPTQ |
| HuggingFace Transformers |
通用 |
Safetensors |
| vLLM |
高吞吐 |
Safetensors |
使用流程
- 访问 http://localhost:7860
- Model 标签 → 下载模型(HuggingFace)
- 选择后端和模型
- Chat 标签 → 开始对话
- Parameters 标签 → 调整推理参数
关键参数
| 参数 |
说明 |
推荐值 |
| Temperature |
随机性 |
0.7 |
| Top P |
核采样 |
0.9 |
| Top K |
Top-K 采样 |
40 |
| Repetition Penalty |
重复惩罚 |
1.1 |
| Max New Tokens |
最大生成数 |
512 |
| Context Length |
上下文长度 |
4096 |
| GPU Memory |
GPU 显存限制 |
按卡设置 |
API 服务
| Bash |
|---|
| # 启动 API 模式
python server.py --api --listen
# 调用
curl http://localhost:5000/v1/chat/completions -d '{
"model": "qwen2.5-7b",
"messages": [{"role": "user", "content": "你好"}]
}'
|
Extensions 扩展
- SuperBooga — 超级文档检索(RAG)
- OpenAI API — 暴露 OpenAI 兼容接口
- Whisper STT — 语音输入
- Silero TTS — 语音输出
- Training — LoRA 微调
练习清单