LM Studio 本地部署配置¶
图形化本地 LLM 运行工具,零代码上手,适合非技术用户和快速原型验证
- 官网:https://lmstudio.ai/
- 语言:TypeScript/Electron + C++ 后端
- 许可证:免费(非开源)
系统要求¶
| 项目 | 最低要求 | 推荐 |
|---|---|---|
| 操作系统 | Windows 10+ / macOS 12+ / Linux | — |
| 内存 | 8 GB | 16 GB+ |
| GPU | 可选 | NVIDIA RTX 3060+ / Apple Silicon |
| 磁盘 | 10 GB | SSD 50 GB+ |
安装¶
- 访问 https://lmstudio.ai/
- 下载对应平台安装包
- 安装并启动
使用流程¶
1. 搜索与下载模型¶
- 打开 LM Studio → 左侧 Search 标签
- 搜索模型名(如
Qwen2.5-7B-Instruct) - 选择 GGUF 量化版本下载
- 推荐:Q4_K_M(默认平衡)、Q5_K_M(更高质量)
2. 对话¶
- 左侧 Chat 标签
- 顶部选择已下载的模型
- 开始对话
3. 调整参数¶
| 参数 | 说明 | 推荐值 |
|---|---|---|
| Temperature | 随机性 | 0.7(创作)/ 0.2(精确) |
| Top P | 核采样 | 0.9 |
| Context Length | 上下文长度 | 4096 |
| GPU Offload | GPU 层数 | 最大(全 GPU) |
4. 本地 API 服务¶
- 左侧 Local Server 标签
- 点击 Start Server
- 默认地址:
http://localhost:1234/v1 - 兼容 OpenAI API 格式
API 调用¶
Python 调用¶
高级配置¶
模型目录¶
默认下载到 ~/.cache/lm-studio/models/,可在设置中修改。
硬件设置¶
- GPU Offload Layers:设为最大以全 GPU 推理
- Context Length:按需设置,越大越吃显存
- Thread Count:CPU 线程数,一般设为物理核心数
系统提示词¶
在 Chat 界面的 System Prompt 区域输入系统级指令。
优势与局限¶
优势¶
- 零代码,图形界面友好
- 自动检测硬件并优化配置
- 内置模型搜索和下载
- 兼容 OpenAI API
局限¶
- 非开源,无法自定义后端
- 性能略低于 llama.cpp / vLLM
- 不适合高并发生产部署
- 仅支持 GGUF 格式
练习清单¶
- 安装 LM Studio,下载 Qwen2.5-7B-GGUF
- 完成一次对话,调整 Temperature 观察差异
- 启动 Local Server,用 Python OpenAI SDK 调用
- 测试不同量化版本的质量差异