跳转至

LM Studio 本地部署配置

图形化本地 LLM 运行工具,零代码上手,适合非技术用户和快速原型验证

  • 官网:https://lmstudio.ai/
  • 语言:TypeScript/Electron + C++ 后端
  • 许可证:免费(非开源)

系统要求

项目 最低要求 推荐
操作系统 Windows 10+ / macOS 12+ / Linux
内存 8 GB 16 GB+
GPU 可选 NVIDIA RTX 3060+ / Apple Silicon
磁盘 10 GB SSD 50 GB+

安装

  1. 访问 https://lmstudio.ai/
  2. 下载对应平台安装包
  3. 安装并启动

使用流程

1. 搜索与下载模型

  • 打开 LM Studio → 左侧 Search 标签
  • 搜索模型名(如 Qwen2.5-7B-Instruct
  • 选择 GGUF 量化版本下载
  • 推荐:Q4_K_M(默认平衡)、Q5_K_M(更高质量)

2. 对话

  • 左侧 Chat 标签
  • 顶部选择已下载的模型
  • 开始对话

3. 调整参数

参数 说明 推荐值
Temperature 随机性 0.7(创作)/ 0.2(精确)
Top P 核采样 0.9
Context Length 上下文长度 4096
GPU Offload GPU 层数 最大(全 GPU)

4. 本地 API 服务

  • 左侧 Local Server 标签
  • 点击 Start Server
  • 默认地址:http://localhost:1234/v1
  • 兼容 OpenAI API 格式

API 调用

Bash
# Chat Completions
curl http://localhost:1234/v1/chat/completions -d '{
  "model": "qwen2.5-7b-instruct",
  "messages": [{"role": "user", "content": "你好"}],
  "temperature": 0.7,
  "stream": true
}'

# Completions
curl http://localhost:1234/v1/completions -d '{
  "model": "qwen2.5-7b-instruct",
  "prompt": "用Python写快排:",
  "max_tokens": 512
}'

# Embeddings
curl http://localhost:1234/v1/embeddings -d '{
  "model": "text-embedding",
  "input": "你好世界"
}'

Python 调用

Python
import openai

client = openai.OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio"
)

response = client.chat.completions.create(
    model="qwen2.5-7b-instruct",
    messages=[{"role": "user", "content": "你好"}],
    stream=True
)
for chunk in response:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

高级配置

模型目录

默认下载到 ~/.cache/lm-studio/models/,可在设置中修改。

硬件设置

  • GPU Offload Layers:设为最大以全 GPU 推理
  • Context Length:按需设置,越大越吃显存
  • Thread Count:CPU 线程数,一般设为物理核心数

系统提示词

在 Chat 界面的 System Prompt 区域输入系统级指令。


优势与局限

优势

  • 零代码,图形界面友好
  • 自动检测硬件并优化配置
  • 内置模型搜索和下载
  • 兼容 OpenAI API

局限

  • 非开源,无法自定义后端
  • 性能略低于 llama.cpp / vLLM
  • 不适合高并发生产部署
  • 仅支持 GGUF 格式

练习清单

  • 安装 LM Studio,下载 Qwen2.5-7B-GGUF
  • 完成一次对话,调整 Temperature 观察差异
  • 启动 Local Server,用 Python OpenAI SDK 调用
  • 测试不同量化版本的质量差异