LM Studio是一个用于本地部署大语言模型的工具,在Windows环境下,LM Studio对AMD等非NVIDIA系列显卡的支持性更好,本文将详细介绍如何在Windows环境下安装LM Studio及本地部署大语言模型,并将其作为服务供外部应用调用。
前置教程
- Ollama的安装与使用教程,Ollama与LM Studio同为本地模型部署工具,对比学习可加深理解。
- vLLM的安装与多卡部署大语言模型完整教程,vLLM与LM Studio是不同场景下的模型推理方案。
1. LM Studio下载与安装
- 打开LM Studio官网
- 点击右上角
Download按钮,下载LM Studio安装包。 - 双击下载的安装包,按照提示进行安装。
2. LM Studio基本配置
- 打开LM Studio,点击右下角
齿轮按钮,进入设置界面。找到Language选项,选择简体中文,将界面语言切换为中文
Model Defaults选项卡,将模型加载保护设置为宽松,以防止出现模型无法加载的情况
- 在左侧列表项中选择
Runtime,更新列出的运行时环境,确保为最新版本 - 在右侧界面的运行时环境中,选择相应的运行时环境,本机以
CUDA为例:CUDA:如果你是NVIDIA显卡,且安装了CUDA驱动,选择CUDA运行时环境,以利用GPU加速模型推理CPU:如果不是NVIDIA显卡,或不希望使用GPU加速,选择CPU运行时环境ROCm:如果是AMD显卡,选择ROCm运行时环境,以利用GPU加速模型推理
3. 下载模型
点击左侧上方第四个图标,在弹出的搜索框中输入模型名称,如Qwen3-0.6B-GGUF,点击download按钮。
一般默认下载Q4量化模型,若需要下载其他量化尺寸的模型,可点开模型列表项,按需选择:

说明:
- 模型的尺寸尽量不要超过显存大小,否则会导致模型加载失败或输出速率过慢。
- 尽量选择LM Studio官方量化的模型,以确保模型的质量和性能,一般为紫色背景,带有紫色机器人图标,供应商为
lmstudio-community
4. 加载模型
- 点击LM Studio左侧
机器人图标,点击上方状态栏的选择要加载的模型按钮,选择我们刚刚下载的Qwen3-0.6B,即可加载模型 - 加载完成后,点击
New Chat按钮,即可创建一个新的聊天会话 - 点击上方的
Eject按钮,即可卸载模型,释放显存资源
5. 调用模型API
点击左侧绿色命令行图标,将Status切换为Running,即可启动模型服务
在Server Settings选项卡中,将所有开关全部打开,即可确保模型服务能够被局域网中的全部设备访问

6. Cherry Studio中调用模型服务
6.1 下载Cherry Studio
- 打开Cherry Studio官网,点击
下载,即可下载Cherry Studio安装包 - 安装Cherry Studio,按照提示进行安装即可
6.2 配置服务
- 打开Cherry Studio,点击左下角
设置图标,进入设置页面 - 在
模型服务栏目中,搜索LM Studio - 在右侧点击
获取模型列表,在弹窗中点击qwen3-0.6b右侧的+
- 保存后即可与AI交互了
举手提问