LM Studio是一个用于本地部署大语言模型的工具,在Windows环境下,LM Studio对AMD等非NVIDIA系列显卡的支持性更好,本文将详细介绍如何在Windows环境下安装LM Studio及本地部署大语言模型,并将其作为服务供外部应用调用。

前置教程

1. LM Studio下载与安装

  1. 打开LM Studio官网
  2. 点击右上角Download按钮,下载LM Studio安装包。
  3. 双击下载的安装包,按照提示进行安装。

2. LM Studio基本配置

  • 打开LM Studio,点击右下角齿轮按钮,进入设置界面。找到Language选项,选择简体中文,将界面语言切换为中文 LM Studio界面语言设置为简体中文
  • Model Defaults选项卡,将模型加载保护设置为宽松,以防止出现模型无法加载的情况 LM Studio模型加载保护设置为宽松
  • 在左侧列表项中选择Runtime,更新列出的运行时环境,确保为最新版本
  • 在右侧界面的运行时环境中,选择相应的运行时环境,本机以CUDA为例:
    • CUDA:如果你是NVIDIA显卡,且安装了CUDA驱动,选择CUDA运行时环境,以利用GPU加速模型推理
    • CPU:如果不是NVIDIA显卡,或不希望使用GPU加速,选择CPU运行时环境
    • ROCm:如果是AMD显卡,选择ROCm运行时环境,以利用GPU加速模型推理 LM Studio运行时环境选择界面

3. 下载模型

点击左侧上方第四个图标,在弹出的搜索框中输入模型名称,如Qwen3-0.6B-GGUF,点击download按钮。

一般默认下载Q4量化模型,若需要下载其他量化尺寸的模型,可点开模型列表项,按需选择:

LM Studio模型搜索与下载界面

说明:

  • 模型的尺寸尽量不要超过显存大小,否则会导致模型加载失败或输出速率过慢。
  • 尽量选择LM Studio官方量化的模型,以确保模型的质量和性能,一般为紫色背景,带有紫色机器人图标,供应商为lmstudio-community

4. 加载模型

  1. 点击LM Studio左侧机器人图标,点击上方状态栏的选择要加载的模型按钮,选择我们刚刚下载的Qwen3-0.6B,即可加载模型
  2. 加载完成后,点击New Chat按钮,即可创建一个新的聊天会话
  3. 点击上方的Eject按钮,即可卸载模型,释放显存资源

5. 调用模型API

点击左侧绿色命令行图标,将Status切换为Running,即可启动模型服务

Server Settings选项卡中,将所有开关全部打开,即可确保模型服务能够被局域网中的全部设备访问

LM Studio启动模型服务界面

6. Cherry Studio中调用模型服务

6.1 下载Cherry Studio

  1. 打开Cherry Studio官网,点击下载,即可下载Cherry Studio安装包
  2. 安装Cherry Studio,按照提示进行安装即可

6.2 配置服务

  1. 打开Cherry Studio,点击左下角设置图标,进入设置页面
  2. 模型服务栏目中,搜索LM Studio
  3. 在右侧点击获取模型列表,在弹窗中点击qwen3-0.6b右侧的+ Cherry Studio获取LM Studio模型列表
  4. 保存后即可与AI交互了