Ollama 是一款开源的本地部署大语言模型工具,它允许用户在无需依赖云端服务和算力的情况下,本地部署大语言模型。Ollama 使用 GGUF 存储格式的大语言模型,让用户在消费级硬件设备上部署大模型成为可能。本节教程将详细介绍如何在 Windows 环境下安装 Ollama 并部署 Qwen3 系列模型。

资源下载

1. Ollama下载与安装

  1. 在 Ollama 官网或网盘下载 Ollama 安装包。
  2. 双击下载的安装包,按照提示进行安装。
  3. 验证安装是否成功 在开始菜单处搜索cmd,打开命令行窗口,输入以下命令:
    ollama -v
    
    如果显示出 Ollama 的版本号,说明安装成功。

2. 本地部署大语言模型

2.1 下载模型

ollama run qwen3:0.6b

出现百分比显示时,说明qwen3:0.6b已经开始下载。

如下载过程较慢,可Ctrl+C中断下载,按键盘键继续下载直至下载完成。

解释说明:

  • ollama run:表示运行相应模型,当 Ollama 没有下载该模型则会自动执行模型下载,也可以使用 ollama pull qwen3:0.6b 下载

2.2 与大模型对话

当终端中出现send a message时,说明模型已经下载完毕,可以和它对话了:

与大模型对话示意图

常用命令

  • ollama list:列出所有已下载的模型
  • ollama run <model-name>:运行指定模型
  • ollama pull <model-name>:下载指定模型
  • ollama rm <model-name>:删除指定模型
  • ollama help:查看Ollama帮助文档
  • Ctrl+d:退出当前对话

3. 前端UI界面使用

你可以在状态栏左下角找到Ollama图标,点击后选择open ollama即可打开前端UI界面。这时你就可以在前端UI界面中与模型进行对话了。

4. Ollama 配置

4.1 常用环境变量

Ollama 提供了多个环境变量来控制运行行为,以下是最常用的配置项:

环境变量 作用 默认值 建议配置
OLLAMA_HOST 监听的网络地址,设为 0.0.0.0 可允许局域网访问 127.0.0.1(仅本机) 0.0.0.0(局域网访问)
OLLAMA_MODELS 模型文件的存储目录 C:\Users\用户名\.ollama\models 可指定到空间较大的磁盘,如 D:\ollama_models
OLLAMA_KEEP_ALIVE 模型加载后在内存中的保留时间,单位秒 300(5分钟) 0(用完立即释放)或 -1(一直保留)
OLLAMA_NUM_PARALLEL 同时处理的请求数量(需要支持并行处理的模型) 1 根据显存容量调整
OLLAMA_MAX_LOADED_MODELS 同时加载到内存的最大模型数量 1 显存充足可适当增大
OLLAMA_ORIGINS 允许跨域访问的来源地址,用于 Web 页面调用 localhost *(允许所有来源,需注意安全)

4.2 配置方法

配置环境变量的方法如下(以 OLLAMA_MODELS 为例):

  1. 点击任务栏中的搜索图标,输入环境变量,打开系统环境变量设置窗口。
  2. 点击"环境变量"按钮,在"系统变量"区域点击"新建"
  3. 输入变量名和变量值,例如 OLLAMA_MODELS = D:\ollama_models,依次点击"确定"保存。
  4. 重启 Ollama 服务,使环境变量生效。

修改 OLLAMA_MODELS 后,Ollama 会将新下载的模型存放到新目录。如果已有模型在旧目录,需要手动迁移过去。

ollama环境变量配置

5. 在其它UI应用中调用Ollama服务

5.1 下载 Cherry Studio

  1. 打开 Cherry Studio 官网,点击下载,即可下载 Cherry Studio 安装包
  2. 安装Cherry Studio,按照提示进行安装即可

5.2 在 Cherry Studio 中使用 Ollama Api 服务

  1. 打开Cherry Studio,点击左下角设置,进入设置页面
  2. 模型服务栏目中,搜索Ollama,在API 地址中填写http://localhost:11434 cherry-studio模型配置1
  3. 最下方两个按钮中,点击+ 添加,来添加新的模型:qwen3:0.6b cherry-studio模型配置2
  4. 打开右上角开关,即可保存设置
  5. 点击左上角对话,在上方状态栏中选择qwen3:0.6b,即可开始使用Ollama服务,与AI进行对话了 cherry-studio模型调用

6. 模型参数与量化规模说明

6.1 模型参数

我们下载的Qwen3:0.6b 模型参数量为 0.6B(即6亿个参数),这个参数量在中文大模型中属于较低水平。

一般而言,模型参数越大,模型的性能越好,但是模型的大小也会相应增加。所谓性能即表示模型在任务的表现能力,如在文本生成任务中,模型参数越多,生成的文本就越符合语法和逻辑。

另一个角度来看,模型参数越大对资源占用也会越大,在Ollama官网中,可以查看不同模型的参数占用情况。比如Qwen3:0.6b 模型参数占用为 523MB,这里的资源占用是指显存的占用情况

不同模型的参数量与显存占用情况

6.2 模型量化

在非特殊指令要求下,Ollama 默认下载模型的量化规模为 4 位。

与量化后的模型相对比的是全精度模型,LLM 的全精度一般为 FP16 或 FP32。量化数值越低,模型的资源占用越小,但是模型的性能也会相应下降。

需要说明的是,Ollama 运行的都是经过量化后的模型,而不是全精度模型。

7. 其它本地部署模型的方式

市面上有很多本地部署模型的方式,如 LM Studio、vLLM 等。大家可以根据自己的需求选择合适的方式进行部署。我们会在后续的教程中进行详细介绍。