Ollama 是一款开源的本地部署大语言模型工具,它允许用户在无需依赖云端服务和算力的情况下,本地部署大语言模型。Ollama 使用 GGUF 存储格式的大语言模型,让用户在消费级硬件设备上部署大模型成为可能。本节教程将详细介绍如何在 Windows 环境下安装 Ollama 并部署 Qwen3 系列模型。
资源下载
- Ollama安装包官网下载地址
- Ollama安装包网盘下载地址- 解决网络环境不佳下载过慢的问题
1. Ollama下载与安装
- 在 Ollama 官网或网盘下载 Ollama 安装包。
- 双击下载的安装包,按照提示进行安装。
- 验证安装是否成功
在
开始菜单处搜索cmd,打开命令行窗口,输入以下命令:如果显示出 Ollama 的版本号,说明安装成功。ollama -v
2. 本地部署大语言模型
2.1 下载模型
ollama run qwen3:0.6b
出现百分比显示时,说明qwen3:0.6b已经开始下载。
如下载过程较慢,可Ctrl+C中断下载,按键盘↑键继续下载直至下载完成。
解释说明:
ollama run:表示运行相应模型,当 Ollama 没有下载该模型则会自动执行模型下载,也可以使用ollama pull qwen3:0.6b下载
2.2 与大模型对话
当终端中出现send a message时,说明模型已经下载完毕,可以和它对话了:

常用命令:
ollama list:列出所有已下载的模型ollama run <model-name>:运行指定模型ollama pull <model-name>:下载指定模型ollama rm <model-name>:删除指定模型ollama help:查看Ollama帮助文档Ctrl+d:退出当前对话
3. 前端UI界面使用
你可以在状态栏左下角找到Ollama图标,点击后选择open ollama即可打开前端UI界面。这时你就可以在前端UI界面中与模型进行对话了。
4. Ollama 配置
4.1 常用环境变量
Ollama 提供了多个环境变量来控制运行行为,以下是最常用的配置项:
| 环境变量 | 作用 | 默认值 | 建议配置 |
|---|---|---|---|
OLLAMA_HOST |
监听的网络地址,设为 0.0.0.0 可允许局域网访问 |
127.0.0.1(仅本机) |
0.0.0.0(局域网访问) |
OLLAMA_MODELS |
模型文件的存储目录 | C:\Users\用户名\.ollama\models |
可指定到空间较大的磁盘,如 D:\ollama_models |
OLLAMA_KEEP_ALIVE |
模型加载后在内存中的保留时间,单位秒 | 300(5分钟) |
0(用完立即释放)或 -1(一直保留) |
OLLAMA_NUM_PARALLEL |
同时处理的请求数量(需要支持并行处理的模型) | 1 |
根据显存容量调整 |
OLLAMA_MAX_LOADED_MODELS |
同时加载到内存的最大模型数量 | 1 |
显存充足可适当增大 |
OLLAMA_ORIGINS |
允许跨域访问的来源地址,用于 Web 页面调用 | localhost |
*(允许所有来源,需注意安全) |
4.2 配置方法
配置环境变量的方法如下(以 OLLAMA_MODELS 为例):
- 点击任务栏中的搜索图标,输入
环境变量,打开系统环境变量设置窗口。 - 点击"环境变量"按钮,在"系统变量"区域点击"新建"。
- 输入变量名和变量值,例如
OLLAMA_MODELS=D:\ollama_models,依次点击"确定"保存。 - 重启 Ollama 服务,使环境变量生效。
修改
OLLAMA_MODELS后,Ollama 会将新下载的模型存放到新目录。如果已有模型在旧目录,需要手动迁移过去。

5. 在其它UI应用中调用Ollama服务
5.1 下载 Cherry Studio
- 打开 Cherry Studio 官网,点击
下载,即可下载 Cherry Studio 安装包 - 安装Cherry Studio,按照提示进行安装即可
5.2 在 Cherry Studio 中使用 Ollama Api 服务
- 打开Cherry Studio,点击左下角
设置,进入设置页面 - 在
模型服务栏目中,搜索Ollama,在API 地址中填写http://localhost:11434
- 最下方两个按钮中,点击
+ 添加,来添加新的模型:qwen3:0.6b
- 打开右上角开关,即可保存设置
- 点击左上角
对话,在上方状态栏中选择qwen3:0.6b,即可开始使用Ollama服务,与AI进行对话了
6. 模型参数与量化规模说明
6.1 模型参数
我们下载的Qwen3:0.6b 模型参数量为 0.6B(即6亿个参数),这个参数量在中文大模型中属于较低水平。
一般而言,模型参数越大,模型的性能越好,但是模型的大小也会相应增加。所谓性能即表示模型在任务的表现能力,如在文本生成任务中,模型参数越多,生成的文本就越符合语法和逻辑。
另一个角度来看,模型参数越大对资源占用也会越大,在Ollama官网中,可以查看不同模型的参数占用情况。比如Qwen3:0.6b 模型参数占用为 523MB,这里的资源占用是指显存的占用情况。

6.2 模型量化
在非特殊指令要求下,Ollama 默认下载模型的量化规模为 4 位。
与量化后的模型相对比的是全精度模型,LLM 的全精度一般为 FP16 或 FP32。量化数值越低,模型的资源占用越小,但是模型的性能也会相应下降。
需要说明的是,Ollama 运行的都是经过量化后的模型,而不是全精度模型。
7. 其它本地部署模型的方式
市面上有很多本地部署模型的方式,如 LM Studio、vLLM 等。大家可以根据自己的需求选择合适的方式进行部署。我们会在后续的教程中进行详细介绍。
举手提问