模型部署与调用

从 vLLM 多卡部署大语言模型到主流服务商 API 调用,带你一步步把大模型真正跑起来、用起来

大语言模型LLM服务商Api服务调用教程

本文将详细介绍如何获取主流大语言模型(LLM)服务商的 Api 服务,包括 DeepSeek、智谱 GLM 等平台的完整接入流程:在智谱 GLM API 服务站点注册登录后,进入个人中心的 Api Key 管理页面创建并复制 Api Key;在 DeepSeek API 开放平台完成账户充值后,于

2026-07-22 717 次阅读

Ollama本地部署大语言模型完整教程

Ollama 是一款开源的本地部署大语言模型工具,它允许用户在无需依赖云端服务和算力的情况下,本地部署大语言模型。Ollama 使用 GGUF 存储格式的大语言模型,让用户在消费级硬件设备上部署大模型成为可能。本教程详细介绍如何在 Windows 环境下安装 Ollama,并用 `ollama ru

2026-07-22 281 次阅读

LM Studio本地部署大语言模型完整教程

LM Studio是一个用于本地部署大语言模型的工具,在Windows环境下,LM Studio对AMD等非NVIDIA系列显卡的支持性更好,本文将详细介绍如何在Windows环境下安装LM Studio及本地部署大语言模型,并将其作为服务供外部应用调用。

2026-07-28 249 次阅读

PyTorch安装与版本选择问题详解

PyTorch是Meta AI(Facebook)开发的开源机器学习框架,基于Torch库,用于计算机视觉和自然语言处理等应用。正确选择PyTorch版本与CUDA版本的兼容性是深度学习环境配置中的关键环节,直接影响GPU加速性能和模型训练效率。

2026-08-02 250 次阅读

llama.cpp本地部署Qwen3.8大语言模型完整教程

llama.cpp 是一款基于 C/C++ 编写的开源大语言模型推理引擎,配合 GGUF 格式的量化模型,可以在消费级显卡上高效运行大语言模型。本教程使用 a4agent 一键安装包完成部署,它按显卡后端提供 CUDA 12.4、CUDA 13.3 与 Vulkan 三种预编译版本,并针对 8G 至

2026-08-20 919 次阅读

vLLM的安装与多卡部署大语言模型完整教程

vLLM是一个专为大规模语言模型设计的高性能推理库,由加州大学伯克利分校的研究团队开发。它通过PagedAttention、连续批处理和优化的CUDA内核等技术,显著提升了大语言模型的推理性能和内存运用效率,特别适合生产环境中的模型服务部署。

2026-07-22 349 次阅读