模型部署与调用
从 vLLM 多卡部署大语言模型到主流服务商 API 调用,带你一步步把大模型真正跑起来、用起来
vLLM的安装与多卡部署大语言模型完整教程
vLLM是一个专为大规模语言模型设计的高性能推理库,由加州大学伯克利分校的研究团队开发。它通过PagedAttention、连续批处理和优化的CUDA内核等技术,显著提升了大语言模型的推理性能和内存运用效率,特别适合生产环境中的模型服务部署。
OpenAI兼容API的概念与用法详解
本教程全面解析OpenAI兼容API的技术原理和实际应用,详细介绍对话接口、文本向量化、语音处理等核心功能。通过系统化的API调用指南和实战案例,帮助开发者高效灵活地构建多模态AI应用。
TTS模型服务调用与本地部署教程
本教程系统讲解文本转语音(TTS)技术,详细介绍两款主流 TTS 方案:免费在线的 edge-tts 与开源本地的 IndexTTS-2.5。通过完整示例项目 a4voice,你将学会用 Python 调用两种 TTS 引擎,将两者封装为 OpenAI 兼容的 `/v1/audio/
ASR模型本地部署与服务调用教程
本教程系统讲解自动语音识别(ASR)技术,详细介绍 OpenMOSS 团队开源的端到端语音转写模型 MOSS-Transcribe-Diarize 0.9B 及其 vLLM 高性能部署方案。通过完整示例项目 voice2text,你将学会在 WSL2 中用 vLLM 部署该模型,用 Fast
本地图像与视频生成模型部署与调用教程
本教程系统讲解如何在消费级硬件(Windows 11 系统、16GB 可用内存、8GB 或 16GB 可用显存)上,通过开源推理框架 diffusers 部署图像生成模型(SDXL / SD1.5)与视频生成模型(LTX-Video / Wan2.1),并使用 Python 代码完成
ComfyUI本地部署MiniMax H3消费级显卡文生视频、图生视频教程
本教程系统讲解如何在消费级 NVIDIA 显卡(12GB / 16GB 显存)上,通过 ComfyUI 节点式界面本地部署 MiniMax H3 全模态视频生成模型,完成文生视频(T2V)与图生视频(I2V)两大核心场景。教程将先梳理 H3 的模型变体与核心架构,再逐步完成