2026 年 8 月,DeepSeek 宣布其 v4 系列模型 API 价格上调约 3.5 倍,直接抬高了基于 DeepSeek API 的 Agent 开发与运行成本。本教程不讨论涨价本身,而是聚焦于一个实际问题:当官方 API 变贵之后,还有哪些可用的替代路径。我们将从商业中转、本地部署、免费预览 API、多模型切换四个维度,梳理一套可落地的成本控制方案。
前置教程
如想快速开始学习本教程,你可能需要先完成以下前置教程:
- 大语言模型LLM服务商Api服务调用教程,了解 API 调用的基本概念与鉴权方式,是理解本教程所有替代方案的基础。
- DeepSeek Harness 安装与使用教程,DeepSeek Harness 是本教程多模型切换方案的核心载体,需先掌握其安装与配置。
- Claude Code安装及配置国内大模型完整教程,Claude Code 同样支持多模型服务商切换,与本教程的 a4api 方案形成互补。
1. 涨价背景与替代思路
1.1 为什么需要替代方案
DeepSeek v4 系列涨价后,高频调用场景下的 API 成本显著上升。对于个人开发者、小团队以及以 Agent 为主要工作单元的场景,成本压力直接转化为对替代路径的需求。本教程梳理的四条路径,覆盖了从"完全免费"到"按量付费"的完整成本区间,读者可根据自身场景选择组合。


1.2 三条替代路径概览
| 路径 | 成本 | 延迟 | 适用场景 |
|---|---|---|---|
| 商业中转平台 | 按量付费(低于官方高峰价) | 中 | 临时降本、峰值分流 |
| 本地部署开源模型 | 免费(仅硬件成本) | 低 | 离线环境、长期稳定运行 |
| 免费预览 API | 免费 | 低-中 | 文档处理、工具调用等轻任务 |
2. 商业中转平台:CodingPlan
2.1 平台概述
CodingPlan 是一个面向 AI 编程场景的模型中转服务,提供 DeepSeek v4 Flash 等模型的 API 接入,价格低于 DeepSeek 官方高峰时段定价。其核心卖点是按订阅制提供额度,而非按 Token 单独计费,适合有稳定调用需求的用户。
2.2 价格与额度
以 5 美元首月套餐为例:
| 项目 | 数值 |
|---|---|
| 首月价格 | 5 美元 |
| 续订价格 | 10 美元/月 |
| 5 小时最大调用次数 | 7600 次 |
| 每周最大调用次数 | 18900 次 |
| 每月最大调用次数 | 37800 次 |
| 推理速度 | 约 70 tokens/s |
与 DeepSeek 官方高峰时段定价相比,等效调用成本约为官方的三分之一。对于以代码生成、调试为主的场景,该套餐的调用次数上限通常足够使用。

3. 本地部署:Qwen3.8-27B
3.1 方案概述
本地部署的核心优势是零边际成本——模型跑在自己的硬件上,不消耗任何 API 额度,也没有调用次数上限。对于有 GPU 资源的用户,这是长期成本最低的方案。
本教程以 Qwen3.8-27B 为例,该模型在代码能力与通用推理上与 DeepSeek v4 Flash 处于同一水平,且权重完全开源。
3.2 硬件要求与推理速度
| 项目 | 数值 |
|---|---|
| 模型格式 | GGUF(量化版) |
| 显存要求 | 16 GB + |
| 上下文长度 | 最高 128K |
| 推理速度 | 约 30 tokens/s |
详细部署步骤见 llama.cpp本地部署Qwen3.8大语言模型完整教程。该教程覆盖了 llama.cpp 的安装、模型下载、量化与推理服务启动的完整流程。
3.3 本地部署的取舍
本地部署并非适用于所有场景。其优势在于零成本、无网络依赖、数据不出本地;代价是需要 GPU 资源、推理速度受硬件限制(30 tokens/s 相比商业 API 有数量级差距),且需要自行维护模型更新。适合离线环境、敏感数据处理以及对延迟不敏感的批处理任务。
4. 免费预览 API:dots 平台
4.1 平台概述
dots(小红书 Dots Studio)在 2026 年 8 月推出了 dots3-note preview 模型的免费 API,面向注册用户开放。该模型为 280B 参数的 MoE 架构,上下文窗口 512K,推理速度约 110 tokens/s,目前完全免费且无调用次数限制。
4.2 能力特点与局限
| 维度 | 表现 |
|---|---|
| 文档处理 | 可完成,512K 上下文适合长文档 |
| 工具调用 | 可完成 |
| 代码能力 | 有待提升,不建议作为编程主力 |
| 多模态理解 | 支持 |
| 收费风险 | 预览版,随时可能转为收费 |
该方案的定位是临时替代:当 DeepSeek API 额度耗尽或成本过高时,可将文档处理、工具调用等轻任务分流至 dots 平台,代码生成等重度任务仍走主模型。预览版随时可能收费或调整策略,不宜作为长期唯一方案。
4.3 接入方式
详细模型解读见 小红书 dots3-note preview 开源与 API 上线。
5. 多模型一键切换:DeepSeek Harness + a4api
5.1 为什么需要多模型切换
前三种方案各自有适用边界:商业中转按量计费、本地部署依赖硬件、免费预览不稳定。在实际使用中,单一模型很难覆盖所有场景。更务实的做法是同时配置多个供应商,按任务类型和成本预算动态切换。
DeepSeek Harness(简称 dsh)原生支持近 40 家模型厂商的接入,可在会话级别随时切换模型与供应商,无需重启服务。a4api 则将这一能力扩展到桌面端,支持同时管理 DeepSeek Harness、Codex、Claude Code 等多个 Agent 应用的供应商配置。
5.2 DeepSeek Harness 配置切换
在 DeepSeek Harness 中,你可以直接在 web ui 中通过添加新的模型供应商的方式添加其他模型 Api 服务:

5.3 a4api 桌面管理
a4api 是一个 Windows 桌面应用,通过可视化界面统一读写多个 Agent 应用的配置文件(~/.claude/settings.json、DeepSeek Harness 配置等),实现多模型服务商的快速切换。其核心价值在于一处配置,多处生效——在 a4api 中切换供应商后,所有接入的 Agent 应用同步更新。
a4api 首页与供应商配置界面:

项目地址:
- 文档:a4api安装与使用教程
- GitHub:a4api github 开源仓库地址
- 下载:a4api下载地址
6. 方案组合建议
6.1 按场景选择
不同使用场景适合不同的方案组合:
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 日常编程为主 | CodingPlan 订阅 | 成本可控,调用次数充足 |
| 有 GPU 资源 | 本地部署 Qwen3.8-27B | 零边际成本,长期最省 |
| API 额度偶尔用完 | dots 免费预览 | 临时分流,零成本 |
| 多 Agent 协作 | a4api + Harness | 一处切换,全局生效 |
| 成本敏感 + 无 GPU | CodingPlan + dots 组合 | 低成本覆盖主要场景 |
6.2 风险提示
在组合使用多种替代方案时,需注意以下几点:
- 免费预览 API 的稳定性:dots 平台当前免费,但预览版随时可能收费或调整策略,不宜将关键工作流绑定其上。
- 本地部署的硬件门槛:Qwen3.8-27B 需要约 16 GB 显存,无合适 GPU 的用户无法使用该方案。
- 商业中转的价格变动:CodingPlan 等中转平台的价格与额度政策可能随时调整,订阅前建议确认最新条款。
- 多供应商的管理成本:同时维护多个供应商的 API Key 与配置,需注意 Key 安全与配置一致性。
举手提问