2026 年 8 月,DeepSeek 宣布其 v4 系列模型 API 价格上调约 3.5 倍,直接抬高了基于 DeepSeek API 的 Agent 开发与运行成本。本教程不讨论涨价本身,而是聚焦于一个实际问题:当官方 API 变贵之后,还有哪些可用的替代路径。我们将从商业中转、本地部署、免费预览 API、多模型切换四个维度,梳理一套可落地的成本控制方案。

前置教程

如想快速开始学习本教程,你可能需要先完成以下前置教程:

1. 涨价背景与替代思路

1.1 为什么需要替代方案

DeepSeek v4 系列涨价后,高频调用场景下的 API 成本显著上升。对于个人开发者、小团队以及以 Agent 为主要工作单元的场景,成本压力直接转化为对替代路径的需求。本教程梳理的四条路径,覆盖了从"完全免费"到"按量付费"的完整成本区间,读者可根据自身场景选择组合。

ds价格上涨前消费截图

ds价格上涨后消费截图

1.2 三条替代路径概览

路径 成本 延迟 适用场景
商业中转平台 按量付费(低于官方高峰价) 临时降本、峰值分流
本地部署开源模型 免费(仅硬件成本) 离线环境、长期稳定运行
免费预览 API 免费 低-中 文档处理、工具调用等轻任务

2. 商业中转平台:CodingPlan

2.1 平台概述

CodingPlan 是一个面向 AI 编程场景的模型中转服务,提供 DeepSeek v4 Flash 等模型的 API 接入,价格低于 DeepSeek 官方高峰时段定价。其核心卖点是按订阅制提供额度,而非按 Token 单独计费,适合有稳定调用需求的用户。

2.2 价格与额度

以 5 美元首月套餐为例:

项目 数值
首月价格 5 美元
续订价格 10 美元/月
5 小时最大调用次数 7600 次
每周最大调用次数 18900 次
每月最大调用次数 37800 次
推理速度 约 70 tokens/s

与 DeepSeek 官方高峰时段定价相比,等效调用成本约为官方的三分之一。对于以代码生成、调试为主的场景,该套餐的调用次数上限通常足够使用。

opencodego价格表

opencodego的注册地址

3. 本地部署:Qwen3.8-27B

3.1 方案概述

本地部署的核心优势是零边际成本——模型跑在自己的硬件上,不消耗任何 API 额度,也没有调用次数上限。对于有 GPU 资源的用户,这是长期成本最低的方案。

本教程以 Qwen3.8-27B 为例,该模型在代码能力与通用推理上与 DeepSeek v4 Flash 处于同一水平,且权重完全开源。

3.2 硬件要求与推理速度

项目 数值
模型格式 GGUF(量化版)
显存要求 16 GB +
上下文长度 最高 128K
推理速度 约 30 tokens/s

详细部署步骤见 llama.cpp本地部署Qwen3.8大语言模型完整教程。该教程覆盖了 llama.cpp 的安装、模型下载、量化与推理服务启动的完整流程。

3.3 本地部署的取舍

本地部署并非适用于所有场景。其优势在于零成本、无网络依赖、数据不出本地;代价是需要 GPU 资源、推理速度受硬件限制(30 tokens/s 相比商业 API 有数量级差距),且需要自行维护模型更新。适合离线环境、敏感数据处理以及对延迟不敏感的批处理任务。

4. 免费预览 API:dots 平台

4.1 平台概述

dots(小红书 Dots Studio)在 2026 年 8 月推出了 dots3-note preview 模型的免费 API,面向注册用户开放。该模型为 280B 参数的 MoE 架构,上下文窗口 512K,推理速度约 110 tokens/s,目前完全免费且无调用次数限制。

4.2 能力特点与局限

维度 表现
文档处理 可完成,512K 上下文适合长文档
工具调用 可完成
代码能力 有待提升,不建议作为编程主力
多模态理解 支持
收费风险 预览版,随时可能转为收费

该方案的定位是临时替代:当 DeepSeek API 额度耗尽或成本过高时,可将文档处理、工具调用等轻任务分流至 dots 平台,代码生成等重度任务仍走主模型。预览版随时可能收费或调整策略,不宜作为长期唯一方案。

4.3 接入方式

dots3-note preview 的注册地址

详细模型解读见 小红书 dots3-note preview 开源与 API 上线

5. 多模型一键切换:DeepSeek Harness + a4api

5.1 为什么需要多模型切换

前三种方案各自有适用边界:商业中转按量计费、本地部署依赖硬件、免费预览不稳定。在实际使用中,单一模型很难覆盖所有场景。更务实的做法是同时配置多个供应商,按任务类型和成本预算动态切换

DeepSeek Harness(简称 dsh)原生支持近 40 家模型厂商的接入,可在会话级别随时切换模型与供应商,无需重启服务。a4api 则将这一能力扩展到桌面端,支持同时管理 DeepSeek Harness、Codex、Claude Code 等多个 Agent 应用的供应商配置。

5.2 DeepSeek Harness 配置切换

在 DeepSeek Harness 中,你可以直接在 web ui 中通过添加新的模型供应商的方式添加其他模型 Api 服务:

DeepSeek Harness 模型及供应商配置

5.3 a4api 桌面管理

a4api 是一个 Windows 桌面应用,通过可视化界面统一读写多个 Agent 应用的配置文件(~/.claude/settings.json、DeepSeek Harness 配置等),实现多模型服务商的快速切换。其核心价值在于一处配置,多处生效——在 a4api 中切换供应商后,所有接入的 Agent 应用同步更新。

a4api 首页与供应商配置界面:

a4api 首页 a4api 供应商配置 a4api 配置方案

项目地址:

  • 文档:https://eogee.com/article/43
  • GitHub:https://github.com/eogee/a4api
  • 下载:https://github.com/eogee/a4api/releases

6. 方案组合建议

6.1 按场景选择

不同使用场景适合不同的方案组合:

场景 推荐方案 理由
日常编程为主 CodingPlan 订阅 成本可控,调用次数充足
有 GPU 资源 本地部署 Qwen3.8-27B 零边际成本,长期最省
API 额度偶尔用完 dots 免费预览 临时分流,零成本
多 Agent 协作 a4api + Harness 一处切换,全局生效
成本敏感 + 无 GPU CodingPlan + dots 组合 低成本覆盖主要场景

6.2 风险提示

在组合使用多种替代方案时,需注意以下几点:

  • 免费预览 API 的稳定性:dots 平台当前免费,但预览版随时可能收费或调整策略,不宜将关键工作流绑定其上。
  • 本地部署的硬件门槛:Qwen3.8-27B 需要约 16 GB 显存,无合适 GPU 的用户无法使用该方案。
  • 商业中转的价格变动:CodingPlan 等中转平台的价格与额度政策可能随时调整,订阅前建议确认最新条款。
  • 多供应商的管理成本:同时维护多个供应商的 API Key 与配置,需注意 Key 安全与配置一致性。