2026 年 7 月 31 日——DeepSeek 今日宣布,DeepSeek-V4-Flash 正式版上线公测,其 API 正式新增对 OpenAI Responses API 格式的支持(base_url 为 https://api.deepseek.com),这意味着开发者可通过标准接口,将 DeepSeek 模型无缝接入 OpenAI Codex 等 Agent 工具,只需简单配置即可完成对接。

本次更新的核心亮点如下:

一、DeepSeek-V4-Flash 正式版上线公测

据官方更新日志介绍,相较预览版,正式版在多项Agent基准测试中取得显著提升,包括Terminal Bench 2.1(82.7)、NL2Repo(54.2)、Cybergym(76.7)、DeepSWE(54.4)、Toolathlon Verified(70.3)、Agent Last Exam(25.2)、Automation Bench Public(25.1)、DSBench-FullStack(68.7)及DSBench-Hard(59.6)。

此外,针对开发者对 Codex 的旺盛需求,DeepSeek API 现已支持 Responses API 格式,开发者仅需修改少量配置,即可在 Codex 中直接调用 DeepSeek 模型,享受 DeepSeek 强大的推理与 Agent 能力。Responses API 目前支持 deepseek-v4-flash 模型,Agent 能力大幅增强,已正式进入公测阶段。DeepSeek-V4-Pro 模型将于 2026 年 8 月初 完成接入,敬请期待。代码调用示例如下:

from openai import OpenAI

client = OpenAI(api_key="<your DeepSeek API Key>", base_url="https://api.deepseek.com")

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful assistant.",
    input="Hi, how are you?",
)

print(response.output_text)

二、流式输出全面升级

Responses API 支持语义化的流式输出:设置 stream: true 后,响应将以带事件类型(event 字段)和递增序号(sequence_number)的 SSE 事件序列返回。与 Chat Completions 不同,其流以 response.completed / response.incomplete / response.failed 等语义化事件收尾,不再有 data: [DONE] 消息,事件类型覆盖文本增量、思维链、Function 调用、服务端联网搜索等完整 Agent 能力链路。

三、良好的兼容性与迁移成本

  • 高度兼容:响应对象与 OpenAI Responses API 结构一致;不支持的参数会被静默忽略、不会报错,现有 Responses API 客户端无需修改即可接入
  • 函数与联网搜索:支持 function 工具及服务端执行的 web_search / web_search_2025_08_26;针对 Codex 兼容,还支持 apply_patch 自定义工具。
  • 多工具与模型能力:支持 tool_choicereasoning.efforttop_logprobstext.format 等;并行工具调用始终开启。
  • 无状态架构:API 采用无状态设计,不支持 previous_response_idconversationstore 等参数;输入超出上下文窗口时将返回 400 错误。
  • 上下文缓存:上下文缓存自动管理,usage 字段中会返回 cached_tokens(命中缓存的输入 token 数)与 reasoning_tokens(思维链 token 数),方便开发者监控用量。

四、关于模型与价格

下表所列模型价格以"百万 tokens"为单位,根据模型输入和输出的总 token 数进行计量计费。

模型细节 deepseek-v4-flash deepseek-v4-pro
BASE URL(OpenAI 格式) https://api.deepseek.com https://api.deepseek.com
BASE URL(Anthropic 格式) https://api.deepseek.com/anthropic https://api.deepseek.com/anthropic
模型版本 DeepSeek-V4-Flash-0731 DeepSeek-V4-Pro
思考模式 支持非思考与思考模式(默认),切换方式详见"思考模式" 同左
上下文长度 1M 1M
输出长度 最大 384K 最大 384K
功能 · Json Output 支持 支持
功能 · Tool Calls 支持 支持
功能 · Responses API(1) 支持 暂不支持
功能 · Anthropic API 支持 支持
功能 · 对话前缀续写(Beta) 支持 支持
功能 · FIM 补全(Beta) 仅非思考模式支持 仅非思考模式支持
价格(2) · 百万 tokens 输入(缓存命中) 0.02 元 0.025 元
价格(2) · 百万 tokens 输入(缓存未命中) 1 元 3 元
价格(2) · 百万 tokens 输出 2 元 6 元
并发限制(3) 2500 500

(1) Responses API 目前仅支持 deepseek-v4-flash 模型,暂不支持 deepseek-v4-pro 模型,将于 2026 年 8 月初增加对 deepseek-v4-pro 模型的支持。

(2) DeepSeek API 服务即将采用峰谷定价策略,高峰时段价格为平时价格的 2 倍,适用所有计费项,具体时间另行通知通知为准。高峰时段定义:北京时间每日 9:00~12:00 和 14:00~18:00。

(3) 并发限制详情见上表。

更多关于 Responses API 的完整事件列表、参数兼容性明细及接入指南,欢迎访问 DeepSeek 开放平台查阅官方文档。