2026 年 7 月 31 日——DeepSeek 今日宣布,DeepSeek-V4-Flash 正式版上线公测,其 API 正式新增对 OpenAI Responses API 格式的支持(base_url 为 https://api.deepseek.com),这意味着开发者可通过标准接口,将 DeepSeek 模型无缝接入 OpenAI Codex 等 Agent 工具,只需简单配置即可完成对接。
本次更新的核心亮点如下:
一、DeepSeek-V4-Flash 正式版上线公测
据官方更新日志介绍,相较预览版,正式版在多项Agent基准测试中取得显著提升,包括Terminal Bench 2.1(82.7)、NL2Repo(54.2)、Cybergym(76.7)、DeepSWE(54.4)、Toolathlon Verified(70.3)、Agent Last Exam(25.2)、Automation Bench Public(25.1)、DSBench-FullStack(68.7)及DSBench-Hard(59.6)。
此外,针对开发者对 Codex 的旺盛需求,DeepSeek API 现已支持 Responses API 格式,开发者仅需修改少量配置,即可在 Codex 中直接调用 DeepSeek 模型,享受 DeepSeek 强大的推理与 Agent 能力。Responses API 目前支持 deepseek-v4-flash 模型,Agent 能力大幅增强,已正式进入公测阶段。DeepSeek-V4-Pro 模型将于 2026 年 8 月初 完成接入,敬请期待。代码调用示例如下:
from openai import OpenAI
client = OpenAI(api_key="<your DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful assistant.",
input="Hi, how are you?",
)
print(response.output_text)
二、流式输出全面升级
Responses API 支持语义化的流式输出:设置 stream: true 后,响应将以带事件类型(event 字段)和递增序号(sequence_number)的 SSE 事件序列返回。与 Chat Completions 不同,其流以 response.completed / response.incomplete / response.failed 等语义化事件收尾,不再有 data: [DONE] 消息,事件类型覆盖文本增量、思维链、Function 调用、服务端联网搜索等完整 Agent 能力链路。
三、良好的兼容性与迁移成本
- 高度兼容:响应对象与 OpenAI Responses API 结构一致;不支持的参数会被静默忽略、不会报错,现有 Responses API 客户端无需修改即可接入。
- 函数与联网搜索:支持
function工具及服务端执行的web_search/web_search_2025_08_26;针对 Codex 兼容,还支持apply_patch自定义工具。 - 多工具与模型能力:支持
tool_choice、reasoning.effort、top_logprobs、text.format等;并行工具调用始终开启。 - 无状态架构:API 采用无状态设计,不支持
previous_response_id、conversation、store等参数;输入超出上下文窗口时将返回 400 错误。 - 上下文缓存:上下文缓存自动管理,
usage字段中会返回cached_tokens(命中缓存的输入 token 数)与reasoning_tokens(思维链 token 数),方便开发者监控用量。
四、关于模型与价格
下表所列模型价格以"百万 tokens"为单位,根据模型输入和输出的总 token 数进行计量计费。
| 模型细节 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| BASE URL(OpenAI 格式) | https://api.deepseek.com | https://api.deepseek.com |
| BASE URL(Anthropic 格式) | https://api.deepseek.com/anthropic | https://api.deepseek.com/anthropic |
| 模型版本 | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Pro |
| 思考模式 | 支持非思考与思考模式(默认),切换方式详见"思考模式" | 同左 |
| 上下文长度 | 1M | 1M |
| 输出长度 | 最大 384K | 最大 384K |
| 功能 · Json Output | 支持 | 支持 |
| 功能 · Tool Calls | 支持 | 支持 |
| 功能 · Responses API(1) | 支持 | 暂不支持 |
| 功能 · Anthropic API | 支持 | 支持 |
| 功能 · 对话前缀续写(Beta) | 支持 | 支持 |
| 功能 · FIM 补全(Beta) | 仅非思考模式支持 | 仅非思考模式支持 |
| 价格(2) · 百万 tokens 输入(缓存命中) | 0.02 元 | 0.025 元 |
| 价格(2) · 百万 tokens 输入(缓存未命中) | 1 元 | 3 元 |
| 价格(2) · 百万 tokens 输出 | 2 元 | 6 元 |
| 并发限制(3) | 2500 | 500 |
(1) Responses API 目前仅支持 deepseek-v4-flash 模型,暂不支持 deepseek-v4-pro 模型,将于 2026 年 8 月初增加对 deepseek-v4-pro 模型的支持。
(2) DeepSeek API 服务即将采用峰谷定价策略,高峰时段价格为平时价格的 2 倍,适用所有计费项,具体时间另行通知通知为准。高峰时段定义:北京时间每日 9:00~12:00 和 14:00~18:00。
(3) 并发限制详情见上表。
更多关于 Responses API 的完整事件列表、参数兼容性明细及接入指南,欢迎访问 DeepSeek 开放平台查阅官方文档。
举手提问