2026 年 8 月 21 日——据 DeepSeek 官方 API 文档,DeepSeek API 平台已上线多模态视觉理解实验模型 DeepSeek-V4-Flash-Vision-Exp(调用名为 deepseek-v4-flash-vision-exp),支持图像与文本混合输入,可执行图片内容描述、截图文字识别、图表分析等任务;模型上下文长度 1M、最大输出 384K,各计费项单价与 deepseek-v4-flash 保持一致。
官方文档显示,该模型为实验(experimental)版本,在原有文本能力基础上新增图像输入,开发者将 model 参数设置为 deepseek-v4-flash-vision-exp 即可调用。据媒体报道,DeepSeek 此前系列模型均为纯文本模型,此次发布补齐了其在视觉理解方向的能力空缺。
1. 接入方式与 API 兼容性
模型支持 JPEG、PNG、GIF、WebP 四种图像格式,格式按文件实际内容识别,不依赖文件扩展名或声明的 MIME 类型。图像传入支持三种方式:
- Base64 内联:将图片编码为
data:URL 直接嵌入请求,编码后数据计入 48 MiB 请求体上限; - 外部 URL:传入公开可访问的 http(s) 链接,URL 最长 8192 字符,单图最大 32 MiB,下载须在 60 秒内完成;
- Files API 引用:先通过 Files API 上传获取
file_id再引用,单图最大可达 64 MiB,适合同一图片多次复用的场景。
三种方式均兼容 OpenAI 格式的 Chat Completions 与 Responses API(图像通过 input_image 内容块传入),也可通过 Anthropic 兼容端点(base_url 为 https://api.deepseek.com/anthropic)以 base64、url、file 三种 source 类型传入。外部 URL 方式的调用示例如下:
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "描述这张图片的内容"},
{"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}},
],
}
],
)
print(response.choices[0].message.content)
使用限制方面,官方文档明确:图像仅允许出现在 user 消息中,system 或 assistant 消息中的图像会返回 400 错误;非视觉模型不接受图像输入,传入同样返回 400 错误。
2. 图像输入限制与 token 计费规则
图像按尺寸转换为 token 后,与文本 token 合并计入输入费用。推理前每张图片自动缩放:总像素低于约 384×384 的图片等比放大,更大的图片等比缩小至约 800×800 总像素规模,因此单张图片消耗的 token 上限为 384 tokens,例如 2000×2000 与 5000×5000 的图片缩放后消耗相同数量的 token;多图请求中每张图片独立计数。此外,image_url 内容块可选配 detail 参数,设为 low 时图片缩放至 512×512 后推理,可降低开销,high、original、auto 则保留原图。
主要输入限制汇总如下(据官方文档):
| 限制项 | 数值 |
|---|---|
| 支持格式 | JPEG、PNG、GIF、WebP |
| 外部 URL 长度上限 | 8192 字符 |
| 请求体大小上限 | 48 MiB |
| 单图大小上限(Base64 / 外部 URL) | 32 MiB |
| 单图大小上限(Files API file_id) | 64 MiB |
| 单次请求图片数量上限 | 600 张 |
| 单次请求图片总大小上限 | 不含 file_id 图片 64 MiB,含 file_id 最高 200 MiB |
| 单边像素上限 | 8192 px,单请求含 15 张及以上图片时降为 4096 px |
| 单张图片 token 上限 | 384 tokens |
3. 模型规格与定价
以下参数与价格据 DeepSeek 开放平台文档整理,价格以百万 tokens 为单位,币种为美元:
| 模型细节 | deepseek-v4-flash | deepseek-v4-pro | deepseek-v4-flash-vision-exp |
|---|---|---|---|
| 模型版本 | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Pro-0813 | DeepSeek-V4-Flash-Vision-Exp |
| 思考模式 | 支持非思考与思考模式(默认) | 同左 | 同左 |
| 上下文长度 | 1M | 1M | 1M |
| 最大输出 | 384K | 384K | 384K |
| JSON Output | 支持 | 支持 | 支持 |
| Tool Calls | 支持 | 支持 | 支持 |
| Responses API | 支持 | 支持 | 支持 |
| Anthropic API | 支持 | 支持 | 支持 |
| 对话前缀续写(Beta) | 支持 | 支持 | 支持 |
| FIM 补全(Beta) | 仅非思考模式 | 仅非思考模式 | 不支持 |
| 百万 tokens 输入(缓存命中)谷时 / 峰时 | 0.007 / 0.014 | 0.022 / 0.044 | 0.007 / 0.014 |
| 百万 tokens 输入(缓存未命中)谷时 / 峰时 | 0.22 / 0.44 | 0.66 / 1.32 | 0.22 / 0.44 |
| 百万 tokens 输出 谷时 / 峰时 | 0.66 / 1.32 | 1.98 / 3.96 | 0.66 / 1.32 |
| 并发限制 | 2500 | 500 | 2500 |
注 1:DeepSeek API 执行峰谷定价,高峰时段为 UTC 01:00–04:00 与 06:00–10:00(对应北京时间 09:00–12:00 与 14:00–18:00),其余时段为谷时,谷时价格为峰时的一半。
注 2:发送至 deepseek-v4-flash-vision-exp 的图像按尺寸转换为 token,与文本 token 合并按输入价格计费。
注 3:以上信息截至 2026 年 8 月 21 日,价格可能调整,以官方文档为准。
更多关于图像输入方式、token 计算细节及多 API 格式接入指南,可查阅 DeepSeek 开放平台官方文档(api-docs.deepseek.com)。
举手提问