2026 年 8 月 21 日——据 DeepSeek 官方 API 文档,DeepSeek API 平台已上线多模态视觉理解实验模型 DeepSeek-V4-Flash-Vision-Exp(调用名为 deepseek-v4-flash-vision-exp),支持图像与文本混合输入,可执行图片内容描述、截图文字识别、图表分析等任务;模型上下文长度 1M、最大输出 384K,各计费项单价与 deepseek-v4-flash 保持一致。

官方文档显示,该模型为实验(experimental)版本,在原有文本能力基础上新增图像输入,开发者将 model 参数设置为 deepseek-v4-flash-vision-exp 即可调用。据媒体报道,DeepSeek 此前系列模型均为纯文本模型,此次发布补齐了其在视觉理解方向的能力空缺。

1. 接入方式与 API 兼容性

模型支持 JPEG、PNG、GIF、WebP 四种图像格式,格式按文件实际内容识别,不依赖文件扩展名或声明的 MIME 类型。图像传入支持三种方式:

  • Base64 内联:将图片编码为 data: URL 直接嵌入请求,编码后数据计入 48 MiB 请求体上限;
  • 外部 URL:传入公开可访问的 http(s) 链接,URL 最长 8192 字符,单图最大 32 MiB,下载须在 60 秒内完成;
  • Files API 引用:先通过 Files API 上传获取 file_id 再引用,单图最大可达 64 MiB,适合同一图片多次复用的场景。

三种方式均兼容 OpenAI 格式的 Chat Completions 与 Responses API(图像通过 input_image 内容块传入),也可通过 Anthropic 兼容端点(base_urlhttps://api.deepseek.com/anthropic)以 base64urlfile 三种 source 类型传入。外部 URL 方式的调用示例如下:

from openai import OpenAI

client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "描述这张图片的内容"},
                {"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}},
            ],
        }
    ],
)
print(response.choices[0].message.content)

使用限制方面,官方文档明确:图像仅允许出现在 user 消息中,system 或 assistant 消息中的图像会返回 400 错误;非视觉模型不接受图像输入,传入同样返回 400 错误。

2. 图像输入限制与 token 计费规则

图像按尺寸转换为 token 后,与文本 token 合并计入输入费用。推理前每张图片自动缩放:总像素低于约 384×384 的图片等比放大,更大的图片等比缩小至约 800×800 总像素规模,因此单张图片消耗的 token 上限为 384 tokens,例如 2000×2000 与 5000×5000 的图片缩放后消耗相同数量的 token;多图请求中每张图片独立计数。此外,image_url 内容块可选配 detail 参数,设为 low 时图片缩放至 512×512 后推理,可降低开销,highoriginalauto 则保留原图。

主要输入限制汇总如下(据官方文档):

限制项 数值
支持格式 JPEG、PNG、GIF、WebP
外部 URL 长度上限 8192 字符
请求体大小上限 48 MiB
单图大小上限(Base64 / 外部 URL) 32 MiB
单图大小上限(Files API file_id) 64 MiB
单次请求图片数量上限 600 张
单次请求图片总大小上限 不含 file_id 图片 64 MiB,含 file_id 最高 200 MiB
单边像素上限 8192 px,单请求含 15 张及以上图片时降为 4096 px
单张图片 token 上限 384 tokens

3. 模型规格与定价

以下参数与价格据 DeepSeek 开放平台文档整理,价格以百万 tokens 为单位,币种为美元:

模型细节 deepseek-v4-flash deepseek-v4-pro deepseek-v4-flash-vision-exp
模型版本 DeepSeek-V4-Flash-0731 DeepSeek-V4-Pro-0813 DeepSeek-V4-Flash-Vision-Exp
思考模式 支持非思考与思考模式(默认) 同左 同左
上下文长度 1M 1M 1M
最大输出 384K 384K 384K
JSON Output 支持 支持 支持
Tool Calls 支持 支持 支持
Responses API 支持 支持 支持
Anthropic API 支持 支持 支持
对话前缀续写(Beta) 支持 支持 支持
FIM 补全(Beta) 仅非思考模式 仅非思考模式 不支持
百万 tokens 输入(缓存命中)谷时 / 峰时 0.007 / 0.014 0.022 / 0.044 0.007 / 0.014
百万 tokens 输入(缓存未命中)谷时 / 峰时 0.22 / 0.44 0.66 / 1.32 0.22 / 0.44
百万 tokens 输出 谷时 / 峰时 0.66 / 1.32 1.98 / 3.96 0.66 / 1.32
并发限制 2500 500 2500

注 1:DeepSeek API 执行峰谷定价,高峰时段为 UTC 01:00–04:00 与 06:00–10:00(对应北京时间 09:00–12:00 与 14:00–18:00),其余时段为谷时,谷时价格为峰时的一半。

注 2:发送至 deepseek-v4-flash-vision-exp 的图像按尺寸转换为 token,与文本 token 合并按输入价格计费。

注 3:以上信息截至 2026 年 8 月 21 日,价格可能调整,以官方文档为准。

更多关于图像输入方式、token 计算细节及多 API 格式接入指南,可查阅 DeepSeek 开放平台官方文档(api-docs.deepseek.com)。