2026 年 8 月 31 日——据 AIHub 等媒体报道,DeepSeek 于 8 月 31 日在 Hugging Face 上线多模态视觉理解实验模型 DeepSeek-V4-Flash-Vision-Exp 的完整权重,采用 MIT License 开源。该模型是 DeepSeek-V4 系列首个开放权重的多模态模型,基于 V4-Flash 架构新增视觉模块,模型仓库体积约 168GB(含 48 个 Safetensors 权重分片),纯文本 Agent 性能与 DeepSeek-V4-Flash-0731 相当。

该模型此前已于 8 月 21 日上线 DeepSeek API 平台(调用名 deepseek-v4-flash-vision-exp),据 DeepSeek 开放平台文档,模型上下文长度 1M、最大输出 384K,各计费项单价与 deepseek-v4-flash 一致。据媒体报道,此前 DeepSeek 系列模型权重均为纯文本模型,此次权重开源补齐了多模态模型的本地推理能力。

1. 开源详情

官方在 Hugging Face 开放了 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 模型仓库,除模型权重外,还同步开放了以下资源:

  • Tokenizer(分词器)
  • 图文提示编码(image-text prompt encoding)
  • 图像预处理工具
  • 权重转换工具
  • 最小 PyTorch 推理实现,便于理解模型结构

据 AIHub 报道,官方明确表示当前提供的是"便于理解模型结构的参考推理实现",并非开箱即用的生产级服务引擎。由于权重体积约 168GB,本地运行需要较高的 GPU 显存、存储空间和多卡计算资源。

2. 架构与能力

据 AIHub 报道,模型基于 DeepSeek-V4-Flash 架构加入视觉模块,通过持续训练获得图像理解与多模态 Agent 能力,主要结构组件包括:

组件 说明
Vision Encoder 视觉编码器
Aligner 图文对齐模块
DFlash 基础语言架构
MoE 混合专家结构
Hyper-Connections 超连接结构
DSpark 推理/调度相关模块

模型支持图文交错输入、多轮对话、工具调用(Tool Calling)与思考模式(Thinking Mode),官方提供多卡张量并行推理示例。

3. 性能表现

据 PANews 报道,该模型可识别截图、图表并结合工具执行 Agent 任务。在 Terminal Bench 等纯文本 Agent 基准上,其性能与 DeepSeek-V4-Flash 大致持平;在处理图片、图表、网页界面和视觉任务的同时,纯文本 Agent 性能与 DeepSeek-V4-Flash-0731 相当。

4. 部署与集成

开发者可下载权重本地部署,据媒体报道支持 Transformers、vLLM、SGLang 等推理框架集成。此前该系列模型仅通过 API 提供服务,本次为首次开放权重下载。

主要规格汇总如下:

项目 数据
开源日期 2026 年 8 月 31 日
开源平台 Hugging Face
开源协议 MIT License
模型定位 DeepSeek-V4 系列首个开放权重的多模态模型
仓库体积 约 168GB(48 个 Safetensors 权重分片)
上下文长度 1M(据 DeepSeek 开放平台文档)
最大输出 384K(据 DeepSeek 开放平台文档)
支持图像格式 JPEG、PNG、GIF、WebP(据 DeepSeek 开放平台文档)
推理框架 Transformers、vLLM、SGLang
API 定价 与 deepseek-v4-flash 一致

注:以上信息截至 2026 年 8 月 31 日,综合 AIHub、PANews 报道与 DeepSeek 开放平台文档整理,参数量及详细基准数据以 Hugging Face 模型卡与官方公告为准。