2026 年 8 月 31 日——据 AIHub 等媒体报道,DeepSeek 于 8 月 31 日在 Hugging Face 上线多模态视觉理解实验模型 DeepSeek-V4-Flash-Vision-Exp 的完整权重,采用 MIT License 开源。该模型是 DeepSeek-V4 系列首个开放权重的多模态模型,基于 V4-Flash 架构新增视觉模块,模型仓库体积约 168GB(含 48 个 Safetensors 权重分片),纯文本 Agent 性能与 DeepSeek-V4-Flash-0731 相当。
该模型此前已于 8 月 21 日上线 DeepSeek API 平台(调用名 deepseek-v4-flash-vision-exp),据 DeepSeek 开放平台文档,模型上下文长度 1M、最大输出 384K,各计费项单价与 deepseek-v4-flash 一致。据媒体报道,此前 DeepSeek 系列模型权重均为纯文本模型,此次权重开源补齐了多模态模型的本地推理能力。
1. 开源详情
官方在 Hugging Face 开放了 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 模型仓库,除模型权重外,还同步开放了以下资源:
- Tokenizer(分词器)
- 图文提示编码(image-text prompt encoding)
- 图像预处理工具
- 权重转换工具
- 最小 PyTorch 推理实现,便于理解模型结构
据 AIHub 报道,官方明确表示当前提供的是"便于理解模型结构的参考推理实现",并非开箱即用的生产级服务引擎。由于权重体积约 168GB,本地运行需要较高的 GPU 显存、存储空间和多卡计算资源。
2. 架构与能力
据 AIHub 报道,模型基于 DeepSeek-V4-Flash 架构加入视觉模块,通过持续训练获得图像理解与多模态 Agent 能力,主要结构组件包括:
| 组件 | 说明 |
|---|---|
| Vision Encoder | 视觉编码器 |
| Aligner | 图文对齐模块 |
| DFlash | 基础语言架构 |
| MoE | 混合专家结构 |
| Hyper-Connections | 超连接结构 |
| DSpark | 推理/调度相关模块 |
模型支持图文交错输入、多轮对话、工具调用(Tool Calling)与思考模式(Thinking Mode),官方提供多卡张量并行推理示例。
3. 性能表现
据 PANews 报道,该模型可识别截图、图表并结合工具执行 Agent 任务。在 Terminal Bench 等纯文本 Agent 基准上,其性能与 DeepSeek-V4-Flash 大致持平;在处理图片、图表、网页界面和视觉任务的同时,纯文本 Agent 性能与 DeepSeek-V4-Flash-0731 相当。
4. 部署与集成
开发者可下载权重本地部署,据媒体报道支持 Transformers、vLLM、SGLang 等推理框架集成。此前该系列模型仅通过 API 提供服务,本次为首次开放权重下载。
主要规格汇总如下:
| 项目 | 数据 |
|---|---|
| 开源日期 | 2026 年 8 月 31 日 |
| 开源平台 | Hugging Face |
| 开源协议 | MIT License |
| 模型定位 | DeepSeek-V4 系列首个开放权重的多模态模型 |
| 仓库体积 | 约 168GB(48 个 Safetensors 权重分片) |
| 上下文长度 | 1M(据 DeepSeek 开放平台文档) |
| 最大输出 | 384K(据 DeepSeek 开放平台文档) |
| 支持图像格式 | JPEG、PNG、GIF、WebP(据 DeepSeek 开放平台文档) |
| 推理框架 | Transformers、vLLM、SGLang |
| API 定价 | 与 deepseek-v4-flash 一致 |
注:以上信息截至 2026 年 8 月 31 日,综合 AIHub、PANews 报道与 DeepSeek 开放平台文档整理,参数量及详细基准数据以 Hugging Face 模型卡与官方公告为准。
举手提问