2026 年 8 月 21 日——DeepSeek 于 8 月 19 日发布 Harness 工具 v0.1.0-rc.8 版本更新,新增原生图片输入支持,配置文件显式声明 inputModalities: [text, image] 的多模态声明字段,社区在源码中进一步发现名为 deepseek-v4-flash-vision-exp 的实验性视觉模型 ID。

此次 Harness 更新在底层打通了图片输入通道,/goal/plan 等命令现已支持图文混合输入,输入框的 @ 菜单可引用文件和会话。图片通过附件系统持久化存储,在请求阶段转换为模型接口所需格式,单次请求的 base64 图片载荷被控制在 20 MiB 左右,避免因累计图片过多导致请求失败。

DeepSeek 模型适配器的 Catalog 配置文件中,出现了一个名为 private-vision 的模型条目,其 inputModalities 字段明确标注为 [text, image],表明该模型具备原生图像理解能力。配置注释指出:"在视觉模型端点完成发布前,默认目录不会公布视觉模型,但部署方可以通过 inputModalities: [text, image] 主动添加"。社区随后在 GitHub 源码中挖掘出一个新的模型 ID——deepseek-v4-flash-vision-exp,从命名规则推断其为 V4 Flash 的实验性(exp)视觉版本。

此次更新的技术基础可追溯至 2026 年 4 月。4 月 24 日,DeepSeek V4 系列(Pro 与 Flash 版本)上线,初期仅支持文本输入。4 月 30 日,DeepSeek 发布多模态技术报告《Thinking with Visual Primitives(以视觉原语思考)》,该报告阐释了基于 DeepSeek V4-Flash(总参数 2840 亿,推理时激活 130 亿的 MoE 架构)构建的视觉推理模型技术细节。报告指出,模型通过引入"视觉原语"框架,将点、边界框等空间标记提升为最小思维单元,实现了"语言逻辑+空间坐标"交织的双轨推理,在多项高难度视觉问答任务中表现超过 GPT-5.4、Claude-Sonnet-4.6、Gemini-3-Flash 等模型。同一天,DeepSeek 识图模式灰度上线,但官方随后删除了 GitHub 多模态仓库与论文原文,未说明具体原因。

Harness 更新中出现的 private-vision 配置与社区发现的 deepseek-v4-flash-vision-exp 模型 ID,结合 DeepSeek 此前已发布的技术报告与灰度测试记录,标志着 DeepSeek 的原生视觉模型已进入发布前的最后准备阶段。截至发稿,DeepSeek 官方尚未公布视觉模型的正式发布时间表。