2026 年 9 月 11 日——DeepSeek 于 9 月 10 日正式发布并开源 DeepSeek-V4.1-Flash 模型与技术报告:该模型为多模态 MoE 架构,主干参数 552B,支持 100 万 token 上下文,prefill 阶段每 token 仅激活 8B 参数,全局 KV Cache 压缩至 890 字节/token,约为上一代 DeepSeek-V4-Flash 的 1/4、2023 年 DeepSeek-V1 的 1/437。
在 Agent 能力上,该模型以明显更小的激活参数规模取得一组领先成绩:DeepSWE v1.1 通过率 74.2%,超过 Anthropic Opus-5(74.0%)与 OpenAI GPT-5.6 Sol(73.0%);Terminal-Bench 2.1 得分 90.6%,为全部对比模型中最高。官方定价页显示,高峰时段输入(缓存未命中)0.3 美元/百万 token、输出 1.2 美元/百万 token,低谷时段减半。官方更新日志同时宣布计划有序退役 V4 Pro:9 月 14 日 12:00(北京时间)起,deepseek-v4-pro 请求将路由至 V4.1 Flash 并按其价格计费,直至 V4.1 Pro 发布。
2026-09-11 · DeepSeek · 模型架构 · KV Cache · Agent
一、概览
DeepSeek-V4.1-Flash 的技术报告标题为《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,官方将"逼近 KV Cache 压缩极限"作为整份报告的主线。模型权重以 MIT 许可证发布在 Hugging Face,API 调用名为 deepseek-flash。官方更新日志称其为新架构家族中最小的型号,新架构的目标包括更高能力上限、更快推理、更高吞吐以及可扩展到更大模型,后续将有更大的 V4.1 Pro 型号。
发布节奏上,据 IT 之家报道与官方交流群通知,DeepSeek 于 9 月 8 日开启 V4.1 Flash 中间版本限时内测(模型名 deepseek-v4.1-flash-expires-on-0910,每账号限流 20 并发),9 月 10 日正式发布并同步开源。官方在发布说明中表示,V4.1 Flash 在性能、成本、速度、总耗时上全面超越 V4 Pro,因此计划有序退役 V4 Pro。
| 项目 | 数据 |
|---|---|
| 发布日期 | 2026 年 9 月 10 日(9 月 8 日开启限时内测) |
| 模型/API 名称 | DeepSeek-V4.1-Flash / deepseek-flash |
| 许可证 | MIT,权重开放于 Hugging Face |
| 整体架构 | Causal Encoder-Decoder(CED)+ CSA2 注意力 + DeepSeekMoE,40 层(20 层编码器 + 20 层解码器) |
| 主干参数 | 552B,另有 196B Engram 条件记忆参数 |
| 激活参数 | prefill 每 token 8B,decode 每 token 16B |
| 上下文长度 | 100 万 token,官方定价页显示最大输出 384K token |
| 多模态 | 原生视觉理解(DeepSeek-ViT + MLP 投影器) |
| 预训练数据 | 45T token 多模态语料 |
| 全局 KV Cache | 890 字节/token,约为 V4-Flash 的 1/4、V1 的 1/437 |
| 持久化 KV Cache | 约为 V4-Flash 的 1/8 |
| 峰值价格(每百万 token) | 输入命中 0.006 美元 / 未命中 0.3 美元 / 输出 1.2 美元,低谷时段减半 |
| 代表性成绩 | DeepSWE v1.1 74.2%、Terminal-Bench 2.1 90.6%、Codeforces 3471 分 |
数据来源:DeepSeek-V4.1-Flash 技术报告、Hugging Face 模型卡、DeepSeek API 官方更新日志与定价页。
二、技术背景:Agent 时代的瓶颈从计算转向 KV Cache
技术报告在引言中给出了明确的问题定义:长时程 Agent 应用的普及使模型负载越来越"输入重"(input-heavy)。已有稀疏注意力工作大幅降低了长序列处理的计算成本之后,剩余的瓶颈集中在三处:
- 计算:prefill(对输入序列的并行前向计算)在缓存未命中时依然昂贵,Agent 工作流中频繁的工具调用不断产生新的 prefill 请求;
- 存储:庞大的 KV Cache 同时挤压 HBM(显存)与 SSD/主机内存的容量;
- 带宽:缓存迁移与加载受 I/O 和互连带宽限制。
这三个约束共同限制了长上下文服务的吞吐与部署成本。DeepSeek 在报告中的判断是:继续降低 KV Cache 足迹,是缓解存储与通信瓶颈、降低长上下文服务成本的关键。
从各代模型的每 token 全局 KV Cache 体积(HBM 中常驻部分)可以看到这条压缩路线的演进:
| 模型(年代) | 全局 KV Cache(字节/token) |
|---|---|
| DeepSeek-V1(2023) | 388843 |
| DeepSeek-V2(2024) | 322750 |
| DeepSeek-V3(2024,MLA) | 576 |
| DeepSeek-V4-Flash(2026) | 3514 |
| DeepSeek-V4.1-Flash(2026) | 890 |
数据来源:DeepSeek-V4.1-Flash 官方 Hugging Face 模型卡图 1。
值得注意的是,V3 到 V4 的 KV 体积反而上升:V4 为支持百万 token 上下文引入了"全局注意力分支 + 滑窗注意力(SWA)"的混合设计,全局分支需要保存压缩后的主 KV(main KV)与索引器 K(indexer K),其体积在足够长的序列下支配运行时缓存足迹;另一部分 KV 需要"持久化"存储于 SSD/主机内存以支持前缀复用(persistent KV Cache),受 SSD 容量约束。V4.1 的全部架构设计都围绕这两类缓存的进一步压缩展开。
与 V4 相比,V4.1-Flash 在架构上做了一次明显的简化:V4 采用压缩稀疏注意力 CSA 与重度压缩注意力 HCA 的混合架构,而 V4.1-Flash 放弃 HCA,全面转向纯 CSA2(Compressed Sparse Attention 2),并叠加缓存精度(FP4)与部署策略(SWA Bounded Replay)的联合优化。
三、架构解析:三个乘法维度上同时压缩
CSA2 的设计出发点是把 KV Cache 与注意力计算的压缩拆解为三个相乘的维度:
- 条目维度:减少每个缓存条目的大小,如 GQA 减少 KV 头数、MLA 用共享低秩隐向量跨头共享(DeepSeek-V3 的做法);
- 序列维度:每 r 个 token 压缩为一个条目,如 V4 的 CSA/HCA;
- 层维度:部分层复用其他层的缓存或稀疏选择结果。
报告指出,此前的 IndexCache、YOIO、HySparse 等工作只在单一维度上做复用,且或只省索引不省主 KV 存储,或全网共享路由损失性能;CSA2 的差异在于三个维度联合压缩,并将"缓存共享"与"索引复用"解耦。
32 层 / 2D-RoPE / patch 14"] B --> C["MLP 投影器
3×3 pixel-unshuffle,视觉 token 减为 1/9"] D["文本 Embedding"] --> E["因果编码器:20 层
前 2 层纯 SWA
后 18 层 CSA2 压缩率 r=2
激活 8B/token"] C --> E E -->|"编码器末层隐状态
经层相关投影直接生成解码器全局 KV"| F["解码器:20 层
CSA2 r=1 + 层级稀疏索引器
激活 16B/token"] G["Engram 条件记忆
196B 参数"] -.-> E G -.-> F F --> H["输出 token
DSpark 投机解码加速"]
3.1 CED:因果编码器-解码器,prefill 计算砍半
CED(Causal Encoder-Decoder)是本次最核心的架构创新,设计灵感来自 YoCo:让上半部分层直接共享下半部分层生成的 KV Cache。CED 在此基础上做了结构性改进,以提升 KV 生成路径的计算深度与整体 KV Cache 容量。
具体机制:40 层 Transformer 被划分为 20 层"因果编码器"与 20 层"解码器"。对全局注意力而言,解码器层的 KV 条目不再由各自隐状态生成,而是直接从编码器第 L/2 层(编码器最后一层)的隐状态经各层独立的投影矩阵投影得到。这意味着 prefill 阶段只需要完整计算前 20 层,即可低成本获得全部解码器层的全局 KV Cache。
对滑窗注意力(SWA)而言,CED 保持逐层常规计算,本地 KV 的生成路径不缩短,从而保住本地特征的处理深度。但逐层计算 SWA 意味着解码器部分需要额外处理 win·L/2 个 token 来生成解码器 SWA KV(win 为窗口大小,L 为层数),在多轮短提示交互中开销不可忽略。为此 CED 引入 Decoder SWA Bounded Replay:只回放提示词最后 win 个 token 来近似重建解码器 SWA 状态。
综合效果:对长度为 s 的序列(s 远大于 win),prefill 复杂度从 O(s) 降为 O(s/2 + win·L/2),近似 O(s/2),prefill 计算近乎砍半。参数激活上,模型 prefill 每 token 只激活 8B 参数、decode 激活 16B——对"输入重"的 Agent 负载,这直接压低了处理新输入与缓存未命中场景的成本。
3.2 CSA2:Full / Reindex / Reuse 三种静态模式
CSA2 保留了一个轻量索引器:用索引器 Q 与索引器 K 对主 KV 条目打分,为每个查询选出 Top-K 条目,查询只对选中的条目加上本层 SWA KV 做注意力。压缩率 r=1 时退化为不压缩的主 KV 设置。相比 V4 的 CSA,CSA2 做了两处简化:去掉相邻压缩条目的重叠设计,去掉压缩阶段的绝对位置编码;索引器 K 改为直接从主 KV 条目投影得到,替代 CSA 从隐状态单独压缩的路径。报告称这两点简化提升了训练效率。
每个 CSA2 层被静态指定为三种模式之一:
| 模式 | 主 KV / 索引器 K | Top-K 索引 | 计算内容 |
|---|---|---|---|
| Full | 本层自行生成 | 本层新生成 | 完整 CSA2 路径,等同 V4 中的完整 CSA 层 |
| Reindex | 复用最近一层 | 本层重新计算 | 用自己的索引器 Q 重新打分共享索引器 K,选出新 Top-K |
| Reuse | 复用最近一层 | 复用最近一个产索引层的结果 | 不计算索引器 Q、不打分,直接做稀疏注意力 |
三种模式下,每层都保留自己的全局 Q 与 SWA KV。共享主 KV 与索引器 K 直接削减缓存存储,复用 Top-K 索引则省去索引器计算;Reindex 模式在保持缓存共享的同时允许稀疏选择逐层变化。
实际配置为(技术报告 4.2.1 节):编码器 18 层 CSA2 使用压缩率 r=2,分 3 组、每组 6 层,组内第 1 层 Full、其余 5 层 Reuse;解码器 20 层 CSA2 使用压缩率 r=1(序列维不压缩),分 5 组、每组 4 层,第一组第 1 层 Full、其余 Reuse,其余 4 组第 1 层 Reindex、其余 Reuse。注意力主路为 64 个查询头、头维度 512、查询压缩维度 1280;索引器 32 头、头维度 128;Top-K 为 512;SWA 窗口 win=128。
3.3 层级稀疏索引器:把深索引器的打分成本与上下文长度解耦
跨层索引复用减少了索引器执行次数,但剩余索引器仍要对全部可见上下文打分,超长上下文下这仍是计算瓶颈。层级稀疏索引器(Hierarchical Sparse Indexer)只用在解码器:每个查询由第一个 Full 模式层对全部可见位置打分,选出自己的 Top-K,同时做块级候选选择——每个块取块内最高索引分,选出高分块并收集其覆盖位置构成候选池(例如选 2048 个块、每块 8 个位置,共 16384 个候选位置)。后续 Reindex 层只在这个候选池内打分。
在固定候选池大小下,深层索引器每查询的打分成本从"随上下文长度线性增长"变为"常数"。该机制是训练感知的:在后训练阶段即引入相同的候选限制,使深层索引器在与推理一致的搜索域上被优化。
3.4 FP4 主 KV 缓存:精度再砍一半
V4 已对索引器的 Q/K 使用 FP4 量化感知训练(QAT)。V4.1 把 QAT 扩展到主 KV 缓存本身:采用 OCP 标准的 MXFP4 格式(E2M1 数值格式,每 16 通道一个 E4M3 缩放因子,参照 NVFP4 但省去二级全局缩放)。为兼容尽量多的硬件平台,注意力计算前先反量化缓存值,因此不依赖硬件原生 FP4 矩阵乘支持。量化在 RoPE 之后进行,实验显示 RoPE 前量化仅有微小精度收益却增加解码开销;对量化敏感的 SWA KV 缓存则保留 FP8。相比 V4 的 FP8 主 KV,FP4 使 HBM 与 SSD 中的存储足迹近乎减半。
3.5 Single-Pass mHC 与推理内核整合
mHC 是 V4 引入的多残差流机制:相邻 Transformer 块之间维护多条残差流,由预测出的 token 级系数做混合。V4 的多内核实现激活内存流量为 (4L+4),是理论下界 (2L+2) 的两倍。V4.1 提出 Single-Pass mHC:把输入混合系数错位一个块(每个块消费前一个块产生的系数),消除了系数依赖,使混合可在残差单次遍历中完成。部署侧将残差更新、输入混合、系数预测融合为单个 Mega-mHC 内核,激活内存流量达到理论下界 (2L+2),较原实现减半。
内核整合的整体效果:架构概念复杂,但推理内核流非常精简——绝大多数 Transformer 层(Reuse 模式层)在 prefill 只需 15 个内核、decode 只需 11 个内核,配合 FlashMLA、DeepGEMM 的 Mega-Gate/Mega-mHC/Mega-MoE、TileKernels、DeepSelect TopK 等融合内核实现高吞吐低延迟。部署架构采用 Encoder-Prefill-Decode(EPD)分离,视觉编码、prefill、解码三段可独立扩缩并重叠执行。
3.6 Engram 条件记忆:把"记忆"从"计算"中解耦出来
Engram 是 DeepSeek 前作提出的条件记忆模块,目标是将记忆与计算解耦:用基于 token 的稀疏查找访问外部记忆表,而不是让主干参数承担全部记忆职能。V4.1-Flash 配备 196B Engram 参数,均匀分在两个模块(置于第 1、14 层,零索引),保持原设计的分词压缩、多头哈希、上下文感知门控与多分支集成,并做两处修改:去掉短因果卷积(收益配不上推理栈复杂度);嵌入表更新改用"动量更新 + Sinkhorn 平衡"替代 Adam。
配置上,每个模块使用 n-gram 阶数 {2, 3, 4}、8 个哈希头、每阶总嵌入维度 2048;每个头索引一张约 1600 万条目的表(表大小取不同质数以降低碰撞)。嵌入表与 K/V 投影均为 FP8 精度。推理时利用确定性寻址,通过后台 RDMA 从主机内存预取嵌入,第一个模块的预取与第一个 Transformer 块的计算重叠。
3.7 DSpark 投机解码:半自回归草稿 + 置信度调度验证
DSpark 取代了 V3 时代与主干联合预训练的 MTP 模块。其草稿器由 3 个 Transformer 块组成(滑窗 128 token),单次前向并行产出 5 个草稿位置的基础 logits,辅以轻量 Markov 头建模草稿 token 间依赖;置信度头预测每个位置的条件接受概率并估计前缀存活概率,调度器再结合实测引擎吞吐曲线,为每个请求动态选择验证长度,目标是在当前系统负载下最大化全系统 token 吞吐。
训练安排上,DSpark 在主干预训练结束后以专门阶段训练(主干冻结);后训练期间与主干同步继续训练,但 DSpark 目标的梯度不回传主干,使其持续对齐演进中的策略,同时服务于线上推理与 RL/OPD 的 rollout 生成加速。
3.8 原生多模态通路
V4.1-Flash 的多模态能力是"原生"的:图像从语言模型预训练一开始就与文本联合参与训练,而不是后挂视觉扩展包。通路包括:
- DeepSeek-ViT 视觉编码器:从零训练,32 层、隐藏维 1024、16 头、patch 大小 14。为支持任意分辨率输入,用 2D-RoPE 替代绝对位置嵌入;为兼容 Muon 优化器,把 patch 嵌入的卷积替换为线性投影;归一化用 RMSNorm、激活用 SwiGLU。训练分两阶段:先用 SigLIP 的 sigmoid 对比损失在约 470 亿图文对上做对比预训练(分辨率压到 224×224);再连接一个 4B MoE 语言模型做自回归微调(236B token,含图像描述、alt 文本、图表、OCR),此后丢弃语言模型只保留视觉编码器。
- MLP 投影器:2 层、隐藏维 5120。视觉特征先经 3×3 pixel-unshuffle 把局部邻域重排到通道维,视觉 token 数量降为 1/9,支持约 1344×1344 像素输入。
- 模态分离的负载均衡:图像与文本 token 的路由偏好不同,总体均衡会掩盖模态内失衡。DeepSeek 扩展 aux-loss-free 负载均衡,为文本与图像 token 各维护一套专家修正偏置,路由时按各自模态的偏置选专家、按原始打分加权输出,两套偏置按各自专家负载独立更新。
3.9 优化器:head-wise Muon 与 Sinkhorn 平衡更新
优化配置延续 V4 并有两处新变化:
- head-wise Muon:Query/Key 权重按注意力头切分后分别施加 Muon 更新。报告的解释是:把 Muon 视为预条件梯度下降,原始 Muon 对所有头共享一个预条件器,按头划分则为每个头提供不同预条件器,更好处理注意力头间异质性;实验显示优于原始 Muon,且该经验在 GLM 5 与 Kimi-K3 中得到验证。
- Sinkhorn 平衡更新:对 Engram 嵌入表、token 嵌入与预测头这类大参数矩阵,用动量更新加 Sinkhorn 行列平衡替代 Adam,大幅降低优化器状态显存占用。该做法把 SinkGD 中用于线性层的 Sinkhorn 平衡扩展到大参数矩阵,只需动量缓冲、经验上优于 Adam。
其余配置:Muon 用于语言主干线性层、Engram 投影层与视觉-语言投影器(Nesterov 动量 0.95、权重衰减 0.1、更新矩阵 RMS 缩放 0.18);AdamW 用于 RMSNorm 及偏置、缩放因子等非矩阵参数;训练期间视觉编码器冻结至学习率衰减阶段,随后以更小学习率解冻联合训练。
四、训练:45T token 预训练与"数据工程优先"的后训练
4.1 预训练设置
| 项目 | 配置 |
|---|---|
| 训练数据量 | 45T token 多模态语料(文本:多模态约为 7:1) |
| 序列长度策略 | 从零直接以 64K 序列长度训练稀疏注意力,无稠密注意力预热;34T token 处扩展到 1M |
| 批大小 | 固定 1.006 亿 token |
| 学习率 | 2.6×10⁻⁴(2000 步线性预热),28T 后余弦衰减至 2.6×10⁻⁵,40T-45T 保持 |
| 稳定性 | 官方称全程无不稳定(no instability) |
数据侧的两个要点:其一,文本数据管线明确过滤"信息增益有限的模型生成内容"(能力较弱的模型输出、低质量机器翻译文本),报告将其定性为"隐式重复",并引入更多领域专家参与细粒度数据质量评估;代码数据纳入新发布的开源仓库、提交、库与新兴框架。其二,多模态数据不做大规模合成,优先清洗利用原生网络数据:因原爬取系统偏向文本,团队从 Common Crawl 重新引导采集;交错图文数据从网页与 PDF 构建,用 SmolVLM 做严格质量打分;另补充视觉定位、OCR、长尾知识与图像-代码对、computer-use 轨迹等领域数据。工程上,最优适配打包算法将填充率控制在 10⁻⁴ 以内。
4.2 训练基础设施
多模态长序列训练带来 I/O、CPU 与内存瓶颈,报告给出三项对策:视觉编码器在 LLM 参数树之外复制部署(分离式设计,训练步骤分三阶段执行);对比学习阶段将 all-gather 通信与正反向计算完全重叠;超长图像密集序列在 CP 维度间做负载均衡的图像分片(每张图只加载一次),RL rollout 只增量传输图像并缓存解码/预处理结果。针对 CSA2 的跨层共享,训练系统引入影子索引器(各流水线阶段放置轻量可执行副本、单一逻辑属主负责优化与存档)、流水线载荷扩展与微批级共享状态管理。Engram 嵌入表按行分区,预取与视觉编码器前后向计算重叠。
4.3 后训练:算法不变,数据与环境管线全面升级
报告在开头即声明:后训练没有引入算法创新,整体配方为标准的 SFT → RL → 在线策略蒸馏(OPD),与 V4 开发中已验证的实践一致。官方把观察总结为一句话:在当前阶段,数据与环境管线的工程化边际收益显著超过后训练算法创新。
投入集中在三处:
其一,大规模 Agent 任务合成。 每个任务被形式化为(问题、环境、验证系统)三元组,以难度与正确性为奖励信号迭代训练模型"自己出题"并自检质量;任务每次进入新的 RL 运行,其轨迹又作为质量复审的新证据。通用 Agent 环境来自内部员工与外部伙伴的真实工作流数据:按观测到的接口构造大规模 mock 工具(覆盖常用 SaaS、企业应用与业务后端),并系统性回放员工提交的负反馈与失败案例,支持对模型弱点的定向强化学习。编码 Agent 环境来自内部编码会话与达标 GitHub 仓库,由多个专职 Agent 流水线协作构建:可构建性判定 Agent 选择任务起点并设计 fail-to-pass/pass-to-pass 评估点;环境搭建 Agent 在隔离容器中装配依赖、自测、清除答案泄漏痕迹并打包为镜像层;多个求解 Agent 尝试任务;独立质检 Agent 审查环境缺陷、事实错误、评估点错配与"可作弊性";不合格则由修复 Agent 修正后重新送审。
其二,DSec:百万级并发沙箱平台。 V4.1 训练将并发沙箱需求推高到百万量级。DSec 用分片(scale unit)与放宽一致性的自研放置引擎替代 Kubernetes:多个放置副本不做同步协调、基于近期测量做"足够好"的放置决策,由节点本地硬性准入约束兜底。节点内采用硬件辅助子 NUMA 划分,容器运行于绑定 NUMA 域的 worker VM,单物理节点并发存活容器密度从约 1000 提升到 2500 以上。为防止高密度部署干扰时延敏感评测,DSec 对非 LS 任务施加 SCHED_IDLE 并用核心调度保证同优先级任务才共享超线程。针对"越强越爱越轨"的 Agent:RL 训练中观察到 Agent 利用新披露漏洞(XFS 驱动权限问题、AppArmor 非法内存访问、包镜像服务泄题),以及删除关键二进制、破坏系统文件等行为;平台以每沙箱 AppArmor 配置与细粒度 eBPF 网络策略防护,Agent 弄崩环境则记为失败轨迹并向 RL 框架上报"后果"信号。
其三,可控行思考(Controllable Reasoning Effort)。 模型支持标量 effort 等级(1-100)作为显式条件信号:训练时在系统提示前注入"Reasoning Effort: {effort}"指令,同一提示在不同 effort 下各采样若干回答,奖励的组相对优势仅在(提示,effort)子组内部中心化计算;长度惩罚系数随 effort 指数衰减,使不同 effort 产生行为分离。部署时单一权重即可在成本-质量前沿上移动,公开 API 暴露三档预设:low=50、high=75、max=100,中间值可触发插值行为。官方同步的异步 RL 基础设施采用样本级派发、token 级中断与 token 粒度的状态持久化(KV Cache 与专家路由直接复用,免重新 prefill),配合长度偏置抑制与过期 token 损失掩码;最后的 OPD 阶段使用超过 40 个架构异构的教师模型做全词表蒸馏。
五、效果:性能、效率与鲁棒性
5.1 Base 模型:以 1/3 参数追平上代旗舰
技术报告表 1 在统一内部评测框架下对比了三代 Base 模型(分数差不超过 0.3 视为同级):
| 基准 | V4-Flash-Base(13B 激活/284B) | V4-Pro-Base(49B 激活/1.6T) | V4.1-Flash-Base(8B/16B 激活/552B) |
|---|---|---|---|
| AGIEval (EM) | 83.9 | 84.4 | 83.4 |
| MMLU-Pro (EM) | 68.3 | 73.5 | 74.1 |
| C-Eval (EM) | 92.1 | 93.1 | 92.1 |
| MultiLoKo (LLM-Judge) | 42.6 | 50.9 | 45.5 |
| SimpleQA-Verified (EM) | 30.1 | 55.2 | 42.3 |
| SuperGPQA (EM) | 46.5 | 53.9 | 53.1 |
| BBH (EM) | 86.9 | 87.5 | 86.1 |
| BBEH (EM) | 25.4 | 29.8 | 27.2 |
| DROP (F1) | 88.6 | 88.7 | 87.9 |
| HellaSwag (EM) | 85.7 | 88.0 | 87.2 |
| BigCodeBench (Pass@1) | 56.8 | 59.2 | 60.6 |
| HumanEval (Pass@1) | 69.5 | 76.8 | 79.4 |
| GSM8K (EM) | 90.8 | 92.6 | 93.0 |
| MATH (EM) | 57.4 | 64.5 | 61.1 |
| MGSM (EM) | 85.7 | 84.4 | 80.2 |
| LongBench-V2 (EM) | 44.7 | 51.5 | 45.2 |
| MMMU-Pro (EM) | — | — | 56.5 |
| CVBench (EM) | — | — | 77.9 |
| DocVQA (LLM-Judge) | — | — | 95.6 |
| RefCOCO-avg (Acc@0.5) | — | — | 86.0 |
数据来源:DeepSeek-V4.1-Flash 技术报告表 1。
官方结论是:V4.1-Flash-Base 仅用 V4-Pro-Base 约 1/3 的总参数与 1/4 的激活参数,在世界知识、推理与编码上全面可比,并在内部留出集的困惑度(bits-per-byte)评测中全部任务取得最优,反映预训练数据管线质量的提升;MMLU-Pro、HumanEval、GSM8K 等基准上甚至超过 V4-Pro-Base。多模态能力由原生训练获得,DocVQA 95.6 分与 RefCOCO 系列平均 86.0 的定位准确率显示其文档理解与视觉定位达到可用水平。
5.2 对话模型:Agent 基准全面拉齐闭源前沿
后训练评测统一在最大 effort(100)下进行,对比闭源与开源旗舰(温度 1.0、top-p 0.95,代码 Agent 用 DeepSeek Harness Minimal 模式、100 万 token 上下文):
| 基准 | Opus-5 | GPT-5.6 Sol | Kimi-K3 | GLM-5.3 | DS-V4-Pro | DS-V4-Flash | DS-V4.1-Flash |
|---|---|---|---|---|---|---|---|
| GPQA Diamond (Pass@1) | 93.4 | 94.1 | 92.9 | 88.1 | 92.4 | 89.9 | 90.9 |
| HLE (Pass@1) | 56.3 | 44.5 | 43.5 | 42.0 | 42.7 | 37.8 | 36.8(纯文本子集 39.1) |
| Codeforces(评分) | — | — | — | — | 3348 | 3289 | 3471 |
| MathArena Apex (Pass@1) | — | — | 65.6 | — | 65.3 | 58.6 | 65.6 |
| Terminal-Bench 2.1 | 89.1 | 88.8 | 88.3 | 88.2 | 87.9 | 82.7 | 90.6 |
| Terminal-Bench 3.0 | 43.3 | 34.4 | 17.7 | 28.3 | 11.8 | 7.6 | 30.0 |
| Terminal-Bench 4.0 | 51.8 | 39.9 | 12.6 | 37.9 | 12.4 | 7.0 | 31.2 |
| DeepSWE v1.1 | 74.0 | 73.0 | 67.5 | 66.9 | 62.7 | 54.4 | 74.2 |
| ProgramBench (Almost@1) | 37.0 | 23.0 | 17.5 | 19.0 | 15.5 | — | 20.3 |
| NL2Repo-Bench | 75.3 | 56.8 | 58.0 | 58.0 | 61.5 | 54.2 | 65.4 |
| CyberGym | — | 84.5 | 80.0 | 84.5 | 83.3 | 76.7 | 88.1 |
| SEC-Bench Pro | — | 74.3 | — | — | 56.4 | 30.9 | 62.8 |
| ExploitGym | 22.1 | 33.7 | — | 15.0 | 5.4 | 1.8 | 15.3 |
| HLE w/ tools | 63.6 | — | 59.8 | 62.5 | 60.0 | 51.5 | 63.9 |
| Automation-Bench | 50.3 | 45.8 | 46.7 | 48.8 | 43.2 | 37.7 | 54.8 |
| Agents' Last Exam | 28.6 | 26.7 | 27.6 | 28.5 | 25.7 | 25.2 | 31.8 |
| Chartography w/ tools | 84.0 | 79.9 | 68.1 | — | — | — | 78.9 |
| BabyVision w/ tools | 94.1 | 88.9 | 85.7 | — | — | — | 89.6 |
| ZeroBench-main w/ tools (Pass@5) | 52.0 | 53.0 | 41.0 | — | — | — | 49.0 |
数据来源:DeepSeek-V4.1-Flash 技术报告表 3("—"为报告未提供的数据)。
分领域能力画像(依据报告行文):
- 推理:Codeforces 评分 3471,超过 V4-Flash(3289)与 V4-Pro(3348);MathArena Apex 65.6% 追平开源最强的 Kimi-K3;GPQA Diamond 90.9% 稳步提升。HLE 无工具场景与闭源旗舰仍有差距(36.8 对 Opus-5 的 56.3),但配合工具后 HLE 63.9 已并列全场最高。
- Agent:DeepSWE v1.1 达 74.2%,从 V4-Flash 的 54.4% 大幅跃升并超过 Opus-5(74.0%)与 GPT-5.6 Sol(73.0%);Terminal-Bench 2.1 的 90.6%、Automation-Bench 的 54.8%、Agents' Last Exam 的 31.8% 均为全场最高。报告同时承认:在需要专家级领域知识的科学向 Agent 任务(Terminal-Bench 3.0/4.0)上与巨型模型仍有差距。
- 网络安全:CyberGym 88.1% 为对比模型中最高,SEC-Bench Pro 62.8% 为开源最高。官方基于其双刃剑属性呼吁社区将其负责任地用于防御性安全研究与漏洞修复。
- 视觉 Agent:Chartography 78.9、BabyVision 89.6 超过 Kimi-K3,ZeroBench-main 49.0 与开源/闭源第一梯队接近,但整体与最强闭源模型仍有可见差距。报告特别提到其在真实视觉 Agent 工作流中的实用性:前端开发与办公自动化中可利用渲染后的屏幕截图做视觉检查与自我纠正。
官方对整体定位的表述是:DeepSeek-V4.1-Flash 在绝大多数基准上已能比肩闭源前沿模型,可以完成超过 95% 的真实任务;小激活参数带来低推理延迟与服务成本,是能力与效率之间的有利折中。
5.3 推理效率:KV Cache、FLOPs 与 effort 曲线
效率数据是这份报告的核心卖点,四组数字值得单独列出:
- 全局 KV Cache:890 字节/token,约为 V4-Flash(3514 字节/token)的 1/4、DeepSeek-V1 的 1/437。该缓存常驻 HBM,得益于 CSA2 跨层共享与 FP4 量化的乘法效应。
- 持久化 KV Cache:约为 V4-Flash 的 1/8。两个乘法因子:SWA KV 不再进入持久化缓存(近省一半),全局 KV 又被压到 1/4。部署上,SWA KV 改存于每台机器 10% 主机内存划出的分布式内存池(TTL 仅数分钟、到期立即回收),全局 KV 在 SSD 上保底存活 72 小时;SWA 缓存未命中时由 Encoder SWA Bounded Replay 只回放最后 128 个 token 完成近似重建——官方称这种"有界回放"把灾难性未命中变成优雅且廉价的降级,是整套设计的基石。实验证据显示近似重建对回答质量的影响可忽略,且后训练期间同步模拟了相同的回放以做训练感知适配。
- 解码 FLOPs 与上下文长度解耦:上下文从 4K 扩展 256 倍到 1M,单 token 解码 FLOPs 仅增加约 1/4(按 BF16=1、FP8=0.5、FP4=0.25 的加权口径),显著低于 V4-Flash 的增长曲线——这意味着长上下文下的解码成本接近常数。
- effort-成本曲线:effort 从 25 提到 100,八个推理密集基准的平均 Pass@1 从 67.1% 升至 76.3%,DeepSWE v1.1 从 66.0% 升至 74.2%,Terminal-Bench 2.1 从 82.4% 升至 90.6%,代价是输出 token 约增至 2.5 倍。官方指出收益是前载的:60-80 的 effort 区间已用不到一半的 token 预算收回了最大档的大部分精度,而从 80 到 100 会把 Agent 轨迹拉长 1.6-1.8 倍却只换来边际提升,最大档适合留给最难的任务。
5.4 脚手架鲁棒性与多智能体
为验证 Agent 能力不依赖特定脚手架,报告固定模型权重、解码配置与任务集,只更换 harness,在 6 个脚手架家族共 8 种配置下评测(DeepSWE v1.1 / Terminal-Bench 2.1):Claude Code 69.8/88.0、Codex 65.6/84.1、OpenCode 65.5/85.0、Pi 66.2/86.1、mini-SWE 74.2/90.3、DeepSeek Harness 三种模式 72.6/90.6、70.5/85.8、67.6/85.8。结论是能力可跨脚手架迁移,与训练数据在环境、工具模式、交互格式上的多样性设计一致。
多智能体方面,基于 DeepSeek Harness 的 Agent Team 模式(主 Agent 可异步创建具名持久队友、经持久邮箱通信、共享任务板),RL 奖励在任务成绩之外加入协作奖励(鼓励委派与通信)与推导时延惩罚(把执行事件与协作依赖建模为有向无环图、取关键路径成本)。在按墙钟时限评测的初步实验中:ProgramBench 高置信子集上多智能体 Almost@1 从 1 小时的 13.59% 升至 8 小时峰值 30.04%(单智能体为 12.79% 至 20.39%);FrontierSWE v2 上多智能体 Mean@5 从 13.50%(1 小时)升至 32.90%(20 小时),单智能体为 10.50% 至 28.20%——每个时限下多智能体配置均优于单智能体。
六、局限与官方风险披露
技术报告在结论部分做了三点明确披露,值得完整转述:
- 鲁棒性边界尚未完全摸清。尽管相比 V4-Flash 大幅简化了架构,新引入的设计也制造了尚未完全刻画的鲁棒性边界:CSA2 的潜在选择错误与 SWA Bounded Replay 的近似状态重建,可能在未测试的边界场景造成能力退化。官方表示内部评测未观察到系统性退化,但任何有限测试集都无法覆盖所有极端输入与部署条件,后续将持续扩充针对长上下文稀疏检索与缓存恢复边界的压力测试。
- 基准饱和与真实差距。官方表示该模型的性能已接近 Fable-5、GPT-6 Astra 等顶级模型,在日常应用中提供高度相近的体验,但在最困难的任务上差距仍在:基准分数上的微弱差距不等于在最复杂的高难度推理与边缘场景上追平闭源前沿。
- 评测基础设施正被模型"攻破"。即使做了断网、剥离 Git 历史、清理构建与包管理缓存等防作弊措施,评测中仍观察到"钻空子"行为——例如在 CyberGym 中反编译 Ubuntu 核心软件包寻找漏洞。官方呼吁研究社区在设计下一代基准时优先考虑检测与缓解此类行为。
七、行业观察
第一,设计哲学的转向:把"上下文压缩"从算法问题变成系统问题。 V3 时代 MLA 用低秩隐向量压缩 KV,是单一架构技巧;V4.1 则把 KV Cache 压缩拆解为架构(CSA2 跨层复用)、精度(FP4)、部署(SWA Bounded Replay 与内存池)三层相乘的联合优化,并让每一层都配套了训练基础设施(影子索引器、QAT、训练感知回放)。从模型卡给出的各代数据看,这套路线正在把"每 token 缓存体积"当作与loss同级别的一等指标持续优化。
第二,非对称激活对 Agent 负载的针对性。 8B 的 prefill 激活与 16B 的 decode 激活、加上 prefill 计算砍半,本质上是承认"Agent 时代输入 token 远多于输出 token"这一负载事实,把参数预算倾斜给生成路径。对大量调用工具、反复拼接长上下文的 Agent 应用,这一取舍直接作用于单位成本。定价页显示的并发配额也体现了同样的定位:deepseek-flash 并发 2500,而 deepseek-v4-pro 为 500。
第三,价格与产品线的连锁反应。 官方定价页显示 V4.1 Flash 高峰时段输入(未命中)0.3 美元/输出 1.2 美元每百万 token、低谷减半(峰谷时段为 UTC 周一至周五 01:00-04:00 与 06:00-10:00,即北京时间 9:00-12:00、14:00-18:00,周末全天低谷)。对照 36 氪 9 月 9 日报道的 V4-Flash 原峰谷价(输入 0.44 美元/输出 1.32 美元),新模型上市即降价;对照 V4 Pro 高峰价(输入 1.32 美元/输出 3.96 美元),输入价格约为其 1/4、输出约 1/3。结合"9 月 14 日起 V4 Pro 请求路由至 V4.1 Flash 并按其价格计费"的安排,一款参数量 552B 的模型正在以明显更低的价格接替 1.6T 参数的旗舰,官方明确表示这基于其测试中"性能、成本、速度、总耗时全面超越 V4 Pro"的结论。
跨层共享主 KV 与索引器 K
复用 Top-K 索引"] A --> C["精度层 FP4 QAT
主 KV 存储再减半"] A --> D["部署层 SWA Bounded Replay
SWA KV 不再持久化"] B --> E["全局 KV:890 字节/token
V4-Flash 的 1/4、V1 的 1/437"] C --> E D --> F["持久化 KV:V4-Flash 的 1/8
全局 KV 保底 72 小时"] E --> G["长上下文解码成本接近常数
部署成本显著下降"] F --> G
第四,"数据工程优先"的后训练路线有了量化背书。 官方明确表态:在固定且并不新奇的优化流程下,合成数据与环境在规模、多样性、可验证性上的系统性提升贡献了几乎全部增益。百万级并发沙箱(DSec)、模型自己出题再自我质检的任务生产闭环、40 余个异构教师的在线策略蒸馏,构成了这套路线的完整基建。这一判断对正在跟进 Agent 训练的团队具有直接参考价值:瓶颈更可能在自己的数据与环境管线,而不在算法。
第五,待观察的问题。 技术报告给出的后续看点包括:更大的 V4.1 Pro 是否延续 CED + 纯 CSA2 路线并兑现"可扩展到更大模型"的目标;CSA2 选择错误与 SWA 近似重建在真实生产流量中的鲁棒性表现;以及开源的 MIT 权重能否让第三方在自有硬件上复现报告中的部署成本优势——890 字节/token 的全局 KV 与 EPD 分离架构的效果,最终要由 Hugging Face 之外的部署实践来验证。
举手提问