产品简介
DeepSeek-V4.1-Flash 是深度求索于 2026 年 9 月 10 日发布的全新模型结构系列中的最小尺寸模型,也是该家族首个正式版。它采用全新的 Causal Encoder-Decoder 架构,设计目标是能力上限更高、推理速度更快、吞吐更大,并可扩展到更大参数规模的模型。
模型为 552B MoE 架构,prefill 阶段激活约 8B 参数、解码阶段激活约 16B 参数,支持 1M 上下文与最大 384K 输出。最值得关注的是 KV 缓存优化:FP4 量化的全局 KV 缓存降至每 token 约 890 字节,约为上一代 V4-Flash 的四分之一,显著降低了 Agent 长上下文场景的显存与存储成本。
它是 DeepSeek 首个原生支持多模态视觉理解的正式版模型,在需要视觉理解的 Agent 基准上直接衔接了 8 月底 Vision-Exp 实验版验证过的方向。API 模型名更新为 deepseek-flash,MIT 协议开源上架 Hugging Face,第三方云平台同步接入。
核心功能
- 原生多模态视觉理解:无需外挂视觉模块,单模型直接处理图像输入,Chartography w/tools 78.9、BabyVision w/tools 89.6,视觉 Agent 能力由 8 月实验版正式转正。
- 极致压缩的 KV 缓存:FP4 全局 KV 缓存每 token 约 890 字节,HBM 占用约为 V4-Flash 的四分之一、SSD 存储约为八分之一,长会话 Agent 与大批量并发的硬件门槛大幅下降。
- 1M 上下文与 384K 输出:上下文窗口 1M、最大输出 384K,配合极低的 KV 缓存开销,适合代码库级理解、超长文档处理与多轮智能体任务。
- Agent 能力全面加强:Terminal-Bench 2.1 90.6、DeepSWE v1.1 74.2、CyberGym 88.1、NL2Repo-Bench 65.4、Automation-Bench 54.8,官方测试基于 DeepSeek Harness 框架 max 档位。
- MIT 协议开源:模型权重以 MIT License 在 Hugging Face 开放,支持商用与二次开发,延续 DeepSeek 一贯的完全开源策略。
- API 大幅降价:随模型上线 API 价格同步下调,输入缓存未命中低至每百万 token 1 元(空闲时段),并提供峰谷定价与最高 2500 并发,性价比进一步拉高。
适合谁用
以下类型的用户会特别受益于 DeepSeek V4.1-Flash:
- 长上下文 Agent 任务:1M 上下文加四分之一的 KV 缓存开销,适合跑长会话智能体、代码库级分析与批量文档处理
- 多模态应用:图表理解、视觉问答、界面截图转操作等需要原生视觉的场景可直接调用
- 成本敏感的规模化部署:峰谷定价加低并发门槛,适合把大批量离线任务安排到空闲时段跑
- 私有化部署:MIT 协议加低显存需求,企业可以在有限 GPU 资源上跑更大并发
- 编程与研发自动化:Terminal-Bench、DeepSWE、CyberGym 等基准显示其在终端操作、软件工程与安全任务上的能力
优点亮点
- 官方与第三方测试均显示其性能、费用、速度、总用时全面超越自家旗舰 V4 Pro
- KV 缓存压缩技术领先,长上下文 Agent 的内存成本降低一个量级
- 原生视觉理解免外挂,多模态与文本任务统一在单模型内完成
- MIT 协议完全开源,商用无限制
- API 定价极低,输入缓存未命中空闲时段每百万 token 仅 1 元
- DeepSeek、硅基流动等多渠道同步上线,接入门槛低
价格与方案
API 峰谷定价(每百万 token):输入缓存命中空闲 0.02 元、高峰 0.04 元;输入未命中空闲 1 元、高峰 2 元;输出空闲 4 元、高峰 8 元。高峰时段为北京时间工作日 9:00-12:00、14:00-18:00。并发限制 2500。模型权重 MIT 协议开源,自部署无授权费用。
总结与建议
DeepSeek-V4.1-Flash 是 2026 年国内开源模型阵营最重要的一次更新。它用新架构同时做到了能力提升和成本骤降,官方直接以它替代自家旗舰 V4 Pro,第三方实测也认可这个判断。对需要长上下文 Agent、多模态理解和低成本规模化部署的团队,它是当前开源阵营的首选之一;对 API 用户,峰谷定价加缓存优惠把成本压到了行业最低档。
版本演进
- DeepSeek-V4.1-Flash 正式发布,同步开源并上线 API (2026-09-10):新架构家族最小尺寸模型首发:552B MoE(prefill 激活 8B、解码激活 16B)、原生视觉理解、1M 上下文、FP4 KV 缓存每 token 约 890 字节。API 模型名 deepseek-flash,旧名 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 下线并由新模型承接,V4 Pro 计划有序下线(9 月 14 日 12 时后请求路由至 V4.1 Flash)。MIT 协议开源,API 价格同步下调。