DeepSeek V4.1 Flash 发布:原生多模态、API 降价,V4 Pro 将切换路由

DeepSeek 发布 V4.1 Flash,以 552B MoE 非对称架构降低输入与缓存成本,加入原生视觉理解,并将在 9 月 14 日起承接 V4 Pro 的 API 请求。

DeepSeek V4.1 Flash 蓝色数字鲸鱼与多模态数据流封面图
DeepSeek DeepSeek V4.1 Flash 多模态模型 AI Agent 模型 API

DeepSeek 于 2026 年 9 月 10 日发布 V4.1 Flash,并同步上线 API 与开源权重。新模型采用 552B 参数的 MoE 架构,输入阶段激活 8B 参数,输出阶段激活 16B 参数;它还把视觉理解纳入主力模型,并下调 API 价格。

对正在使用 DeepSeek API 的开发者,更紧迫的变化发生在模型路由上。deepseek-v4-flashdeepseek-v4-flash-vision-exp 已停止提供原模型服务,旧模型名暂时兼容,但请求会由 V4.1 Flash 处理。北京时间 2026 年 9 月 14 日 12:00 后,deepseek-v4-pro 的请求也将路由至 V4.1 Flash,直到 V4.1 Pro 上线,并按 Flash 单价计费。

新架构把读取与生成分开计算

V4.1 Flash 是 DeepSeek 新模型结构系列中尺寸最小的型号。它采用 Causal-Encoder-Decoder 非对称结构:处理输入时激活 8B 参数,生成输出时激活 16B 参数。与输入、输出使用相同激活规模相比,这种设计更贴近 Agent 的实际负载——读取代码库、历史对话和文档时输入很长,最终产出的代码、判断或操作指令往往短得多。

官方还披露了两项与长任务成本直接相关的数据:与上一代模型相比,V4.1 Flash 的 KV Cache 对 HBM 的需求降至四分之一,对 SSD 的需求降至八分之一;相较 DeepSeek 初代模型,KV Cache 规模累计缩小 437 倍。

这些改动不会自动保证每项任务都更省钱。Agent 的实际账单仍会受到上下文长度、缓存命中率、思考过程、工具调用轮次和失败重试的影响。不过,对于反复读取相同代码、工具说明和对话历史的工作流,缓存压缩和命中输入降价会共同降低连续运行成本。

视觉理解进入统一 API

V4.1 Flash 原生支持图像理解,开发者可以在同一个模型入口中处理文字与图片。旧的 V4 Flash Vision Exp 属于实验模型,此次更新后,其模型名仅作为兼容入口存在。

目前 deepseek-flash 支持 100 万 Token 上下文、最大 384K Token 输出,并提供思考与非思考模式、JSON Output、工具调用、Responses API、Anthropic 兼容接口和图像理解。对于需要读取界面截图、图表、扫描资料或视觉文档的 Agent,统一入口可以减少模型切换与任务分流。

这里仍要区分“支持图片输入”和“适合生产流程”。团队在迁移前应使用自己的真实资料测试 OCR、图表理解、界面定位和多轮引用的一致性,尤其是数字密集型文档;官方基准成绩不能替代业务数据上的回归测试。

API 价格如何变化

新价格已于北京时间 2026 年 9 月 10 日 12:00 生效,按每百万 Token 计费:

计费项

空闲时段

高峰时段

缓存命中输入

0.02 元

0.04 元

缓存未命中输入

1 元

2 元

输出

4 元

8 元

高峰时段为北京时间周一至周五 9:00—12:00、14:00—18:00,其余时间为空闲时段。空闲价格是高峰价格的一半。与同时在售的 V4 Pro 价格相比,V4.1 Flash 的差距尤其明显:V4 Pro 高峰时段的缓存未命中输入与输出价格分别为每百万 Token 9 元和 27 元。

低单价对批处理和可调度任务更有价值。内容归档、代码库索引、批量分类等工作如果不要求即时返回,可以放在空闲时段;面向用户的实时请求则应先评估延迟、并发和质量,而不是单纯为价格调整调用时间。

迁移时先检查这四件事

现有项目可以暂时依赖旧模型名的兼容路由,但新接入应直接使用 deepseek-flash。小团队在 9 月 14 日前后可以按以下顺序处理:

  1. 盘点模型名。 搜索配置、环境变量和网关规则中的 deepseek-v4-flashdeepseek-v4-flash-vision-expdeepseek-v4-pro
  2. 重跑质量基线。 用固定任务集比较结构化输出、工具调用、代码修改、视觉理解和长任务稳定性,不要只看一次对话体验。
  3. 重算成本。 分开记录缓存命中输入、未命中输入和输出 Token;长思考与多轮重试可能抵消部分单价优势。
  4. 保留回滚策略。 V4 Pro 请求将在指定时间自动改由新模型处理。依赖其特定输出风格或行为的生产流程,需要提前保存测试结果并设置异常告警。

官方表示,V4.1 Flash 在性能、费用、速度和任务总用时方面全面超过 V4 Pro,但这是官方测试结论。对开发团队而言,最可靠的判断仍来自自身任务集,尤其是带工具调用、长上下文和图片输入的端到端测试。

开源不代表轻量部署

DeepSeek 已在 Hugging Face 发布 V4.1 Flash 权重和技术报告。开源让研究者与基础设施团队可以研究新架构、适配推理框架或进行私有部署,但 552B 总参数并不适合常规小团队直接自托管。官方面向大规模部署需求提到约 2,000 张 GPU 和存储集群这一资源量级。

因此,多数独立开发者和创业团队当前更现实的路径仍是先使用 API 验证产品价值。需要数据隔离、定制推理或大规模稳定负载时,再评估云上专有部署、第三方推理服务或自建集群。接下来最需要观察的是 V4.1 Pro 的发布时间与能力差异,以及旧模型名兼容路由会保留多久;官方目前尚未给出这两个时间点。