DeepSeek-V4-Flash 正式版 API 公测:Agent 能力升级,原生适配 Codex

DeepSeek-V4-Flash-0731 正式版 API 开启公测,模型架构与参数规模不变,重点通过后训练增强 Agent 与代码任务,并新增 Responses API 和 Codex 适配。

深海蓝光束穿过标有 V4 FLASH API 的发光接口门户
DeepSeek DeepSeek-V4-Flash Agent Codex API

2026 年 7 月 31 日,DeepSeek 将官方 API 中的 deepseek-v4-flash 升级为 DeepSeek-V4-Flash-0731,并以正式版模型、API 公测的方式开放。现有开发者无需更换模型名,继续调用 deepseek-v4-flash 即可获得新版本。

这次更新只作用于 V4-Flash API。DeepSeek-V4-Pro API、网页端和 App 端模型没有同步变化。官方表示 V4-Pro 正式版将尽快发布,其 Responses API 与 Codex 支持计划在 2026 年 8 月初加入。

参数没变,重点放在 Agent 后训练

DeepSeek-V4-Flash-0731 沿用了 Preview 版的模型架构和参数规模:2840 亿总参数、每个 Token 激活 130 亿参数。两者之间的差异主要来自重新后训练,优化方向集中在工具调用、代码修改和多步骤 Agent 任务。

DeepSeek 公布了九项 Agent 与代码任务成绩,并称新版本在对应对比中超过 V4-Pro Preview:

基准

V4-Flash-0731 成绩

Terminal Bench 2.1

82.7

NL2Repo

54.2

Cybergym

76.7

DeepSWE

54.4

Toolathlon Verified

70.3

Agent Last Exam

25.2

Automation Bench(Public)

25.1

DSBench-FullStack

68.7

DSBench-Hard

59.6

这组数字能说明官方优化的方向,但还不能直接等同于所有真实开发任务的提升。公开代码 Agent 测试使用了尚未发布的 DeepSeek Harness 极简模式,设置为最大推理强度、top_p=0.95temperature=1.0;DSBench-FullStack 和 DSBench-Hard 又是内部测试集。等 Harness 开放、测试环境可复现后,开发者才能更准确地比较不同模型的完成率、耗时和实际成本。

Responses API 让 Codex 接入成为主线能力

V4-Flash 正式版原生支持 Responses API,并针对 Codex 做了适配。对已经使用 Codex CLI、ChatGPT 桌面端或 VS Code Codex 扩展的开发者,这比单纯增加一项基准成绩更直接:模型可以进入现有的编码 Agent 客户端,承担读取代码、调用工具和连续修改等任务。

官方文档当前列出的 V4-Flash API 能力包括:

  • 思考与非思考两种模式,默认开启思考模式;
  • 100 万 Token 上下文,最大输出 38.4 万 Token;
  • JSON 输出、工具调用与 Responses API;
  • OpenAI ChatCompletions、Anthropic API 等接入格式;
  • 2500 的并发上限。

模型本身仍是纯文本模型。涉及截图理解、界面视觉检查或图片输入的编码任务,需要客户端另外接入视觉模型或代理处理,不能仅凭 V4-Flash 完成。

当前价格低,但峰谷计费规则仍待生效

DeepSeek 官方定价页目前给出的 V4-Flash 参考价格如下:

计费项

每百万 Token 价格

缓存命中输入

0.0028 美元

缓存未命中输入

0.14 美元

输出

0.28 美元

这套价格对重复读取系统提示、仓库说明和稳定上下文的 Agent 场景很有吸引力。不过成本评估不能只看输入单价。长任务会产生多轮工具调用、上下文回传和大量输出,最大推理强度也可能显著增加 Token 消耗。

官方还预告将引入峰谷计费:北京时间每天 9:00—12:00、14:00—18:00 的峰时价格将按常规价格的两倍计算,具体生效日尚未公布。准备接入生产环境的团队应把这一变量纳入预算,并在上线前再次检查定价页。

小团队最值得先测三类任务

此次公测适合用真实仓库做小规模验证,不宜只依据排行榜直接替换现有模型。可以优先测试:

  1. 边界清晰的代码修改:给定测试、文件范围和验收条件,观察一次完成率与误改率。
  2. 多工具连续执行:让模型完成检索、编辑、运行测试和修复,记录中断、循环调用与失败恢复情况。
  3. 长上下文代码理解:输入较大仓库的说明与关键模块,比较缓存命中率、首字延迟、总耗时和完整任务成本。

测试时应固定客户端、Harness、推理强度、采样参数和任务集。否则模型差异很容易与执行框架差异混在一起。涉及私有代码、客户数据或线上权限时,还要先设定最小权限、敏感信息脱敏和人工审批节点。

公测阶段还要观察什么

V4-Flash-0731 的产品信号很清楚:DeepSeek 正在把 Flash 从低成本通用模型推向编码与 Agent 执行场景,同时保留原有模型名,降低迁移成本。对独立开发者和小团队,最现实的价值是多了一个可接入 Codex、支持超长上下文且单价较低的 API 选项。

现阶段仍有三个待确认点:尚未发布的 DeepSeek Harness 会怎样影响复现结果;公开任务中的优势能否延伸到团队自己的仓库;峰谷计费正式生效后,长时间运行的 Agent 成本会如何变化。先用一组可重复的内部任务跑通质量、延迟和账单,再决定是否扩大使用范围,会比追逐单项基准更可靠。