DeepSeek API 新价格确认:8 月 17 日起峰谷计价,Pro 高峰输出涨至 27 元

DeepSeek 已公布 API 调价细则,新价格将于 2026 年 8 月 17 日 00:00 生效。V4 Flash 与 V4 Pro 均采用峰谷计价,高峰价格为空闲时段两倍;Pro 高峰输出价升至每百万 tokens 27 元。

DeepSeek API 峰谷计价时段与 V4 模型新价格示意图
DeepSeek API 定价 峰谷计价 大模型成本 AI Agent

DeepSeek API 涨价细则已经落地。官方定价页确认,新价格将于北京时间 2026 年 8 月 17 日 00:00 生效,deepseek-v4-flashdeepseek-v4-pro 都将采用峰谷计价。

高峰时段为每天 9:00—12:00、14:00—18:00,其余时间为空闲时段。空闲价统一为高峰价的一半。与此前价格相比,六项计费价格全部上调,其中变化最大的是 V4 Pro 缓存命中输入:空闲时段变为原价 6 倍,高峰时段变为原价 12 倍。

8 月 6 日的涨价预告只确认了“整体上调、预计涨幅较大”,没有给出价格和生效日。这次更新补齐了开发者真正需要的决策信息:何时生效、哪些模型受影响、不同时间段分别按什么价格计费。

新旧价格一次看清

以下价格单位均为人民币元/百万 tokens。“倍数”表示新价格是旧价格的多少倍,不是涨幅百分比。

模型与计费项

旧价

新空闲价

空闲/旧价

新高峰价

高峰/旧价

V4 Flash 缓存命中输入

0.02

0.05

2.5 倍

0.10

5 倍

V4 Flash 缓存未命中输入

1.00

1.50

1.5 倍

3.00

3 倍

V4 Flash 输出

2.00

4.50

2.25 倍

9.00

4.5 倍

V4 Pro 缓存命中输入

0.025

0.15

6 倍

0.30

12 倍

V4 Pro 缓存未命中输入

3.00

4.50

1.5 倍

9.00

3 倍

V4 Pro 输出

6.00

13.50

2.25 倍

27.00

4.5 倍

换成涨幅百分比后,V4 Pro 缓存命中输入的空闲价上涨 500%,高峰价上涨 1100%;两个模型的缓存未命中输入,空闲价都上涨 50%,高峰价上涨 200%;输出价格则分别上涨 125% 和 350%。

“最高涨至 27 元”指的是 V4 Pro 高峰时段的每百万输出 tokens 单价。它是表中绝对价格最高的一项,但倍数变化最大的项目是 V4 Pro 缓存命中输入。成本分析需要把“单价最高”和“涨幅最大”分开看。

峰谷计价会改变哪些调用决策

新价格不只提高了调用成本,也给不同工作负载增加了调度差异。工作日上午和下午是高峰时段,正好覆盖大量面向国内用户的实时请求。客服、搜索、在线代码助手和交互式 Agent 很难为了省钱延迟响应,因此更可能承担高峰价。

批量任务则有调整空间。离线评测、夜间内容生成、索引整理、文档解析、数据标注和非紧急代码扫描,可以安排在空闲时段。相同 tokens 用量下,空闲成本是高峰的一半。对月调用量较大的团队,任务时间会从运维细节变成直接影响毛利的计费变量。

需要注意的是,空闲价也高于旧价。迁移到空闲时段只能减少本轮调价带来的增量,无法维持原成本。比如 V4 Pro 输出即使避开高峰,也从每百万 tokens 6 元升至 13.5 元,是旧价的 2.25 倍。

缓存仍有价值,但旧成本模型失效了

缓存命中价格的倍数变化最显眼,尤其是 V4 Pro。不过,缓存命中输入的绝对单价依然远低于缓存未命中输入:V4 Pro 高峰时段分别为 0.30 元和 9 元,Flash 高峰时段分别为 0.10 元和 3 元。

因此,缓存优化仍然值得做。稳定系统提示词、固定工具定义、重复知识库前缀和多轮对话历史,都可能继续降低输入成本。变化在于,团队不能再沿用旧价下的预算假设。长会话、高频 RAG 和代码 Agent 即使保持很高缓存命中率,账单也会比以前明显增加。

真正需要重新测算的是“混合账单”,而非单独盯住某一列价格。一次请求的费用通常由三部分组成:

总费用 = 缓存命中输入 tokens × 对应单价 + 缓存未命中输入 tokens × 对应单价 + 输出 tokens × 对应单价

Agent 工作流还会叠加多轮请求、工具返回、失败重试和子任务。输出较长或循环次数较多的任务,受到的影响可能比普通短对话更明显。

固定月费产品需要重算单用户毛利

API 调价最先影响的通常不是偶尔调用模型的个人开发者,而是把模型成本包含在固定套餐中的产品团队。

  • 固定月费但没有 tokens 上限的 AI 工具,需要重新计算重度用户成本。
  • 默认使用 V4 Pro 的产品,应确认哪些任务确实需要 Pro,哪些可以交给 Flash 或其他模型。
  • 实时业务要按高峰价做预算,不能假设请求可以平均分布到全天。
  • 批量工作流应记录实际执行时间,否则月底账单很难解释峰谷差异。
  • 依赖缓存的 Agent 和 RAG 产品,要同时监控缓存命中率、未命中输入和输出长度。

价格比较也不应只看公开单价。模型迁移还会改变任务成功率、重试次数、延迟和人工返工成本。便宜但经常失败的模型,最终单任务成本可能更高。小团队更适合用自己的真实任务集做对照,而不是直接采用社交平台上的通用排名或情绪化结论。

8 月 17 日前应完成的检查

留给团队的准备时间不长,可以优先完成四项检查。

  1. 导出最近 7 天或 30 天的缓存命中输入、缓存未命中输入和输出 tokens,并按模型拆分。
  2. 将实时请求按高峰价重算,将可延迟任务按空闲价重算,得到新的月度成本区间。
  3. 检查套餐限额、免费额度和异常重试,确认涨价后是否会侵蚀毛利或触发预算告警。
  4. 为模型调用层保留切换能力,但先用真实任务验证候选方案,再决定是否迁移。

新价格的核心影响已经可以确定:DeepSeek API 的成本管理从“选哪个模型、用了多少 tokens”,扩展为“什么时候调用”。对于实时产品,高峰价应成为新的默认预算基线;对于可调度任务,空闲窗口则是最直接的降本手段。