DeepSeek V4 Flash Vision Exp 上线:API 开始原生接收图片
DeepSeek 发布实验性多模态模型 V4 Flash Vision Exp,现已通过 API 提供图像理解能力,并兼容 Chat Completions、Messages 与 Responses。本文梳理接入方式、成本边界和小团队最值得先测的场景。
2026 年 8 月 21 日,DeepSeek 在 API 平台上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp。开发者将模型参数设置为 deepseek-v4-flash-vision-exp,即可在请求中同时发送文字和图片。
这次更新补上了 DeepSeek V4 Flash 在官方 API 中直接读取图片的能力。图片可以是产品截图、图表、文档页面或网页视觉稿,模型理解后还能继续调用工具完成多步骤任务。对已经使用 V4 Flash 做代码 Agent、内容生产或业务自动化的团队,现有工作流终于可以把视觉信息作为原始输入,而不必先接入另一个模型生成图片描述。
这次开放了哪些能力
DeepSeek 将 Vision Exp 定位为实验模型。官方称其 Agent、推理和世界知识等纯文本能力与 DeepSeek-V4-Flash 正式版基本持平;在需要视觉理解的 Agent 测试中,表现较纯文本版本明显提升,多模态 Agent 能力接近 Claude Opus 4.8。
这项对比来自官方测试,适合用来理解模型定位,暂时不能替代实际业务评测。公开说明没有证明它在所有截图、图表、OCR 或视觉操作任务上都能达到相同水平,实验版本的稳定性和后续升级路径也仍需观察。
目前已确认的 API 能力包括:
项目 | 当前信息 |
|---|---|
模型名 | |
发布状态 | 实验性模型,已在 DeepSeek API 平台开放 |
调用格式 | Chat Completions、Anthropic Messages、Responses |
图片输入 | Base64、外部图片 URL、Files API |
支持格式 | JPEG、PNG、GIF、WebP |
图片计费 | 转换为输入 tokens,单张最多占 384 tokens |
模型价格 | 与 DeepSeek-V4-Flash 一致 |
图片目前应放在用户消息中。已有应用如果继续调用普通的 deepseek-v4-flash,不会因此自动获得图片理解能力,需要显式切换到新的 Vision Exp 模型名,并按所用协议调整图像内容块。
Files API 让多轮图片任务更实用
除了 Base64 和外部 URL,DeepSeek 同时开放了免费的 Files API。开发者可以先上传图片,取得 file_id 后在后续请求中重复引用。文件上传接口本身不收费,模型处理图片时仍按输入和输出 tokens 计费。
这对多轮 Agent 工作流很关键。一张产品界面截图如果要依次经过问题识别、修改建议、代码生成和验收,不需要在每一轮请求里重新编码或上传。团队既能减少请求体积和带宽,也更容易在任务日志中固定同一份视觉输入。
三种传图方式可以按任务选择:
- 单张本地图片、只调用一次:直接使用 Base64,接入最简单。
- 图片已有稳定的公开地址:使用外部 URL,避免扩大请求体。
- 同一图片反复分析或文件较大:先上传 Files API,再通过
file_id复用。
单张图片最多折算为 384 个输入 tokens,使视觉输入成本更容易预测。不过,总成本仍取决于图片数量、文本上下文、推理过程和输出长度。批量任务上线前应记录 API 返回的实际 token 用量,而不能只按单图上限估算整条 Agent 链路。
小团队最值得先测的三个场景
截图驱动的前端修改
把现有页面截图、目标参考图和代码仓库任务同时交给 Agent,测试它能否识别布局差异并完成修改。验收不能停在“生成了代码”,还应加入截图回归,检查间距、字体、响应式布局和交互状态。
图表与业务文档处理
让模型读取仪表盘、运营图表或文档页面,再输出结构化结论。重点记录数字抄录错误、图例对应关系和跨页遗漏。涉及财务、医疗或合规判断时,视觉提取结果仍需要人工或程序校验。
视觉素材的多轮协作
通过 Files API 固定同一批产品图、活动素材或 PPT 页面,让 Agent 连续完成分析、改写和复核。这个场景能直接验证 file_id 复用是否减少传输开销,也能观察长对话中模型是否仍准确指向原图细节。
建议先选 10 到 30 个有明确答案或验收标准的真实任务,并记录四项指标:任务通过率、端到端耗时、每个通过任务的总成本、人工介入次数。还应保留 V4 Flash 纯文本流程或其他视觉模型作为回退,避免实验模型的服务或输出变化直接影响生产任务。
现在还不能下结论的部分
DeepSeek 尚未说明 Vision Exp 是否会进入稳定版本、何时提供正式模型,以及实验期内模型标识和行为会如何变化。官方也没有宣布该实验模型的开源权重。需要本地部署、固定版本或长期可复现结果的团队,目前不宜把 API 可用等同于部署条件已经成熟。
接下来最值得关注的信号有三个:正式版时间表、视觉任务的完整评测配置、API 在连续多图和工具调用场景中的稳定性。现阶段更合适的动作是把它放进真实任务集做小流量对照测试;如果截图理解与后续工具执行能稳定形成闭环,它会显著缩短 DeepSeek Agent 处理视觉任务的接入链路。