跳到主要内容

DeepSeek 多模态视觉模型正式上线:补齐 Agent 感知入口,价格对齐 V4-Flash

2026 年 8 月 21 日下午,DeepSeek 官方 API 文档的「模型细节」页面悄悄多了一行:deepseek-v4-flash-vision-exp。这是 DeepSeek V4 系列首个直接支持图片输入的视觉模型,从产品定义上补齐了 DeepSeek Agent 框架的「感知入口」

更重要的是定价策略:Vision-Exp 与 V4-Flash 正式版价格完全一致,图片按尺寸折算成 Token 与文本一同计费,没有额外的视觉税。对一个刚满一周的 Agent 生态来说,这是个重要信号。

一、这次发布的三个关键细节

1. 能力面

  • 上下文窗口:1M
  • 最大输出长度:384K
  • 支持接口:JSON Output、Tool Calls、Responses API、Anthropic API、对话前缀续写
  • 计费方式:图片按尺寸折算成 Token,与文本 Token 一同计费

2. 价格面(与 V4-Flash 完全一致)

计费类型空闲时段高峰时段
缓存命中0.05 元/百万 Token0.10 元/百万 Token
缓存未命中1.5 元/百万 Token3 元/百万 Token
输出4.5 元/百万 Token9 元/百万 Token

媒体测算「1000 张图只要 1 块钱」正是基于这个价格带。没有视觉附件溢价——这在多模态模型里是相当激进的定价。

3. 模型定位

模型名带「Exp」(Experimental),DeepSeek 明确这是实验性版本,先在 API 平台跑一段时间,收集反馈后再决定是否升正式版。同步上线的 DeepSeek Harness v0.1.1-rc.1 把视觉能力接入了 /goal/plan 等命令,Agent Loop 现在可以直接接收图文混合输入

二、为什么这次发布「被迫加速」

V4-Flash-Vision-Exp 的快速上线不是主动规划,是社区需求倒逼的结果。

时间线:

  • 4 月下旬:DeepSeek 发布 V4 预览版(V4-Pro 1.6T/49B,V4-Flash 284B/13B),统一 1M 上下文,但只有纯文本能力
  • 8 月 13 日:DeepSeek 更新 V4-Pro,开放 DeepSeek Harness(Agent 执行框架)
  • 8 月 13-20 日:开发者尝试在 Harness 里上传图片,直接收到 MODEL_DOES_NOT_SUPPORT_IMAGES 错误
  • 8 月 21 日:V4-Flash-Vision-Exp 上线 API

Harness 开放仅一周,「怎么让 DeepSeek 看图」就成了 GitHub 讨论区的高频问题。社区开始自发给 DeepSeek「装眼睛」:

  • 方案 A:在 DeepSeek 前面接一个 Qwen-VL 等视觉模型,先把图片转成文字描述,再交给 DeepSeek 推理
  • 方案 B:修改 Harness,把图片保存到工作区,再由视觉插件/脚本/子 Agent 读取

DeepSeek 显然看到了这个信号,并在最短时间内把官方视觉能力补上——这与 8 月 13 日 Harness 上线相隔刚好 8 天。

三、Vision-Exp 真正改变的是什么

表面上是一次模型上新,实际上改写了 DeepSeek Agent 生态的能力边界。三件事被激活:

1. Agent Loop 不再「断」

之前 Harness 里的 Agent 处理图片时,链路在「读图」这一步就断。Vision-Exp 让图片能直接进入会话上下文,Agent 后续的工具调用、文件处理、规划步骤才真正能跑通

2. Harness 里的"多模态插件生态"获得原生支持

社区已经做了十几个 vision bridge 插件(dsh-deepresearch 等),但都是 hack。官方视觉能力补齐后,这些插件可以专注于「专业视觉能力」(如 OCR、表格识别、UI 截图分析)而不是「能不能看图」这种基础能力

3. 价格锚点建立

Vision-Exp 沿用 V4-Flash 价格表,等效于 DeepSeek 宣布"视觉能力不另收税"。这给整个 API 市场建立了一个新锚点——同行后续做多模态 API 定价时,很难再轻松加收"图像理解溢价"。

四、与 V4-Pro 的关系

注意:这次只更新了 V4-Flash 的视觉版本(284B 参数、13B 激活),V4-Pro(1.6T/49B)暂时没有同步上线视觉能力

这背后有产品节奏的考虑:

  • V4-Flash 定位是「高性价比通用模型」,先补齐视觉能让更多开发者用上
  • V4-Pro 定位是「高难度推理模型」,视觉能力需要更谨慎地评估(图片会让推理 prompt 变得很长,可能影响 Pro 的核心优势)
  • 实验性 Vision-Exp 先收集 2-4 周反馈,V4-Pro 视觉版可能要到 Q4 才会上

DeepSeek 的"先小后大"产品策略——先用 Flash 跑通感知入口,再把视觉能力上探到 Pro——避免了把 Pro 模型一次性做大改动的风险。

五、行业层面的影响

对多模态 API 市场:DeepSeek 用 1M 上下文 + Flash 价格 + 原生视觉组合,把"多模态"这个赛道的入门门槛又往下拉了一截。GPT-4o、Gemini、Claude 等产品的视觉 API 价格如果不做调整,性价比劣势会被进一步放大

对开源多模态模型:Qwen-VL、InternVL 等开源视觉模型原本在 DeepSeek 生态里承担"补视觉"的桥接角色,现在这个角色被官方接管。开源模型需要找新的差异点(如更强的 OCR、更细的视觉问答、屏幕理解等)。

对 Agent 开发者:Harness 终于能「看」了,用 DeepSeek 做截图分析、UI 操作辅助、文档识别的 Agent 都能跑通。这会催生一批基于视觉能力的新型 Agent 应用。

六、现在就能尝试的 3 个场景

如果你是 API 开发者,今天就能试:

  1. 文档识别 Agent:上传合同/发票图片,让 Agent 提取结构化信息并写入 CRM
  2. UI 截图分析:上传产品截图,让 Agent 输出前端代码或定位 UI 问题
  3. 多模态客服:用户发来商品问题图片,Agent 同时看图+查知识库给回答

模型名称deepseek-v4-flash-vision-exp 接入方式:DeepSeek API 平台,与 V4-Flash 共用 base_url

七、这次发布的真正信号

V4-Flash-Vision-Exp 的「免费视觉税 + 实验性版本」组合,标志着 DeepSeek 在 Agent 框架层面的策略已经清晰:

  • 感知层:先把视觉补齐,下一步大概率是音频、视频
  • 执行层:Harness 框架已经能调工具、跑代码、操作文件
  • 规划层:V4-Pro 的强推理 + 长上下文是核心

DeepSeek 不再是「纯文本 LLM 厂商」,而是「全栈 Agent 基础设施提供商」。V4-Flash-Vision-Exp 是这个转型的第一块拼图,也是给整个 API 市场的一封战书。