DeepSeek 多模态视觉模型正式上线:补齐 Agent 感知入口,价格对齐 V4-Flash
2026 年 8 月 21 日下午,DeepSeek 官方 API 文档的「模型细节」页面悄悄多了一行:deepseek-v4-flash-vision-exp。这是 DeepSeek V4 系列首个直接支持图片输入的视觉模型,从产品定义上补齐了 DeepSeek Agent 框架的「感知入口」。
更重要的是定价策略:Vision-Exp 与 V4-Flash 正式版价格完全一致,图片按尺寸折算成 Token 与文本一同计费,没有额外的视觉税。对一个刚满一周的 Agent 生态来说,这是个重要信号。
一、这次发布的三个关键细节
1. 能力面
- 上下文窗口:1M
- 最大输出长度:384K
- 支持接口:JSON Output、Tool Calls、Responses API、Anthropic API、对话前缀续写
- 计费方式:图片按尺寸折算成 Token,与文本 Token 一同计费
2. 价格面(与 V4-Flash 完全一致)
| 计费类型 | 空闲时段 | 高峰时段 |
|---|---|---|
| 缓存命中 | 0.05 元/百万 Token | 0.10 元/百万 Token |
| 缓存未命中 | 1.5 元/百万 Token | 3 元/百万 Token |
| 输出 | 4.5 元/百万 Token | 9 元/百万 Token |
媒体测算「1000 张图只要 1 块钱」正是基于这个价格带。没有视觉附件溢价——这在多模态模型里是相当激进的定价。
3. 模型定位
模型名带「Exp」(Experimental),DeepSeek 明确这是实验性版本,先在 API 平台跑一段时间,收集反馈后再决定是否升正式版。同步上线的 DeepSeek Harness v0.1.1-rc.1 把视觉能力接入了 /goal、/plan 等命令,Agent Loop 现在可以直接接收图文混合输入。
二、为什么这次发布「被迫加速」
V4-Flash-Vision-Exp 的快速上线不是主动规划,是社区需求倒逼的结果。
时间线:
- 4 月下旬:DeepSeek 发布 V4 预览版(V4-Pro 1.6T/49B,V4-Flash 284B/13B),统一 1M 上下文,但只有纯文本能力
- 8 月 13 日:DeepSeek 更新 V4-Pro,开放 DeepSeek Harness(Agent 执行框架)
- 8 月 13-20 日:开发者尝试在 Harness 里上传图片,直接收到
MODEL_DOES_NOT_SUPPORT_IMAGES错误 - 8 月 21 日:V4-Flash-Vision-Exp 上线 API
Harness 开放仅一周,「怎么让 DeepSeek 看图」就成了 GitHub 讨论区的高频问题。社区开始自发给 DeepSeek「装眼睛」:
- 方案 A:在 DeepSeek 前面接一个 Qwen-VL 等视觉模型,先把图片转成文字描述,再交给 DeepSeek 推理
- 方案 B:修改 Harness,把图片保存到工作区,再由视觉插件/脚本/子 Agent 读取
DeepSeek 显然看到了这个信号,并在最短时间内把官方视觉能力补上——这与 8 月 13 日 Harness 上线相隔刚好 8 天。
三、Vision-Exp 真正改变的是什么
表面上是一次模型上新,实际上改写了 DeepSeek Agent 生态的能力边界。三件事被激活:
1. Agent Loop 不再「断」
之前 Harness 里的 Agent 处理图片时,链路在「读图」这一步就断。Vision-Exp 让图片能直接进入会话上下文,Agent 后续的工具调用、文件处理、规划步骤才真正能跑通。
2. Harness 里的"多模态插件生态"获得原生支持
社区已经做了十几个 vision bridge 插件(dsh-deepresearch 等),但都是 hack。官方视觉能力补齐后,这些插件可以专注于「专业视觉能力」(如 OCR、表格识别、UI 截图分析)而不是「能不能看图」这种基础能力。
3. 价格锚点建立
Vision-Exp 沿用 V4-Flash 价格表,等效于 DeepSeek 宣布"视觉能力不另收税"。这给整个 API 市场建立了一个新锚点——同行后续做多模态 API 定价时,很难再轻松加收"图像理解溢价"。
四、与 V4-Pro 的关系
注意:这次只更新了 V4-Flash 的视觉版本(284B 参数、13B 激活),V4-Pro(1.6T/49B)暂时没有同步上线视觉能力。
这背后有产品节奏的考虑:
- V4-Flash 定位是「高性价比通用模型」,先补齐视觉能让更多开发者用上
- V4-Pro 定位是「高难度推理模型」,视觉能力需要更谨慎地评估(图片会让推理 prompt 变得很长,可能影响 Pro 的核心优势)
- 实验性 Vision-Exp 先收集 2-4 周反馈,V4-Pro 视觉版可能要到 Q4 才会上
DeepSeek 的"先小后大"产品策略——先用 Flash 跑通感知入口,再把视觉能力上探到 Pro——避免了把 Pro 模型一次性做大改动的风险。
五、行业层面的影响
对多模态 API 市场:DeepSeek 用 1M 上下文 + Flash 价格 + 原生视觉组合,把"多模态"这个赛道的入门门槛又往下拉了一截。GPT-4o、Gemini、Claude 等产品的视觉 API 价格如果不做调整,性价比劣势会被进一步放大。
对开源多模态模型:Qwen-VL、InternVL 等开源视觉模型原本在 DeepSeek 生态里承担"补视觉"的桥接角色,现在这个角色被官方接管。开源模型需要找新的差异点(如更强的 OCR、更细的视觉问答、屏幕理解等)。
对 Agent 开发者:Harness 终于能「看」了,用 DeepSeek 做截图分析、UI 操作辅助、文档识别的 Agent 都能跑通。这会催生一批基于视觉能力的新型 Agent 应用。
六、现在就能尝试的 3 个场景
如果你是 API 开发者,今天就能试:
- 文档识别 Agent:上传合同/发票图片,让 Agent 提取结构化信息并写入 CRM
- UI 截图分析:上传产品截图,让 Agent 输出前端代码或定位 UI 问题
- 多模态客服:用户发来商品问题图片,Agent 同时看图+查知识库给回答
模型名称:deepseek-v4-flash-vision-exp
接入方式:DeepSeek API 平台,与 V4-Flash 共用 base_url
七、这次发布的真正信号
V4-Flash-Vision-Exp 的「免费视觉税 + 实验性版本」组合,标志着 DeepSeek 在 Agent 框架层面的策略已经清晰:
- 感知层:先把视觉补齐,下一步大概率是音频、视频
- 执行层:Harness 框架已经能调工具、跑代码、操作文件
- 规划层:V4-Pro 的强推理 + 长上下文是核心
DeepSeek 不再是「纯文本 LLM 厂商」,而是「全栈 Agent 基础设施提供商」。V4-Flash-Vision-Exp 是这个转型的第一块拼图,也是给整个 API 市场的一封战书。