一、DeepSeek–V4-Flash-Vision-Exp 是什么?
一句话答案:DeepSeek 于 2026 年 8 月 21 日上线了全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp(实验版),开发者把 API 的 model 设为 deepseek-v4-flash-vision-exp 就能调用——这是 DeepSeek 在 API 平台首次正式开放「看得懂图片」的视觉能力,而且纯文本能力没有缩水。
更直白的理解:以前 DeepSeek 网页端识图靠的是内部能力,现在视觉理解做成了独立的 API 模型,开发者可以像调用 V4-Flash 一样把它接进自己的应用、Agent 和工具链。
二、能力到底怎么样?和 V4-Flash 比强在哪?
据 DeepSeek 官方公告:在纯文本的 Agent、推理和世界知识等能力上,V4-Flash-Vision-Exp 与 V4-Flash 正式版保持同一水平;而在需要视觉理解的 Agent 基准上,它相比 V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。
官方与第三方博主整理的基准参考(以官方公布为准):
- Agent 基准:Terminal Bench 2.1 83.9、NL2Repo 57.7、DeepSWE 59.3、DSBench-Hard 63.6、AutomationBench 25.7。
- 综合/视觉类:ApexBench(Pass@1)36.5、Agents’ Last Exam 27.3、Chartography 64.3(p0.95)、ZeroBench(Pass@5)35.0。
简单说:文字功底不掉队,多出来的视觉能力是真增量——这也是它叫「Flash + Vision」的原因。
三、官方演示了哪些真实场景?
能力落到场景里才有意义,官方展示了三个例子:
- 西藏自驾游 PPT:为高端私人定制旅行服务生成「藏南+藏北、一个月、自驾游」攻略 PPT,风格要求野性、粗粝、有探索感,配真实摄影质感图片,并给出三种定价方案,面向高净值客户。
- DeepSeek Harness 官网二次创作:用黑蓝深海、玻璃 UI、ASCII 原子像素等视觉要素,经多轮交互重构出未来主义风格的开发者网站。
- 前端 Mini Demo:让一群 3D 黏土小怪物在跃动的复古舞池里蹦迪的动效 Demo。
另外,DeepSeek Harness 已第一时间接入该模型并支持上传图片(升级到 0.1.1-rc.1 及以上即可),以后可以直接用 DeepSeek 验收前端网站效果。站内收录的 DeepSeek Harness 详情页 可以了解这个 Agent 工具。
四、API 怎么调用?怎么计费?
- 调用方式:设置 model=’deepseek-v4-flash-vision-exp’,支持 Chat Completions、Messages、Responses 三种格式,方便接入各类 Agent 工具。
- 图片传入:支持图文混合输入,图片可用三种方式传入——base64 内联、外部 URL、Files API。
- 计费规则:图片会先转换成 token 再按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 一致(百万 tokens 输入约 1 元、输出约 2 元的量级,以官方定价页为准)。
- Files API(免费):可先把图片上传到平台,请求里通过 file_id 引用;同一张图片在多个请求中无需重复上传,节省请求带宽。
开发者可直接到站内收录的 DeepSeek API 开放平台详情页 查看接入信息。
五、一个省钱骚操作:长文本可以「拍成图」
这次计费有个很有意思的点:一张图片最多只占 384 tokens。如果你的文本特别长(比如几千字的文档),直接塞文本要花几千 token;但把它转成图片再喂给模型,成本可能直接降一个量级——这也是社区第一时间想到的用法(DeepSeek 此前发布的 DeepSeek-OCR 就在做「信息压缩」,把长文档压进图片里)。
不过要注意:这个玩法是否划算,取决于模型对「图片里的文字」的识别准确率,属于社区探索的用法,正经业务场景还是按官方文档来,别拿关键任务赌。
六、高频 FAQ
- Q:这个模型免费吗?
A:API 按 token 计费,价格与 V4-Flash 一致;图片单张最多 384 tokens,具体以官方定价页为准。 - Q:普通用户网页端能用吗?
A:目前是 API 模型 + DeepSeek Harness 支持,网页/App 是否开放识图以官方公告为准。 - Q:和 V4-Flash 是什么关系?
A:同一个家族的兄弟:V4-Flash 是纯文本性价比版,Vision-Exp 在它基础上加了视觉理解,文本能力与 V4-Flash 持平。 - Q:能替代 Opus-4.8 吗?
A:多模态 Agent 能力接近 Opus-4.8(据官方),但它是实验模型,生产环境建议先小流量验证。 - Q:一张图最多 384 tokens 是什么意思?
A:图片进入 API 前会先缩放处理,再转成 token 计费,单张封顶 384 tokens,所以单图成本可控。 - Q:和 DeepSeek-OCR 什么关系?
A:OCR 专注文字识别与信息压缩,Vision-Exp 是通用视觉理解 + Agent 能力,两者互补,都体现 DeepSeek「图像进、token 出」的思路。
总结:DeepSeek 补齐了多模态这块拼图:价格不变、文本不掉队、视觉 Agent 逼近 Opus-4.8,还顺手开放了免费的 Files API。想用 DeepSeek 看图的开发者可以直接上 DeepSeek API 开放平台;普通用户可关注 DeepSeek 详情页 与 DeepSeek 网页版 的后续开放。