DeepSeek 多模态模型上线!能看懂图片吗?

AI动态4天前发布 千寻AI
11 0

一、DeepSeekV4-Flash-Vision-Exp 是什么?

一句话答案:DeepSeek 于 2026 年 8 月 21 日上线了全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp(实验版),开发者把 API 的 model 设为 deepseek-v4-flash-vision-exp 就能调用——这是 DeepSeek 在 API 平台首次正式开放「看得懂图片」的视觉能力,而且纯文本能力没有缩水。

更直白的理解:以前 DeepSeek 网页端识图靠的是内部能力,现在视觉理解做成了独立的 API 模型,开发者可以像调用 V4-Flash 一样把它接进自己的应用、Agent 和工具链。

二、能力到底怎么样?和 V4-Flash 比强在哪?

据 DeepSeek 官方公告:在纯文本的 Agent、推理和世界知识等能力上,V4-Flash-Vision-Exp 与 V4-Flash 正式版保持同一水平;而在需要视觉理解的 Agent 基准上,它相比 V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。

官方与第三方博主整理的基准参考(以官方公布为准):

  • Agent 基准:Terminal Bench 2.1 83.9、NL2Repo 57.7、DeepSWE 59.3、DSBench-Hard 63.6、AutomationBench 25.7。
  • 综合/视觉类:ApexBench(Pass@1)36.5、Agents’ Last Exam 27.3、Chartography 64.3(p0.95)、ZeroBench(Pass@5)35.0。

简单说:文字功底不掉队,多出来的视觉能力是真增量——这也是它叫「Flash + Vision」的原因。

三、官方演示了哪些真实场景?

能力落到场景里才有意义,官方展示了三个例子:

  • 西藏自驾游 PPT:为高端私人定制旅行服务生成「藏南+藏北、一个月、自驾游」攻略 PPT,风格要求野性、粗粝、有探索感,配真实摄影质感图片,并给出三种定价方案,面向高净值客户。
  • DeepSeek Harness 官网二次创作:用黑蓝深海、玻璃 UI、ASCII 原子像素等视觉要素,经多轮交互重构出未来主义风格的开发者网站。
  • 前端 Mini Demo:让一群 3D 黏土小怪物在跃动的复古舞池里蹦迪的动效 Demo。

另外,DeepSeek Harness 已第一时间接入该模型并支持上传图片(升级到 0.1.1-rc.1 及以上即可),以后可以直接用 DeepSeek 验收前端网站效果。站内收录的 DeepSeek Harness 详情页 可以了解这个 Agent 工具。

四、API 怎么调用?怎么计费?

  • 调用方式:设置 model=’deepseek-v4-flash-vision-exp’,支持 Chat Completions、Messages、Responses 三种格式,方便接入各类 Agent 工具。
  • 图片传入:支持图文混合输入,图片可用三种方式传入——base64 内联、外部 URL、Files API。
  • 计费规则:图片会先转换成 token 再按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 一致(百万 tokens 输入约 1 元、输出约 2 元的量级,以官方定价页为准)。
  • Files API(免费):可先把图片上传到平台,请求里通过 file_id 引用;同一张图片在多个请求中无需重复上传,节省请求带宽。

开发者可直接到站内收录的 DeepSeek API 开放平台详情页 查看接入信息。

五、一个省钱骚操作:长文本可以「拍成图」

这次计费有个很有意思的点:一张图片最多只占 384 tokens。如果你的文本特别长(比如几千字的文档),直接塞文本要花几千 token;但把它转成图片再喂给模型,成本可能直接降一个量级——这也是社区第一时间想到的用法(DeepSeek 此前发布的 DeepSeek-OCR 就在做「信息压缩」,把长文档压进图片里)。

不过要注意:这个玩法是否划算,取决于模型对「图片里的文字」的识别准确率,属于社区探索的用法,正经业务场景还是按官方文档来,别拿关键任务赌。

六、高频 FAQ

  • Q:这个模型免费吗?
    A:API 按 token 计费,价格与 V4-Flash 一致;图片单张最多 384 tokens,具体以官方定价页为准。
  • Q:普通用户网页端能用吗?
    A:目前是 API 模型 + DeepSeek Harness 支持,网页/App 是否开放识图以官方公告为准。
  • Q:和 V4-Flash 是什么关系?
    A:同一个家族的兄弟:V4-Flash 是纯文本性价比版,Vision-Exp 在它基础上加了视觉理解,文本能力与 V4-Flash 持平。
  • Q:能替代 Opus-4.8 吗?
    A:多模态 Agent 能力接近 Opus-4.8(据官方),但它是实验模型,生产环境建议先小流量验证。
  • Q:一张图最多 384 tokens 是什么意思?
    A:图片进入 API 前会先缩放处理,再转成 token 计费,单张封顶 384 tokens,所以单图成本可控。
  • Q:和 DeepSeek-OCR 什么关系?
    A:OCR 专注文字识别与信息压缩,Vision-Exp 是通用视觉理解 + Agent 能力,两者互补,都体现 DeepSeek「图像进、token 出」的思路。

总结:DeepSeek 补齐了多模态这块拼图:价格不变、文本不掉队、视觉 Agent 逼近 Opus-4.8,还顺手开放了免费的 Files API。想用 DeepSeek 看图的开发者可以直接上 DeepSeek API 开放平台;普通用户可关注 DeepSeek 详情页DeepSeek 网页版 的后续开放。

© 版权声明

相关文章