智东西8月21日报道,就在刚刚,DeepSeek宣布全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp(实验性质模型)上线DeepSeek API 平台。
DeepSeek同步公布了这一模型的详细基准测试结果。根据模型名字推测,DeepSeek-V4-Flash-Vision-Exp是在DeepSeek-V4-Flash基础上打造的,基准测试中其纯文本能力(Agent、推理、世界知识等)与DeepSeek-V4-Flash正式版持平。
在需要视觉理解的Agent Benchmark上,DeepSeek-V4-Flash-Vision-Exp相比DeepSeek-V4-Flash实现了大幅提升,多模态Agent能力已接近Opus 4.8。
要使用这一模型,开发者需将模型参数设置为deepseek-v4-flash-vision-exp,即可通过API调用V4-Flash-Vision-Exp的图像理解能力。
计费上,图片会先转换为token再计入用量,单张图片最多按384 tokens计算,价格与V4-Flash模型持平。据此计算,高峰时段用该模型理解一张图片的最高价格为0.001152元。
调用方式上,这套多模态API同时兼容Chat Completions、Messages、Responses三种格式,支持图文混合输入,方便接入各类Agent工具;图片传入支持base64内联和外部URL两种方式。
此外,DeepSeek还同步上线了免费的Files API,开发者可以先把图片上传到平台,后续请求中凭file_id直接引用,同一张图片无需重复上传,能省下一笔重复传输的开销。
DeepSeek官方称,V4-Flash-Vision-Exp在各类Agent框架内展现出了较好的多模态适配能力,能够有效支持用户借助多样化的Agent工具解锁更多实用的工作场景。
比如,用户可以用V4-Flash-Vision-Exp制作PPT内容,模型可以理解真实摄影图片风格、野性、原始、探索感等较为抽象的风格化要求。
V4-Flash-Vision-Exp还可以被用于视觉编程任务,比如对DeepSeek Harness官网进行二次创作,加上黑蓝深海、玻璃UI和ASCII原子像素等视觉要素。
可以看到,V4-Flash-Vision-Exp打造的网页视觉特效还是较为精美的,动画流畅,文字质感不错。
值得一提的是,8月19日,DeepSeek Harness已经先行更新,将多模态能力作为升级重点,覆盖多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向,既补齐了Agent处理图片等多模态任务的能力,也进一步完善了子代理协作、终端交互和工具调用体验。
今天,DeepSeek Harness再次更新,DeepSeek模型适配器新增DeepSeek-V4-Flash-Vision-Exp多模态模型选项,并支持配置原生图片请求。
结语:DeepSeek多模态API,终于补齐
多模态理解早已是主流大模型的标配能力,截图、文档、网页、UI界面,许多真实工作大多绕不开看图这一步。但在这条赛道上,DeepSeek长期是个例外,直到今年4月底,DeepSeek才以灰度测试的方式上线识图模式,6月在网页端和App全量开放,而面向开发者的多模态API,则一直等到了今天。
随着DeepSeek多模态模型的上线,DeepSeek Harness+V4-Flash-Vision-Exp的组合可能会衍生出更多有趣玩法。这一模型还符合DeepSeek一贯的定价风格,多模态调用的价格门槛,大概率还会被再拉低一档。

