DeepSeek上线视觉模型v4-flash-vision:看图、读截图、分析图表,API与OpenAI完全兼容
DeepSeek 悄悄补上了多模态这一课。8月21日,DeepSeek API 文档更新了视觉能力:新模型 deepseek-v4-flash-vision-exp 支持图片+文字同时输入,可以描述图片、读取截图文字、分析图表,而且接口与 OpenAI 的 Chat Completions 完全兼容——这意味着中文开发者接视觉能力时,又多了一个低门槛、低价位的选项。
三种传图方式,按场景选
官方文档给出了三种喂图方式:Base64 内联(本地文件最简单,但受 48MiB 请求体限制);外链 URL(模型自己下载,链接最长 8192 字符、图片最大 32MiB、下载限时 60 秒);Files API 上传(传一次可反复复用,单张最大 64MiB,适合大图或重复使用)。支持的格式为 JPEG、PNG、GIF、WebP,按文件实际内容识别而非扩展名。另外还支持 detail 参数控制处理精度:low 会缩到 512×512 再推理,更快更省;high/original 保留原图。
对开发者意味着什么
对国内团队来说,这次更新的价值主要在三点:一是兼容 OpenAI 格式,现有的图片理解代码改个 base_url 和模型名就能切过来,迁移成本几乎为零;二是多模态 API 市场多了一个价格变量,中文语境下的 OCR、截图理解、图表解析又多了一个候选;三是模型名带 exp 后缀,说明仍是实验版本——适合搭原型和验证场景,上生产前要先压测。目前文档还没公布详细价格,计费按图片尺寸换算 Token 与文本一起结算。
和现有视觉 API 怎么选
如果你已经在用 OpenAI 的 GPT-4o、Anthropic 的 Claude 或国内其他家的视觉接口,这次更新的价值在于多了一个”按场景分流”的选项:简单 OCR、截图理解、图标识别这类高频低难度任务,完全可以用 DeepSeek 的 flash 级模型跑,把贵模型留给复杂推理场景。detail: low 模式把图片先缩到 512×512 再推理,进一步压低成本,适合对细节不敏感的场景。当然,视觉能力的实际效果(中英文混排、复杂表格、手写体)还需要实测,文档目前也没有给出明确的评测数据——建议先用小样本跑一轮对比再决定要不要切换。
谁该关注,谁可以忽略
谁该关注:做文档识别、截图问答、图表分析、多模态 RAG 的开发者,以及想给产品快速加”看图说话”能力的小团队——先用 detail: low 跑通流程再优化成本。谁可以忽略:暂时不需要图像理解能力的纯文本应用,可以等模型转正、价格明确后再评估。
一句话判断:DeepSeek 的视觉版来了,多模态 API 的价格战正式进入”中国玩家”时间。对开发者,这周最值得做的事就是拿一张截图试跑一遍。跑通之后别忘了关注两件事:一是 exp 模型后续会不会转正、定价会不会调整;二是它和自家文本模型的组合能力——同一家供应商一个 Key 同时搞定图文,运维成本会比”文本一家、视觉一家”低不少。对产品经理来说,这也是个信号:图片理解已经从”旗舰功能”变成”标配能力”,该考虑把它放进路线图了。
🔥 关注LC智趣厅,每天一条硬核科技观察。
👇 关注不错过。
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn