DeepSeek终于上视觉了!!!
新模型DeepSeek-V4-Flash-Vision-Exp今日正式登陆 DeepSeek API 平台,这是一款实验性多模态模型,Flash 系列从此有了"眼睛"。
核心点先说清楚:这个模型在文本能力上和 V4-Flash 齐平,代理、推理、世界知识一个没落,还有一些提高。但加上视觉之后,它的多模态代理表现有了一次明显跳跃,在相关基准测试上直接逼近 Claude Opus-4.8 的水准。
配套工具也到位了。DeepSeek Harness 0.1.1 今天同步发布,开箱就支持这个新模型,接入各类代理框架没有额外负担。
收费
图片按 token 计费,每张最多 384 个 token,价格跟 V4-Flash 一致。支持 Chat Completions、Messages 和 Responses 三种接口,图片可以用 base64、外部 URL 或者 Files API 传进来。
文件 API,这次也一并上线了,而且免费。
逻辑很实用:图片上传一次,拿到 file_id,之后每次请求直接引用这个 ID,不用重复传图。对于那些要反复用同一张图的场景,带宽省下来的量相当可观。
写在最后
多模态能力打开的是一类过去做不了的代理场景。看截图、读图表、理解界面、处理带图文档,这些在纯文本时代都是硬伤。视觉一上,代理的可操作空间直接扩大了一圈。
DeepSeek 这次用 Flash 级别的模型做到这一步,成本控制和能力之间的平衡,是真的拿捏到位了。
这让DeepSeek-V4-Flash-Vision-Exp成为了一个真正的生产可用的主力模型
文档地址:
https://api-docs.deepseek.com/guides/vision
--end--
最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论
/...@作者:你说的完全正确(YAR师)