IT时代网8月21日消息,深度求索官方宣布全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 在 API 平台上线。该模型支持在文本之外输入图片,可描述图片内容、识别截图中的文字、分析图表等,支持的图片格式包括 JPEG、PNG、GIF、WebP。
官方表示,这款实验性质模型在各类 Agent 框架内展现出较好的多模态适配能力。在纯文本能力上与正式版持平,而在需要视觉理解的 Agent 基准测试上相比原版实现大幅跃升,多模态 Agent 能力已接近 Opus-4.8。
调用时设置对应的 model 参数即可访问。图片会转换为 token 后按 token 计费,单张图片最多占用 384 个 token,计费价格与原模型一致。多模态 API 支持 Chat Completions、Messages、Responses 三种格式,可接入各类 Agent 工具,支持图文混合输入,以及 base64 内联、在线地址与文件接口三种图片传入方式。
注:本文综合自IT之家等,文中包含AI辅助创作的内容。