DeepSeek 在 8 月 21 日的 API 新闻页上线了 DeepSeek-V4-Flash-Vision-Exp。模型 ID 是 deepseek-v4-flash-vision-exp,官方写法是实验版多模态模型,文本侧的 agent、推理和世界知识对齐 V4-Flash,多模态 agent 基准相对 V4-Flash 有明显提升,接近 Opus-4.8。页面没有给出具体分数字。
调用走 Chat Completions、Messages 和 Responses 三条接口。图片可以 base64、外链 URL 或 Files API 三种方式塞进请求,也支持图文混排。格式认 JPEG、PNG、GIF、WebP,按文件字节判断,不看文件名,也不看你声明的 MIME。
计费按 V4-Flash 价。官方价目表里 vision-exp 与 flash 同列,峰时 cache miss 输入每百万 token 0.44 美元、输出 1.32 美元,非峰时减半,cache hit 更低。图片先按尺寸折成 token,再和文本一起算,单图上限写的是最多 384 token。价目表还标了 1M 上下文、最大输出 384K,并发上限 2500。峰时是周一到周五的 UTC 时间,凌晨 1 点到 4 点,以及早上 6 点到 10 点,其余算非峰时。
Vision 文档给了一张限额表。请求体 48 MiB;base64 或外链单图最大 32 MiB,Files API 单图 64 MiB;单请求最多 600 张图;总图体积不含 file_id 时 64 MiB,含 file_id 可到 200 MiB;单边最长 8192 px,一张请求里图达到 15 张及以上时降到 4096 px。图片只允许出现在 user 消息里。
同日 Files API 正式上线,官方写 Free to use。图上传一次之后用 file_id 引用,跨请求复用,不用反复塞 base64。DeepSeek Harness 0.1.1 也在当天发了,开箱支持这个模型。FIM Completion 在 vision-exp 上不支持,thinking 和 non-thinking 两种模式都有。