DeepSeek 于 8 月 21 日在 API 平台上线首款支持图像输入的模型 DeepSeek-V4-Flash-Vision-Exp。该模型定位为实验性版本,但文本侧能力与现有的 DeepSeek-V4-Flash 相当,图像输入也不额外收费。单张图片按最多 384 个 token 计费,同一天免费的 Files API 也一并开放。
图片按最多 384 个 token 折算
对实际使用来说,这次最值得关注的可能是图片的计费方式。图片会被换算成 token,与文本一起计入输入 token,而在换算之前,每张图片都会先经过一次缩放。
总像素数低于约 384×384 的图片会在保持宽高比的前提下放大,更大的图片则同样保持宽高比缩小,缩放后的总像素数大致对齐到 800×800 的水平。这一处理带来的结果是单张图片的 token 数存在 384 的上限。也就是说,2000×2000 和 5000×5000 的图片在缩放之后消耗的 token 完全相同。一次请求包含多张图片时,每张图片都按同一规则独立计算。
如果不需要精细的视觉信息,可以把 detail 设为 low,图片会被压到 512×512。设为 original 或 auto 则保留原始分辨率。
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "这张图片里有什么?"},
{"type": "image_url",
"image_url": {"url": "https://example.com/image.jpg", "detail": "low"}},
],
}],
)
文本能力保持不变,提升的是智能体侧
按 DeepSeek 的说明,这款实验模型在智能体行为、推理和世界知识等文本能力上与 DeepSeek-V4-Flash 相当。已经把 V4-Flash 用于纯文本任务的团队,切换之后文字侧的表现不会有明显变化。
真正提升的是多模态智能体能力。官方称该模型在多模态智能体基准上相比 V4-Flash 实现大幅跃升,接近 Opus-4.8 的水平。读取仪表盘截图、从图表中提取数字、看着界面判断下一步操作,这类处理有机会比只传文本摘要少走几步。
执行环境同步更新,DeepSeek Harness 0.1.1 当天发布并原生支持新模型,现有配置基本不用大改就能试。
三种图片传入方式,Files API 免费开放
图片输入方式有三种:以 base64 直接嵌入请求、传入公开 URL 由模型下载、以及上传到 Files API 后通过 file_id 引用。支持 JPEG、PNG、GIF、WebP 四种格式,格式判定依据文件实际内容,而非文件名或声明的 MIME 类型。
同期开放的 Files API 免费使用,在同一张图片被反复调用时可以节省请求带宽。上传一次之后,后续只需指定 file_id。base64 内嵌会计入 48 MiB 的请求体上限,而通过 Files API 引用的图片单张可达 64 MiB。
限制也写得很清楚:单次请求最多 600 张图片,外部 URL 不超过 8192 个字符,单边最大 8192 像素,当请求包含 15 张以上图片时降为 4096 像素。图片只能放在 user 消息中,放进 system 或 assistant 会返回 400 错误。调用入口方面,OpenAI 兼容的 Chat Completions、Anthropic 兼容的 Messages 以及 Responses API 均可使用。
价格不变,周末全天转为低谷时段
计费标准与 DeepSeek-V4-Flash 完全一致。按每 100 万 token 计算,命中缓存的输入低谷时段为 0.007 美元(约 1 日元),高峰时段 0.014 美元(约 2 日元);未命中缓存的输入低谷时段 0.22 美元(约 35 日元),高峰时段 0.44 美元(约 70 日元);输出低谷时段 0.66 美元(约 105 日元),高峰时段 1.32 美元(约 210 日元)。传入图片不会产生单独的附加费用,折算出的 token 直接计入输入侧。
※1 美元 = 159 日元(截至 2026 年 8 月 22 日)
高峰时段为协调世界时 1 点至 4 点、6 点至 10 点,其余时间均为低谷时段。此外,自北京时间 8 月 23 日 0 点起规则调整,周六和周日全天按低谷时段计费。对于可以错峰执行的批处理任务,仅这一项变化就能把实际单价压到一半。上下文长度为 100 万 token,最大输出 38.4 万 token,并发上限 2500。
总结
DeepSeek-V4-Flash-Vision-Exp 在保持 V4-Flash 文本能力的同时补上了图像理解。单张图片 384 个 token 的上限,加上不额外收取图像费用的定价方式,让围绕截图和图表构建的工作负载更容易估算成本。免费的 Files API、三种图片输入方式,以及周末全天低谷的调价也在同一时间落地。毕竟仍是实验模型,投入生产之前用自己的图片测一遍精度这一步省不掉,不过尝试的门槛确实相当低。
