DeepSeekは8月21日、画像を扱える初のモデル「DeepSeek-V4-Flash-Vision-Exp」をAPIプラットフォームで公開しました。実験的な位置づけながら、テキスト側の性能は既存のDeepSeek-V4-Flashと同等とされ、画像入力に対する追加料金もありません。画像は1枚あたり最大384トークンに丸めて課金される仕組みで、同じ日に無料のFiles APIも提供が始まっています。
画像は「最大384トークン」に丸められる
このモデルでいちばん実務に効くのは、画像の課金方法かもしれません。送信した画像はテキストと同じトークンに換算され、入力トークンとして合算されますが、その換算前に必ずリサイズが入ります。
総画素数がおよそ384×384を下回る画像は縦横比を保ったまま拡大され、それより大きい画像は縦横比を保ったまま縮小されます。縮小後の総画素数は、おおむね800×800相当に揃えられます。この処理の結果、1枚あたりのトークン数には384という上限が生まれます。つまり2000×2000の画像でも5000×5000の画像でも、リサイズ後に消費するトークンは同じです。複数枚を1回のリクエストに含めた場合も、各画像が独立に同じルールで数えられます。
細かい視覚情報が不要な場面では、detail に low を指定して512×512まで落とす選択肢もあります。逆に original や auto を指定すると元の解像度のまま処理されます。
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "この画像には何が写っていますか"},
{"type": "image_url",
"image_url": {"url": "https://example.com/image.jpg", "detail": "low"}},
],
}],
)
テキスト性能は据え置き、伸びたのはエージェント寄りの部分
DeepSeekの説明によれば、この実験モデルはエージェント動作、推論、世界知識といったテキスト面でDeepSeek-V4-Flashと同等です。既存のV4-Flashをテキスト用途で使っているなら、乗り換えても文章側の挙動が変わりにくい、という組み立てになっています。
一方で伸びたのはマルチモーダルのエージェント性能です。同社はマルチモーダル系のエージェントベンチマークにおいて、V4-Flashから大きく飛躍し、Opus-4.8に迫る水準に達したとしています。ダッシュボードのスクリーンショットを読ませる、図表から数字を拾わせる、画面を見せて次の操作を判断させるといった処理が、テキスト要約だけを渡す運用より短い手数で済む可能性があります。
エージェント実行環境の側も同日に更新され、DeepSeek Harness 0.1.1が新モデルに標準対応しました。既存の構成を大きく組み替えずに試せる状態で出してきた形です。
画像の渡し方は3通り、Files APIは無料開放
画像の入力方法は3つ用意されています。base64でリクエストに直接埋め込む方法、公開URLを渡してモデル側にダウンロードさせる方法、そしてFiles APIにアップロードして file_id で参照する方法です。対応形式はJPEG、PNG、GIF、WebPで、判定はファイル名や宣言されたMIMEタイプではなく実体の中身で行われます。
同時に提供が始まったFiles APIは無料で、同じ画像を何度も使い回す場合にリクエストの帯域を節約できます。1度アップロードすれば、以降は file_id を指定するだけで済みます。base64で埋め込む場合は48MiBというリクエスト全体のサイズ上限に効いてきますが、Files API経由なら1枚あたり64MiBまで扱えます。
制限も明示されています。1リクエストあたりの画像は最大600枚、外部URLは8192文字まで、1辺の最大は8192ピクセルで、15枚以上を含むリクエストでは4096ピクセルまで下がります。画像を置けるのは user メッセージだけで、system や assistant に入れると400エラーになります。呼び出し口はOpenAI互換のChat Completions、Anthropic互換のMessages、そしてResponses APIのいずれにも対応します。
料金は据え置き、週末は終日オフピークへ
料金体系はDeepSeek-V4-Flashと同一です。100万トークンあたり、キャッシュヒットした入力がオフピーク0.007ドル(約1円)、ピーク0.014ドル(約2円)。キャッシュミスの入力がオフピーク0.22ドル(約35円)、ピーク0.44ドル(約70円)。出力がオフピーク0.66ドル(約105円)、ピーク1.32ドル(約210円)です。画像を送っても別枠の追加料金は発生せず、換算されたトークン分が入力側に乗るだけという設計になります。
※1ドル159円換算(2026年8月22日時点)
ピーク時間帯は協定世界時の1時から4時と6時から10時で、それ以外はオフピークです。さらに北京時間の8月23日0時からは区分が調整され、土曜と日曜は終日オフピーク扱いになります。バッチ処理のように時間をずらせる用途なら、この変更だけで実効単価が半分になる計算です。コンテキスト長は100万トークン、最大出力は38万4000トークン、同時実行数の上限は2500となっています。
まとめ
DeepSeek-V4-Flash-Vision-Expは、テキスト性能をV4-Flashと同等に保ったまま画像理解を足した実験モデルです。1枚あたり最大384トークンという上限と、画像分の追加料金が無い料金体系により、スクリーンショットや図表を投げる運用のコスト見積もりが立てやすくなりました。無料のFiles API、3通りの画像入力、週末終日オフピークという価格改定も同じタイミングで揃っています。実験モデルである以上、本番投入の前に自分たちの画像で精度を測る作業は避けられませんが、試すための障壁はかなり低い部類に入ります。
