DeepSeekが軽量版の大規模言語モデル「DeepSeek-V4-Flash-0731」を公開し、プレビュー版から正式版へ切り替えました。総パラメータ284B、推論時の活性化13B、文脈長100万トークンという構成は据え置きで、変わったのは事前学習後の調整だけです。それでもエージェント系のベンチマークでは上位モデルのプレビュー版を上回る数字が並びました。重みはMITライセンスで公開されています。
※1ドル157円換算(2026年8月1日時点)
設計は変えず、後段の学習だけをやり直した
今回の更新でまず押さえておきたいのは、モデルの骨格に手が入っていない点です。DeepSeekはモデルカードで、アーキテクチャとサイズはプレビュー版と同一であり、性能の伸びは事後学習(post-training)のやり直しによるものだと明記しています。新しい設計を投入したわけではありません。
V4-Flashの中身は、総パラメータ284B、1トークンあたり13Bだけが動くMoE(Mixture of Experts、専門家混合)です。各MoE層は共有エキスパート1個とルーティング対象256個で構成され、中間次元は2048、1トークンにつき6個のエキスパートが発火します。最初の3つのMoE層だけはハッシュルーティングを使う設計です。
注意(アテンション)機構はハイブリッドで、圧縮スパース注意(CSA)と高圧縮注意(HCA)を組み合わせています。通常の残差接続の代わりに多様体制約付きハイパー接続(mHC)を採用し、拡張係数は4、Sinkhorn-Knopp反復は20回。事前学習は32兆トークン超で、最適化手法にはMuonが使われました。
なお、Hugging Face上のリポジトリはパラメータ数を304Bと表示します。これはベースの284Bに投機的デコードの下書きモジュール「DSpark」が同梱されているためで、本体が大きくなったわけではありません。
エージェント系の指標で上位版のプレビューを追い抜く
数字の伸び幅がはっきり出たのはコーディングとエージェントの領域です。ターミナル操作を評価するTerminal Bench 2.1では、プレビュー版の61.8から82.7へ跳ね上がりました。上位モデルであるV4-Proのプレビュー版が72.1ですから、軽量版が上位版を追い抜いた形になります。
ソフトウェア開発タスクのDeepSWEはさらに極端で、7.3から54.4へと7倍以上の改善です。このほかDeepSeekは、社内テストセットであるDSBench-FullStackで68.7、DSBench-Hardで59.6という値を挙げています。
第三者の評価も上振れしています。ベンチマーク集計サイトのArtificial Analysisは、V4-Flash-0731のIntelligence Indexを50と算定しました。従来のV4-Flashから10ポイントの上積みです。
ただし、公開された数値をそのまま鵜呑みにするのは避けたほうがよいでしょう。DeepSeek自身が、コードエージェント系のタスクは同社のDeepSeek Harnessの最小モードで実行したと注記しており、そのハーネスはまだ公開されていません。エージェント評価はハーネスの作り方で結果が動くため、自分の環境で測り直す前提で見ておくのが安全です。
出力単価は上位モデルの3分の1
APIの価格は据え置かれ、割安感が際立つ水準にあります。deepseek-v4-flashの入力はキャッシュミス時で100万トークンあたり0.14ドル(約22円)、キャッシュヒット時は0.0028ドル(約0.4円)。出力は100万トークンあたり0.28ドル(約44円)です。同時実行数の上限は2,500に設定されています。
比較対象として、上位のdeepseek-v4-proは出力が100万トークンあたり0.87ドル(約137円)です。V4-Flashの出力単価はその約3分の1にあたります。エージェントのループを回すと出力トークンがかさむため、この差はランニングコストに直結します。GPU予算を持たない個人開発者や社内基盤チームでも、腰を据えてエージェントを走らせられる価格帯といえます。
APIの仕様面では、deepseek-v4-flashがResponses API形式をネイティブにサポートし、Codexへの対応も済んでいます。一方で、V4-ProのAPI、およびアプリ版とWeb版のモデルは今回の更新に含まれていません。
自前で動かすなら100GB超のメモリが必要
重みはMITライセンスで、ゲートも掛かっていません。商用の自社サーバー運用に踏み切れる条件は整っています。ただしハードルは価格の話とはまったく別物です。
活性化するのが13Bだけとはいえ、256個のエキスパートはすべてメモリ上に居座ります。vLLMが示す推奨構成では、GB300を4基積んだノード1台で配信します。量子化に振り切る場合、Unslothの動的GGUFでは無劣化の8ビット版が162GB、3ビット版が103GBとされ、RAMとVRAMを合わせておよそ110GBが必要になります。
つまり自前運用が現実的なのは、推論クラスタを持つ中規模以上の企業か、思い切った量子化を前提に高性能ワークステーションを1台用意できるケースに限られます。手元のノートPCで気軽に動かす類のモデルではありません。
実装前に知っておきたい細かな仕様
導入時に引っかかりやすいポイントもいくつかあります。まず、このモデルにはJinja形式のチャットテンプレートがありません。代わりにDeepSeekはencoding/フォルダを同梱し、encode_messagesとparse_message_from_completion_textという関数を提供しています。既存のテンプレート前提のコードは書き換えが要ります。
推論の深さはreasoning_effortで制御し、low、high、maxの3段階が選べます。highとmaxでは出力が最大384Kトークンまで伸びます。サンプリングの推奨値は、エージェント用途で温度1.0・top_p 0.95、それ以外では両方とも1.0です。
同梱のDSparkを有効にするには、vLLM側でフラグを1つ渡します。
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
DSparkの論文では、同等の総スループット下でMTP-1のベースラインと比べ、利用者1人あたりの生成速度が60〜85パーセント速くなると報告されています。体感速度に効く部分なので、self-hostする場合は最初から有効にしておく価値がありそうです。
まとめ
DeepSeek-V4-Flash-0731は、設計を触らずに事後学習だけを組み直し、エージェントとコーディングの成績を大きく引き上げたモデルです。出力単価は上位版の約3分の1に収まり、重みもMITライセンスで開かれています。一方で、公表されたスコアは未公開ハーネス上でベンダー自身が測ったものであり、自前運用には100GBを超えるメモリが要ります。導入を検討するなら、まず自分のタスクで評価を回してみるところからでしょう。
