DeepSeek 推出輕量級大型語言模型 DeepSeek-V4-Flash-0731,將其從預覽版升級為正式版。總參數 284B、推論時啟用 13B、脈絡長度 100 萬 token 的結構維持不變,動到的只有後訓練階段。即便如此,代理(agent)類基準測試的成績已經超越規模更大的 V4-Pro 預覽版。權重以 MIT 授權釋出。
※1 美元 = 157 日圓(截至 2026 年 8 月 1 日)
架構原封不動,重做的是後訓練
這次更新首先要留意的是模型骨架沒有更動。DeepSeek 在模型卡中明確寫出,架構與規模和預覽版一致,效能提升來自重新執行的後訓練,而不是全新設計。
V4-Flash 是總參數 284B 的 MoE(混合專家)模型,每個 token 只啟用 13B。每個 MoE 層由 1 個共享專家與 256 個路由專家組成,中間維度為 2048,每個 token 會觸發 6 個路由專家。前 3 個 MoE 層則改用雜湊路由。
注意力機制採混合設計,結合壓縮稀疏注意力(CSA)與高壓縮注意力(HCA)。一般的殘差連接由流形約束超連接(mHC)取代,擴展係數為 4,Sinkhorn-Knopp 迭代 20 次。預訓練使用超過 32 兆 token,最佳化器為 Muon。
另外要澄清一點,Hugging Face 上的儲存庫顯示參數量為 304B。那是因為在 284B 基座之外還附上了推測解碼的草稿模組 DSpark,模型本體並沒有變大。
代理指標反超上位模型的預覽版
成長幅度最明顯的是程式撰寫與代理領域。評估終端機操作的 Terminal Bench 2.1 上,成績從預覽版的 61.8 一舉拉到 82.7。上位的 V4-Pro 預覽版為 72.1,等於輕量版反超了大模型。
針對軟體開發任務的 DeepSWE 落差更大,從 7.3 提升到 54.4,改善超過 7 倍。此外 DeepSeek 也提出內部測試集 DSBench-FullStack 68.7、DSBench-Hard 59.6 的數值。
第三方評價同樣往上。基準彙整網站 Artificial Analysis 將 V4-Flash-0731 的 Intelligence Index 評為 50,比先前的 V4-Flash 高出 10 分。
不過把公布的數字照單全收並不妥當。DeepSeek 自己註明,程式代理類任務是在該公司 DeepSeek Harness 的最小模式下執行,而這套 harness 尚未公開。代理評測的結果會隨 harness 的寫法而變動,最好抱著要在自己環境重新量測的前提來看。
輸出單價約為上位模型的三分之一
API 價格維持不變,划算的程度相當突出。deepseek-v4-flash 的輸入在快取未命中時為每 100 萬 token 0.14 美元(約 22 日圓),快取命中時為 0.0028 美元(約 0.4 日圓);輸出為每 100 萬 token 0.28 美元(約 44 日圓)。同時執行數上限設為 2,500。
作為對照,上位的 deepseek-v4-pro 輸出為每 100 萬 token 0.87 美元(約 137 日圓)。V4-Flash 的輸出單價約為其三分之一。代理迴圈會大量吃掉輸出 token,這個差距會直接反映在營運成本上。對沒有 GPU 預算的個人開發者或企業內部平台團隊而言,這是一個可以放心讓代理持續運轉的價格帶。
在介面層面,deepseek-v4-flash 已原生支援 Responses API 格式,也完成了對 Codex 的適配。至於 V4-Pro 的 API 以及 App 版與網頁版模型,這次並不在更新範圍內。
自行架設需要 100GB 以上記憶體
權重採 MIT 授權且無需申請權限,商用地端部署的條件已經齊備。但硬體門檻完全是另一回事。
雖然每個 token 只啟用 13B,256 個專家卻全部常駐在記憶體中。vLLM 提供的建議組態是在搭載 4 張 GB300 的單一節點上提供服務。若走量化路線,Unsloth 的動態 GGUF 中無損 8 位元版為 162GB、3 位元版為 103GB,需要 RAM 與顯示記憶體合計約 110GB。
換句話說,自行架設實際可行的對象,只有擁有推論叢集的中大型企業,或是能備妥一台高規格工作站並接受積極量化的情況。這並不是能在筆電上隨手跑起來的模型。
導入前值得先掌握的細節
實作時容易卡住的地方也有幾處。首先,這個模型沒有 Jinja 格式的對話樣板。DeepSeek 改為附上 encoding/ 資料夾,提供 encode_messages 與 parse_message_from_completion_text 兩個函式。以樣板為前提的既有程式碼需要改寫。
推論深度透過 reasoning_effort 控制,可選 low、high、max 三段。在 high 與 max 之下,輸出最長可延伸到 384K token。取樣方面官方建議代理用途使用溫度 1.0、top_p 0.95,其他情況兩者皆為 1.0。
要啟用隨附的 DSpark,只需在 vLLM 端傳入 1 個旗標。
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
DSpark 論文指出,在總吞吐量相當的條件下,與 MTP-1 基準相比單一使用者的生成速度快 60% 至 85%。這直接影響使用時的體感速度,自行架設時值得一開始就打開。
總結
DeepSeek-V4-Flash-0731 沒有改動設計,只重組了後訓練,就把代理與程式撰寫的成績大幅拉高。輸出單價落在上位版本的三分之一左右,權重也以 MIT 授權開放。另一方面,公布的分數是由廠商自己在未公開的 harness 上量測,自行架設還需要 100GB 以上的記憶體。若要評估導入,先用自己的任務跑一輪評測會是合理的起點。
