DeepSeek 在 9 月 8 日向開發者限時開放 DeepSeek V4.1 Flash 的中間版本。這是 V4 系列自 4 月推出以來幅度最大的架構調整,重點在於把影像與語音的處理併入模型本體,不再依靠外掛的擴充套件。官方並未將其定位為正式發表,開放的視窗在 9 月 10 日關閉。
從擴充套件走進模型內部
這並不是 DeepSeek 第一次碰多模態。8 月 21 日,在文字模型上疊加視覺擴充套件的 V4-Flash-Vision-Exp 就已經登上 API,主要用於描述圖片、辨識螢幕截圖中的文字、分析圖表等情境。
V4.1 Flash 改變的是組裝方式本身。視覺能力不再事後接上,而是把多模態處理寫進模型架構,讓文字、影像、語音輸入在同一個層面被處理。DeepSeek 表示,這個中間版本能力更強、生成更快、成本更低。
發布的場合同樣透露了性質。消息是透過官方交流群發出,而不是社群帳號,比較像是為下一代正式模型鋪路,而非產品發表。
呼叫只要改一個模型名稱
嘗試的門檻被壓得很低。已經在用 API 的開發者不必更動 base_url,只要替換模型名稱就能呼叫。
model = "deepseek-v4.1-flash-expires-on-0910"
不需要申請內測資格,計費也與現有的 deepseek-v4-flash 相同。限制在於每個帳號最多 20 個並行請求,這個額度不足以承接正式的服務流量。
模型名稱結尾的日期就是期限,這個版本會在 9 月 10 日自動下線。官方尚未公布技術規格、跑分數據與單獨定價,因此可參考的依據只有實際呼叫後的手感。
速度數據由第三方先行提出
在官方沒有給出數字的情況下,開發者社群先一步分享了實測結果。已揭露的數值包括第一個 token 回傳約 178 毫秒、持續生成約每秒 355 個 token,尖峰超過每秒 365 個 token。有測試顯示,生成 1,500 個 token 規模的程式碼只花 4.40 秒,內建的思考階段約 1.1 秒完成。
同一組測試中,上位的 V4 Pro 為每秒 63 個 token、第一個 token 耗時 766 毫秒,差距相當明顯。也有使用者回報每秒 300 到 600 個 token 的區間,但有看法認為那可能是為內測另外部署的環境速度。這些都不是 DeepSeek 認可的官方數據,正式版能否達到相同水準目前仍無法判斷。
真正被追問的是「Flash 能否取代 Pro」
這次開放最值得注意的,是 DeepSeek 同時發出的問卷內容:中間版本的 V4.1 Flash 能否全面取代線上運行的 V4 Pro。
Flash 一直是優先速度與價格的下位級距,Pro 則是優先能力的上位級距。如今官方自己來驗證下位級距能不能扛起上位級距的工作。若成立,開發者的選型邏輯就會從「要快選 Flash、要準選 Pro」轉為「先試試 Flash 夠不夠」。在代理程式連續執行、程式碼批次生成這類呼叫次數直接決定成本的場景中,這個差別特別明顯。
換個角度看,20 個並行請求的限制與僅約兩天的開放期,本身就是為了蒐集回饋而設的條件。DeepSeek 想量的並不是速度紀錄,而是在 Flash 的價格帶裡究竟能撐起多少實際工作。
總結
V4.1 Flash 是把原本外掛的多模態能力併入模型本體的中間版本,只在 9 月 10 日前向開發者開放。接入只需替換模型名稱、計費維持不變,而 20 個並行請求的上限與短暫視窗,清楚說明目的在於蒐集回饋而非投入正式服務。在官方跑分尚未公布之前,速度數據目前只適合當作參考值。真正的看點在於 DeepSeek 想用 Flash 級距去拿下 Pro 的領域,答案得等正式版登場才會揭曉。
