Alibaba 旗下的模型研發團隊 Qwen 於日本時間 2026 年 8 月 26 日公開了開放權重的 AI 模型「Qwen3.8-Flash-Next」。總參數量為 1250 億,但每個 token 實際啟動的僅有 60 億,並提前導入了為下一代「Qwen4」準備的 4 項新機制。權重目前已可從 Hugging Face 與 ModelScope 下載。

總參數 1250 億,實際運作的只有 60 億

Qwen3.8-Flash-Next 是一款除了文字之外,也能處理影像與影片的 MoE(Mixture-of-Experts,混合專家)模型。MoE 會把模型內部拆成許多分工不同的小型網路,每次輸入只啟動需要的部分,藉此壓低運算量。「125B-A6B」的寫法代表總參數 1250 億、啟動參數 60 億。

在主體之外,模型另外帶有 510 億參數規模的 N-gram 嵌入。脈絡長度預設為 26 萬 2144 個 token,擴充後最長可達 100 萬 token。

與 Opus 4.6 及 27B 版本的比較

在 Qwen 公布的基準測試結果中,對比 Anthropic 的「Claude Opus 4.6(Max)」,衡量軟體開發能力的 SWE-bench Pro 為 62.5%(Opus 4.6 為 53.4%),涵蓋長時間文書作業的 CoWorkBench 為 73.9%(對方 68.2%),職務任務的 JobBench 為 55.7%(對方 36.6%),三項皆領先。

與自家總參數 3970 億的上位模型「Qwen3.7-Plus」相比,也在多數項目勝出,而訓練成本據稱只有約九分之一。

更值得注意的是與本地 AI 常見選擇「Qwen3.8-27B」的比較。27B 屬於 270 億參數全部參與運算的 Dense(稠密)型模型,Qwen3.8-Flash-Next 卻只運作 60 億。即便如此,在語言與視覺合計 22 個項目中達到同等以上,其中 21 項勝出。SWE-bench Pro 為 62.5% 對 61.7%,差距不大;但 JobBench 為 55.7% 對 33.4%,差距相當明顯。

要說明的是,這些數字都由 Qwen 自行公布,並非第三方獨立驗證的結果,解讀時應把這個前提放在心上。

提前落地的 4 項 Qwen4 新機制

Qwen 把「啟動參數這麼少卻仍有高分」的原因,歸結為 4 項設計上的調整。

第一是注意力機制(決定要關注脈絡中哪些部分的機制)的結構。每 4 層由 3 層負責壓縮並記住脈絡的「Gated DeltaNet」,搭配 1 層只挑出重要區塊回頭讀取的「Qwen Sparse Attention」組成。在快取命中率 90%、輸入 100 萬 token 的條件下,預填充處理量達到 Qwen3.7-Plus 的 8.6 倍。

第二是「Gated Residual」,把各層輸入直通到深層的路徑從 1 條增加為 4 條,並以閘門動態控制每條路徑的讀寫量。初期資訊在傳到深層時比較不會被稀釋,訓練也更穩定。

第三就是前面提到的 N-gram 嵌入。它是一張依據前面數個 token 的排列查出對應向量的參照表,與主體分開,規模為 510 億參數。由於只是查表,每個 token 的運算量幾乎沒有增加。

第四是提升訓練時參數更新效率的新方法「Muon」,能以較少的步驟完成訓練。訓練成本降到約九分之一,關鍵就在這裡。

510 億參數能放進記憶體的意義

對在自己機器上跑模型的人來說,最關鍵的是 N-gram 嵌入的 510 億參數可以放在記憶體而非顯示記憶體。一般來說,塞不進顯示記憶體的參數得每次從記憶體傳輸到 GPU,速度會大幅下滑。以 8GB 顯示卡運作 35B 等級模型而受到矚目的執行環境「FreeToken」也跨過了同樣的門檻,但那是以 NVIDIA 顯示卡為前提、在執行環境端所做的工夫。

Qwen3.8-Flash-Next 則是從模型端就以「放在記憶體並預先讀取」為前提來設計,因此不受特定 GPU 環境限制。Qwen 列出的伺服器端對應環境為推論框架「SGLang」「vLLM」「TokenSpeed」。本地端也提到「llama.cpp」的支援,不過是否已經實作到預先讀取,目前還不清楚。

授權條款與商用版價格

授權採用「Qwen Community License 1.0」,原則上含商用在內皆為免費。但若經營 MaaS 業務,或提供以 AI 程式撰寫、辦公室輔助為主要用途的產品,就需要另行簽約。此外,月活躍使用者超過 1 億,或月營收超過 2000 萬美元(約 32 億日圓)的產品,必須在 UI 上標示模型名稱。

對應的商用版「Qwen3.8-Flash」預計近期會透過 QwenCloud 的 API 提供。價格公布為每 100 萬 token 輸入 0.16 美元(約 25 日圓)、輸出 0.47 美元(約 75 日圓)。

※1 美元 = 159 日圓

總結

Qwen3.8-Flash-Next 等於是把下一代 Qwen4 的設計提前釋出。重點在於:以 60 億啟動參數的輕量結構拿到 Opus 4.6 等級的分數,並把沉重的部分交給記憶體,藉此擺脫對特定 GPU 的依賴。若 llama.cpp 的預先讀取支援確定到位,能在自家電腦上運作的模型選擇還會再擴大。