Alibaba旗下的Qwen團隊於8月3日開放旗艦大型語言模型「Qwen3.8-Max」。總參數量達2.4兆,但更值得留意的並非規模本身,而是它在完全沒有人為介入的狀態下連續寫了16天程式碼這件事。該模型與小型版本的權重預定於下週公開,開放權重的節奏又快了一階。

2.4兆之中真正運作的是950億

Qwen3.8-Max採用MoE(混合專家)架構,每生成一個token只啟用所需的專家網路。總參數為2.4兆,但推論時實際啟用的參數約為950億。目的是在保留超大模型知識量的同時,壓低每次回應所需的運算量與延遲。

可處理的脈絡最大達100萬token規模,其中一般模式下最大輸入約99.1萬token,開啟思考模式時約98.3萬token,最大輸出為13.1萬token。除文字之外也能原生理解影像與影片,從螢幕截圖直接組出網站這類用法同樣在設想範圍內。

從空資料夾開始,16天無人看管

Qwen團隊最想強調的能力,是在無人介入的前提下持續進行軟體開發。從空資料夾起步、約16天的完全自主運作結束後,對應的儲存庫累積了265次提交、127個拉取請求與151個Issue。這並非一次性的程式碼生成,而是持續兩週以上自行找出問題、修正並擴充功能的過程。

作為對照,上一代Qwen3.7-Max被談論的自主運作時間還停留在35小時的量級,這次直接跨了一個數量級。

先重現論文,再超越原本的做法

研究任務的驗證結果也已公開。題材是一篇探討如何從大型語言模型的訓練資料中,挑出「模型最難判斷的樣本」的論文。交給Qwen3.8-Max的只有論文與GPU,資料處理、訓練、評估所需的程式碼與實驗環境都得從零建起。

整個過程耗時約125小時,寫出約7600行程式碼,操作次數超過1100次,在GPU上完成33次訓練。最初約37小時重現了論文的6項主要結果,其餘約88小時則反覆執行「提出假設、實作、跑實驗、分析、再嘗試」的循環,共4輪、驗證了18項改良方案。最終它得出自有的樣本挑選方法,把數學基準AIME24從重現值的49.58%提升到52.29%,多出2.71個百分點。

它也和人類正面較量過。在Alibaba Cloud舉辦的多模態對話意圖辨識競賽中,該模型在24小時內自行建構出分類系統,透過45次提交把正確率從0.600拉高到0.853,在526支參賽隊伍中勝過458支,進入前13%[1]。

365天電商營運模擬中資金成長4.16倍

為了檢驗模型能否從經驗中學習,團隊還以Alibaba旗下淘寶與天貓的匿名化資料為基礎,進行了365天的電商營運模擬。10萬人民幣(約230萬日圓)的初始資金成長到41萬6252人民幣(約960萬日圓),報酬率為4.16倍,比第二名的GLM 5.2高出38%,比上一代Qwen3.7-Max高出152%。

有趣的是成長的原因:在超過2000次的往來交涉中,它逐步調整了與同一批供應商的談判方式,持續壓低了進貨價格。能不能依據過往的互動重新調整策略,看來正是長週期任務拉開差距的關鍵。

基準測試的強項與弱點界線分明

從公開的分數來看,強弱分布相當清楚。Terminal-Bench 2.1拿到86.6,超越Claude Fable 5與Claude Opus 4.8的84.6,但沒能追上GPT-5.6 Sol的88.8。衡量論文重現能力的PaperBench為93.0,指令遵循的IFBench為82.8,兩項都高於Claude Fable 5。

反過來看,SWE-bench Pro為67.7、FrontierSWE為73.5,都不及Claude Fable 5;Humanity's Last Exam停在43.6,Toolathlon Verified為72.5。修改既有程式碼與複雜的工具運用,仍是差距所在。與上一代相比,DeepSWE 1.1從21.6升到56.6,JobBench從31.3升到53.4。影像與文件處理方面,RealWorldQA為88.0,MMMU-Pro為82.3,OmniDocBench 1.5為92.1。

Qwen團隊表示,透過同時擴大強化學習環境與算力規模,內部與公開基準的分數取得了持續且一致的提升[1]。

價格,以及下週的權重公開

Qwen3.8-Max可透過Qwen Chat與Alibaba Cloud的Model Studio等管道使用。API費用為輸入每100萬token 2美元(約310日圓)、輸出每100萬token 6美元(約940日圓)、已快取的輸入每100萬token 0.25美元(約40日圓)。模型支援函式呼叫、結構化輸出、批次處理、前綴續寫與微調,透過Responses API還能使用程式碼執行、網頁搜尋、網頁資訊擷取、影像搜尋等內建工具。

下週,Qwen3.8-Max本體以及270億參數的「Qwen3.8-27B」權重預定一併公開。要自行運行2.4兆參數的模型需要資料中心等級的環境,而270億參數版在一般GPU環境中就相對現實。加上Moonshot AI才剛公開2.8兆參數的「Kimi K3」,以開放權重推出前沿等級模型的競爭,短期內看來還會延續下去。

※1美元=157日圓,1人民幣=23日圓(截至2026年8月5日)

總結

Qwen3.8-Max是採用MoE架構的多模態模型,2.4兆參數中啟用950億,可處理最多100萬token的脈絡。16天無人監督的開發、耗時125小時的論文重現與改良、365天電商營運取得4.16倍報酬,這些結果都被用來衡量持續完成工作的續航力,而非單次回應的品質。基準測試顯示它在修改既有程式碼與複雜工具運用上仍有課題,不過下週的權重公開能否讓這個等級的模型落到一般使用者手中,才是接下來的重點。

參考連結