Z.ai 於 2026 年 8 月 26 日推出 GLM-5.3-Flash,這是 GLM-5 系列中第一款原生多模態模型。總參數量為 3200 億,每個 token 實際啟用 180 億,可處理 100 萬 token 的上下文。權重採 MIT 授權釋出,商業使用幾乎沒有限制。整體設計的重心,是讓程式開發與代理任務跑得更便宜。

3200 億當中只動 180 億

GLM-5.3-Flash 採用混合專家(MoE)架構。總參數量 3200 億,但處理每個 token 時真正參與運算的只有約 180 億。GLM-4.5 的啟用量為 320 億,這一代反而壓到接近一半,優先順序顯然放在低成本與高吞吐上。

訓練使用約 30 兆 token 的多模態語料。注意力機制把兩種做法組合起來:以線性注意力處理鄰近 token 之間的依賴,再用稀疏注意力抓取遠處真正需要的上下文。當上下文接近 100 萬 token 時,索引器的 key 向量會大量累積並拖慢速度,因此導入了 IndexPool,把成組的向量壓縮起來。Z.ai 表示,與 GLM-5.3 相比,注意力運算量降到三分之一,KV 快取的體積縮小為 4.4 分之一。

相較 GLM-5.2,跑分變化明顯

程式開發方面,DeepSWE v1.1 拿到 63.4 分,GLM-5.2 則是 46.2。衡量自動化能力的 AutomationBench 為 48.8 分,GLM-5.2 是 26.2,接近翻倍。在綜合指標 Artificial Analysis Intelligence Index v4.1.1 上,這款模型取得 57 分,當時折扣後的成本為每項任務 0.045 美元(約 7 日圓)。

Z.ai 表示,在已公布的程式開發與代理測試中,這款模型全面勝過 GLM-5.2,價格卻只有十分之一,並宣稱在自家內部的程式開發基準上,與 Claude Opus 4.8 的差距縮小到 0.5 分以內。

不過這類比較會隨評測框架、上下文長度上限以及生成參數而改變。兩個分數是否在相同條件下測得,不去看各自的設定就無法判斷。把成績直接當成排行榜來讀並不妥當。

※1 美元 = 160 日圓(截至 2026 年 8 月 31 日)

看著自己畫出的畫面再修正

這次發表中被特別強調的,是以視覺進行的自我驗證。Z.ai 讓模型檢視已算繪的介面、遊戲畫面與 3D 輸出,再根據看到的結果評估並修改自己的成果。寫完程式不代表結束,模型可以回頭看實際呈現的畫面並繼續調整。

同樣的做法也延伸到文件、試算表、簡報、儀表板與會議資料。目標是讓模型同時在文字、影像與結構之間進行推理,這一點在前端開發與資料製作的情境中應該最容易看出差別。

「ox-alpha」的真實身分與國產晶片

在正式發表之前,這款模型曾以匿名的「ox-alpha」出現在 OpenCode 與 OpenRouter 上。身分未公開就先引發討論,Z.ai 表示它在當週成為這兩個服務上使用最多的模型。這次發表正式確認,ox-alpha 就是 GLM-5.3-Flash。

另一個值得注意的細節是,推論完全跑在中國製的 AI 晶片上。Z.ai 以 SGLang 為基礎,打造了把編碼、預填與解碼分開處理的服務堆疊,並表示在數萬張國產加速卡上,端到端的服務效能提升為 3 倍。在海外 GPU 採購難以預期的情況下,證明這種規模的推論可以只靠國產晶片完成,意義並不侷限於跑分本身。

可以在哪裡使用,價格如何

GLM-5.3-Flash 對所有 GLM Coding Plan 使用者開放,可用額度是 GLM-5.3 的 3 倍。多模態功能透過 ZCode 的 Browser Use 與 Computer Use 提供。

權重在 Hugging Face 上發布,本機部署支援 SGLang、vLLM 與 TokenSpeed。由於採用 MIT 授權,無論是內部使用或嵌入自家產品都相當方便。

總結

GLM-5.3-Flash 是一款總參數 3200 億、啟用 180 億的多模態 MoE 模型,以 MIT 授權開放了 100 萬 token 的上下文能力。相較 GLM-5.2,程式開發與自動化基準提升明顯,官方給出的價格則只有十分之一。這次發表也揭開了匿名模型 ox-alpha 的身分,再加上推論完全仰賴國產晶片這一點,可談的內容並不只有分數。由於成績受評測條件影響甚大,最可靠的判斷方式仍然是自己實際跑一次。

※縮圖為 AI 生成的示意圖。