Moonshot AI 公開了旗艦模型 Kimi K3 的權重。總參數量達 2.8 兆,是目前可自由下載的開放權重模型中規模最大者,該公司將其定位為全球首個開放 3T 級模型。Kimi K3 本身於 7 月 16 日推出,不久後在 Hugging Face 上釋出完整權重。不過若要在本機執行,所需的運算資源遠遠超出個人能負擔的程度。
896 個專家中僅啟用 16 個
Kimi K3 採用混合專家(MoE)架構,也就是依需求切換不同的專家模組,而非讓全部參數同時運算。總參數為 2.8 兆,但每個 token 實際啟用的只有 1,040 億,不到整體的 4%。專家總數為 896 個,每個 token 只選中其中 16 個,另外還有 2 個始終參與運算的共享專家。
模型共 93 層,注意力部分為混合結構:69 層採用自行研發的 Kimi Delta Attention(KDA),24 層採用 Gated MLA。Moonshot AI 表示,將此結構與名為 Stable LatentMoE 的框架結合後,單位運算量所換得的智慧水準較上一代 Kimi K2 提升約 2.5 倍。該公司特地強調這並非單純堆疊參數的結果,可見其希望與規模競賽拉開距離。
其他規格方面,上下文長度為 1,048,576 個 token,詞彙表規模 16 萬,視覺編碼器為 MoonViT-V2,參數量 4.01 億。文字與影像在同一個模型內完成理解,屬於一般所說的原生多模態架構。
下載容量約 1.56TB,自行部署的門檻不低
權重以 MXFP4 這種 4 位元格式儲存。這並非事後壓縮,而是從監督式微調階段起就以量化為前提進行訓練,啟用值則使用 MXFP8。即便如此,釋出檔案分為 96 個分片,容量仍達約 1.56 TB。
Moonshot AI 本身也建議,從推論效率的角度應部署在 64 個以上加速器所組成的超級節點上。研究機構、雲端業者以及資金充裕的新創公司可以自行運行,但這並不是個人開發者用手邊 GPU 就能嘗試的模型。建議的推論引擎包括 vLLM、SGLang 與 TokenSpeed;針對 KDA 與傳統前綴快取相容性不佳的問題,該公司已向 vLLM 提供對應實作。
授權並非通用的開源授權,而是自訂的 Kimi K3 License。雖然仍可取得、修改並再散布權重,但條款內容需要各自確認。
基準測試位居前兩名之後
從 Moonshot AI 公布的評測表來看,Kimi K3 排在 Claude Fable 5 與 GPT-5.6 Sol 之後。該公司也明白表示,整體效能尚未追上最頂尖的商用模型。
不過就個別項目而言,勝出的領域並不少。在檢視長週期軟體開發的 SWE-Marathon 上,它以 42.0 取得最高分;在需要反覆檢索網頁的 BrowseComp 上取得 91.2,MCPMark-Verified 上取得 94.5。GPQA Diamond 為 93.5,超越 Claude Fable 5 的 92.6。另一方面,FrontierSWE 為 81.2,落後 Claude Fable 5 的 86.6;衡量知識工作的 AA-Briefcase Elo 為 1548,也未達 1583。
值得一提的是,該公司還展示了讓 Kimi K3 設計晶片的案例。在一次 48 小時的自主執行中,它使用開源 EDA 工具,在 4 平方公釐的面積內完成可在 100 MHz 下收斂時序的電路,模擬中的解碼吞吐量超過每秒 8,700 個 token。這個例子顯然是為了說明模型能在長時間內依自身判斷持續推進工作。
API 的單價壓得相當低
也可以選擇不自行部署。在 Kimi API Platform 上選擇模型名稱 kimi-k3 即可使用,每百萬 token 的價格為:快取命中輸入 0.30 美元(約 47 日圓)、快取未命中輸入 3.00 美元(約 470 日圓)、輸出 15.00 美元(約 2,350 日圓)。該公司表示,在程式開發用途上官方 API 的快取命中率超過 90%。
※1 美元 = 157 日圓(以 2026 年 8 月 1 日收盤價換算)
此外,手機端的 Kimi 應用程式、桌面端的 Kimi Work,以及在終端機執行的 Kimi Code 也都能使用這個模型。
注意事項也由官方主動揭露
Moonshot AI 同時列出了幾項限制。其一是思考歷程的處理方式:Kimi K3 是在完整回傳過往推理內容的前提下訓練的,因此在不支援此做法的代理框架上,或在對話中途從其他模型切換過來時,輸出可能變得不穩定。其二是過度主動,由於訓練偏重長週期的高難度任務,當指示模糊時模型可能擅自替使用者做出判斷。該公司也承認,在使用體驗方面與 Claude Fable 5、GPT-5.6 Sol 仍有落差。
這次公開的不只是權重。高效能注意力核心、MoE 通訊函式庫,以及大規模運行代理環境所需的基礎設施也一併開放。美國業者仍將最頂尖的模型封閉運營,中國業者則透過開放權重持續擴大存在感。當 3 兆參數等級的模型可以免費取得,這條分界線看來還會繼續移動。
總結
Kimi K3 是首個開放 3T 級模型,將 2.8 兆參數的 MoE 與 100 萬 token 上下文及原生影像理解結合在一起。896 選 16 的極度稀疏結構搭配自研注意力機制,據稱使單位運算量的效率較上一代提升約 2.5 倍。基準測試中它位居頂尖商用模型之後,但在程式開發與代理類的部分項目上實現超車。釋出容量約 1.56 TB,自行部署的門檻依然很高。
