Moonshot AI 公开了旗舰模型 Kimi K3 的权重。总参数量达到 2.8 万亿,是目前可自由下载的开放权重模型中规模最大的一个,该公司将其定位为全球首个开放 3T 级模型。Kimi K3 本身于 7 月 16 日推出,随后不久在 Hugging Face 上发布了完整权重。不过如果想在本地运行,所需的算力远远超出个人可以承担的范围。
896 个专家中只激活 16 个
Kimi K3 采用混合专家(MoE)架构,即按需切换调用不同的专家模块,而不是让全部参数同时参与计算。总参数为 2.8 万亿,但每个 token 实际激活的只有 1,040 亿,不到整体的 4%。专家总数为 896 个,每个 token 只选中其中 16 个,此外还有 2 个始终参与计算的共享专家。
模型共 93 层,注意力部分为混合结构:69 层采用自研的 Kimi Delta Attention(KDA),24 层采用 Gated MLA。Moonshot AI 表示,将这一结构与名为 Stable LatentMoE 的框架结合后,单位算力所能换来的智能水平比上一代 Kimi K2 提升约 2.5 倍。该公司特意强调这不只是堆参数的结果,可以看出其希望与单纯的规模竞赛拉开距离。
其他规格方面,上下文长度为 1,048,576 个 token,词表规模 16 万,视觉编码器为 MoonViT-V2,参数量 4.01 亿。文本与图像在同一个模型内完成理解,属于通常所说的原生多模态架构。
下载体积约 1.56TB,自行部署门槛不低
权重以 MXFP4 这一 4 位格式保存。这并非事后压缩,而是从监督微调阶段起就按量化目标进行训练,激活值则使用 MXFP8。即便如此,发布文件的体积分为 96 个分片,仍达到约 1.56 TB。
Moonshot AI 自己也建议,从推理效率考虑应部署在 64 个以上加速器构成的超节点上。科研机构、云服务商以及资金充裕的初创公司可以自行运行,但这并不是个人开发者用手头 GPU 就能尝试的模型。推荐的推理引擎包括 vLLM、SGLang 和 TokenSpeed,针对 KDA 与传统前缀缓存不兼容的问题,该公司已向 vLLM 提供了相应实现。
许可证并非通用的开源许可,而是自定的 Kimi K3 License。虽然仍可获取、修改并再分发权重,但具体条款需要各自确认。
基准测试位列头部两款模型之后
从 Moonshot AI 公布的评测表来看,Kimi K3 排在 Claude Fable 5 与 GPT-5.6 Sol 之后。该公司也明确表示,整体性能尚未追上最顶级的商用模型。
不过分项来看,取胜的领域并不少。在考察长周期软件开发的 SWE-Marathon 上,它以 42.0 取得最高分;在需要反复检索网页的 BrowseComp 上取得 91.2,MCPMark-Verified 上取得 94.5。GPQA Diamond 为 93.5,超过 Claude Fable 5 的 92.6。另一方面,FrontierSWE 为 81.2,落后于 Claude Fable 5 的 86.6;衡量知识工作的 AA-Briefcase Elo 为 1548,也没有达到 1583。
值得一提的是,该公司还展示了让 Kimi K3 设计芯片的案例。在一次 48 小时的自主运行中,它使用开源 EDA 工具,在 4 平方毫米的面积内完成了可在 100 MHz 下收敛时序的电路,仿真中的解码吞吐超过每秒 8,700 个 token。这一例子显然是为了说明模型能够在长时间内依靠自身判断持续推进工作。
API 的单价压得较低
也可以选择不自行部署。在 Kimi API Platform 上选择模型名 kimi-k3 即可调用,每百万 token 的价格为:缓存命中输入 0.30 美元(约 47 日元)、缓存未命中输入 3.00 美元(约 470 日元)、输出 15.00 美元(约 2,350 日元)。该公司称,在编程类场景中官方 API 的缓存命中率超过 90%。
※1 美元 = 157 日元(按 2026 年 8 月 1 日收盘价换算)
此外,手机端的 Kimi 应用、桌面端的 Kimi Work,以及在终端运行的 Kimi Code 也都可以调用该模型。
注意事项也由官方主动说明
Moonshot AI 同时列出了几项限制。其一是思考历史的处理方式:Kimi K3 是在完整回传既往推理内容的前提下训练的,因此在不支持这一点的智能体框架上,或在会话中途从其他模型切换过来时,输出可能变得不稳定。其二是过度主动,由于训练侧重长周期的高难度任务,当指令含糊时模型可能擅自替用户做出判断。该公司还承认,在使用体验方面与 Claude Fable 5、GPT-5.6 Sol 仍存在差距。
此次公开的不只是权重。高性能注意力算子、MoE 通信库,以及大规模运行智能体环境所需的基础设施也一并开放。美国厂商仍将最顶级模型封闭运营,中国厂商则通过开放权重不断扩大存在感。当 3 万亿参数级别的模型可以免费获取,这条分界线看来还会继续移动。
总结
Kimi K3 是首个开放 3T 级模型,将 2.8 万亿参数的 MoE 与 100 万 token 上下文和原生图像理解结合在一起。896 选 16 的极度稀疏结构配合自研注意力机制,据称使单位算力效率较上一代提升约 2.5 倍。基准测试中它位于顶级商用模型之后,但在编程与智能体类的部分项目上实现反超。发布体积约 1.56 TB,自行部署的门槛依然很高。
