中国的 Moonshot AI 于 2026 年 7 月 16 日发布了新一代大语言模型 Kimi K3。该模型总参数量达 2.8 万亿,是迄今公开权重的模型中规模最大的一个。规模并非唯一看点:在多项基准测试中,它紧随 OpenAI 与 Anthropic 的顶级模型之后。完整权重计划于 7 月 27 日放出,时间点正好卡在上海世界人工智能大会开幕之前。
「开放模型性能低一档」的前提被打破
此前开放权重的模型通常要落后闭源前沿模型半年左右。看过 K3 的成绩后,这个前提这次不太站得住脚。
在模拟真实职业任务的 GDPval-AA v2 上,K3 得到 1,687 分,位列总榜第三。排在前面的只有 Claude Fable 5 Max 的 1,815 分和 GPT-5.6 Sol Max 的 1,747.8 分,而 Claude Opus 4.8 的 1,600 分被它超过。在衡量长时间知识工作的 AA-Briefcase 上,K3 以 1,527 分排名第二,反超了 GPT-5.6 Sol Max 的 1,495 分。
另一个亮点是在高难度信息检索基准 BrowseComp 上拿到的 91.2 分。Moonshot AI 说明,这个分数是在只启用单个智能体、不做上下文压缩、也不加特殊上下文管理的条件下取得的。言下之意是:与其用多个智能体拼接调度,不如让模型直接把长上下文整段读完,在某些场景下反而更强。
内部是稀疏 MoE,定价略显强势
K3 并不是每次都调用全部参数,而是采用稀疏的混合专家架构,每个 token 只经过 896 个专家中的 16 个。这也是 2.8 万亿规模仍然跑得动的原因。
技术上的新东西有两项,均由 Moonshot AI 自研。一是混合式线性注意力 Kimi Delta Attention,二是用于替换残差连接的 Attention Residuals,两者都旨在让规模扩大时的收益保持稳定。此外,上下文长度超过 104 万 token,原生支持图像理解,推理模式常驻开启。
API 直接兼容 OpenAI SDK,现有代码基本只需改一下调用地址就能试。价格为每百万输入 token 3 美元(约 490 日元)、每百万输出 token 15 美元(约 2,400 日元),命中缓存的输入则降至 0.30 美元(约 50 日元)。这在中国厂商中算是强势定价,但完成同样任务的单价大约只有 Claude Opus 4.8 的一半。8 月 12 日之前,充值 1,000 美元(约 16 万日元)以上还可获得最高 30% 的代金券返还。
※1 美元 = 162 日元(2026 年 7 月 18 日收盘价)
想立刻上手的话,可以通过 kimi.com、面向办公的 Kimi Work 以及面向开发者的 Kimi Code 使用。
花 48 小时设计一颗自己用的芯片
比基准分数更有说服力的,是随发布一同展示的演示。Moonshot AI 让 K3 设计一颗芯片,用来运行把它自身极度缩小后的版本。
据称,K3 使用开源的设计自动化工具,在 48 小时内无人干预地走完了从架构设计到优化、验证的完整流程。最终产出是一颗面积 4 平方毫米的小芯片,在 100MHz 下达成时序收敛,仿真中每秒可解码 8,700 个以上的 token。
这不是要量产的产品。演示真正想验证的,是模型能否把「读资料、做判断、失败后重来」这一循环连续维持两天。这与一问一答的能力属于不同维度,说明竞争已进入考验智能体持久力的阶段。天体物理领域也有一个例子:研究者通常需要一到两周的计算,K3 约两小时便复现出来,过程中比对阅读了 20 多篇论文。
一家跌落过的公司,用规模重新下注
Moonshot AI 成立于 2023 年,创始人杨植麟毕业于清华大学,曾在 Google 与 Meta 从事研究工作。2024 年,Kimi 凭借长文本解析与 AI 搜索迅速走红,中国月活跃用户数一度升至第三。
转折点出现在 2025 年 1 月。DeepSeek 推出低成本的 R1,市场注意力随之转移,Kimi 的排名跌到第七。公司累计融资约 15 亿美元(约 2,400 亿日元),估值从 25 亿美元(约 4,000 亿日元)升至 43 亿美元(约 7,000 亿日元),但存在感明显被削弱。
此后的翻身之策,正是从 2025 年 7 月的 Kimi K2 开始的开放路线。K3 是这条路线的延续,而规模差距相当明显:在公开权重的同行中,DeepSeek 为 1.6 万亿,Xiaomi 为 1.02 万亿,Alibaba 为 3,970 亿,K3 明显高出一截。训练 2.8 万亿规模的模型需要可观的算力与数月准备,因此这一步棋很可能早已布局。此后融资也一路顺畅:2026 年 5 月公司募得约 20 亿美元(约 3,200 亿日元),估值已回升至 200 亿美元(约 3.2 万亿日元)以上。
对于无力自行训练的企业来说,可以自行部署并微调的准前沿模型选项变多了。也可以这样理解:在美国收紧算力出口的背景下,中国方面正试图通过公开权重,坐上全球开发者社区的中心位置。等到 7 月 27 日权重真正放出,下一个焦点将是这套东西究竟能在多少人手里跑起来。
总结
Moonshot AI 发布的 Kimi K3 拥有 2.8 万亿参数和超过 104 万 token 的上下文,是公开权重模型中规模最大的一批。GDPval-AA v2 第三名、BrowseComp 91.2 分,说明它与闭源顶级模型的差距已大幅缩小。正如 48 小时自主设计芯片的演示所示,胜负手正从单次问答转向长时间的智能体运行。完整权重预计于 7 月 27 日公开。
