Moonshot AIが、旗艦モデル「Kimi K3」の重みを一般公開しました。総パラメータ数は2.8兆で、自由に入手できるオープンウェイトのモデルとしては過去最大です。同社はこれを世界初の「オープン3T級モデル」と位置づけています。7月16日にモデル自体を投入し、その後まもなくHugging Faceで重み一式を配布しました。ただし手元で動かすとなると、要求される計算資源は個人の手に負える水準を大きく超えます。
896個のうち16個だけを使う極端な疎構成
Kimi K3はMixture-of-Experts(複数の専門家モジュールを切り替えて使う構成)を採用しています。総パラメータは2.8兆ですが、1トークンあたりに実際に動くのは1,040億で、全体の4パーセント弱にとどまります。エキスパートは896個あり、そのうち選ばれるのは16個だけです。これに常時使う共有エキスパートが2個加わります。
層数は93で、注意機構は自社開発のKimi Delta Attention(KDA)が69層、Gated MLAが24層という混成です。Moonshot AIは、この構成とStable LatentMoEと呼ぶ枠組みを組み合わせることで、前世代のKimi K2に対して計算量あたりの知能を約2.5倍に高めたと説明しています。パラメータを増やしただけではない、という主張をわざわざ添えているあたりに、規模競争と一線を画したい意図がうかがえます。
そのほかの仕様は、コンテキスト長が1,048,576トークン、語彙サイズが16万、画像を扱うエンコーダーはMoonViT-V2で4億100万パラメータ。テキストと画像を同じモデルの中で理解する、いわゆるネイティブマルチモーダルの構成です。
配布サイズは約1.56TB、動かす側のハードルは高い
重みはMXFP4という4ビットの形式で保存されています。しかも後付けの圧縮ではなく、教師ありファインチューニングの段階から量子化を前提に学習させる方式で、活性値にはMXFP8を使います。それでも配布物の容量は96分割でおよそ1.56テラバイトに達します。
Moonshot AI自身も、推論効率の観点から64基以上のアクセラレータで構成するスーパーノードでの運用を推奨しています。研究機関やクラウド事業者、資金力のあるスタートアップであれば自前で回せますが、個人開発者が手元のGPUで試す類のモデルではありません。推論エンジンとしてはvLLM、SGLang、TokenSpeedが挙げられており、KDAが従来のプレフィックスキャッシュと相性の悪い点については、同社がvLLM側へ実装を提供しています。
ライセンスは汎用のオープンソースライセンスではなく、独自の「Kimi K3 License」です。重みを取得して改変・配布できる点は変わりませんが、条件は各自で確認しておく必要があります。
ベンチマークでは上位2モデルを追う位置
Moonshot AIが公開した評価表を見ると、Kimi K3はClaude Fable 5とGPT-5.6 Solを追う位置につけています。同社自身も、総合的な性能では最上位の商用モデルにまだ届いていないと明言しています。
とはいえ項目ごとに見ると勝っている領域も少なくありません。長時間のソフトウェア開発を扱うSWE-Marathonでは42.0で最高値、Webを渡り歩くBrowseCompでは91.2、MCPMark-Verifiedでは94.5を記録しています。GPQA Diamondは93.5で、Claude Fable 5の92.6を上回りました。一方でFrontierSWEは81.2とClaude Fable 5の86.6に差をつけられ、知識労働を測るAA-BriefcaseのEloも1548で1583に届いていません。
面白いのは、同社がKimi K3にチップを設計させた事例を挙げていることです。48時間の自律実行でオープンソースのEDAツールを使い、4平方ミリメートルの中に100MHzで動作する回路をまとめ、シミュレーション上で毎秒8,700トークン超のデコード性能を出したとしています。長時間にわたって自分で判断しながら作業を続ける力を示す例として持ち出したものでしょう。
APIは1トークンあたりの単価を抑えた設定
自前で動かさない選択肢もあります。Kimi API Platformでモデル名kimi-k3を選べば利用でき、料金は100万トークンあたりキャッシュヒットの入力が0.30ドル(約47円)、キャッシュミスの入力が3.00ドル(約470円)、出力が15.00ドル(約2,350円)です。同社によると、コーディング用途では公式APIのキャッシュヒット率が90パーセントを超えるとしています。
※1ドル157円換算(2026年8月1日の終値ベース)
このほか、スマートフォン向けのKimiアプリ、デスクトップアプリのKimi Work、ターミナルで動くKimi Codeからも利用できます。
注意点も自ら開示している
Moonshot AIは制約も並べています。1つは思考履歴の扱いで、Kimi K3は過去の推論内容をすべて渡し直す前提で学習されているため、対応していないエージェント基盤や、途中で別モデルから切り替えた場合に出力が不安定になります。もう1つは過剰な能動性で、長時間の難しい作業を重視して訓練した結果、指示が曖昧な場面で勝手に判断を進めてしまうことがあるといいます。加えて、使い勝手の面ではClaude Fable 5やGPT-5.6 Solとの差が残ると認めています。
公開されたのは重みだけではありません。高速な注意機構のカーネル、MoEの通信ライブラリ、エージェントの実行環境を大規模に回すための基盤も併せて開放されています。米国勢が最上位モデルを閉じたまま運用しているのに対し、中国勢は重みを開く方向で存在感を高めてきました。3兆パラメータ級が無償で降りてきたことで、その線引きはさらに動きそうです。
まとめ
Kimi K3は、2.8兆パラメータのMoEに1Mトークンのコンテキストとネイティブの画像理解を組み合わせた、初のオープン3T級モデルです。896個中16個のエキスパートを使う極端な疎構成と独自の注意機構により、前世代比で計算量あたり約2.5倍の効率をうたいます。ベンチマークでは最上位の商用モデルを追う位置ですが、コーディングやエージェント系の一部項目では上回りました。配布容量は約1.56テラバイトで、自前運用のハードルは依然として高いままです。
