Thinking Machines Labが2本目のモデル「Inkling-Small」を公開しました。総パラメータ276B、推論時の活性化12BのMoEで、7月中旬に登場した旗艦モデルInklingのおよそ4分の1という大きさです。小さいほうが劣るという常識に反して、推論とコーディングのベンチマークでは親モデルを上回りました。重みはApache 2.0で配布され、量子化版ならGPU 1基でも動きます。ただし事実知識の面では明確に後退しています。
親の4分の1でも、同じ知能帯に収まる
Inkling-Smallは42層のデコーダ専用トランスフォーマで、フィードフォワード部にスパースMoE(Mixture of Experts、専門家混合)を採用しています。総パラメータは276B、1トークンあたり動くのは12Bだけです。ルーティング対象の256個から各トークンが6個のエキスパートを選び、これに全トークン共通の共有エキスパート2個が加わります。学習にはNVIDIAのGB300 NVL72が使われました。
比較対象となる旗艦のInklingは総975B・活性化41Bですから、総パラメータで約3.5分の1、活性化でも3分の1強という計算になります。それでも第三者評価のArtificial Analysisは、Inkling-SmallのIntelligence Indexを40と算定しました。Inklingの41に対して1ポイント差です。同社は、このサイズ以下のオープンウェイトモデルでこれを上回るものは無いとしています。
なお文脈長は、公式ブログが最大100万トークンとする一方、Artificial Analysisは256Kトークンと記載しています。提供経路によって上限が変わるとみられるため、使う前に確認しておきたい部分です。
Thinking Machines Labは、OpenAIの元CTOであるMira Murati氏がサンフランシスコで立ち上げた研究所です。7月中旬にInklingを出してから2週間ほどでの2本目という速さになります。
後から作ったことが効いた
小さいモデルが親を追い抜いた理由は、学習の順番にあります。公式の説明によれば、Inkling-Smallの学習が始まったのは大きいほうより後でした。その分だけ、事前学習のデータ配合と機械学習のレシピを見直す余地があったわけです。
さらに、途中段階のチェックポイントに対してInklingを教師とするオンポリシー蒸留を施し、そこからエージェント的なコーディングの強化学習を2週間ぶん積み増しています。設計を大きくするのではなく、学習手順を組み替えて詰めていく作り方といえます。
得意分野では親を抜き、知識では負ける
数字を並べると、伸びた領域と落ちた領域がはっきり分かれます。
推論系では、Humanity's Last Exam(テキストのみ)が31.6パーセントで、Inklingの29.7パーセントを上回りました。GPQA Diamondは89.5対87.2、ARC-AGI-2は40.1対36.5です。コーディングのSWEBench Verifiedは80.2対77.6、Terminal Bench 2.1は64.7対63.8。ツール操作を測るToolathlon Verifiedでは54.4対45.5と、10ポイント近い差をつけました。
一方で落ちたのが事実知識です。SimpleQA Verifiedは20.6パーセントで、Inklingの43.9パーセントから半分以下に沈みました。金融タスクのτ³-Bankingも15.5対23.7で負けています。Artificial Analysisの集計では、AA-Omniscienceの指数がマイナス9.0で、2.1のInklingに対し正解より不正解が多い状態です。ただし同社は、これは幻覚(ハルシネーション)が増えたためではなく、正答率そのものが31パーセントと低いことが原因だと指摘しています。幻覚率はむしろInklingより低い57パーセントでした。
要するに、考える力とツールを使う力は保ったまま、覚えている量だけが削られた形です。検索やRAGで知識を外から与える設計なら影響は小さく、モデル単体の記憶に頼る用途では効いてきます。
トークンの使い方も倹約型
出力トークンの量にも触れておきます。Artificial AnalysisのIntelligence Index 1タスクあたりの平均出力は約24,000トークンで、Inklingの約25,000トークンをわずかに下回りました。同じ知能帯のDeepSeek V4 Flash(max)が約45,000、GPT-5.4 mini(xhigh)が約78,000ですから、かなり簡潔な部類に入ります。
長時間の作業を測るAA-Briefcaseでは917 Eloと、Inklingの839を上回りました。ただしArtificial Analysisは、ルーブリック通過率がほぼ同じ(20対19パーセント)である点を挙げ、正確さが上がったというより出力の見せ方が良くなった結果だと分析しています。タスク完了までのターン数は平均34で、Inklingの81に対して半分以下でした。
音声と画像は据え置き、自前運用は180GBから
マルチモーダル面はInklingとほぼ同等を維持しています。エンコーダを持たない構成は同じで、画像は40×40ピクセルのパッチに分割して4層のhMLPで変換し、音声はdMelスペクトログラムとして扱います。MMMU Proは74.0パーセント、図表読解のCharXiv RQは77.4パーセントで、Pythonでトリミングや拡大をさせると81.3パーセントまで伸びます。音声側はMMAUが77.0パーセント、VoiceBenchが90.1パーセントです。
自前で動かす場合の要件も公開されています。モデルカードによると、BF16のチェックポイントは合計600GB以上のVRAMを要求し、NVIDIA B300を4基またはH200を8基という構成になります。NVFP4版ならこの下限が180GBまで下がり、B300を1基(SM100以上)でW4A4、H200を2基でW4A16という運用が可能です。対応ランタイムにはSGLang、vLLM、TokenSpeed、Unsloth、Hugging Faceが挙げられています。
276Bクラスが単体GPUの射程に入るのは、それなりに大きな変化です。とはいえB300を1基借りられる環境が前提ですから、手元のノートPCで動かすという話ではありません。
安全性の評価と入手方法
安全面の後処理はInklingと同じレシピで、公開前の内部評価と外部パートナーによるレッドチーミングも同様に実施されたとしています。明確に有害な要求を拒めるかを見るStrongREJECTは98.4パーセント。犯罪や暴力、軍民両用リスクを含むFORTRESSでは、敵対的な設問への拒否率が71.6パーセント、無害な設問に答えられた率が96.9パーセントでした。同社は、既存のオープンウェイト環境に対して実質的な上乗せリスクは無いと結論づけつつ、消費者向けに載せる場合は下流での追加的なモデレーションを推奨しています。
重みはHugging Faceで配布され、ライセンスはApache 2.0です。同社のファインチューニング基盤Tinkerでも扱え、テキスト・画像・音声のチャットはTinker Playgroundから試せます。InklingとInkling-Smallはいずれも期間限定の割引価格が設定されています。
まとめ
Inkling-Smallは、総276B・活性化12Bという構成で、4倍近い大きさの親モデルを推論とコーディングで上回りました。Apache 2.0で重みが配られ、NVFP4版なら180GBのVRAMで動きます。反面、事実知識のスコアは半分以下に落ちており、モデルの記憶だけに頼る使い方には向きません。検索やツールと組み合わせる前提で、自分のタスクで測り直してから判断するのが妥当なところでしょう。
