IBMが現地時間の2026年8月25日、企業向けAIモデル群「Granite 4.2」を公開しました。30億、80億、300億パラメータの3サイズで、いずれもApache 2.0ライセンスです。今回の目玉は、答える前に段階を踏んで考える推論機能と、8Bと30Bだけに施された実環境でのエージェント訓練にあります。同時に4億7,000万パラメータの音声モデル2種も出ています。

3つのサイズと「考える/考えない」の切り替え

Granite 4.2は、Denseと呼ばれる全パラメータが常時動く構成のデコーダー専用モデルです。MoE(混合エキスパート)のように一部だけを起動する方式ではないため、実行環境を選ばず動かしやすいのが特徴になります。

3サイズすべてに、回答前に思考の過程を出力する仕組みが入っています。運用側は思考モードと非思考モードを切り替えられるほか、その中間として短い思考予算だけを割り当てる「低労力モード」も選べます。簡単な質問に長い思考を費やして待たされる、という無駄を減らすための設計です。

ツール呼び出しはモデル本体が標準で扱います。vLLMなどOpenAI互換のエンドポイント経由で動かせば、OpenAIのファンクションコーリング形式でそのまま呼び出しが出てくるため、既存のエージェント基盤に追加の変換処理なしで差し込めます。推論フレームワークはvLLMとSGLangが対応済みで、Hugging Face、Ollama、GitHub、LM Studio、OpenRouter、Replicateなどから入手できます。対応言語には日本語も含まれます。

デプロイ先はクラウド、オンプレミス、エッジのいずれも想定されています。3Bは高頻度で回すエージェント処理、30Bは重い推論やコーディングという住み分けです。推論用の量子化版も用意され、LLM Compressorを使ったFP8・NVFP4・MXFP4のほか、llama.cppによるGGUFがQ2_KからQ8_0まで揃っています。

15兆トークンから作り直した土台

事前学習はゼロからの実施で、規模はおよそ15兆トークンです。5つの段階に分けて進める方式を取り、第1・第2段階が基礎的な事前学習、第3・第4段階が高品質データへ寄せていく中間学習(mid-training)、第5段階が長文脈の学習という組み立てになっています。第5段階ではコンテキスト長を51万2,000トークンまで引き伸ばして訓練しました。ただし公開されているモデル設定上のシーケンス長は13万1,072トークン(128K)です。

アーキテクチャはGrouped Query Attention(GQA)にアテンションヘッド40・KVヘッド8、位置埋め込みはRoPE(θ=10,000,000)、活性化はSwiGLU、正規化はRMSNorm、精度はbfloat16という構成です。入出力の埋め込みは共有していません。層数は3Bと8Bが40層、30Bが64層になります。

学習データ側の工夫も出ています。IBM独自の「CodeAlchemy」で生成した合成コード1兆トークン分を投入し、さらに高速化のための投機的デコーディング層を組み込みました。教師ありファインチューニング(SFT)では約720万サンプル、およそ1,000億トークンを使い、うちエージェント関連が31.6パーセントを占めます。エージェント側の内訳はソフトウェア開発が69パーセント、ツール呼び出しが12.1パーセント、ターミナル操作が8.0パーセントです。

品質管理では、GPT-OSS-120BとGemma 4を判定役に立て、低評価のサンプルや、事実の捏造・不正なツール呼び出しを含むサンプルを除去しています。重複排除はツール定義とメッセージを結合したSHA-256ハッシュで、データソース内とデータセット全体の両方に対して実施されました。

実環境でエージェントを鍛える多段強化学習

SFTの後段が今回の中心です。1回で終わらせる強化学習ではなく、目的を1つに絞った学習を鎖状につなぎ、前段のチェックポイントを引き継ぎながら進める構成を取りました。順序はRLVR(検証可能な報酬による強化学習)、スキルブースター、SWEエージェント、ターミナル、検索、最後にRLHFです。

前半のRLVRでは、数学の答え合わせやLeanによる形式証明、隠しテストに通すコード生成、大学院レベルの科学問題、指示追従、ツール呼び出しなど、機械的に正誤を判定できる課題を混ぜています。1ステップあたり256のプロンプトに16通りの応答を生成し、4,096件のバッチで1回更新するという回し方です。学習アルゴリズムは非同期GRPOで、生成側と学習側が互いを待たずに動きます。

後半のエージェント強化学習は、8Bと30Bだけが通る区間です。3Bはここを飛ばして基礎的な強化学習とアライメントで終わります。

ソフトウェア開発の段階では、実在するリポジトリを1件ずつサンドボックスに立て、OpenHandsのハーネス越しにコードを読んで編集し、テストを走らせます。報酬は隠しテストが通ったかどうかという明快な形です。ターミナルの段階ではHarbor/Terminus-2を使い、生きたシェル上で最大64ターンのやり取りを重ねながらコマンドを組み立て、失敗から復帰する動きを学ばせます。検索の段階では、実際のWeb検索ツールを呼びながら多段の質問に答えさせ、最終回答をLLMが採点します。

学習基盤にはNVIDIAのNeMo-RLとNeMo-Gymを採用し、ハードウェアはCoreWeaveがホストするNVIDIA GB200 NVL72クラスターです。仕上げのRLHFでは、好みと安全性の調整に加えて、思考が冗長になりすぎないよう長さのペナルティもかけています。

ベンチマークで見える8Bと30Bの差

IBMが公開した数値を見ると、エージェント訓練を受けた2サイズの伸びがはっきり出ています。ソフトウェア開発のSWE-bench Verifiedは30Bが57.00、8Bが47.67で、Terminal-Bench 2.1は30Bが29.24、8Bが20.56でした。3Bはこの領域の測定対象外です。

推論系では、数学のAIME25が30B・8B・3Bの順に89.17、86.67、78.33。科学のGPQAが66.41、64.14、54.80。コード推論のLiveCodeBench v6が75.77、73.24、69.71となっています。総合知識のMMLU-Proは30Bで77.60、長文脈のRULER 128Kは30Bで81.38です。

3Bでも数学や指示追従はかなりの水準に届いており、軽さを優先する用途なら十分に選択肢に入ります。一方で、ツールを実際に叩いて仕事を終わらせる用途では8B以上を選ぶ、という切り分けがベンチマーク上も裏付けられた形です。なお、これらはIBM自身が公表した数値であり、第三者による独立検証ではない点は押さえておく必要があります。

470Mの音声モデルも同時公開

言語モデルと合わせて、音声モデル「Granite Speech 5.0 Turbo CTC」とその非商用版が出ました。パラメータは4億7,000万で、Granite系では最小の部類に入ります。前世代の4.1から構造が変わったため、バージョン番号が5.0に飛んでいます。

大きな変更点は、LLMをバックボーンに持たないことです。CTC(コネクショニスト時系列分類)で音声とテキストを直接対応付ける方式に切り替え、モデルサイズを抑えたまま音声認識の効率を上げました。IBMの測定では、H200を1基使った条件で処理スループット(RTFx)が約12,600に達したとされています。Hugging FaceのOpen ASRリーダーボードで速度上位のモデルが6,000前後であることを踏まえると、倍近い数字です。3時間分の音声を1秒で書き起こせる計算になり、ノートPCやスマートフォンでの常時起動や、コールセンターの大量ログ処理といった使い方が視野に入ります。

IBMはこのほか、Hirundoの機械アンラーニング技術を使い、再学習なしで望ましくない出力を減らす取り組みも進めていると説明しています。

まとめ

Granite 4.2は、モデルを大きくするのではなく、後段の訓練を作り込むことでエージェント性能を伸ばした事例です。実環境のリポジトリやシェル、Web検索を報酬付きで回すという手法を、Apache 2.0で配布されるオープンウェイトのモデルで実装した点に価値があります。8Bと30Bのどちらを選ぶかは、ツール操作の難易度と手元の計算資源次第と言えるでしょう。