国立情報学研究所の大規模言語モデル研究開発センター(LLMC)が、約332億パラメータのDense型モデル「LLM-jp-4 33B」を公開しました。事前学習と中間学習までを終えたベースモデルと、事後学習まで施した推論向けモデルの2種類が、Apache License 2.0のもとでHugging Faceに置かれています。学習に使ったデータセットも同じタイミングで開かれ、重みだけを配って終わりにしない姿勢が今回もはっきり出ています。

8B・32B-A3Bに続く、シリーズ最大のDense型

LLM-jp-4シリーズは2026年4月に、Dense型の8Bモデルと、Mixture of Experts(MoE、複数の小さな専門家モジュールを切り替えながら動かす方式)を採る32B-A3Bモデルが先に公開されていました。今回加わった33Bは、MoEではなく全パラメータを常に使うDense型で、シリーズでは最大規模にあたります。

用意されたのは2本です。llm-jp-4-33b-baseは事前学習と中間学習までを終えた素の状態で、自社の業務に合わせて追加学習をかけるときの土台として想定されています。もう一方のllm-jp-4-33b-thinkingは、そこから教師ありファインチューニング(SFT)と直接選好最適化(DPO)を通した完成品です。

構成は64層、隠れ層の次元が5,120、アテンションヘッドが40。扱えるコンテキスト長は65,536トークンで、総パラメータ数は332億1,954万8,160になります。数値精度はBF16で配布されています。

11.7兆トークンを流し込み、後段に強化学習は使わない

事前学習と中間学習を合わせて、投入されたテキストは11.7兆トークンです。使用したコーパスは、事前学習用と中間学習用のいずれもLLM-jpのGitLab上で公開されています。ライセンスの都合で外された部分は残るものの、何を読ませたのかを外部から追える状態に近づけているのが特徴です。

事後学習の作り方にも特徴があります。SFTとDPOだけで仕上げており、強化学習は使っていません。近年の推論特化モデルが強化学習を主役に据えるのとは対照的な選び方で、DPOに用いたデータセットも今回あわせて公開されました。

トークナイザーはllm-jp-tokenizer v4.0の語彙を移した、Unigramのバイトフォールバック方式です。チャットテンプレートはOpenAIのHarmony応答形式に合わせてありますが、openai-harmonyライブラリでのトークナイズには対応していません。同梱のトークナイザーを使う前提になっている点は、動かす前に押さえておきたいところです。

既存のLLM-jp-4を全項目で上回った

評価にはLLM-jpが開発する評価フレームワークllm-jp-judgeが使われました。審査役を務めるのはgpt-5.4-2026-03-05で、日本語と英語のMT-Bench、日本語の安全性を測るAnswerCarefully、人手で作った単問単答集のllm-jp-instructionsという4つの課題が対象です。スコアは3回の推論と評価の平均値になります。

推論の深さを中設定にそろえた場合の結果は次の通りです。

モデル MT-Bench(日本語) MT-Bench(英語) AnswerCarefully llm-jp-instructions
llm-jp-4-33b-thinking 8.00 8.24 3.79 3.79
llm-jp-4-32b-a3b-thinking 7.82 7.86 3.70 3.61
llm-jp-4-8b-thinking 7.54 7.79 3.69 3.54
gpt-oss-20b 7.33 7.85 3.55 3.16
gpt-5.4-2026-03-05 8.87 8.89 4.43 4.82

これまでに公開されたLLM-jp-4のThinkingモデルを、4つすべてで上回りました。同じ33B前後でもMoEの32B-A3Bとは差がついており、Dense型に振った判断が数字として出た形です。オープンウェイトのgpt-oss-20bに対しても、全項目で上に立っています。

一方で、審査役として使われたgpt-5.4との開きはまだ残ります。MT-Benchの差は1ポイント弱に収まっていますが、AnswerCarefullyでは0.64、llm-jp-instructionsでは1ポイントを超える開きがあり、安全性と指示追従の面では距離が残ると読めます。なお、旧シリーズのllm-jp-3では審査役にgpt-4o-2024-08-06を使っていたため、より厳しく採点する現在の審査役では過去の数値と単純比較できません。

重みもデータも開ける、という選択

ライセンスはApache License 2.0で、商用利用が認められています。重み、SFTとDPOのデータセット、そして学習コーパスまでが同じ枠組みで公開されているため、社内文書に合わせた追加学習や、日本語での評価基盤づくりに手を付けやすい構成です。量子化版も外部から公開が始まっており、llama.cppやOllama、LM Studioで動かす道筋も見えています。

ただし開発側は、これらのモデルが研究開発の初期段階にあり、出力が人間の意図や安全性の観点にそろうよう調整されてはいないと明記しています。そのまま利用者に向けたサービスへ載せるのではなく、追加の調整や検証を挟む前提で扱うのが妥当です。開発にあたっては、国立国語研究所の日本語ウェブコーパス(NWJC)も使われています。

まとめ

LLM-jp-4 33Bは、11.7兆トークンで学習した332億パラメータのDense型モデルで、シリーズの既存モデルを4つのベンチマークすべてで上回りました。強化学習を使わずSFTとDPOで仕上げた点、そして重みだけでなく学習データまでApache License 2.0で開いた点が、このモデルの性格をよく表しています。商用利用まで見据えて国産の土台を探しているなら、まず触ってみる価値のある1本です。