日本國立情報學研究所旗下的大規模語言模型研究開發中心(LLMC)公開了約 332 億參數的 Dense 型模型「LLM-jp-4 33B」。兩款版本已放上 Hugging Face,皆採用 Apache License 2.0:一款是完成預訓練與中期訓練的基礎模型,另一款則是完成後訓練的推理版模型。訓練所使用的資料集也同步公開,延續了這個專案不只釋出權重的一貫作風。
繼 8B 與 32B-A3B 之後,系列中規模最大的 Dense 型
LLM-jp-4 系列在 2026 年 4 月先行公開了 Dense 型的 8B 模型,以及採用 Mixture of Experts(MoE,透過切換多個較小的專家模組來運作的架構)的 32B-A3B 模型。這次加入的 33B 並非 MoE,而是全部參數持續參與運算的 Dense 型,在系列中規模最大。
公開的模型共有 2 款。llm-jp-4-33b-base 僅完成預訓練與中期訓練,定位是針對特定業務追加訓練時的基底。llm-jp-4-33b-thinking 則是在此之上經過監督式微調(SFT)與直接偏好最佳化(DPO)的後訓練成品。
架構為 64 層,隱藏層維度 5,120,注意力頭 40 個,可處理的脈絡長度為 65,536 個 token,總參數量為 33,219,548,160。權重以 BF16 精度釋出。
投入 11.7 兆 token,後訓練沒有使用強化學習
預訓練與中期訓練合計投入的文本量為 11.7 兆 token。所使用的語料無論預訓練用或中期訓練用,都已公開在 LLM-jp 的 GitLab 上。雖然受授權條款限制仍有部分內容未能釋出,但外界能夠追溯模型讀過哪些素材,這一點相當少見。
後訓練的作法同樣值得注意。團隊只用 SFT 與 DPO 收尾,並未使用強化學習,與近年推理特化模型普遍把強化學習擺在核心的路線形成對比。這次也一併公開了 DPO 所使用的資料集。
斷詞器採用 Unigram 位元組回退方式,詞彙表移植自 llm-jp-tokenizer v4.0。對話樣板設計為相容 OpenAI 的 Harmony 回應格式,但不支援透過 openai-harmony 函式庫進行斷詞,必須使用隨模型附帶的斷詞器。這一點在實際佈署前需要先確認。
在所有項目上都超越既有的 LLM-jp-4
評測使用 LLM-jp 自行開發的評測框架 llm-jp-judge,擔任評審的模型是 gpt-5.4-2026-03-05,考察對象包含日文與英文的 MT-Bench、衡量日文安全性的 AnswerCarefully,以及由人工撰寫的單輪問答集 llm-jp-instructions 共 4 項任務。分數為 3 輪推論與評測的平均值。
將推論深度統一設為中等時,結果如下。
| 模型 | MT-Bench(日文) | MT-Bench(英文) | AnswerCarefully | llm-jp-instructions |
|---|---|---|---|---|
| llm-jp-4-33b-thinking | 8.00 | 8.24 | 3.79 | 3.79 |
| llm-jp-4-32b-a3b-thinking | 7.82 | 7.86 | 3.70 | 3.61 |
| llm-jp-4-8b-thinking | 7.54 | 7.79 | 3.69 | 3.54 |
| gpt-oss-20b | 7.33 | 7.85 | 3.55 | 3.16 |
| gpt-5.4-2026-03-05 | 8.87 | 8.89 | 4.43 | 4.82 |
新模型在 4 項測試中全數超越先前公開的 LLM-jp-4 Thinking 系列。即使總規模相近,它與採用 MoE 的 32B-A3B 之間仍拉開差距,可以看作選擇 Dense 路線換來的成果。面對開放權重的 gpt-oss-20b,它在所有項目上同樣領先。
另一方面,與擔任評審的 gpt-5.4 之間仍有差距。MT-Bench 的落差控制在 1 分以內,但 AnswerCarefully 落後 0.64 分,llm-jp-instructions 則落後超過 1 分,顯示安全性與指令遵循仍有距離。另外要說明的是,先前的 llm-jp-3 系列由 gpt-4o-2024-08-06 擔任評審,而現行評審模型評分更為嚴格,兩代數值無法直接比較。
不只開放權重,連資料也一起開放
授權為 Apache License 2.0,允許商業使用。權重、SFT 與 DPO 資料集,乃至訓練語料都放在同一套開放框架之下,因此針對內部檔案進行追加訓練,或建立日文的評測基礎環境,都比較容易著手。第三方釋出的量化版本也已經出現,透過 llama.cpp、Ollama、LM Studio 執行的路徑同樣明確。
不過開發方明確指出,這些模型仍處於研究開發的早期階段,尚未針對輸出符合人類意圖與安全考量進行調校。與其直接接上面向使用者的服務,先加入額外的調整與驗證才是穩妥的用法。開發過程中也使用了日本國立國語研究所的日文網路語料庫(NWJC)。
總結
LLM-jp-4 33B 是以 11.7 兆 token 訓練而成的 332 億參數 Dense 型模型,在 4 項基準測試中全面超越系列既有模型。不依賴強化學習、僅以 SFT 與 DPO 收尾,以及不只公開權重還公開訓練資料,這兩點清楚定義了它的性格。若正在尋找可商用的日文基礎模型,它值得先實際上手試試。
