日本国立情报学研究所旗下的大规模语言模型研究开发中心(LLMC)发布了约 332 亿参数的稠密(Dense)模型「LLM-jp-4 33B」。两个版本已上传至 Hugging Face,均采用 Apache License 2.0:一个是完成预训练与中期训练的基础模型,另一个是完成后训练的推理版模型。训练所用的数据集也同期公开,延续了该项目不只放出权重的一贯做法。

继 8B 与 32B-A3B 之后,系列中规模最大的稠密型

LLM-jp-4 系列在 2026 年 4 月首先公开了稠密型的 8B 模型,以及采用 Mixture of Experts(MoE,通过切换多个较小的专家模块来运行的架构)的 32B-A3B 模型。此次加入的 33B 并非 MoE,而是全部参数始终参与计算的稠密型,也是该系列目前规模最大的一款。

公开的模型共有 2 个。llm-jp-4-33b-base 仅完成预训练与中期训练,定位是针对具体业务追加训练时的底座。llm-jp-4-33b-thinking 则在此基础上经过监督微调(SFT)与直接偏好优化(DPO)的后训练。

结构方面为 64 层,隐藏层维度 5,120,注意力头 40 个,可处理的上下文长度为 65,536 个 token,总参数量为 33,219,548,160。权重以 BF16 精度发布。

投入 11.7 万亿 token,后训练阶段未使用强化学习

预训练与中期训练合计投入的文本量为 11.7 万亿 token。所用语料无论是预训练用还是中期训练用,都已在 LLM-jp 的 GitLab 上公开。虽然受许可证限制仍有部分内容未能放出,但外界能够追溯模型读过哪些材料,这一点相当少见。

后训练的做法同样值得注意。团队仅使用 SFT 与 DPO 完成收尾,没有使用强化学习,与近年推理型模型普遍把强化学习放在核心位置的路线形成对照。此次还同步公开了 DPO 所用的数据集。

分词器采用 Unigram 字节回退方式,词表来自 llm-jp-tokenizer v4.0。对话模板设计为兼容 OpenAI 的 Harmony 响应格式,但不支持通过 openai-harmony 库进行分词,必须使用随模型附带的分词器。这一点在部署前需要先确认。

在全部项目上超过此前的 LLM-jp-4

评测使用了 LLM-jp 自研的评测框架 llm-jp-judge,担任评审的模型是 gpt-5.4-2026-03-05,考察对象包括日语与英语的 MT-Bench、衡量日语安全性的 AnswerCarefully,以及由人工编写的单轮问答集 llm-jp-instructions 共 4 项任务。分数为 3 轮推理与评测的平均值。

将推理深度统一设为中等时,结果如下。

模型 MT-Bench(日语) MT-Bench(英语) AnswerCarefully llm-jp-instructions
llm-jp-4-33b-thinking 8.00 8.24 3.79 3.79
llm-jp-4-32b-a3b-thinking 7.82 7.86 3.70 3.61
llm-jp-4-8b-thinking 7.54 7.79 3.69 3.54
gpt-oss-20b 7.33 7.85 3.55 3.16
gpt-5.4-2026-03-05 8.87 8.89 4.43 4.82

新模型在 4 项测试中全部超过了此前公开的 LLM-jp-4 Thinking 系列。即便总规模相近,它与采用 MoE 的 32B-A3B 也拉开了差距,可以看作选择稠密路线换来的结果。面对开放权重的 gpt-oss-20b,它在所有项目上同样领先。

另一方面,与担任评审的 gpt-5.4 相比仍有差距。MT-Bench 的差距控制在 1 分以内,但 AnswerCarefully 落后 0.64 分,llm-jp-instructions 则落后超过 1 分,说明安全性与指令遵循方面还有距离。需要说明的是,此前的 llm-jp-3 系列由 gpt-4o-2024-08-06 担任评审,而现在的评审模型打分更为严格,两代数值无法直接比较。

不只开放权重,也开放数据

许可证为 Apache License 2.0,允许商用。权重、SFT 与 DPO 数据集,乃至训练语料都置于同一开放框架之下,因此针对内部文档做追加训练,或搭建日语评测体系,都比较容易上手。第三方发布的量化版本也已经出现,通过 llama.cpp、Ollama、LM Studio 运行的路径同样清晰。

不过开发方明确表示,这些模型仍处于研发早期阶段,尚未针对输出符合人类意图与安全考量进行调优。比起直接接入面向用户的服务,先做额外的调整与验证才是稳妥的用法。开发过程中还使用了日本国立国语研究所的日语网络语料库(NWJC)。

总结

LLM-jp-4 33B 是一款以 11.7 万亿 token 训练的 332 亿参数稠密模型,在 4 项基准测试中全面超过系列既有模型。不依赖强化学习、仅靠 SFT 与 DPO 收尾,以及不只公开权重还公开训练数据,这两点很好地体现了它的定位。如果正在寻找可商用的日语底座模型,它值得先上手一试。