IBM 于当地时间 2026 年 8 月 25 日发布面向企业的 AI 模型系列「Granite 4.2」,提供 30 亿、80 亿和 300 亿参数三种规格,全部采用 Apache 2.0 许可证。本次的重点在于回答前分步思考的推理能力,以及仅对 8B 和 30B 施加的真实环境智能体训练。同期还发布了两款 4.7 亿参数的语音模型。

三种规格与「思考/不思考」开关

Granite 4.2 采用 Dense(稠密)架构的仅解码器模型,即所有参数在每个 token 上都参与计算。与只激活部分网络的 MoE(混合专家)方式不同,稠密模型对运行环境的挑剔程度更低,部署更为省心。

三种规格都能在给出答案前输出思考过程。运维方可以在思考模式和非思考模式之间切换,两者之间还有只分配少量思考预算的「低强度模式」。其目的是避免为简单问题付出漫长的思考等待。

工具调用由模型原生支持。通过 vLLM 等 OpenAI 兼容端点提供服务时,模型会直接以 OpenAI 的函数调用格式输出工具调用,因此无需额外的转换代码即可接入现有的智能体框架。推理框架方面 vLLM 与 SGLang 均已支持,权重可从 Hugging Face、Ollama、GitHub、LM Studio、OpenRouter、Replicate 等处获取。支持的语言中包含日语。

部署场景涵盖云端、本地和边缘。3B 适合高频次运行的智能体任务,30B 则留给较重的推理和编程工作。官方还提供了用于推理的量化版本:基于 LLM Compressor 的 FP8、NVFP4、MXFP4,以及由 llama.cpp 转换的 GGUF,覆盖 Q2_K 到 Q8_0。

从 15 万亿 token 重建的底座

预训练从零开始,规模约为 15 万亿 token,分五个阶段推进。第 1、2 阶段为基础预训练,第 3、4 阶段是逐步转向高质量数据的中期训练(mid-training),第 5 阶段则是长上下文训练,将上下文长度拉伸到 51.2 万 token。不过公开模型配置中的序列长度为 131,072 token(128K)。

架构方面采用分组查询注意力(GQA),注意力头 40 个、KV 头 8 个,位置编码为 RoPE(θ=10,000,000),激活函数为 SwiGLU,归一化为 RMSNorm,精度为 bfloat16。输入与输出嵌入不共享。层数上 3B 和 8B 为 40 层,30B 为 64 层。

数据侧同样下了功夫。IBM 投入了由自研「CodeAlchemy」生成的 1 万亿 token 合成代码,并加入用于提速的推测解码层。有监督微调(SFT)使用约 720 万条样本、约 1,000 亿 token,其中智能体相关数据占 31.6%。智能体语料的构成为软件工程 69%、工具调用 12.1%、终端操作 8.0%。

质量管控上,IBM 以 GPT-OSS-120B 和 Gemma 4 作为评审模型,剔除评分偏低的样本,以及包含捏造信息或无效工具调用的样本。去重则基于工具定义与消息拼接后的 SHA-256 哈希,在单一数据源内部和整体混合数据集两个层面同时执行。

在真实环境中锤炼智能体的多阶段强化学习

SFT 之后的环节才是这次的核心。IBM 没有采用一次性的强化学习,而是把目标单一的训练串成链条,逐段继承前一阶段的检查点。顺序依次是 RLVR(可验证奖励的强化学习)、技能增强、SWE 智能体、终端、检索,最后是 RLHF。

前半段的 RLVR 混合了可以机械判定对错的任务:数学答案核对与基于 Lean 的形式化证明、以隐藏测试判定的代码生成、研究生水平的科学题、指令遵循、工具调用等。每一步用 256 条提示各生成 16 个回答,组成 4,096 条的批次完成一次更新。算法为异步 GRPO,生成侧与训练侧互不等待。

后半段的智能体强化学习只有 8B 和 30B 才会经历,3B 跳过这一段,在基础强化学习和对齐之后即告结束。

软件工程阶段会为每个真实代码仓库单独搭建沙箱,模型通过 OpenHands 框架读取并修改代码、运行测试,奖励就是隐藏测试是否通过这一明确信号。终端阶段使用 Harbor/Terminus-2,在真实 shell 上最多进行 64 轮交互,让模型学会编排命令并从失败中恢复。检索阶段则让模型调用真实的网络搜索工具回答多跳问题,最终答案由大模型评审打分。

训练基础设施采用 NVIDIA 的 NeMo-RL 与 NeMo-Gym,硬件是 CoreWeave 托管的 NVIDIA GB200 NVL72 集群。收尾的 RLHF 除了偏好与安全对齐,还加入了长度惩罚,避免思考过程过于冗长。

基准测试显示的 8B 与 30B 差距

从 IBM 公布的数据看,接受过智能体训练的两个规格提升明显。软件工程的 SWE-bench Verified 上,30B 为 57.00,8B 为 47.67;Terminal-Bench 2.1 上 30B 为 29.24,8B 为 20.56。3B 不在该领域的测评范围内。

推理类方面,数学的 AIME25 按 30B、8B、3B 顺序依次为 89.17、86.67、78.33;科学的 GPQA 为 66.41、64.14、54.80;代码推理的 LiveCodeBench v6 为 75.77、73.24、69.71。综合知识的 MMLU-Pro 在 30B 上为 77.60,长上下文的 RULER 128K 在 30B 上为 81.38。

3B 在数学和指令遵循上也达到了相当水准,追求轻量的场景完全可以纳入选项。而在需要实际调用工具完成任务的场景中,选择 8B 及以上这一判断也得到了基准测试的印证。需要说明的是,这些数值由 IBM 自行公布,并非第三方独立验证。

同时发布的 4.7 亿参数语音模型

除语言模型外,IBM 还发布了语音模型「Granite Speech 5.0 Turbo CTC」及其非商用版本。参数量为 4.7 亿,属于 Granite 系列中最小的一档。由于结构相对上一代 4.1 发生了变化,版本号直接跳到了 5.0。

最大的改动是不再以大语言模型作为主干。改用 CTC(连接时序分类)直接建立语音与文本的对应关系,在压住模型体积的同时提升了语音识别效率。IBM 的测试显示,在单块 H200 上处理吞吐量(RTFx)达到约 12,600。考虑到 Hugging Face Open ASR 排行榜上速度靠前的模型在 6,000 左右,这几乎是翻倍的成绩。换算下来相当于 1 秒转写 3 小时音频,笔记本电脑和手机上的常驻运行,以及呼叫中心大批量日志处理都进入了可行范围。

IBM 还表示,正在与 Hirundo 合作,利用机器遗忘技术在无需重新训练的前提下减少不良输出。

总结

Granite 4.2 是一个通过打磨后训练环节而非放大模型规模来提升智能体能力的案例。把真实仓库、真实 shell 与网络检索纳入带奖励的训练循环,并以 Apache 2.0 的开放权重形式发布,这一点很有价值。至于选 8B 还是 30B,取决于工具操作的难度和手头的算力资源。