IBM 於當地時間 2026 年 8 月 25 日推出企業取向的 AI 模型系列「Granite 4.2」,提供 30 億、80 億與 300 億參數三種規格,全數採用 Apache 2.0 授權。這次的重點在於回答前逐步思考的推理能力,以及僅針對 8B 與 30B 施行的真實環境代理訓練。同一天還一併釋出兩款 4.7 億參數的語音模型。
三種規格與「思考/不思考」切換
Granite 4.2 採用 Dense(稠密)架構的純解碼器模型,也就是每個 token 都會動用全部參數。與只啟動部分網路的 MoE(混合專家)做法不同,稠密模型對執行環境的要求較低,部署起來相對省事。
三種規格都能在給出答案前輸出思考過程。維運方可在思考模式與非思考模式之間切換,兩者之間還有只配置少量思考預算的「低耗力模式」。用意是避免為簡單問題付出冗長的思考等待。
工具呼叫由模型原生支援。透過 vLLM 等 OpenAI 相容端點提供服務時,模型會直接以 OpenAI 的函式呼叫格式輸出工具呼叫,因此不需額外的轉換程式就能接進既有的代理框架。推理框架方面 vLLM 與 SGLang 皆已支援,權重可從 Hugging Face、Ollama、GitHub、LM Studio、OpenRouter、Replicate 等處取得。支援語言中包含日文。
部署場景涵蓋雲端、地端與邊緣。3B 適合高頻執行的代理工作,30B 則留給較重的推理與程式開發。官方另備有推理用的量化版本:以 LLM Compressor 製作的 FP8、NVFP4、MXFP4,以及由 llama.cpp 轉換的 GGUF,範圍從 Q2_K 到 Q8_0。
從 15 兆 token 重新打造的基礎
預訓練從零開始,規模約 15 兆 token,分成五個階段推進。第 1、2 階段為基礎預訓練,第 3、4 階段是逐步轉向高品質資料的中期訓練(mid-training),第 5 階段則是長上下文訓練,將上下文長度拉長到 51.2 萬 token。不過公開的模型設定中,序列長度為 131,072 token(128K)。
架構採用分組查詢注意力(GQA),注意力頭 40 個、KV 頭 8 個,位置編碼為 RoPE(θ=10,000,000),啟動函式為 SwiGLU,正規化為 RMSNorm,精度為 bfloat16。輸入與輸出嵌入並未共用。層數方面 3B 與 8B 為 40 層,30B 為 64 層。
資料端同樣下了工夫。IBM 投入了以自家「CodeAlchemy」產生的 1 兆 token 合成程式碼,並加入用來加速輸出的推測解碼層。監督式微調(SFT)使用約 720 萬筆樣本、約 1,000 億 token,其中代理相關資料占 31.6%。代理語料的組成為軟體工程 69%、工具呼叫 12.1%、終端機操作 8.0%。
品質控管上,IBM 以 GPT-OSS-120B 與 Gemma 4 擔任評審模型,剔除評分偏低的樣本,以及含有捏造資訊或無效工具互動的樣本。去重複則以工具定義與訊息串接後的 SHA-256 雜湊為依據,在單一資料來源內部與整體混合資料集兩個層次同時執行。
在真實環境鍛鍊代理的多階段強化學習
SFT 之後的環節才是這次的核心。IBM 沒有採用一次到底的強化學習,而是把目標單一的訓練串成鏈條,逐段承接前一階段的檢查點。順序依序是 RLVR(可驗證獎勵的強化學習)、技能強化、SWE 代理、終端機、搜尋,最後是 RLHF。
前半段的 RLVR 混合了可以機械判定對錯的題目:數學的答案核對與以 Lean 進行的形式化證明、以隱藏測試判定的程式生成、研究所層級的科學題、指令遵循、工具呼叫等。每一步以 256 條提示各生成 16 個回應,組成 4,096 筆的批次完成一次更新。演算法為非同步 GRPO,生成端與訓練端互不等待。
後半段的代理強化學習只有 8B 與 30B 會經歷,3B 則跳過這一段,在基礎強化學習與對齊之後就結束。
軟體工程階段會為每個真實的程式碼儲存庫各自架設沙箱,模型透過 OpenHands 框架讀取並修改程式碼、執行測試,獎勵就是隱藏測試是否通過這個明確訊號。終端機階段使用 Harbor/Terminus-2,在活的 shell 上最多進行 64 輪互動,讓模型學會編排指令並從失敗中復原。搜尋階段則讓模型呼叫真實的網路搜尋工具回答多跳問題,最終答案由大型語言模型評審評分。
訓練基礎設施採用 NVIDIA 的 NeMo-RL 與 NeMo-Gym,硬體是由 CoreWeave 代管的 NVIDIA GB200 NVL72 叢集。收尾的 RLHF 除了偏好與安全對齊之外,也加入了長度懲罰,避免思考過程過於冗長。
基準測試呈現的 8B 與 30B 差距
從 IBM 公布的數據來看,接受過代理訓練的兩種規格提升相當明顯。軟體工程的 SWE-bench Verified 上,30B 為 57.00、8B 為 47.67;Terminal-Bench 2.1 上 30B 為 29.24、8B 為 20.56。3B 不在這個領域的評測範圍內。
推理類方面,數學的 AIME25 依 30B、8B、3B 順序為 89.17、86.67、78.33;科學的 GPQA 為 66.41、64.14、54.80;程式推理的 LiveCodeBench v6 為 75.77、73.24、69.71。綜合知識的 MMLU-Pro 在 30B 上為 77.60,長上下文的 RULER 128K 在 30B 上為 81.38。
3B 在數學與指令遵循上也達到了相當水準,追求輕量的用途完全可以列入選項。而在需要實際呼叫工具把事情做完的場合,選擇 8B 以上這個判斷也在基準測試上獲得佐證。要提醒的是,這些數值由 IBM 自行公布,並非第三方獨立驗證。
同步推出的 4.7 億參數語音模型
除了語言模型之外,IBM 也推出語音模型「Granite Speech 5.0 Turbo CTC」及其非商用版本。參數量為 4.7 億,屬於 Granite 系列中最小的一類。由於結構相對上一代 4.1 有所改變,版本號直接跳到了 5.0。
最大的改動是不再以大型語言模型作為骨幹。改用 CTC(連結時序分類)直接建立語音與文字的對應關係,在壓低模型體積的同時提升語音辨識效率。IBM 的測試顯示,在單一顆 H200 上處理吞吐量(RTFx)達到約 12,600。考量到 Hugging Face Open ASR 排行榜上速度領先的模型約在 6,000 左右,這幾乎是翻倍的成績。換算下來相當於 1 秒轉寫 3 小時的語音,筆電與手機上的常駐執行,以及客服中心的大量記錄處理都進入可行範圍。
IBM 另外表示,正與 Hirundo 合作,運用機器遺忘技術在不需重新訓練的前提下減少不當輸出。
總結
Granite 4.2 是一個透過打磨後訓練環節、而非放大模型規模來提升代理能力的案例。把真實儲存庫、真實 shell 與網路搜尋納入帶獎勵的訓練迴圈,再以 Apache 2.0 的開放權重形式釋出,這一點相當有價值。至於要選 8B 還是 30B,就看工具操作的難度與手邊的運算資源了。
