
Granite 4.2 推理模型:从预训练到多阶段 RL 的完整构建

IBM 发布了 Granite 4.2,这是其首个密集、仅解码器的推理模型系列,提供 3B、8B 和 30B 三种尺寸。所有模型均从零开始预训练,使用约 15T token 的五阶段策略,将上下文窗口扩展到 512K token,随后进行思维链、推理和智能体轨迹数据的监督微调,再通过多阶段强化学习流水线进行后训练。该流水线包括智能体 RL,其中 8B 和 30B 模型在真实沙盒环境中学习使用工具。每个模型都有思考/非思考开关、低努力思考模式(在简单问题上花费较短的推理预算)以及原生工具调用。所有 Granite 4.2 模型均以 Apache 2.0 许可证发布。
架构方面,Granite 4.2 基于 decoder-only dense transformer,采用 Grouped Query Attention(40 个注意力头、8 个 KV 头)、RoPE 位置编码(θ=10,000,000)、SwiGLU 激活的 MLP、RMSNorm 归一化、独立的输入/输出嵌入,以及 bfloat16 精度。三种尺寸的模型共享相同的架构设计,但层数、隐藏大小等参数不同。
预训练阶段采用五阶段策略:阶段 1-2 为基础预训练,阶段 3-4 进行中训练并逐步提高数据质量,阶段 5 引入长上下文训练,将上下文窗口扩展到 512K token。每个阶段使用不同的数据混合和学习率调度,从广泛的网络规模数据逐渐转向更精选的高质量来源。
SFT 数据混合结合了智能体数据(31.6%)和非智能体数据(68.4%),总计约 720 万样本,约 100B token,其中约 65B 可训练。智能体语料涵盖软件工程(69%)、工具调用(12.1%)、终端使用(8.0%)、数学(3.5%)、搜索(0.8%)和操作(0.2%)。数据质量控制包括使用 GPT-OSS-120B 和 Gemma 4 作为 LLM 评判器评估样本质量,移除低分样本、包含幻觉或捏造信息的样本、无效工具交互的样本,以及调用未定义函数的样本。还进行了基于 SHA-256 哈希的局部和全局去重。
RL 流水线采用多阶段、多环境的方法,每个阶段是独立的 GRPO 运行,从上一阶段的检查点热启动。流水线顺序为:SFT → RLVR → 技能增强器 → SWE 智能体 → 终端 → 搜索 → RLHF。8B 和 30B 模型走完整路径,3B 模型仅进行基础 RL 和对齐,不包含智能体块。奖励信号分为三类:可验证奖励(精确匹配、单元测试、格式检查器)、奖励模型/LLM 评判器(开放质量、偏好、安全性)、智能体结果奖励(模型是否在真实环境中实际解决了任务)。
基础设施方面,RL 运行在 NeMo-RL(训练侧)和 NeMo-Gym(rollout 侧)两个开源组件上。NeMo-RL 使用 Megatron-Core 作为训练后端,vLLM 生成 rollout,Megatron-Bridge 在 HF 和 Megatron 格式之间转换权重。NeMo-Gym 将每个环境暴露为一组资源(验证器、工具、沙盒、奖励模型),统一接口使得简单的数学验证器和完整的 SWE 沙盒对 GRPO 呈现相同接口。
评估结果显示,30B 模型在 SWE-Bench Verified 上达到 57.00,AIME25 上达到 89.17,GPQA 上达到 66.41。8B 模型在 SWE-Bench Verified 上为 47.67,AIME25 为 86.67。3B 模型在 AIME25 上为 78.33,GPQA 为 54.80。所有模型支持 12 种语言。
此外,还发布了四种量化变体:FP8、NVFP4、MXFP4 和 GGUF 格式,用于 vLLM 推理。FP8 使用动态逐通道权重和逐 token 激活量化,无需校准。FP4 版本使用 GPTQ 在 SFT 数据集的 2K 样本上校准。GGUF 转换使用 llama.cpp 工具,提供多种量化级别。
训练在 CoreWeave 托管的 NVIDIA GB200 NVL72 集群上进行,配备 72-GPU NVLink 域和 400 Gb/s InfiniBand 网络。软件栈打包为 .sqsh 容器镜像,确保可复现性。


