IBM 8 月 25 日在 Hugging Face 上放出 Granite 4.2 系列,三档稠密解码器推理模型,3B、8B、30B,Apache 2.0 许可,另有 FP8、NVFP4、MXFP4 量化版本和 14 种格式的 GGUF。
结构上三档共用分组查询注意力、RoPE、SwiGLU、RMSNorm 和非绑定的输入输出嵌入,权重是 bfloat16,序列长度均为 131072。30B 是 64 层,嵌入 4096,MLP 隐层 32768。8B 是 40 层,嵌入 4096,MLP 隐层 12800。3B 是 40 层,嵌入 2560,MLP 隐层 8192。
跑分按 3B、8B、30B 的顺序排。SWE-Bench Verified 没给 3B,8B 是 47.67,30B 是 57.00。SWE-Bench Multilingual 是 30.78 与 41.89,Terminal-Bench 2.1 是 20.56 与 29.24。AIME25 三档分别 78.33、86.67、89.17,GPQA 是 54.80、64.14、66.41,MMLU-Pro 是 67.84、74.04、77.60,LiveCodeBench v6 是 69.71、73.24、75.77,长上下文的 RULER 128K 是 55.30、71.41、81.38。支持 12 种语言,含中文。
运行侧支持 Transformers、vLLM、SGLang 和 llama.cpp,也适配 OpenCode、Pi、OpenHands 这些框架。IBM 没有公布确切参数量,只给了三档的整数口径。预训练数据配比只说约 15T token 和五个阶段,具体成分指向 Granite 4.1 那篇。算力、GPU 小时、评测所用的 harness 和采样设置、量化版本的跑分、安全红队结果同样没给。文章里第五阶段说把窗口扩到 512K token,架构表和推理配置写的都是 131072。