返回快讯列表
开源生态

OpenBMB 开源 MiniCPM5-2B,25 亿参数走 Apache 2.0,训练语料一起放

MiniCPM5-2B 于 9 月 6 日上架 Hugging Face,25.17 亿总参数、131072 上下文、Apache 2.0,模型卡自报 2B 档平均分 53.9,训练语料按 UltraData 系列开源。

OpenBMB 在 9 月 6 日把 MiniCPM5-2B 放上 Hugging Face,两天时间点赞数过了三百。总参数 25.17 亿,去掉嵌入是 19.82 亿,42 层,16 个查询头配 2 个 KV 头的分组查询注意力,上下文 131072,BF16 权重。架构直接用 LlamaForCausalLM,主流推理引擎不改 kernel 就能加载。仓库和权重都是 Apache 2.0。

模型卡把自己放在 2B 档,平均分 53.9,对照组里最大的 Qwen3.5-4B 是 51.1。单项里 LiveCodeBench v6 拿 69.1,AIME 2025 和 AIME 2026 都是 86.5,MATH-500 94.6,SWE-bench Verified 46.4。同一张表里 Qwen3.5-4B 在 MATH-500、SWE-bench Pro 和 Terminal-Bench v2.1 上更高,这几行模型卡没藏。部分分数标了剑号,来源是 Artificial Analysis 而不是自己跑的。

后训练那段比分数更有信息量。先用 JustRL II 的 critic-based RL,再做 On-Policy Distillation,把 16 个 RL 专家模型合起来,其中 5 个是 agentic 方向,优势信号用全词表反向 KL,RL 阶段的提示词直接复用成蒸馏数据。官方给的增益是推理和通用方向约 10.96 分,agentic 方向约 6.96 分。

训练语料按 UltraData 系列开源,包含 UltraX、分 L0 到 L3 的 UltraData-Code、50 万条 agent SFT 样本和 8 万多条 RL 样本。附带发了 GGUF、MLX、GPTQ 和一个叫 DSpark 的草稿模型给投机解码用,SGLang 里有 minicpm5 解析器输出 OpenAI 风格的 tool_calls。上面这些分数全是模型卡自报,卡上也挂着输出可能不准确的免责声明。

更多快讯