SevenTnewSAI 与科技新闻,深度解读

OpenBMB 的 MiniCPM5-2B:2.52B 参数,4B 的野心

一款 2.52B 模型在其自家厂商运行的基准测试集上跑赢了 4B 对手

一款 2.52B、采用 Apache-2.0 许可的模型,在编码、工具调用和长上下文方面击败了更大的开源基线,其基准测试表格据 OpenBMB 称混合了内部运行与第三方运行结果。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-22 · 阅读需 4 分钟

一款 2.52B 模型在其自家厂商运行的基准测试集上跑赢了 4B 对手

OpenBMB 为 MiniCPM5-2B 提供的自家基准测试表列出了 25 亿参数级模型本不该擅长的项目。它在 LiveCodeBench v6 上得分 69.1,在 SWE-bench Verified 上得分 46.4,在函数调用测试 BFCL v4 上得分 66.6。该模型本身约有 25.2 亿参数,其中约 19.8 亿为非嵌入参数。

这样的体积正是关键所在。OpenBMB 是与 ModelBest 关联的开源分支,它把 MiniCPM5-2B 定位为手机、笔记本或边缘设备就能承载的模型,而非需要 GPU 集群来服务的模型。已公布的领先幅度能否经受独立测试的检验,仍是一个悬而未决的问题,而此次发布材料让这个问题很容易被提出。

OpenBMB 究竟发布了什么

MiniCPM5-2B 是稠密模型而非混合专家模型,以 Apache-2.0 许可发布。它是 MiniCPM5 系列的第二款产品,继 MiniCPM5-1B 之后。原生上下文长达 131,072 token。

其架构刻意保持平平无奇,而在这个体量上这本身就算一项特性。它采用标准的 LlamaForCausalLM 结构:42 层,配备分组查询注意力,16 个查询头和 2 个键/值头。由于计算图中没有任何自定义内容,主流推理引擎无需打补丁的模型定义或手写内核即可加载权重。

53.9 的均值,以及测试由谁运行

在 OpenBMB 的 34 项基准对比集中,MiniCPM5-2B 平均得分 53.9。这让它在同一表格中领先于若干更大的开源基线,包括得分 51.1 的 Qwen3.5-4B 和得分 42.7 的 granite-4.2-3B。同体量的同类模型如 LFM2.5-2.6B 和 Qwen3.5-2B 则排名更靠后。

数据来源才是值得驻足细看的部分。OpenBMB 把源自 Artificial Analysis 的数据行与自行复现的数据行区分开来,以便读者分辨这两类数字。混合平均并不等同于全部来自外部的平均,53.9 这个数字应当结合这一区分来解读,而不是凌驾于其上。

基准测试MiniCPM5-2BQwen3.5-4B
34 项基准平均53.951.1
LiveCodeBench v669.156.4
SWE-bench Verified46.433.6
NoLiMa(长上下文)68.143.5
MMLU-Pro70.878.0

数据为 OpenBMB 公布的数字,取自厂商复现行与 Artificial Analysis 行。

2B 模型在哪里胜过 4B,又在哪里不敌

优势集中在智能体类任务上。LiveCodeBench v6 为 69.1,对比 4B Qwen 参照的 56.4;SWE-bench Verified 为 46.4,对比 33.6;NoLiMa 的长上下文检索为 68.1,对比 43.5。OpenBMB 还报告 τ²-Bench Telecom 为 97.1,BFCL v4 为 66.6。

知识密集型的数据行则讲述了故事的另一半。MMLU-Pro 上 MiniCPM5-2B 为 70.8,而更大的 Qwen 模型为 78.0,差距方向相反。OpenBMB 的定位与数据相符:一个紧凑的智能体与编码伙伴,而非通用知识的巨兽。

跃升背后的 16 位专家

后训练通过 OpenBMB 称为 UltraData 分层管理的流程进行。它先在大约 4000 亿 token 上进行深度思考监督微调,随后针对数学、代码、智能体和写作训练专门的强化学习教师模型,采用该实验室称为 JustRL II 的基于评论家的算法。最后一步是同策略蒸馏,将 16 个强化学习专家(其中 5 个为智能体方向)折叠进最终交付的单一学生模型中。

OpenBMB 将推理与通用测试集约 10.96 分的平均提升,以及智能体测试集约 6.96 分的平均提升,归功于这一强化学习与蒸馏阶段。它没有要求读者凭空相信这一说法,而是公开发布了中间阶段的 Base、Midtrain 和仅 SFT 检查点,让任何人都能单独衡量每一项贡献。

它实际能在什么上运行

运行时支持覆盖 vLLM、SGLang、Transformers、llama.cpp、Ollama、LM Studio、MLX、LiteRT 以及 FlagOS 多芯片构建版本。GGUF、MLX 和 GPTQ 包面向需要工具调用和长上下文、但不想用数据中心 GPU 的本地助手。训练所用的 UltraData 语料库,涵盖网页、代码、数学以及智能体 SFT 与 RL 样本,也已发布。

权重、数据、中间检查点和量化版本在同一次发布中一并提供,降低了核验这项工作的成本,这种做法足够罕见,值得直白地说出来。

53.9 这一平均值会被反复引用。但真正决定 MiniCPM5-2B 是否重要的数字更窄:当由他人运行测试框架时,它在编码和工具调用上相对 4B 开源基线的领先还能剩下多少。OpenBMB 已交出了查明这一点所需的一切。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。