
MiniCPM5-2B 权重已上线:摘得 Sub-4B 桂冠的小型模型正式开源
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0247智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75代码
- obsidianQwen3.8 27B2026-08-1541智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69代码
- grokSpaceXAI: Grok 4.62026-08-1251智能77代码
- metaMeta: Muse Spark 1.22026-08-0547智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0347智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49代码
该模型本身问世仅七周。MiniCPM5-2B于7月19日在2026世界人工智能大会上正式亮相,ModelBest与OpenBMB称其为Artificial Analysis排行榜上4B参数以下排名第一的模型,并承诺权重“在不久的将来”发布。而就在这个周末,这个“不久的将来”悄然到来,却没有任何发布造势:MiniCPM5-2B仓库于9月6日在Hugging Face上线,OpenBMB的更新日志将发布日期标为9月7日,采用Apache-2.0许可证,提供完整套件——BF16权重、GGUF、MLX与GPTQ量化版本、基座及SFT检查点、用于投机解码的DSpark草稿模型,以及其背后的训练数据集。
没有伴随的新闻稿,也没有发布活动。它就这么出现了:某天是一个 Hugging Face 仓库,隔天是更新日志里的一行。这使得这篇内容成为“就目前所知”的解读——并附带一项早期更新。仓库本身透露了大量信息:该模型如今确实可以下载并运行,规格表也已公开。外部评分也已经出现:Artificial Analysis 已将 MiniCPM5-2B 列入其 Intelligence Index v4.2,得分 15,是该指数上总参数低于 4B 的开放权重结果中的最高分;因此这个低于 4B 的排名不再只依赖厂商的一面之词。仍未得到确认的是模型卡上的关键数字——OpenBMB 在自家测试工具中复现了这些数字,但实验室之外还没有人重新运行过。以下是目前从仓库中已知的信息、现已独立测得的指标,以及在你基于它进行开发之前仍需验证的内容。
刚才发生了什么?
MiniCPM5-2B 是 MiniCPM5 系列中的第二款模型,紧随 OpenBMB 于 5 月 19 日开源的 MiniCPM5-1B 之后。当 2B 作为产品在 WAIC 上亮相时,这个故事既是芯片故事,也是模型故事——ModelBest 将其定位为面向手机、PC 和智能座舱的端侧智能体底座,并通过其 FlagOS 社区列出了九款首发支持的芯片,从华为昇腾到 NVIDIA,再到一系列国产加速器。当时开源被宣称为即将到来。七周过去了。
9月6日,openbmb/MiniCPM5-2B仓库上线。截至撰写本文时,模型卡即为发布公告,对于一个悄无声息的发布而言,其内容完整得异乎寻常。
• 权重——最终 RL + OPD 后训练得到的检查点,采用 BF16 格式、Apache-2.0 许可,且无访问限制——任何人都可以下载。
• 配套检查点 — MiniCPM5-2B-SFT、-Midtrain 和 -Base,用于那些希望在 RL/OPD 之前获得模型的人,外加 -GGUF、-MLX、-GPTQ 和一个 -DSpark 草稿模型,全部列在 Hugging Face 的 MiniCPM5 集合中。
• 数据——训练语料库也是开放的,作为 UltraData 系列的一部分发布:Ultra-FineWeb、UltraX、UltraData-Code、UltraData-Math、UltraData-SFT-Agent-2609 和 UltraData-RL-2609。
• 镜像——README 同时指向 Hugging Face 和 ModelScope。
模型卡中的一行内容比它看起来更重要:“无需自定义内核,无需分叉模型代码。”MiniCPM5-2B 使用标准的 LlamaForCausalLM 架构,因此任何已经支持 Llama 系列模型的引擎都可以直接加载它,无需等待定制实现。
为什么2.5B模型值得再看一眼
WAIC上的推介是一场排名推介。ModelBest称,MiniCPM5-2B在Artificial Analysis Intelligence Index上取得17分,发布时在AA排行榜上位列参数量低于4B的模型之首。这个数字旁边还应当附上两点说明。首先,指数分数只有在同一方法版本内才具有可比性:MiniCPM5-1B早前的17.9分来自更早版本的AA快照,因此它不能作为较小模型“得分更高”的证据;同理,在更新方法上得到的更新分数也不代表性能回退。其次,AA的数据会被写入模型卡,但模型卡上的首要平均分来自OpenBMB自己,并且是在OpenBMB自己的评测框架中复现的。这一区分之所以重要,是因为AA此后已转向更新的方法并发布了新分数——这是自开源权重发布以来,外界对该推介的首次核查。
与权重发布的同一周,一个外部分数出现了。9月4日,Artificial Analysis 发布了 Intelligence Index v4.2——这是一次方法论修订,将私有留出测试的权重提高到40%,并新增两个组件:AA-Briefcase(一项智能体评估)和 Surge 的 GDP.pdf(一项长上下文文档推理任务)。在 AA 的指数条目中,MiniCPM5-2B 现带有 v4.2 分数15:这是总参数低于40亿的开放权重模型中的最高分,也在 AA 榜单该尺寸类别的47个开放模型中位列第一。这使该模型保持在七月宣传中所处的位置,只不过这次采用的方法更难被操纵,且权重可供任何人下载和复核。15不能与发布时期的17直接比较,后者来自 v4.1——方法更严格,而非模型更弱——而且该综合指数不会重新验证模型卡片上的各个单行结果,其中大多数已由 OpenBMB 在自己的测试框架中复现。它真正做到的,是落在 OpenBMB 声称所优化的两个维度上:v4.2 更侧重于智能体任务,而 AA 的冗长度跟踪显示,MiniCPM5-2B 在指数任务中生成了5700万个输出词元,是该类别中最简洁的模型,而中位数是7200万。OpenBMB 感谢 AA 进行了这次评测,并正是用这些说法来框定结果——它表示,2.6B 规模下的智能体性能和词元效率正是该模型被优化的目标。
其核心主张是,在小型模型中实现智能体能力:原生工具调用、深度搜索和代码生成,这些能力是从零训练出来的,而非事后拼接上去的。模型卡描述了一个三阶段流程——基础训练、中期训练,然后是后训练,包括在 4000 亿 token 的深度思考数据上进行 SFT、专门的强化学习教师模型,以及在策略蒸馏(OPD),后者将十六个强化学习专家模型(其中五个为智能体模型)融合回一个小型稠密网络。OpenBMB 表示,RL + OPD 阶段在推理和通用任务上平均提升了 10.96 分,在智能体任务上提升了 6.96 分——这些是内部对比增益,但它们解释了该模型不同寻常的形态:一个 2.5B 参数网络,按推理模型的方式构建,并面向工具使用。

这个仓库实际包含的内容
规格表毫无歧义,因为它就是配置文件。MiniCPM5-2B 拥有 2,516,756,480 个参数,其中 1,981,982,720 个是非嵌入参数——厂商说“2B 级”时,统计的正是非嵌入参数这一项。它是一个稠密 Transformer(dense transformer),共 42 层,隐藏层大小为 2048,采用分组查询注意力(grouped-query attention),含 16 个查询头和仅 2 个 KV 头,词表大小为 130,560,张量为 BF16 格式。整个模型以单个 safetensors 分片发布,体积小到用笔记本电脑的网络连接即可下载,并且能在单块中端 GPU 或手机级 NPU 上运行。
• 参数 — 总计 2,516,756,480;非嵌入 1,981,982,720。
• 架构 — 密集 LlamaForCausalLM,42 层,隐藏 2048,GQA 16 个查询头 / 2 个 KV 头,词表 130,560。
• 上下文 — 已配置 131,072 个 token(max_position_embeddings),配置中未启用 RoPE 缩放。
• 许可证 — Apache-2.0,适用于模型和已发布的训练数据。
• 格式 — BF16;GGUF、MLX 和 GPTQ 配套版本单独发布。

7月发布材料中的一个数字没有出现在检查点中。WAIC 材料宣传了 512K token 的上下文窗口;但发布的配置将 max_position_embeddings 设置为 131,072(128K),且没有 rope_scaling 条目。有可能 512K 这个数字是打算通过推理时扩展来达到的,正如几个小模型扩展其上下文那样——但按发布形态,仓库文档写明的是 131,072,在 OpenBMB 发布扩展方案之前,应以此数字作为设计依据。
数字,按测量者排序
这份模型卡对数据出处非常审慎,因此值得细读其脚注。带有剑标†的分数“来自官方Artificial Analysis发布”——包括GPQA-Diamond 70.2、HLE 8.9、AA-LCR 59.0、Terminal-Bench v2.1 8.6和GDPval-AA v2 19.6等行。其余数据则被标注为“内部复现”,这意味着OpenBMB是在自己的评测框架中运行这些评测的。这一类别中包含那些引人注目的数字:模型卡对比集的内部平均分53.9、AIME 2025/2026的86.5、MATH-500的94.6、LiveCodeBench v6的69.1、SWE-bench Verified的46.4、BFCL v4的66.6、τ²-Bench Telecom的97.1、GAIA(Text-103)的88.7以及MMLU-Pro的70.8。
支撑这些数字可信、可读的因素有三个。53.9 的平均分是相对得分,而非绝对得分——厂商把每个雷达轴做了归一化,使对比中表现最佳的模型得分为 100。对比集由厂商自行选定:包括 Qwen3.5-2B、Qwen3.5-4B、Gemma-4-E2B-it、granite-4.2-3B、LFM2.5-2.6B 和 LFM2.5-8B-A1B 在内的其他 2B-4B 开源模型。在该集合内,卡片显示 MiniCPM5-2B 明显超过次佳模型 Qwen3.5-4B(51.1)——对于一个只有其一半规模的模型而言,这是相当惊人的结果,也恰恰是需要独立复现后才能让人放心在此基础上继续推进的那类结果。此外,有若干单项分数与营销措辞难以对上:SWE-bench Verified 46.4 若能在 2.5B 稠密模型上复现,那将非常出色;而 HLE 8.9 则提醒我们,“sub-4B 领跑者”和“前沿模型”分属两个不同的层级。这些结果与仓库内容无一矛盾,而且 AA 的 v4.2 综合评分也进一步确认了该模型在 sub-4B 开放权重类别中整体位居首位——但这几项具体分数仍出自 OpenBMB 自身,实验室外还没有任何人加以验证。
今天运行 MiniCPM5-2B
由于架构是标准 Llama,主流引擎可以直接加载。OpenBMB 的 README 提供了 vLLM(0.21 或更高版本)、SGLang(0.5.16 或更高版本)和 Transformers(5.6 或更高版本)的快速上手说明,推荐的采样参数为 temperature 1.0、top-p 0.95;当你需要模型进行推理时,可开启 enable_thinking。配套的 GGUF 和 MLX 版本覆盖了 llama.cpp、Ollama、LM Studio 以及 Apple Silicon;模型卡中还列出了 ArcLight 运行时和常用的微调工具栈(TRL + PEFT、LLaMA-Factory、ms-swift、unsloth)。
开始之前,有两个部署细节值得了解。在工具与函数调用方面,SGLang 是推荐的后端:模型会输出 XML 形式的工具调用,SGLang 内置的 minicpm5 解析器会将其原生转换为与 OpenAI 兼容的 tool_calls,因此标准的工具调用客户端无需自定义适配层即可直接使用。此外,DSpark 草稿模型的存在是为了降低推理过程的成本:借助 SGLang 中的 DSPARK 投机解码算法启动后,它能在保持目标模型输出不变的前提下加速解码——这类细节往往决定了在笔记本电脑上运行 128K 上下文的 agent 循环究竟是好用,还是仅仅有可能实现。

如果你更倾向于评估一批小型开源模型,而不是手工调优某一个,那么这里的路由层就能体现其价值:当某个提供商上线 MiniCPM5-2B 时,用路由器对同一任务上的 Qwen3.5-2B 及其他 4B 以下的开源 checkpoint 做 A/B 对比,是最省事的办法,而且无需第二次集成。在 OrcaRouter 上,这意味着一个 API 可访问 200 多个模型,提供商列表价格以 0% 加价透传;如果某个全新 checkpoint 在生产路径上卡住或死循环,还会自动故障转移。这个仓库才刚建两天,目前我们能看到的所有托管 API 也都还没列出 MiniCPM5-2B——所以如今最诚实的默认做法,是把它当作自托管实验,而非依赖项。
谁应该拉这些重物?
如果你的工作涉及端侧智能体、边缘端工具调用,或小模型的编码与推理实验,并且你想要当前可选范围内训练最为激进的 2B 级模型,那么今天就拉取它们。Apache-2.0 许可证与开放训练数据,消除了多数团队对中国实验室小模型犹豫不决的两点原因——没有商业使用限制,也没有黑箱语料库。但如果你仅凭基准测试表就选定生产模型,那就请谨慎拉取:模型卡上最显眼的成绩是 OpenBMB 自己的复现结果,而 AA 的 v4.2 综合分——目前唯一的外部评测——并不能为它们背书。一个据称超越 Qwen3.5-4B 的 2.5B 模型,这样的说法值得你花两个小时亲自复现 SWE-bench 来验证。
下一步该关注什么。这个仓库才刚刚建立两天,所以短期信号仍停留在机械层面:llama.cpp 与 Ollama 库是否会采用这个 GGUF,ModelScope 镜像与 FlagOS 芯片构建能否顺利上线,以及是否有托管 API 将 MiniCPM5-2B 列入其中——那才是它不再仅限自托管的时刻。本篇文章此前指出的实质性信号(由 Artificial Analysis 或某所大学实验室进行独立评测)如今已以 v4.2 索引得分的形式出现,这使得 MiniCPM5-2B 在低于 4B 参数规模的开源权重模型中保持领先。但仍有待落实的是逐行验证:OpenBMB 之外尚无人复现该模型卡片中的内部数据,最引人注目的是 SWE-bench Verified 的 46.4 分以及 53.9 的内部平均分。在这些具体行被重新运行验证之前,对待 MiniCPM5-2B 的方式应当与对待任何低调试发布、却拥有亮眼模型卡片的模型一致:它是一个今晚你就可以在本地运行的、非常有希望的假设,同时也是一个在你信任其执行真实工作之前,应当先核实其最亮眼数字的模型。
