
MiniCPM5-2B 对比 Granite 4.2 3B:3B 推理专家与新 2.5B 智能体技术栈的较量
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest 在没人要求的情况下,就把 Granite 4.2 3B 放上了 MiniCPM5-2B 自家的计分板。OpenBMB 在权重文件悄然上线 Hugging Face 时发布的 MiniCPM5-2B 模型卡,将 IBM 最小的推理模型列入了对比基线;在该测试套件上,MiniCPM5-2B 平均得分 53.9,Granite 4.2 3B 为 42.7。这是两家厂商为这一配对发布的唯一正面交锋数据,因此它既是自然的起点,也是需要保持谨慎的地方。这两个模型都是小尺寸、Apache-2.0 许可、可自行部署的开源权重版本,瞄准的是 2026 年底的同一类任务;只是它们从相反方向入手——一个为推理而训练,一个为行动而训练。
这两次发布之间的呼应,比其厂商营销所暗示的更多。MiniCPM5-2B于7月19日在世界人工智能大会上亮相,是ModelBest与OpenBMB的端侧旗舰产品——一款2B级稠密模型,定位为面向手机、PC和智能座舱的智能体基座。其权重于9月6日和7日悄然上线,没有伴随任何发布活动,采用Apache-2.0许可,同时发布的还有GGUF、MLX、GPTQ、base、SFT和draft检查点及其背后的训练数据。Granite 4.2 3B是IBM面向笔记本的推理模型,权重于8月初上传至Hugging Face,模型卡和技术博客则于8月25日发布。到目前为止,两者都尚未经过任何独立基准测试的检验,这正是下文中的来源标注比数字更为重要的原因。
两个押韵的发布版本
Granite 4.2 3B 是一个独立的稠密推理模型,基于 Granite-4.1-3B-Base 后训练而成。它共有 40 层,采用分组查询注意力,原生上下文为 128K(IBM 在第五次预训练阶段将其扩展到 512K),并提供三种按查询区分的思考模式——默认完整思考、低强度模式和免思考路径。模型卡并未讳言它不是什么:与 8B 和 30B 的 Granite 4.2 兄弟模型不同,3B 刻意跳过了在 SWE-agent、终端和搜索环境中训练的专业智能体强化学习模块,因此 IBM 未列出 SWE-bench 结果,而是将其定位为推理专家而非智能体。该模型通过 vLLM、SGLang、Transformers、GGUF 和 Ollama(granite4.2:3b)对外服务,bfloat16 下运行约需 6-8GB 内存,量化后低于 2GB,且不提供托管 API。它的代表性成绩——AIME 2025 达 78.33,GPQA 54.80,LiveCodeBench v6 69.71,MMLU-Pro 67.84——均系 IBM 自行报告,截至今天尚未见第三方复现。

MiniCPM5-2B 反而是一个已完成的、面向智能体的模型。模型卡描述的是:一个总参数为 2.52B(其中非嵌入参数为 1.98B)的密集 Transformer,42 层、隐藏大小为 2048,采用分组查询注意力,含 16 个查询头和 2 个 KV 头,架构为标准 LlamaForCausalLM,无自定义内核。其发布宣传强调智能体能力——200B 规模的智能体中期训练、大规模智能体 SFT 数据集,以及智能体 RL 对齐,最后通过在线策略蒸馏(On-Policy Distillation)将 16 个 RL 专家模型融合回一个小型密集网络——此外还支持原生长上下文和快速/审慎混合响应模式。其随附配置设定的上下文窗口为 131,072 个 token(7 月资料宣称支持 512K;已发布配置中并未包含该数值),模型卡声称内置 SGLang 解析器、支持 XML 风格的工具调用。在它自己的评估表上,它报称在模型卡所选供应商对照集中内部平均分为 53.9,AIME 2025/2026 为 86.5,MATH-500 为 94.6,以及供应商运行的 SWE-bench Verified 为 46.4——如果该成绩能经受独立测试的检验,对 2.5B 密集模型来说将非常出色。

有人已经打印出来的正面对决
由于不同厂商的评分榜单大多是不可直接比较的“苹果与橘子”,这场对决中最有用的一份资料,是 ModelBest 自己印出来的那一份:MiniCPM5-2B 的规格卡将 granite-4.2-3B 列为其基线模型之一,并报告 MiniCPM5-2B 在该套件上平均得分 53.9,而 Granite 为 42.7。请按它的本来面目去理解——即一家厂商在自己选定的套件上运行了两个模型,结果未经复现,且该厂商有充分的动机让自己的模型胜出。这不是一个定论。它真正告诉你的,是 ModelBest 有足够的自信,把竞争对手的 3B 模型放上自己的规格卡;而它所声称的最大差距,恰好出现在其自身训练投入最深的项目上:智能体(agentic)与长上下文(long-context)两项。把它当作一个方向性的断言来看待,并在据此做出任何决定之前,先权衡 IBM 自己另行发布的规格卡上的说法。
记分牌,诚实标注
• 发布 — MiniCPM5-2B:2026年7月19日官宣;权重于9月6日至7日低调上线。Granite 4.2 3B:权重于8月初上线;模型卡和技术博客于2026年8月25日发布。
• 角色 — MiniCPM5-2B:据 ModelBest,强调端侧智能体与工具使用。Granite 4.2 3B:据 IBM,专注推理,刻意不采用智能体路线。
• 规模 — MiniCPM5-2B:总计 2.52B / 非嵌入参数 1.98B,42 层。Granite 4.2 3B:约 3B 稠密参数,40 层。
• 上下文 — MiniCPM5-2B:出厂配置中为 131,072 个 token。Granite 4.2 3B:原生 128K,可扩展至 512K。
• 后训练 — MiniCPM5-2B:深度思考 SFT、专用 RL、On-Policy 蒸馏。Granite 4.2 3B:推理 SFT、GRPO RL 与 RLHF;不含 agentic-RL 模块。
• 证据 — MiniCPM5-2B:ModelBest 模型卡片声称的结果,未经独立运行验证。Granite 4.2 3B:IBM 模型卡片声称的结果,未被复现;AIME 2025 为 78.33,GPQA 为 54.80,LiveCodeBench v6 为 69.71。

上方的计分板与正文来源相同:上面每一项数据都由厂商自行报告,而两家厂商发布过的唯一同套件对比,就是 ModelBest 自家卡片上的那次。
推理专家 vs 智能体技术栈
在看分数之前,先判断你的工作负载需要哪种小模型,因为这两者回答的是不同的问题。Granite 4.2 3B 是为在受限硬件上进行推理和长上下文处理而构建的:128K 原生窗口可扩展至 512K,三种思考模式,体积小到能装进笔记本电脑,并且明确决定跳过智能体训练。如果你的任务是长文档分析、仓库级上下文,或是在小设备上进行可靠的多步骤推理,那它就是契合之选;IBM 决定不在 3B 上做智能体能力的宣称,这恰恰是信任其规格表的理由,而非它的缺陷。MiniCPM5-2B 则面向相反的侧重点:设备上的智能体行为和工具使用——其训练管线读起来就像一份 Granite 4.2 3B 刻意剔除之物的清单。如果你的任务是设备端的智能体循环,要调用工具、维持长对话,并在快速回应与深思熟虑的回应之间切换,那这个技术栈就是为你打造的;而它也带有额外的不确定性:一个仅有一周历史的检查点,以及一份未经核实的规格表。
OpenBMB 开放了数据,而 IBM 没有。
最不起眼的差异,恰恰是对想做微调的团队最要紧的。OpenBMB 在发布 MiniCPM5-2B 权重的同时,把训练语料也一并开源了——UltraData 家族,包括 Ultra-FineWeb、UltraX、UltraData-Code、UltraData-Math,以及 Agent 的 SFT 与 RL 数据集——全部采用 Apache-2.0 协议。这让 2B 不再是黑盒,而成了一份可复现的配方:你能看到 Agent 后训练是建立在什么之上,也能在自己的领域里接着续训。IBM 开源了 Granite 4.2 3B 的权重,并就构建过程给出了详尽的技术说明,却没有公开训练数据。对于想拥有模型而不是租用模型的组织来说,这种不对称是实打实的。而在部署层面,MiniCPM5-2B 还讲了一个 Granite 在这个尺寸上无法匹敌的故事:通过 ModelBest 的 FlagOS 社区,它做到了横跨九大芯片家族的 Day-0 适配——从华为昇腾、NVIDIA,到众多国产加速器,外加 ARM。这也释放出一个信号:ModelBest 本来就期望 2B 跑在 NVIDIA GPU 之外的地方。
路由的现实
目前,这两个模型都不在托管目录中,因此这种比较发生在自托管世界里——但恰恰是在这里,路由层仍然作为安全网而非交付机制而证明其价值。当一个团队希望在其已服务的工作负载上,用发布仅一周的智能体型 2B 模型去对比推理型 3B 模型时,可逆的做法是:通过一个启用自动故障转移的 API,将测试路径指向自托管的 MiniCPM5-2B 构建,而生产环境继续使用经过验证的模型——新堆栈即使停滞,也不会导致任何服务中断;同时,你用作对比的托管模型的提供商标价以 0% 加价直通,因此 A/B 测试成本很低。该层并不托管任何一个模型;它只是让实验运行起来安全,且回退起来容易。
你实际上应该运行哪个小模型?
如果你的工作负载是在笔记本电脑级别的设备上进行长上下文推理,并且你想要三种思考模式、512K 的上下文上限,以及一张能如实告诉你这个 3B 模型未被训练去做什么的坦诚说明卡,那就运行 Granite 4.2 3B。如果你的工作负载是一个交互式、支持工具调用的设备端智能体,而 2.5B 参数规模正合你的内存预算,那就运行 MiniCPM5-2B——但在信任它之前,请预留出复现其宣传数字的时间,因为 53.9 的平均分和 46.4 的 SWE-bench 成绩只是厂商单方面宣称的,尚未有其他人验证。有两件事会比任何观点都更快给这场对决下定论:一次独立运行 MiniCPM5-2B,证实或推翻其智能体能力的说法;以及 IBM 的推理数据能否经受住社区复现。在任一项落地之前,Granite 4.2 3B 是当下更安全、文档更完善的小模型,而 MiniCPM5-2B 则是更有趣的押注。
