一张对比 MiniCPM5-2DSpark 与 Granite 4.2 3B 的主标题卡,副标题为“两款低调的 Apache-2.0 发布,面向小巧快速的部署服务”,画面中两个敞开的纸箱并排摆放——左侧纸箱射出一道标有“DSpark 草稿”的闪电,右侧纸箱呈现一个标有“推理模式”的齿轮——底部横贯一条 Apache-2.0 缎带,右下角为 OrcaRouter 标志。
Guides & Insights

MiniCPM5-2B-DSpark 对比 Granite 4.2 3B:两个低调的 Apache-2.0 发布,面向小型、快速、自托管服务

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年8月和9月上旬出现了两个低调的Apache-2.0版本发布,它们的目标相同——都是供你自行部署的小型模型——但切入点截然相反。Granite 4.2 3B是IBM面向笔记本场景的推理模型,其权重于8月初上传至Hugging Face,模型卡和技术博客则于2026年8月25日发布。MiniCPM5-2B-DSpark从同样的意义上说根本不算模型:它是OpenBMB于2026年9月6日在没有任何公告的情况下发布的323.8M参数DSpark草稿检查点,目的是通过投机解码让MiniCPM5-2B——即ModelBest于2026年7月19日在WAIC上公布的2.52B稠密端侧模型——更快地生成token。其中一个是独立的轻量级推理模型;另一个是面向小型模型的加速配件。两者均采用Apache-2.0许可,都仅限自托管,而且至今都还没有经过任何独立基准测试。

剥去营销的外衣,团队面临的实际问题很简单:对于2026年底的小型自托管推理服务负载,你是要IBM的3B推理专家,还是要ModelBest的2B智能体栈,再附带一个免费的草稿模型?证据比两家供应商规格表所暗示的都要单薄,因此本文梳理了发布事实、唯一存在的一组同套件数据,以及应当驱动选择的工作负载差异。

两个版本,何为可知

Granite 4.2 3B 是 IBM 最小的推理模型,基于 Granite-4.1-3B-Base 后训练而成。该模型为稠密架构且纯文本——共有 40 层,采用分组查询注意力,原生上下文长度为 128K,在第五个预训练阶段可扩展至 512K;同时提供三种推理模式:默认为完整思考模式,还有低努力模式和免思考路径。IBM 的模型卡明确指出,3B 版本刻意跳过了较大的 Granite 4.2 兄弟模型所接收的智能体强化学习模块,因此没有列出 SWE-Bench 结果——它是一个推理模型而非智能体模型。它可通过 vLLM、SGLang、Transformers、GGUF 和 Ollama(granite4.2:3b)使用,且没有托管 API。其模型卡上的主要数据——AIME 2025 得分为 78.33、GPQA 为 54.80、LiveCodeBench v6 为 69.71——均来自供应商报告,截至目前尚未得到复现。

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b (reused from a published sibling) showing the Model Overview with the 3B dense decoder-only architecture, 128K native context extending to 512K, and the Apache-2.0 license.

上面这张 ibm-granite/granite-4.2-3b 卡片是这次发布的公开门面:一个经推理调优的 3B 模型,以长上下文为核心卖点,且不涉及任何智能体(agentic)相关宣称。

相比之下,MiniCPM5-2B-DSpark 的存在完全是为了服务其目标。该草稿模型包含五个全注意力层,参数量为 323,776,001,每次前向传播的块大小为七个候选 token,在由 MiniCPM5-2B 生成的 70.5 亿 token 上训练了六个 epoch。其仓库报告了接受长度——在贪婪解码下,整体上每一步验证接受 5.52 个 token,代码上为 6.11——但没有每秒 token 数的数据。它加速的目标模型 MiniCPM5-2B 才是更有趣的产品:这是一个稠密、2.52B 参数、42 层、128K 上下文的模型,其发布材料强调智能体能力——根据 ModelBest 7 月的公告,包括 200B 规模的智能体中期训练、大型智能体 SFT 数据集以及智能体 RL 对齐——此外还有原生长上下文和混合快速/审慎模式。在 ModelBest 自己的对比套件中,该目标模型对同类开源模型的平均得分为 53.9。以上每个数字都出自该厂商。

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

上面的 openbmb/MiniCPM5-2B-DSpark 卡片就是完整的发布内容:模型卡片、配置、一个 Safetensors 文件,没有任何公告。

唯一存在的同套件对比

跨厂商的分数榜大多缺乏可比性,但有一个地方确实把 Granite 4.2 3B 和 MiniCPM5-2B 放在一起测过:那就是 ModelBest 自家为 MiniCPM5-2B 发布的评测表,表中将 granite-4.2-3B 列为基线模型之一。在那套评测上,MiniCPM5-2B 平均得分 53.9,而 Granite 4.2 3B 为 42.7。请把这个数字严格看作它本来的样子——一家厂商在同一套评测上跑两个模型,结果未经复现,而且项目选择是为了让自家模型显得更好看。它不是定论。它真正能说明的是:ModelBest 有足够的底气把竞品的 3B 模型放上对比表,而且它声称的差距最大的地方,恰好出现在自己训练投入最深的领域:长上下文和智能体(agentic)相关评测项。把它当作一个方向性的说法,用你自己的数据去验证,并且在据此做任何决定之前,先权衡 IBM 自己那张独立模型卡上的声明。

记分牌,诚实标注

• 发布内容 — MiniCPM5-2B-DSpark:一个面向 MiniCPM5-2B(2.52B 稠密目标)的 324M 草稿模型,不能单独使用。Granite 4.2 3B:一个独立的约 3B 稠密推理模型。

• 角色 — MiniCPM5-2B 技术栈:侧重端侧智能体与工具使用(据 ModelBest)。Granite 4.2 3B:推理专家,刻意不采用智能体模式。

• 上下文 — MiniCPM5-2B 目标:原生 128K。Granite 4.2 3B:原生 128K,可扩展至 512K。

• 加速 — MiniCPM5-2B-DSpark:外部 DSpark 草稿,每次传递七个 token,贪婪接受约每步 5.5 个(仓库报告数值)。Granite 4.2 3B:此版本未附带任何草稿。

• 许可证 — 均为 Apache-2.0。

• 证据 — {{1}}MiniCPM 的数据来自 ModelBest 的模型卡声明(其套件:53.9 对比 Granite 42.7){{/1}};{{2}}Granite 的数据来自 IBM 的模型卡声明(AIME 2025 78.33,GPQA 54.80)。两者均无独立运行结果。{{/2}}

A two-column scoreboard for MiniCPM5-2B-DSpark vs Granite 4.2 3B: left column MiniCPM5-2B-DSpark with What it is: 324M draft + 2.52B dense target, on-device agent and tool-use role, 128K native context, DSpark acceleration at 7 tokens per pass, Apache-2.0 license, and own-suite average 53.9; right column Granite 4.2 3B with a standalone ~3B dense reasoning model, non-agentic role, 128K native / 512K extended context, no shipped acceleration, Apache-2.0 license, and AIME 2025 78.33 / GPQA 54.80, with a footer reading All figures vendor-reported; no independent run of either and the OrcaRouter logo in the bottom-right corner.

上方记分板与正文的数据来源相同:其中每个数字都由厂商自行报告,而任一厂商发布过的同套件数字,只有 ModelBest 自己的那一项。

超越所有基准的差异

在给出评分之前,先确定你的工作负载需要哪种小模型,因为这两个版本回答的是不同的问题。Granite 4.2 3B 面向受限硬件上的推理与长上下文场景:128K 原生窗口可扩展至 512K、三种按查询思考模式、能在笔记本电脑上运行的小体积,并且明确选择跳过智能体训练。如果你的任务是长文档分析、仓库级上下文,或是在小机器上进行可靠推理,那它就是一个契合的选择。MiniCPM5-2B 则侧重于相反的方向:设备上的智能体行为与工具调用——这份草稿的存在本身就表明,ModelBest 预期该目标会被交互式地使用,并希望拿回每秒的 token 数。如果你的任务是设备端智能体循环、需要调用工具并维持长对话,那才是为你准备的那套方案。

该草案改变了第二种选择的成本效益,而 Granite 的发布并未做到这一点。MiniCPM5-2B 是稠密模型,而推测解码恰恰在稠密、内存受限的推理场景中收益最大——由一个小型固定模型向一个略大的固定模型提出候选 token。对以单请求并发方式服务的模型来说,一个能为约 5GB 的目标模型增加约 650MB BF16 权重、配有文档化 SGLang 服务路径、且贪婪接受率约为每验证步骤 5.5 个 token 的外部草稿模型,是可靠的吞吐量杠杆。但必须指出:OpenBMB 尚未公布端到端加速数据,因此这一杠杆未经过校准。IBM 也未随此次发布为 Granite 4.2 3B 提供等效的外部草稿模型——你只能以稠密方式运行它,它的速度优势仅仅在于 3B 模型足够小。

应该由谁运行哪个

• 如果你的工作负载是在笔记本电脑级设备上进行长上下文推理——文档、代码库、深度单线程分析——并且你希望在完全由你掌控的 Apache-2.0 模型上拥有三种思维模式和 512K 上下文上限,那么请运行 Granite 4.2 3B。同时需接受:它背后没有智能体训练,也没有托管 API。

• 如果您的负载是面向设备的交互式工具调用代理,并且目标尺寸在您的内存预算内,同时您希望获得草稿模型带来的吞吐量提升,请运行 MiniCPM5-2B 堆栈及其 DSpark 草稿。请预留时间在您自己的 SGLang 构建上衡量该草稿的实际加速效果,因为目前尚未发布任何相关数据。

• 如果你确实拿不准,就把两者都放在一个路由层后面运行。目前这两个模型都不在托管目录中,OrcaRouter 也是如此——两者都是自托管方案——但在你自己的端点前面加一个带自动故障转移的路由器,就能让新草案栈跑在测试路径上,同时生产环境继续使用经过验证的旧栈;它对周围托管模型 0% 加价的直通策略也让 A/B 对比变得很便宜。关键在于可逆性:换一个模型名,做测量,如果那个一天前的检查点卡住了,就再切回来。

接下来看什么

两件事会比任何观点都更快地为这场对决定下结论。其一,独立跑一遍 MiniCPM5-2B,去证实或推翻 53.9 的平均分及其智能体相关宣称——一个 2B 模型在 SWE-Bench 类任务上拿到这样的分数,对端侧模型类别而言将是一个真正全新的数据点。其二,IBM 自家推理模型的数字能否经受住社区复现——3B 在 AIME 2025 上的 78.33 分,恰恰是那种别人一跑就会变动的宣称。在这些结果落地之前,诚实的立场是:Granite 4.2 3B 是当下更稳妥、文档更完备的小模型,而 MiniCPM5-2B 这套技术栈是更有意思的赌注——若其宣称成立,便是一个在端侧更快的智能体,只是这份赌注仍带着草稿形态,连其自家厂商都尚未衡量它的回报。