
MiniCPM5-2B-DSpark 对比 Gemma 4 12B:本地 AI 的两种起草方式与两个重量级别
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
要看懂 MiniCPM5-2B-DSpark 和 Gemma 4 12B 为什么应该出现在同一页,最快的方法是暂时忽略它们的体积,观察两者各自如何写出一句话。它们都借助一个草稿模型对内存总线作弊:小模型一次提出好几个后续 token,真正的大模型一次性验证整个块,于是芯片的权重加载成本按块支付,而不是按 token 逐次支付。MiniCPM5-2B-DSpark 是 OpenBMB 于 2026 年 9 月 6 日悄悄发布到 Hugging Face 的草稿版本——一个 323.8M 参数的配套检查点,用来加速 MiniCPM5-2B,后者是 ModelBest 在 2026 年 7 月 19 日 WAIC 上发布的稠密 2.52B 端侧模型。Gemma 4 12B 是谷歌于 2026 年 6 月 3 日推出的 11.95B 无编码器多模态通用模型,自带草稿模型,上下文长度 256K。前者把草稿模型作为可自行加载的独立 Apache-2.0 检查点提供;后者则把同样的技巧藏在一个你只管直接运行的大模型内部。
决定本文形态的诚实说明:MiniCPM5-2B-DSpark 并不是一个可以用 prompt 驱动的模型。它没有 tokenizer,没有聊天模板,也没有独立的输出——其模型卡片上只列出了 model.safetensors、config 和 README。它是面向 2B 级目标的 serving 层附件,而读者真正在做的比较,是两种本地 AI 权重级之间的对决:一个手机大小的 2B 模型栈负责起草 token,另一个 16GB 的 12B 全能模型负责起草 token。下文的一切内容,都是这一决定的具体化。
MiniCPM5-2B-DSpark 究竟是什么
模型卡是整个发布对外可见的全部表面,因此这就是从它所能了解到的全部信息。MiniCPM5-2B-DSpark 是一个 DSpark 草稿检查点:五个全注意力层,323,776,001 个参数,分组查询注意力,包含 16 个查询头和 2 个 KV 头,块大小为七——每个前向传播最多为 MiniCPM5-2B 目标提出七个候选令牌以供验证。配置声明了 Qwen3DSparkModel 架构,并带有 DSparkDraftModel 自动映射;同时,它仍启用来自 DSpark 方法(arXiv 2607.05147,即 2026 年 7 月的 DeepSeek 论文)的置信度头和马尔可夫头——这是一个负载感知的验证器,用于决定某个后缀是否值得检查。该模型在 MiniCPM5-2B 生成的 70.5 亿个令牌上训练了六个周期,覆盖通用、数学和代码提示。

上面这张 openbmb/MiniCPM5-2B-DSpark 模型卡片就是已发布内容的全部:模型卡片、config、一个 Safetensors 文件,没有公告、没有博客文章、没有新闻稿——截至撰写本文时,这次悄无声息的权重发布才一天之久。
该卡片未包含的内容与其包含的内容同样重要。它报告了接受长度——在仓库自身的评估中,贪心解码下每个验证步骤平均接受 5.52 个 token,其中数学为 6.05、代码为 6.11(上限为七个 token)——但未公布实际耗时加速、每秒 token 数或独立基准测试。SGLang 的 DSPARK 引擎是文档记载的推理服务路径,草稿模型与 MiniCPM5-2B 目标模型一同加载。换言之:草稿的质量已被量化,但其收益尚未量化;任何采用它的人都应先在测量后再相信。
Gemma 4 12B 带给另一边的东西
Gemma 4 12B 是 Google Gemma 4 系列中的老二,在本地 AI 曲线上处于完全不同的位置。它是一个密集的 11.95B 模型,无需单独的编码器即可接收文本、图像、音频和视频输入,开箱即用地支持工具调用,并将原生 256K 上下文与多 token 预测草稿器配对,在内部实现了同样的内存总线技巧——但这一切都内置于检查点中,因此你无需额外下载或连接任何东西。它采用 Apache 2.0 许可证,实际可在 16GB 笔记本电脑上运行,并配备了完整的 Google 配套:发布评估、基础版和指令版的模型卡,以及跨 Model Garden、LM Studio 和 Ollama 的生态系统支持。它背后已有数月的社区部署经验,而刚发布一天的 MiniCPM 草稿模型尚不具备这一点。

上面 Google 为 Gemma 4 12B 发布的模型卡,正是将这种对比收进同一画面的体现:这是一个成熟的多模态通才,其起草者本身就是本次发布的一部分,而不是另成一个独立仓库。
规格,如实标注
阅读这些内容时请注意其来源:MiniCPM5-2B 的数据是 ModelBest 卡片上的声明,未经复现;Gemma 4 12B 的数据则出自 Google 自家,且长期经受社区使用检验。
• 你运行什么 — MiniCPM5-2B-DSpark:一个 324M 的草稿模型,仅配合 MiniCPM5-2B(2.52B 稠密、42 层)使用。Gemma 4 12B:一个独立的 11.95B 稠密模型。
• 上下文 — MiniCPM5-2B 目标:原生 128K。Gemma 4 12B:原生 256K。
• 模态 — MiniCPM5-2B 模型栈:仅文本。Gemma 4 12B:支持文本、图像、音频和视频输入,无需编码器。
草拟 — MiniCPM5-2B-DSpark:外部DSpark草拟,每次生成七个token,使用SGLang DSPARK引擎。Gemma 4 12B:内部多token预测草稿模型,无需安装。
• 占用空间 — MiniCPM5-2B 在 BF16 下目标约为 5GB,另加约 650MB 的草稿文件;Gemma 4 12B 在 BF16 下约为 18GB,量化后在 16GB 级别硬件上切实可行。
• 证据 — MiniCPM5-2B-DSpark:发布仅一天,仓库中只有达到验收长度的数据;Gemma 4 12B:拥有发布评测,并已在社区部署数月。

上方的记分牌以六行呈现的是同一幅写照:两栏几乎在所有事情上都各执一词,唯独在它们都用来快速书写的策略上意见一致。
哪种重量等级适合你实际拥有的硅
Because MiniCPM5-2B-DSpark is not a model, the meaningful fork is the target model's weight class versus Gemma 4 12B's — and that fork is mostly a hardware question. A phone, a smart-cockpit board, or a small edge box with a few gigabytes of DRAM cannot carry an 11.95B model at useful speed; the memory bus is exactly the bottleneck that would choke it. That is the world the MiniCPM5-2B stack was built for — a dense 2B whose weights fit on-device memory, with a draft bolted on to buy back some of the tokens-per-second that small dense models give away. Speculative decoding is most effective in exactly this dense, memory-bound regime, which is why the draft is the interesting part of the release rather than a gimmick.由于MiniCPM5-2B-DSpark并不是一个模型,真正有意义的比较点在于目标模型的权重规模与Gemma 4 12B之间的差异——而这个差异本质上是一个硬件问题。一部手机、一块智能座舱板卡,或一台只有几GB DRAM的小型边缘盒子,都无法以可用的速度承载一个11.95B的模型;内存总线恰恰就是会将其扼杀的瓶颈。MiniCPM5-2B技术栈正是为这样的世界而生的——一个稠密的2B模型,其权重能够放入设备端内存,再挂上一个草稿模型,以买回小型稠密模型所牺牲的部分每秒令牌数。投机解码恰恰在这种稠密且受内存约束的场景下最为有效,这正是草稿模型成为此次发布中最值得关注的部分、而非噱头的原因。
Gemma 4 12B 就是答案,只不过再高一个重量级。如果你的设备有 16GB 或更多内存——无论是笔记本电脑、工作站,还是性能强悍的边缘服务器——你都能承载这个多模态通才,并获得 2B 方案无法提供的三样东西:无需编码器或第二条流水线即可输入图像、音频和视频;足以胜任仓库级或文档级工作的 256K 上下文窗口;以及诞生仅一天的草稿检查点根本不具备的成熟度。你放弃的是在最小型设备上运行的能力,并且内存占用大约为 2B 方案的三倍。
两者的路由现实
这场对决的双方目前都不在任何托管目录中,OrcaRouter 也不例外。MiniCPM5-2B-DSpark 本质上就是自托管的服务附属组件——你需要自行运行 SGLang 技术栈,而该草稿模型只存在于你的本地部署中。Gemma 4 12B 是开放权重模型,所以你可以自行托管它,或在任何已经能获取它的地方使用它。这正是路由层作为安全网而非交付机制来体现价值的情形:当你用全新的草稿构建版本,针对已经在服务的负载进行试用时,让测试路径经过一个带自动故障转移的 API,就意味着未经证实的堆栈即使停滞,也不会拖垮生产环境;而围绕它的供应商挂牌价以 0% 加价透传,因此你所对比的任何托管模型的价格变动,当天就会显示出来。不过,就对比本身而言,对两个模型最诚实的做法都是一样的:既然你是自托管,那么真正重要的基准测试,就是你在自己的硬件上运行的那个。
裁决
MiniCPM5-2B-DSpark 和 Gemma 4 12B 在任何正面交锋的意义上都不是竞争对手——它们是本地 AI 的两个重量级,只是恰好共享了同一个招数。当你的设备无法承载 12B 模型,而你又想要一个支持文本、采用 Apache-2.0 许可、面向智能体、能适配设备端内存的模型时,选择带 DSpark 草稿的 MiniCPM5-2B 技术栈;草稿是一项颇有前景的免费加速手段,但在信任它之前,请先在你自己的 SGLang 构建上实测一番,因为它的收益仍未量化。当你的硬件有足够余量,并且你想要一个拥有 256K 上下文窗口、背后有生态支撑的多模态模型时,选择 Gemma 4 12B。问题不在于哪个模型更聪明——而在于你的芯片实际喂得动哪一个。
