
MiniCPM5-2B-DSpark 对比 Qwen3-8B:全新2.5B端侧技术栈 vs 开源权重主力
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
每一次模型对比背后都藏着一个硬件问题,而 MiniCPM5-2B-DSpark 与 Qwen3-8B 的对比,就是穿着评测基准外衣的这个硬件问题。Qwen3-8B 是阿里巴巴 2025 年 4 月开源权重的主力模型:约 8.2B 稠密参数、支持 119 种语言、原生 32K 上下文可扩展至 131K、混合思考模式,背后还有十六个月的社区实践验证。MiniCPM5-2B-DSpark 并不是一个可以与之并列的独立模型:它是 OpenBMB 于 2026 年 9 月 6 日悄悄发布到 Hugging Face 上的 323.8M 参数 DSpark 草稿检查点,用于加速 MiniCPM5-2B——后者是 ModelBest 于 2026 年 7 月 19 日在 WAIC 上发布的稠密 2.52B 端侧模型。把两者放在一起,真正的问题就浮出水面:目前运行在 8B 上的工作负载,是否应该迁移到只能承载 2B 的硬件上?而一个带免费草稿模型的 2.5B,又是否已经足够好到能推动这次迁移?
对于大多数工作负载,简短的回答是“还不能”,但原因比参数规模差距所暗示的要更具体,而且有一类部署场景中,8B 完全无法作答。本文中所有定量数据均为厂商自行报告——MiniCPM 的数据是 ModelBest 自家提供的,未经复现;Qwen3-8B 的数据来自阿里巴巴,早已被社区长期使用检验——因此标签比数字更重要。
两个模型位于记忆曲线的不同位置
MiniCPM5-2B 是一个稠密因果 Transformer,体积约为 8B 模型的三分之一——42 层、分组查询注意力、Apache-2.0 许可——专为大模型无法触及的设备类别而构建:手机、智能座舱和小型边缘盒子,这些设备的内存总线在读取八十亿权重时会不堪重负。其发布材料强调的重点是智能体任务和长上下文,而非宽泛的通用能力:原生 128K 上下文,以及 ModelBest 声称其自建评测套件上模型平均分为 53.9——按厂商说法是 2B 级开源 SOTA,其中还包括厂商自行运行的 SWE-bench Verified 46.4 分,如果它能经受住独立测试,这对 2B 模型来说将非常出色。DSpark 草案是对一个显而易见质疑的吞吐率回应:小型稠密模型加载很快,但生成很慢,因为每个 token 都要把权重拖过内存总线。该草案一次最多提出七个 token 供目标验证,仓库报告在聚合数据上每次验证步骤平均接受 5.52 个 token——代码任务上为 6.11。这个数字代表的是草案的质量;其加速效果尚未实测,也没有发布每秒 token 数的数据。

上面的 openbmb/MiniCPM5-2B-DSpark 卡片就是 9 月 6 日这次悄无声息的发布的全部对外公开内容:一个报告接受长度的服务端附件,既没有任何公告,也没有实际运行时间上的加速。
Qwen3-8B 属于同一个架构家族,但规模为其三倍,问世时间早十六个月。它是一个密集型因果 Transformer,采用分组查询注意力,在包含 36 万亿 token 的多语言语料库上训练,采用 Apache-2.0 许可证,是开放权重世界中最广泛被自行托管和部署的 8B 模型之一。其标志性特性是 Qwen3 混合推理模式——每个请求都可选择开启或关闭思考——而其能力定位刻意宽泛:MMLU 达到 70 多分接近 80,GSM8K 与编程表现强劲,支持 119 种语言。它需要一块真正的 GPU 或一台性能强悍的边缘设备:在实际量化水平下,内存占用处于几 GB 的低位区间,可轻松运行在一张中端显卡上,但手机跑不动。

上文中 Alibaba 为 Qwen3-8B 发布的模型卡,正是现有领先者的门面:十六个月来,在 119 种语言中有据可查且经过社区检验的行为。
8B 仍然获胜的地方
如果降到更轻的重量级,你会失去三样具体的东西。首先是语言:Qwen3-8B 覆盖 119 种语言;MiniCPM5-2B 的模型卡和数据集以英语和中文为核心,并且没有宣称任何多语言广度。对一个要服务长尾语言的产品来说,这是一堵硬墙,而不是软边界。第二是证据:Qwen3-8B 的各项数字已经在十六个月里被反复检验、量化、微调和大规模部署服务;它的失效模式已知,量化版本齐全,生态无处不在。MiniCPM5-2B 是 2026 年 7 月发布的版本,跑分榜由厂商自己运营,没有任何独立复现,而且这份草案才出炉一天。第三是服务栈:所有已经能对接 Qwen3-8B 的东西——vLLM、SGLang、llama.cpp、上千个微调模型——对接的是一个成熟的目标;而 MiniCPM 的草案需要构建一个投机解码引擎(SGLang 的 DSPARK 算法),该算法在仓库里有文档说明,但更广泛的生态尚未吸收它。
当2B技术栈是唯一选择时
在8B模型根本无法容纳的设备类别上,这些都无关紧要。在仅有几GB DRAM的手机或边缘板上,Qwen3-8B并不是在与MiniCPM5-2B竞争——它根本无法以可用速度部署。这正是2B模型栈存在的全部原因,也是草稿模型(draft)而非装饰成为本次发布中承重部分的原因。投机解码恰恰在小模型运行于小芯片上所处的那种密集、内存受限的场景中最为有效:紧凑的草稿器提出一个块,目标模型一次前向通过即可验证,权重加载成本按每个块支付一次,而非按每个token支付一次。源自DeepSeek的DSpark方法(arXiv 2607.05147)是为高并发服务系统设计的,但其机制——以及本仓库中的接受率数字——是让2B模型在受限硬件上必须具备交互感的关键着力点。只需牢记这一诚实的告诫:OpenBMB衡量的是草稿的接受率,而非其加速效果,因此你在目标设备上实际获得的每秒token数提升仍需自行测量。
记分牌,诚实标注
• 发布 — MiniCPM5-2B:2026年7月19日(官宣);MiniCPM5-2B-DSpark:2026年9月6日,低调发布。Qwen3-8B:2025年4月,已官宣。
• 规模 — MiniCPM5-2B:2.52B 密集参数,外加 324M 草稿模型。Qwen3-8B:约 8.2B 密集参数。
• 上下文 — MiniCPM5-2B:原生 128K。Qwen3-8B:原生 32K,通过 YaRN 可达 131K。
• 语言 — MiniCPM5-2B:以英语/中文为中心。Qwen3-8B:119。
• 推理 — MiniCPM5-2B:根据发布材料支持混合快速/深思模式。Qwen3-8B:根据请求可开启或关闭思考。
• 证据——MiniCPM 的数据是 ModelBest 模型卡上的声称(其自家测试套件平均 53.9;无独立运行验证)。Qwen3-8B 的数据由阿里巴巴报告,且已在社区中公开十六个月。

上面的记分牌如实反映了这种错配:各列几乎在所有方面都不相同,除了开源的 Apache-2.0 许可证——而且你面向发布的设备类别决定了你究竟可以选择哪一列。
路由的现实
目前,这两款模型都不在 OrcaRouter 的托管目录中,因此这次对比完全发生在自托管世界里——而路由层恰恰是在这里仍然能体现出自己的价值。Qwen3-8B 由其厂商和多家第三方平台提供;MiniCPM5-2B 及其草稿模型则需要你自己去部署运行。当一个团队想测试一套 2.5B 技术栈能否承接 8B 工作负载的一部分时,可回退的做法是:通过一个带自动故障转移的 API,把测试路径指向自托管的 MiniCPM5-2B 加草稿模型的 SGLang 构建——生产环境继续跑在原有方案上,新栈即使中途卡住也不会拖垮任何系统,而且整个对比过程中,供应商挂牌价均以 0% 加价透传,所以这场 A/B 测试成本低、可随时回退,而不是一场押注。该层并不托管这两款模型中的任何一款;它只是让这个实验能够安全地进行。
谁该动,谁该等
对于任何多语言任务、任何需要十六个月已知行为记录的工作负载,或任何已在能轻松承载8B模型的硬件上运行的任务,请继续使用Qwen3-8B——模型尺寸的差距不是迁移的理由,证据层面的差距更不支持迁移。只有当目标设备完全无法承载8B模型,或者一个在智能体任务和长上下文工作中不掉队的2.5B模型能让你在已出货的硬件上削减内存和功耗时,才值得认真测试搭载DSpark草稿模型的MiniCPM5-2B技术栈。在投入草稿模型之前,请先运行OpenBMB没有公布的测量:接受长度不等于延迟,你设备上每秒token数的提升,才是真正决定Hugging Face上那个低调的小checkpoint是否值得下载的指标。
