
Intern-Decision-2B vs MiniCPM5-2B:两个 2B 检查点,相隔二十天,参数花法截然相反
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 584 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
internlm/Intern-Decision-2B 与 openbmb/MiniCPM5-2B大小相同,发布时间相隔二十天,许可方式相同,但构建目的却截然不同。InternLM 的检查点是 2,213,241,664 个参数的决策评分器:它接收一个状态和带类型的问题,运行一次前向传播,在不生成任何 token 的情况下返回经过校准的概率,并拒绝任何超过 8,192 个 token 的输入。OpenBMB 的则是 2,516,756,480 个参数的稠密通用模型:一个源自 MiniCPM5 配方、42 层的 Llama,支持 131,072 个 token 的上下文,能编写代码、调用工具并进行数学运算,其 Artificial Analysis 智能指数为 12.5,上个月下载量为 726,518 次。它们的下载成本相同,换来的却是完全不同的东西。
这组对比中有意思的地方并不在于基准测试上的差距——几乎没有什么可重叠比较的基准。有意思的是,22 亿与 25 亿参数的预算各自能花在什么地方,以及这一选择能告诉你哪一个已经完成。MiniCPM5-2B 是其系列中的第二个模型,继 5 月的 MiniCPM5-1B 之后推出,并且随附了一整套发布配套。Intern-Decision-2B 是 InternLM 于 2026 年 9 月 26 日 05:36 UTC 推送到 Hugging Face 的三个规模中的中间那个,当时没有任何公告,而它的发布配套——一个训练代码库、一个经哈希校验的评估包、一个 96 个用例的校准基准——直到今早 08:58 UTC 才公开。
两个预算的去向
这两个模型都是对他人架构的微调,且参数量都在25亿左右。相似之处仅此而已。

MiniCPM5-2B 是一个稠密 Transformer,拥有 42 层、隐藏维度 2,048、16 个注意力头、中间维度 6,144、130,560 词元的词表以及 131,072 词元的上下文,基于 OpenBMB 随其一同发布的开源语料混合训练:用于网络预训练的 UltraX、具备 L0–L3 分级代码管理的 UltraData-Code、UltraData-Math,以及 UltraData-RL-2609 中 500,000 条智能体 SFT 样本和超过 80,000 条 RL 样本。它的后训练依次进行 SFT,随后在数学、代码和智能体任务上使用专门的 RL 教师,再通过同策略蒸馏回到单个模型。它是一个通用模型,其全部参数预算都体现为你可通过提示调用的能力。
Intern-Decision-2B 是一个 Qwen3_5ForConditionalGeneration,具有 24 层——即三层线性注意力层对一层全注意力层的重复模式——隐藏维度 2,048,8 个查询头对 2 个键值头,头维度 256,一个保留的多 token 预测层,以及 262,144 位置的嵌入上限。它附带一个 612.5 MB 的视觉塔和一个 50.3 MB 的投影器。而这其中的预算几乎没有多少能作为提示词供你使用:该模型回答的是一套固定模式的问题,它的架构是 softmax 的投递机制,而不是文本生成器。
InternLM 最新发布的仓库里有一个细节值得单独拎出来讲,因为它重新诠释了模型卡上"多模态"这个标签。这套 decision tuning"会微调 Qwen3.5 的语言主干,同时冻结视觉塔和投影器"。2B 和 4B 两个 decision 检查点都带有一个大小恰好为 612,517 字节的视觉分片——两者完全相同——这与这些组件继承自 Qwen 底座的情况相符。图像通路确实是真实且可用的,但那正是 InternLM 的 decision tuning 投入精力之处。如果你的工作负载只是纯文本的决策评分,那么在这 4.46 GB 的下载内容里,大约有 660 MB 对你毫无用处。
记分板

• 参数 — Intern-Decision-2B 采用 BF16 格式为 2,213,241,664 个参数,加上约 660 MB 的视觉塔和投影器,仓库大小约 4.46 GB;MiniCPM5-2B 采用 BF16 格式为 2,516,756,480 个参数,单个 5.03 GB 的 safetensors 文件。
• 上下文 — Intern-Decision-2B 为 8,192 个 token,超过该值会被拒绝且不会截断;MiniCPM5-2B 为 131,072 个 token。
• 输出——每个字段一个分布加一个 argmax,完全没有文本;逐 token 生成的文本。
• 训练——在冻结视觉塔的情况下,对 Qwen3.5-2B 主干进行决策调优,训练数据未披露;完整的预训练、中训练和 4000 亿 token 的深度思考 SFT 阶段,随后进行 RL 和同策略蒸馏,并随附发布对应语料库。
• 已发表证据——一张七套件厂商表格平均 84.68,Brier 0.437、ECE 0.100,未经任何第三方复现,一个点赞、零下载;一张 OpenBMB 卡片在其自身对比集中平均 53.9,以及独立的 Artificial Analysis Intelligence Index 为 12.5,过去一个月下载量为 726,518。
• 许可证 — Apache-2.0,上游 Qwen 条款保留为 LICENSE-QWEN,而代码仓库上完全未声明任何许可证;全程采用 Apache-2.0,包括代码。
它们各自实际上更擅长什么,而且差距还不小
这种比较的不对称已经严重到构成范畴错误的地步,因此更有用的做法是直接点明这些工作。
MiniCPM5-2B 在所有需要生成答案而非挑选答案的任务上都更胜一筹。它能编写代码;Intern-Decision-2B 则没有代码路径。它能处理 131,072 个 token 的上下文;Intern-Decision-2B 到 8,192 就止步,并且会直接报错。它能调用工具,在 OpenBMB 自家表格上的 BFCL v4 得分为 66.6;它还能做数学,MATH-500 为 94.6,GPQA-Diamond 为 70.2——这些数字来自厂商的模型卡,其中 GPQA 那一行还带有模型卡自身提供的脚注。它在 MMLU-Pro 上取得 70.8,在 MMLU-Redux 上取得 84.7。它可在 llama.cpp 和 MLX 中运行,提供 GGUF、GPTQ 和 DSpark 版本,并在 Hub 上有一个公开的演示 Space,而不像 Intern-Decision 的模型卡所指向的那个 401。
Intern-Decision-2B 只赢在两件事上,而这两件事正是它存在的理由。第一,用一个由你编写的 schema 做闭集决策,能在单次前向传播中、约 33 毫秒内返回一个可供你设定阈值的概率,既不需要解析器,也不需要采样——这种形态 MiniCPM5-2B 无法产生,除非先生成文本,再寄希望于其中的数字表现良好。第二,它是一件可复现的产物:仓库现在带有训练目标、七个附有 SHA-256 哈希与各套件行数的准确率套件、评分代码、温度拟合与回放脚本,以及一个 96 例的分布校准基准,并配有它自己的生成器与离线评分器。InternLM 的评测指南指出,已发布的预设绑定于 XTuner 后端,而 HF 结果应作为另一种执行设置来报告——这正是复现工具包存在的意义所在:让这类附加说明变得可核查。

谁应该下载哪个
如果你有一项任务涉及阅读长篇内容、写作,或回答一个你事先没有列举选项的问题,那么 MiniCPM5-2B 就是那个模型,无需再做选择。它是一个成熟的 2B 级通用模型,拥有真实的生态系统、背后的开放数据以及独立的评测榜单,而且试用不花一分钱——GGUF 和 MLX 构建版本已经上架 Hub。
如果你有一个任务,它本质上是在已知答案中做选择——将工单路由、对支持邮件分类、给候选人打标签、按有序量表给意图打分——那么生成模型就是错误的工具,而 Intern-Decision-2B 是两者中更有意思的那个,尽管几乎没有人运行过它。一个可以设定阈值的概率,运营成本更低、更容易审计,也不可能产生幻觉;而且这个检查点附带的是复现工具包,而不是排行榜帖子,这让它成为两者中在你必须为选择辩护时真正重要的那个维度上文档更完善的那个。
这两个模型都不在 OrcaRouter 上。我们为 Intern-Decision-2B 提供的模型页面返回 404,也不存在 MiniCPM5-2B 的路由;这里没有任何内容是在声称其可用性,而两者都意味着你需要自行运行推理。切实可行的替代方案存在于托管决策模型之中:TypeSafe's Jev 1.13——InternLM 将整个系列与之进行基准对比的那个模型——已上架目录,价格为每百万输入 token 0.042 美元,上下文长度 65K,首 token 时间(P50)为 178 毫秒。而如果你真正需要的,是一个与 MiniCPM5-2B 同属一个规模级别、又无需承担运维工作的通用模型,我们最小的托管 Qwen 路由体量要大好几倍,但它是 200 多个模型共用的一把密钥,按供应商标价原样传导、不加价,并且背后有自动故障转移作为支撑。
起决定作用的那个数字
这不是 84.68 对 53.9。这两个平均值来自不同的测试套件,由不同的实验室测量得出,其中一个甚至出自一家从未被核实过数据的实验室。真正起决定作用的数字是 8,192。如果你的状态能装进八千个 token 以内,而且你的答案已经是一个列表,那么 Intern-Decision-2B 就是一件精密仪器,它配有复现工具包,还带着一个你应该知晓的校准异常——它 0.100 的期望校准误差是 InternLM 公布的三个尺寸中最差的,而尺寸只有它一半的模型是 0.066,所以在信任任何置信度数值之前,先拟合你自己的温度参数。如果你的状态装不下,那么这个问题在基准测试开始之前就已经结束了,MiniCPM5-2B 才是答案。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
