一张为 Microsoft-Decision-1 对阵 Intern-Decision-4B 生成的标题卡,副标题为"两位评分者,一位有数据,一位没有",标签分别写着 9B 对 4B、托管 API 对开放权重、未公布基准测试对 Brier 0.347 与 ECE 0.065,底部来源说明指出微软的数据未被复现,而 InternLM 的数据为厂商自报。
Guides & Insights

Microsoft-Decision-1 与 Intern-Decision-4B:一个公布其校准,另一个公布其方法论

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

把 Microsoft-Decision-1与 Intern-Decision-4B放在一起对比,你会发现,决定这场比较的与其说是能力,不如说是两家厂商各自愿意公开什么。微软的模型于 2026 年 10 月 8 日在 Microsoft Foundry 上正式发布:基于 Qwen3.5-9B,由微软完成后训练,纯文本,32,768 token 上下文,权重不分发,评估方法描述了准确率、校准误差和配对统计检验——却没有给出任何一项结果。InternLM 的 Intern-Decision-4B 于 2026 年 9 月 26 日 05:36:37 UTC 悄然上线 Hugging Face,背后没有任何公告,基于 Qwen3.5-4B 微调,除文本外还可接受图像,在单块 RTX 4090 上运行仅需 44 毫秒,并完整列出一张 Brier 分数与期望校准误差的数据表。两者都会针对你提供的选项返回一个概率分布。但只有其中一个会告诉你它做得有多好。

那种倒置——规模更大、资金更充裕的模型反而是不透明的那个——正是这场对决的整体格局,而且它对大多数团队抉择的影响,比任何一项规格参数都要来得更快。

区分它们的那一个数字

InternLM 报告称,Intern-Decision-4B 在其基准测试套件上的 Brier 为 0.347,ECE 为 0.065,在 Jevbench-Easy(100.00)、Jevbench-Original(98.61)、Jevbench-Hard(73.87)、Typed Decision(80.55)、ToolACE(96.45)、AG News(90.82)和 WildJailBreak(89.86)上的平均得分为 90.02。这些是厂商在其自有测试框架上报告的数值,尤其是 Jevbench 各项,属于该项目自有的基准系列——应把它们当作自我评估,而非独立验证。但它们是有明确标度的数字,而 ECE 尤其能说明,返回的 0.8 是否值得据此采取行动。

Microsoft 没有发布任何对等指标。Microsoft-Decision-1 目录页面上的“基准测试”选项卡描述了所测量的内容,并声称该模型“表现与领先的决策模型相当,并优于其他以相同方法论评估的开源决策模型”,其中最强的领域被列为推理、规则应用和提示格式稳健性,最弱的则是专业领域知识。没有 Brier,没有 ECE,也没有准确率表格。如果你的采用决策在确定升级阈值之前需要一个校准数值,那么这两个模型中的一个会直接把它交给你,另一个则要求你自己去测量。

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

这两份合同实际上的不同之处

表面上,这些模型接受相同的调用。你提供一个状态、一个由具名问题组成的模式,以及一组固定选项;返回的是每个选项的概率,而不生成任何文本 token。差异出现在这一约定的边缘。

• 模态 — Microsoft-Decision-1 明确仅支持文本,不接受也不生成图像、音频或视频内容。Intern-Decision-4B 可在状态之外接受可选图像,每次调用最多八张,这使其成为截图分诊、文档版式检查和视觉 QA 路由的候选方案。

• 问题数量——InternLM 记载了每次调用 1 到 16 个问题,每个问题最多 62 个选项,涵盖三种字段类型(choice、score、noul)。Microsoft 记载了相关格式——是/否、多选、评分、分类、评分标准——以及单次调用最多 32K token,但未说明每次调用的问题数量上限。

• 上下文 — 微软称其为 32,768 个 token。Intern-Decision-4B 的模型卡是以问题、选项和图像来陈述其限制,而不是给出一个统一的上下文数值,因此你无法用单一数字把两者对齐。

• 分发——Microsoft-Decision-1 是托管的 Foundry API;模型权重不对外分发,也没有下载渠道。Intern-Decision-4B 在 Hugging Face 上以 Apache-2.0 许可发布,并保留了上游 Qwen 许可证,即 LICENSE-QWEN,这意味着如果你再分发,就需要保留该许可证及上游声明。

• 成本结构——InternLM 的权重运行不产生任何费用,在单张 RTX 4090 上标称平均 44.16 ms、P95 为 44.60 ms。微软的每 token 价格在模型页面上根本没有印出。

• 治理——微软提供了负责任 AI 评估、有成文记录的部署实践以及明确的排除用途(不用于文本生成、开放式问答、对话、翻译或摘要;不得在涉及个人的重大决策中充当唯一的自动化决策者)。InternLM 提供了一份模型卡,对模型来源坦诚相告——权重“经决策调优修改”——却没有任何类似合规方案的内容。

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

延迟数字难以比较的两个截然不同的原因

Microsoft-Decision-1 没有公布延迟数据,因此没有东西可以放在 InternLM 的 44.16 ms 平均值旁边。对这个工作负载来说,这并不是一个小遗漏。这些模型存在的意义,就是在一条流水线中被多次调用——每检索到一个文档调用一次,每提出一个工具调用调用一次,每给一个响应评分调用一次——而每秒四次决策与每秒四十次决策之间的差别,就是给一个样本打分与给所有样本打分之间的差别。InternLM 的数字今天就能在按小时租用的硬件上实现;微软的数字则必须通过你自己的 Foundry 部署来测量,而你选择的部署形态(按需付费的无服务器还是预置吞吐量)对它的影响会比模型本身更大。

这也正是该模式中属于 OrcaRouter 的那一半发挥作用的地方,而且只是生成的那一半。我们并不托管 Microsoft-Decision-1 或 Intern-Decision-4B——一个返回概率而非文本的模型,不是你会把聊天补全路由过去的东西,而且它们也都不在我们的目录中。我们那一个 OpenAI 兼容密钥背后所承载的,是负责实际撰写的 200 多个模型组成的池子:由某个模型起草的评审提示词、由另外两个模型生成的候选答案、以及那个在执行前就被打分的工具调用。供应商的目录价格以 0% 的加价原样传递,因此生成模型一旦降价,当天就会在我们这边生效;而当单个供应商出现性能下降时,自动故障转移能让评分循环的生成侧保持存活——这一点在这里比平时更重要,因为一条对所见的一切都进行评分的流水线,没有余力去重试一个卡住的调用。

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

谁应该拿哪一个

如果以下任一情况属实,就选择Intern-Decision-4B:你既需要对图像打分,也需要对文本打分;你在发布前需要一个校准数值;你希望可以选择在自己掌控的边界内、在自己的硬件上运行该模型;或者你想对它进行微调。最后一点值得强调——一个带有文档化封装器的 4B 开放权重评分器,是你可以适配到自有标签的模型,而 Microsoft-Decision-1 是托管 API,没有微调路径,也没有可供适配的权重。

选择Microsoft-Decision-1,如果阻碍在于采购而非性能:在有任何东西进入生产环境之前,你需要 Azure 身份验证、统一计费、治理以及供应商的负责任 AI 评估,而且你需要 32K 上下文来处理长文档,而 4B 的每次调用限制会让这件事变得棘手。它缺少公开基准测试确实是一项实实在在的成本,但这项成本你花一个下午就能了结:把你自己的标注数据集分别跑过这两个模型并比较 ECE——而这本来就是你在信任任何一方的表格之前都会做的事。

令人不安的答案是:这两者测试起来都足够便宜,以至于这场争论几乎不值得进行。Intern-Decision-4B 需要一块你很可能已经拥有的 GPU。Microsoft-Decision-1 需要一个 Foundry 部署,以及一批你自己标注的决策样本。把你的数据分别跑过两者,在对你重要的子集上计算校准度,然后让数字来决定——而这恰如其分,正是这些模型的用途所在。