
Microsoft-Decision-1 与 Intern-Decision-4B:一个公布其校准,另一个公布其方法论
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
把 Microsoft-Decision-1与 Intern-Decision-4B放在一起对比,你会发现,决定这场比较的与其说是能力,不如说是两家厂商各自愿意公开什么。微软的模型于 2026 年 10 月 8 日在 Microsoft Foundry 上正式发布:基于 Qwen3.5-9B,由微软完成后训练,纯文本,32,768 token 上下文,权重不分发,评估方法描述了准确率、校准误差和配对统计检验——却没有给出任何一项结果。InternLM 的 Intern-Decision-4B 于 2026 年 9 月 26 日 05:36:37 UTC 悄然上线 Hugging Face,背后没有任何公告,基于 Qwen3.5-4B 微调,除文本外还可接受图像,在单块 RTX 4090 上运行仅需 44 毫秒,并完整列出一张 Brier 分数与期望校准误差的数据表。两者都会针对你提供的选项返回一个概率分布。但只有其中一个会告诉你它做得有多好。
那种倒置——规模更大、资金更充裕的模型反而是不透明的那个——正是这场对决的整体格局,而且它对大多数团队抉择的影响,比任何一项规格参数都要来得更快。
区分它们的那一个数字
InternLM 报告称,Intern-Decision-4B 在其基准测试套件上的 Brier 为 0.347,ECE 为 0.065,在 Jevbench-Easy(100.00)、Jevbench-Original(98.61)、Jevbench-Hard(73.87)、Typed Decision(80.55)、ToolACE(96.45)、AG News(90.82)和 WildJailBreak(89.86)上的平均得分为 90.02。这些是厂商在其自有测试框架上报告的数值,尤其是 Jevbench 各项,属于该项目自有的基准系列——应把它们当作自我评估,而非独立验证。但它们是有明确标度的数字,而 ECE 尤其能说明,返回的 0.8 是否值得据此采取行动。
Microsoft 没有发布任何对等指标。Microsoft-Decision-1 目录页面上的“基准测试”选项卡描述了所测量的内容,并声称该模型“表现与领先的决策模型相当,并优于其他以相同方法论评估的开源决策模型”,其中最强的领域被列为推理、规则应用和提示格式稳健性,最弱的则是专业领域知识。没有 Brier,没有 ECE,也没有准确率表格。如果你的采用决策在确定升级阈值之前需要一个校准数值,那么这两个模型中的一个会直接把它交给你,另一个则要求你自己去测量。

这两份合同实际上的不同之处
表面上,这些模型接受相同的调用。你提供一个状态、一个由具名问题组成的模式,以及一组固定选项;返回的是每个选项的概率,而不生成任何文本 token。差异出现在这一约定的边缘。
• 模态 — Microsoft-Decision-1 明确仅支持文本,不接受也不生成图像、音频或视频内容。Intern-Decision-4B 可在状态之外接受可选图像,每次调用最多八张,这使其成为截图分诊、文档版式检查和视觉 QA 路由的候选方案。
• 问题数量——InternLM 记载了每次调用 1 到 16 个问题,每个问题最多 62 个选项,涵盖三种字段类型(choice、score、noul)。Microsoft 记载了相关格式——是/否、多选、评分、分类、评分标准——以及单次调用最多 32K token,但未说明每次调用的问题数量上限。
• 上下文 — 微软称其为 32,768 个 token。Intern-Decision-4B 的模型卡是以问题、选项和图像来陈述其限制,而不是给出一个统一的上下文数值,因此你无法用单一数字把两者对齐。
• 分发——Microsoft-Decision-1 是托管的 Foundry API;模型权重不对外分发,也没有下载渠道。Intern-Decision-4B 在 Hugging Face 上以 Apache-2.0 许可发布,并保留了上游 Qwen 许可证,即 LICENSE-QWEN,这意味着如果你再分发,就需要保留该许可证及上游声明。
• 成本结构——InternLM 的权重运行不产生任何费用,在单张 RTX 4090 上标称平均 44.16 ms、P95 为 44.60 ms。微软的每 token 价格在模型页面上根本没有印出。
• 治理——微软提供了负责任 AI 评估、有成文记录的部署实践以及明确的排除用途(不用于文本生成、开放式问答、对话、翻译或摘要;不得在涉及个人的重大决策中充当唯一的自动化决策者)。InternLM 提供了一份模型卡,对模型来源坦诚相告——权重“经决策调优修改”——却没有任何类似合规方案的内容。

延迟数字难以比较的两个截然不同的原因
Microsoft-Decision-1 没有公布延迟数据,因此没有东西可以放在 InternLM 的 44.16 ms 平均值旁边。对这个工作负载来说,这并不是一个小遗漏。这些模型存在的意义,就是在一条流水线中被多次调用——每检索到一个文档调用一次,每提出一个工具调用调用一次,每给一个响应评分调用一次——而每秒四次决策与每秒四十次决策之间的差别,就是给一个样本打分与给所有样本打分之间的差别。InternLM 的数字今天就能在按小时租用的硬件上实现;微软的数字则必须通过你自己的 Foundry 部署来测量,而你选择的部署形态(按需付费的无服务器还是预置吞吐量)对它的影响会比模型本身更大。
这也正是该模式中属于 OrcaRouter 的那一半发挥作用的地方,而且只是生成的那一半。我们并不托管 Microsoft-Decision-1 或 Intern-Decision-4B——一个返回概率而非文本的模型,不是你会把聊天补全路由过去的东西,而且它们也都不在我们的目录中。我们那一个 OpenAI 兼容密钥背后所承载的,是负责实际撰写的 200 多个模型组成的池子:由某个模型起草的评审提示词、由另外两个模型生成的候选答案、以及那个在执行前就被打分的工具调用。供应商的目录价格以 0% 的加价原样传递,因此生成模型一旦降价,当天就会在我们这边生效;而当单个供应商出现性能下降时,自动故障转移能让评分循环的生成侧保持存活——这一点在这里比平时更重要,因为一条对所见的一切都进行评分的流水线,没有余力去重试一个卡住的调用。

谁应该拿哪一个
如果以下任一情况属实,就选择Intern-Decision-4B:你既需要对图像打分,也需要对文本打分;你在发布前需要一个校准数值;你希望可以选择在自己掌控的边界内、在自己的硬件上运行该模型;或者你想对它进行微调。最后一点值得强调——一个带有文档化封装器的 4B 开放权重评分器,是你可以适配到自有标签的模型,而 Microsoft-Decision-1 是托管 API,没有微调路径,也没有可供适配的权重。
选择Microsoft-Decision-1,如果阻碍在于采购而非性能:在有任何东西进入生产环境之前,你需要 Azure 身份验证、统一计费、治理以及供应商的负责任 AI 评估,而且你需要 32K 上下文来处理长文档,而 4B 的每次调用限制会让这件事变得棘手。它缺少公开基准测试确实是一项实实在在的成本,但这项成本你花一个下午就能了结:把你自己的标注数据集分别跑过这两个模型并比较 ECE——而这本来就是你在信任任何一方的表格之前都会做的事。
令人不安的答案是:这两者测试起来都足够便宜,以至于这场争论几乎不值得进行。Intern-Decision-4B 需要一块你很可能已经拥有的 GPU。Microsoft-Decision-1 需要一个 Foundry 部署,以及一批你自己标注的决策样本。把你的数据分别跑过两者,在对你重要的子集上计算校准度,然后让数字来决定——而这恰如其分,正是这些模型的用途所在。
