为 Microsoft-Decision-1 vs Intern-Decision-0.8B 生成的一张标题卡,副标题为“一个没有数字的托管评分器,对比一个 1.73 GB、带有一个不好看数字的检查点”;卡片标签分别写着 Foundry 端点对 852,985,920 个参数、一段方法论说明对 WildJailBreak 得分 64.48,以及 32,768 个 token 对 8,192 的上限。
Guides & Insights

Microsoft-Decision-1 对比 Intern-Decision-0.8B:半盎司的越狱麻烦,对阵托管空白

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

先从发布帖本会略去的那一栏说起。 Intern-Decision-0.8B——InternLM 的 852,985,920 参数决策模型,基于 Qwen3.5-0.8B 微调,于 2026 年 9 月 26 日上传至 Hugging Face,没有公告、没有论文,GitHub 链接至今仍然 404——其测得结果在 WildJailBreak 上为 64.48,而 TypeSafe 的 Jev 1.13 的参考值为 96.29。这不是四舍五入的差异。这是一个拒答鲁棒性的崩塌,发生在一个全部职责就是评判输入的模型上,还发布在厂商自己的模型卡里,出现在一张基准测试归属于竞争对手的表格中。把这一点放到 Microsoft-Decision-1 旁边——它已于 Microsoft Foundry 上正式全面可用,日期是 2026 年 10 月 8 日,作为一个基于 Qwen3.5-9B 后训练的纯文本评分器,配有成文的评估方法,却没有在其下印出哪怕一项结果——你就会看清这场对决的真实轮廓。这两个模型中,有一个会告诉你一个让它自己显得难看的数字。另一个则会告诉你,它原本会采用哪些指标。

这种反转比规格表更有价值。两个模型都接收一个状态和一组有界问题,并返回你各选项上的概率——二者都不生成文本,就此维度而言,它们是同一类工具。真正重要的差异在于:谁在运行它、它有多大、你能验证多少,以及一个安全维度——那个更小、更安静、可完全下载的模型还是选择把它公开了。

每一个实际返回的内容

Microsoft-Decision-1 是一种托管 API,这是第一个结构性差异。权重并不对外分发——没有下载、没有仓库、也没有微调路径——集成意味着一次附带 Azure 身份验证、计费和治理的 Foundry 部署。它单次可处理最多 32,768 个 token,支持是/否、多项选择、评分、分类以及评分量表式问题,且仅接受文本输入、输出数值。当证据不足时,它明确支持诸如“无法判断”之类的弃权选项,这正是阈值之所以有意义的原因。

Intern-Decision-0.8B 则是相反的安排。它是 Apache 2.0 权重,并在旁边保留了上游 Qwen 许可证作为 LICENSE-QWEN,仓库跨三个分片约 1.73 GB——一个 1.50 GB 的语言分片、一个 176 MB 的视觉分片和一个 25 MB 的投影器——可放入单块消费级 GPU 或配置较好的笔记本电脑。它接受一个状态、一个包含一至十六个具名问题且每个问题最多 62 个选项的 schema,以及可选的至多 八张图像;其自带的 inference.py 对这个契约的说明比大多数已发布的模型所愿意费心的还要详细:选项被映射到单 token 符号 A–Z,然后是 a–z,再是 0–9;在每个预渲染骨架中的 <decision> 占位符之前的紧邻位置读取 logits;仅对该字段的合法候选做 softmax;再应用拟合出的温度参数。

这两种许可证并不是同一笔购买。Microsoft-Decision-1 为你提供一个托管端点,但没有归你所有的工件。Intern-Decision-0.8B 为你提供一个归你所有的工件,但没有端点、没有支持合同,也没有除该仓库本身之外的任何文档。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

上限,以及可审计的校准

两个数字决定了大多数实际集成,而它俩都属于小模型。

第一个是 8,192 个 token。Intern-Decision-0.8B 的推理引擎会拒绝过大的输入,而不是将其截断,这对评分器而言是正确的行为,同时也是一堵硬墙:没有任何分块策略能保持这一契约,因为状态、模式和骨架都必须在一次处理中完成。Microsoft-Decision-1 的上限则高出四倍,达到 32,768 个 token,而且这是一个托管限制,你可以通过采用不同的资源配置方式来提高,而不是 Python 文件中的一个常量。

第二项是校准,而在这里,方向反了过来。InternLM 公布的拟合温度值为2.747760550703,对应 0.8B 模型;该值通过在 1,728 个指定校准用例上进行 NLL 最小化来选定,并留出 1,693 个用例用于验证,模型卡中明确说明未使用测试套件标签来选定它。所应用的变换是:先对该字段的候选 logits 做一次 softmax,再对该分布取对数并除以温度后做第二次 softmax。由于该变换在第一次 softmax 之后运行且保持顺序不变,它完全无法改变 argmax——它改变的是置信度、“是”的概率以及评分题的期望值,而标签保持不变。如果你的流水线读取的是标签,那么温度就是空操作。如果它读取的是概率、对其设定阈值,或将其送入期望值计算,那么温度就是决定这个数字有意义还是毫无意义的差别。传入 temperature=1则会返回未经校准的分布,如果你更愿意自行拟合的话。

Microsoft-Decision-1 没有对应的制品。它的 Benchmarks 标签页称,准确率、校准误差、安全召回率、假阳性率和公平性一致性是在公共和社区决策基准以及留出的内部测试集上测量的,选项顺序有所变化,应用了配对统计检验,并且该模型“表现与领先的决策模型相当,并领先于用相同方法评估的其他开放决策模型”。没有打印任何校准误差,没有可供检查的温度,也没有描述验证集划分。唯一能让概率有用的性质——0.8 是否真的意味着 0.8——只是被断言,而未被量化。

把这两段放在一起对照着读,比较就不再关乎规模了。对评估团队来说,一个 8 亿参数的检查点——其校准可以检查,其软件可以运行——是比校准只有一句话的托管 API 更易于处理的对象。这个小模型还有有据可查的延迟数据——根据 InternLM 自己的测量,经由本地 Hugging Face 路径、在单块 RTX 4090 上,每次查询平均 33.98 毫秒,中位数 33.44 毫秒,p95 为 37.50 毫秒——而微软的那个则要通过你自己的部署来测量,在那里,无服务器与预置吞吐量之间的选择对数字的影响会超过模型本身。

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-0.8B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; weights not distributed; calibration error not published; latency not published. Right column Intern-Decision-0.8B rows read: availability uploaded September 26, 2026; parameters 852,985,920 in 1.73 GB; input ceiling 8,192 tokens with oversize input rejected; weights Apache 2.0 and self-serve; Brier 0.530 and ECE 0.066; 33.98 ms mean on a single RTX 4090. A footer line reads that the InternLM figures are vendor-reported on InternLM's own harness with no independent reproduction.

小模型输在哪里

以上任何一项都不能让 Intern-Decision-0.8B 成为安全的选择,而同一张已发布的表格说明了原因。WildJailBreak 为 64.48,而 Jev 的是 96.29,在评分器接触不可信输入的确切类别中,存在三十个百分点的拒绝鲁棒性差距。决策模型常常是决定某个拟议操作是否被允许的组件;一个容易被绕过的模型在那个位置上是一种隐患。这一差距究竟源自 Qwen3.5-0.8B 基座、决策调优目标,还是较小的参数量,仓库并没有告诉你;也没有论文、训练配方或数据披露能说明这一点。

InternLM 自己表格的其余部分比那一列更讨喜,而且依然克制。七个套件的平均成绩是,0.8B 为 79.38,而同门 2B 为 84.68,4B 为 90.02——该系列随规模陡峭上升,这是一个轻微信号,说明这张表并非为了吹捧旗舰而倒推设计。AG News 为 88.61,而 Jev 为 89.57,在四分类主题分类上基本持平。在校准方面,0.8B 报告的 Brier 为 0.530,期望校准误差为 0.066,而 Jev 为 0.358 和 0.095——ECE 更好,但准确率明显更差。对于一个刻意拟合了温度参数的小模型来说,这是合理的特征画像,而且这不是营销团队会碰巧选择发布的组合。

同样没有发布日期,没有公告,没有将这三个检查点汇集起来的合集,也没有任何地方提供托管端点,更没有任何形式的独立评估。Demo Space 返回 401。对 Intern-Decision-0.8B 的正确描述是:一个带有未经审计说法的已发布检查点——这比一个需要排队等待的 API 要好,因为你可以在一个下午内测量它,但这也意味着验证负担完全由你承担。

选择,以及 Orca 的定位

如果障碍是采购或规模,就选择 Microsoft-Decision-1:你需要 Azure 身份验证、统一计费和负责任 AI 评估,之后任何东西才能进入生产环境;你需要 32K 上下文;你需要一个不由你运营的终结点;或者你需要将弃权路径设计在内,而不是手工打造。作为交换,接受你无法运行它、无法微调它、无法检查其校准,并且将不得不自行衡量其核心主张。

如果阻碍因素是成本、内存或控制权,那就选 Intern-Decision-0.8B:你想要一个 Apache-2.0 评分器,小到 1.73 GB,能在你已有的硬件上运行,每次产出相同的标签,并且只要改一下检查点路径就能换成它的 2B 或 4B 兄弟型号。作为交换,你得接受 8,192 token 这道墙、WildJailBreak 那一列,以及 InternLM 之外没有任何人复现过卡上任何结果这一事实。

最诚实的建议是两者都做,因为它们都足够便宜,这场争论本身几乎都不值得进行。评分调用本身并不是由我们路由的东西——一个返回概率而非文本的模型算不上聊天补全,而这两者都不在我们的目录里。OrcaRouter 承担的是这个闭环的另一半:一个 OpenAI 兼容密钥背后的 200 多个模型,它们负责起草评分标准、生成候选答案,或者发出你的评分器即将评判的那次工具调用,价格按供应商目录价原样透传,0% 加价,因此生成器那边的厂商降价当天就会在我们这边生效。自动故障转移在这里比平时更重要,因为一条给所见的一切都打分的流水线没有余力去重试一个卡住的调用,而路由 DSL 让你可以把同一个评委提示词发给多个写手,并融合它们的一致意见,而不是只信任其中某一个。

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

最重要的一点

Microsoft-Decision-1 于 2026 年 10 月 8 日在 Microsoft Foundry 上正式发布:托管式、纯文本、32,768 个 token,基于 Qwen3.5-9B 构建,并以一段方法论说明取代了基准测试表格。Intern-Decision-0.8B 是一个 1.73 GB 的 Apache-2.0 检查点,于 2026 年 9 月 26 日上传,公布了 0.530 的 Brier、0.066 的 ECE、2.747760550703 的拟合温度、在 4090 上 33.98 毫秒的成绩——以及一个没人要求它输出的 64.48 的 WildJailBreak 分数。如果你在采用这两者中的任何一个之前只能验证一件事,那就在你自己标注的案例上验证校准度;这正是两家供应商都留给你去发现的数字。