一张为 Microsoft-Decision-1 与 Gemma 4 12B 生成的标题卡,副标题为“一个没有输出 token 的评分器,对阵一个没有闭集的写作者”,标签分别写着概率对散文、32,768 token 上下文对 256,000、仅文本对文本、图像、音频和视频,以及托管 API 对开放权重。
Guides & Insights

Microsoft-Decision-1 与 Gemma 4 12B:一个从你的列表中挑选,一个为你写一个新的

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

将Microsoft-Decision-1与Gemma 4 12B并排放在一起,真正决定一切差异的并不是规模、准确率或许可证——而是模型读完你的输入之后所发生的事。Gemma 4 12B 是 DeepMind 于 2026 年 6 月 3 日在 Apache 2.0 许可下发布的无编码器多模态模型,拥有 119.6 亿参数,能读取文本、图像、音频或视频,然后在 256,000 token 的上下文窗口内、以 140 多种语言逐 token 为你写出答案。Microsoft-Decision-1 则于2026 年 10 月 8 日在 Microsoft Foundry 上正式全面可用,它是一个基于 Qwen3.5-9B 后训练而成的纯文本评分器:你交给它一个状态和一个答案已被你预先枚举好的问题,它便在单次处理最多 32,768 个 token 的过程中,为每个选项返回一个校准过的概率,而不生成任何内容。一个模型告诉你,你的哪个选项是对的;另一个模型告诉你,这些选项本应是什么——并按其中每一个字向你收费。

把这界定为一场竞赛会是范畴错误,而这一点值得在规格条目之前就说清,而不是之后再说。这两者并非彼此的替代品;它们处在同一条工作流的两端。真正有用的问题是:你实际在构建的是哪一端,因为答案决定了你买到的是一位裁判,还是一位写手。

法案正是分歧不再停留于哲学层面的地方

Gemma 4 12B 的计费方式与所有生成式模型一样:输入 token 和输出 token,两者都计费。当你要求它输出结构化 JSON 时,那个 JSON 的每个字符都会被生成、采样并计费——你的 schema 嵌套得越深,答案就越长,这个账单项也就越大。这不是模型的缺陷。解码器就是这么工作的,而这正是决策头旨在删除的那个账单项。

Microsoft-Decision-1 没有需要计费的输出端。它对你的状态、你的问题和你的选项集执行一次前向传播,为每个候选项读出一个分数,然后返回。其影响是随数据量而非提示词规模累积的:一条用 Gemma 4 12B 为上万条记录打标签的流水线会产出上万份 JSON 文档,而同一条流水线换用决策评分器,则只会产出上万个提示词,别无其他。绝对节省额是否可观,完全取决于你的数据量和架构(schema)的臃肿程度,任何有按 token 预算的人都能在一张电子表格里算清楚。方向毋庸置疑。

还有第二处、较小的不对称:微软没有在 Microsoft-Decision-1 模型页面上标出费率。定价部分外链到微软自家的定价界面,因此每次决策的成本是你从 Azure 上读到的,而不是从模型卡上读到的。该页面确实明确的一点是:调用中 0% 是输出 token,并且批处理推理已被禁用——你无法像使用生成式模型那样,通过批处理通道来摊薄大规模评分运行的成本。

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

同样的输入,两种不同的答案

给两个模型一个客户支持工单和一个问题。Microsoft-Decision-1 会返回类似这样的结果:“账单”为 0.83,“技术”为 0.11,“取消”为 0.04,“无法判断”为 0.02。你得到了一个可命名的标签、一个可以据以设定阈值的数值,以及一条弃权路径——Microsoft 的文档说明,当所提供的证据不足时,支持一种“无法判断”式的选项,这正是使升级逻辑得以运作的原因。但你得不到的是理由。

把工单交给 Gemma 4 12B,你就能得到一段话。它能通过可配置的思考对请求进行推理、调用函数、读取附在工单上的扫描发票、转写钉在工单上的语音留言,并用客户自己的语言作答。上述每一项都是 Decision-1 无法以任何准确度做到的:它的输入面只有文本,别无其他,并且它明确不是为开放式问答、对话、翻译或摘要而设计的。

Gemma 4 12B 的任何输出都不是概率。你让它给出一个带置信度的路由决策,得到的会是一段包含数字的文本,而这个数字是采样器生成的任意结果,而不是对你所提供的选项集做 softmax 的结果。如果下游阈值依赖于这个数字具有实际含义,那你面对的就是一个校准项目,而不是一个评分器。

你的问题是否有一个闭集,全在于此

这是在做其他任何事情之前都要进行的测试,用白板大约需要十分钟。

• 如果你的答案取自一份可以事先枚举的列表——一个标签、一个评级、一个是/否、一个评分标准分数、一条路线——那么 Microsoft-Decision-1 才是正确的工具,而 Gemma 4 12B 是从该列表中挑选的一种浪费且更不可靠的方式。你等于是在花钱让一个解码器去猜一个你早已限定范围的数字。

• 如果你的答案不是一个封闭集合——总结这个、解释那个、撰写回复、描述图表——Microsoft-Decision-1 无论如何都帮不上忙。它没有通往成篇文字的路径,没有理由字段,也没有任何机制来生成你未列为选项的任何内容。

• 如果两者兼具,那你拥有的就不是一个选择,而是一条双模型流水线,真正有趣的设计问题随之变成:升级阈值归谁所有。由评分器设定阈值;写作者则填充阈值之上和之下分别会发生什么。

在 Gemma 4 12B 完全属于另一种运动的地方

在决策框架之外,Gemma 4 12B 并未在某一维度上领先——它玩的是另一种游戏,假装不是这样就是不诚实的。

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• 模态 —— Microsoft-Decision-1 仅支持文本输入、数值输出。Gemma 4 12B 通过无编码器设计原生支持文本、图像、音频和视频,将原始图块与波形直接投影到嵌入空间,并支持任意顺序的交错输入。

• 上下文 — Microsoft-Decision-1 为 32,768 个 token,而 Gemma 4 12B 为 256,000 个;后者在 Google 自己的模型卡上,于 128k 的 MRCR v2 八针测试中得分 43.4%。

• 语言 — Microsoft-Decision-1 支持 25 种语言,Microsoft 警告称覆盖范围、质量和校准“可能因语言而异”,并将低资源非英语语言列为薄弱环节;Gemma 4 12B 支持 140 多种语言,在此规模下的评估 MMMLU 值为 83.4。

• 已公布的性能——Microsoft-Decision-1 的“基准测试”标签页只载有测试方法,没有任何数据;Google 则为 Gemma 4 12B 公布了 77.2% 的 MMLU Pro、77.5% 的 AIME 2026(不使用工具)、72.0% 的 LiveCodeBench v6、78.8% 的 GPQA Diamond、69.1% 的 MMMU Pro 以及 79.7% 的 MATH-Vision。

• 分发方式 — Microsoft-Decision-1 是仅在 Foundry 上提供的托管 API,没有权重、没有下载,也没有微调途径。Gemma 4 12B 则是 Apache 2.0 权重,发布首日便已进入 LM Studio、Ollama、llama.cpp、MLX、vLLM、SGLang 和 Unsloth 的生态。

• 运行时——决策评分只需一次前向计算,没有解码循环,因此延迟随提示长度而非答案长度增长;Gemma 4 12B 逐 token 生成,而 Google 的发布资料将其定位在 16 GB 显存或统一内存。

基准测试那一行才是最值得停下来细看的,而且是从对微软最不有利的角度。Gemma 4 12B 的数字同样是厂商自报的——但它们背后已有数月的第三方使用,在公开评测框架上,在其他人拥有的硬件上。微软在这个类别中的产品是两者中最新、也最难以验证的,尽管它来自规模更大的公司。

实际调用每一个需要你付出多少成本

Gemma 4 12B 的 12B 形态不在我们的目录中——如果你想要的就是这个规模,你得自行获取 119.6 亿个 BF16 参数并自行部署。我们目录中提供的,是 Gemma 4 系列的其余型号,而且价格不贵:Gemma 4 26B A4B 每百万输入 token 0.06 美元,每百万输出 0.33 美元,以及 Gemma 4 31B 为 0.13 美元和 0.38 美元,两者都标注 262,144 token 上下文。这些是供应商标价,由我们这边原样传递,不额外加价,通过一个与 OpenAI 兼容的密钥提供,并与 200 多个其他模型并列。如果你要解决的问题是一般推理,而不是封闭集决策,那么用这两个规模中的一个来对照自建评分器进行衡量,是便宜的做法——而如果你不想绑定到单一写入方,自动故障转移能在某个提供商性能下降时,保持评分循环中生成环节的存活。

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 是您自行预配的 Foundry 部署,并不通过我们提供。本文中的任何内容都不构成对其可用性的声明,无论从哪一方来看都是如此。

最重要的一点

Microsoft-Decision-1 于 2026 年 10 月 8 日在 Microsoft Foundry 上正式发布:这是一个基于 Qwen3.5-9B 的纯文本、32,768 token 的评分器,对你列出的选项返回校准后的概率,输出 token 为零,不开放权重,也没有公布基准测试数据。Gemma 4 12B 是 2026 年 6 月 3 日以 Apache 2.0 许可发布的一个 11.96B 的无编码器多模态通用模型,能够推理、读取图像和音频,并在 256,000 token 的范围内写出答案。要根据答案的形态来选择,而不是根据参数量:封闭集合属于评分器,开放集合属于写作模型,而花钱让解码器从你已经写好的列表中进行选择,是团队花掉十倍于一次决策成本的最常见方式。

我们的目录确实收录了 Gemma 4 系列的其他型号,而且价格低廉:Gemma 4 26B A4B 的价格为每百万输入 token $0.06、每百万输出 token $0.33,而 Gemma 4 31B 则为 $0.13 和 $0.38。