为 Laya 与 Decider 对比生成的标题卡,包含本文自身的副标题,以及一行页脚,注明哪一方的数据由厂商提供,哪一方的数据来自第三方。
Engineering & Research

Laya 对战 Decider:421M 编码器对阵 35B 混合模型

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Laya和Decider都是开放权重、非自回归的决策模型,能在单次前向传播中回答有类型的问题——从给定列表中选择、按有序评分标准打分、给出是/否概率——并且它们位于规模谱系的两端。Convai Innovations于2026年9月18日以Apache 2.0发布Laya:一个面向英语的421M ModernBERT-large编码器,窗口为512个token;一个322M mmBERT-base多语言检查点,窗口为1,024个token,覆盖100+种语言;以及一个检测文字系统并分派到正确模型的路由器。Mapika的Decider系列从小型生成式基座上的decider-0.8b和decider-2b,一直延伸到decider-35b-a3b——一个约3B激活参数的35B专家混合模型。两者均可免费下载,且都返回概率而非文本。它们不能互换的原因,并不是大多数文章首先强调的准确率数字。

两个系列,同一个架构赌注

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

共同的押注是:决策并不需要一个解码循环。当生成模型被问到“这张工单是退款请求吗?”时,它必须输出 token,而一旦它开始输出 token,解析、schema 校验,以及应对它每两百次就有一次忘记花括号的重试路径,就全归你管了。Laya 和 Decider 都通过从单次前向传播中直接读出答案来跳过这一切——Laya 从双向编码器中读出,Decider 则从提示词中专用答案槽位上带字母选项 token 的 logits 中读出。

相似之处到此为止。Laya 是在一个语言路由器之后接两个小型编码器,这使它在 421M 和 322M 的参数量下获得了 512 token 的英语窗口和 1,024 token 的多语言窗口。Decider 则保留生成式主干,并在其上增加一个读出层:decider-2b 是对 Qwen3.5-2B-Base 的监督微调,随后在实时浏览器任务和精确游戏上进行校准感知的强化训练;而 decider-35b-a3b 冻结路由专家,并用 Muon 训练块矩阵。实际后果是,Decider 继承了语言模型的世界知识,而 Laya 没有。另一个后果是,Decider 也继承了语言模型的资源占用。

A screenshot of the decider-2b model card on Hugging Face, showing the Qwen3.5-2B base, the text-classification pipeline tag, the English-language tag, and the decision-model and calibrated tags for the Mapika Decider family.

Mapika 自己的文档显示,在 B300 上以 bf16 精度、批大小为 1、不使用 CUDA graphs 或编译的情况下,decider-2b 每次决策的中位数为 18ms;在同一配置下,decider-35b-a3b 为 41ms。在 GH200 上,面对大约 230 个 token 的工单上下文以及三到五个键入的问题,同一项目报告称,eager 模式下为 49ms,使用 CUDA graphs 和 torch.compile时为约 4.0ms,批大小为 32 时每秒约 1,370 次决策。这些是该项目自己撰写的文章中公布的厂商数据,而非独立测量结果。Laya 的标题数字同样是厂商公布的:在 Tesla T4 上每次决策的 p50 为 32.8ms,批大小为 10 时每个问题为 7.2ms。

校准问题,两个项目在不同尺度上对其作出回答

校准对决策模型来说才是最重要的数字,因为返回概率的全部意义就在于下游会有人据此设定阈值。这也正是直接比较 Laya 和 Decider 会误导你的地方。

Laya 在其自己的模型卡上标注的预期校准误差为 0.466,而该卡明确说明,按问题类型重新拟合温度参数可将其降至 0.081。这是一种异常诚实的披露,同时也意味着发布的检查点并非经过校准的产物。你开箱即用得到的数字就是 0.466。

Decider 报告的是完全另一套测量工具上的结果。Decision Index——一个公开排行榜,在 132,422 次请求上运行了 Jev 的每一个公开复现——将 decider-35b-a3b 排在总榜第四,得分为 54.3,落后于 Jev 的 59.5,并报告它是 32 个条目中校准最好的,校准误差为 3.1 个百分点,在声称置信度 95%+ 时的错误回答率为 0.4%。decider-2b 报告的是 8.8 个点和 0.9%。这些都是排行榜公布的数字,而 Index 的十分箱 ECE 上的 3.1 个点,与 Laya 在自己评测中得到的 0.466 并不是同一种测量。把它们并排放在一张表里,会是一个披着严谨外衣的拿苹果比橘子的错误。你能说的是,Decider 的作者选择在第三方排行榜上接受衡量,而 Laya 的作者选择自己公布其最弱的校准数字;两者都没有被对方的评测框架审计过。

各自在哪些方面胜出,逐个维度来看

• 骨干 — Laya:ModernBERT-large 421M 编码器,双向。决策器:Qwen3.5 生成式基座,0.8B 到 35B-A3B。

• 语言 — Laya:通过位于路由器之后的 322M 多语言检查点,支持 100 多种语言。Decider:仅支持英语,并已将其明确表述为一项局限。

• 上下文窗口 — Laya:英文 512 个 token,多语言 1,024 个。Decider:最多可接受 32k 输入,在 v6 世代上训练至 16k,探测至 30k。

• 选项集上限——Laya:超过约 20 个选项后急剧下降,在 Banking77 上为 0.425,而 Jev 为 0.870。决策器:Choice 可处理 2 至 255 个具名选项,Score 可处理 2 至 10 个经描述的等级。

• 零样本准确率 —— Laya:在 typed-decisions 基准测试上为 0.362,低于 0.461 的多数类基线。Decider:未作为零样本数值发布;该项目改为报告特定任务的结果。

• 校准 — Laya:出厂时 ECE 为 0.466,按问题类型重新拟合温度后降至 0.081。Decider:35B 在决策指数上得 3.1 分,为 32 个条目中的最佳成绩。

• 推理——Laya:依构造而言,无。决策者:无,已明确说明——它是一种模式匹配的读数输出,而非推理者。

• 许可证 — 两者均为 Apache 2.0。

在你选择 Decider 之前,还有一个值得了解的细节:该项目警告说,按位置从很长的 JSON 数组中挑出单条记录是一种较弱的用法,并建议通过键来定位记录。这种限制,只有实际运行它才会知道。

运行其中任何一个需要你付出多少成本

Laya 的成本画像是一个微调项目。该模型足够小,可在笔记本电脑 CPU 上运行以处理低吞吐量任务,但随附的英文检查点的零样本得分低于平凡基线,这意味着采用 Laya 就是采用构建标注集、微调并按问题类型重新拟合温度的工作。回报在于,一旦你完成了这些工作,产物就是 4.21 亿参数,并能在 T4 上以几十毫秒的速度作答。Convai 自己微调的 laya-typed-decisions 检查点在基准的训练集上达到 0.766——这个数字更多说明的是微调,而不是基础模型,模型卡上也是这么说的。

Decider 的成本结构,取决于一项服务决策。你要选择租用多少 GPU,而这个系列给了你一个真正可调的档位:2B 上 18ms,对比 35B-A3B 上 41ms——更大的模型能在 GPQA、GSM8K、CRUXEval 和 MMLU 上换来小模型所不具备的知识与推理余量。如果你的任务范围窄、标签固定,decider-2b 就是更便宜的那台机器。如果你的任务需要模型懂东西,那就得为这个混合模型付费。

OrcaRouter 的适用场景——以及不适用场景

Laya 和 Decider 都不是 OrcaRouter 上的托管模型。你需要自行下载权重并运行它们,这一点不会改变。改变的是这种模式的另一半。一个类型化决策模型几乎从来都不是整个应用:总得有什么来读取工单、总结对话线程,或起草决策所把关的回复。这另一半就是生成式调用,而这正是 OrcaRouter 所擅长的——通过一个兼容 OpenAI 的密钥接入 200 多个模型,以 0% 加价按提供商标价原样传递,因此供应商降价当天就会落到你的账单上,而不是等到下一次合同续签时。如果你正在用前沿模型的输出微调 Laya 检查点,或者在用于分诊的 decider-2b 和用于处理最难 4% 的大型模型之间进行路由,那么把生成侧放在一个端点上,就意味着决策侧和生成侧不需要两份合同和两个 SDK。自动故障转移则能覆盖大型模型正是宕机那一部分的情况。

该选哪一个

如果你的输入是多语言的、标签很少、延迟预算是在普通硬件上几十毫秒,并且你准备好进行微调——因为你将不得不这么做——那就选 Laya。如果你的输入是英语、你需要模型将一些世界知识带入决策,并且你宁愿选择模型规模而不是运行训练流水线,那就选 Decider。如果你的选项集超过二十个标签,在做出决定之前,先看看 Laya 的 Banking77 数值;如果你的输入是你按位置寻址的长 JSON 文档,在做出决定之前,先看看 Decider 声明的局限性。

真正能解决这个问题的比较——两个模型在字节完全相同的输入上、相同的提示、相同的选项顺序、相同的阈值扫描——目前还不存在。在它出现之前,诚实的立场是:Laya 拥有更优的成本曲线,Decider 拥有更好的校准证据,而且两者都还处于早期阶段,以至于你在自己数据上构建的评测,会比任何一个项目公布的数字都更有价值。

A generated two-column scoreboard comparing Laya and Decider across backbone, languages, context, zero-shot accuracy, calibration and serving, with a footer reading "Laya figures per its own model card; Decider per Mapika and the Decision Index."