为 Laya 与 von 对比生成的标题卡,带有本文自己的副标题,以及一行页脚,标明哪一方的数据由厂商自报,哪一方的数据来自第三方。
Engineering & Research

Laya 与 von:当供应商基准不适用时

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

一项提交类型分类任务有六个可能标签,瞎猜能得 8.3%,而 von 得 26.7%。一项文件路由任务中,同一个模型得 8.8%,仅略高于随机水平。一项二元变更广度任务的 AUC 为 0.513,基本等于抛硬币。这些数字来自第三方对 von 的评估——wfzyx 的开源 System One 模型,一个 395M 的 ModernBERT-Large 编码器,于 2026 年 9 月 18 日以 Apache 2.0 许可发布,与 Convai Innovations 的 Laya 是同一天。在 von 自己的 jabr v2 基准上,情况正相反:跨 49 项任务、869 个用例的宏平均准确率为 71.5%,选择路由为 83.4%,ViZDoom 结果为平均击杀 9.38,延迟低于 18ms,而 TypeSafe AI 的 Jev 为 5.62 击杀、约 115ms。这两组数字都是真实的。它们之间的差距,是任何人就这一模型类别发表过的最有用的东西,而这也适用于 Laya。

两个模型,两个骨干网络,一个共同的失效模式

von 与 Laya 在架构上是近邻,这正是迁移问题成为比较二者合适视角的原因。二者都是基于 ModernBERT 构建的非自回归编码器:von 有 395M 参数,Laya 的英文检查点为 421M。二者都暴露同样的三个原语——choice从给定列表中选择,score对有序评分标准打分,noul作为校准后的"是"的概率——并且二者都实现/v1/systemone线路格式,因此为 TypeSafe 的 Jev 编写的客户端可以改为指向本地服务器。二者均为 Apache 2.0。二者返回的是概率而非文本,且都没有可供产生幻觉的解码循环。

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

差异在于训练过程。von 在 2 万亿 token 的通用网络文本、技术文献和代码上进行了预训练,随后在一个约 29 万条示例的平衡多领域语料库上进行了微调,该语料库涵盖运营与企业工作流、安全与 DevOps、安全与政策审核、语言学、分诊以及对抗性推理。后训练使用了 Reinforcement Learning with Calibration Distribution,最小化交叉熵与 Brier 分数的复合目标,lambda 为 0.5,温度缩放收敛于 T=1.1692。Laya 的英语检查点是针对类型化决策形态微调的 ModernBERT-large,具有 512 token 窗口;同时还有一个 322M 的 mmBERT-base 多语言检查点,通过路由器覆盖 100 多种语言,并公布了在 Tesla T4 上每次决策的 p50 为 32.8ms。

共同的失败模式在于,两者都是被训练来产生读出结果的编码器,而不是推理器。von 自己的 README 明确表示,它面向的是延迟敏感的流水线,在这些场景中,自回归模型会引入 500–2,000ms 的延迟以及非确定性的 schema 解析错误。这种定位说明了它的用途:快速、确定性、经统计校准的分类。它并没有告诉你它能在你的分类任务上奏效,而独立基准测试就是有人去验证时会发生的事。

诚实地阅读 von 自己的基准

jabr v2 的结果由所有者发布,尚未经过独立审计,而基准的形态与分数同样重要。四十九项任务和 869 个案例对于决策模型评估来说是合理的广度,而 71.5% 的宏准确率对于 395M 编码器来说是一个强劲的数字。按领域细分才是真正提供信息的地方:症状分诊为 100.0%,家庭服务为 95.7%,城市路线规划为 94.7%,选择路线规划总体为 83.4%。这些正是训练语料库围绕构建的任务——README 将微调数据描述为运营与企业工作流、安全与 DevOps、安全与政策审核、语言学、分诊以及对抗性推理。症状分诊上的高分表明模型学会了分诊领域,而不是学会了分类。

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

ViZDoom 的结果是被引用得最多的一个,值得仔细一读。在“Defend the Center”中,基于结构化场景文本的零样本设置下,八个随机种子、延迟低于 18 毫秒,平均击杀数为 9.38;相比之下,Jev 在约 115 毫秒延迟下取得 5.62 次击杀——提升幅度为 +66.9%。这是一个引人注目的结果,而且它也是一个由结构化文本驱动的游戏环境,在这种环境中,快速反射式策略正是恰好合适的形态。该项目对 System One 范式的界定——反射式、并行、确定性、经统计校准——恰如其分地描述了该任务所奖励的内容。

随后,第三方评估在提交类型分类、文件路由、特征检测和变更广度评分上对 von 进行了测试,而在其中一些任务上,它输给了关键词和正则表达式基线。二分类任务上 0.513 的 AUC 是最刺眼的数字:一次抛硬币,来自一个校准被调到 T=1.1692,且 README 声称预期校准误差接近理想的模型。这两件事可以同时成立。一个模型可以在自己训练所基于的分布上校准良好,却在一个从未见过的分布上毫无用处——而事实上,在错误的分布上拥有良好的校准,比明显糟糕的校准更糟,因为那些置信度数值看起来值得信赖。

对Laya进行了同样的测试

Laya 也经历过类似的处理,结果与 von 的一致。在 TypeSafe 的 typed-decisions 基准测试中,Laya 的零样本得分为 0.362,而随机为 0.318,多数类基线为 0.461——更接近随机猜测,而不是那个平凡答案。它自己的模型卡给出了结论:“Laya 是一个可快速专精的基座,而不是零样本决策引擎。”当选项超过大约二十个时,它的表现急剧下降,在 Banking77 上得分为 0.425,而 Jev 为 0.870。在一项第三方测试中,针对 100 条 Mars-base 紧急消息,Jev 得分 100/100,Laya 得分 53/100。在一个浏览器代理基准测试中,它完成了 50 项任务中的 0 项,在 33 次尝试中过早宣称完成,其中 17 次是在采取任何行动之前——不过基准测试作者指出,它是为支持工单和发票之类的判断性工作训练的,而非导航,这是一种范围声明,而不是裁决。

Laya 与 von 的不同之处,在于它为自己标榜了什么。Convai 在模型卡上公布了对自身不利的零样本数值和 0.466 的期望校准误差,紧挨着按问题类型进行温度重拟合所产生的 0.081。von 的 README 公布了讨喜的 jabr v2 数值和 ViZDoom 的胜绩。两个项目都对自己做了什么很诚实;但只有一个把模型表现糟糕的基准放在最显眼的位置。这是对信息来源的观察,而非指控——但如果你要根据已公开的证据在两者之间做选择,请注意,你是在把一个向你展示了自己弱项数值的项目,与一个其弱项数值需要你到别处寻找的项目作比较。

规格对比,逐维度进行

• 骨干网络 —— Laya:ModernBERT-large 421M 英语,mmBERT-base 322M 多语言。von:ModernBERT-Large 395M。

• 语言 — Laya:通过多语言检查点和路由器支持 100+ 种语言。von:仅英语,未发布多语言检查点。

• 上下文窗口 — Laya:英文 512 个 token,多语言 1,024 个。von:未以相同条款发布;jabr v2 案例是简短的结构化裁决。

• 延迟 — Laya:在 T4 上 p50 为 32.8ms,批大小为 10 时每个问题 7.2ms。von:声称低于 15ms 至低于 25ms,在 ViZDoom 运行中低于 18ms。

• 报告的准确率 — Laya:零样本 0.362,在基准自身划分上微调后为 0.766,在 Banking77 上为 0.425。von:在 jabr v2 的 49 项任务上宏平均为 71.5%,选择路由为 83.4%,在独立测试中的提交类型上为 26.7%。

• 校准 — Laya:发布时 ECE 为 0.466,按问题类型重新拟合温度后为 0.081。von:在 RLCD 后训练期间将温度缩放至 T=1.1692,声称在其自身分布上 ECE 接近理想值。

• 服务 — Laya:pip install laya,以及 ONNX、Go 和 Apple MLX 社区移植版。von:Python 和 TypeScript SDK、一个通过von serve提供的 HTTP 服务器,以及用于工单分类、电子邮件安全、内容审核和安全事件分类的预打包预设。

• 硬件 — Laya:CPU、CUDA 和 Apple MPS。von:NVIDIA CUDA、AMD ROCm、Apple Silicon MPS 和多线程 CPU。

• 许可证 — 两者均为 Apache 2.0。

von 真正独特的那部分

von 的可组合模式是其仓库中最被低估的内容。置信度门控、路由分发、复合评分和两阶段路由都与预设一起作为具名模式发布——工单分诊、邮件安全、内容审核、安全事件分诊——它们编码了决策模型在生产中真正需要的架构。choice 调用很少能构成整个系统;真正有用的形态是一个廉价的第一阶段路由器,它分发到专门的第二阶段,并通过置信度门控对不确定的案例进行升级。von 把这作为有文档记录的模式发布出来,而不是留给你自己去实现。

这与 OrcaRouter 在生成式一侧所做的工作完全对应,这一点值得直白说明,因为该模式的两半通常由不同的团队构建。von 和 Laya 都不托管在 OrcaRouter 上——二者都是你自行下载并运行的权重——本文任何内容都不应被理解为我们在提供它们。在我们清单上的是另一半:200 多个生成式模型,通过一个与 OpenAI 兼容的密钥访问,按提供商标价原样传导,0% 加价,因此厂商降价当天就能反映到你的账单上,而不必等到续约时。如果 von 的置信度门控判定 4% 的请求需要前沿模型,那么路由 DSL 就是把这一决策组合成一次调用,而不是两份合同和两套 SDK;自动故障转移则确保这条昂贵分支不会成为单点故障。

两个模型在各自的训练分布之外都会失败,该怎么办

从 von 评估中得出的实际结论并不是 von 是一个糟糕的模型。而是:一个决策模型所公布的准确率,是对其训练分布的一种断言;而要知道你的问题是否位于该分布之内,唯一的方法就是去测试它。von 自己的 README 基准表在模型大小、准确率、延迟和托管方面,将自身与 GLiNER2、一个经微调的 Qwen3.5 4B、Laya 以及 TypeSafe 的 Jev 进行比较——这是一张有用的表,同时也是一张除了一项之外、所有准确率条目都来自作者自己评测框架的表。

在两者之间:如果你想要更广泛的已发布领域集合、略小的资源占用、用于分诊和审核的预构建服务模式,以及 ViZDoom 证据表明它能很好地处理快速结构化文本决策,那就选 von。如果你需要多语言输入——von 没有多语言检查点,而 Laya 的 322M mmBERT 变体覆盖 100 多种语言——或者如果 T4 上 32.8 毫秒的成绩和 512 token 的英文窗口适合你的工作负载,那就选 Laya。除非你花一个下午从自己的流量中标注几百个样本,并让两者都在这些样本上跑一遍,否则两个都别选。两个项目各自的文档都指向这个实验,而 von 的第三方结果就是没人跑这个实验时会发生的事。

唯一能改变这一比较的,是在完全相同的输入上进行配对评测,并为每个模型附上一张可靠性图。而这样的评测并不存在。在它出现之前,诚实的排名依据应是证据质量,而非分数:Laya 公布了它最差的数字,von 公布了它最好的数字,而对 von 的独立测试则是二者之中最接近于外部核查的东西。

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."