
Laya 与 von:当供应商基准不适用时
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
一项提交类型分类任务有六个可能标签,瞎猜能得 8.3%,而 von 得 26.7%。一项文件路由任务中,同一个模型得 8.8%,仅略高于随机水平。一项二元变更广度任务的 AUC 为 0.513,基本等于抛硬币。这些数字来自第三方对 von 的评估——wfzyx 的开源 System One 模型,一个 395M 的 ModernBERT-Large 编码器,于 2026 年 9 月 18 日以 Apache 2.0 许可发布,与 Convai Innovations 的 Laya 是同一天。在 von 自己的 jabr v2 基准上,情况正相反:跨 49 项任务、869 个用例的宏平均准确率为 71.5%,选择路由为 83.4%,ViZDoom 结果为平均击杀 9.38,延迟低于 18ms,而 TypeSafe AI 的 Jev 为 5.62 击杀、约 115ms。这两组数字都是真实的。它们之间的差距,是任何人就这一模型类别发表过的最有用的东西,而这也适用于 Laya。
两个模型,两个骨干网络,一个共同的失效模式
von 与 Laya 在架构上是近邻,这正是迁移问题成为比较二者合适视角的原因。二者都是基于 ModernBERT 构建的非自回归编码器:von 有 395M 参数,Laya 的英文检查点为 421M。二者都暴露同样的三个原语——choice从给定列表中选择,score对有序评分标准打分,noul作为校准后的"是"的概率——并且二者都实现/v1/systemone线路格式,因此为 TypeSafe 的 Jev 编写的客户端可以改为指向本地服务器。二者均为 Apache 2.0。二者返回的是概率而非文本,且都没有可供产生幻觉的解码循环。

差异在于训练过程。von 在 2 万亿 token 的通用网络文本、技术文献和代码上进行了预训练,随后在一个约 29 万条示例的平衡多领域语料库上进行了微调,该语料库涵盖运营与企业工作流、安全与 DevOps、安全与政策审核、语言学、分诊以及对抗性推理。后训练使用了 Reinforcement Learning with Calibration Distribution,最小化交叉熵与 Brier 分数的复合目标,lambda 为 0.5,温度缩放收敛于 T=1.1692。Laya 的英语检查点是针对类型化决策形态微调的 ModernBERT-large,具有 512 token 窗口;同时还有一个 322M 的 mmBERT-base 多语言检查点,通过路由器覆盖 100 多种语言,并公布了在 Tesla T4 上每次决策的 p50 为 32.8ms。
共同的失败模式在于,两者都是被训练来产生读出结果的编码器,而不是推理器。von 自己的 README 明确表示,它面向的是延迟敏感的流水线,在这些场景中,自回归模型会引入 500–2,000ms 的延迟以及非确定性的 schema 解析错误。这种定位说明了它的用途:快速、确定性、经统计校准的分类。它并没有告诉你它能在你的分类任务上奏效,而独立基准测试就是有人去验证时会发生的事。
诚实地阅读 von 自己的基准
jabr v2 的结果由所有者发布,尚未经过独立审计,而基准的形态与分数同样重要。四十九项任务和 869 个案例对于决策模型评估来说是合理的广度,而 71.5% 的宏准确率对于 395M 编码器来说是一个强劲的数字。按领域细分才是真正提供信息的地方:症状分诊为 100.0%,家庭服务为 95.7%,城市路线规划为 94.7%,选择路线规划总体为 83.4%。这些正是训练语料库围绕构建的任务——README 将微调数据描述为运营与企业工作流、安全与 DevOps、安全与政策审核、语言学、分诊以及对抗性推理。症状分诊上的高分表明模型学会了分诊领域,而不是学会了分类。

ViZDoom 的结果是被引用得最多的一个,值得仔细一读。在“Defend the Center”中,基于结构化场景文本的零样本设置下,八个随机种子、延迟低于 18 毫秒,平均击杀数为 9.38;相比之下,Jev 在约 115 毫秒延迟下取得 5.62 次击杀——提升幅度为 +66.9%。这是一个引人注目的结果,而且它也是一个由结构化文本驱动的游戏环境,在这种环境中,快速反射式策略正是恰好合适的形态。该项目对 System One 范式的界定——反射式、并行、确定性、经统计校准——恰如其分地描述了该任务所奖励的内容。
随后,第三方评估在提交类型分类、文件路由、特征检测和变更广度评分上对 von 进行了测试,而在其中一些任务上,它输给了关键词和正则表达式基线。二分类任务上 0.513 的 AUC 是最刺眼的数字:一次抛硬币,来自一个校准被调到 T=1.1692,且 README 声称预期校准误差接近理想的模型。这两件事可以同时成立。一个模型可以在自己训练所基于的分布上校准良好,却在一个从未见过的分布上毫无用处——而事实上,在错误的分布上拥有良好的校准,比明显糟糕的校准更糟,因为那些置信度数值看起来值得信赖。
对Laya进行了同样的测试
Laya 也经历过类似的处理,结果与 von 的一致。在 TypeSafe 的 typed-decisions 基准测试中,Laya 的零样本得分为 0.362,而随机为 0.318,多数类基线为 0.461——更接近随机猜测,而不是那个平凡答案。它自己的模型卡给出了结论:“Laya 是一个可快速专精的基座,而不是零样本决策引擎。”当选项超过大约二十个时,它的表现急剧下降,在 Banking77 上得分为 0.425,而 Jev 为 0.870。在一项第三方测试中,针对 100 条 Mars-base 紧急消息,Jev 得分 100/100,Laya 得分 53/100。在一个浏览器代理基准测试中,它完成了 50 项任务中的 0 项,在 33 次尝试中过早宣称完成,其中 17 次是在采取任何行动之前——不过基准测试作者指出,它是为支持工单和发票之类的判断性工作训练的,而非导航,这是一种范围声明,而不是裁决。
Laya 与 von 的不同之处,在于它为自己标榜了什么。Convai 在模型卡上公布了对自身不利的零样本数值和 0.466 的期望校准误差,紧挨着按问题类型进行温度重拟合所产生的 0.081。von 的 README 公布了讨喜的 jabr v2 数值和 ViZDoom 的胜绩。两个项目都对自己做了什么很诚实;但只有一个把模型表现糟糕的基准放在最显眼的位置。这是对信息来源的观察,而非指控——但如果你要根据已公开的证据在两者之间做选择,请注意,你是在把一个向你展示了自己弱项数值的项目,与一个其弱项数值需要你到别处寻找的项目作比较。
规格对比,逐维度进行
• 骨干网络 —— Laya:ModernBERT-large 421M 英语,mmBERT-base 322M 多语言。von:ModernBERT-Large 395M。
• 语言 — Laya:通过多语言检查点和路由器支持 100+ 种语言。von:仅英语,未发布多语言检查点。
• 上下文窗口 — Laya:英文 512 个 token,多语言 1,024 个。von:未以相同条款发布;jabr v2 案例是简短的结构化裁决。
• 延迟 — Laya:在 T4 上 p50 为 32.8ms,批大小为 10 时每个问题 7.2ms。von:声称低于 15ms 至低于 25ms,在 ViZDoom 运行中低于 18ms。
• 报告的准确率 — Laya:零样本 0.362,在基准自身划分上微调后为 0.766,在 Banking77 上为 0.425。von:在 jabr v2 的 49 项任务上宏平均为 71.5%,选择路由为 83.4%,在独立测试中的提交类型上为 26.7%。
• 校准 — Laya:发布时 ECE 为 0.466,按问题类型重新拟合温度后为 0.081。von:在 RLCD 后训练期间将温度缩放至 T=1.1692,声称在其自身分布上 ECE 接近理想值。
• 服务 — Laya:pip install laya,以及 ONNX、Go 和 Apple MLX 社区移植版。von:Python 和 TypeScript SDK、一个通过von serve提供的 HTTP 服务器,以及用于工单分类、电子邮件安全、内容审核和安全事件分类的预打包预设。
• 硬件 — Laya:CPU、CUDA 和 Apple MPS。von:NVIDIA CUDA、AMD ROCm、Apple Silicon MPS 和多线程 CPU。
• 许可证 — 两者均为 Apache 2.0。
von 真正独特的那部分
von 的可组合模式是其仓库中最被低估的内容。置信度门控、路由分发、复合评分和两阶段路由都与预设一起作为具名模式发布——工单分诊、邮件安全、内容审核、安全事件分诊——它们编码了决策模型在生产中真正需要的架构。choice 调用很少能构成整个系统;真正有用的形态是一个廉价的第一阶段路由器,它分发到专门的第二阶段,并通过置信度门控对不确定的案例进行升级。von 把这作为有文档记录的模式发布出来,而不是留给你自己去实现。
这与 OrcaRouter 在生成式一侧所做的工作完全对应,这一点值得直白说明,因为该模式的两半通常由不同的团队构建。von 和 Laya 都不托管在 OrcaRouter 上——二者都是你自行下载并运行的权重——本文任何内容都不应被理解为我们在提供它们。在我们清单上的是另一半:200 多个生成式模型,通过一个与 OpenAI 兼容的密钥访问,按提供商标价原样传导,0% 加价,因此厂商降价当天就能反映到你的账单上,而不必等到续约时。如果 von 的置信度门控判定 4% 的请求需要前沿模型,那么路由 DSL 就是把这一决策组合成一次调用,而不是两份合同和两套 SDK;自动故障转移则确保这条昂贵分支不会成为单点故障。
两个模型在各自的训练分布之外都会失败,该怎么办
从 von 评估中得出的实际结论并不是 von 是一个糟糕的模型。而是:一个决策模型所公布的准确率,是对其训练分布的一种断言;而要知道你的问题是否位于该分布之内,唯一的方法就是去测试它。von 自己的 README 基准表在模型大小、准确率、延迟和托管方面,将自身与 GLiNER2、一个经微调的 Qwen3.5 4B、Laya 以及 TypeSafe 的 Jev 进行比较——这是一张有用的表,同时也是一张除了一项之外、所有准确率条目都来自作者自己评测框架的表。
在两者之间:如果你想要更广泛的已发布领域集合、略小的资源占用、用于分诊和审核的预构建服务模式,以及 ViZDoom 证据表明它能很好地处理快速结构化文本决策,那就选 von。如果你需要多语言输入——von 没有多语言检查点,而 Laya 的 322M mmBERT 变体覆盖 100 多种语言——或者如果 T4 上 32.8 毫秒的成绩和 512 token 的英文窗口适合你的工作负载,那就选 Laya。除非你花一个下午从自己的流量中标注几百个样本,并让两者都在这些样本上跑一遍,否则两个都别选。两个项目各自的文档都指向这个实验,而 von 的第三方结果就是没人跑这个实验时会发生的事。
唯一能改变这一比较的,是在完全相同的输入上进行配对评测,并为每个模型附上一张可靠性图。而这样的评测并不存在。在它出现之前,诚实的排名依据应是证据质量,而非分数:Laya 公布了它最差的数字,von 公布了它最好的数字,而对 von 的独立测试则是二者之中最接近于外部核查的东西。

