Laya対von比較のために生成されたタイトルカードで、この記事自体のサブタイトルと、どちらの側の数値がベンダー報告によるものか、どちらが第三者によるものかを示すフッター行を備えている。
Engineering & Research

Laya対von:ベンダーベンチマークが移行しない場合

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

6 種類のラベルが可能なコミット種別分類タスクでは、当てずっぽうで 8.3%、von は 26.7% を記録する。同じモデルが 8.8% を記録するファイルルーティングタスクは、偶然をわずかに上回る程度だ。AUC が 0.513 の二値の変更幅タスクは、コイントスと変わらない。これらの数値は、wfzyx によるオープンソースの System One モデルである von の第三者評価から来ている。これは 2026 年 9 月 18 日に Apache 2.0 のもとでリリースされた 395M の ModernBERT-Large エンコーダーで、Convai Innovations の Laya と同じ日だった。von 自身の jabr v2 ベンチマークでは、状況は正反対だ。49 タスク、869 ケースにわたるマクロ精度 71.5%、選択ルーティング 83.4%、そして ViZDoom の結果は 18ms 未満で平均 9.38 キル、対する TypeSafe AI の Jev は 5.62 キルで約 115ms だった。どちらの数値群も本物だ。両者の隔たりは、このモデルカテゴリについて誰かが公表した中で最も有用なものであり、それは Laya にも当てはまる。

2つのモデル、2つのバックボーン、1つの共通する故障モード

von と Laya はアーキテクチャ的にごく近い隣人同士であり、だからこそ転移問題が両者を比較するための適切なレンズとなる。どちらも ModernBERT 上に構築された非自己回帰型エンコーダで、von は3億9,500万パラメータ、Laya の英語チェックポイントは4億2,100万パラメータ。どちらも同じ3つのプリミティブを公開している——choiceは提供されたリストから、scoreは順序付きルーブリック上で、noulは「はい」の較正済み確率として——そしてどちらも/v1/systemoneワイヤフォーマットを実装しているので、TypeSafe の Jev 向けに書かれたクライアントを代わりにローカルサーバーへ向けることができる。どちらも Apache 2.0。どちらもテキストではなく確率を返し、どちらにもハルシネーションを起こすデコーディングループは存在しない。

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

違いはトレーニングの経緯にあります。von は、一般ウェブテキスト、技術文献、コードの2兆トークンで事前学習され、その後、運用およびエンタープライズのワークフロー、セキュリティと DevOps、安全性とポリシーのモデレーション、言語学、トリアージ、敵対的推論にまたがる約29万例のバランスの取れたマルチドメインコーパスで微調整されました。ポストトレーニングでは、Calibration Distribution を用いた強化学習を使用し、lambda を 0.5 として交差エントロピーとブライアスコアの合成を最小化し、温度スケーリングは T=1.1692 で収束しました。Laya の英語チェックポイントは、512トークンウィンドウを持つ、typed-decision 形式向けに微調整された ModernBERT-large であり、ルーターの背後で100以上の言語をカバーする322Mの mmBERT-base 多言語チェックポイントとともに、Tesla T4 上での決定あたり p50 32.8ms を公表しています。

共通の失敗モードは、両者とも読み出しを生成するように訓練されたエンコーダであり、推論器ではないという点にある。von 自身の README は、自己回帰モデルが 500~2,000ms の遅延と非決定的なスキーマ解析エラーを引き起こすような、レイテンシに敏感なパイプラインを対象としていることを明言している。その枠組みは、それが何のためのものかを示している。高速で、決定的で、統計的に較正された分類だ。しかし、それがあなたの分類で機能するかまでは教えてくれない。そして独立したベンチマークとは、誰かが検証したときに何が起きるかを示すものだ。

von自身のベンチマークを正直に読む

jabr v2の結果は所有者によって公開されたもので、独立した監査は受けていない。また、ベンチマークの形はスコアと同じくらい重要だ。49タスク・869ケースは意思決定モデル評価として妥当な広がりであり、マクロ精度71.5%は395Mエンコーダにとって強い数字だ。ドメイン別の内訳がより情報量の多い部分で、症状トリアージは100.0%、ホームサービスは95.7%、都市ルーティングは94.7%、選択ルーティング全体は83.4%となっている。これらは訓練コーパスが中心に構築されたタスクだ—READMEはファインチューニングデータを、運用・エンタープライズワークフロー、セキュリティとDevOps、安全性とポリシーモデレーション、言語学、トリアージ、敵対的推論と説明している。症状トリアージでの高スコアは、モデルがトリアージ領域を学習したことの表明であり、分類を学習したことの表明ではない。

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

ViZDoomの結果は最も引用されるものであり、注意深く読む価値がある。「Defend the Center」で平均9.38キル、8シード、構造化シーンテキストからのゼロショット、18ms未満のレイテンシで、約115msでのJevの5.62キルに対して、+66.9%の改善。これは際立った結果であり、また、高速で反射的なポリシーがまさに適した形となる、構造化テキストによって駆動されるゲーム環境でもある。このプロジェクトによるSystem Oneパラダイムの枠組み——反射的、並列的、決定論的、統計的に較正済み——は、そのタスクが報いるものの妥当な記述である。

その後、第三者評価は von をコミット種別分類、ファイルルーティング、特徴検出、変更幅スコアリングで実行したが、そのうちいくつかではキーワードおよび正規表現のベースラインに敗れた。二値タスクにおける AUC 0.513 が最も際立つ数字だ。コイントス同然であり、しかもキャリブレーションが T=1.1692 に調整され、README ではほぼ理想的な期待キャリブレーション誤差がうたわれているモデルによるものだ。両方とも真であり得る。モデルは、学習した分布ではよくキャリブレーションされていながら、一度も見たことのない分布では役に立たないことがある。それどころか、誤った分布での良好なキャリブレーションは、明らかに悪いキャリブレーションよりも悪い。なぜなら、信頼度の数値が信頼できるように見えるからだ。

同じテストをLayaに適用した

Laya もこの種の検証の一形態を受けており、その結果は von のものと一致している。TypeSafe の typed-decisions ベンチマークでは、Laya はゼロショットで 0.362 を記録し、これはランダムの 0.318、多数クラスベースラインの 0.461 と比べて、自明な答えよりも偶然に近い。Laya 自身のモデルカードはその結論を明記している。「Laya は特化させるための高速なベースであり、ゼロショットの意思決定エンジンではない」。およそ20個の選択肢を超えると急激に劣化し、Banking77 では 0.425 を記録して、Jev の 0.870 と対照をなしている。ある第三者のテストで、100件の Mars-base urgency メッセージに対して、Jev は 100/100、Laya は 53/100 だった。ブラウザエージェントのベンチマークでは、50件のタスクのうち完了したのは0件で、33回の試行で早期に完了を宣言し、そのうち17回は何らかの行動を起こす前にそう宣言した — ただしベンチマークの著者らは、それがサポートチケットや請求書のような判断作業向けに訓練されており、ナビゲーション向けではないと注記している。これは判定ではなく適用範囲についての記述である。

Laya が von と異なるのは、自らについて何を主張するかという点だ。Convai は、見栄えのしないゼロショットの数値と、カード上に 0.466 の期待キャリブレーション誤差を、質問タイプ別の温度再フィッティングが生み出す 0.081 の隣に公表した。von の README は、見栄えのよい jabr v2 の数値と ViZDoom での勝利を公表している。どちらのプロジェクトも、自分たちが行ったことについては正直だ。ただし、モデルが振るわないベンチマークを真っ先に出すのは、そのうちの一方だけである。これは出典に関する観察であって、非難ではない——だが、公表された証拠に基づいて両者を選ぼうとしているなら、自分から弱点の数値を見せたプロジェクトと、弱点の数値をよそで探し出さなければならなかったプロジェクトを比較しているのだということを心に留めておいてほしい。

仕様の対比、次元ごとに

• バックボーン — Laya: ModernBERT-large 421M 英語、mmBERT-base 322M 多言語。von: ModernBERT-Large 395M。

• 言語 — Laya: 多言語チェックポイントとルーター経由で100以上。von: 英語、多言語チェックポイントは未公開。

• コンテキストウィンドウ — Laya:英語512トークン、多言語1,024トークン。von:同じ条件では公開されていない。jabr v2のケースは短い構造化された決定である。

• レイテンシ — Laya: T4上でp50 32.8ms、バッチ10で質問あたり7.2ms。von: 15ms未満~25ms未満と主張、ViZDoom実行では18ms未満。

• 報告された精度 — Laya: 0.362 ゼロショット、ベンチマーク自身の分割で微調整して 0.766、Banking77 では 0.425。von: jabr v2 の 49 タスク全体でマクロ平均 71.5%、チョイスルーティング 83.4%、独立テストでのコミットタイプでは 26.7%。

• キャリブレーション — Laya: ECE は出荷時 0.466、質問タイプ別の温度再フィッティング後 0.081。von: RLCD 事後学習中に温度を T=1.1692 にスケーリングし、自身の分布上でほぼ理想的な ECE を主張。

• サービング — Laya: pip install laya、さらに ONNX、Go、Apple MLX のコミュニティポート。von: Python および TypeScript SDK、HTTP サーバーは von serve で利用可能、チケットトリアージ、メールセキュリティ、モデレーション、セキュリティイベントトリアージ用のプリセットを同梱。

• ハードウェア — Laya: CPU、CUDA、Apple MPS。von: NVIDIA CUDA、AMD ROCm、Apple Silicon MPS、マルチスレッドCPU。

• ライセンス — 両方とも Apache 2.0。

vonの genuinely distinctiveな部分

von のコンポーザブルパターンは、そのリポジトリで最も議論されていないものだ。信頼度ゲート、ルートディスパッチ、複合スコアリング、二段階ルーティングは、プリセット——チケットトリアージ、メールセキュリティ、モデレーション、セキュリティイベントトリアージ——と並んで名前付きパターンとして提供されており、意思決定モデルが本番環境で実際に必要とするアーキテクチャを体現している。単一の choice呼び出しがシステム全体であることはほとんどない。有用な形は、安価な第一段ルーターが特化した第二段へディスパッチし、不確実なケースをエスカレーションする信頼度ゲートを備えたものだ。von はそれを、あなたに任せるのではなく、文書化されたパターンとして提供している。

それは、生成側でOrcaRouterが行っていることとすっきり対応します。このパターンの二つの半分は通常、別々のチームによって構築されるので、これは率直に言っておく価値があります。vonもLayaもOrcaRouter上でホストされているわけではありません——どちらもダウンロードして実行する重みであり、ここにあるものを当社がそれらを提供しているという主張として読むべきではありません。当社のリストに載っているのはもう一方の半分です。単一のOpenAI互換キーの背後にある200以上の生成モデルを、プロバイダー定価を0%のマークアップでそのまま通して提供しており、それによりベンダーの値下げは更新時ではなく同じ日に請求書へと反映されます。vonの確信度ゲートがリクエストの4%にフロンティアモデルが必要だと判断した場合、ルーティングDSLがその判断を、二つの契約と二つのSDKではなく単一の呼び出しへと組み上げ、自動フェイルオーバーが、高コストな分岐が単一障害点になるのを防ぎます。

両方とも訓練分布外では失敗する2つのモデルをどう扱うか

von評価から得られる実用的な結論は、vonが悪いモデルだということではない。それは、意思決定モデルが公表する精度とは、その学習分布についての主張であり、自分の問題がその分布の内側にあるかどうかを知る唯一の方法は、テストすることだ、ということだ。von自身のREADMEベンチマーク表は、サイズ、精度、レイテンシ、ホスティングの点で、GLiNER2、ファインチューニングされたQwen3.5 4B、Laya、TypeSafeのJevと自身を比較している——これは役に立つ表であり、同時に、1つを除くすべての精度項目が著者自身のハーネスから来ている表でもある。

二つを比べるなら:より広範な公開ドメイン群、わずかに小さいフットプリント、トリアージとモデレーション向けに事前構築されたサービングパターン、そして高速な構造化テキスト判断をうまく扱うという ViZDoom の証拠が欲しいなら、von を選べ。多言語入力が必要なら Laya を選べ — von には多言語チェックポイントがなく、Laya の 322M mmBERT バリアントは 100 以上の言語をカバーしている — あるいは 32.8ms T4 の数値と 512 トークンの英語ウィンドウが自分のワークロードに合うなら。自分のトラフィックから数百例にラベルを付けて午後を費やし、両方をそれらに対して実行するのでなければ、どちらも選ぶな。両プロジェクト自身のドキュメントがその実験を指し示しているし、von のサードパーティ結果は、誰もそれを実行しなかったときに起きることだ。

この比較を変える唯一のものは、同一入力に対するペア評価と、各モデルの信頼性ダイアグラムだ。それは存在しない。それが存在するまでは、正直な順位付けはスコアではなく証拠の質による。Layaは自らの最悪の数値を公表し、vonは自らの最良の数値を公表しており、vonの独立したテストが、どちらにとっても外部チェックに最も近いものだ。

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."