「Jev vs Laya」と書かれた生成タイトルカードが、副題「T4上で33ミリ秒、そしてランダムベースライン」の上に置かれ、Jev(クローズド、ホスト型、ゼロショット意思決定エンジン、0.727)とLaya(Apache 2.0、421M ModernBERT、ローカルで動作、0.362ゼロショット)を対比している。
Engineering & Research

Jev 対 Laya:T4 での33ミリ秒、そしてランダムベースライン

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Layaのモデルカードには、この比較を決定づける一文が含まれており、それはLayaを作った人々によって書かれた。「Layaは特化するための高速な基盤であり、ゼロショットの意思決定エンジンではない。」Convai Innovationsは、TypeSafe AIがJevをリリースしてから3日後の2026年9月18日に、Apache 2.0の下でLayaをリリースし、重みはHugging Faceで公開しており、そしてpip install layaというエントリポイントを備えている。Layaは、トークン単位のデコーディングを行わず、単一のフォワードパスで型付きの質問に答える。これはJevが賭けたのと同じアーキテクチャ上の賭けだ。目玉の主張は、Tesla T4上で1意思決定あたりp50レイテンシ32.8ミリ秒というもので、Jevがホスト型APIを通じて公表しているp50 236–276msよりも約7.8倍高速だと位置づけられている。この主張は本物であり、同時に2つの異なるものを測定している——ローカルGPUとネットワーク呼び出し——そして、その下にある精度の姿こそが、ダウンロードすべきかどうかを決める部分である。ゼロショットで、LayaはTypeSafeの型付き意思決定ベンチマークで0.362を記録する。ランダム推測は0.318。多数クラスベースラインは0.461。Layaは、そのままでは、取るに足らないベースラインよりもランダムに近い。

Layaとは実際に何なのか

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability per answer, free output, and the roughly 32,000-token request budget.

Laya は、各入力を適切なチェックポイントへと振り分ける組み込みルーターの背後に、2 つのチェックポイントとして搭載されています。英語用チェックポイントは ModernBERT-large で、4 億 2,100 万パラメータ、コンテキスト長は 512 トークンです。多言語版は mmBERT-base で、3 億 2,200 万パラメータ、100 以上の言語にわたる 1,024 トークンのウィンドウを持ちます。どちらも非自己回帰型です。1 回のフォワードパスが答えを返すため、デコードループも、解析すべき JSON も、宣言された型の外にテキストを出力する余地もありません。この最後の性質は、Jev が提供するものと同じ構造的保証であり、別の方向から到達したものです。そして、時折中括弧を閉じ忘れるモデルをめぐってリトライロジックを書いたことがある人にとって、これは真に価値のあるものです。

Jevはクローズドな対となるモデルだ。TypeSafe AI初のSystem Oneモデルで、2026年9月15日に提供開始され、ホスト型かつ早期アクセスであり、3つの型付きプリミティブを備える——自分で用意したリストからのChoice、順序付きルーブリック上のScore、そして較正済み確率を伴うはい/いいえの主張であるNoul。すべての質問は、状態の単一の共有読み取りに対して並列に評価され、出力トークンが存在しないため出力は無料で、入力は100万トークンあたり0.042ドル。そのアーキテクチャ、パラメータ数、学習コンピュートは非公開で、TypeSafeは詳細を胸に秘めており、論文は後日になる可能性があると述べている。

適切に測定されたレイテンシの主張

Laya の T4 上での 32.8ms p50 は実測値であり、良好な値です。Jev の 236–276ms との 7.8 倍比較は注意が必要な箇所であり、Laya 自身のカードはその理由について異例なほど正直です。Jev の数値は Convai が自ら測定したことのない第三者公開の数値であり、この比較はローカル GPU のフォワードパスと、ネットワーク往復やキューイングを含むホスト型 API 呼び出しを対比させています。ネットワークを除外すれば、アーキテクチャ比較は 2 つのシングルパスモデル、すなわち 421M パラメータのものと、TypeSafe がこれまで公表したことのない非公開サイズのものとの間の比較になります。

知っておく価値のあるバッチ数もあります。バッチ10では、Layaは質問あたり7.2msを報告しています。それがこの製品の姿です。Layaはローカルで大量に実行されるように作られており、laya-mlxのようなオンデバイスのコミュニティポートがそれをApple Siliconへ広げています。「Jevより50倍速い」という拡散した主張は、プロジェクト自身が公開したベンチマークでは裏付けられていません。正直に位置づけるなら、ローカル対クラウドの大きな隔たりであり、その隔たりは一部がアーキテクチャによるもので、一部は単にあなたのGPUと誰か他の人のAPIとの違いにすぎません。

精度の数値が順に語るもの

ここから比較は好意的なものではなくなる。順序が重要であるため、順を追って示す価値がある。

• TypeSafeのtyped-decisionsベンチマークにおけるゼロショット:Laya 0.362、ランダム 0.318、多数派クラス 0.461、Jev 0.727。Layaはチャンス水準を上回っているが、自明なベースラインは下回っている。

• ベンチマーク自体の訓練用分割でファインチューニング済み — Laya 0.766 対 Jev 0.727。Laya が勝利し、その勝利はベンチマークの訓練データを見てきたチェックポイントによるものである。したがってこれはベースモデルについてではなく、ファインチューニングについての主張である。

• Banking77 の意図分類。ここでは選択肢セットが大規模です — Laya は 0.425 に対し、Jev は 0.870。Laya はおおよそ 20 個の選択肢を超えると急激に性能が低下し、Jev の Choice フィールドは、2 段階スコアリングパターンが必要になる前に最大 255 個まで扱えることが文書化されています。

• キャリブレーション — Laya は平均期待キャリブレーション誤差 0.466 で提供され、質問タイプ別の温度再フィッティングを行った後に初めて 0.081 に改善する。Jev は、TypeSafe が RLCD(Reinforcement Learning for Calibrated Decisions、較正された意思決定のための強化学習)と呼ぶ手法で訓練されており、すべての回答を確率分布とともに提供する。ただし TypeSafe は、ユーザーに対し自身のラベル付きデータでしきい値を検証するようも促しており、ある独立監査では Jev のキャリブレーションがタスクによって大きく変動することが判明した。

パターンは明白だ。Layaはファインチューニングの強力な基盤であり、ゼロショットの意思決定エンジンとしては弱い。そしてLaya自身がそう言っている。Jevは強力なゼロショット意思決定エンジンだが、そのキャリブレーションはデプロイごとに確認する必要がまだある。これらは価格体系の異なる別々の製品であり、どちらを選ぶかは主に、ラベル付きデータとトレーニングループがあるかどうかの問題だ。

コストの計算はJevのものと同じ形ではない

Jevは入力トークン100万個あたり$0.042で、出力は無料です。つまり10億個あたり$42に相当し、文書化されている約32,000トークンのリクエスト予算での最大サイズの呼び出しは、1セントを大きく下回るコストです。Everyの独立したテストでは、37件の文書にわたる777件の判定が約0.25セントでした。

Layaのコールあたりのコストは限界的にはゼロであり、総計では非ゼロであり、その総計は小さくない。T4上の421Mパラメータモデルは実行が安価で、それでもGPUを1台消費する。そしてLayaを競争力のあるものにするファインチューニングの工程こそが本当の出費の所在である——データのラベリング、トレーニングの実行、評価ハーネス、そしてキャリブレーション誤差を0.466から0.081へと改善する、質問タイプごとの温度パラメータの再フィッティング。決して変化しない固定されたタクソノミーにとって、それはボリュームで回収できる一回限りのコストである。ドリフトするタクソノミーにとって、それは繰り返し発生するコストであり、Jevの0.727というゼロショットベースラインは、はるかに良い取引になる。

見落としやすい3つ目のコストがあります。Layaの英語チェックポイントのコンテキストウィンドウは512トークンです。これはコンテキスト予算が小さい意思決定モデルではなく、段落向けのサイズの意思決定モデルです。Jevの約32,000トークンのリクエスト予算はその60倍で、それでも両者の価格設定の基準となっている生成モデルよりは一桁小さいです。あなたの状態がサポートメッセージではなくサポートスレッドなら、どちらのモデルのウィンドウも、あなたが最適化すべき制約ではありません。

本当の違いはデプロイの問いにある

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window and the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 on a T4, and the pip install entry point.

Layaの最も強い論拠はレイテンシではない。Apache 2.0の重みがHugging Face上にあるということは、意思決定があなたのインフラストラクチャから決して出ていかず、エンドポイントにレート制限が決してかからないという点だ。医療記録、法律文書、顧客の口座履歴に基づいて行われるルーティング判断にとって、それは好みではない——決定的要因であり、どんな価格のホスト型エンドポイントもその論拠には勝てない。TypeSafeのJevは早期アクセスで順番待ちであり、そのドキュメント自体が、レート制限は予告なく変更される可能性があると記している。

反論は、あなたが何を犠牲にするかにある。Jevの非公開のより大きなアーキテクチャは、Layaの421Mパラメータにはできない仕事を担っている。ゼロショットのギャップ0.727対0.362と、Banking77のギャップ0.870対0.425は、どちらも訓練する前にモデル内部にどれだけの知識が存在するかを測る指標だ。Layaの答えは、その知識をファインチューニングによって自分で供給するというもので、狭く固定されたドメインではその答えは機能する——0.766というファインチューニング後の結果が証拠だ。

意思決定レイヤーは実際のスタックのどこに位置するのか

どちらのモデルもテキストを生成しないため、どちらもあらゆるワークフローの全体を担うものではありません。両者が想定しているパターンは2つのモデル、すなわち型付きの呼び出しを行う意思決定レイヤーと、文章・コード・説明を要する部分を担う生成モデルです。OrcaRouter は Jev や Laya を提供しているわけではありません — Jev は TypeSafe のアーリーアクセス用エンドポイントで、Laya は自分で動かすウェイトです — しかし、このパターンの生成側こそがまさに当社がカバーしている部分です。1つの OpenAI 互換キーの背後に 200 以上のモデルを、プロバイダーの定価をそのまま 0% のマークアップで、ベンダーの価格変更は同日に当社側にも反映されます。この2モデル構成は、2つ目のベンダー契約なしで検証でき、自動フェイルオーバーによって、安価な意思決定レイヤーが自動化に耐えうるほど適切に調整されているかを見極めている間も、生成側のパスが単一障害点になることはありません。

評決

固定された狭い分類体系とラベル付きの例があり、ホスト型APIを排除するプライバシーまたはレイテンシの要件があるなら、Layaのほうがより正当化しやすい選択であり、ファインチューニング後の数値もそれを裏付けている。その意思決定をすぐにそのまま使える形で機能させる必要があるなら、オプションセットが20カテゴリを超えるなら、あるいは状態が一段落より長いなら、Laya自身のモデルカードが、それはその用途向けの製品ではないと告げている——そして、多数派ベースライン0.461に対するゼロショットスコア0.362こそ、誰かが7.8倍のレイテンシの数字をあなたに持ち出すときに見据えておくべき数字だ。

両者に共通する点は、両者を分ける点よりも有用だ。どちらも、出力フォーマットに由来する種類のエラーは排除するが、判断に由来する種類のエラーには何も対処しない。どちらも確率を提供するが、どちらにも、確認せずに信頼できる公開済みの信頼性ダイアグラムはない。どちらかを自動化に組み込む前に、自分のラベル付きケースでキャリブレーションをテストせよ — レイテンシはすでにコモディティ化しており、信頼度の値こそがデプロイごとに獲得しなければならない部分だ。

A generated two-column scoreboard comparing Jev and Laya across the same six labelled dimensions, with a footer reading "Laya zero-shot vs random 0.318 and majority baseline 0.461; per Laya's own model card."