RSI-Jev vs Laya のタイトルカードを生成。テキストは「2つのオープンな意思決定モデル。正反対の賭け。」。左のカードには「RSI-Jev v6.1-VL」というラベルが付き、脳と歯車のアイコンと「4.69Bパラメータ、ゼロショット」という行を伴う。右のカードには「Laya」というラベルが付き、羽根のアイコンと「421Mパラメータ、自分でファインチューニング」という行を伴う。2枚のカードの間には細い縦の仕切り線があり、キャプションは「どちらも Apache-2.0。どちらもあなた向けにホストされているわけではありません。」。OrcaRouter のロゴが右下隅に合成されている。
Guides & Insights

RSI-Jev 対 Laya:2つのオープンな意思決定モデル、正反対の賭け

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.

最初の賭けは規模に関するものだ。Laya の英語チェックポイントは 421M パラメータ、512 トークンコンテキストの ModernBERT-large で、その多言語チェックポイントは 322M の mmBERT-base、1,024 トークンのウィンドウを持ち、エンコーダを広く設定すると 8,192 に達する。RSI-Jev v6.1-VL は Qwen3.5-4B-Base タワー全体を動かす——4.69B パラメータで、そのうち 3.57B が 32 個のデコーダ層にあり、さらにビジョンタワーと、層 16、20、32 にある 3 つの決定ヘッドを備える。Laya は数ギガバイトで 3 つをプリロードできるモデルだ。RSI-Jev は 9.7 GB の bf16 チェックポイントだ。2 つ目の賭けは 1 つ目から続く。Laya は呼び出しごとにほとんど何も消費せず、自分のドメインを教えることを期待する。一方 RSI-Jev は 45 億パラメータを費やして、まったく訓練なしであなたの質問に答えようとする。

それぞれが実際に何のためのものか

Laya自身のモデルカードには、どんなレビュアーよりもこの比較をうまく位置づける一文が含まれている。「Layaは特化するための高速なベースであり、ゼロショットの意思決定エンジンではない」。型付き意思決定ベンチマーク——4つのワークフローにわたる2,000件の意思決定——では、英語のベースチェックポイントは0.362を記録し、ランダム推測の0.318、常に多数派クラスを選ぶ場合の0.461と対比される。同じ意思決定において、そのベンチマーク自体の訓練分割でファインチューニングされたチェックポイントConvaiは0.766を記録し、教師一致の上限0.735を上回る。この差こそが製品だ。Layaは、狭いタクソノミーでファインチューニングする421Mのエンコーダーであり、Convaiは、データセットの構築、訓練、キャリブレーション温度のフィット、評価というループ全体を、無料のT4 2基で実行するKaggleノートブックを提供している。

RSI-Jevはもう一方の選択だ。そのv6.1-VLリリースは、独自の公開Decision Index 0.3で50.98を記録する。これはデフォルト構成での140,178リクエストの実行であり、2026-10-06付のプロジェクトのボードでは、そこの最良の4Bモデルと並び、全体で113件中27位につけている。15ベンチマークのスイートは0.793、ホールドアウトセットは0.729だ。これらはゼロショットの数値である——ただしプロジェクトは、15のベンチマークのうち10が何らかの形で学習データを提供していると慎重に断っている。つまり「ゼロショット」が当てはまるのはこのリリースの探索であり、ページ上のすべての数値ではない。これらの数値が実際にもたらすのは、一度も見せたことのない文書についての質問に答え、事前の学習実行を必要としないモデルだ。

• サイズ — Laya 421M 英語 / 322M 多言語 対 RSI-Jev 4.69B、Qwen3.5-4B-Base タワー全体を実行

• ゼロショット精度 — 型付き意思決定タスクではLayaが0.362で、多数派ベースラインの0.461を下回った。一方、RSI-Jevは独自のDecision Index 0.3で50.98を記録し、そこでの最良の4Bエントリーと並んだ。

• ファインチューニング後の精度 — Laya の 0.766 はベンチマーク自身の分割で学習したチェックポイントによる値であるのに対し、RSI-Jev の数値はドメイン別ではなくリリースレベルのもの。

•言語 — Laya は、51言語中45言語が利用可能で、RSI-Jev の英語中心テキストに対するランダムなサーバーサイドルーティングの3倍超です。

• モダリティ — Layaはテキストのみ、RSI-Jevはテキストに加えて1リクエストあたり最大4枚の画像。

• コンテキスト — Laya は英語で512トークン、多言語で1,024、長文ドキュメントでは最大8,192トークンであるのに対し、RSI-Jev は32,768トークンで、切り詰めるのではなく拒否します。

• レイテンシ — T4 上で Laya は p50 32.8 ms、バッチ 10 で質問あたり 7.2 ms、RSI-Jev はエフォート low で 22.5 ms、フル深度で約 40 ms(H200 上)。

オプション数の崖は最も顕著な違いです

両モデルはリクエスト時に回答空間を定義するため、新しいスキーマに再トレーニングは不要です — これがこのファミリー全体に共通する構造上の強みです。しかし、両者は回答空間の割り当て方が異なり、その違いはまさにエンタープライズルーティングが扱いがちなタスクで表面化します。Layaは各選択肢をそれぞれのマスクトークンでスコアリングし、選択肢は固定のヘッド予算を共有します。英語チェックポイントでは192トークン、多言語では256トークンです。77のインテントを持つBanking77では、ラベルあたりおよそ3~4トークンとなり、精度は0.425まで低下します。Convai自身のモデルカードがこの崖を記録し、修正策を提示しています — 引き上げるべきは、head_max_lenを512に、コンテキストを1,024以上にして各ラベルに余地ができるようにするか、大規模な選択肢セットを粗から細への2段階選択に分割することです。

RSI-Jevのサービングパスは、1つの質問につき最大5,120個の選択肢を受け付けます。これはLayaの0.425に対する同一条件のベンチマークではありません——両者は異なるハーネスで測定されており、選択肢の上限は設定上の制限であってスコアではありません。これは、タクソノミーが100項目あるときに、どちらのモデルが破綻しないかについての説明です。選択式の質問が「請求/技術/営業/その他」であれば、どちらでも機能します。それが100前後のインテントラベルであれば、この2つのうち一方は使用可能になる前に調整が必要で、もう一方は不要です。

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

レイテンシ、言語の問題、そして画像

Layaのレイテンシの主張は最も声高で、それは本物です:Tesla T4での単一の質問で32.8 ms p50、10件のバッチで72.3 ms、50件で337 ms — 1つの控えめなGPUで毎秒103〜332質問。RSI-Jev自身の数値は、H200で計測され、22.5 ms(エフォート低)、26.8 ms(中)、デフォルトで39.9 ms、フル深度で40.4 msです。これらは同じ桁であり、どちらもネットワーク呼び出しではなくローカルフォワードパスであり、ホストされたエンドポイントが選択肢から外れたら、実際に重要になる比較はこれです。両者が時間をどう使っているかに注目してください:RSI-Jevは、意図的にレイヤー16で停止してその22.5 msを稼ぎ、質問が難しいときは32層すべてを実行できますが、Layaにはそのようなダイヤルはありません — 常に(小さな)エンコーダ全体を実行します。

言語に関する話は逆方向に展開し、英語圏外の誰にとっても決定的だ。Layaは、スクリプトを1ミリ秒未満で検出し、多言語チェックポイントへ振り分けるルーターを提供している。その公開表によれば、51言語のうち45言語がランダムの3倍を超える水準で使用可能であり、英語チェックポイント単独では23言語にとどまる。そのカードは、なぜそれが重要かについても正直だ。英語チェックポイントは非ラテン文字スクリプトで崩壊する——クメール語は信頼度0.952で精度0.000を記録する——したがって信頼度ゲーティングでは誤ったルートを救えない。RSI-Jevにはこの種の言語に関する話はない。たまたま画像を読む、英語中心のテキストモデルである。

画像については、両者は鏡像のような関係にある。RSI-Jevは1リクエストにつき1~4枚をbase64データURLとして受け取り、今回のリリースではホールドアウト画像セットで0.834を記録した。Layaが出荷しているチェックポイントはテキスト分類器であり、Hubにはlaya-visionのようなコミュニティによる移植版が存在するものの、それらはベンダーの製品ではない。写真やチャート、スクリーンショットに基づいて判断を下すのであれば、それは一方のモデルの担当領域であり、もう一方のものではない。

どちらも他方に対してベンチマークされたことはない

これは、仕様ごとの比較がそっと隠してしまう部分だ。この2つのモデルの直接対決は存在しない。あるのは、それぞれと同じクローズドモデル——TypeSafeのJev 1.13——との直接対決であり、どちらも他方の隣に並べることはできない。

Convaiが公表したものがある:typed-decisionsでは、Jev 1.13.0が0.727で、Layaのroutedは0.766。Banking77では、Jevが0.870で、Layaは0.425。キャリブレーションでは、Jevが0.246で、Layaのtemperature修正後は0.081。Convaiは同じ表の中で自社の限界も指摘している——Jevの数値は第三者によって公表されたもので、同社はそれを測定するためのAPIアクセスを一度も持っておらず、サンプルサイズとプロンプトも異なる。RSI-Jevの比較はDecision Indexであり、これはRSI-Jev自身の公開ボードで、Jevの項目は一切載っていない。したがって、これら両モデルに関わる唯一の外部数値は、それらを販売している当事者が構築したハーネスに由来し、上の個々の数値の妥当な読み方は「これは作成元が、作成元のタスク上で測定したものだ」ということになる。

両プロジェクトがうまくやっていること、そしてめったにやらないことは、自らの弱点を公表することだ。RSI-Jev は、そのビジョンリリースの背後にある5つの非商用画像ソースを名指しし、それらで学習された重みがそれらの条件を継承するかどうかは決着していないとはっきり言っている。最新リリースでキャリブレーションのリグレッションを報告し、デフォルトの終了しきい値は未確認だと呼んでいる。Laya は、そのベースチェックポイントが多数派ベースラインを下回っていること、その順序スコアの質問が最も弱いプリミティブであること、その noulが状態ではなく自身の選択肢ラベルに従うことがあること、その応答フィールドの1つが使用可能な信号を含まないことを文書化している。その正直さは、どちらのプロジェクトから継承するにも最も有用なものだ。それらに対して自動化する前に、自分のラベル付きケースで信頼度の値を確認せよ。

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

彼らがコピーする契約が実際に存在する場所

これらのモデルが両方とも存在するのは、あるワイヤーフォーマットにコピーする価値があったからです。TypeSafeのJevがリクエストの形 — 状態、質問、3つの型付きプリミティブ — と回答の形を定義しており、LayaとRSI-Jevはどちらもそれを実装しているので、既存のクライアントはベースURLを変えるだけで動きます。その参照モデル、typesafe/jev-1.13は、私たちが提供する3つのうちの1つです。専用のsystemoneエンドポイントでカタログに掲載されており、/v1/systemone への POST、非ストリーミング、65,536トークンのコンテキスト、100万入力トークンあたり$0.042、出力はゼロ課金です。LayaもRSI-Jevも私たちのカタログにはありません — どちらもダウンロードであり、それこそが彼らの存在意義です。

その実用的なバージョンは、比較そのものよりも重要です。意思決定レイヤーがスタック内で単独で存在することはほとんどなく、返信や要約、コードを書く生成モデルの隣に位置します。参照用のコントラクトが200以上の他のモデルと同じキーで利用でき、プロバイダー定価を0%のマークアップでそのまま適用であれば、ベンダーの料金変更が当日に届き、自動フェイルオーバーにより、安価な意思決定側が十分かどうかを検討している間も、そのペアの生成側が単一障害点になることはありません。自己ホスト型の421Mエンコーダーや4.69Bチェックポイントが適切だと判断した場合でも、それが話すコントラクトに同じ場所から到達できるようにしたいはずです。また、どちらも実行したくない場合は、両者がコピーしているモデルに1リクエストでアクセスできます。

どれをダウンロードすればいいですか?

ラベル付きデータがあり、あまり変化しない分類体系があり、英語のみではない言語構成であれば、Laya を選びましょう。これは多数実行できるほど小さく、あらゆるリクエストの前に配置できるほど高速で、ファインチューニングされることを前提に一から設計されています — ゼロショットの 0.362 に対するファインチューニング後の 0.766 というスコアが、そのすべての根拠です。トレーニング実行、ラベリング、そしてキャリブレーション誤差を 0.466 から 0.081 に下げる質問タイプごとの温度パラメータ再調整のための予算を確保し、選択肢セットはおよそ 20 ラベル未満に保つか、大規模な分類を信頼する前にヘッドの予算を増やしてください。

RSI-Jev v6.1-VL を選ぶのは、まずトレーニングなしで意思決定を機能させたい場合、質問がときに画像に関するものである場合、オプション セットが大きい場合、またはリクエストごとにレイテンシと引き換えに深さを求めたい場合です。400M のチェックポイントではなく 9.7 GB のチェックポイントを実行することになることを想定し、13 日間で 8 つのリリースを公開し、これを評価している間にさらに別のリリースを公開する可能性があるプロジェクトであることを想定し、そのキャリブレーションを自分で確認することを想定してください — このリリース自体のカードには、良くなるどころか悪くなったと書かれています。

どちらを選んでも、同じ2つのことが当てはまります。どちらのモデルもテキストを生成しないため、不正な形式のフィールドを出力して失敗することはありません。どちらも確率を返し、カードから取ってくるのではなくデプロイごとに検証しなければならないのは、その確率の部分です。そしてどちらも、意思決定レイヤーに関する興味深い問いを「誰のAPIか」から「誰の重みか」へと移しました。これは問うべきより良い問いであり、この2つはそれに大きく異なる答えを出します。

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL vs Laya - the scoreboard', six rows across both columns: size, '4.69B parameters' against '421M English / 322M multilingual'; zero-shot, '50.98 Decision Index' against '0.362 typed-decisions'; fine-tuned, 'Not per-domain' against '0.766 on its own split'; languages, 'English-centric' against '45 of 51 usable'; modality, 'Text + up to 4 images' against 'Text only'; and latency, '~23-40 ms on an H200' against '32.8 ms p50 on a T4'. A footer reads 'Both vendor-reported; neither has been benchmarked against the other.'