Generierte Titelkarte für RSI-Jev vs. Laya mit dem Text „Zwei offene Entscheidungsmodelle. Entgegengesetzte Wetten.“, mit einer linken Karte mit der Beschriftung „RSI-Jev v6.1-VL“, die ein Gehirn-Zahnrad-Symbol und die Zeile „4,69 Mrd. Parameter, Zero-Shot“ trägt, einer rechten Karte mit der Beschriftung „Laya“, die ein Feder-Symbol und die Zeile „421 Mio. Parameter, feinabstimmen“ trägt, einem dünnen vertikalen Trenner zwischen den beiden Karten und der Bildunterschrift „Beide Apache-2.0. Keines davon wird für dich gehostet.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

RSI-Jev vs. Laya: Zwei offene Entscheidungsmodelle, entgegengesetzte Wetten

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.

Bei der ersten Wette geht es um Skalierung. Layas englischer Checkpoint ist ModernBERT-large mit 421 Mio. Parametern und einem 512-Token-Kontext, und ihr mehrsprachiger Checkpoint ist mmBERT-base mit 322 Mio. und einem 1.024-Token-Fenster, das 8.192 erreicht, wenn der Encoder weit eingestellt wird. RSI-Jev v6.1-VL betreibt einen kompletten Qwen3.5-4B-Base-Tower – 4,69 Mrd. Parameter, davon 3,57 Mrd. in den 32 Decoder-Schichten, plus einen Vision-Tower und drei Entscheidungs-Heads in den Schichten 16, 20 und 32. Laya ist ein Modell, von dem Sie drei in wenigen Gigabyte vorladen können; RSI-Jev ist ein 9,7 GB großer bf16-Checkpoint. Die zweite Wette folgt aus der ersten: Laya verbraucht pro Aufruf fast nichts und erwartet, dass Sie ihm Ihre Domäne beibringen, während RSI-Jev viereinhalb Milliarden Parameter einsetzt, um Ihre Frage ganz ohne Training zu beantworten.

Wofür jedes einzelne tatsächlich da ist

Layas eigene Modellkarte enthält den Satz, der diesen Vergleich besser einordnet, als es jeder Reviewer könnte: „Laya ist eine schnelle Basis zum Spezialisieren, keine Zero-Shot-Entscheidungsengine.“ Im Typed-Decisions-Benchmark – 2.000 Entscheidungen über vier Workflows – erzielt der englische Basis-Checkpoint 0,362, gegenüber 0,318 beim zufälligen Raten und 0,461 beim ständigen Auswählen der Mehrheitsklasse. Bei denselben Entscheidungen erzielt der Checkpoint, den Convai auf dem eigenen Trainings-Split dieses Benchmarks feinabgestimmt hat, 0,766 und durchbricht damit die Obergrenze von 0,735 für die Teacher-Übereinstimmung. Diese Lücke ist das Produkt: Laya ist ein 421-Mio.-Encoder, den man auf eine enge Taxonomie feinabstimmt, und Convai liefert ein Kaggle-Notebook, das den gesamten Loop – Dataset erstellen, trainieren, Kalibrierungstemperaturen fitten, evaluieren – auf zwei kostenlosen T4s ausführt.

RSI-Jev ist der andere Trade. Sein v6.1-VL-Release erzielt 50,98 auf seinem eigenen öffentlichen Decision Index 0.3, einem Lauf mit 140.178 Anfragen in der Standardkonfiguration, der auf dem Board des Projekts vom 2026-10-06 mit dem besten 4B-Modell dort gleichzieht und insgesamt auf Platz 27 von 113 liegt. Seine Suite aus fünfzehn Benchmarks erreicht 0,793 und sein Hold-out-Set 0,729. Das sind Zero-Shot-Zahlen – wobei das Projekt sorgfältig darauf hinweist, dass zehn der fünfzehn Benchmarks in irgendeiner Form Trainingsdaten beisteuern, sodass „Zero-Shot“ für die Suche des Releases gilt, nicht für jede Zahl auf der Seite. Was Ihnen diese Zahlen tatsächlich verschaffen, ist ein Modell, das eine Frage zu einem Dokument beantwortet, das Sie ihm nie gezeigt haben, und das keinen vorherigen Trainingslauf benötigt.

• Größe — Laya 421M Englisch / 322M mehrsprachig vs. RSI-Jev 4,69B, wobei der gesamte Qwen3.5-4B-Base-Tower läuft.

• Zero-Shot-Genauigkeit — Laya 0,362 bei typisierten Entscheidungen, unter der Mehrheitsbasislinie von 0,461, gegenüber RSI-Jev 50,98 auf seinem eigenen Decision Index 0.3, womit es dort den besten 4B-Eintrag egalisiert.

• Feinabgestimmte Genauigkeit — Laya 0,766 mit einem Checkpoint, der auf dem eigenen Split des Benchmarks trainiert wurde, gegenüber RSI-Jevs Angaben, die Release-Niveau und nicht pro Domäne gelten.

• Sprachen — Laya in 45 von 51 Sprachen nutzbar, mehr als dreimal so viel wie zufälliges serverseitiges Routing im Vergleich zu RSI-Jev englischzentriertem Text.

• Modalität — nur Laya-Text im Vergleich zu RSI-Jev-Text plus bis zu vier Bildern pro Anfrage.

• Kontext — Laya 512 Token Englisch, 1.024 mehrsprachig und bis zu 8.192 für lange Dokumente vs. RSI-Jev 32.768 Token, abgelehnt statt abgeschnitten.

• Latenz — Laya 32,8 ms p50 auf einer T4, 7,2 ms pro Frage bei Batch zehn im Vergleich zu RSI-Jev 22,5 ms bei Aufwand niedrig und etwa 40 ms bei voller Tiefe, auf einer H200.

Die Optionsanzahl-Klippe ist der deutlichste Unterschied.

Beide Modelle definieren den Antwortraum zur Anfragezeit, sodass ein neues Schema kein erneutes Training benötigt — das ist der gemeinsame strukturelle Gewinn dieser ganzen Familie. Doch sie weisen den Antwortraum unterschiedlich zu, und der Unterschied zeigt sich genau bei den Aufgaben, auf die Enterprise-Routing typischerweise trifft. Laya bewertet jede Option an ihrem eigenen maskierten Token, und die Optionen teilen sich ein festes Head-Budget: 192 Token beim englischen Checkpoint, 256 beim mehrsprachigen. Bei Banking77 mit 77 Intents ergibt das etwa drei oder vier Token pro Label, und die Genauigkeit sinkt auf 0,425. Convais eigene Karte dokumentiert die Klippe und bietet die Lösung — erhöhen head_max_len auf 512 und den Kontext auf 1.024 oder mehr, damit jedes Label Platz hat, oder teilen Sie einen großen Optionssatz in eine zweistufige Grob-zu-Fein-Entscheidung auf.

RSI-Jevs Serving-Pfad lässt bis zu 5.120 Optionen pro Frage zu. Das ist kein vergleichbarer Benchmark gegen Layas 0,425 — die beiden wurden auf unterschiedlichen Testumgebungen gemessen, und die Options-Obergrenze ist eine Konfigurationsgrenze, kein Score. Es ist eine Aussage darüber, welches Modell nicht zusammenbricht, wenn deine Taxonomie hundert Einträge hat. Wenn deine Auswahlfragen „Abrechnung / Technik / Vertrieb / Sonstiges“ lauten, funktioniert beides. Wenn es gut hundert Intent-Labels sind, muss eines der beiden abgestimmt werden, bevor es nutzbar ist, und das andere nicht.

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

Latenz, die Sprachenfrage und die Bilder

Layas Latenzbehauptung ist die lauteste, und sie ist echt: 32,8 ms p50 für eine einzelne Frage auf einer Tesla T4, 72,3 ms für einen Batch von zehn und 337 ms für fünfzig — 103 bis 332 Fragen pro Sekunde auf einer bescheidenen GPU. RSI-Jevs eigene Zahlen, gemessen auf einer H200, sind 22,5 ms bei Aufwand niedrig, 26,8 ms bei mittel, 39,9 ms standardmäßig und 40,4 ms bei voller Tiefe. Diese liegen in derselben Größenordnung, und beide sind lokale Forward-Pässe statt Netzwerkaufrufe, was der Vergleich ist, der tatsächlich zählt, sobald ein gehosteter Endpunkt aus dem Spiel ist. Beachten Sie, was die beiden mit der Zeit machen: RSI-Jev kann absichtlich bei Layer 16 stoppen, um diese 22,5 ms zu erkaufen, und alle 32 ausführen, wenn die Frage schwierig ist, und Laya hat keinen solchen Regler — es führt immer seinen gesamten (kleinen) Encoder aus.

Die Sprachgeschichte verläuft genau umgekehrt und ist für alle außerhalb des Englischen entscheidend. Laya liefert einen Router aus, der das Schriftsystem in deutlich unter einer Millisekunde erkennt und an den mehrsprachigen Checkpoint weiterleitet, und seine veröffentlichte Tabelle zeigt 45 von 51 Sprachen oberhalb des Dreifachen der Zufallsrate nutzbar, gegenüber 23 allein für den englischen Checkpoint. Seine Modellkarte ist zudem ehrlich darüber, warum das zählt: Der englische Checkpoint bricht bei nichtlateinischen Schriften zusammen – Khmer erzielt 0,000 Genauigkeit bei 0,952 Konfidenz –, sodass Konfidenz-Gating eine falsche Route nicht retten kann. RSI-Jev hat keine derartige Sprachgeschichte; es ist ein englischzentriertes Textmodell, das zufällig Bilder lesen kann.

Bei Bildern ist es genau umgekehrt. RSI-Jev nimmt ein bis vier pro Anfrage als Base64-Daten-URLs entgegen und erreichte in diesem Release 0,834 auf seinem zurückgehaltenen Bilddatensatz; Layas ausgelieferte Checkpoints sind Textklassifikatoren, und obwohl Community-Ports wie laya-vision auf dem Hub existieren, sind sie nicht das Produkt des Anbieters. Wenn Ihre Entscheidung ein Foto, ein Diagramm oder einen Screenshot betrifft, ist das die Spalte des einen Modells und nicht die des anderen.

Keines von beiden wurde gegen das andere gebenchmarkt.

Das ist der Teil, den ein Vergleich Spezifikation für Spezifikation stillschweigend verbirgt: Es gibt kein direktes Duell zwischen diesen beiden Modellen. Was es gibt, ist ein direktes Duell zwischen jedem von ihnen und demselben geschlossenen Modell – TypeSafe Jev 1.13 – und keines von beiden lässt sich neben das andere stellen.

Convai hat eine veröffentlicht: bei typed-decisions, Jev 1.13.0 bei 0,727 gegen Layas geroutete 0,766; bei Banking77, Jev 0,870 gegen Layas 0,425; bei der Kalibrierung, Jev 0,246 gegen Layas 0,081 nach der Temperaturkorrektur. Convai weist in derselben Tabelle auf seine eigenen Grenzen hin – die Jev-Zahlen sind von Dritten veröffentlicht, sie hatten nie API-Zugang, um es zu messen, und die Stichprobengrößen und Prompts unterscheiden sich. RSI-Jevs Vergleich ist der Decision Index, ein eigenes öffentliches Board von RSI-Jev, das überhaupt keinen Jev-Eintrag enthält. Die einzigen externen Zahlen, die beide dieser Modelle betreffen, stammen also aus Testumgebungen, die von den Parteien erstellt wurden, die sie verkaufen, und die vernünftige Lesart jeder einzelnen oben genannten Zahl ist: „Das ist es, was der Hersteller gemessen hat, an der Aufgabe des Herstellers.“

Was beide Projekte gut – und selten – machen, ist, ihre eigenen Schwächen zu veröffentlichen. RSI-Jev nennt die fünf nichtkommerziellen Bildquellen hinter seinen Vision-Veröffentlichungen und sagt unumwunden, dass nicht geklärt ist, ob auf ihnen trainierte Gewichte diese Bedingungen erben; es meldet eine Kalibrierungsregression in seiner neuesten Version und bezeichnet seinen Standard-Exit-Schwellenwert als unbestätigt. Laya dokumentiert, dass seine Basis-Checkpoints unter der Mehrheits-Baseline liegen, dass seine ordinalen Score-Fragen seine schwächste Primitive sind, dass sein noul eher seinen eigenen Optionsbezeichnungen als dem Zustand folgen kann und dass eines seiner Antwortfelder kein nutzbares Signal enthält. Diese Ehrlichkeit ist das Nützlichste, was man von einem der beiden Projekte übernehmen kann: Prüfe die Konfidenzwerte an deinen eigenen gelabelten Fällen, bevor du auf ihrer Grundlage automatisierst.

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Wo der Vertrag, den sie kopieren, tatsächlich liegt

Beide dieser Modelle existieren, weil ein Wire-Format es wert war, kopiert zu werden. Jev von TypeSafe definiert die Anfrageform – Zustand, Fragen, drei typisierte Primitive – und die Antwortform, und sowohl Laya als auch RSI-Jev implementieren dieses Wire-Format, sodass ein bestehender Client durch Ändern einer Basis-URL funktioniert. Dieses Referenzmodell, typesafe/jev-1.13, ist dasjenige der drei, das wir anbieten: Es steht in unserem Katalog auf dem dedizierten systemone-Endpunkt, ein POST an /v1/systemone, nicht streamend, bei einem Kontext von 65.536 Token, zu $0,042 pro Million Eingabe-Token, wobei die Ausgabe mit null abgerechnet wird. Weder Laya noch RSI-Jev sind in unserem Katalog – beide sind Downloads, und genau das ist der Punkt bei ihnen.

Die praktische Version davon ist wichtiger als der Vergleich. Entscheidungsschichten stehen fast nie allein in einem Stack; sie sitzen neben einem generativen Modell, das die Antwort, die Zusammenfassung oder den Code schreibt. Den Referenzvertrag unter demselben Schlüssel wie 200+ anderen Modellen zu haben, zum Anbieterlistenpreis, durchgereicht mit 0 % Aufschlag, bedeutet, dass eine Anbieterpreisänderung Sie am selben Tag erreicht, und automatisches Failover bedeutet, dass die generative Hälfte dieses Paares kein Single Point of Failure ist, während Sie herausfinden, ob die günstige Entscheidungshälfte gut genug ist. Wenn Sie entscheiden, dass ein selbst gehosteter 421M-Encoder oder ein 4.69B-Checkpoint die richtige Wahl ist, möchten Sie trotzdem, dass der Vertrag, den es spricht, vom selben Ort aus erreichbar ist — und wenn Sie lieber keinen von beiden betreiben möchten, ist das Modell, das beide kopieren, nur eine Anfrage entfernt.

Welche soll ich herunterladen?

Wählen Sie Laya, wenn Sie gelabelte Daten haben, eine Taxonomie, die sich nicht stark verändert, und einen Sprachmix, der nicht nur Englisch ist. Es ist klein genug, um viele davon zu betreiben, schnell genug, um es jeder Anfrage voranzustellen, und von Grund auf dafür ausgelegt, feinabgestimmt zu werden – der feinabgestimmte Wert von 0,766 gegenüber 0,362 im Zero-Shot-Ansatz ist das ganze Argument. Planen Sie den Trainingslauf, die Labelvergabe und die erneute Temperaturanpassung pro Fragetyp ein, die den Kalibrierungsfehler von 0,466 auf 0,081 senkt, und halten Sie die Optionssätze unter ungefähr zwanzig Labels oder erhöhen Sie das Head-Budget, bevor Sie einer großen Klassifikation vertrauen.

Wählen Sie RSI-Jev v6.1-VL, wenn Sie möchten, dass eine Entscheidung zunächst ohne jegliches Training funktioniert, wenn sich Ihre Fragen manchmal auf ein Bild beziehen, wenn Ihre Optionssets groß sind oder wenn Sie Latenz gegen Tiefe pro Anfrage eintauschen möchten. Rechnen Sie damit, einen 9,7 GB großen Checkpoint statt eines 400M-Checkpoints auszuführen, rechnen Sie mit einem Projekt, das in dreizehn Tagen acht Releases veröffentlicht hat und möglicherweise ein weiteres veröffentlicht, während Sie dieses hier evaluieren, und rechnen Sie damit, dass Sie seine Kalibrierung selbst überprüfen – die eigene Modellkarte dieser Version sagt, dass es schlechter wurde, nicht besser.

Für welches du dich auch entscheidest, es gelten dieselben zwei Dinge. Keines der beiden Modelle erzeugt Text, also kann keines daran scheitern, ein fehlerhaftes Feld auszugeben; beide geben Wahrscheinlichkeiten zurück, und die Wahrscheinlichkeit ist der Teil, der pro Deployment validiert werden muss, statt einfach aus einer Modellkarte übernommen zu werden. Und beide haben die interessante Frage einer Entscheidungsschicht von „wessen API“ zu „wessen Gewichte“ verlagert — was eine bessere Frage ist, die man stellen sollte, und eine, die dieses Paar sehr unterschiedlich beantwortet.

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL vs Laya - the scoreboard', six rows across both columns: size, '4.69B parameters' against '421M English / 322M multilingual'; zero-shot, '50.98 Decision Index' against '0.362 typed-decisions'; fine-tuned, 'Not per-domain' against '0.766 on its own split'; languages, 'English-centric' against '45 of 51 usable'; modality, 'Text + up to 4 images' against 'Text only'; and latency, '~23-40 ms on an H200' against '32.8 ms p50 on a T4'. A footer reads 'Both vendor-reported; neither has been benchmarked against the other.'