Wygenerowana karta tytułowa dla RSI-Jev vs Laya z napisem „Dwa otwarte modele decyzyjne. Przeciwstawne zakłady.”, z lewą kartą oznaczoną jako „RSI-Jev v6.1-VL”, zawierającą ikonę mózgu z zębatką i wiersz „4,69 mld parametrów, zero-shot”, prawą kartą oznaczoną jako „Laya”, zawierającą ikonę pióra i wiersz „421 mln parametrów, dostrój go”, cienkim pionowym separatorem między obiema kartami oraz podpisem „Oba na licencji Apache-2.0. Żaden z nich nie jest hostowany dla ciebie.” Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

RSI-Jev kontra Laya: Dwa otwarte modele decyzyjne, przeciwne zakłady

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.

Pierwszy zakład dotyczy skali. Angielski checkpoint Layi to ModernBERT-large z 421 mln parametrów i kontekstem 512 tokenów, a jej wielojęzyczny checkpoint to mmBERT-base z 322 mln i oknem 1024 tokenów, które sięga 8192, gdy enkoder ustawi się szeroko. RSI-Jev v6.1-VL uruchamia całą wieżę Qwen3.5-4B-Base — 4,69 mld parametrów, z czego 3,57 mld w 32 warstwach dekodera, plus wieżę wizyjną i trzy głowice decyzyjne na warstwach 16, 20 i 32. Laya to model, którego trzy egzemplarze można wstępnie załadować w kilku gigabajtach; RSI-Jev to 9,7 GB checkpoint bf16. Drugi zakład wynika z pierwszego: Laya nie zużywa prawie nic na wywołanie i oczekuje, że nauczysz ją swojej dziedziny, podczas gdy RSI-Jev zużywa cztery i pół miliarda parametrów, próbując odpowiedzieć na twoje pytanie bez jakiegokolwiek trenowania.

Do czego właściwie służy każdy z nich

Karta modelu Laya sama zawiera zdanie, które ujmuje to porównanie lepiej, niż zrobiłby to jakikolwiek recenzent: „Laya to szybka baza do specjalizacji, a nie silnik decyzji zero-shot”. W benchmarku typed-decisions — 2000 decyzji w czterech workflowach — bazowy angielski checkpoint uzyskuje 0,362, wobec 0,318 dla losowego zgadywania i 0,461 dla zawsze wybierania klasy większościowej. Na tych samych decyzjach checkpoint dostrojony przez Convai na własnym podziale treningowym tego benchmarku uzyskuje 0,766, przebijając pułap zgodności z nauczycielem wynoszący 0,735. Ta różnica to właśnie produkt: Laya to 421M enkoder, który dostrajasz na wąskiej taksonomii, a Convai udostępnia notebook Kaggle, który przeprowadza całą pętlę — zbuduj zbiór danych, wytrenuj, dopasuj temperatury kalibracji, oceń — na dwóch darmowych T4.

RSI-Jev to drugi zakład. Jego wydanie v6.1-VL uzyskuje 50,98 w swoim publicznym Decision Index 0.3, w przebiegu domyślnej konfiguracji na 140 178 żądań, który na tablicy projektu z dnia 2026-10-06 dorównuje tam najlepszemu modelowi 4B i zajmuje 27. miejsce spośród 113 ogółem. Jego zestaw piętnastu benchmarków osiąga 0,793, a jego zbiór wydzielony — 0,729. To wyniki zero-shot — choć projekt starannie zaznacza, że dziesięć z piętnastu benchmarków wnosi dane treningowe w jakiejś formie, więc „zero-shot” odnosi się do wyszukiwania w tym wydaniu, a nie do każdej liczby na stronie. To, co te liczby faktycznie dają, to model, który odpowiada na pytanie o dokument, którego nigdy mu nie pokazano, i nie wymaga najpierw przeprowadzenia treningu.

• Rozmiar — Laya 421M (angielski) / 322M (wielojęzyczny) vs RSI-Jev 4,69B, uruchamiając całą wieżę Qwen3.5-4B-Base.

• Dokładność zero-shot — Laya 0,362 w decyzjach typowanych, poniżej bazowego wyniku większościowego 0,461 w porównaniu z RSI-Jev 50,98 w jego własnym Decision Index 0.3, dorównując tam najlepszemu wpisowi 4B.

• Dokładność po dostrojeniu — Laya 0.766 z checkpointem wytrenowanym na własnym podziale benchmarku w porównaniu z wynikami RSI-Jev na poziomie wydania, a nie na poziomie poszczególnych domen.

• Języki — Laya 45 z 51 języków użytecznych ponad trzykrotnie w stosunku do losowego trasowania po stronie serwera w porównaniu z tekstem RSI-Jev zorientowanym na angielski.

• Modalność — Laya: tylko tekst vs RSI-Jev: tekst oraz do czterech obrazów na żądanie.

• Kontekst — Laya 512 tokenów w języku angielskim, 1024 w trybie wielojęzycznym i do 8192 w przypadku długich dokumentów w porównaniu z RSI-Jev 32 768 tokenów — odrzucane, a nie obcinane.

• Opóźnienie — Laya 32,8 ms p50 na T4, 7,2 ms na pytanie przy partii o rozmiarze 10 w porównaniu z RSI-Jev 22,5 ms przy niskim wysiłku i około 40 ms przy pełnej głębokości, na H200.

Przepaść w liczbie opcji jest najostrzejszą różnicą.

Oba modele definiują przestrzeń odpowiedzi w momencie żądania, więc nowy schemat nie wymaga ponownego trenowania — to wspólna korzyść strukturalna całej tej rodziny. Ale przydzielają przestrzeń odpowiedzi inaczej, a różnica uwidacznia się dokładnie w zadaniach typowych dla routingu korporacyjnego. Laya ocenia każdą opcję na własnym zamaskowanym tokenie, a opcje dzielą stały budżet głowicy: 192 tokeny na angielskim checkpointcie, 256 w wersji wielojęzycznej. W Banking77, przy 77 intencjach, przekłada się to na około trzy lub cztery tokeny na etykietę, a dokładność spada do 0,425. Własna karta Convai dokumentuje ten klif i oferuje rozwiązanie — podnieść head_max_len do 512, a kontekst do 1 024 lub więcej, aby każda etykieta miała miejsce, albo podzielić duży zestaw opcji na dwuetapowy wybór od zgrubnego do szczegółowego.

Ścieżka obsługi RSI-Jev dopuszcza do 5 120 opcji na pytanie. To nie jest bezpośrednie porównanie z wynikiem 0,425 Laya — oba pomiary wykonano na różnych środowiskach testowych, a pułap opcji to ograniczenie konfiguracji, nie wynik. To stwierdzenie o tym, który model się nie wysypie, gdy twoja taksonomia ma sto pozycji. Jeśli twoje pytania wyboru to „rozliczenia / techniczne / sprzedaż / inne”, oba się nadają. Jeśli to około stu etykiet intencji, jeden z tych dwóch wymaga dostrojenia, zanim będzie użyteczny, a drugi nie.

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

Opóźnienie, kwestia językowa i obrazy

Najgłośniejszym twierdzeniem Laya jest to o opóźnieniu i jest ono prawdziwe: 32,8 ms p50 dla pojedynczego pytania na Tesla T4, 72,3 ms dla partii dziesięciu i 337 ms dla pięćdziesięciu — od 103 do 332 pytań na sekundę na jednym skromnym GPU. Własne liczby RSI-Jev, zmierzone na H200, to 22,5 ms przy wysiłku niskim, 26,8 ms przy średnim, 39,9 ms domyślnie i 40,4 ms przy pełnej głębokości. To ten sam rząd wielkości, a oba są lokalnymi przejściami w przód, a nie wywołaniami sieciowymi, co jest porównaniem, które tak naprawdę ma znaczenie, gdy hostowany punkt końcowy jest poza grą. Zwróć uwagę, co oba robią z czasem: RSI-Jev może celowo zatrzymać się na warstwie 16, aby kupić te 22,5 ms, i uruchomić wszystkie 32, gdy pytanie jest trudne, a Laya nie ma takiego pokrętła — zawsze uruchamia cały swój (mały) enkoder.

Historia językowa przebiega odwrotnie i ma rozstrzygające znaczenie dla każdego spoza angielskiego. Laya dostarcza router, który wykrywa pismo w czasie znacznie poniżej milisekundy i kieruje do wielojęzycznego checkpointu, a jej opublikowana tabela pokazuje, że 45 z 51 języków jest użytecznych na poziomie ponad trzykrotnie wyższym od losowego, wobec 23 dla samego angielskiego checkpointu. Jej karta również uczciwie mówi, dlaczego to ma znaczenie: angielski checkpoint załamuje się na pismach niełacińskich — khmerski uzyskuje dokładność 0,000 przy pewności 0,952 — więc bramkowanie pewności nie może uratować błędnej trasy. RSI-Jev nie ma tego rodzaju historii językowej; to tekstowy model zorientowany na angielski, który przypadkiem czyta obrazy.

Obrazy to lustrzane odbicie. RSI-Jev przyjmuje od jednego do czterech na żądanie jako adresy URL danych w formacie base64 i w tym wydaniu uzyskał wynik 0,834 na przeznaczonym do testów zbiorze obrazów; checkpointy dostarczane przez Layę to klasyfikatory tekstu, a choć w Hubie istnieją społecznościowe porty, takie jak laya-vision, nie są one produktem dostawcy. Jeśli Twoja decyzja dotyczy zdjęcia, wykresu lub zrzutu ekranu, to jest to kolumna jednego modelu, a nie drugiego.

Żadnego z nich nie poddano testom porównawczym względem drugiego.

To jest ta część, którą porównanie parametr po parametrze po cichu ukrywa: nie ma bezpośredniego starcia między tymi dwoma modelami. Istnieje natomiast bezpośrednie starcie każdego z nich z tym samym zamkniętym modelem — Jev 1.13 firmy TypeSafe — i żadnego z nich nie można postawić obok drugiego.

Convai opublikował jedno: w przypadku typed-decisions, Jev 1.13.0 osiągnął 0.727 wobec 0.766 Laya w wersji routed; w przypadku Banking77, Jev 0.870 wobec 0.425 Laya; w przypadku kalibracji, Jev 0.246 wobec 0.081 Laya po poprawce temperatury. Convai zaznacza własne ograniczenia w tej samej tabeli — liczby Jev są opublikowane przez strony trzecie, nigdy nie mieli dostępu do API, aby to zmierzyć, a rozmiary próbek i prompty się różnią. Porównanie RSI-Jev to Decision Index, który jest własną publiczną tablicą RSI-Jev i nie zawiera żadnego wpisu Jev. Tak więc jedyne zewnętrzne liczby, które dotyczą obu tych modeli, pochodzą ze środowisk testowych zbudowanych przez strony, które je sprzedają, a rozsądny odczyt którejkolwiek z powyższych pojedynczych liczb brzmi: „to jest to, co zmierzył producent, na zadaniu producenta”.

To, co oba projekty robią dobrze, a co zdarza się rzadko, to publikowanie własnych słabości. RSI-Jev wymienia pięć niekomercyjnych źródeł obrazów stojących za jego wydaniami wizyjnymi i mówi wprost, że nie jest rozstrzygnięte, czy wagi trenowane na nich dziedziczą te warunki; informuje o regresji kalibracji w swoim najnowszym wydaniu i nazywa swój domyślny próg wyjścia niepotwierdzonym. Laya dokumentuje, że jej bazowe punkty kontrolne znajdują się poniżej większościowego poziomu odniesienia, że jej porządkowe punktowe pytania są jej najsłabszym prymitywem, że jej noul może podążać za własnymi etykietami opcji, a nie za stanem, oraz że jedno z jej pól odpowiedzi nie niesie żadnego użytecznego sygnału. Ta szczerość jest najbardziej użyteczną rzeczą, którą można odziedziczyć po którymkolwiek z tych projektów: sprawdź wartości pewności na własnych oznaczonych przypadkach, zanim zautomatyzujesz działania w oparciu o nie.

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Gdzie faktycznie znajduje się umowa, którą kopiują

Oba te modele istnieją, ponieważ jeden format transmisji był wart skopiowania. Jev firmy TypeSafe definiuje kształt żądania — stan, pytania, trzy typowane prymitywy — oraz kształt odpowiedzi, a zarówno Laya, jak i RSI-Jev implementują go tak, że istniejący klient działa po zmianie bazowego adresu URL. Ten model referencyjny, typesafe/jev-1.13, to ten z trzech, który obsługujemy: znajduje się w naszym katalogu na dedykowanym punkcie końcowym systemone, jako POST do /v1/systemone, bez strumieniowania, z kontekstem 65 536 tokenów, w cenie 0,042 USD za milion tokenów wejściowych, przy czym tokeny wyjściowe są rozliczane po zerowej stawce. Ani Laya, ani RSI-Jev nie znajdują się w naszym katalogu — oba są do pobrania i właśnie o to w nich chodzi.

Praktyczny wymiar tego ma większe znaczenie niż samo porównanie. Warstwy decyzyjne prawie nigdy nie występują w stosie samodzielnie; sąsiadują z modelem generatywnym, który pisze odpowiedź, podsumowanie lub kod. To, że kontrakt referencyjny jest na tym samym kluczu co ponad 200 innych modeli, po cenie katalogowej dostawcy przekazywanej dalej z 0% marży, oznacza, że zmiana stawek dostawcy dociera do Ciebie tego samego dnia, a automatyczne przełączanie awaryjne oznacza, że generatywna połowa tej pary nie jest pojedynczym punktem awarii, gdy ustalasz, czy tania połowa decyzyjna jest wystarczająco dobra. Jeśli uznasz, że enkoder 421M hostowany samodzielnie albo checkpoint 4.69B to właściwy wybór, nadal chcesz, aby kontrakt, z którym się komunikuje, był osiągalny z tego samego miejsca — a jeśli wolisz nie uruchamiać żadnego z nich, model, który oba kopiują, można uzyskać jednym żądaniem.

Który pobrać?

Wybierz Laya, jeśli masz dane z etykietami, taksonomię, która nie zmienia się zbytnio, oraz mieszankę językową, która nie ogranicza się do angielskiego. Jest wystarczająco mała, aby uruchamiać wiele jej instancji, wystarczająco szybka, aby stawiać ją przed każdym żądaniem, i od podstaw zaprojektowana do dostrajania — wynik 0,766 po dostrojeniu w porównaniu z 0,362 w trybie zero-shot to cały argument. Zaplanuj budżet na przebieg treningowy, etykietowanie i ponowne dopasowanie temperatury dla każdego typu pytania, które zmniejsza błąd kalibracji z 0,466 do 0,081, a zestawy opcji utrzymuj poniżej około dwudziestu etykiet albo zwiększ budżet głowicy, zanim zaufasz dużej klasyfikacji.

Wybierz RSI-Jev v6.1-VL, jeśli chcesz, aby decyzja działała bez żadnego wcześniejszego treningu, jeśli twoje pytania czasami dotyczą obrazu, jeśli twoje zestawy opcji są duże albo jeśli chcesz zamienić opóźnienie na głębię na żądanie. Spodziewaj się uruchamiania checkpointu o rozmiarze 9,7 GB, a nie 400M, spodziewaj się projektu, który opublikował osiem wydań w trzynaście dni i może opublikować kolejne, gdy będziesz oceniać to wydanie, oraz spodziewaj się, że samodzielnie sprawdzisz jego kalibrację — karta tego wydania mówi, że jest gorzej, a nie lepiej.

Niezależnie od tego, który wybierzesz, prawdziwe są te same dwie rzeczy. Żaden z modeli nie generuje tekstu, więc żaden nie może zawieść przez wyemitowanie niepoprawnie sformatowanego pola; oba zwracają prawdopodobieństwa, a prawdopodobieństwo to część, którą trzeba walidować przy każdym wdrożeniu, a nie brać z karty. Oba przeniosły też ciekawe pytanie o warstwę decyzyjną z „czyje API” na „czyje wagi” — co jest lepszym pytaniem do zadania i takim, na które ta para odpowiada bardzo różnie.

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL vs Laya - the scoreboard', six rows across both columns: size, '4.69B parameters' against '421M English / 322M multilingual'; zero-shot, '50.98 Decision Index' against '0.362 typed-decisions'; fine-tuned, 'Not per-domain' against '0.766 on its own split'; languages, 'English-centric' against '45 of 51 usable'; modality, 'Text + up to 4 images' against 'Text only'; and latency, '~23-40 ms on an H200' against '32.8 ms p50 on a T4'. A footer reads 'Both vendor-reported; neither has been benchmarked against the other.'