
RSI-Jev vs Laya: Två öppna beslutsmodeller, motsatta satsningar
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.
Det första vadet handlar om skala. Layas engelska checkpoint är ModernBERT-large på 421 M parametrar med en kontext på 512 token, och dess flerspråkiga checkpoint är mmBERT-base på 322 M med ett fönster på 1 024 token som når 8 192 med encodern i brett läge. RSI-Jev v6.1-VL kör ett helt Qwen3.5-4B-Base-torn — 4,69 B parametrar, varav 3,57 B i de 32 decoderlagren, plus ett visionstorn och tre beslutshuvuden vid lager 16, 20 och 32. Laya är en modell som du kan förladda tre exemplar av på några gigabyte; RSI-Jev är en bf16-checkpoint på 9,7 GB. Det andra vadet följer av det första: Laya gör av med nästan ingenting per anrop och förväntar sig att du lär den din domän, medan RSI-Jev gör av med fyra och en halv miljard parametrar för att försöka svara på din fråga helt utan träning.
Vad var och en egentligen är till för
Layas eget modellkort innehåller meningen som ramar in den här jämförelsen bättre än någon recensent skulle kunna: ”Laya är en snabb basmodell för specialisering, inte en zero-shot-beslutsmotor.” På benchmarken för typade beslut – 2 000 beslut över fyra arbetsflöden – får den engelska bascheckpointen 0,362, mot 0,318 för slumpmässig gissning och 0,461 för att alltid välja majoritetsklassen. På samma beslut får checkpointen som Convai finjusterade på benchmarkens egen träningsdel 0,766, vilket överträffar taket för läraröverensstämmelse på 0,735. Det gapet är produkten: Laya är en 421M-encoder som du finjusterar på en snäv taxonomi, och Convai levererar en Kaggle-notebook som kör hela loopen – bygg datasetet, träna, anpassa kalibreringstemperaturer, utvärdera – på två kostnadsfria T4:or.
RSI-Jev är det andra alternativet. Dess v6.1-VL-släpp får 50,98 på sitt eget offentliga Decision Index 0.3, en körning med 140 178 förfrågningar av standardkonfigurationen, vilket på projektets resultattavla daterad 2026-10-06 ligger i nivå med den bästa 4B-modellen där och intar 27:e plats av 113 totalt. Dess svit med femton benchmarks är 0,793 och dess held-out-uppsättning är 0,729. Det är zero-shot-siffror – även om projektet är noga med att säga att tio av de femton benchmarks bidrar med träningsdata i någon form, så "zero-shot" gäller släppets sökning, inte varje siffra på sidan. Vad siffrorna faktiskt ger dig är en modell som svarar på en fråga om ett dokument som du aldrig har visat den och som inte behöver en träningskörning först.
• Storlek — Laya 421M engelska / 322M flerspråkig vs RSI-Jev 4,69B, som kör hela Qwen3.5-4B-Base-tornet.
• Zero-shot-noggrannhet — Laya 0,362 på typade beslut, under majoritetsbaslinjen 0,461 mot RSI-Jev 50,98 på dess eget Decision Index 0,3, vilket tangerar den bästa 4B-posten där.
• Finjusterad noggrannhet — Lana 0,766 med en checkpoint tränad på benchmarkens egna RSI-Jevs siffror som ligger på release-nivå, inte per domän
• Språk — Laya 45 av 51 språk användbara över tre gånger slumpmässig routning på serversidan jämfört med RSI-Jev engelskcentrerad text.
• Modalitet — endast Laya-text kontra RSI-Jev-text plus upp till fyra bilder per begäran.
• Kontext — Laya 512 tokens engelska, 1 024 flerspråkiga och upp till 8 192 för långa dokument jämfört med RSI-Jev 32 768 tokens, avvisas hellre än trunkeras.
• Latens — Laya 32,8 ms p50 på en T4, 7,2 ms per fråga vid batch tio jämfört med RSI-Jev 22,5 ms vid låg ansträngning och omkring 40 ms vid fullt djup, på en H200.
Stupet i antalet alternativ är den skarpaste skillnaden.
Båda modellerna definierar svarsutrymmet vid förfrågningstillfället, så ett nytt schema kräver ingen omträning – det är den gemensamma strukturella vinsten för hela den här familjen. Men de allokerar svarsutrymmet olika, och skillnaden visar sig just i de uppgifter som företagsroutning tenderar att handla om. Laya poängsätter varje alternativ vid sin egen maskerade token, och alternativen delar en fast head-budget: 192 tokens i den engelska checkpointen, 256 i den flerspråkiga. På Banking77, med 77 avsikter, blir det ungefär tre eller fyra tokens per etikett, och noggrannheten faller till 0,425. Convais eget modellkort dokumenterar stupet och erbjuder lösningen – höj head_max_len till 512 och kontexten till 1 024 eller mer så att varje etikett får plats, eller dela upp en stor uppsättning alternativ i ett tvåstegsval från grovt till fint.
RSI-Jevs serveringsväg tillåter upp till 5 120 alternativ per fråga. Det är inte ett likvärdigt riktmärke mot Layas 0,425 – de två mättes i olika testramverk, och taket för antalet alternativ är en konfigurationsgräns, inte en poäng. Det är ett påstående om vilken modell som inte kraschar när din taxonomi har hundra poster. Om dina urvalsfrågor är "fakturering / teknik / försäljning / övrigt" fungerar båda. Om de är ett hundratal avsiktsetiketter behöver en av dessa två justeras innan den är användbar, och den andra inte.

Latens, språkfrågan och bilderna
Laya's latency claim is its loudest, and it is a real one: 32.8 ms p50 for a single question on a Tesla T4, 72.3 ms for a batch of ten, and 337 ms for fifty — 103 to 332 questions a second on one modest GPU. RSI-Jev's own numbers, clocked on an H200, are 22.5 ms at effort low, 26.8 ms at medium, 39.9 ms by default and 40.4 ms at full depth. Those are the same order of magnitude, and both are local forward passes rather than network calls, which is the comparison that actually matters once a hosted endpoint is out of the picture. Note what the two are doing with the time: RSI-Jev can deliberately stop at layer 16 to buy that 22.5 ms and run all 32 when the question is hard, and Laya has no such dial — it always runs its whole (small) encoder.
Språkberättelsen går i motsatt riktning och är avgörande för alla utanför engelskan. Laya levererar en router som identifierar skriften på långt under en millisekund och dirigerar till den flerspråkiga checkpointen, och dess publicerade tabell visar att 45 av 51 språk är användbara över tre gånger slumpnivån, jämfört med 23 för enbart den engelska checkpointen. Dess kort handlar också om varför det spelar roll: den engelska checkpointen kollapsar för icke-latinska skrifter – khmer får 0,000 i noggrannhet och 0,952 i konfidens – så gating kan inte rädda ett felaktigt val. RSI-J har ingen egen språkberättelse; det är en engelskcentrerad textmodell som råkar kunna läsa bilder.
Bilder är spegelbilden. RSI-Jev tar emot ett till fyra per begäran som base64-data-URL:er och fick 0,834 på sin held-out-bildmängd i den här utgåvan; Layas levererade checkpoints är textklassificerare, och även om community-portningar som laya-vision finns på Hub, är de inte leverantörens produkt. Om ditt beslut gäller ett foto, ett diagram eller en skärmbild, är det den ena modellens kolumn och inte den andras.
Ingen av dem har benchmarkats mot den andra
Det här är delen som en jämförelse specifikation för specifikation tyst döljer: det finns ingen direkt jämförelse mellan dessa två modeller. Det som finns är en direkt jämförelse mellan var och en av dem och samma stängda modell – TypeSafe's Jev 1.13 – och ingen av dem kan ställas bredvid den andra.
Convai publicerade en: på typed-decisions: Jev 1.13.0 på 0,727 mot Laya:s routade 0,766; på Banking77: Jev 0,870 mot Laya:s 0,425; på kalibrering: Jev 0,246 mot Laya:s 0,081 efter temperaturfixen. Convai flaggar sina egna begränsningar i samma tabell – Jev-siffrorna är publicerade av tredje part, de hade aldrig API-åtkomst för att mäta dem, och urvalsstorlekarna och prompterna skiljer sig. RSI-Jevs jämförelse är Decision Index, som är RSI-Jevs egen offentliga resultattavla och inte innehåller någon Jev-post alls. Så de enda externa siffrorna som berör båda dessa modeller kommer från utvärderingsramverk byggda av parterna som säljer dem, och den rimliga tolkningen av varje enskild siffra ovan är ”det här är vad tillverkaren mätte, på tillverkarens uppgift.”
Vad båda projekten gör bra, och sällan, är att publicera sina egna svagheter. RSI-Jev namnger de fem icke-kommersiella bildkällorna bakom sina visionssläpp och säger rakt ut att det inte är avgjort om vikter som tränats på dem ärver dessa villkor; RSI-Jev rapporterar en kalibreringsregression i sin senaste utgåva och kallar sin förvalda utträdesströskel för obekräftad. Laya dokumenterar att dess bascheckpunkter ligger under majoritetsbaslinjen, att dess ordinala poängfrågor är dess svagaste primitiv, att dess noul kan följa sina egna alternativetiketter i stället för tillståndet, och att ett av dess svarsfält inte bär någon användbar signal. Den ärligheten är det mest användbara att ärva från något av projekten: kontrollera konfidensvärdena på dina egna märkta fall innan du automatiserar mot dem.

Var avtalet de kopierar faktiskt finns
Båda dessa modeller finns eftersom ett överföringsformat var värt att kopiera. TypeSafe:s Jev definierar förfrågningsformen — tillstånd, frågor, tre typade primitiver — och svarsformen, och både Laya och RSI-Jev implementerar det så att en befintlig klient fungerar genom att ändra en bas-URL. Den referensmodellen, typesafe/jev-1.13, är den av de tre som vi tillhandahåller: den finns i vår katalog på den dedikerade systemone-endpointen, en POST till /v1/systemone, icke-strömmande, mot en kontext på 65 536 tokens, till $0,042 per miljon indatatokens med utdata som faktureras till noll. Varken Laya eller RSI-Jev finns i vår katalog — båda är nedladdningar, och det är poängen med dem.
Den praktiska versionen av det är viktigare än jämförelsen. Beslutsmodeller står nästan aldrig ensamma i en stack; de sitter bredvid en generativ modell som skriver svaret, sammanfattningen eller koden. Att ha referenskontraktet på samma nyckel som 200+ andra modeller, till leverantörens listpris som förs vidare med 0 % påslag, innebär att en ändring i leverantörens prissättning når dig samma dag, och automatisk failover innebär att den generativa halvan av det paret inte är en enskild felpunkt medan du utvärderar om den billiga beslutsdelen är tillräckligt bra. Om du beslutar att en självhostad 421M-encoder eller en 4,69B-checkpoint är rätt val, vill du fortfarande att kontraktet som den talar med ska vara nåbart från samma plats — och om du helst inte vill köra någon av dem, är modellen som båda kopierar bara en förfrågan bort.
Vilken ska man ladda ner
Välj Laya om du har märkt data, en taxonomi som inte förändras särskilt mycket, och en språkmix som inte enbart är engelska. Den är tillräckligt liten för att kunna köra många av dem, tillräckligt snabb för att sätta framför varje begäran, och designad från grunden för att finjusteras – poängen 0,766 efter finjustering mot 0,362 för zero-shot är hela argumentet. Budgetera för träningskörningen, märkningen och den frågetypsspecifika temperaturåteranpassningen som tar dess kalibreringsfel från 0,466 till 0,081, och håll alternativuppsättningarna under ungefär tjugo etiketter eller höj budgeten för huvudet innan du litar på en stor klassificering.
Välj RSI-Jev v6.1-VL om du vill att ett beslut ska fungera utan någon träning först, om dina frågor ibland handlar om en bild, om dina alternativuppsättningar är stora, eller om du vill byta latens mot djup per begäran. Förvänta dig att köra en checkpoint på 9,7 GB i stället för en på 400M, förvänta dig ett projekt som har publicerat åtta utgåvor på tretton dagar och kan publicera en till medan du utvärderar den här, och förvänta dig att själv behöva kontrollera dess kalibrering – den här utgåvans eget kort säger att den blev sämre, inte bättre.
Oavsett vilket du väljer gäller samma två saker. Ingen av modellerna genererar text, så ingen av dem kan misslyckas genom att skicka ut ett felformat fält; båda returnerar sannolikheter, och sannolikheten är den del som måste valideras per driftsättning i stället för att tas från ett kort. Och båda har flyttat den intressanta frågan om ett beslutslager från "vems API" till "vems vikter" — vilket är en bättre fråga att ställa, och en som det här paret besvarar väldigt olika.

