
RSI-Jev vs Laya: twee open beslissingsmodellen, tegenovergestelde inzetten
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Met ingang van oktober 2026 zijn er twee open-weight modellen het overwegen waard als je getypeerde beslissingen wilt — een ja/nee, een kies-één-uit-k, een beoordeling-op-een-rubriek — zonder een gehoste endpoint in het pad. Het zijn RSI-Jev v6.1-VL 4B, gepubliceerd op 2026-10-07 door de externe Shanghua-Gao/RSI-Jev-onderzoeksloop, en Laya, uitgebracht op 2026-09-18 door Convai Innovations. Beide antwoorden in één enkele forward pass zonder gegenereerde tekst; beide retourneren een gekalibreerde waarschijnlijkheid voor elke optie; beide worden geleverd onder Apache-2.0-gewichten met een server die de beslissings-API van TypeSafe spreekt, zodat een client die voor het commerciële model is geschreven, op beide draait door een basis-URL te wijzigen. Ze zijn ook gebouwd op tegengestelde aannames, en de twee cijfers die hen onderscheiden zijn 3 tot 4 tokens per label en 421 miljoen parameters.
De eerste weddenschap gaat over schaal. Laya's Engelse checkpoint is ModernBERT-large met 421M parameters en een context van 512 tokens, en zijn meertalige checkpoint is mmBERT-base met 322M en een venster van 1.024 tokens dat 8.192 bereikt wanneer de encoder breed wordt ingesteld. RSI-Jev v6.1-VL draait een volledige Qwen3.5-4B-Base-toren — 4,69B parameters, waarvan 3,57B in de 32 decoderlagen, plus een visietoren en drie beslissingshoofden op lagen 16, 20 en 32. Laya is een model waarvan je er drie kunt preloaden in een paar gigabyte; RSI-Jev is een bf16-checkpoint van 9,7 GB. De tweede weddenschap volgt uit de eerste: Laya besteedt bijna niets per aanroep en verwacht dat je het jouw domein aanleert, terwijl RSI-Jev vier en een half miljard parameters besteedt aan het proberen je vraag te beantwoorden zonder ook maar enige training.
Waar elk exemplaar eigenlijk voor is
De eigen modelkaart van Laya bevat de zin die deze vergelijking beter kadert dan welke reviewer dan ook: "Laya is een snelle basis om op te specialiseren, geen zero-shot beslissingsengine." Op de typed-decisions-benchmark — 2.000 beslissingen verdeeld over vier workflows — scoort het Engelse basis-checkpoint 0,362, tegenover 0,318 voor willekeurig gokken en 0,461 voor het altijd kiezen van de meerderheidsklasse. Op dezelfde beslissingen scoort het checkpoint dat Convai fijnafstemde op de eigen trainingssplit van die benchmark 0,766, waarmee het het plafond van 0,735 voor teacher-overeenstemming doorbreekt. Dat verschil is het product: Laya is een encoder van 421M die je fijnafstemt op een nauwe taxonomie, en Convai levert een Kaggle-notebook die de hele cyclus draait — de dataset bouwen, trainen, kalibratietemperaturen fitten, evalueren — op twee gratis T4's.
RSI-Jev is het andere vak. De v6.1-VL-release ervan scoort 50,98 op zijn eigen publieke Decision Index 0.3, een run van 140.178 requests met de standaardconfiguratie, die op de projectranglijst van 2026-10-06 het beste 4B-model daar evenaart en in totaal 27e van 113 staat. De suite van vijftien benchmarks ervan is 0,793 en de held-outset ervan is 0,729. Dat zijn zero-shotcijfers — hoewel het project er zorgvuldig op wijst dat tien van de vijftien benchmarks in een of andere vorm trainingsdata aanleveren, dus "zero-shot" geldt voor het zoekproces van de release, niet voor elk getal op de pagina. Wat die cijfers je wel opleveren, is een model dat een vraag over een document beantwoordt dat je het nooit hebt laten zien en dat niet eerst een trainingsrun nodig heeft.
• Formaat — Laya 421M Engels / 322M meertalig versus RSI-Jev 4,69B, die de volledige Qwen3.5-4B-Base-toren draait.
• Zero-shot-nauwkeurigheid — Laya 0.362 op typed-decisions, onder de meerderheidsbaseline van 0.461, tegenover RSI-Jev 50.98 op zijn eigen Decision Index 0.3, waarmee het de beste 4B-inzending daar evenaart.
• Fijngetunede nauwkeurigheid — Laya 0,766 met een checkpoint dat is getraind op de eigen split van de benchmark, tegenover de cijfers van RSI-Jev die van release-niveau zijn, niet per domein.
• Talen — Laya 45 van de 51 talen bruikbaar, meer dan drie keer willekeurige server-side routering versus RSI-Jev Engels-centrische tekst.
• Modaliteit — Alleen tekst bij Laya versus tekst plus maximaal vier afbeeldingen per verzoek bij RSI-Jev.
• Context — Laya 512 tokens Engels, 1.024 meertalig en tot 8.192 voor lange documenten vs RSI-Jev 32.768 tokens, geweigerd in plaats van afgekapt.
• Latentie — Laya 32,8 ms p50 op een T4, 7,2 ms per vraag bij batch tien vs RSI-Jev 22,5 ms bij inspanning laag en ongeveer 40 ms op volledige diepte, op een H200.
De kloof in het aantal opties is het scherpste verschil
Beide modellen definiëren de antwoordruimte op het moment van het verzoek, dus een nieuw schema vereist geen hertraining — dat is de gedeelde structurele winst van deze hele familie. Maar ze wijzen de antwoordruimte anders toe, en het verschil komt precies naar voren bij de taken die kenmerkend zijn voor enterprise-routing. Laya scoort elke optie op zijn eigen gemaskeerde token, en de opties delen een vast head-budget: 192 tokens op het Engelse checkpoint, 256 op meertalig. Op Banking77, met 77 intenties, komt dat neer op ongeveer drie of vier tokens per label, en de nauwkeurigheid daalt naar 0,425. Convai's eigen kaart documenteert de scherpe daling en biedt de oplossing — verhoog head_max_len naar 512 en de context naar 1.024 of meer zodat elk label ruimte heeft, of splits een grote set opties in een grof-naar-fijne keuze in twee stappen.
Het serveerpad van RSI-Jev ondersteunt tot 5.120 opties per vraag. Dat is geen één-op-één benchmark tegen Laya's 0,425 — de twee zijn gemeten op verschillende testopstellingen, en het optieplafond is een configuratielimiet, geen score. Het zegt iets over welk model niet omvalt wanneer je taxonomie honderd items telt. Als je keuzevragen "facturering / technisch / verkoop / overig" zijn, voldoet elk van de twee. Gaat het om een honderdtal intentielabels, dan moet een van deze twee worden bijgesteld voordat die bruikbaar is, en de andere niet.

Latentie, de taalkwestie en de afbeeldingen
Laya's latencyclaim is de luidruchtigste, en het is een echte: 32,8 ms p50 voor een enkele vraag op een Tesla T4, 72,3 ms voor een batch van tien, en 337 ms voor vijftig — 103 tot 332 vragen per seconde op één bescheiden GPU. RSI-Jevs eigen cijfers, gemeten op een H200, zijn 22,5 ms bij inspanning laag, 26,8 ms bij gemiddelde inspanning, 39,9 ms standaard en 40,4 ms op volledige diepte. Die liggen in dezelfde orde van grootte, en beide zijn lokale forward passes in plaats van netwerkaanroepen, wat de vergelijking is die er echt toe doet zodra een gehost endpoint buiten beeld is. Let op wat de twee met de tijd doen: RSI-Jev kan bewust stoppen bij laag 16 om die 22,5 ms te behalen en alle 32 te draaien wanneer de vraag moeilijk is, en Laya heeft zo'n knop niet — het draait altijd zijn hele (kleine) encoder.
Het taalverhaal is precies omgekeerd en is doorslaggevend voor iedereen buiten het Engels. Laya levert een router die het schrift in ruim minder dan een milliseconde detecteert en naar het meertalige checkpoint stuurt, en de gepubliceerde tabel laat zien dat 45 van de 51 talen bruikbaar zijn boven drie keer de willekeurige baseline, tegenover 23 voor alleen het Engelse checkpoint. De modelkaart is ook eerlijk over waarom dat ertoe doet: het Engelse checkpoint stort in bij niet-Latijnse schriften — Khmer scoort 0,000 nauwkeurigheid bij een confidence van 0,952 — dus confidence-gating kan een verkeerde route niet redden. RSI-Jev heeft geen dergelijk taalverhaal; het is een op Engels gericht tekstmodel dat toevallig afbeeldingen leest.
Bij afbeeldingen is het net omgekeerd. RSI-Jev neemt er één tot vier per verzoek als base64-data-URL's en scoorde 0,834 op zijn achtergehouden afbeeldingsset in deze release; de meegeleverde checkpoints van Laya zijn tekstclassificaties, en hoewel communityports zoals laya-vision op de Hub bestaan, zijn ze niet het product van de leverancier. Als je beslissing over een foto, een grafiek of een screenshot gaat, dan is dat de kolom van het ene model en niet die van het andere.
Geen van beide is ten opzichte van de ander gebenchmarkt.
Dit is het deel dat een vergelijking specificatie voor specificatie stilletjes verbergt: er is geen rechtstreekse vergelijking tussen deze twee modellen. Wat bestaat, is een rechtstreekse vergelijking tussen elk van hen en hetzelfde gesloten model — TypeSafe's Jev 1.13 — en geen van beide kan naast de ander worden geplaatst.
Convai publiceerde er een: op typed-decisions, Jev 1.13.0 op 0.727 tegenover Laya's gerouteerde 0.766; op Banking77, Jev 0.870 tegenover Laya's 0.425; op calibratie, Jev 0.246 tegenover Laya's 0.081 na de temperatuurfix. Convai wijst in dezelfde tabel op zijn eigen beperkingen — de Jev-cijfers zijn door derden gepubliceerd, ze hebben nooit API-toegang gehad om die te meten, en de steekproefgroottes en prompts verschillen. De vergelijking van RSI-Jev is de Decision Index, die het eigen openbare bord van RSI-Jev is en helemaal geen Jev-vermelding bevat. Dus de enige externe cijfers die beide modellen raken, komen uit testharnassen die zijn gebouwd door de partijen die ze verkopen, en de verstandige lezing van elk afzonderlijk cijfer hierboven is: "dit is wat de maker heeft gemeten, op de taak van de maker."
Wat beide projecten goed doen, en zelden, is hun eigen zwakheden publiceren. RSI-Jev noemt de vijf niet-commerciële beeldbronnen achter zijn vision-releases en zegt ronduit dat het niet vaststaat of gewichten die erop zijn getraind die voorwaarden overnemen; het meldt een kalibratieregressie in zijn nieuwste release en noemt zijn standaard exitdrempel onbevestigd. Laya documenteert dat zijn basis-checkpoints onder de meerderheidsbaseline liggen, dat zijn ordinale scorevragen de zwakste primitieve zijn, dat zijn noul kan zijn eigen optielabels volgen in plaats van de toestand, en dat een van zijn responsvelden geen bruikbaar signaal bevat. Die eerlijkheid is het nuttigste dat u van een van beide projecten kunt overnemen: controleer de confidencewaarden op uw eigen gelabelde gevallen voordat u op basis daarvan automatiseert.

Waar het contract dat ze kopiëren daadwerkelijk staat
Beide modellen bestaan omdat één wire-format het kopiëren waard was. TypeSafe's Jev definieert de vorm van het verzoek — state, questions, drie getypeerde primitieven — en de vorm van het antwoord, en zowel Laya als RSI-Jev implementeren het zodat een bestaande client werkt door een basis-URL te wijzigen. Dat referentiemodel, typesafe/jev-1.13, is degene van de drie die wij aanbieden: het staat in onze catalogus op het toegewijde systemone-endpoint, een POST naar /v1/systemone, niet-streamend, tegen een context van 65.536 tokens, voor $0,042 per miljoen inputtokens, waarbij de output tegen nul wordt gefactureerd. Noch Laya noch RSI-Jev staat in onze catalogus — beide zijn downloads, en dat is juist het punt.
De praktische versie daarvan is belangrijker dan de vergelijking. Beslissingslagen staan bijna nooit alleen in een stack; ze staan naast een generatief model dat het antwoord, de samenvatting of de code schrijft. Als je het referentiecontract op dezelfde sleutel hebt als 200+ andere modellen, tegen de lijstprijs van de provider, doorgegeven met 0% markup, betekent dat een tariefwijziging van een leverancier je dezelfde dag bereikt, en automatische failover betekent dat de generatieve helft van dat paar geen single point of failure is terwijl je uitzoekt of de goedkope beslissingshelft goed genoeg is. Als je besluit dat een zelfgehoste 421M-encoder of een 4,69B-checkpoint de juiste keuze is, wil je nog steeds dat het contract dat erbij hoort vanaf dezelfde plek bereikbaar is — en als je liever geen van beide draait, is het model dat beide kopiëren één verzoek verwijderd.
Welke moet ik downloaden?
Kies Laya als je gelabelde data hebt, een taxonomie die niet veel verandert, en een taalmix die niet alleen Engels is. Het is klein genoeg om er veel van te draaien, snel genoeg om voor elk verzoek te zetten, en vanaf de grond af ontworpen om te worden fijngetuned — de 0,766 fijngetunede score tegenover 0,362 zero-shot is het hele argument. Begroot de trainingsrun, het labelen en de temperatuurherfit per vraagtype die de kalibratiefout van 0,466 naar 0,081 brengt, en houd de optiesets onder ongeveer twintig labels, of verhoog het head-budget voordat je een grote classificatie vertrouwt.
Kies RSI-Jev v6.1-VL als je wilt dat een beslissing werkt zonder enige training vooraf, als je vragen soms over een afbeelding gaan, als je optiesets groot zijn, of als je latentie wilt inruilen voor diepgang per verzoek. Verwacht een checkpoint van 9,7 GB te draaien in plaats van een van 400M, verwacht een project dat in dertien dagen acht releases heeft gepubliceerd en er misschien nog een publiceert terwijl je deze aan het evalueren bent, en verwacht dat je de kalibratie zelf controleert — de eigen kaart van deze release zegt dat het slechter werd, niet beter.
Wat je ook kiest, dezelfde twee dingen zijn waar. Geen van beide modellen genereert tekst, dus geen van beide kan falen door een misvormd veld te produceren; beide geven waarschijnlijkheden terug, en de waarschijnlijkheid is het deel dat per implementatie moet worden gevalideerd in plaats van uit een kaart te worden gehaald. En beide hebben de interessante vraag van een beslissingslaag verplaatst van "wiens API" naar "wiens gewichten" — wat een betere vraag is om te stellen, en een die dit tweetal heel verschillend beantwoordt.

