
Laya vs Kev: Twee recepten voor een lokaal beslissingsmodel
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Het nuttigste getal in de vergelijking Laya-versus-Kev is een bonnetje. Jared Palmer trainde de Kev-familie voor ongeveer $95 aan H100-tijd op Modal, plus ongeveer drie cent aan API-aanroepen voor evaluatiedata, en publiceerde het recept samen met de gewichten. Convai Innovations koos de andere route met Laya: uitgebracht op 18 september 2026, drie dagen na TypeSafe AI's Jev, Apache 2.0, gewichten op Hugging Face, een pip install laya als ingangspunt, en geen trainingspijplijn — een 421M ModernBERT-large Engels checkpoint, een 322M mmBERT-base meertalig checkpoint, en een router die tussen beide kiest. Kev is een familie van drie kleine modellen van 0,8B, 4B en 9B, elk een bevroren basis plus een rank-16 LoRA-adapter en een kleine pointer-head. Beide beantwoorden getypte vragen in één forward pass en geen van beide genereert tekst. De keuze tussen hen is eigenlijk een keuze over welk artefact je wilt bezitten: een checkpoint of een recept.
Wat elk project daadwerkelijk uitlevert
Laya levert inferentie. Het Engelse checkpoint is een bidirectionele encoder met een venster van 512 tokens; de meertalige dekt meer dan 100 talen met een venster van 1.024 tokens en werkt ongeveer twee keer zo snel; de router detecteert het schrift in minder dan een halve milliseconde. Het beantwoordt choice, score en noul — een keuze uit een lijst, een verwacht niveau op een geordende rubric en een gekalibreerde waarschijnlijkheid dat een bewering waar is. Er is een derde checkpoint, laya-typed-decisions, dat dezelfde 421M-backbone is, fijngetuned op de trainingssplit van de typed-decisions-benchmark. De eigen modelkaart van Convai bevat de zin die zou moeten bepalen hoe je elk Laya-getal leest: "Laya is een snelle basis om te specialiseren, geen zero-shot beslissingsengine."


Kev levert een methode. De repository documenteert decision-v7: twee epochs over 10.000 voorbeelden afkomstig uit tien publieke datasets, 896 gegenereerde policy-voorbeelden, en 1.680 voorbeelden gebouwd uit 60 gegenereerde regelstructuren. De head scoort elke aangeleverde optie tegen het decide-token van de vraag en past softmax toe op het resultaat. Omdat de Qwen3.5-checkpoints aandacht combineren met recurrente Gated DeltaNet-lagen die aandachtsmaskers negeren, draait elke vraag als een eigen rij waarbij de gedeelde toestand eenmalig wordt berekend en gecachet — dat is hoe het model vragen geïsoleerd van elkaar houdt zonder te betalen voor een nieuwe prefill per vraag. Kev weerspiegelt het publieke /v1/systemone-contract van TypeSafe, zodat een bestaande TypeSafe SDK-client naar een lokale Kev-server kan wijzen door de basis-URL te wijzigen. De README vermeldt dat er geen Jev-outputs zijn gebruikt bij de training.
De twee faalwijzen zijn verschillend, en dat is het echte verhaal.
Beide modellen verliezen van Jev bij de taken waarvoor je dingen moet weten, maar ze verliezen op manieren die om verschillende mitigaties vragen.
De gepubliceerde zwakke punten van Laya gaan over de vorm van de invoer. Op de typed-decisions-benchmark van TypeSafe scoort het 0,362 zero-shot, tegenover 0,318 voor willekeurig gissen en 0,461 voor de majority-class-baseline — dichter bij toeval dan bij het triviale antwoord. Bij meer dan ongeveer twintig opties valt het uiteen: 0,425 op Banking77 tegen 0,870 van Jev. Het is zodanig ordeningsgevoelig dat een loutere omkering van de optievolgorde de nauwkeurigheid met 13,75 punten deed dalen in een test door een derde partij, met een percentage identieke antwoorden van 42,5% tot gevolg. En de meegeleverde checkpoints komen met ongeldige temperaturen — de bibliotheek waarschuwt bij import, wat betekent dat het kalibratiecijfer op de kaart, een verwachte kalibratiefout van 0,466, het getal is dat je daadwerkelijk krijgt voordat je opnieuw fit. Opnieuw fitten per vraagtype brengt het naar 0,081, maar dat is werk dat jij doet, niet werk dat de download doet. Er is een gepubliceerde meertalige tekortkoming die het waard is om volledig te lezen: bij niet-Latijnse schriften is het Engelse checkpoint catastrofaal overmatig zelfverzekerd, met een Khmer-voorbeeld dat 0,000 nauwkeurigheid toont bij 0,952 gemiddelde confidence.
De gepubliceerde zwakheden van Kev betreffen kennis en rekenvaardigheid. Kev-9B scoort 0,837 op zijn eigen afgeschermde nieuwe-brontest — 0,832 voor de 4B en 0,668 voor de 0,8B — en ongeveer 0,822 buiten het domein op de dev-split tegenover 0,857 van Jev. De kloof ontstaat waar wereldkennis vereist is: MMLU ongeveer 70% tegen 90% van Jev, MMLU-Pro 0,515 tegen 0,840, en datumrekenkunde met dagprecisie 60% tegen 93%. Op een smalle routeringsset met vaste labels wint hij — een evaluatie van supportticketroutering zette Kev-9B op 0,952 tegen 0,897 van Jev — maar de auteur zegt expliciet dat dit zijn eigen harness is, dat de trainingsdata van Jev niet zijn vrijgegeven, en dat er daarom geen gecontroleerde vergelijking te construeren valt. Kev blijft ook overmatig zelfverzekerd op nieuwe bronnen; het instellen van KEV_TEMPERATURE=2.0 verlaagde in de eigen tests van het project het aantal zelfverzekerde fouten van 8,7% naar 4,4%, wat aangeeft dat de standaardinstelling niet de veilige instelling is.
Praktisch vertaald: het falen van Laya wordt veroorzaakt door je optieset en je promptopmaak, en je lost het op met fine-tuning en opnieuw fitten. Het falen van Kev wordt veroorzaakt door vragen waarvoor feiten nodig zijn, en je lost het op door het model af te bakenen tot routering en classificatie en de kennisafhankelijke aanroepen elders onder te brengen. Geen van beide oplossingen is een configuratievlag.
Wat er nodig is om hen te dienen
• Hardware — Laya: 421M/322M-encoders, geloofwaardig op CPU voor lage doorvoer en onder een gigabyte resident voor de MLX-port op Apple silicon. Kev: 0,8B tot 9B, waarbij voor de 9B een BF16 CUDA-GPU nodig is, en de Qwen3.5-architectuurflash-linear-attention op CUDA en ROCm vereist.
• Latentie — Laya: 32,8 ms p50 per beslissing op een Tesla T4, 7,2 ms per vraag bij batch 10. Kev: ongeveer 300 ms voor vijf getypte vragen van een 4B-model op een 32GB-Mac in bf16, ongeveer 40 ms op een H100.
• Plafonds — Laya: 512-tokenvenster voor Engels, 1.024 voor meertalig. Kev: keuze uit 1–255 opties, score over 2–255 niveaus, 384 tokens voor de trainingsstatus, met 8.192 tijdens het serveren.
• Server — Laya: in-process Python, plus community-ports voor ONNX, Go en Apple MLX. Kev: een lokale server gebonden aan 127.0.0.1 zonder authenticatie, een npm-SDK en LangChain- en LlamaIndex-adapters.
• Licentie — Apache 2.0 voor beide.
Twee operationele kanttekeningen die niet in de cijfers uit de kop staan. Kev's server is bewust single-request en niet-geauthenticeerd — het is een lokale sidecar, niet iets dat je openbaar maakt. En de latentie van Kev's Mac is wezenlijk slechter dan zijn H100-latentie, omdat de snelle DeltaNet-kernels nog niet voor MLX bestaan, wat precies het soort detail is dat van een 'draait lokaal'-claim een 'draait lokaal op de juiste hardware'-claim maakt.
De generatieve helft van het patroon
Deze beide modellen bestaan om één specifieke aanroep te vervangen: de LLM-aanroep die je deed puur om een label of een waarschijnlijkheid terug te krijgen. Ze vervangen niet de aanroepen waarbij je echt proza nodig hebt. Een supportsysteem dat Kev-9B gebruikt om een ticket te routeren, heeft nog steeds een model nodig om de thread samen te vatten en het antwoord op te stellen, en dat model zal geen 9B-LoRA met een pointer-head zijn.
Dat is de naad waarin OrcaRouter zich bevindt, eerder dan een claim over het hosten van een van beide. Noch Laya noch Kev staat op onze modellenlijst — het zijn gewichten die je downloadt — en het artikel zou misleidend zijn als het iets anders suggereerde. Wat wel op de lijst staat, zijn de meer dan 200 generatieve modellen achter één OpenAI-compatibele sleutel tegen de lijstprijs van de provider, doorgegeven met 0% markup. Als je Kev gebruikt om te bepalen in welk van drie samenvattingsniveaus een verzoek thuishoort, of Laya gebruikt om te beoordelen of een conceptantwoord acceptabel is, dan is de generatieve kant van beide lussen één endpoint met automatische failover in plaats van een tweede contract en een tweede SDK. De routing-DSL is het onderdeel dat het natuurlijkst past bij een beslissingsmodel-architectuur: stel een goedkoop model en een duur model samen in één aanroep en laat de uitvoer van het beslissingsmodel de vertakking kiezen.
Wat nu te kijken
De leemte in het bewijs is voor beide hetzelfde, en die zal door geen van beide projecten worden gedicht. Niemand heeft Laya en Kev op byte-identieke inputs gedraaid met dezelfde prompts, dezelfde optievolgorde en dezelfde sweep over confidence-drempels. Laya's headline-overwinningen komen uit zijn eigen harness; Kev's beweringen over bijna-pariteit komen uit de harness van zijn auteur; de kalibratie-audit waaruit bleek dat Jev's kalibratie sterk per taak varieerde — 44,7% nauwkeurigheid en 0,325 verwachte kalibratiefout op een prioriteitstaak met verborgen beleid — was van een derde partij, en noch Laya noch Kev heeft die behandeling ondergaan. Totdat iemand dat doet, zijn de bovenstaande cijfers de best beschikbare en zijn ze niet onderling vergelijkbaar.
Als je vandaag een beslissing neemt: kies Kev als je deze week een werkend routeringsmodel wilt op een GPU die je al huurt, en accepteer dat het dingen niet zal weten. Kies Laya als je invoer meertalig is of je hardwarebudget een laptop is, en begroot de fine-tuning als onderdeel van het project in plaats van als een latere optimalisatie. Hoe dan ook: meet op je eigen gelabelde data voordat je een betrouwbaarheidsdrempel vóór productieverkeer zet — beide projecten zeggen je dat in hun eigen documentatie.

