
Laya vs von: Wanneer de leveranciersbenchmark niet overdraagbaar is
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Een committype-classificatietaak met zes mogelijke labels, waarbij gokken je 8,3% oplevert en von 26,7% scoort. Een bestandsrouteringstaak waarbij hetzelfde model 8,8% scoort, nauwelijks boven kans. Een binaire wijzigingsbreedtetaak met een AUC van 0,513, wat een muntworp is. Die cijfers komen uit een evaluatie door een derde partij van von — het open-source System One-model van wfzyx, een 395M ModernBERT-Large-encoder die op 18 september 2026 onder Apache 2.0 is uitgebracht, dezelfde dag als Laya van Convai Innovations. Op de eigen jabr v2-benchmark van von is het beeld tegenovergesteld: 71,5% macro-nauwkeurigheid over 49 taken en 869 gevallen, keuzeroutering op 83,4%, en een ViZDoom-resultaat van 9,38 gemiddelde kills bij minder dan 18 ms tegen Jev van TypeSafe AI met 5,62 kills en ongeveer 115 ms. Beide sets cijfers zijn echt. De kloof ertussen is het nuttigste dat iemand over deze modelcategorie heeft gepubliceerd, en die geldt ook voor Laya.
Twee modellen, twee backbones, één gedeelde faalmodus
von en Laya liggen architectonisch dicht bij elkaar, daarom is het transferprobleem de juiste lens om ze te vergelijken. Beide zijn niet-autoregressieve encoders gebouwd op ModernBERT: von met 395M parameters, Laya's Engelse checkpoint met 421M. Beide bieden dezelfde drie primitieven — choice uit een aangeleverde lijst, score op een geordende rubric, noul als een gekalibreerde kans op ja — en beide implementeren het /v1/systemone wire-formaat, zodat een client die voor TypeSafe's Jev is geschreven in plaats daarvan naar een lokale server kan wijzen. Beide zijn Apache 2.0. Beide retourneren waarschijnlijkheden in plaats van tekst, en geen van beide heeft een decoderingslus waarin gehallucineerd kan worden.

De verschillen zitten in het trainingsverhaal. von was voorgetraind op 2 biljoen tokens algemene webtekst, technische literatuur en code, en vervolgens fine-tuned op een gebalanceerd multi-domeincorpus van ongeveer 290.000 voorbeelden dat zich uitstrekt over operationele en enterprise-workflows, security en DevOps, veiligheid en beleidsmoderatie, taalkunde, triage en adversariële redenering. De post-training gebruikte Reinforcement Learning with Calibration Distribution, waarbij een samengestelde maat van cross-entropie en Brier-score werd geminimaliseerd met lambda op 0,5, en temperatuurschaling convergeerde bij T=1,1692. Het Engelse checkpoint van Laya is ModernBERT-large, fine-tuned voor de typed-decision-vorm, met een venster van 512 tokens, naast een meertalig checkpoint mmBERT-base met 322M dat meer dan 100 talen achter een router dekt, en een gepubliceerde p50 van 32,8 ms per beslissing op een Tesla T4.
De gedeelde faalmodus is dat beide encoders zijn die zijn getraind om een readout te produceren, geen redeneerders. von's eigen README is expliciet dat het zich richt op latencygevoelige pijplijnen waarin autoregressieve modellen 500–2.000 ms vertraging en niet-deterministische schema-parsingfouten introduceren. Die framing vertelt je waarvoor het dient: snelle, deterministische, statistisch gekalibreerde classificatie. Het vertelt je niet dat het op jouw classificatie zal werken, en de onafhankelijke benchmark is wat er gebeurt wanneer iemand het controleert.
Het eerlijk lezen van von's eigen benchmark
De resultaten van jabr v2 zijn door de eigenaar gepubliceerd en zijn niet onafhankelijk geauditeerd, en de vorm van de benchmark is net zo belangrijk als de score. Negenveertig taken en 869 casussen vormen een redelijke breedte voor een evaluatie van een beslissingsmodel, en 71,5% macro-nauwkeurigheid is een sterk cijfer voor een 395M-encoder. De uitsplitsing per domein is waar het informatief wordt: symptoomtriage op 100,0%, diensten aan huis op 95,7%, stadsroutering op 94,7%, keuzeroutering in totaal op 83,4%. Dat zijn de taken waar het trainingscorpus omheen is gebouwd — de README beschrijft de fine-tuningdata als operationele en bedrijfsmatige workflows, security en DevOps, veiligheids- en beleidsmoderatie, taalkunde, triage en adversariële redenering. Een hoge score op symptoomtriage zegt dat het model het triagedomein heeft geleerd, niet dat het heeft leren classificeren.

Het ViZDoom-resultaat is het resultaat dat het vaakst wordt aangehaald, en het verdient een zorgvuldige lezing. 9,38 gemiddelde kills in "Defend the Center", acht seeds, zero-shot op basis van gestructureerde scènetekst, met een latentie van minder dan 18 ms, tegenover de 5,62 kills van Jev bij ongeveer 115 ms — een verbetering van +66,9%. Het is een opvallend resultaat, en het is ook een spelomgeving die wordt aangestuurd door gestructureerde tekst, waar een snel reflexief beleid precies de juiste vorm heeft. De manier waarop het project het System One-paradigma kadert — reflexief, parallel, deterministisch, statistisch gekalibreerd — is een terechte beschrijving van wat die taak beloont.
Vervolgens voerde de externe evaluatie von uit op commit-typeclassificatie, bestandsroutering, functiedetectie en het scoren van wijzigingsbreedte, en op sommige daarvan verloor het van keyword- en regex-baselines. Een AUC van 0,513 op de binaire taak is het meest onthullende cijfer: een muntworp, van een model waarvan de kalibratie op T=1,1692 is afgestemd en waarvan de README een vrijwel ideale verwachte kalibratiefout claimt. Beide dingen kunnen waar zijn. Een model kan goed gekalibreerd zijn op de distributie waarop het is getraind en nutteloos op een distributie die het nooit heeft gezien — en goede kalibratie op de verkeerde distributie is zelfs erger dan overduidelijk slechte kalibratie, omdat de betrouwbaarheidscijfers dan betrouwbaar lijken.
Dezelfde test toegepast op Laya
Laya heeft een versie van deze behandeling ondergaan, en de resultaten komen overeen met die van von. Op de typed-decisions-benchmark van TypeSafe scoort Laya 0.362 zero-shot tegenover 0.318 voor random en 0.461 voor de majority-class-baseline — dichter bij kans dan bij het triviale antwoord. In zijn eigen modelcard staat de conclusie: "Laya is een snelle basis om op te specialiseren, geen zero-shot beslissingsengine." Voorbij ongeveer twintig opties gaat het sterk achteruit: het scoort 0.425 op Banking77 tegenover 0.870 voor Jev. Bij 100 Mars-base urgentieberichten in één test door een derde partij scoorde Jev 100/100 en Laya 53/100. In een browser-agent-benchmark voltooide het 0 van de 50 taken, waarbij het in 33 pogingen voortijdig voltooiing uitriep, 17 daarvan voordat het enige actie had ondernomen — hoewel de auteurs van de benchmark opmerken dat het is getraind voor beoordelingstaken zoals supporttickets en facturen, niet voor navigatie, wat een afbakening van het toepassingsgebied is en geen eindoordeel.
Waarin Laya van von verschilt, is wat het over zichzelf beweert. Convai publiceerde het onflatteuze zero-shot-getal en de 0,466 verwachte kalibratiefout op de modelkaart, naast de 0,081 die het opnieuw fitten van de temperatuur per vraagtype oplevert. De README van von publiceert het flatteuze jabr v2-getal en de ViZDoom-overwinning. Beide projecten zijn eerlijk over wat ze hebben gedaan; slechts één van hen opent met een benchmark waarin het model slecht presteert. Dat is een observatie over de bronvermelding, geen beschuldiging — maar als je tussen de twee kiest op basis van gepubliceerd bewijs, bedenk dan dat je een project dat je zijn zwakke getal toonde, vergelijkt met een project waarvan je het zwakke getal elders moest zoeken.
Het specificatiecontrast, dimensie voor dimensie
• Backbone — Laya: ModernBERT-large 421M Engels, mmBERT-base 322M meertalig. van: ModernBERT-Large 395M.
• Talen — Laya: 100+ via het meertalige checkpoint en een router. von: Engels, zonder gepubliceerd meertalig checkpoint.
• Contextvenster — Laya: 512 tokens Engels, 1.024 meertalig. von: niet in dezelfde bewoordingen gepubliceerd; de jabr v2-zaken zijn korte gestructureerde beslissingen.
• Latentie — Laya: 32,8 ms p50 op een T4, 7,2 ms per vraag bij batch 10. von: sub-15 ms tot sub-25 ms geclaimd, sub-18 ms in de ViZDoom-run.
• Gerapporteerde nauwkeurigheid — Laya: 0,362 zero-shot, 0,766 fine-tuned op de eigen split van de benchmark, 0,425 op Banking77. von: 71,5% macro over de 49 taken van jabr v2, 83,4% choice routing, en 26,7% op commit type in een onafhankelijke test.
• Kalibratie — Laya: ECE 0,466 bij uitlevering, 0,081 na het opnieuw fitten van de temperatuur per vraagtype. von: temperatuur geschaald naar T=1,1692 tijdens RLCD-posttraining, claimde een bijna-ideale ECE op zijn eigen distributie.
• Serving — Laya: pip install laya, plus communityports voor ONNX, Go en Apple MLX. von: Python- en TypeScript-SDK's, een HTTP-server via von serve, kant-en-klare presets voor ticket-triage, e-mailbeveiliging, moderatie en triage van beveiligingsgebeurtenissen.
• Hardware — Laya: CPU, CUDA en Apple MPS. van: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS en multithreaded CPU.
• Licentie — Apache 2.0 voor beide.
Het deel van von dat werkelijk onderscheidend is
De composable patronen van von zijn het meest onderbelichte onderdeel van zijn repository. Confidence-gating, route-dispatch, compositescoring en tweefasige routing worden geleverd als benoemde patronen naast de presets — ticket-triage, e-mailbeveiliging, moderatie, triage van beveiligingsgebeurtenissen — en ze coderen de architectuur die een beslissingsmodel in productie daadwerkelijk nodig heeft. Een enkele keuze-aanroep is zelden het hele systeem; de bruikbare vorm is een goedkope router in de eerste fase die doorverwijst naar een gespecialiseerde tweede fase, met een confidence-gate die de onzekere gevallen escaleert. von levert dat als een gedocumenteerd patroon in plaats van het aan jou over te laten.
Dat sluit naadloos aan bij wat OrcaRouter doet aan de generatieve kant, wat je maar beter ronduit kunt zeggen, omdat de twee helften van het patroon doorgaans door verschillende teams worden gebouwd. Noch von noch Laya wordt gehost op OrcaRouter — beide zijn gewichten die je downloadt en zelf draait — en niets hier mag worden gelezen als een bewering dat wij ze aanbieden. Wat wel op onze lijst staat, is de andere helft: 200+ generatieve modellen achter één OpenAI-compatibele sleutel tegen de lijstprijs van de provider, doorgegeven met 0% opslag, zodat een prijsverlaging van een leverancier dezelfde dag nog op je factuur te zien is in plaats van pas bij de verlenging. Als von's confidence gate besluit dat 4% van de verzoeken een frontier-model nodig heeft, is de routing-DSL wat die beslissing samenbrengt in één aanroep in plaats van twee contracten en twee SDK's, en automatische failover is wat voorkomt dat de dure tak een single point of failure wordt.
Wat te doen met twee modellen die beide buiten hun trainingsdistributie falen
De praktische conclusie van de von-evaluatie is niet dat von een slecht model is. Het is dat de gepubliceerde nauwkeurigheid van een beslissingsmodel een bewering is over de trainingsdistributie ervan, en de enige manier om te weten of je probleem binnen die distributie valt, is het testen. von's eigen README-benchmarktabel vergelijkt zichzelf met GLiNER2, een fijngetunede Qwen3.5 4B, Laya en TypeSafe's Jev op grootte, nauwkeurigheid, latentie en hosting — wat een nuttige tabel is, en ook een tabel waarin elke nauwkeurigheidsvermelding op één na uit de eigen meetomgeving van de auteur komt.
Van de twee: neem von als je een bredere set gepubliceerde domeinen wilt, een iets kleinere footprint, vooraf gebouwde serving-patronen voor triage en moderatie, en het ViZDoom-bewijs dat het snelle beslissingen op gestructureerde tekst goed aankan. Neem Laya als je meertalige invoer nodig hebt — von heeft geen meertalig checkpoint en de 322M mmBERT-variant van Laya dekt meer dan 100 talen — of als een 32,8 ms T4-waarde en een Engelstalig venster van 512 tokens bij je workload passen. Neem geen van beide zonder een middag te besteden aan het labelen van een paar honderd voorbeelden uit je eigen verkeer en beide daartegen te draaien. De eigen documentatie van beide projecten wijst je op dat experiment, en het von-resultaat van derden is wat er gebeurt als niemand het uitvoert.
Het enige dat deze vergelijking zou veranderen, is een gepaarde evaluatie op identieke inputs met een betrouwbaarheidsdiagram voor elk model. Die bestaat niet. Totdat die bestaat, is de eerlijke rangschikking gebaseerd op bewijskwaliteit in plaats van op score: Laya heeft zijn slechtste cijfer gepubliceerd, von heeft zijn beste gepubliceerd, en de onafhankelijke test van von komt voor beide het dichtst bij een externe controle.

