Ett genererat titelkort för Laya-mot-von-jämförelsen, med den här artikelns egen underrubrik och en sidfotsrad som anger vilken sidas siffror som är leverantörsrapporterade och vilka som är tredjepartssiffror.
Engineering & Research

Laya vs von: När leverantörsbenchmarket inte är överförbart

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

En klassificeringsuppgift för commit-typ med sex möjliga etiketter, där gissning ger 8,3 % och von får 26,7 %. En filroutningsuppgift där samma modell får 8,8 %, knappt över slumpnivå. En binär uppgift om förändringsbredd med en AUC på 0,513, vilket är en slantsingling. De siffrorna kommer från en tredjepartsutvärdering av von — den öppen källkods-baserade System One-modellen från wfzyx, en 395M ModernBERT-Large-encoder som släpptes under Apache 2.0 den 18 september 2026, samma dag som Convai Innovations Laya. I von:s egen jabr v2-benchmark är bilden den motsatta: 71,5 % makronoggrannhet över 49 uppgifter och 869 fall, valroutning på 83,4 %, och ett ViZDoom-resultat på 9,38 genomsnittliga kills vid under 18 ms mot TypeSafe AI:s Jev på 5,62 kills och ungefär 115 ms. Båda uppsättningarna av siffror är verkliga. Avståndet mellan dem är det mest användbara någon har publicerat om den här modellkategorin, och det gäller även Laya.

Två modeller, två backbones, ett gemensamt felmod

von och Laya är arkitektoniskt nära grannar, vilket är anledningen till att transferproblemet är rätt lins för att jämföra dem. Båda är icke-autoregressiva encoders byggda på ModernBERT: von med 395M parametrar, Layas engelska checkpoint på 421M. Båda exponerar samma tre primitiver — choice från en medföljande lista, score på en ordnad bedömningsmall, noul som en kalibrerad sannolikhet för ja — och båda implementerar /v1/systemone trådformatet så att en klient skriven för TypeSafe's Jev kan peka på en lokal server i stället. Båda är Apache 2.0. Båda returnerar sannolikheter i stället för text, och ingen av dem har en avkodningsloop att hallucinera i.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

Skillnaderna ligger i träningshistorien. von förtränades på 2 biljoner tokens allmän webbtext, teknisk litteratur och kod, och finjusterades sedan på en balanserad flerdomänkorpus med ungefär 290 000 exempel som spänner över operativa och företagsmässiga arbetsflöden, säkerhet och DevOps, trygghet och policymoderering, lingvistik, triage och adversariellt resonemang. Efterträningen använde förstärkningsinlärning med kalibreringsfördelning, som minimerade en sammansättning av korsentropi och Brier-score med lambda på 0,5, och temperaturskalning konvergerade vid T=1,1692. Layas engelska checkpoint är ModernBERT-large finjusterad för den typade beslutsformen, med ett 512-tokensfönster, tillsammans med en 322M mmBERT-base flerspråkig checkpoint som täcker över 100 språk bakom en router, och en publicerad p50 på 32,8 ms per beslut på en Tesla T4.

Det gemensamma felmodet är att båda är enkodare tränade att producera en utläsning, inte resonemangsmaskiner. von:s egen README är explicit med att den riktar sig mot latenskänsliga pipelines där autoregressiva modeller introducerar 500–2 000 ms fördröjning och icke-deterministiska schema-tolkningsfel. Den inramningen säger vad den är till för: snabb, deterministisk, statistiskt kalibrerad klassificering. Den säger inte att den kommer att fungera på din klassificering, och den oberoende benchmarken är vad som händer när någon kontrollerar.

Att läsa von:s egen benchmark ärligt

Resultaten för jabr v2 är publicerade av ägaren och har inte granskats av en oberoende part, och utformningen av benchmarken spelar lika stor roll som poängen. Fyrtionio uppgifter och 869 fall är en rimlig bredd för utvärdering av en beslutsmodell, och 71,5 % makronoggrannhet är en stark siffra för en 395M-encoder. Uppdelningen per domän är där det blir informativt: symtomtriagering på 100,0 %, hemtjänster på 95,7 %, routing i städer på 94,7 %, valrouting totalt på 83,4 %. Det är de uppgifter som träningskorpusen byggdes kring – README beskriver finjusteringsdatan som operativa och företagsinterna arbetsflöden, säkerhet och DevOps, säkerhets- och policymoderering, lingvistik, triagering och adversariellt resonemang. Ett högt resultat på symtomtriagering är ett uttalande om att modellen lärde sig triageringsdomänen, inte att den lärde sig klassificera.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

ViZDoom-resultatet är det som citeras mest, och det förtjänar en noggrann läsning. 9,38 kills i genomsnitt i "Defend the Center", åtta seeds, zero-shot från strukturerad scen-text, vid en latens under 18 ms, mot Jevs 5,62 kills vid omkring 115 ms — en förbättring på +66,9 %. Det är ett slående resultat, och det är också en spelmiljö som drivs av strukturerad text, där en snabb reflexiv policy är exakt rätt form. Projektets inramning av System One-paradigmet — reflexivt, parallellt, deterministiskt, statistiskt kalibrerat — är en rättvisande beskrivning av vad den uppgiften belönar.

Sedan körde tredjepartsutvärderingen von på klassificering av commit-typer, filroutning, funktionsdetektering och poängsättning av ändringsbredd, och den förlorade mot nyckelords- och regexbaslinjer på några av dem. En AUC på 0,513 på den binära uppgiften är den mest slående siffran: en slantsingling, från en modell vars kalibrering trimmades till T=1.1692 och vars README gör anspråk på ett nästan idealt förväntat kalibreringsfel. Båda sakerna kan vara sanna. En modell kan vara välkalibrerad på den fördelning den tränades på och värdelös på en fördelning den aldrig har sett – och i själva verket är bra kalibrering på fel fördelning värre än uppenbart dålig kalibrering, eftersom konfidenstalen ser trovärdiga ut.

Samma test tillämpades på Laya

Laya har fått en version av den här behandlingen, och resultaten stämmer överens med von:s. På TypeSafe:s benchmark för typade beslut får Laya 0,362 zero-shot mot 0,318 för slumpen och 0,461 för majoritetsklassbaslinjen – närmare slumpen än det triviala svaret. Dess eget modellkort anger slutsatsen: ”Laya är en snabb bas för specialisering, inte en zero-shot-beslutsmotor.” Efter ungefär tjugo alternativ försämras den kraftigt och får 0,425 på Banking77 mot Jev:s 0,870. På 100 brådskande meddelanden från Mars-base i ett tredjepartstest fick Jev 100/100 och Laya 53/100. I en benchmark för webbläsaragenter slutförde den 0 av 50 uppgifter och förklarade sig klar i förtid i 33 försök, varav 17 innan den hade vidtagit någon åtgärd – även om benchmarkens författare noterar att den tränades för bedömningsarbete som supportärenden och fakturor, inte navigering, vilket är ett uttalande om omfattning snarare än en dom.

Det som skiljer Laya från von är vad den påstår om sig själv. Convai publicerade den föga smickrande zero-shot-siffran och det förväntade kalibreringsfelet på 0,466 på modellkortet, bredvid 0,081 som temperaturåteranpassning per frågetyp ger. vons README publicerar den smickrande jabr v2-siffran och ViZDoom-vinsten. Båda projekten är ärliga om vad de gjorde; bara ett av dem inleder med ett benchmark där modellen presterar dåligt. Det är en iakttagelse om källanvändning, inte en anklagelse – men om du väljer mellan de två utifrån publicerat underlag, notera att du jämför ett projekt som visade dig sin svaga siffra med ett vars svaga siffra du var tvungen att hitta någon annanstans.

Specifikationskontrasten, dimension för dimension

• Backbone — Laya: ModernBERT-large 421M engelska, mmBERT-base 322M flerspråkig. från: ModernBERT-Large 395M.

• Språk — Laya: över 100 via den flerspråkiga checkpointen och en router. von: engelska, utan någon publicerad flerspråkig checkpoint.

• Kontextfönster — Laya: 512 tokens engelska, 1 024 flerspråkiga. von: publiceras inte på samma villkor; jabr v2-fallen är korta strukturerade beslut.

• Latens — Laya: 32,8 ms p50 på en T4, 7,2 ms per fråga vid batch 10. von: sub-15 ms till sub-25 ms uppgett, sub-18 ms i ViZDoom-körningen.

• Rapporterad noggrannhet — Laya: 0,362 zero-shot, 0,766 finjusterad på benchmarks egen uppdelning, 0,425 på Banking77. von: 71,5 % makro över jabr v2:s 49 uppgifter, 83,4 % valrouting, och 26,7 % på commit-typ i ett oberoende test.

• Kalibrering — Laya: ECE 0,466 vid leverans, 0,081 efter temperaturåteranpassning per frågetyp. von: temperaturen skalad till T=1,1692 under RLCD-efterträning, påstods ha nära idealisk ECE på sin egen distribution.

• Servering — Laya: pip install laya, plus ONNX-, Go- och Apple MLX-portar från communityn. von: Python- och TypeScript-SDK:er, en HTTP-server via von serve, färdigpaketerade förinställningar för triagering av ärenden, e-postsäkerhet, moderering och triagering av säkerhetshändelser.

• Hårdvara — Laya: CPU, CUDA och Apple MPS. från: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS och flertrådad CPU.

• Licens — Apache 2.0 för båda.

Den del av von som är genuint särpräglad

De komponerbara mönstren i von är det mest underdiskuterade i dess repository. Konfidensgrindning, ruttutskick, sammansatt poängsättning och tvåstegsroutning levereras som namngivna mönster tillsammans med förinställningarna – ärendetriage, e-postsäkerhet, moderering, triage av säkerhetshändelser – och de kodifierar arkitekturen som en beslutsmodell faktiskt behöver i produktion. Ett enda choice-anrop är sällan hela systemet; den användbara formen är en billig förstastegsrouter som skickar vidare till ett specialiserat andra steg, med en konfidensgrind som eskalerar de osäkra fallen. von levererar det som ett dokumenterat mönster i stället för att lämna över det till dig.

Det stämmer väl överens med vad OrcaRouter gör på den generativa sidan, vilket är värt att säga rakt ut eftersom de två halvorna av mönstret vanligtvis byggs av olika team. Varken von eller Laya ligger på OrcaRouter – båda är vikter som du laddar ner och kör – och inget här bör läsas som ett påstående att vi tillhandahåller dem. Det som står på vår lista är den andra halvan: 200+ generativa modeller bakom en OpenAI-kompatibel nyckel till leverantörens listpris vidarebefordrat med 0 % påslag, så en prissänkning från en leverantör når din faktura samma dag i stället för vid förnyelsen. Om vons konfidensgrind avgör att 4 % av förfrågningarna behöver en frontiermodell, är routing-DSL:en det som sammanfogar det beslutet till ett enda anrop i stället för två avtal och två SDK:er, och automatisk failover är det som hindrar den dyra grenen från att vara en enda felpunkt.

Vad ska man göra med två modeller som båda misslyckas utanför sin träningsdistribution

Den praktiska slutsatsen av von-utvärderingen är inte att von är en dålig modell. Det är att en beslutsmodells publicerade noggrannhet är ett påstående om dess träningsfördelning, och det enda sättet att veta om ditt problem ligger inom den fördelningen är att testa det. vons egen README-benchmarktabell jämför sig mot GLiNER2, en finjusterad Qwen3.5 4B, Laya och TypeSafe's Jev i fråga om storlek, noggrannhet, latens och hosting – vilket är en användbar tabell, och också en tabell där varje noggrannhetsvärde utom ett kommer från författarens egen testrigg.

Mellan de två: välj von om du vill ha en bredare uppsättning publicerade domäner, ett något mindre fotavtryck, färdigbyggda serveringsmönster för triage och moderering, och ViZDoom-beviset för att den hanterar snabba beslut på strukturerad text väl. Välj Laya om du behöver flerspråkig indata — von har ingen flerspråkig checkpoint och Layas 322M mmBERT-variant täcker över 100 språk — eller om en siffra på 32,8 ms för T4 och ett engelskt fönster på 512 token passar din arbetsbelastning. Välj ingen av dem utan att lägga en eftermiddag på att märka några hundra exempel från din egen trafik och köra båda mot dem. Båda projektens egen dokumentation hänvisar dig till det experimentet, och vons tredjepartsresultat är vad som händer när ingen kör det.

Det enda som skulle förändra den här jämförelsen är en parad utvärdering på identiska indata med ett reliabilitetsdiagram för varje modell. Den finns inte. Tills den gör det är den ärliga rangordningen efter beviskvalitet snarare än efter poäng: Laya har publicerat sitt sämsta tal, von har publicerat sitt bästa, och det oberoende testet av von är det närmaste någon av dem har till en utomstående kontroll.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."