Ett genererat titelkort med texten "Jev vs Laya" ovanför undertexten "33 millisekunder på en T4, och en slumpmässig baslinje", som ställer Jev (sluten, hostad, zero-shot-beslutsmotor, 0,727) mot Laya (Apache 2.0, 421M ModernBERT, körs lokalt, 0,362 zero-shot).
Engineering & Research

Jev vs Laya: 33 millisekunder på en T4, och en slumpmässig baslinje

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Layas modellkort innehåller meningen som avgör den här jämförelsen, och den skrevs av personerna som gjorde Laya. "Laya är en snabb bas för specialisering, inte en zero-shot-beslutsmotor." Convai Innovations släppte Laya den 18 september 2026, tre dagar efter att TypeSafe AI lanserade Jev, under Apache 2.0, med vikter på Hugging Face och en ingångspunkt via pip install laya. Den svarar på typade frågor i en enda framåtpassning utan token-för-token-avkodning, vilket är samma arkitektoniska satsning som Jev gör. Huvudpåståendet är en p50-latens på 32,8 millisekunder per beslut på en Tesla T4, formulerat som ungefär 7,8 gånger snabbare än Jevs publicerade 236–276 ms p50 genom sitt hostade API. Påståendet är sant och det mäter också två olika saker – en lokal GPU mot ett nätverksanrop – och noggrannhetsbilden under den är den del som bör avgöra om du laddar ner den. Zero-shot får Laya 0,362 på TypeSafes benchmark för typade beslut. Slumpmässig gissning får 0,318. Baslinjen för majoritetsklassen får 0,461. Laya, direkt ur lådan, ligger närmare slumpen än den triviala baslinjen.

Vad Laya egentligen är

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability per answer, free output, and the roughly 32,000-token request budget.

Laya levereras som två checkpoints bakom en inbyggd router som dirigerar varje indata till den rätta. Den engelska checkpointen är ModernBERT-large med 421M parametrar och en kontext på 512 token. Den flerspråkiga varianten är mmBERT-base med 322M parametrar och ett fönster på 1 024 token över 100+ språk. Båda är icke-autoregressiva: en enda framåtpassning returnerar svaret, så det finns ingen avkodningsloop, ingen JSON att tolka och inget utrymme där text kan avges utanför den deklarerade typen. Den sista egenskapen är samma strukturella garanti som Jev erbjuder, nådd från en annan riktning, och den är verkligen värdefull för alla som har skrivit återförsökslogik kring en modell som ibland glömmer att stänga en måsvinge.

Jev är den slutna motsvarigheten: TypeSafe AI:s första System One-modell, lanserad den 15 september 2026, hostad och med tidig tillgång, med tre typade primitiver – Choice från en lista du tillhandahåller, Score enligt en ordnad bedömningsmatris och Noul, ett ja/nej-påstående med en kalibrerad sannolikhet. Alla frågor utvärderas parallellt mot en gemensam läsning av tillståndet, utdata är gratis eftersom det inte finns några utdatatoken, och indata kostar $0,042 per miljon token. Dess arkitektur, parameterantal och träningsberäkningskraft är inte offentliggjorda, och TypeSafe har sagt att detaljerna hålls hemliga med en artikel möjligen senare.

Latenspåståendet, korrekt mätt

Layas 32,8 ms p50 på en T4 är en riktig siffra, och en bra sådan. Jämförelsen på 7,8x mot Jevs 236–276 ms är där försiktighet krävs, och Layas eget kort är ovanligt ärligt om varför: Jev-siffrorna är siffror publicerade av tredje part som Convai aldrig själva har mätt, och jämförelsen ställer en lokal GPU-forward-pass mot ett hostat API-anrop som inkluderar nätverksfördröjning tur och retur och köbildning. Bortser man från nätverket är den arkitektoniska jämförelsen mellan två single-pass-modeller, en med 421M parametrar och en med en icke offentliggjord storlek som TypeSafe aldrig har publicerat.

Det finns också ett batchningstal som är värt att känna till: vid en batch på tio rapporterar Laya 7,2 ms per fråga. Det är produktens form. Laya är byggt för att köras lokalt i stor skala, och communityportningar på enheten som laya-mlx utökar det till Apple Silicon. Virala påståenden om "50x snabbare än Jev" stöds inte av projektets egna publicerade benchmarks, och den ärliga beskrivningen är ett stort gap mellan lokalt och moln som delvis är arkitektoniskt och delvis bara skillnaden mellan din GPU och någon annans API.

Vad noggrannhetssiffrorna säger, i ordning

Det är här jämförelsen slutar vara smickrande, och det är värt att lägga fram i tur och ordning eftersom ordningen har betydelse.

• Zero-shot på TypeSafes typed-decisions-benchmark – Laya 0,362, slump 0,318, majoritetsklass 0,461, Jev 0,727. Laya ligger över slumpnivån och under den triviala baslinjen.

• Finjusterad på benchmarkens egen träningssplit — Laya 0,766 mot Jevs 0,727. Laya vinner, och vinsten kommer från en checkpoint som har sett benchmarkens träningsdata, vilket gör att det säger något om finjusteringen, inte om basmodellen.

• Banking77-klassificering av avsikter, där alternativuppsättningen är stor – Laya 0,425 mot Jevs 0,870. Laya försämras kraftigt efter ungefär 20 alternativ, och Jevs Choice-fält är dokumenterade att hantera upp till 255 innan mönstret för tvåstegsbedömning behövs.

• Kalibrering — Laya levereras med ett genomsnittligt förväntat kalibreringsfel på 0,466, som förbättras till 0,081 först efter temperaturåteranpassning per frågetyp. Jev tränas med en metod som TypeSafe kallar RLCD, Reinforcement Learning for Calibrated Decisions, och levererar varje svar med en sannolikhetsfördelning — även om TypeSafe också uppmanar användare att validera tröskelvärden på sina egna märkta data, och en oberoende granskning fann att Jevs kalibrering varierade kraftigt beroende på uppgift.

Mönstret är entydigt. Laya är en stark bas att finjustera och en svag zero-shot-beslutsmotor, och det säger den själv. Jev är en stark zero-shot-beslutsmotor vars kalibrering fortfarande måste kontrolleras för varje driftsättning. Det är olika produkter med olika prisstrukturer, och att välja mellan dem handlar mest om huruvida du har märkta data och en träningsloop.

Kostnadsaritmetiken har inte samma form som Jevs

Jev kostar 0,042 USD per miljon indata-tokens med gratis utdata, vilket är 42 USD per miljard, och ett anrop av maximal storlek vid den dokumenterade budgeten på cirka 32 000 tokens per begäran kostar långt under en cent. Everys oberoende test gjorde 777 bedömningar över 37 dokument för ungefär en fjärdedels cent.

Layas kostnad per anrop är noll vid marginalen och inte noll i aggregerad form, och aggregerat är den inte liten. En modell med 421M parametrar på en T4 är billig att köra och kostar dig fortfarande en GPU, och finjusteringssteget som gör Laya konkurrenskraftig är där den verkliga utgiften ligger — datamärkningen, träningskörningen, utvärderingsramverket och återanpassningen av temperaturen per frågetyp som tar dess kalibreringsfel från 0,466 till 0,081. För en fast taxonomi som aldrig förändras är detta en engångskostnad som betalar sig vid volym. För en taxonomi som förändras över tid är den återkommande, och Jevs zero-shot-baslinje på 0,727 blir en mycket bättre affär.

Det finns en tredje kostnad som är lätt att missa: Layas engelska checkpoint har ett kontextfönster på 512 token. Det är inte en beslutsmodell med en liten kontextbudget – det är en beslutsmodell dimensionerad för ett stycke. Jevs förfrågningsbudget på ungefär 32 000 token är sextio gånger större, och även den ligger en storleksordning under de generativa modeller som båda prissätts mot. Om ditt tillstånd är en supporttråd snarare än ett supportmeddelande, är ingendera modellens fönster den begränsning du bör optimera mot.

Frågan om driftsättning är den verkliga skillnaden

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window and the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 on a T4, and the pip install entry point.

Layas starkaste argument är inte latens. Det är att Apache 2.0-vikter på Hugging Face innebär att beslutet aldrig lämnar din infrastruktur och att slutpunkten aldrig har någon hastighetsbegränsning. För ett routingbeslut som fattas utifrån en medicinsk journal, ett juridiskt dokument eller en kunds kontohistorik är det inte en preferens – det är den avgörande faktorn, och ingen hostad slutpunkt till något pris vinner det argumentet. TypeSafes Jev är early-access och har väntelista, och dess egen dokumentation noterar att hastighetsbegränsningar kan ändras utan förvarning.

Motargumentet är vad du ger upp. Jevs oredovisade större arkitektur utför det arbete som Layas 421M parametrar inte kan: zero-shot-gapet på 0,727 mot 0,362 och Banking77-gapet på 0,870 mot 0,425 är båda mått på hur mycket kunskap som finns inuti modellen innan du tränar den. Layas svar är att du själv tillhandahåller den kunskapen genom finjustering, och på en snäv fast domän fungerar det svaret — det finjusterade resultatet 0,766 är beviset.

Var beslutsfattningslagret ligger i en verklig stack

Ingen av modellerna genererar text, så ingen av dem utgör hela något arbetsflöde. Mönstret som båda är utformade för är två modeller: ett beslutslager som fattar det typade anropet, och en generativ modell som hanterar den del som behöver prosa, kod eller en förklaring. OrcaRouter tillhandahåller inte Jev eller Laya — Jev är TypeSafe:s endpoint för tidig åtkomst och Laya är vikter du kör själv — men den generativa halvan av det mönstret är exakt vad vi täcker: 200+ modeller bakom en enda OpenAI-kompatibel nyckel till leverantörens listpris vidarebefordrat med 0 % påslag, så en prisändring från leverantören är aktiv hos oss samma dag. Tvåmodellsarkitekturen är testbar utan ett andra leverantörsavtal, och med automatisk failover blir den generativa vägen inte en enda felpunkt medan du avgör om det billiga beslutslagret är tillräckligt väl kalibrerat för att automatisera mot.

Domen

Om du har en fast, snäv taxonomi, märkta exempel och ett krav på integritet eller latens som utesluter ett hostat API, är Laya det mer försvarbara valet och de finjusterade siffrorna stöder det. Om du behöver att beslutet fungerar direkt ur lådan, om dina alternativmängder överstiger tjugo kategorier, eller om tillståndet är längre än ett stycke, säger Layas eget modellkort att den inte är produkten för den uppgiften – och zero-shot-poängen på 0,362 mot en majoritetsbaslinje på 0,461 är siffran att hålla i minnet när någon kastar 7,8x-latenssiffran i ansiktet på dig.

Det de två har gemensamt är mer användbart än det som skiljer dem åt. Båda eliminerar den typ av fel som kommer från utdataformatering och gör inget åt den typ som kommer från bedömning. Båda levererar sannolikheter, och ingen av dem har ett publicerat reliabilitetsdiagram som man kan lita på utan att kontrollera. Testa kalibreringen på dina egna märkta fall innan du automatiserar mot någon av dem — latensen är redan kommodifierad och konfidensvärdet är den del som måste förtjänas per driftsättning.

A generated two-column scoreboard comparing Jev and Laya across the same six labelled dimensions, with a footer reading "Laya zero-shot vs random 0.318 and majority baseline 0.461; per Laya's own model card."