
Jev vs Kev: En $95-finjustering som slår Jev i supportärenden
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 578 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 182 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Jared Palmer släppte Kev den 20 september 2026, fem dagar efter att TypeSafe AI lanserade Jev, och det viktiga talet finns inte i benchmark-tabellen. Det finns i README: hela saken kostade cirka 95 USD i H100-tid på Modal, plus tre cent i Jev-API-anrop som användes för att generera utvärderingsdata. Kev är Apache-2.0, går att hosta själv och finns i tre storlekar byggda på Qwen3.5-basvikterna – ungefär 0,8B, 4B och 9B – med en LoRA-adapter med rank 16 och ett pointer-huvud monterat på en fryst bas i stället för en beslutsmodell byggd från grunden. Den speglar Jevs typade besluts-API exakt: Choice, Score och Noul, tillräckligt nära för att vara kompatibel med TypeSafe:s egen Python-SDK. Jev i sin tur lanserades den 15 september 2026 som TypeSafe AI:s slutna, hostade System One-modell, returnerar typade svar med kalibrerad konfidens och ingen text alls, och har aldrig publicerat sin arkitektur, parameterantal, träningsberäkningskraft eller vikter. Jämförelsen är därför egentligen inte en modelljämförelse. Det är ett test av hur mycket av Jevs värde som överlever att återskapas på en eftermiddag för priset av en begagnad laptop.
Vad benchmarkarna faktiskt säger

Rubriken är att Kev kommer nära, och i en snäv uppgift vinner den. På Kevs låsta testset med nya källor fick Kev-9B 0,837 mot Jevs 0,857. På routning av supportärenden över 900 ärenden – scienthoon-setet – fick Kev-9B 0,952 mot Jevs 0,897, vilket är det enda publicerade resultatet där den öppna reproduktionen slår modellen som den reproducerar. Kev ligger också något före i vissa logikigenkänningsuppgifter. På SemiF-beslutsset, ett strukturerat set med 144 frågor, tar Jev hem det med 0,965 mot Kev-9B:s 0,917.
Där Kev förlorar, förlorar den stort. Träffsäkerhet utanför domänen: Kev-8B på 79,6 % mot Jevs 85,7 %. MMLU: 70 % mot 90 %. MMLU-Pro: 0,515 mot 0,840. Datumaritmetik på dagsnivå: 60 % mot 93 %. Mönstret är konsekvent – Kev är konkurrenskraftig vid snäv routning och klassificering där etikettuppsättningen är liten och domänen är fast, och den faller samman på allt som kräver världskunskap eller aritmetik i flera steg, eftersom en rank-16-adapter på en fryst liten basmodell inte är där världskunskapen finns.
Alla dessa siffror kommer från Kevs eget testramverk eller från tredjepartsspårningsverktyg, och Palmers README säger uttryckligen att det inte är en kontrollerad jämförelse – Jevs träningsdata är inte offentliggjord, så det finns inget sätt att bygga en sådan. README:n anger också att inga Jev-utdata användes för träning. Båda friskrivningarna är av det slag som gör siffrorna mer trovärdiga, inte mindre: den som publicerar jämförelsen är den som berättar vad den inte kan bevisa.
Vad du får för $95 som du inte kan få från Jev till något pris

Kostnadsjämförelsen är där de två produkterna slutar vara jämförbara över huvud taget. Jev kostar $0,042 per miljon indatatokens med gratis utdata, vilket är billigt på ett sätt som är genuint svårt att slå per anrop — men det är ett hostat API för tidig åtkomst med en väntelista, och TypeSafe har sagt att hastighetsgränser kan ändras utan varsel. Kev är vikter du laddar ner. Marginalkostnaden för den tio miljonte klassificeringen är din egen el.
Fyra saker följer av det, och ingen av dem handlar om benchmarkpoäng.
• Inga data lämnar din infrastruktur. Jev är en hostad slutpunkt; varje tillstånd du skickar till den – supportärendet, loggposten, journalen – går till TypeSafe. Kev körs på din egen GPU, vilket för reglerade arbetsbelastningar inte är en preferens utan den avgörande faktorn.
• Inga hastighetsbegränsningar, ingen väntelista, ingen risk för utfasning. TypeSafe:s egen dokumentation anger att hastighetsbegränsningar kan ändras utan varsel. En lokal kontrollpunkt har ingen sådan klausul.
• Du kan finjustera den. Kev är en bas att specialisera, och LoRA-receptet som producerade den är offentligt. Om din routing-taxonomi har 40 klasser som ingen generell modell hanterar bra kan du träna på dina egna etiketter — vilket är precis vad Palmer gjorde, till en kostnad mätt i tiotals dollar snarare än i ett ML-team.
• Det är upp till dig att ändra kontexttaket. Jevs dokumenterade anropsbudget är ungefär 32 000 tokens och Choice-fält har en gräns på 255 alternativ. Kev ärver Qwen3.5:s fönster, som är mycket större, och alternativgränsen är en implementationsdetalj i din egen serveringsstack snarare än en leverantörsgräns.
Vad Jev fortfarande har som Kev inte har
Kalibreringspåståendet är det som inte överförs helt rent, och det är kärnan i TypeSafe:s pitch. Jev tränas med en metod som TypeSafe kallar RLCD – Reinforcement Learning for Calibrated Decisions – som optimerar för att konfidensvärdet ska vara ärligt snarare än för att svaret ska vara det föredragna. Varje Jev-svar levereras med en sannolikhetsfördelning över alternativen, så din kod kan sätta trösklar: agera automatiskt i det övre bandet, flagga i mitten, eskalera i det nedre.
Kev producerar samma typade form och samma sannolikhetsutdata, eftersom API:et är avsiktligt kompatibelt. Huruvida dessa sannolikheter är kalibrerade är en annan fråga, och det ärliga svaret är att ingen har publicerat ett reliabilitetsdiagram för någon av modellerna. En separat kalibreringsrevision rapporterade att Jev uppnådde 44,7 % träffsäkerhet med ett förväntat kalibreringsfel på 0,325 på en prioritetsuppgift med dold policy, vilket tyder på att kalibreringen för Jev varierar kraftigt mellan uppgifter snarare än att vara en universell egenskap – och TypeSafe självt uppmanar användare att testa konfidenströsklar mot sina egna märkta exempel i stället för att lita på det publicerade beteendet.
Det andra som Jev har är att den inte tränades på Qwen3.5. En 9B-modell med en rank-16-adapter har ett kunskapstak, och gapet i MMLU-Pro på 0,515 mot 0,840 är det taket synliggjort. Om ditt routingbeslut ibland kräver att man vet vad en sak är, utför Jevs större icke avslöjade arkitektur arbete som Kevs adapter inte kan.
Latens och distributionsformen
Jevs dokumenterade end-to-end-latens är 70–500 ms mot 3–329 sekunder för frontier-LLM-anrop i TypeSafes egen jämförelse, och att lägga till frågor i ett anrop påverkar den knappt eftersom varje fråga utvärderas parallellt mot en gemensam läsning av tillståndet. Kev-9B på en H100 kommer att ligga i samma storleksordning för en enda framåtpassning, men jämförelsen är inte rättvis åt något håll: en självhostad 9B på en delad GPU under belastning har inte samma latens som en hostad slutpunkt, och en hostad slutpunkt är inte samma sak som en maskin i ditt eget rack. Vad som kan sägas utan förbehåll är att båda är tillräckligt snabba för användning per tur i en agentloop, och att Kevs latens är en funktion av hårdvara du kontrollerar snarare än en servicenivå du blir lovad.
Den ärliga tolkningen av reproduktionen
Att Kev överhuvudtaget existerar ger en indikation om Jev, och det förtjänar att nämnas. En sluten modell vars beteende kan approximeras på fem dagar för 95 dollar, av en person, på offentliga basvikter, säger dig något om hur mycket av dess försprång som är arkitektur och hur mycket som är träningsdata och modellservering. Det följer inte att Jev är lätt att bygga – API-ytan är lätt att kopiera, men kalibreringen är det inte. Men det betyder att vallgraven inte är gränssnittet, och den som utvärderar Jev för en produktionsväg bör räkna med möjligheten att en finjustering av en öppen bas tar dem större delen av vägen för en bråkdel av åtagandet.
Vilket också är argumentet för att ännu inte satsa en produktionsväg på någon av dem. Om du utvärderar Jev är det kloka förhållningssättet att prova det utan att binda sig till det – och OrcaRouter tillhandahåller inte Jev, eftersom TypeSafe:s modell är i early access och använder sitt eget förfrågningsformat. Det vi däremot täcker är den generativa halvan av arbetsflödet som dessa beslutsmodeller ingår i: 200+ modeller bakom en enda OpenAI-kompatibel nyckel till leverantörens listpris som förs vidare med 0 % påslag, med automatisk failover. En tvåmodellsarkitektur där ett billigt beslutsskikt sorterar trafiken och en generativ modell hanterar resten kan testas hos oss utan ett andra leverantörsavtal, och om beslutskomponenten visar sig vara dåligt kalibrerad på dina data är det failover-vägen som förhindrar att det blir en incident.
Domen
Om din beslutsuppgift är smal, fast domän, högvolym och integritetskänslig är Kev det mer försvarbara valet i dag, och det är inte ens nära — du äger vikterna, du kontrollerar datavägen, du kan finjustera på dina egna etiketter, och för dirigering av supportärenden slår 9B-checkpointen redan Jev enligt Jevs egna publicerade siffror. Om din beslutsuppgift kräver världskunskap, flerstegsaritmetik eller ett konfidensvärde som du tänker automatisera mot, utför Jevs större icke-offentliggjorda modell och dess RLCD-träning verkligt arbete, och Kevs adapter är inte ett substitut för någon av dem.
Det enda som ingen av jämförelserna avgör är kalibreringen, för ingen har publicerat ett reliabilitetsdiagram för någon av modellerna. Testa det på dina egna etiketterade fall innan du automatiserar mot någon av dem – konfidensvärdet är den del av båda produkterna som måste förtjänas per driftsättning, och hastigheten är den del som redan är kommodifierad.

