
Jev vs Kev: un fine-tuning da $95 che batte Jev sui ticket di supporto
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 578 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 182 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Jared Palmer ha rilasciato Kev il 20 settembre 2026, cinque giorni dopo che TypeSafe AI ha lanciato Jev, e il numero importante non è nella tabella dei benchmark. È nel README: l'intera operazione è costata circa 95 dollari di tempo H100 su Modal, più tre centesimi di chiamate API a Jev usate per generare i dati di valutazione. Kev è Apache-2.0, self-hostable, e arriva in tre dimensioni costruite sui pesi di base Qwen3.5 — all'incirca 0,8B, 4B e 9B — con un adattatore LoRA di rango 16 e una pointer head avvitata su una base congelata anziché un modello decisionale costruito da zero. Rispecchia esattamente l'API di decisione tipizzata di Jev: Choice, Score e Noul, abbastanza vicina da essere compatibile con l'SDK Python di TypeSafe. Jev, dal canto suo, è stato lanciato il 15 settembre 2026 come modello System One chiuso e ospitato di TypeSafe AI, restituisce risposte tipizzate con confidenza calibrata e nessun testo, e non ha mai pubblicato la sua architettura, il numero di parametri, il compute di addestramento o i pesi. Il confronto, quindi, non è davvero un confronto tra modelli. È una prova di quanto del valore di Jev sopravviva all'essere riprodotto in un pomeriggio al prezzo di un portatile usato.
Cosa dicono davvero i benchmark

La notizia principale è che Kev si avvicina, e su un compito ristretto vince. Sul set di test bloccato di nuove fonti di Kev, Kev-9B ha ottenuto 0,837 contro 0,857 di Jev. Sull'instradamento dei ticket di supporto su 900 ticket — il set scienthoon — Kev-9B ha ottenuto 0,952 contro 0,897 di Jev, che è l'unico risultato pubblicato in cui la riproduzione aperta batte il modello che riproduce. Kev è anche leggermente in vantaggio su alcuni compiti di riconoscimento logico. Sui set decisionali SemiF, un set strutturato di 144 domande, Jev la spunta per 0,965 contro 0,917 di Kev-9B.
Dove Kev perde, perde malamente. Accuratezza fuori dominio: Kev-8B al 79,6% contro l'85,7% di Jev. MMLU: 70% contro 90%. MMLU-Pro: 0,515 contro 0,840. Aritmetica delle date a precisione giornaliera: 60% contro 93%. Il pattern è coerente — Kev è competitivo su routing ristretto e classificazione dove l'insieme di etichette è piccolo e il dominio è fisso, e crolla su qualsiasi cosa che richieda conoscenza del mondo o aritmetica multi-step, perché un adattatore di rango 16 su un piccolo modello base congelato non è dove risiede la conoscenza del mondo.
Ognuna di quelle cifre proviene dall'harness personale di Kev o da tracker di terze parti, e il README di Palmer dice chiaramente che non si tratta di un confronto controllato — i dati di addestramento di Jev non sono divulgati, quindi non c'è modo di costruirne uno. Il README afferma anche che nessun output di Jev è stato utilizzato per l'addestramento. Entrambi i disclaimer sono del tipo che rende i numeri più affidabili, non meno: chi pubblica il confronto è quello che ti dice cosa non può dimostrare.
Quello che ottieni per 95 $ che non puoi ottenere da Jev a nessun prezzo

Il confronto dei costi è il punto in cui i due prodotti smettono del tutto di essere paragonabili. Jev costa $0,042 per milione di token di input, con output gratuito, il che è economico in un modo davvero difficile da battere su base per chiamata — ma è un'API ospitata, in accesso anticipato e con lista d'attesa, e TypeSafe ha dichiarato che i limiti di utilizzo potrebbero cambiare senza preavviso. Kev sono pesi che scarichi. Il costo marginale della decimilionesima classificazione è la tua stessa elettricità.
Da ciò conseguono quattro cose, e nessuna di esse riguarda i punteggi dei benchmark.
• Nessun dato lascia la tua infrastruttura. Jev è un endpoint ospitato; ogni stato che gli invii — il ticket di supporto, la riga di log, la cartella clinica — va a TypeSafe. Kev gira sulla tua GPU, il che per i carichi di lavoro soggetti a regolamentazione non è una preferenza ma il fattore decisivo.
• Nessun limite di frequenza, nessuna lista d'attesa, nessun rischio di deprecazione. La documentazione di TypeSafe stessa osserva che i limiti di frequenza possono cambiare senza preavviso. Un checkpoint locale non ha tale clausola.
• Puoi metterlo a punto. Kev è una base da specializzare, e la ricetta LoRA che lo ha prodotto è pubblica. Se la tua tassonomia di routing ha 40 classi che nessun modello generale gestisce bene, puoi addestrarlo sulle tue etichette — esattamente ciò che ha fatto Palmer, a un costo che si misura in decine di dollari, non in un team di ML.
• Il tetto del contesto sta a te cambiarlo. Il budget di richieste documentato di Jev è di circa 32.000 token e i campi Choice hanno un tetto di 255 opzioni. Kev eredita la finestra di Qwen3.5, che è molto più ampia, e il tetto delle opzioni è un dettaglio implementativo del tuo stack di serving, non un limite del fornitore.
Quello che Jev ha ancora e che Kev non ha
L'affermazione sulla calibrazione è quella che non si trasferisce in modo pulito, ed è il cuore della proposta di TypeSafe. Jev è addestrato con un metodo che TypeSafe chiama RLCD — Reinforcement Learning for Calibrated Decisions — che ottimizza per l'onestà del valore di confidenza piuttosto che per la preferenza della risposta. Ogni risposta di Jev viene fornita con una distribuzione di probabilità sulle opzioni, così il tuo codice può impostare delle soglie: agire automaticamente nella fascia alta, segnalare in quella media, escalare in quella bassa.
Kev produce la stessa forma tipizzata e gli stessi output di probabilità, perché l'API è deliberatamente compatibile. Se poi tali probabilità siano calibrate è una questione diversa, e la risposta onesta è che nessuno ha pubblicato un diagramma di affidabilità per nessuno dei due modelli. Un audit di calibrazione separato ha riportato che Jev otteneva un'accuratezza del 44,7% con un errore di calibrazione atteso di 0,325 su un compito di priorità con policy nascosta, il che suggerisce che la calibrazione di Jev varii nettamente da compito a compito anziché essere una proprietà universale — e TypeSafe stessa invita gli utenti a testare le soglie di confidenza sui propri esempi etichettati anziché fidarsi del comportamento pubblicato.
L'altra cosa che Jev ha è che non è stato addestrato su Qwen3.5. Un modello da 9B con un adattatore di rango 16 ha un tetto di conoscenza, e il divario MMLU-Pro tra 0,515 e 0,840 è quel tetto reso visibile. Se la tua decisione di routing a volte richiede di sapere che cos'è una cosa, l'architettura più grande e non divulgata di Jev sta facendo un lavoro che l'adattatore di Kev non può fare.
Latenza e forma del deployment
La latenza end-to-end documentata di Jev è di 70–500 ms, rispetto a 3–329 secondi per le chiamate ai LLM di frontiera nel confronto di TypeSafe stesso, e aggiungere domande a una chiamata non la sposta quasi per nulla, perché ogni domanda viene valutata in parallelo rispetto a un'unica lettura condivisa dello stato. Kev-9B su una H100 sarà nello stesso ordine di grandezza per un singolo forward pass, ma il confronto non è alla pari in nessuna delle due direzioni: un 9B self-hosted su una GPU condivisa sotto carico non ha la stessa latenza di un endpoint ospitato, e un endpoint ospitato non è la stessa cosa di una macchina nel tuo rack. Ciò che si può dire senza cautele è che entrambi sono abbastanza veloci per l'uso turno per turno in un loop di agente, e che la latenza di Kev è una funzione dell'hardware che controlli, non di un livello di servizio che ti viene promesso.
La lettura onesta della riproduzione
Il fatto stesso che Kev esista è una prova riguardo a Jev, e vale la pena nominarlo. Un modello chiuso il cui comportamento può essere approssimato in cinque giorni per 95 dollari, da una sola persona, su pesi base pubblici, ti sta dicendo qualcosa su quanto del suo vantaggio sia architettura e quanto siano dati di addestramento e serving. Non ne consegue che Jev sia facile da costruire — la superficie dell'API è facile da copiare, e la calibrazione non lo è. Ma significa che il fossato non è l'interfaccia, e chiunque valuti Jev per un percorso di produzione dovrebbe mettere in conto la possibilità che un fine-tuning di una base aperta gli faccia fare gran parte del percorso per una frazione dell'impegno.
Il che è anche l'argomento per non puntare ancora un percorso di produzione su nessuno dei due. Se stai valutando Jev, la posizione sensata è provarlo senza impegnarti — e OrcaRouter non serve Jev, perché il modello di TypeSafe è in accesso anticipato e parla una propria forma di richiesta. Ciò che copriamo è la metà generativa del flusso di lavoro in cui si inseriscono questi modelli decisionali: oltre 200 modelli dietro un'unica chiave compatibile con OpenAI al prezzo di listino del provider trasferito con 0% di ricarico, con failover automatico. Un'architettura a due modelli in cui un livello decisionale economico smista il traffico e un modello generativo gestisce il resto è testabile dalla nostra parte senza un secondo contratto con un fornitore, e se il componente decisionale risulta mal calibrato sui tuoi dati, il percorso di failover è ciò che impedisce che tutto ciò diventi un incidente.
Il verdetto
Se il tuo compito decisionale è ristretto, a dominio fisso, ad alto volume e sensibile alla privacy, oggi Kev è la scelta più difendibile, e non c'è partita: possiedi i pesi, controlli il percorso dei dati, puoi fare fine-tuning sulle tue etichette e, sull'instradamento dei ticket di supporto, il checkpoint 9B batte già Jev sui suoi stessi numeri pubblicati. Se invece il tuo compito decisionale richiede conoscenza del mondo, aritmetica multi-step o un valore di confidenza su cui intendi basare l'automazione, il modello più grande e non divulgato di Jev e il suo addestramento RLCD stanno facendo un lavoro reale, e l'adattatore di Kev non sostituisce né l'uno né l'altro.
L'unica cosa che nessuno dei due confronti risolve è la calibrazione, perché nessuno ha pubblicato un diagramma di affidabilità per nessuno dei due modelli. Verificalo sui tuoi casi etichettati prima di automatizzare con l'uno o con l'altro — il valore di confidenza è la parte di entrambi i prodotti che deve essere guadagnata per ogni distribuzione, e la velocità è la parte che è già una commodity.

