Un cartello del titolo generato per il confronto Laya contro Kev, che riporta il sottotitolo di questo stesso articolo e una riga a piè di pagina che indica quali cifre di ciascuna parte sono riportate dal fornitore e quali sono di terze parti.
Engineering & Research

Laya vs Kev: Due ricette per un modello decisionale locale

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il numero più utile nel confronto Laya contro Kev è una ricevuta. Jared Palmer ha addestrato la famiglia Kev per circa 95 $ di tempo H100 su Modal, più circa tre centesimi di chiamate API per i dati di valutazione, e ha pubblicato la ricetta insieme ai pesi. Convai Innovations ha preso l'altra strada con Laya: rilasciato il 18 settembre 2026, tre giorni dopo Jev di TypeSafe AI, Apache 2.0, pesi su Hugging Face, un pip install laya punto d'ingresso, e nessuna pipeline di addestramento — un checkpoint inglese ModernBERT-large da 421M, uno multilingue mmBERT-base da 322M, e un router che sceglie tra i due. Kev è una famiglia di tre modelli piccoli da 0,8B, 4B e 9B, ciascuno una base congelata più un adattatore LoRA di rango 16 e una piccola testa pointer. Entrambi rispondono a domande tipizzate in un solo forward pass e nessuno dei due genera testo. La decisione tra loro è in realtà una decisione su quale artefatto vuoi possedere: un checkpoint o una ricetta.

Cosa sta effettivamente rilasciando ciascun progetto

Laya fornisce l'inferenza. Il checkpoint inglese è un encoder bidirezionale con una finestra di 512 token; quello multilingue copre oltre 100 lingue con una finestra di 1.024 token e gira circa due volte più veloce; il router rileva la scrittura in meno di mezzo millisecondo. Risponde a choice, score e noul — una scelta da un elenco, un livello atteso su una rubrica ordinata e una probabilità calibrata che un'affermazione sia vera. Esiste un terzo checkpoint, laya-typed-decisions, che è lo stesso backbone da 421M su cui è stato fatto fine-tuning sullo split di training del benchmark typed-decisions. La model card di Convai stessa contiene la frase che dovrebbe guidare il modo in cui leggi ogni numero di Laya: "Laya è una base veloce da specializzare, non un motore decisionale zero-shot."

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Kev repository on GitHub, showing the description "tiny Jev-like family of decision models built on top of Qwen3.5 you can train and run on your own", the Apache-2.0 licence, and the Kev-0.8B, Kev-4B and Kev-9B releases.

Kev rilascia un metodo. Il repository documenta decision-v7: due epoche su 10.000 esempi estratti da dieci dataset pubblici, 896 esempi di policy generati e 1.680 esempi costruiti da 60 strutture di regole generate. Il head assegna un punteggio a ciascuna opzione fornita rispetto al decide token della domanda e applica la softmax al risultato. Poiché i checkpoint di Qwen3.5 combinano l'attenzione con livelli ricorrenti Gated DeltaNet che ignorano le maschere di attenzione, ogni domanda viene eseguita come una riga a sé stante, con lo stato condiviso calcolato una sola volta e messo in cache — ed è così che il modello mantiene le domande isolate l'una dall'altra senza pagare il costo di un nuovo prefill per ogni domanda. Kev rispecchia il contratto pubblico /v1/systemone di TypeSafe, quindi un client SDK TypeSafe esistente può puntare a un server Kev locale cambiando l'URL di base. Il README afferma che nessun output di Jev è stato utilizzato nell'addestramento.

Le due modalità di guasto sono diverse, e questa è la vera storia

Entrambi i modelli perdono contro Jev nei compiti che richiedono di conoscere le cose, ma perdono in modi che richiedono mitigazioni diverse.

Le debolezze pubblicate di Laya riguardano la forma dell'input. Sul benchmark typed-decisions di TypeSafe ottiene 0,362 zero-shot, contro 0,318 per l'indovinare a caso e 0,461 per la baseline della classe maggioritaria — più vicino al caso che alla risposta banale. Oltre circa venti opzioni crolla: 0,425 su Banking77 contro 0,870 di Jev. È abbastanza sensibile all'ordine che un semplice ribaltamento dell'ordine delle opzioni ha fatto scendere l'accuratezza di 13,75 punti in un test di terze parti, lasciando un tasso di risposte identiche del 42,5%. E i checkpoint forniti arrivano con temperature non valide — la libreria avverte all'importazione, il che significa che la cifra di calibrazione sulla scheda, un errore di calibrazione atteso di 0,466, è il numero che si ottiene effettivamente prima di riadattare. Il riadattamento per tipo di domanda lo porta a 0,081, ma è lavoro che fai tu, non lavoro che fa il download. C'è un fallimento multilingue pubblicato che vale la pena leggere per intero: sulle scritture non latine il checkpoint inglese è catastroficamente troppo sicuro di sé, con un esempio in khmer che mostra un'accuratezza di 0,000 con una confidenza media di 0,952.

Le debolezze pubblicate di Kev riguardano la conoscenza e l'aritmetica. Kev-9B ottiene 0,837 sul proprio test bloccato su nuove fonti — 0,832 per il 4B e 0,668 per lo 0,8B — e circa 0,822 fuori dominio sulla split di sviluppo, contro lo 0,857 di Jev. Il divario si apre dove è richiesta conoscenza del mondo: MMLU intorno al 70% contro il 90% di Jev, MMLU-Pro 0,515 contro 0,840, e aritmetica sulle date con precisione al giorno 60% contro 93%. Su un ristretto set di routing a etichette fisse vince — una valutazione di routing dei ticket di assistenza ha collocato Kev-9B a 0,952 contro lo 0,897 di Jev — ma l'autore è esplicito sul fatto che questo è il suo harness personale, che i dati di addestramento di Jev non sono divulgati e che quindi non è costruibile alcun confronto controllato. Kev inoltre resta troppo sicuro di sé su nuove fonti; impostando KEV_TEMPERATURE=2.0 gli errori con alta confidenza sono scesi dall'8,7% al 4,4% nei test del progetto stesso, il che ti dice che l'impostazione predefinita non è quella sicura.

La traduzione pratica: il fallimento di Laya è innescato dal tuo set di opzioni e dalla formattazione del tuo prompt, e lo risolvi con il fine-tuning e il refitting. Il fallimento di Kev è innescato da domande che richiedono fatti, e lo risolvi limitando l'ambito del modello a routing e classificazione e mantenendo altrove le chiamate dipendenti dalla conoscenza. Nessuna delle due soluzioni è un flag di configurazione.

Ciò che occorre per servirli

• Hardware — Laya: encoder 421M/322M, credibili su CPU per throughput ridotto e con meno di un gigabyte di memoria residente per il porting MLX su Apple silicon. Kev: da 0,8B a 9B, che necessita di una GPU CUDA BF16 per il 9B, con l'architettura Qwen3.5 che richiede flash-linear-attention su CUDA e ROCm.

• Latenza — Laya: 32,8 ms p50 per decisione su una Tesla T4, 7,2 ms per domanda con batch 10. Kev: circa 300 ms per cinque domande digitate da un modello 4B su un Mac da 32 GB in bf16, all'incirca 40 ms su un H100.

• Limiti — Laya: finestra di 512 token per l'inglese, 1.024 per il multilingue. Kev: scelta tra 1–255 opzioni, punteggio su 2–255 livelli, 384 token di stato di addestramento con 8.192 in servizio.

• Server — Laya: Python in-process, più port della community per ONNX, Go e Apple MLX. Kev: un server locale associato a 127.0.0.1 senza autenticazione, un SDK npm e adattatori LangChain e LlamaIndex.

• Licenza — Apache 2.0 per entrambi.

Due note operative che non compaiono nei numeri principali. Il server di Kev gestisce una sola richiesta alla volta e non è autenticato per scelta progettuale — è un sidecar locale, non qualcosa da esporre. E la latenza di Kev su Mac è sensibilmente peggiore di quella su H100 perché i kernel veloci di DeltaNet non esistono ancora per MLX, ed è esattamente il tipo di dettaglio che trasforma un'affermazione "gira in locale" in "gira in locale sull'hardware giusto".

La metà generativa del pattern

Entrambi questi modelli esistono per sostituire una chiamata specifica: l'invocazione LLM che facevi unicamente per ottenere in risposta un'etichetta o una probabilità. Non sostituiscono le chiamate in cui hai effettivamente bisogno di prosa. Un sistema di supporto che usa Kev-9B per instradare un ticket ha comunque bisogno di un modello per riassumere il thread e redigere la risposta, e quel modello non sarà un LoRA da 9B con una testa pointer.

Questo è il punto in cui si colloca OrcaRouter, più che un'affermazione sull'hosting dell'uno o dell'altro. Né Laya né Kev figurano nella nostra lista di modelli — sono pesi che scarichi tu — e l'articolo sarebbe fuorviante se lasciasse intendere il contrario. Quello che c'è nella lista sono gli oltre 200 modelli generativi dietro un'unica chiave compatibile con OpenAI, a prezzo di listino del provider, passato senza alcun ricarico. Se usi Kev per decidere a quale di tre livelli di riassunto appartiene una richiesta, o usi Laya per valutare se una bozza di risposta è accettabile, il lato generativo di entrambi i cicli è un unico endpoint con failover automatico, invece di un secondo contratto e un secondo SDK. Il DSL di routing è l'elemento che si adatta più naturalmente a un'architettura basata su un modello decisionale: combinare un modello economico e uno costoso in un'unica chiamata e lasciare che l'output del modello decisionale scelga il ramo.

Cosa guardare dopo

La lacuna nelle prove è la stessa per entrambi, e non sarà colmata da nessuno dei due progetti. Nessuno ha eseguito Laya e Kev su input identici byte per byte con gli stessi prompt, lo stesso ordine delle opzioni e la stessa scansione della soglia di confidenza. Le vittorie di punta di Laya provengono dal suo stesso harness; le asserzioni di quasi parità di Kev provengono dall'harness del suo autore; l'audit di calibrazione che ha rilevato che la calibrazione di Jev variava notevolmente a seconda del task — 44,7% di accuratezza e 0,325 di errore di calibrazione atteso su un task di priorità a policy nascosta — era di una terza parte, e né Laya né Kev sono stati sottoposti a quel trattamento. Finché qualcuno non lo farà, i numeri sopra sono i migliori disponibili e non sono confrontabili tra loro.

Se stai decidendo oggi: scegli Kev se vuoi un modello di routing funzionante questa settimana su una GPU che già noleggi, e accetta che non saprà le cose. Scegli Laya se i tuoi input sono multilingue o se il tuo budget hardware è un laptop, e metti in conto il fine-tuning come parte del progetto anziché come un'ottimizzazione successiva. In ogni caso, misura sui tuoi dati etichettati prima di mettere una soglia di confidenza davanti al traffico di produzione — entrambi i progetti, nella propria documentazione, te lo dicono.

A generated two-column scoreboard comparing Laya and Kev across backbone, context window, latency, benchmark accuracy, many-option performance and licence, with a footer reading "Kev figures are the author's own harness; Laya figures per its model card."