
Jev vs Laya: 33 millisecondi su una T4, e una baseline casuale
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La scheda del modello di Laya contiene la frase che decide questo confronto, ed è stata scritta dalle persone che hanno creato Laya. "Laya è una base veloce da specializzare, non un motore decisionale zero-shot." Convai Innovations ha rilasciato Laya il 18 settembre 2026, tre giorni dopo che TypeSafe AI ha lanciato Jev, sotto Apache 2.0, con i pesi su Hugging Face e un pip install laya punto di ingresso. Risponde a domande tipizzate in un singolo forward pass senza decodifica token per token, che è la stessa scommessa architetturale fatta da Jev. L'affermazione principale è una latenza p50 di 32,8 millisecondi per decisione su una Tesla T4, presentata come circa 7,8 volte più veloce rispetto ai 236–276 ms di p50 pubblicati da Jev tramite la sua API ospitata. L'affermazione è reale e misura anche due cose diverse — una GPU locale contro una chiamata di rete — e il quadro di accuratezza che vi sta sotto è la parte che dovrebbe determinare se scaricarlo. In modalità zero-shot, Laya ottiene 0,362 sul benchmark typed-decisions di TypeSafe. L'indovinare a caso ottiene 0,318. La baseline della classe maggioritaria ottiene 0,461. Laya, così com'è, si avvicina di più a una scelta casuale che alla baseline banale.
Che cos'è davvero Laya

Laya viene distribuita come due checkpoint dietro un router integrato che indirizza ogni input a quello giusto. Il checkpoint inglese è ModernBERT-large con 421M parametri e un contesto di 512 token. La variante multilingue è mmBERT-base con 322M parametri e una finestra di 1.024 token su oltre 100 lingue. Entrambi sono non autoregressivi: un singolo passaggio in avanti restituisce la risposta, quindi non c'è alcun ciclo di decodifica, nessun JSON da analizzare e nessuno spazio in cui emettere testo al di fuori del tipo dichiarato. Quest'ultima proprietà è la stessa garanzia strutturale offerta da Jev, raggiunta da una direzione diversa, ed è davvero preziosa per chiunque abbia scritto logica di retry attorno a un modello che occasionalmente dimentica di chiudere una graffa.
Jev è la controparte chiusa: il primo modello System One di TypeSafe AI, lanciato il 15 settembre 2026, ospitato e in accesso anticipato, con tre primitive tipizzate — Choice da una lista che fornisci, Score su una rubrica ordinata, e Noul, un'affermazione sì/no con una probabilità calibrata. Tutte le domande vengono valutate in parallelo rispetto a un'unica lettura condivisa dello stato, l'output è gratuito perché non ci sono token di output, e l'input costa $0.042 per milione di token. La sua architettura, il numero di parametri e il calcolo di addestramento non sono divulgati, e TypeSafe ha detto che i dettagli vengono tenuti segreti, con un articolo possibilmente in seguito.
L'affermazione sulla latenza, misurata correttamente
Il p50 di 32,8 ms di Laya su una T4 è un numero reale, e anche buono. Il confronto di 7,8x rispetto ai 236–276 ms di Jev è il punto in cui serve cautela, e la scheda di Laya stessa è insolitamente onesta sul perché: le cifre di Jev sono numeri pubblicati da terzi che Convai non ha mai misurato direttamente, e il confronto mette un forward pass su GPU locale contro una chiamata API ospitata che include round-trip di rete e accodamento. Tolta la rete dall'equazione, il confronto architetturale è tra due modelli a passaggio singolo, uno da 421M parametri e uno di dimensione non divulgata che TypeSafe non ha mai pubblicato.
C'è anche un numero di batching che vale la pena conoscere: con un batch di dieci, Laya riporta 7,2 ms per domanda. Questa è la forma del prodotto. Laya è progettato per essere eseguito localmente su larga scala, e i port della community on-device come laya-mlx lo estendono ad Apple Silicon. Le affermazioni virali di "50 volte più veloce di Jev" non sono supportate dai benchmark pubblicati dal progetto stesso, e l'inquadramento onesto è un ampio divario tra locale e cloud che è in parte architetturale e in parte semplicemente la differenza tra la tua GPU e l'API di qualcun altro.
Cosa dicono i numeri di accuratezza, in ordine
È qui che il paragone smette di essere lusinghiero, e vale la pena esporlo in sequenza perché l'ordine conta.
• Zero-shot sul benchmark typed-decisions di TypeSafe — Laya 0.362, casuale 0.318, classe maggioritaria 0.461, Jev 0.727. Laya è superiore al caso e inferiore alla baseline banale.
• Fine-tuned sullo split di addestramento del benchmark stesso — Laya 0,766 contro Jev 0,727. Laya vince, e la vittoria arriva da un checkpoint che ha visto i dati di addestramento del benchmark, il che ne fa un'affermazione sul fine-tuning, non sul modello di base.
• Classificazione delle intent di Banking77, dove l'insieme delle opzioni è ampio — Laya 0,425 contro lo 0,870 di Jev. Laya degrada bruscamente oltre circa 20 opzioni, e i campi Choice di Jev sono documentati per gestirne fino a 255 prima che sia necessario il pattern di scoring a due stadi.
• Calibrazione — Laya arriva con un errore di calibrazione atteso medio di 0,466, che migliora a 0,081 solo dopo la ricalibrazione della temperatura per tipo di domanda. Jev è addestrato con un metodo che TypeSafe chiama RLCD, Reinforcement Learning for Calibrated Decisions, e fornisce ogni risposta con una distribuzione di probabilità — sebbene TypeSafe dica anche agli utenti di convalidare le soglie sui propri dati etichettati, e un audit indipendente abbia rilevato che la calibrazione di Jev varia notevolmente a seconda del compito.
Lo schema è inequivocabile. Laya è una base solida su cui fare fine-tuning e un debole motore decisionale zero-shot, e lo dice essa stessa. Jev è un forte motore decisionale zero-shot la cui calibrazione va ancora verificata per ogni deployment. Sono prodotti diversi con strutture di prezzo diverse, e scegliere tra loro è soprattutto una questione di sapere se si dispone di dati etichettati e di un ciclo di addestramento.
L'aritmetica dei costi non ha la stessa forma di quella di Jev
Jev costa $0,042 per milione di token di input, con output gratuito, cioè $42 per miliardo, e una chiamata di dimensione massima con il budget documentato di ~32.000 token per richiesta costa ben meno di un centesimo. Il test indipendente di Every ha prodotto 777 giudizi su 37 documenti a circa un quarto di centesimo.
Il costo per chiamata di Laya è zero al margine e non nullo nell'aggregato, e l'aggregato non è piccolo. Un modello da 421M di parametri su una T4 è economico da eseguire e ti costa comunque una GPU, e il passaggio di fine-tuning che rende Laya competitiva è dove si concentra la spesa reale — l'etichettatura dei dati, l'esecuzione dell'addestramento, l'infrastruttura di valutazione e il refitting della temperatura per tipo di domanda che porta il suo errore di calibrazione da 0,466 a 0,081. Per una tassonomia fissa che non cambia mai, si tratta di un costo una tantum che si ripaga con i volumi. Per una tassonomia soggetta a drift, è un costo ricorrente, e la baseline zero-shot di Jev di 0,727 diventa un affare molto più vantaggioso.
C'è un terzo costo che è facile trascurare: il checkpoint inglese di Laya ha una finestra di contesto di 512 token. Non è un modello decisionale con un piccolo budget di contesto — è un modello decisionale dimensionato per un paragrafo. Il budget di richiesta di Jev, di circa 32.000 token, è sessanta volte più grande, e anche quello è un ordine di grandezza inferiore rispetto ai modelli generativi rispetto ai quali entrambi sono prezzati. Se il tuo stato è un thread di supporto anziché un messaggio di supporto, la finestra di nessuno dei due modelli è il vincolo rispetto al quale dovresti ottimizzare.
La questione del deployment è la vera differenza

L'argomento più forte di Laya non è la latenza. È che i pesi Apache 2.0 su Hugging Face fanno sì che la decisione non lasci mai la tua infrastruttura e che l'endpoint non abbia mai un limite di frequenza. Per una decisione di routing presa su una cartella clinica, un documento legale o la cronologia dell'account di un cliente, non è una preferenza — è il fattore decisivo, e nessun endpoint ospitato, a qualsiasi prezzo, vince questo argomento. Jev di TypeSafe è in accesso anticipato e con lista d'attesa, e la sua stessa documentazione osserva che i limiti di frequenza possono cambiare senza preavviso.
Il controargomento è ciò a cui rinunci. L'architettura più grande e non divulgata di Jev svolge il lavoro che i 421M parametri di Laya non riescono a fare: il divario zero-shot di 0,727 contro 0,362 e il divario su Banking77 di 0,870 contro 0,425 sono entrambi misure di quanta conoscenza risiede nel modello prima che tu lo addestri. La risposta di Laya è che sei tu a fornire quella conoscenza tramite il fine-tuning, e su un dominio ristretto e fisso quella risposta funziona — il risultato di 0,766 ottenuto con il fine-tuning ne è la prova.
Dove si colloca il livello decisionale in uno stack reale
Né l'uno né l'altro modello genera testo, quindi nessuno dei due costituisce l'intero flusso di lavoro. Il pattern per cui entrambi sono progettati prevede due modelli: un livello decisionale che effettua la chiamata tipizzata e un modello generativo che si occupa della parte che richiede prosa, codice o una spiegazione. OrcaRouter non serve Jev né Laya — Jev è l'endpoint in accesso anticipato di TypeSafe e Laya sono pesi che esegui tu stesso — ma la metà generativa di quel pattern è esattamente ciò che copriamo: oltre 200 modelli dietro un'unica chiave compatibile con OpenAI al prezzo di listino del fornitore, passato senza alcun ricarico, così una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno. L'architettura a due modelli è testabile senza un secondo contratto con un fornitore e, grazie al failover automatico, il percorso generativo non diventa un singolo punto di guasto mentre decidi se il livello decisionale economico è calibrato abbastanza bene da automatizzarvi le operazioni.
Il verdetto
Se hai una tassonomia fissa e ristretta, esempi etichettati e un requisito di privacy o latenza che esclude un'API ospitata, Laya è la scelta più difendibile e i numeri del fine-tuning lo confermano. Se hai bisogno che la decisione funzioni subito, così com'è, se i tuoi insiemi di opzioni superano le venti categorie, o se lo stato è più lungo di un paragrafo, la model card di Laya stessa ti dice che non è il prodotto per quel compito — e il punteggio zero-shot di 0,362 contro una baseline di maggioranza di 0,461 è il numero da tenere a mente quando qualcuno ti cita il dato di latenza di 7,8x.
Ciò che i due hanno in comune è più utile di ciò che li separa. Entrambi eliminano la classe di errore che deriva dalla formattazione dell'output e non fanno nulla per la classe che deriva dal giudizio. Entrambi distribuiscono probabilità, e nessuno dei due ha un diagramma di affidabilità pubblicato di cui ci si possa fidare senza verificarlo. Verifica la calibrazione sui tuoi casi etichettati prima di automatizzare con l'uno o con l'altro — la latenza è già una commodity e il valore di confidenza è la parte che va guadagnata per ogni distribuzione.

