Una scheda del titolo generata per il confronto Laya contro Nimble, che riporta il sottotitolo di questo stesso articolo e una riga a piè di pagina che indica quali cifre provengono dal venditore e quali da terze parti.
Engineering & Research

Laya vs Nimble: dati contrastivi contro un encoder più veloce

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Laya e Nimble sono i due modelli decisionali open-weight i cui autori hanno fatto di più per spiegare come sono stati costruiti, e le loro spiegazioni non concordano su dove risieda la difficoltà. Convai Innovations ha rilasciato Laya il 18 settembre 2026 sotto Apache 2.0 — un checkpoint inglese ModernBERT-large da 421M, un checkpoint multilingue mmBERT-base da 322M che copre oltre 100 lingue, un router sub-millisecondo tra i due e un p50 pubblicato di 32,8 ms per decisione su una Tesla T4. Bespoke Labs ha costruito Nimble come fine-tune LoRA su Qwen3.5-9B, Apache 2.0, e lo descrive come «il Jev open source» — ispirato al Jev di TypeSafe AI ma senza usarne né i pesi, né l'architettura, né una distillazione dei suoi output. La risposta di Convai al problema dell'accuratezza è la velocità e una base fine-tunabile. La risposta di Bespoke sono i dati di addestramento. Questa differenza merita più attenzione del divario di accuratezza di tre punti che emerge nelle tabelle principali.

L'affermazione che ogni progetto sta effettivamente facendo

L'affermazione di Laya è architetturale. È non autoregressivo in senso stretto — un encoder bidirezionale, nessun ciclo di decodifica, nessun JSON da analizzare, nessuno spazio in cui emettere testo al di fuori del tipo dichiarato. Questa garanzia strutturale è la stessa che offre Jev, raggiunta da una direzione diversa, ed è davvero preziosa per chiunque abbia scritto logica di retry attorno a un modello che occasionalmente dimentica di chiudere una parentesi graffa. Il costo è che un encoder da 421M con una finestra di 512 token e nessun pretraining generativo alle spalle non sa molto. Convai lo dice sulla model card: "Laya è una base veloce da specializzare, non un motore decisionale zero-shot."

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Nimble repository on GitHub, showing the description "Local typed decisions, contrastive data curation, and model evaluation", the README heading "Bespoke Nimble - Data, Model, Recipe for an open Jev", the contrastive example where changing one fact flips the correct answer, and the 2,676-example training split against the frozen 324 held-out set.

L'affermazione di Nimble riguarda i dati. Il metodo di Bespoke è la curatela contrastiva, adattata dal precedente lavoro del team su Bespoke-MiniCheck: scrivere due esempi quasi identici che differiscono per un “fatto focale”, in modo che l'etichetta corretta si inverta. La pipeline prevede quattro passaggi dichiarati — verificare che le regole decisionali possano realmente portare a risposte diverse, costruire la coppia modificando al massimo otto parole, verificare entrambi gli esempi con chiamate separate al modello più un controllo di rimozione di ogni frase, e generare le etichette nel codice mantenendo solo le coppie le cui etichette differiscono effettivamente. L'obiettivo non è avere più esempi ma esempi più nitidi: costringere il modello a imparare quali prove dovrebbero cambiare la decisione. Questa è una teoria diversa del perché i piccoli modelli decisionali falliscono, ed è più interessante di un altro punto di accuratezza.

Cosa supportano realmente i numeri pubblicati

Nimble riporta una concordanza del 90,12% con le etichette di riferimento su 324 campioni di hold-out, rispetto al 93,21% di Jev, al 66,36% del modello base Qwen3.5-9B non ottimizzato e all'84,88% di un Qwen3.8 da 27B non ottimizzato. Riporta una mediana di circa 106 ms su una H100 e una mediana di 444 ms su un M5 Pro con 64 GB. Si tratta delle cifre del banco di prova di Bespoke stesso. Il set di valutazione di 324 campioni è la parte da soppesare con attenzione, e il progetto stesso ne spiega il motivo: i campioni coprono sei delle dieci famiglie di fonti di addestramento, sono stati generati e convalidati da modelli senza revisione umana, e la generalizzazione a categorie non viste è quindi non dimostrata. Quando un modello viene addestrato con un metodo di curatela dei dati e poi valutato su una suddivisione di hold-out della stessa distribuzione curata, il valore di accuratezza è un'affermazione sulla coerenza interna del metodo, non sul tuo traffico.

I numeri di Laya vengono dall'altro estremo. Sul benchmark typed-decisions di TypeSafe ottiene 0,362 zero-shot — il caso casuale è 0,318, la baseline della classe maggioritaria è 0,461 — e 0,766 quando viene fine-tuned sullo split di addestramento proprio del benchmark. Su Banking77, 77 etichette, ottiene 0,425 contro lo 0,870 di Jev, che è l'illustrazione più netta del suo tetto alle molte opzioni. Su AG News con quattro etichette ottiene 0,950 contro lo 0,910 di Jev; su DAIR Emotion con sei etichette, 0,595 contro 0,480. Il suo errore di calibrazione è di 0,466 e scende a 0,081 dopo il rifitting della temperatura per tipo di domanda. Un test di terze parti su 100 messaggi di urgenza Mars-base ha dato Jev a 100/100 e Laya a 53/100. E in una valutazione indipendente di chiamate a strumenti di agenti, Laya ha raggiunto il 100% di recall di rifiuto sulle chiamate pericolose, ma solo segnalando tutto, il che è un fallimento di precisione mascherato da successo di sicurezza.

Metti le due serie di numeri una accanto all'altra e la lettura onesta è che sono state misurate su cose diverse. Il 90,12% di Nimble è la concordanza con le proprie etichette di riferimento curate. Lo 0,362 di Laya è un benchmark che non ha costruito. Nessuno dei due numeri è trasferibile.

Calibrazione: l'unico punto in cui entrambi i progetti sono insolitamente sinceri

È qui che i due progetti sono più vicini nello spirito e più distanti nel risultato.

Il README di Bespoke avverte esplicitamente che le probabilità di Nimble sono logit normalizzati con softmax sui candidati forniti, non tassi di correttezza calibrati — un 0,9 non significa corretto al 90%. Raccomanda di aggiungere un'opzione "nessuna delle precedenti", perché se la risposta giusta non è tra i candidati uno di essi vince comunque. Su una valutazione più recente di 3.880 record che copre 13 sottoinsiemi, Jev presentava un errore di calibrazione riportato inferiore in 11 dei 13 sottoinsiemi e un punteggio di Brier inferiore in 10 dei 13. Quindi un'accordanza simile tra etichette non implica una qualità delle probabilità simile, e Bespoke lo dice.

La divulgazione di Convai è l'immagine speculare: l'errore di calibrazione atteso di 0,466 è sulla scheda, accanto allo 0,081 che il ricalcolo della temperatura per tipo di domanda produce. Nessuno dei due progetti distribuisce un modello la cui confidenza si possa usare senza lavoro. Entrambi te lo dicono per iscritto. Se stai costruendo una soglia di confidenza — rilascio automatico sopra 0,95, escalation sotto 0,7 — la documentazione di entrambi gli autori ti dice la stessa cosa: adatta prima la soglia sui tuoi dati etichettati.

Il confronto, dimensione per dimensione

• Backbone — Laya: encoder ModernBERT-large da 421M, bidirezionale, nessun pre-addestramento generativo. Nimble: Qwen3.5-9B con un fine-tuning LoRA, base generativa mantenuta.

• Lingue — Laya: 100+ tramite il checkpoint multilingue da 322M. Nimble: inglese.

• Budget del prompt — Laya: 512 token in inglese, 1.024 multilingue. Nimble: 2.048 token massimo per prompt, solo schemi piatti, enum limitati a 26 opzioni per campo.

• Velocità — Laya: 32,8 ms p50 su una T4, 7,2 ms per domanda con batch da 10. Nimble: circa 106 ms di mediana su una H100, 444 ms su un M5 Pro 64GB.

• Hardware — Laya: CPU, CUDA e Apple MPS; meno di un gigabyte residente sul port MLX. Nimble: GPU CUDA BF16 per i valori indicati, con supporto ai percorsi MLX e CUDA.

• Accuratezza riportata — Laya: 0,362 zero-shot, 0,766 fine-tuned, 0,425 su Banking77. Nimble: 90,12% su 324 campioni curati held-out rispetto al 93,21% di Jev.

• Metodo — Laya: prima l'architettura, poi il fine-tuning per ogni deployment. Nimble: curation contrastiva dei dati, pubblicata come ricetta.

• Licenza — Apache 2.0 per entrambi.

Due vincoli in quell'elenco meritano di essere letti due volte prima di procedere. Il limite di 26 opzioni per enum di Nimble e il tetto di 2.048 token per il prompt sono limiti rigidi dello schema, non una degradazione delle prestazioni — se la tua tassonomia ha quaranta etichette o il tuo prompt contiene un documento lungo, Nimble è lo strumento sbagliato a prescindere dalla sua accuratezza. E Nimble valuta ogni campo in modo indipendente, quindi qualsiasi regola di coerenza tra campi — "se A è vero allora B deve essere falso" — deve risiedere nel tuo codice, non nel modello.

Perché la ricetta dei dati è l'artefatto più portabile

Ecco l'argomento a favore di Nimble che le tabelle di accuratezza trascurano. Bespoke ha pubblicato la pipeline di curatela, non solo i pesi. Se il tuo problema decisionale ha una tassonomia fissa e puoi scrivere le regole, il metodo contrastivo è qualcosa che puoi eseguire sui tuoi dati con i tuoi fatti focus, sopra qualunque modello di base tu preferisca. Il 9B LoRA è una dimostrazione del metodo tanto quanto un prodotto.

La portabilità di Laya è diversa e complementare. Poiché è piccola, poiché gira su CPU e poiché esistono i port ONNX e MLX, Laya è il modello che puoi inserire all'interno di un processo che non ha GPU né rete. In un benchmark per browser agent di terze parti, Laya ha completato 0 attività su 50 e ha dichiarato il completamento in modo prematuro in 33 tentativi — ma gli autori del benchmark osservano che era stata addestrata per lavori di giudizio come ticket di supporto, fatture e revisione di tracce di agenti, non per la navigazione. Leggi quel risultato come un'affermazione di ambito piuttosto che come un verdetto, ed è coerente con l'inquadramento di entrambi i progetti: questi sono componenti per una classe specifica di decisioni, non agenti generali.

Né Laya né Nimble sono modelli ospitati su OrcaRouter. Entrambi sono pesi che esegui tu stesso, e nulla in questo articolo va inteso come un'affermazione che li serviamo. Il motivo per cui si parla del prodotto di routing è lo stesso per cui se ne parla in qualsiasi architettura con modello decisionale: il modello decisionale risponde a una sola chiamata, e l'applicazione che lo circonda ha comunque bisogno di prosa. Una pipeline che usa Nimble per valutare se una bozza è conforme e Laya per instradare l'eccezione avrà comunque bisogno di un modello generativo per scrivere la bozza. Mantenere quella metà generativa su un unico endpoint compatibile con OpenAI — oltre 200 modelli, prezzo di listino dei provider passato con markup allo 0% così un taglio di prezzo di un fornitore è attivo lo stesso giorno, failover automatico tra provider — significa che il livello decisionale può essere sostituito senza toccare il contratto del livello generativo.

Il verdetto, e l'esperimento che lo cambierebbe

Scegli Nimble se la tua tassonomia è fissa e ristretta, i tuoi input sono in inglese e brevi, hai una GPU e vuoi la ricetta dei dati tanto quanto il modello. Scegli Laya se ti serve un input multilingue, un budget inferiore a 40 ms o un processo senza alcuna GPU — e metti in conto il fine-tuning fin dall'inizio, perché il checkpoint zero-shot è al di sotto della baseline banale e la model card lo dichiara.

L'esperimento che lo risolverebbe è una valutazione appaiata su traffico reale: stessi input, stessi insiemi di opzioni, stesse soglie di confidenza, valutati rispetto a etichette umane, con un diagramma di affidabilità per ciascuno. La documentazione di Nimble avverte che le sue probabilità non sono tassi di correttezza e la scheda di Laya riporta un errore di calibrazione di 0,466 prima del rifitting, quindi quel diagramma è l'artefatto che ti direbbe davvero quale modello mettere davanti alla produzione. Nessuno dei due progetti ne ha pubblicato uno, e nessuno dei due ha pubblicato quello dell'altro. Costruiscilo sui tuoi dati prima di impostare una soglia.

A generated two-column scoreboard comparing Laya and Nimble across backbone, languages, prompt budget, label agreement, latency and licence, with a footer reading "Nimble's 90.12% is agreement with its own curated labels; Laya figures per its model card."