Una card del titolo generata per il confronto Laya-versus-Decider, che riporta il sottotitolo di questo stesso articolo e una riga a piè di pagina che indica quali cifre di quale parte sono dichiarate dal fornitore e quali sono di terze parti.
Engineering & Research

Laya vs Decider: un encoder da 421M contro una miscela da 35B

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Laya e Decider sono entrambi modelli decisionali a pesi aperti e non autoregressivi che rispondono a domande tipizzate — una scelta da un elenco fornito, un punteggio su una rubrica ordinata, una probabilità sì/no — in un'unica passata in avanti, e si collocano agli estremi opposti dello spettro dimensionale. Convai Innovations ha rilasciato Laya il 18 settembre 2026 con licenza Apache 2.0: un encoder ModernBERT-large da 421M per l'inglese con una finestra di 512 token, un checkpoint multilingue mmBERT-base da 322M con una finestra di 1.024 token che copre oltre 100 lingue, e un router che rileva il sistema di scrittura e indirizza a quello corretto. La famiglia Decider di Mapika va da decider-0.8b e decider-2b su piccole basi generative fino a decider-35b-a3b, un mixture-of-experts da 35B con circa 3B di parametri attivi. Entrambi sono scaricabili gratuitamente ed entrambi restituiscono probabilità anziché testo. Il motivo per cui non sono intercambiabili non è il valore di accuratezza con cui esordisce la maggior parte dei resoconti.

Due famiglie, un'unica scommessa architettonica

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

La scommessa condivisa è che una decisione non abbia bisogno di un ciclo di decodifica. A un modello generativo a cui si chiede «questo ticket è una richiesta di rimborso?» tocca emettere token, e nel momento in cui li emette sei tu a doverti occupare del parsing, della validazione dello schema e di un percorso di retry per quella volta su duecento in cui dimentica una parentesi graffa. Sia Laya sia Decider lo evitano leggendo la risposta direttamente da un singolo forward pass — Laya da un encoder bidirezionale, Decider dai logit dei token di opzione con lettera in uno slot di risposta dedicato nel prompt.

È qui che finisce la somiglianza. Laya è formato da due piccoli encoder dietro un router linguistico, il che garantisce una finestra di 512 token per l'inglese e una di 1.024 token multilingue, con 421M e 322M parametri. Decider mantiene un backbone generativo e aggiunge un readout al di sopra: decider-2b è un fine-tune supervisionato di Qwen3.5-2B-Base seguito da un passaggio di reinforcement calibration-aware su task browser dal vivo e giochi esatti, mentre decider-35b-a3b congela gli esperti instradati e addestra matrici a blocchi con Muon. La conseguenza pratica è che Decider eredita la conoscenza del mondo di un modello linguistico e Laya no. L'altra conseguenza è che Decider eredita l'ingombro di un modello linguistico.

A screenshot of the decider-2b model card on Hugging Face, showing the Qwen3.5-2B base, the text-classification pipeline tag, the English-language tag, and the decision-model and calibrated tags for the Mapika Decider family.

La documentazione di Mapika stessa colloca decider-2b a 18 ms di mediana per decisione su una B300 in bf16, batch di uno, senza CUDA graphs né compilazione, e decider-35b-a3b a 41 ms sulla stessa configurazione. Su una GH200 con contesti di ticket di supporto di circa 230 token e da tre a cinque domande digitate, lo stesso progetto riporta 49 ms eager, 4,0 ms con CUDA graphs e torch.compile, e circa 1.370 decisioni al secondo con batch 32. Quelli sono dati pubblicati dal fornitore, tratti dal resoconto del progetto stesso, non una misurazione indipendente. Il numero di punta di Laya è anch'esso pubblicato dal fornitore: 32,8 ms p50 per decisione su una Tesla T4, e 7,2 ms per domanda con dimensione del batch 10.

La questione della calibrazione, a cui i due progetti rispondono su scale diverse

La calibrazione è il numero che conta di più per un modello decisionale, perché lo scopo stesso di restituire una probabilità è che qualcuno a valle vi imposti una soglia. È anche il punto in cui confrontare direttamente Laya e Decider ti indurrà in errore.

Laya viene distribuito con un errore di calibrazione atteso di 0,466 sulla propria scheda modello, e la scheda afferma chiaramente che rieseguire il fitting di una temperatura per tipo di domanda lo porta a 0,081. Si tratta di una divulgazione insolitamente onesta, e significa anche che il checkpoint distribuito non è l'artefatto calibrato. Il numero che si ottiene così com'è è 0,466.

Decider riporta dati su uno strumento del tutto diverso. Il Decision Index — una classifica aperta che ha eseguito ogni riproduzione aperta di Jev su 132.422 richieste — colloca decider-35b-a3b al quarto posto assoluto a 54,3, dietro il 59,5 di Jev, e lo segnala come il meglio calibrato delle 32 voci, con un errore di calibrazione di 3,1 punti e lo 0,4% di risposte errate con confidenza dichiarata pari o superiore al 95%. decider-2b riporta 8,8 punti e 0,9%. Sono numeri pubblicati nella classifica, e 3,1 punti sull'ECE a dieci bin del Decision Index non sono la stessa misura del 0,466 di Laya sulla sua valutazione. Metterli fianco a fianco in una tabella sarebbe un errore di confronto tra mele e arance mascherato da rigore. Quello che si può dire è che l'autore di Decider ha scelto di farsi misurare su una classifica di terze parti e l'autore di Laya ha scelto di pubblicare da sé il proprio numero di calibrazione più debole; nessuno dei due è stato verificato dall'harness dell'altro.

Dove vince ciascuno, dimensione per dimensione

• Backbone — Laya: encoder bidirezionale ModernBERT-large 421M. Decisore: basi generative Qwen3.5, da 0,8B a 35B-A3B.

• Lingue — Laya: oltre 100 tramite un checkpoint multilingue da 322M dietro un router. Decider: solo inglese, dichiarato come limitazione.

• Finestra di contesto — Laya: 512 token in inglese, 1.024 in multilingue. Decider: input fino a 32k accettati, addestrato a 16k sulla generazione v6, testato a 30k.

• Limite del set di opzioni — Laya: degrada bruscamente oltre circa 20 opzioni, 0,425 su Banking77 contro lo 0,870 di Jev. Decider: Choice su 2-255 opzioni denominate, Score su 2-10 livelli descritti.

• Accuratezza zero-shot — Laya: 0,362 sul benchmark typed-decisions, al di sotto della baseline della classe maggioritaria di 0,461. Decider: non è pubblicato come numero zero-shot; il progetto riporta invece risultati specifici per attività.

• Calibrazione — Laya: ECE 0,466 nella versione distribuita, 0,081 dopo la ricalibrazione della temperatura per tipo di domanda. Decider: 3,1 punti sull'Indice Decisionale per il 35B, il migliore tra 32 voci.

• Ragionamento — Laya: nessuno, per costruzione. Decisore: nessuno, dichiarato esplicitamente — è una lettura basata sul pattern matching, non un ragionatore.

• Licenza — Apache 2.0 per entrambi.

Un altro dettaglio di Decider che vale la pena conoscere prima di sceglierlo: il progetto avverte che scegliere un record da un lungo array JSON in base alla posizione è un caso debole, e consiglia di indirizzare i record tramite chiave. È il tipo di limitazione che si scopre solo eseguendolo.

Quanto ti costa eseguire uno dei due

Il profilo di costo di Laya è un progetto di fine-tuning. Il modello è abbastanza piccolo da girare sulla CPU di un laptop per lavori a basso throughput, ma il punteggio zero-shot del checkpoint inglese distribuito si colloca al di sotto della baseline banale, il che significa che adottare Laya vuol dire assumersi il compito di costruire un set etichettato, fare fine-tuning e ricalibrare la temperatura per ogni tipo di domanda. Il vantaggio è che, una volta fatto, l'artefatto conta 421M parametri e risponde in decine di millisecondi su una T4. Il checkpoint laya-typed-decisions messo a punto da Convai stesso raggiunge 0,766 sullo split di training del benchmark — un numero che dice più sul fine-tuning che sul modello di base, e la scheda lo ammette.

Il profilo di costo di Decider è una decisione di serving. Stai scegliendo quanta GPU noleggiare, e la famiglia ti offre una manopola autentica: 18 ms su un 2B contro 41 ms su un 35B-A3B, con il modello più grande che acquista margine di conoscenza e ragionamento su GPQA, GSM8K, CRUXEval e MMLU che i modelli piccoli non hanno. Se il tuo compito è ristretto e le tue etichette sono fisse, decider-2b è la macchina più economica. Se il tuo compito richiede che il modello sappia le cose, paghi il mixture.

Dove OrcaRouter è adatto — e dove non lo è

Né Laya né Decider sono modelli ospitati su OrcaRouter. Scarichi i pesi e li esegui da solo, e nulla di tutto ciò cambia questo. Ciò che invece cambia è l'altra metà dello schema. Un modello decisionale tipizzato non è quasi mai l'intera applicazione: qualcosa deve leggere il ticket, riassumere la conversazione o redigere la risposta che la decisione controlla. Quella metà è una chiamata generativa, ed è la metà per cui OrcaRouter è progettato — oltre 200 modelli dietro un'unica chiave compatibile con OpenAI al prezzo di listino del fornitore, passato senza alcun ricarico, così un taglio di prezzo del fornitore arriva sulla tua fattura lo stesso giorno invece che al rinnovo contrattuale successivo. Se stai facendo il fine-tuning di un checkpoint Laya rispetto agli output di un modello di frontiera, oppure instradando tra decider-2b per il triage e un modello grande per il 4% difficile, tenere il lato generativo su un unico endpoint significa che il lato decisionale e il lato generativo non hanno bisogno di due contratti e due SDK. Il failover automatico copre il caso in cui sia proprio il modello grande la parte che va giù.

Quale scegliere?

Scegli Laya se i tuoi input sono multilingue, le tue etichette sono poche, il tuo budget di latenza è nell'ordine delle decine di millisecondi su hardware modesto, e sei disposto a fare fine-tuning — perché dovrai farlo. Scegli Decider se i tuoi input sono in inglese, hai bisogno che il modello porti un po' di conoscenza del mondo nella decisione, e preferisci scegliere una dimensione del modello piuttosto che eseguire una pipeline di addestramento. Se i tuoi set di opzioni superano le venti etichette, leggi il dato Banking77 di Laya prima di impegnarti; se i tuoi input sono lunghi documenti JSON che indirizzi per posizione, leggi la limitazione dichiarata di Decider prima di impegnarti.

Il confronto che risolverebbe davvero la questione — entrambi i modelli su input identici a livello di byte, stessi prompt, stesso ordinamento delle opzioni, stessa scansione delle soglie — non esiste ancora. Finché non esisterà, la posizione onesta è che Laya ha la curva di costo migliore e Decider ha le prove di calibrazione migliori, e che entrambi sono sufficientemente agli inizi perché la valutazione che costruirai sui tuoi dati varrà più dei numeri pubblicati di entrambi i progetti.

A generated two-column scoreboard comparing Laya and Decider across backbone, languages, context, zero-shot accuracy, calibration and serving, with a footer reading "Laya figures per its own model card; Decider per Mapika and the Decision Index."