Una scheda del titolo generata per Microsoft-Decision-1 vs Laya, sottotitolata "copertura linguistica rispetto alla lunghezza del contesto", con chip che riportano 25 lingue supportate vs 100+ lingue, un contesto di 32.768 token vs una finestra di 1.024 token, solo API ospitata vs pesi Apache-2.0, e un piè di pagina che segnala che i dati di entrambi i fornitori sono autodichiarati.
Engineering & Research

Microsoft-Decision-1 vs Laya: 25 lingue dietro un'API, oltre 100 dietro un download da 322 MB

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Basta contare le lingue e il confronto sembra già deciso. Microsoft-Decision-1, disponibile a livello generale su Microsoft Foundry dall'8 ottobre 2026, elenca 25 lingue supportate e afferma chiaramente che copertura, qualità e calibrazione "possono variare da lingua a lingua", citando le lingue non inglesi e in particolare quelle a basse risorse come un'area di prestazioni inferiori. Laya, pubblicato da Convai Innovations il 18 settembre 2026 con licenza Apache 2.0, si descrive come multilingue in oltre 100 lingue e riporta che 45 delle 51 lingue testate restano utilizzabili con il routing, contro 23 delle 51 per la sua controparte solo in inglese. Uno è un modello da 9B dietro un endpoint Azure con un contesto di 32.768 token; l'altro è un classificatore da 421 milioni di parametri che viene eseguito a 32,8 millisecondi per decisione su una singola Tesla T4, gratuitamente. Nessuno dei due scrive un token ed entrambi restituiscono probabilità sulle opzioni che definisci.

Ma se si leggono per intero le due model card, il conteggio delle lingue smette di essere il numero interessante. È la storia di calibrazione che vi sta dietro, e i due progetti la raccontano in direzioni opposte.

Laya pubblica il numero che rende imbarazzante il proprio marketing

La model card di Laya afferma, nella sua stessa sezione dei limiti, che i checkpoint di base ottengono 0,362 zero-shot sul benchmark typed-decisions — al di sotto della baseline majority-class di 0,461. Questa è una scheda che ti dice che il suo modello è peggiore di indovinare "la risposta più comune" in quel test. Afferma inoltre che i checkpoint di base sono vicini al caso in zero-shot, che la cifra di punta di 0,766 su typed-decisions richiede un fine-tuning sullo split proprio di quel benchmark, che le domande con punteggio ordinale sono la primitiva più debole (SST-5 0,372), che le domande a scelta ad alta cardinalità soffrono perché 77 opzioni lasciano circa tre o quattro token ciascuna, che noul può seguire le proprie etichette, e che il campo action.act_probability "non porta ancora alcun segnale utilizzabile" ad AUROC 0,30. La frase di riepilogo di Convai stessa è quella da portare in qualsiasi valutazione: Laya è una base veloce da specializzare, non un motore decisionale zero-shot.

Quella franchezza è più preziosa di quanto sembri, perché ti dice esattamente a cosa serve Laya. È un encoder che si mette a punto sulle proprie etichette — l'intera architettura è costruita in modo che i nuovi schemi non richiedano alcun retraining, ma ottenere buone prestazioni su un compito sì. Usato in quel modo, i numeri pubblicati sono solidi: 0,766 contro 0,727 di Jev sulle decisioni tipizzate dopo il fine-tuning, AG News 0,950 contro 0,910, DAIR Emotion 0,595 contro 0,480, e ECE 0,081 contro 0,246 di Jev — con la nota onesta che viene rilasciato troppo sicuro di sé e necessita di un refitting della temperatura, il che sposta l'ECE medio da 0,466 a 0,081.

Microsoft pubblica la metodologia e non divulga il risultato

La pagina Foundry di Microsoft-Decision-1 esegue lo stesso esercizio nell'altra direzione. Descrive la valutazione in dettaglio — benchmark decisionali pubblici e della comunità più set interni held-out, metriche tra cui accuratezza ed errore di calibrazione, ordine delle opzioni variato, test statistici appaiati, harness identico per i modelli confrontati — e riporta che il modello "è alla pari dei principali modelli decisionali e davanti ad altri modelli decisionali aperti valutati con la stessa metodologia". Indica i suoi punti di forza (ragionamento, applicazione di regole, robustezza alla formattazione dei prompt) e i suoi punti deboli (conoscenza specialistica di dominio, non inglese).

E poi non stampa nulla. Nessun valore di accuratezza, nessun errore di calibrazione, nessuna tabella per benchmark. Le limitazioni auto-dichiarate sono reali e utili — i punteggi cambiano con la formulazione e l'ordine delle opzioni, una domanda formulata male restituisce comunque un punteggio, la calibrazione è più forte sui tipi di attività familiari, non vengono prodotte spiegazioni — ma un elenco di limitazioni non è una misura. Quindi lo scambio è insolitamente netto: Laya ti dà numeri che puoi provare a falsificare sui tuoi dati, e Microsoft ti dà una postura di conformità e un contesto da 32K in cui puoi inserire un lungo documento.

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

Cosa si guadagna davvero dalla differenza di dimensioni

La piccolezza di Laya non è un compromesso qui, è il design. Poiché ogni opzione viene valutata sul proprio [MASK] token e viene sottoposta a softmax sulle opzioni di quella domanda, lo spazio delle risposte viene assemblato al momento della richiesta invece di essere incorporato in una testa di vocabolario — ecco perché uno schema che inventi questo pomeriggio non richiede riaddestramento, e perché il modello rientra in 322-421 milioni di parametri. Il checkpoint multilingue è circa 2,2 volte più veloce di quello inglese, il router rileva lo script in meno di mezzo millisecondo, e il throughput in batch raggiunge 103-332 domande al secondo su una T4. Per un carico di lavoro che valuta ogni ticket, ogni documento recuperato o ogni azione proposta, quel throughput è la caratteristica, non il numero di parametri.

I costi di quel design sono altrettanto specifici e vale la pena dichiararli rispetto all'alternativa di Microsoft. Il checkpoint inglese adotta una finestra di 512 token; quello multilingue 1.024, estendibile fino a 8K. Microsoft-Decision-1 adotta 32.768. Un lungo thread di supporto, un contratto completo o un documento di policy di più pagine non entra affatto nella finestra di Laya, e nessuna quantità di velocità compensa il troncamento. Laya risponde a un set di domande per ogni passaggio in avanti con un budget di token documentato per opzione; Microsoft documenta una singola invocazione su un massimo di 32K token senza un limite per domanda. E vale la pena conoscere il punto debole competitivo di Laya come classificatore: ottiene 0,425 su Banking77 contro lo 0,870 di Jev, che è il tipo di problema di intenti a grana fine e ad alta cardinalità in cui un passaggio di specializzazione conta di più.

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

Il confronto dei costi che non è per token

Laya è gratuito al punto di utilizzo — self-hosted, Apache 2.0, elencato a un costo self-hosted di "$0" — e il suo vero prezzo è la run di fine-tuning che gli devi prima che sia bravo nel tuo compito. Microsoft-Decision-1 è un'API Foundry ospitata con una tariffa per token che non è stampata sulla pagina del modello, nessun peso da scaricare, nessun percorso di fine-tuning e inferenza batch disabilitata. Uno è un progetto di etichettatura dati iniziale, l'altro è una chiamata a consumo. Quale sia più economico dipende interamente dal volume, e il crossover è alto: un encoder da 421M che elabora 300 elementi al secondo su una T4 noleggiata è molto difficile da battere per decisione una volta addestrato.

Ecco dove OrcaRouter si guadagna il suo posto in una pipeline costruita su uno dei due modelli, e si tratta solo del lato generativo. Non ospitiamo né Microsoft-Decision-1 né Laya: entrambi restituiscono probabilità anziché testo, nessuno dei due è nel nostro catalogo, e un endpoint di scoring non è una destinazione di chat-completions. Quello che offriamo è il modello che produce l'elemento che viene valutato — la bozza di risposta, la chiamata di tool proposta, la risposta candidata che la testa fine-tuned di Laya giudica poi. Sono più di 200 modelli dietro un'unica chiave compatibile con OpenAI al prezzo di listino del provider, passato con 0% di markup, con failover automatico quando un percorso di serving si degrada. In un ciclo che valuta tutto ciò che genera, la chiamata di generazione è la parte che può cadere, e il failover è ciò che tiene alimentata la coda di scoring.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

Quale scegliere?

Scegli Laya se le tue decisioni arrivano in molte lingue, se il tuo volume è abbastanza alto da rendere rilevante il prezzo per token, se hai etichette e una settimana per fare fine-tuning, o se devi eseguire lo scoring su hardware all'interno del tuo perimetro. Accetta la finestra da 512 a 1.024 token e il fatto che il checkpoint di base sarà vicino alla casualità finché non lo specializzi, e ottieni un modello decisionale che è onesto sul fatto di essere un punto di partenza.

Scegli Microsoft-Decision-1 se i tuoi input sono documenti lunghi anziché ticket, se il tuo gate di deployment è l'autenticazione Azure, la fatturazione unificata e un pacchetto Responsible AI anziché un download, se 25 lingue coprono il tuo traffico, o se preferisci non possedere affatto il modello. Accetta che sarai tu a tracciare la sua prima curva di calibrazione, e metti in conto un pomeriggio su un campione etichettato per farlo — perché, a differenza di Laya, questo non ti consegnerà un numero ECE con cui discutere.