
Intern-Decision-4B vs Laya: due modelli che si rifiutano di scrivere una risposta, con dimensioni che differiscono di dieci volte
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 592 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
C'è una riga nella scheda del modello Intern-Decision-4B che recita "Laya — 57,77". Chiunque abbia letto la documentazione di Laya riconoscerà il significato di quel numero: convaiinnovations/laya è un modello decisionale non autoregressivo da 421 milioni di parametri, e 57,77 è la media che ottiene quando viene usato zero-shot sul benchmark di qualcun altro. La sua stessa scheda dice la stessa cosa in modo più schietto — i checkpoint di base si trovano al di sotto della baseline della classe maggioritaria sul benchmark typed-decisions, a 0,362 contro 0,461. Nel frattempo internlm/Intern-Decision-4B è un modello da 4,54 miliardi di parametri costruito esattamente per lo stesso compito: prendere uno stato e un insieme di domande tipizzate, eseguire un singolo forward pass, restituire probabilità calibrate, non generare mai un token. Stessa scommessa architetturale, stessa forma di output, stessa licenza Apache-2.0, dieci volte i parametri — e uno di essi è una base da fine-tunare mentre l'altro pretende di essere un motore zero-shot finito.
Concordano sulla premessa, che è la parte rara.
Entrambe le schede sostengono la stessa tesi, e vale la pena enunciarla perché la maggior parte del settore sostiene il contrario. Se il tuo problema è scegliere tra un insieme noto di risposte, generare prosa è l'operazione sbagliata: paghi per token che poi butti via, ti serve un parser e ottieni una spiegazione che non hai chiesto invece di una probabilità su cui applicare una soglia. La scheda di Laya lo formula così: «non genera mai testo, quindi non c'è nulla da analizzare e nulla da allucinare». La scheda di Intern-Decision-4B dice che la sua API «esegue uno scoring strutturato dei candidati. Non chiama generate() né campiona testo libero».
I meccanismi differiscono in modo istruttivo. Laya invia domande tipizzate a un classifier head e restituisce risposte tipizzate con probabilità calibrate in un unico forward pass, con un routing layer che rileva il sistema di scrittura e la lingua in meno di mezzo millisecondo prima del passaggio. Intern-Decision-4B mappa le opzioni di ogni domanda su simboli a token singolo, genera uno scheletro JSON dell'assistente con un segnaposto per campo, legge i logit immediatamente prima di ciascun segnaposto ed esegue la softmax solo sui simboli consentiti per quel campo. Quello di Laya è un problema di classificazione; quello di InternLM è un problema di next-token che si rifiuta di lasciare che diventi un problema di generazione.

Il divario di dimensioni, e cosa ci si guadagna
Chiedere a due modelli di svolgere lo stesso compito con 421M e 4,54B di parametri produce il risultato che ti aspetteresti, e poi una sorpresa.
La parte prevista è la capacità su domande difficili. Intern-Decision-4B ha una media di 90,02 su sette set di valutazione con un punteggio di Brier di 0,347 e un errore di calibrazione atteso di 0,065 nella misurazione di InternLM stessa, e impiega in media 44,16 ms per query su una singola RTX 4090. Il checkpoint base in inglese di Laya ha un'accuratezza di 0,362 sul benchmark typed-decisions da 2.000 decisioni, che la sua stessa scheda segnala come al di sotto della linea della classe maggioritaria di 0,461 e appena al di sopra della baseline casuale di 0,318. Quando lo stesso checkpoint viene sottoposto a fine-tuning sul proprio split di addestramento di quel benchmark, il numero sale a 0,766. La scheda di Laya trae da sola la conclusione: "Laya è una base veloce da specializzare, non un motore decisionale zero-shot."
La sorpresa è che il modello più piccolo vince nettamente su due dimensioni. Velocità: Laya risponde da 103 a 332 domande al secondo in batch su una singola T4, e la sua scheda lo colloca approssimativamente da sei a otto volte più veloce di TypeSafe Jev sulla cifra p50 di 236–276 ms misurata in modo indipendente che cita. Dieci volte i parametri non comprano dieci volte il throughput nella direzione opposta — i 44,16 ms di Intern-Decision-4B sono per query su una 4090 senza alcun dato pubblicato sul batching. E lingua: Laya riporta 45 delle 51 lingue benchmarkate utilizzabili a più di tre volte il livello casuale, con un 0,451 instradato su MASSIVE intent in tredici lingue non inglesi contro 0,306 per il suo checkpoint solo inglese. Intern-Decision-4B non fa alcuna affermazione multilingue.
Tabellone
Parametri — 4,54B BF16 per Intern-Decision-4B, torre di testo più torre di visione più proiettore; 421M per Laya, un singolo stack compatto di classe encoder.
• Limite di input — 8.192 token per entrambi, ed entrambi rifiutano anziché troncare; nota che gli 8.192 di Laya si applicano al checkpoint multilingue, il cui valore predefinito fornito è 1.024.
• Molteplicità — Intern-Decision-4B accetta da 1 a 16 domande e fino a 62 opzioni ciascuna, e 62 non è arbitrario: è esattamente il numero di simboli a token singolo che il suo contratto di inferenza può indirizzare. Anche Laya accetta più domande tipizzate, ma la sua scheda documenta un brusco crollo oltre circa 50 opzioni, dove una domanda con 77 etichette riceve solo tre o quattro token di budget per etichetta e l'accuratezza scende a 0,425.
• Immagini — fino a otto per Intern-Decision-4B, conteggiate sul budget di 8.192 token; nessun percorso multimodale per Laya.
• Calibrazione — Intern-Decision-4B viene fornito con una temperatura adattata di 1,99241824 selezionata tramite minimizzazione NLL su 1.728 casi, e riporta un ECE di 0,065 sulla propria suite; Laya viene fornito con un'eccessiva sicurezza, e la sua scheda indica che rieseguire il fitting di una temperatura per tipo di domanda e numero di opzioni sposta l'ECE medio da 0,466 a 0,081.
• Postura zero-shot — un checkpoint finito che dichiara una media di 90,02 rispetto a una base documentata che ottiene un punteggio inferiore alla linea della classe maggioritaria.
• Latenza — 44,16 ms di media, 44,03 ms di mediana su una RTX 4090 rispetto a 103-332 domande al secondo elaborate in batch su una T4.
• Lingue — nessuna dichiarazione pubblicata contraria a 45 delle 51 lingue utilizzabili quando instradate.
• Licenza — Apache-2.0, con la licenza Qwen a monte preservata accanto ad Apache-2.0 esplicitamente contrassegnata per uso commerciale.

Due carte, due concezioni della trasparenza molto diverse
È qui che il confronto smette di essere una scheda tecnica e diventa una questione di valutazione, perché i due fornitori documentano i loro modelli in stili opposti.
La scheda di Laya pubblica i propri fallimenti in dettaglio. Riporta che il checkpoint inglese ottiene un'accuratezza di 0.000 sul Khmer con una confidenza di 0.952 — sicuro di sé mentre sbaglia, il che rende il gating della confidenza inutile in quel caso. Riporta che action.act_probability non porta alcun segnale utilizzabile, leggendo 1.0 per quasi ogni input con un AUROC di 0.30 su 396 decisioni etichettate, e ti dice di fare gating su confidenza invece, che raggiunge 0.77 sugli stessi elementi. Nomina le domande con punteggio ordinale come "la primitiva più debole", citando 0.372 su SST-5. Una scheda che ti dice quali dei suoi stessi output ignorare sta facendo qualcosa che la maggior parte dei fornitori non tenta.
La scheda di Intern-Decision-4B pubblica una tabella pulita e nessun caso di fallimento. Le sue avvertenze sono reali e cruciali — la sezione di calibrazione è insolitamente esplicita sul fatto che la colonna "before" del suo studio pilota non è ciò che vedrebbe qualsiasi utente, e che le etichette della suite di test non sono state usate per selezionare la temperatura — ma la sezione di valutazione è sette vittorie e nessuna ammissione. Porta anche righe per cinque sistemi concorrenti che InternLM ha eseguito sull'harness di InternLM, inclusa la riga Laya che apre questo articolo. Quelli non sono i numeri propri di quei progetti, e leggerli come tali sarebbe un errore.
Quindi la linea di reperimento delle fonti per questo confronto è asimmetrica in modo da favorire il modello più piccolo: le prove di Laya includono difetti che ha documentato essa stessa, e le prove di Intern-Decision-4B non hanno mai incontrato un test set che i suoi autori non abbiano scelto.
A quale forma di problema si adatta ciascuno
Dato un breve stato strutturato in inglese, un insieme chiuso di risposte e la necessità di una probabilità affidabile, Intern-Decision-4B è l'oggetto più capace sulla carta e il più costoso in pratica — quattro shard safetensors, PyTorch 2.9.1 e Transformers 5.14.1 con Python 3.12, un motore residente e un wrapper che scrivi tu stesso se vuoi un endpoint HTTP. Data una decisione di routing o di guardrail ad alto volume in dozzine di lingue, dove il throughput è il vincolo stringente, Laya è la forma migliore: pip install laya, un modello da 421M e una scheda che ti ha già detto di fare fine-tuning prima di fidarti delle probabilità.
L'unica cosa su cui entrambe le schede concordano è che non ci si dovrebbe fidare di nessuno dei due modelli in zero-shot senza aver verificato la calibrazione sui propri dati — Laya perché i suoi checkpoint di base sono vicini al livello del caso su tipi di decisione non familiari, Intern-Decision-4B perché il suo ECE di 0,065 proviene da una suite messa insieme dai suoi stessi autori.
Cosa cambia e cosa non cambia un router qui
Nessuno di questi due modelli è nel catalogo di OrcaRouter, e vale la pena dirlo apertamente anziché lasciar intendere il contrario: le nostre pagine dei modelli restituiscono un 404 sia per Intern-Decision-4B sia per Laya, e nessuno dei due è una rotta che si possa chiamare oggi. Ciò che questo significa per i due progetti non è la stessa cosa. La licenza Apache-2.0 di Laya con tag per uso commerciale significa che l’ostacolo è puramente di packaging: è un pacchetto Python locale con un ingombro ridotto, il genere di cosa che potrebbe plausibilmente essere servita. L’ostacolo di Intern-Decision-4B è anch’esso di packaging, ma i suoi pesi BF16 da 4,54B e il tetto di rifiuto di 8.192 token lo rendono un componente anziché un servizio.
Dove OrcaRouter aiuta davvero è dall'altro lato della decisione. Se il tuo problema di decisione strutturata si rivela richiedere dopotutto un passaggio di ragionamento, i modelli generali in grado di farlo sono su una sola chiave per oltre 200 modelli, con il prezzo di listino del provider passato a 0% di ricarico e failover automatico tra provider — così il modello che abbini a uno scorer è a un endpoint di distanza, non a un secondo contratto.
La versione breve
Questi due progetti sono giunti alla stessa conclusione su come dovrebbero essere prese le decisioni, per poi differire su quasi tutto il resto. Laya scommette che 421M di parametri, un routing linguistico stretto e un'onestà spietata riguardo ai propri difetti creino una base veloce da specializzare. Intern-Decision-4B scommette che dieci volte i parametri e un contratto di scoring a token singolo ingegnerizzato con cura creino un motore zero-shot finito. L'esperimento decisivo è uno che nessuno dei due ha eseguito pubblicamente: prendere una serie di decisioni con risposte calcolabili, eseguirle entrambe e verificare se le probabilità significhino qualcosa. Laya ha pubblicato a metà quell'esperimento e ti ha mostrato dove fallisce. Intern-Decision-4B non l'ha pubblicato affatto.

