Una card di titolo generata che recita 'Intern-Decision-2B vs Laya', con il sottotitolo '2.21B contro 421M, nessuno dei due scrive un token', con i badge 'uno distribuisce un pacchetto pip' e 'uno distribuisce un kit di riproduzione', con il logo OrcaRouter compositato nell'angolo.
Guides & Insights

Intern-Decision-2B vs Laya: 2,2 miliardi di parametri contro 421 milioni, entrambi si rifiutano di scrivere una risposta

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

internlm/Intern-Decision-2B e convaiinnovations/laya sono i due modelli più simili nella nicchia dei piccoli modelli decisionali, e il fatto più utile di questo confronto è che ci arrivano per strade opposte. Il checkpoint da 2.213.241.664 parametri di InternLM legge il logit in una posizione fissa prima di un segnaposto e non chiama mai generate(). Il checkpoint da 421 milioni di parametri di Convai invia domande tipizzate a una testa decisionale posta sopra un backbone ModernBERT-large e restituisce probabilità calibrate in un singolo passaggio in avanti. Nessuno dei due scrive un token, entrambi promettono probabilità, entrambi si fermano a circa ottomila token di input, e il più piccolo è cinque volte più piccolo e circa mille volte più popolare. Ciò che li separa non è tanto la capacità quanto il packaging, e il divario di packaging decide l'acquisto per la maggior parte dei lettori.

Intern-Decision-2B è apparso su Hugging Face alle 05:36 UTC del 26 settembre 2026, la dimensione intermedia delle tre che InternLM ha caricato in quaranta secondi senza alcun annuncio, fine-tuned da Qwen/Qwen3.5-2B con licenza Apache-2.0. Laya è stato caricato per la prima volta il 18 settembre 2026 e da allora ha accumulato circa 3.700 like, un pacchetto pip, un server HTTP compatibile con Jev, integrazioni ONNX e LangChain e un notebook per il fine-tuning. Il contrasto di maturità è l'articolo.

La premessa che condividono, e i meccanismi che differiscono

Entrambe le card sostengono che se il tuo problema è scegliere tra risposte note, generare prosa è l’operazione sbagliata. La formulazione di Laya è «non genera mai testo, quindi non c’è nulla da analizzare e nulla da allucinare». Quella di Intern-Decision-2B è che la sua API «esegue una valutazione strutturata dei candidati. Non chiama generate() né campiona testo libero».

I meccanismi sono il punto in cui si separano.

Laya è un classificatore. Un encoder ModernBERT-large (395M, bidirezionale, interamente fine-tuned) alimenta una testa decisionale addestrata da zero — due livelli transformer, un valutatore del marcatore di opzione e una testa act/escalate — per un totale di 421M. Le opzioni condividono un budget di token fisso (head_max_len, 192 token sul checkpoint inglese, 256 su quello multilingue), e il router rileva scrittura e lingua in meno di mezzo millisecondo prima del passaggio.

Intern-Decision-2B è un modello next-token a cui è stato proibito di diventare un generatore. Mappa le opzioni di ogni domanda su simboli a token singolo A–Z, a–z, 0–9; genera uno scheletro JSON completo dell'assistente con un segnaposto <decision> per campo; esegue un singolo passaggio forward causale; legge i logits immediatamente prima di ciascun segnaposto; applica la softmax sui simboli consentiti di quel campo; e applica una temperatura calibrata di 2.100509348278. Sotto c'è un Qwen3_5ForConditionalGeneration standard — 24 livelli, tre livelli di attenzione lineare ogni livello di attenzione completa, un livello di previsione multi-token mantenuto, un tetto di embedding di 262.144 posizioni — più una torre visiva e un proiettore.

La conseguenza pratica della differenza è la capacità di opzioni. Il budget fisso per opzione di Laya collassa su spazi di etichette ampi; la sua stessa scheda documenta una domanda con 77 etichette che ottiene 0,425 contro 0,870 di TypeSafe Jev sullo stesso compito, perché 77 opzioni ricevono circa tre o quattro token ciascuna. Intern-Decision-2B accetta fino a 62 opzioni per domanda e fino a sedici domande, e 62 non è una preferenza ma il numero esatto di simboli a token singolo che il suo contratto può indirizzare. Nessuno dei due è a proprio agio oltre qualche dozzina di opzioni; le forme di fallimento differiscono.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Tabellone

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• Parametri — Intern-Decision-2B 2.213.241.664 in BF16 più una torre di visione e un proiettore, circa 4,46 GB su disco; Laya 421M, un singolo file safetensors da 842 MB, con un checkpoint multilingue separato da 644 MB.

• Limite di input — 8.192 token per entrambi, entrambi rifiutano anziché troncare; nota che l'8.192 di Laya si applica a laya-multilingual e richiede max_len=8192, poiché il default fornito è 1.024.

• Immagini — fino a otto per Intern-Decision-2B, conteggiate rispetto allo stesso budget di token; nessun percorso multimodale per Laya.

• Velocità — 33,28 ms di media, 33,15 ms P50, 33,55 ms P95 per richiesta su una RTX 4090 per Intern-Decision-2B; Laya riporta circa 33 ms per richiesta e 103–332 domande al secondo in batch su una singola T4.

• Lingue — Intern-Decision-2B non rivendica affatto capacità multilingui; Laya esegue il routing attraverso oltre 100 lingue, riportando che 45 delle 51 lingue sottoposte a benchmark sono utilizzabili con prestazioni oltre tre volte il livello casuale, e 0,451 su MASSIVE intent in tredici lingue non inglesi rispetto a 0,306 del suo checkpoint solo in inglese.

• Accuratezza zero-shot — Intern-Decision-2B registra 84,68 di media su sette suite di fornitori con Brier 0,437 ed ECE 0,100, tutti non riprodotti; il checkpoint base inglese di Laya ottiene 0,362 sul benchmark typed-decisions da 2.000 decisioni, che la sua stessa scheda segnala come inferiore alla linea di classe maggioritaria di 0,461.

• Packaging — un checkpoint, un inference.py e un repository GitHub reso pubblico da poco con codice di addestramento e valutazione, rispetto a pip install laya, un server HTTP compatibile con Jev, i percorsi veloci di ONNX Runtime e TileLang, integrazioni MCP e LangChain, e un notebook di fine-tuning che gira su GPU del piano gratuito.

Il confronto più equo non è quello che la scheda tecnica imposta

Mettere 84,68 accanto a 0,362 rasenta la disonestà, e vale la pena spiegare perché invece di lasciare che i numeri restino lì da soli.

Lo 0.362 di Laya è un checkpoint base misurato zero-shot su un benchmark per cui non è stato messo a punto. La sua stessa scheda trae esplicitamente la conclusione: "Laya è una base veloce da specializzare, non un motore decisionale zero-shot." Fine-tuned sullo split di addestramento di quel benchmark raggiunge 0.766, superando il tetto del teacher di 0.735 e battendo il 0.727 pubblicato di TypeSafe Jev sulle stesse decisioni. Il 84.68 di Intern-Decision-2B, invece, è una media di sette suite di un fornitore i cui set di test non sono quelli citati da Laya, prodotta dal laboratorio che ha costruito il modello, senza che nessuna terza parte l'abbia eseguita — il checkpoint mostra un like e zero download. Confrontare un risultato fine-tuned con un risultato zero-shot, o una media di fornitore con una board indipendente, non è un confronto. Sono due misurazioni diverse che condividono un carattere tipografico.

Che cosa è davvero comparabile: entrambi sono piccoli, entrambi costano poco da eseguire ed entrambi non sono fine-tunabili nel tuo dominio. Il repository che InternLM ha pubblicato questa mattina rende quest'ultima parte sostanzialmente più semplice di quanto lo fosse ieri, perché include il launcher di addestramento, l'obiettivo masked-next-token, un bundle verificato tramite hash di 10.751 righe di test su sette suite, e gli script di temperature-fitting e replay. Un laboratorio che fornisce un generatore di calibrazione deterministico e afferma che il replay non cambia alcuna decisione sta invitando esattamente il tipo di adattamento che la card di Laya raccomanda.

Come chiameresti effettivamente uno dei due

Nessuno dei due modelli è su OrcaRouter. La pagina dei modelli di OrcaRouter per Intern-Decision-2B restituisce 404 e non esiste nemmeno una route Laya; nulla di quanto detto qui costituisce una dichiarazione di disponibilità. Intern-Decision-2B significa scaricare il checkpoint ed eseguire il suo motore incluso sulla propria GPU. Laya significa pip install laya e, se vuoi l'interfaccia compatibile con Jev, laya-serve su POST /v1/systemone.

La domanda di fondo in stile Orchestrator è se vuoi una seconda superficie operativa per uno scorer. Laya è progettata per essere integrata — la stessa struttura di richiesta e risposta di TypeSafe Jev, così un client esistente cambia un URL di base e nient'altro. Intern-Decision-2B è progettato per essere riprodotto, e oggi richiede circa un giorno di lavoro sull'ambiente prima che arrivi la prima decisione. Se la decisione a classi chiuse che stai prendendo è simile nella forma a una di queste, l'alternativa in hosting che entrambe le schede usano come benchmark è TypeSafe Jev 1.13, che ha effettivamente una route: $0,042 per milione di token di input, un contesto da 65K e un P50 time-to-first-token di 178 ms, raggiungibile con la stessa chiave di oltre 200 altri modelli con prezzo di listino del provider passato con markup dello 0%.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

Dove ciascuno vince

Laya vince su tutto ciò che è operativo. Un pacchetto pip contro un download di checkpoint. Un router su più di cento lingue contro nessuna dichiarazione multilingue. Throughput in batch misurato in centinaia al secondo contro una cifra per richiesta senza alcuna dichiarazione multilingue. Due ecosistemi...

Intern-Decision-2B vince su tre aspetti circoscritti. Accetta immagini, cosa che Laya non fa. Non si porta dietro alcun debito di fine-tuning: il suo 84,68 è un valore dichiarato dal fornitore in zero-shot, mentre il valore di punta di Laya, 0,766, appartiene a un checkpoint messo a punto sullo split di addestramento del benchmark stesso. Ed è documentato con un kit di riproduzione — un pacchetto di valutazione verificabile e uno stack di addestramento pubblico — che vale più di una riga in classifica per chiunque debba giustificare il modello a qualcun altro.

Il pareggio è la premessa. Entrambi rifiutano di generare, entrambi ti danno probabilità a cui puoi applicare una soglia, ed entrambi stanno al di sotto della lunghezza di input alla quale si attestano la maggior parte dei documenti reali. Se il tuo stato è un ticket, un'email o un modulo, va bene l'uno o l'altro e Laya ti ci porterà più rapidamente. Se al tuo stato è allegato uno screenshot o la tua organizzazione necessita che la riproduzione sia verificabile, il checkpoint intermedio di InternLM è quello che risponde a quell'obiezione specifica — e secondo i numeri di InternLM stesso è il meno ben calibrato dei suoi tre fratelli, con ECE 0,100 contro 0,066 e 0,065, quindi adatta la tua temperatura prima di fidarti della confidenza che riporta.