
Intern-Decision-2B vs MiniCPM5-2B: due checkpoint da 2B, a venti giorni di distanza, modi opposti di spendere i parametri
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 584 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
internlm/Intern-Decision-2B e openbmb/MiniCPM5-2B hanno le stesse dimensioni, sono stati rilasciati a venti giorni di distanza, hanno la stessa licenza e sono stati costruiti per compiti per nulla simili. Il checkpoint di InternLM è un decision scorer da 2.213.241.664 parametri: riceve uno stato e domande tipizzate, esegue un singolo forward pass e restituisce probabilità calibrate senza generare un token, rifiutando qualsiasi input oltre i 8.192 token. Quello di OpenBMB è un generalista denso da 2.516.756.480 parametri: un Llama a 42 livelli derivato dalla ricetta MiniCPM5, che gestisce 131.072 token di contesto, scrive codice, chiama strumenti e fa matematica, con un Artificial Analysis Intelligence Index di 12,5 e 726.518 download il mese scorso. Costano lo stesso da scaricare e offrono in cambio cose del tutto diverse.
La parte interessante di questo abbinamento non è il divario nei benchmark — c'è a malapena un benchmark sovrapponibile da confrontare. È su cosa si può spendere rispettivamente un budget di 2,2 miliardi e uno di 2,5 miliardi di parametri, e cosa ti dice la scelta su quale dei due sia completo. MiniCPM5-2B è il secondo modello della sua serie, dopo MiniCPM5-1B di maggio, ed è arrivato con un completo apparato di rilascio. Intern-Decision-2B è la dimensione intermedia tra le tre che InternLM ha pubblicato su Hugging Face alle 05:36 UTC del 26 settembre 2026 senza alcun annuncio, e il suo apparato di rilascio — una base di codice per l'addestramento, un pacchetto di valutazione verificato tramite hash, un benchmark di calibrazione di 96 casi — è diventato pubblico solo questa mattina alle 08:58 UTC.
Dove sono andati i due budget
Entrambi i modelli sono fine-tune dell'architettura di qualcun altro, ed entrambi hanno all'incirca 2,5 miliardi di parametri. Qui finisce la somiglianza.

MiniCPM5-2B è un Transformer denso con 42 layer, dimensione nascosta 2.048, 16 teste di attenzione, una dimensione intermedia di 6.144, un vocabolario di 130.560 token e un contesto di 131.072 token, addestrato su una miscela di corpora aperti che OpenBMB ha pubblicato insieme ad esso: UltraX per il pre-addestramento web, UltraData-Code con gestione del codice a livelli L0–L3, UltraData-Math e 500.000 campioni SFT per agenti con oltre 80.000 campioni RL in UltraData-RL-2609. Il suo post-addestramento esegue SFT, poi insegnanti RL specializzati in matematica, codice e attività agentiche, quindi distillazione on-policy di nuovo in un unico modello. È un modello general-purpose il cui intero budget di parametri è esposto come capacità che puoi sollecitare con il prompt.
Intern-Decision-2B è un Qwen3_5ForConditionalGeneration con 24 strati — un pattern ripetuto di tre strati di attenzione lineare per ogni strato di attenzione completa — dimensione nascosta 2.048, 8 teste di query contro 2 teste chiave-valore, dimensione della testa 256, uno strato di previsione multi-token mantenuto e un tetto di embedding di 262.144 posizioni. Viene fornito con una torre di visione da 612,5 MB e un proiettore da 50,3 MB. Quasi nulla di quel budget è disponibile per te come prompt: il modello risponde a uno schema fisso di domande, e la sua architettura è il meccanismo di erogazione di una softmax, non un generatore di testo.
Un dettaglio del repository appena pubblicato di InternLM merita di essere evidenziato, perché ridefinisce il tag multimodale sulla model card. Il decision tuning "esegue il fine-tuning del backbone linguistico di Qwen3.5 mentre congela la torre di visione e il proiettore". Sia il checkpoint del decision tuning da 2B sia quello da 4B contengono uno shard di visione di esattamente 612.517.440 byte — la stessa dimensione in entrambi — il che è coerente con il fatto che tali componenti siano ereditati dalla base Qwen anziché addestrati. Il percorso delle immagini è reale ed è utilizzabile, ma non è ciò su cui il decision tuning di InternLM ha concentrato i propri sforzi. Se il tuo carico di lavoro è lo scoring decisionale solo testuale, circa 660 MB di quel download da 4,46 GB non ti servono a nulla.
Tabellone

• Parametri — Intern-Decision-2B: 2.213.241.664 in BF16 più circa 660 MB di torre di visione e proiettore, circa 4,46 GB di repository; MiniCPM5-2B: 2.516.756.480 in BF16, un unico file safetensors da 5,03 GB.
• Contesto — 8.192 token per Intern-Decision-2B, rifiutati senza troncamento oltre tale soglia; 131.072 token per MiniCPM5-2B.
• Output — una distribuzione calibrata più un argmax per campo, assolutamente nessun testo; testo generato, token per token.
• Addestramento — decision tuning di un backbone Qwen3.5-2B con la torre di visione congelata, dati di addestramento non divulgati; un ciclo completo di pre-training, mid-training e SFT di deep-thinking da 400 miliardi di token, seguito da RL e distillazione on-policy, con i corpora pubblicati contestualmente.
• Prove pubblicate — una tabella del fornitore a sette suite con una media di 84,68, con Brier 0,437 ed ECE 0,100, non riprodotta da alcuna terza parte, un like e zero download; una scheda OpenBMB con una media di 53,9 all'interno del proprio insieme di confronto e un Artificial Analysis Intelligence Index indipendente di 12,5, con 726.518 download nell'ultimo mese.
• Licenza — Apache-2.0 con i termini Qwen upstream conservati come LICENSE-QWEN, e nessuna licenza dichiarata affatto sul repository del codice; Apache-2.0 ovunque, codice incluso.
In cosa ciascuno è davvero migliore, e non c'è paragone.
Il confronto è asimmetrico al punto da essere un errore di categoria, quindi è più utile nominare i lavori.
MiniCPM5-2B vince in tutto ciò che comporta produrre una risposta anziché selezionarla. Scrive codice; Intern-Decision-2B non ha alcun percorso per il codice. Gestisce un contesto di 131.072 token; Intern-Decision-2B si ferma a 8.192 e fallisce in modo evidente. Chiama strumenti, con un punteggio BFCL v4 di 66,6 nella tabella di OpenBMB stessa, e fa matematica, con MATH-500 a 94,6 e GPQA-Diamond a 70,2 — cifre tratte dalla scheda del fornitore, con la riga GPQA che riporta una nota che la scheda stessa fornisce. Totalizza 70,8 su MMLU-Pro e 84,7 su MMLU-Redux. Funziona in llama.cpp e MLX, è distribuito in varianti GGUF, GPTQ e DSpark, e ha uno Space demo sull'Hub che è pubblico, a differenza del 401 a cui rimanda la scheda di Intern-Decision.
Intern-Decision-2B vince esattamente due cose, e sono la ragione della sua esistenza. Primo, una decisione a insieme chiuso con uno schema che scrivi tu restituisce una probabilità che puoi sogliare, in un singolo passaggio in avanti, in circa 33 millisecondi, senza parser e senza campionamento — una forma che MiniCPM5-2B non può produrre se non generando testo e sperando che il numero al suo interno si comporti bene. Secondo, è un artefatto riproducibile: il repository ora contiene l'obiettivo di addestramento, le sette suite di accuratezza con hash SHA-256 e conteggi di righe per suite, il codice di scoring, gli script di temperature-fitting e replay, e un benchmark di calibrazione della distribuzione con 96 casi, con il proprio generatore e scorer offline. La guida di valutazione di InternLM osserva che i preset rilasciati sono legati al backend XTuner e che i risultati HF dovrebbero essere riportati come un'impostazione di esecuzione diversa — che è esattamente il tipo di avvertenza che un kit di riproduzione esiste per rendere verificabile.

Chi dovrebbe scaricare cosa
Se hai un compito che comporta leggere qualcosa di lungo, scrivere qualcosa o rispondere a una domanda le cui opzioni non hai enumerato in anticipo, MiniCPM5-2B è il modello e non c'è alcuna decisione da prendere. È un generalista completo di classe 2B con un ecosistema reale, dati aperti alle spalle e una valutazione indipendente in un elenco, e provarlo non costa nulla — le build GGUF e MLX sono già sull'Hub.
Se hai un compito che è genuinamente una scelta tra risposte note — instradare un ticket, classificare un'email di supporto, etichettare un candidato, assegnare un punteggio a un intent su una scala ordinale — allora un modello generativo è lo strumento sbagliato, e Intern-Decision-2B è il più interessante dei due anche se quasi nessuno lo ha eseguito. Una probabilità che puoi sottoporre a soglia è più economica da gestire, più facile da verificare e impossibile che allucini, e il fatto che il checkpoint sia arrivato con un kit di riproduzione anziché con un post su una classifica lo rende il meglio documentato dei due sull'asse che conta quando devi difendere la scelta.
Nessuno dei due modelli è su OrcaRouter. La nostra pagina del modello per Intern-Decision-2B restituisce 404 e non esiste una route per MiniCPM5-2B; nulla di quanto qui segue costituisce una dichiarazione di disponibilità, ed entrambi implicano l'esecuzione dell'inferenza in proprio. L'alternativa pratica esiste nei modelli decisionali ospitati: Jev 1.13 di TypeSafe, il modello rispetto al quale InternLM ha confrontato l'intera sua famiglia, è nel catalogo a 0,042 $ per milione di token di input con una context window di 65K e un time-to-first-token P50 di 178 ms. E se ciò di cui hai davvero bisogno è un generalista della stessa classe dimensionale di MiniCPM5-2B senza il lavoro operativo, la nostra route Qwen ospitata più piccola è diverse volte più grande ma è una sola chiave tra oltre 200 modelli, a prezzo di listino del provider trasferito senza alcun ricarico e con failover automatico alle spalle.
L'unico numero che decide tutto
Non è 84,68 contro 53,9. Quelle due medie provengono da suite diverse, misurate da laboratori diversi e, in un caso, da un laboratorio i cui numeri non sono mai stati verificati. Il numero che decide è 8.192. Se il tuo stato rientra in ottomila token e la tua risposta è già una lista, Intern-Decision-2B è uno strumento preciso con un kit di riproduzione e un'anomalia di calibrazione di cui dovresti essere consapevole: il suo errore di calibrazione atteso di 0,100 è il peggiore delle tre dimensioni pubblicate da InternLM, contro 0,066 per il modello grande la metà, quindi adatta la tua temperatura prima di fidarti di un valore di confidenza. Se il tuo stato non rientra, la questione è chiusa prima ancora che inizino i benchmark, e MiniCPM5-2B è la risposta.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
