
MiniCPM5-2B-DSpark vs Granite 4.2 3B: Due rilasci discreti Apache-2.0 per un serving piccolo, veloce e self-hosted
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Agosto e l'inizio di settembre 2026 hanno prodotto due release tranquille, sotto Apache-2.0, destinate allo stesso compito — piccoli modelli che ospiti da solo — e ci sono arrivate da estremi opposti. Granite 4.2 3B è il modello reasoning dimensionato per laptop di IBM, i cui pesi sono approdati su Hugging Face all'inizio di agosto e la cui model card e il blog tecnico sono usciti il 25 agosto 2026. MiniCPM5-2B-DSpark non è affatto un modello nello stesso senso: è un checkpoint DSpark di 323,8M di parametri che OpenBMB ha pubblicato il 6 settembre 2026 senza alcun annuncio, costruito per far sì che MiniCPM5-2B — il modello on-device denso da 2,52B annunciato da ModelBest al WAIC il 19 luglio 2026 — generi token più velocemente tramite decodifica speculativa. Una release è un piccolo modello reasoning autonomo; l'altra è un accessorio di accelerazione per un piccolo modello. Entrambe sono sotto Apache-2.0, entrambe sono solo self-host, e nessuna delle due è stata ancora toccata da un benchmark indipendente.
Togliendo lo strato di marketing, la domanda pratica che un team si trova ad affrontare è lineare: per un piccolo carico di lavoro di serving self-hosted a fine 2026, vuoi lo specialista di ragionamento 3B di IBM o lo stack orientato agli agenti 2B di ModelBest con un modello draft gratuito aggiunto? Le evidenze sono più scarse di quanto suggeriscano le schede tecniche di entrambi i vendor, quindi questo articolo esamina i fatti del rilascio, l'unico set di numeri ottenuti con la stessa suite che esista davvero, e la differenza di carico di lavoro che dovrebbe guidare la scelta.
I due rilasci, ciò che è conoscibile
Granite 4.2 3B è il più piccolo modello di ragionamento di IBM, ottenuto tramite post-addestramento di Granite-4.1-3B-Base. È denso e solo testo — 40 strati, attenzione a query raggruppate, un contesto nativo di 128K che si estende a 512K in una quinta fase di pre-addestramento, e tre modalità di ragionamento: pensiero completo per impostazione predefinita, una modalità a basso sforzo e un percorso senza pensiero. La scheda di IBM è esplicita: il modello 3B ha deliberatamente saltato il blocco di apprendimento per rinforzo agentico che i modelli Granite 4.2 più grandi hanno ricevuto, quindi non elenca risultati SWE-Bench ed è un modello di ragionamento piuttosto che un modello agente. Funziona tramite vLLM, SGLang, Transformers, GGUF e Ollama (granite4.2:3b), e non dispone di API ospitata. I suoi numeri principali sulla scheda — 78.33 su AIME 2025, 54.80 GPQA, 69.71 LiveCodeBench v6 — sono dichiarati dal fornitore e non ancora riprodotti ad oggi.

La scheda ibm-granite/granite-4.2-3b qui sopra è il volto pubblico di quel rilascio: un 3B ottimizzato per il ragionamento, con una narrazione sul lungo contesto e nessuna pretesa agentica.
MiniCPM5-2B-DSpark, invece, esiste solo al servizio del suo target. Il modello draft è composto da cinque strati a piena attenzione, con 323.776.001 parametri e una dimensione del blocco di sette token candidati per forward pass, addestrato per sei epoche su 7,05 miliardi di token di risposte generate da MiniCPM5-2B. Il suo repository riporta la lunghezza di accettazione — 5,52 token accettati per passo di verifica in aggregato con decodifica greedy, 6,11 sul codice — ma nessuna cifra sui token al secondo. Il target che accelera, MiniCPM5-2B, è il prodotto più interessante: un modello denso da 2,52B, 42 strati e contesto 128K, i cui materiali di lancio enfatizzano le capacità agentiche — mid-training di agenti su scala 200B, un ampio set SFT per agenti e allineamento RL degli agenti, secondo l’annuncio di luglio di ModelBest — oltre al contesto lungo nativo e alle modalità ibride veloci/deliberative. Nella suite comparativa di ModelBest, il target ottiene una media di 53,9 contro i modelli open della stessa classe. Tutti questi numeri sono dichiarati dal fornitore.

La scheda openbmb/MiniCPM5-2B-DSpark qui sopra è l'intera superficie di rilascio: scheda del modello, config, un file Safetensors e nessun annuncio.
L'unico confronto nella stessa suite che esista
I punteggi tra vendor diversi sono per lo più un confronto tra mele e arance, ma c'è un punto in cui Granite 4.2 3B e MiniCPM5-2B sono stati misurati insieme: la tabella di valutazione che ModelBest ha pubblicato per MiniCPM5-2B, in cui granite-4.2-3B compare tra i baseline. In quella suite, MiniCPM5-2B ottiene una media di 53.9 contro il 42.7 di Granite 4.2 3B. Leggi quella cifra per quello che è: un vendor che esegue entrambi i modelli su un'unica suite, senza repliche, e scelta per far apparire buono il proprio modello. Non è un verdetto. Quello che ti dice è che ModelBest è stata abbastanza sicura di sé da mettere il 3B di un concorrente sulla propria scheda, e il divario che dichiara è maggiore proprio dove il suo addestramento ha investito di più: le righe relative al contesto lungo e a quelle agentiche. Considerala come un'indicazione di massima, verificala sui tuoi dati e soppesa le dichiarazioni della scheda separata di IBM prima di decidere qualcosa in merito.
Il tabellone, etichettato onestamente
• Cosa viene distribuito — MiniCPM5-2B-DSpark: un draft da 324M per MiniCPM5-2B (target denso da 2.52B), non standalone. Granite 4.2 3B: un modello di reasoning denso standalone da ~3B.
Ruolo — Stack MiniCPM5-2B: enfasi su agenti on-device e uso di strumenti, secondo ModelBest. Granite 4.2 3B: specialista del ragionamento, deliberatamente non agentico.
• Contesto — MiniCPM5-2B: obiettivo 128K nativo. Granite 4.2 3B: 128K nativo, estendibile a 512K.
• Accelerazione — MiniCPM5-2B-DSpark: bozza esterna DSpark, sette token per passaggio, accettazione greedy ~5,5 per passo (riportato nel repository). Granite 4.2 3B: nessuna inclusa in questa versione.
• Licenza — entrambe Apache-2.0.
• Prove — I punteggi di MiniCPM sono dichiarazioni della model card di ModelBest (la sua suite: 53.9 vs Granite 42.7); i punteggi di Granite sono dichiarazioni della model card di IBM (AIME 2025 78.33, GPQA 54.80). Non esiste alcuna esecuzione indipendente di nessuno dei due.

Il tabellone qui sopra riporta le stesse fonti del testo: ogni dato in esso è dichiarato dal fornitore, e l'unico numero dello stesso insieme che uno dei due fornitori ha pubblicato è quello di ModelBest.
La differenza che supera ogni benchmark
Prima dei punteggi, decidi quale tipo di piccolo modello richiede il tuo carico di lavoro, perché le due release rispondono a domande diverse. Granite 4.2 3B è pensato per il ragionamento e il contesto lungo su hardware vincolato: una finestra nativa di 128K che si estende fino a 512K, tre modalità di thinking per ogni singola query, un ingombro che gira su un laptop e una scelta esplicita di saltare l'addestramento agentico. Se il tuo compito è l'analisi di documenti lunghi, contesti su scala di repository o un ragionamento affidabile su una macchina piccola, è una soluzione coerente. MiniCPM5-2B è costruito per l'enfasi opposta: comportamento agentico e uso di strumenti sul dispositivo — il fatto stesso che esista una bozza segnala che ModelBest si aspetta che questo target venga servito in modo interattivo e vuole indietro i token al secondo. Se il tuo compito è un loop agentico on-device che chiama strumenti e sostiene lunghe conversazioni, quello è lo stack pensato per te.
Il draft cambia l'economia di quella seconda scelta in un modo che la release di Granite non affronta. MiniCPM5-2B è denso, e la decodifica speculativa ripaga maggiormente proprio nel regime denso e limitato dalla memoria — un piccolo modello fisso che propone token a uno leggermente più grande. Un drafter esterno che aggiunge circa 650MB di pesi BF16 a un target di ~5GB, con un percorso di serving SGLang documentato e un tasso di accettazione greedy di circa cinque token e mezzo per passo di verifica, è una credibile leva di throughput per un modello servito con concorrenza a singola richiesta. Ma la precisazione è d'obbligo: OpenBMB non ha pubblicato alcuna accelerazione end-to-end, quindi la leva non è calibrata. IBM non fornisce un drafter esterno equivalente per Granite 4.2 3B in questa release — lo esegui in modalità densa, e la sua storia di velocità si riduce semplicemente al fatto che il 3B è piccolo.
Chi dovrebbe gestire cosa
• Esegui Granite 4.2 3B se il tuo carico di lavoro è il ragionamento su contesti lunghi su un computer di classe laptop — documenti, repository, analisi approfondita a thread singolo — e vuoi tre modalità di pensiero e un tetto di 512K su un modello Apache-2.0 che controlli completamente. Accetta che dietro non ci sia addestramento agentico né un'API ospitata.
Esegui lo stack MiniCPM5-2B con il relativo modello draft DSpark se il tuo workload è un agente on-device interattivo con chiamata a strumenti, in cui il modello target rientra nel tuo budget di memoria e vuoi la throughput che un draft può farti recuperare. Metti in conto del tempo per misurare lo speedup reale del draft sulla tua build di SGLang, perché non è stato pubblicato alcun numero a riguardo.
• Esegui entrambi dietro un livello di routing se sei davvero incerto. Nessuno dei due modelli è oggi in un catalogo ospitato, incluso OrcaRouter — entrambi sono proposte self-host — ma un router che si pone davanti ai tuoi endpoint con failover automatico consente al nuovo stack di bozza di restare su un percorso di test mentre la produzione rimane su quello collaudato, e il suo pass-through con markup allo 0% sui modelli ospitati circostanti mantiene economico il confronto A/B. Il punto è la reversibilità: cambia il nome di un modello, misura e torna indietro se il checkpoint di un giorno si blocca.
Cosa guardare dopo
Due cose decideranno questo confronto più in fretta di qualsiasi opinione. {{1}}In primo luogo, un'esecuzione indipendente di MiniCPM5-2B che confermi o smentisca la media di 53.9 e le affermazioni sugli agenti: un modello da 2B che ottiene risultati così buoni su task in stile SWE-Bench rappresenterebbe un dato davvero nuovo per la categoria on-device.{{/1}} {{2}}In secondo luogo, i numeri del modello reasoning di IBM che sopravvivono alla riproduzione da parte della comunità; il 78.33 su AIME 2025 del modello da 3B è il tipo di affermazione che cambia quando qualcun altro la esegue.{{/2}} {{3}}Finché una di queste due cose non si concretizza, la posizione onesta è: Granite 4.2 3B è oggi il piccolo modello più sicuro e meglio documentato, mentre lo stack MiniCPM5-2B è la scommessa più interessante — un agente più veloce on-device se le sue affermazioni reggono, con una bozza il cui ritorno economico nemmeno il suo stesso vendor ha ancora misurato.{{/3}}
