
MiniCPM5-2B-DSpark vs Qwen3-8B: Il Nuovo Stack On-Device da 2.5B contro il Cavallo di Battaglia Open-Weights
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Every model comparison hides a hardware question, and MiniCPM5-2B-DSpark versus Qwen3-8B is that question wearing a benchmark costume. Qwen3-8B is Alibaba's April 2025 open-weights workhorse — roughly 8.2B dense parameters, 119 languages, 32K native context extensible to 131K, hybrid thinking modes, and sixteen months of community evidence behind it. MiniCPM5-2B-DSpark is not a standalone model to set beside it: it is the 323.8M-parameter DSpark draft checkpoint OpenBMB posted quietly to Hugging Face on September 6, 2026 to accelerate MiniCPM5-2B, the dense 2.52B on-device model ModelBest announced at WAIC on July 19, 2026. Put the pair together and the real question surfaces: should the workload that currently runs on an 8B be running on hardware that can only carry a 2B — and is a 2.5B with a free draft good enough to make the move? --- Ogni confronto tra modelli nasconde una questione hardware, e MiniCPM5-2B-DSpark contro Qwen3-8B è quella questione in costume da benchmark. Qwen3-8B è il cavallo di battaglia open-weights di Alibaba dell'aprile 2025 — circa 8,2 miliardi di parametri densi, 119 lingue, contesto nativo di 32K estendibile a 131K, modalità di pensiero ibride e sedici mesi di riscontri dalla community alle spalle. MiniCPM5-2B-DSpark non è un modello autonomo da mettere accanto a quello: è il checkpoint bozza DSpark da 323,8 milioni di parametri che OpenBMB ha pubblicato in silenzio su Hugging Face il 6 settembre 2026 per accelerare MiniCPM5-2B, il modello denso on-device da 2,52 miliardi di parametri che ModelBest ha annunciato al WAIC il 19 luglio 2026. Mettete i due insieme ed emerge la vera domanda: il carico di lavoro che oggi gira su un 8B dovrebbe girare su hardware che può portare solo un 2B — e un 2.5B con una bozza gratuita è abbastanza per fare il salto?
La risposta breve è: non ancora, per la maggior parte dei carichi di lavoro, ma le ragioni sono più circoscritte di quanto suggerisca il divario dimensionale, e c'è una classe di deployment per cui l'8B non ha alcuna risposta. Tutto ciò che è quantitativo in questo articolo è dichiarato dai vendor — i numeri di MiniCPM sono di ModelBest stessa, non riprodotti; quelli di Qwen3-8B sono di Alibaba, da tempo esposti all'uso della community — quindi le etichette contano più delle cifre.
Due modelli in punti diversi della curva di memoria
MiniCPM5-2B è un Transformer causale denso grande un terzo di un modello da 8B — 42 layer, grouped-query attention, Apache-2.0 — progettato per la classe di dispositivi che un modello di grandi dimensioni non può raggiungere: smartphone, cockpit intelligenti e piccoli edge box in cui il bus di memoria andrebbe in soffocamento con otto miliardi di pesi. I materiali di lancio puntano l'accento sul lavoro agentico e sul contesto lungo piuttosto che sull'ampiezza grezza: 128K di contesto nativo e l'affermazione di ModelBest che, sulla propria suite di valutazione, il modello ottiene in media 53.9 — SOTA open-source di classe 2B, secondo il vendor, incluso un 46.4 ottenuto dal vendor su SWE-bench Verified che sarebbe notevole per un 2B se superasse test indipendenti. La bozza DSpark è la risposta in termini di throughput all'obiezione ovvia secondo cui un piccolo modello denso è veloce da caricare ma lento a generare, perché ogni token trascina i propri pesi attraverso il bus di memoria. La bozza propone fino a sette token alla volta da far verificare al target, e la repo riporta un'accettazione greedy di 5.52 token per passo di verifica in aggregato — 6.11 sul codice. Quel numero è la qualità della bozza; il suo speedup non è ancora stato misurato e non è stata pubblicata alcuna cifra di token al secondo.

La scheda openbmb/MiniCPM5-2B-DSpark mostrata qui sopra è l'intera superficie pubblica della silenziosa release del 6 settembre: un accessorio di serving che riporta la lunghezza di accettazione, senza alcun annuncio e senza speedup wall-clock.
Qwen3-8B appartiene alla stessa famiglia architettonica ed è tre volte più grande e di sedici mesi più vecchio. È un Transformer causale denso con attenzione a query raggruppate, addestrato su un corpus multilingue di 36 trilioni di token, con licenza Apache-2.0, ed è uno dei modelli 8B più diffusi in self-hosting e come servizio nel mondo open-weight. La sua firma è la modalità di ragionamento ibrida di Qwen3 — thinking attivo o spento a ogni richiesta — e il suo profilo è volutamente ampio: MMLU nella parte alta degli anni Settanta, ottimi risultati in GSM8K e nel coding, 119 lingue. Richiede una vera GPU o un edge box robusto: con una quantizzazione pratica occupa pochi gigabyte e gira comodamente su una scheda di fascia media, non su un telefono.

La model card di Alibaba per Qwen3-8B qui sopra è il volto dell'incumbent: sedici mesi di comportamento documentato e testato dalla community in 119 lingue.
Dove l'8B vince ancora
Scendendo di una categoria di peso si rinuncia a tre cose concrete. Innanzitutto, le lingue: Qwen3-8B ne copre 119; la scheda e i dataset di MiniCPM5-2B sono incentrati su inglese e cinese, e non viene rivendicata alcuna ampiezza multilingue. Per un prodotto che serve una coda lunga di lingue, questo è un muro duro, non morbido. Secondo, le prove: i numeri di Qwen3-8B sono stati scrutati, quantizzati, affinati e serviti su larga scala per sedici mesi; le sue modalità di fallimento sono note, le sue quantizzazioni esistono, il suo ecosistema è ovunque. MiniCPM5-2B è una release di luglio 2026 con una classifica gestita dal fornitore e nessuna riproduzione indipendente, e la bozza è di un giorno fa. Terzo, lo stack di serving: tutto ciò che già parla con Qwen3-8B — vLLM, SGLang, llama.cpp, mille fine-tuning — parla con un target maturo, mentre la bozza MiniCPM richiede la costruzione di un motore di decodifica speculativa (l'algoritmo DSPARK di SGLang) che il repository documenta ma l'ecosistema più ampio non ha ancora assorbito.
Dove lo stack 2B è l'unica opzione
Niente di tutto ciò conta nella classe di dispositivi in cui un modello da 8B semplicemente non ci sta. Su un telefono o su una scheda edge con pochi gigabyte di DRAM, Qwen3-8B non compete con MiniCPM5-2B: non è affatto distribuibile a una velocità utile. È proprio questo il motivo per cui esiste lo stack da 2B, ed è per questo che la bozza è la parte portante di questa release, non un abbellimento. La decodifica speculativa è più efficace proprio nel regime denso e limitato dalla memoria in cui vive un modello piccolo su silicio piccolo: un draft compatto propone un blocco, il target lo verifica in un'unica passata, e il costo di caricamento dei pesi viene pagato una volta per blocco invece che una volta per token. Il metodo DSpark di origine DeepSeek (arXiv 2607.05147) è stato progettato per sistemi di servizio ad alta concorrenza, ma i suoi meccanismi — e i numeri di accettazione in questa repository — sono la leva rilevante per un modello da 2B che deve risultare interattivo su hardware con risorse limitate. Basta tenere presente l'avvertenza onesta: OpenBMB ha misurato l'accettazione della bozza, non il suo speedup, quindi il reale guadagno in token al secondo sul tuo dispositivo di destinazione resta comunque qualcosa che devi misurare tu.
Il tabellone, etichettato onestamente
• Rilascio — MiniCPM5-2B: 19 luglio 2026 (annunciato); MiniCPM5-2B-DSpark: 6 settembre 2026, in sordina. Qwen3-8B: aprile 2025, annunciato.
• Dimensioni — MiniCPM5-2B: 2,52B di parametri densi, più un modello draft da 324M. Qwen3-8B: ~8,2B di parametri densi.
• Contesto — MiniCPM5-2B: 128K nativi. Qwen3-8B: 32K nativi, 131K tramite YaRN.
• Lingue — MiniCPM5-2B: incentrato su inglese/cinese. Qwen3-8B: 119.
• Ragionamento — MiniCPM5-2B: modalità ibride rapida/deliberata secondo i materiali di lancio. Qwen3-8B: thinking attivo o disattivo su richiesta.
• Evidenza — I dati MiniCPM sono dichiarazioni della scheda ModelBest (media 53.9 sulla propria suite; nessun test indipendente). I dati Qwen3-8B sono riportati da Alibaba, esposti alla comunità per sedici mesi.

Il tabellone qui sopra è il disallineamento disegnato onestamente: le colonne differiscono su quasi tutto, tranne che sulla licenza open Apache-2.0, e la classe di dispositivo a cui stai spedendo decide quale colonna ti è persino consentito scegliere.
La realtà del routing
Né l'uno né l'altro modello è oggi presente in un catalogo ospitato su OrcaRouter, quindi questo confronto avviene interamente nel mondo self-hosted — ma è proprio qui che un layer di routing dimostra ancora il suo valore. Qwen3-8B è servito dal suo fornitore e da diverse piattaforme terze; MiniCPM5-2B e il suo draft sono qualcosa che gestisci tu. Quando un team vuole verificare se uno stack da 2.5B può sostenere parte di un carico di lavoro da 8B, la mossa reversibile è puntare un percorso di test su una build SGLang self-hosted MiniCPM5-2B-plus-draft attraverso un'unica API con failover automatico — la produzione resta sul sistema attuale, il nuovo stack può bloccarsi senza mandare giù nulla, e i prezzi di listino dei provider per l'intero confronto vengono applicati con markup allo 0%, così il test A/B è economico e reversibile, non una scommessa. Il layer non ospita nessuno dei due modelli; rende l'esperimento sicuro da eseguire.
Chi dovrebbe muoversi, e chi dovrebbe aspettare
Resta su Qwen3-8B per qualsiasi esigenza multilingue, per qualsiasi cosa che richieda sedici mesi di comportamento noto, o per qualsiasi carico di lavoro già servito su hardware che gestisce comodamente un modello da 8B — il divario dimensionale non è una ragione per migrare, e il divario nelle evidenze depone contro. Metti seriamente alla prova lo stack MiniCPM5-2B con la sua bozza DSpark solo se il tuo dispositivo di destinazione non può assolutamente gestire il modello da 8B, oppure se un modello da 2.5B che regge il passo su lavoro agentico e a contesto lungo ti consentirebbe di ridurre memoria e consumo energetico su hardware che già spedisci. E prima di impegnarti con la bozza, esegui la misurazione che OpenBMB non ha pubblicato: la lunghezza di accettazione non è la latenza, e il guadagno in token al secondo sul tuo dispositivo è il numero che determina davvero se il piccolo checkpoint silenzioso su Hugging Face valesse il download.
