
MiniCPM5-2B-DSpark: OpenBMB rilascia silenziosamente i pesi di MiniCPM5-2B con un modello draft progettato per la velocità
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Sei settimane fa MiniCPM5-2B era una promessa. Presentato alla conferenza WAIC di Shanghai il 19 luglio 2026 come modello sub-4B in cima all'Artificial Analysis Index, era accompagnato da una nota di roadmap secondo cui i pesi aperti sarebbero arrivati "presto". Quel "presto" è arrivato questa settimana, senza alcun clamore. Il 6 settembre 2026 OpenBMB ha caricato il repository di punta MiniCPM5-2B su Hugging Face con licenza Apache-2.0 e, ventuno minuti dopo, ha caricato MiniCPM5-2B-DSpark — un checkpoint draft da 323,8 milioni di parametri il cui unico compito è rendere più veloce la decodifica di MiniCPM5-2B con l'algoritmo di decodifica speculativa DSpark. Il 7 settembre 2026 è seguita una build GPTQ. Al momento in cui scriviamo non c'è alcun annuncio, nessun post di lancio e nessuna voce di changelog che abbiamo potuto trovare; il rilascio è emerso con repository resi pubblici in silenzio nell'arco di undici giorni.
Questo è un articolo su ciò che sappiamo finora, e la cornice è importante. MiniCPM5-2B-DSpark non è un chatbot autonomo né un nuovo modello di punta — è un acceleratore: un modello piccolo e veloce che propone token prima di MiniCPM5-2B, il quale poi li verifica in parallelo. È inutile senza il suo target, e il target è il motivo per cui vale la pena interessarsene. Il rilascio open-weight di MiniCPM5-2B che OpenBMB aveva promesso a luglio ora è effettivamente su Hugging Face, e il modello draft distribuito insieme ad esso è il meccanismo che il fornitore raccomanda per eseguirlo a una velocità utile. Tutto ciò che non è esplicitamente attribuito di seguito è letto direttamente dalle due schede dei modelli e dai loro repository.
Cosa è stato spedito, e quando
La famiglia 2B è stata resa pubblica come un rilascio progressivo e non annunciato, con gli ultimi arrivi per primi:
2026-08-27 — Appaiono MiniCPM5-2B-Base e MiniCPM5-2B-SFT, i checkpoint grezzi pre-addestrati e con fine-tuning supervisionato.
• 2026-09-01 — MiniCPM5-2B-Midtrain, la fase di mid-training agentico.
• 2026-09-05 — MiniCPM5-2B-MLX e MiniCPM5-2B-GGUF, i formati Apple-Silicon e llama.cpp.
• 2026-09-06 — il repository di punta MiniCPM5-2B, poi MiniCPM5-2B-DSpark ventuno minuti dopo.
• 2026-09-07 — MiniCPM5-2B-GPTQ, il formato di serving quantizzato.
Tutti portano la licenza Apache-2.0, che ModelBest ha utilizzato per la famiglia MiniCPM5-1B a maggio, e i checkpoint precedenti nella sequenza mostrano ancora un segnale praticamente nullo dalla community — una manciata di download e mi piace ciascuno. Questo è il segno di un rilascio dei pesi in corso piuttosto che di un lancio coordinato: gli artefatti compaiono in ordine di dipendenza (prima base e SFT, poi formati quantizzati e draft per ultimi) senza che un singolo giorno funga da data di rilascio.
Che cos'è realmente MiniCPM5-2B-DSpark
La decodifica speculativa divide la generazione in un proponente economico e un verificatore costoso. Un piccolo modello di bozza predice i prossimi token; il modello grande controlla tutte le previsioni in un singolo passaggio in avanti e accetta quelle con cui concorda. Quando la bozza è ben calibrata, si ottiene l'output del modello grande a una frazione del costo; quando invece è sbagliata, si spreca solo un passo di verifica. DSpark è una ricetta specifica per questa idea, tratta da un articolo pubblicato il 6 luglio 2026 (arXiv 2607.05147, "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation"). Due scelte progettuali la distinguono: abbina un backbone parallelo per il drafter a un modulo sequenziale leggero, così che i token all'interno di un blocco proposto dipendano l'uno dall'altro anziché perdere accuratezza verso la fine del blocco, e dimensiona ogni run di verifica per richiesta in base a stime di confidenza e throughput del motore, invece di verificare sempre un blocco di lunghezza fissa.
Il modello draft DSpark rilasciato da OpenBMB è un Transformer a cinque layer con 323,8 milioni di parametri in BF16 (circa 648 MB). Si basa sulla famiglia di architetture Qwen3 ma include aggiunte specifiche di DSpark: un proiettore che legge gli stati nascosti di MiniCPM5-2B da cinque dei layer del modello target (1, 10, 20, 30 e 39), una confidence head e una piccola Markov head che modella la distribuzione del token successivo. La sua configurazione propone un blocco di sette token per ogni forward pass. Con circa un ottavo dei 2,5 miliardi di parametri di MiniCPM5-2B, è uno dei modelli draft più piccoli rilasciati per un checkpoint open mainstream — ed è proprio questo il punto in un modello orientato all'edge: il draft deve essere abbastanza economico da far sì che eseguire due modelli su un unico dispositivo sia comunque più conveniente che eseguirne uno solo.

Il repository sopra è l'intera superficie pubblica del modello bozza: un README, una configurazione, un singolo file safetensors e una scheda del modello la cui descrizione dell'addestramento mostra 1.959.525 sequenze (7,05B token) generate da MiniCPM5-2B da prompt di carattere generale, matematico e di codice, addestrato per sei epoche con un obiettivo combinato di entropia incrociata, L1 e confidenza. Non vi è alcun utilizzo del checkpoint come modello generativo autonomo.
I numeri pubblicati da OpenBMB, onestamente etichettati.
La scheda del modello draft riporta una cifra che conta — la lunghezza di accettazione, il numero medio di token proposti che il target accetta da ogni blocco di sette token. La valutazione è stata eseguita sugli output di MiniCPM5-2B in tre domini, fino a 4.096 token generati:
• Matematica — in media 6.05 token accettati con decodifica greedy (T=0); 4.61 con campionamento a T=1.0.
• Codice — 6.11 con greedy; 4.44 con campionamento.
• Generale — 4.16 greedy; 3.10 campionato.
• Aggregato — 5.52 greedy; 4.05 campionato, su un massimo di sette.
Queste cifre sono dichiarate dal fornitore nella model card e non sono state riprodotte in modo indipendente. Descrivono inoltre l'hit rate del draft, non uno speedup a tempo di clock: la velocità è una misura di serving che dipende dal costo del passaggio di verifica del target rispetto al passaggio di proposta del draft, dall'occupazione del batch e dall'azione del confidence scheduler di DSpark, che riduce la lunghezza della verifica. OpenBMB non ha pubblicato alcun dato in token al secondo per la coppia. Per avere un'idea del tetto massimo del metodo, il paper di DSpark riporta una generazione per utente più veloce del 60–85% a parità di throughput rispetto alla baseline MTP-1 nel sistema di serving live di DeepSeek — un punto di riferimento utile per ciò che l'algoritmo ha fatto altrove, non un'affermazione su MiniCPM5-2B sul tuo hardware.

Il tabellone qui sopra è la scheda tecnica della release stessa. Leggi il dato di accettazione come un tasso di hit di bozza; il moltiplicatore sul throughput reale è ciò che un run SGLang indipendente deve ancora misurare.
Il modello che la bozza accelera.
MiniCPM5-2B è un Transformer denso da 2,5 miliardi di parametri — 2.516.756.480 in totale — con 42 layer, 16 query head e 2 KV head, un vocabolario di 130.560 token e una finestra di contesto di 131.072 token, in BF16 (circa 5 GB). Architettonicamente è volutamente convenzionale: una LlamaForCausalLM standard, senza kernel personalizzati e senza fork del codice del modello; ed è esattamente per questo che è portabile su moltissimi runtime e target di chip. Nella suite di benchmark interna di OpenBMB, la scheda del modello riporta una media di 53,9 su ragionamento, capacità di seguire le istruzioni, conoscenza, contesto lungo, uso di strumenti, coding e agenti di ricerca — davanti a Qwen3.5-4B (51,1) e a granite-4.2-3B (42,7) nella stessa tabella, con diverse celle (GPQA-Diamond 70,2, HLE 8,9 e varie righe su contesto lungo e attività agentiche) segnalate come provenienti da Artificial Analysis, non riprodotte internamente. Le principali celle per singolo task includono MATH-500 a 94,6, AIME 2025 e 2026 a 86,5, IFEval a 86,7, MMLU-Pro a 70,8 e SWE-bench Verified a 46,4. Questi sono i numeri del fornitore sulla suite del fornitore, e la scheda dichiara esplicitamente che alcune righe provengono da terze parti; trattate il mix di conseguenza.

Alla presentazione di luglio, i materiali di lancio di ModelBest citavano un punteggio Artificial Analysis Index di 17 — primo tra i modelli sotto i 4B di parametri — e la copertura di luglio menzionava una finestra di 512K token. I checkpoint effettivamente distribuiti configurano 131.072 token di contesto. Laddove una cifra di marketing del giorno del lancio e una configurazione distribuita divergono, è la configurazione il numero che determina ciò che puoi effettivamente eseguire, e questa discrepanza è bene conoscerla prima di pianificare un carico di lavoro a contesto lungo basandoti sulla cifra di marketing.
Eseguire MiniCPM5-2B con il suo modello draft
Il percorso indicato è SGLang, che supporta l'algoritmo DSpark a monte dalla v0.5.16 — la versione minima richiesta dalla scheda del modello. Il comando di servizio completo dalla scheda:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
Sotto decodifica greedy (T=0), la verifica DSpark è senza perdite: l'output è identico al serving di MiniCPM5-2B da solo, il che rende il draft un puro vantaggio in termini di latenza. Con il campionamento abilitato, DSpark di SGLang usa per impostazione predefinita il campionamento del solo target, con campionamento a rifiuto opzionale. OpenBMB documenta anche il caricamento standard di Transformers (transformers ≥ 5.6) e il serving del target da solo con vLLM ≥ 0.21, oltre a un parser di chiamate agli strumenti minicpm5 per carichi di lavoro agentici; il percorso speculativo DSPARK in particolare è di SGLang.
Il calcolo hardware è la vera questione per una coppia di classe edge: circa 5GB per MiniCPM5-2B in BF16 più circa 0,65GB per il draft. La combinazione draft-più-target si adatta comodamente ovunque il solo modello da 2B era già utilizzabile, che è esattamente il motivo per cui conviene distribuire un draft così piccolo invece di un secondo modello più grande.
Cosa non è confermato
• Non esiste alcun annuncio che siamo riusciti a trovare — nessun blog di {{1}}OpenBMB{{/1}} o {{2}}ModelBest{{/2}}, nessun post social in inglese o cinese. La caratterizzazione {{3}}"rilasciato in silenzio"{{/3}} è letterale, e l'unica presenza pubblica è la collection di Hugging Face.
• Nessuna valutazione indipendente. Le lunghezze di accettazione della bozza e la media di suite del 53,9 di MiniCPM5-2B sono dichiarate dal fornitore e non riprodotte; le celle contrassegnate AA sono di terze parti, ma sono valori istantanei, non esecuzioni di questi pesi esatti.
• Nessuna API ospitata disponibile che riusciamo a trovare, quindi oggi l'adozione significa eseguire i checkpoint da soli. Un mirror ModelScope, promesso nella copertura di luglio dell'annuncio, non era visibile al momento della stesura.
• Nessuna cifra di accelerazione wall-clock per la coppia DSPARK. Una lunghezza di accettazione di 5.52 è un tasso di successo elevato, ma "quante volte più veloce" su una data GPU è esattamente il numero che OpenBMB non ha pubblicato.
• La suddetta ambiguità relativa alla finestra di contesto: i materiali di marketing indicavano 512K, la configurazione distribuita indica 131.072 e nulla nei repository collega i due valori.
Dove si colloca un tranquillo rilascio open-weight in uno stack
Oggi, la lettura onesta di MiniCPM5-2B è che {{1}}si tratta di una scommessa{{/1}}: numeri importanti dichiarati dal vendor, zero run indipendenti, nessuno storico di serving e un modello draft la cui accelerazione nel mondo reale non è stata misurata. {{2}}È esattamente questa la situazione{{/2}} per cui esiste un livello di routing. Un team che voglia verificare se l'output di un piccolo modello open source possa sostituire un modello hosted a cui già fa chiamate può eseguire il confronto da un'unica API — OrcaRouter dà accesso a oltre 200 modelli hosted al prezzo di listino del provider, senza alcun ricarico, quindi attivare una settimana di valutazione non costa nulla, e il failover automatico garantisce che {{3}}un checkpoint vecchio di pochi giorni non debba mai tenere in ostaggio un percorso di produzione{{/3}} mentre dimostra il proprio valore. Niente di tutto ciò richiede che MiniCPM5-2B sia ospitato da qualche parte; è la rete di sicurezza attorno ai modelli da cui già dipendi mentre decidi se un 2B self-hosted vale la GPU.
Osserva, in ordine di importanza: un run indipendente di SGLang DSPARK che riporti i token reali al secondo per la coppia, dato che la lunghezza di accettazione è un proxy, non un benchmark; un annuncio formale o un mirror su ModelScope che confermi che il rilascio è definitivo; e un provider di hosting che adotti MiniCPM5-2B — se lo fa, il prezzo che paghi dalla nostra parte è il prezzo di listino del provider, lo stesso giorno, perché è questo che significa pass-through. Nel frattempo, il modello draft è l'oggetto più interessante dei due. Un proposer a cinque livelli che il target accetta per cinque token e mezzo su sette è la differenza tra un piccolo modello edge che sembra piccolo e uno che sembra un modello più grande che gira sullo stesso dispositivo.
