
I pesi di MiniCPM5-2B sono disponibili: il piccolo modello che si è aggiudicato la corona sub-4B diventa open-source
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0455Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0247Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0247Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0157Intelligenza82Codice
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2646Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1849Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1541Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1251Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0547Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligenza49Codice
Il modello stesso ha sette settimane. MiniCPM5-2B è stato presentato alla Conferenza Mondiale sull'Intelligenza Artificiale 2026 il 19 luglio, dove ModelBest e OpenBMB lo hanno definito il modello con il punteggio più alto sotto i 4B parametri nella classifica di Artificial Analysis e hanno promesso che i pesi sarebbero arrivati «nel prossimo futuro». Quello che è successo questo fine settimana è che quel prossimo futuro è arrivato senza alcun clamore di lancio: il repository MiniCPM5-2B è andato online su Hugging Face il 6 settembre, e il changelog di OpenBMB segna la pubblicazione il 7 settembre, sotto licenza Apache-2.0, con il pacchetto completo — pesi BF16, quantizzazioni GGUF, MLX e GPTQ, checkpoint base e SFT, un modello draft DSpark per la decodifica speculativa e i dataset di addestramento alla base.
Nessun comunicato stampa l'ha accompagnato e nessun evento di lancio. È semplicemente apparso: una repo Hugging Face un giorno, una riga nel changelog il giorno dopo. Questo lo rende un articolo del tipo "cosa sappiamo finora" — con un primo aggiornamento. La repo ci dice molto: il modello è davvero scaricabile ed eseguibile oggi, e la scheda tecnica è pubblica. Ed è già arrivato anche un punteggio esterno: Artificial Analysis elenca MiniCPM5-2B nel suo Intelligence Index v4.2 con un punteggio di 15, il miglior risultato open-weights con meno di 4B di parametri totali in quell'indice, quindi la classifica sub-4B non si basa più soltanto sulla parola del fornitore. Ciò che invece non è ancora confermato sono i dati principali della scheda del modello, che OpenBMB ha riprodotto nel proprio ambiente di valutazione e che nessuno al di fuori del laboratorio ha ancora ripetuto. Ecco cosa si può sapere dalla repo, cosa è stato ora misurato in modo indipendente e cosa deve ancora essere verificato prima di costruirci sopra.
Cosa è appena successo?
MiniCPM5-2B è il secondo modello della serie MiniCPM5, dopo MiniCPM5-1B, che OpenBMB ha reso open-source il 19 maggio. Quando il 2B è stato distribuito come prodotto al WAIC, la storia era tanto una storia di chip quanto una storia di modelli — ModelBest lo ha inquadrato come una base per agenti on-device per telefoni, PC e cockpit intelligenti, e ha nominato nove chip con supporto dal giorno zero attraverso la sua community FlagOS, da Huawei Ascend a NVIDIA fino a una serie di acceleratori domestici. L'open-sourcing è stato presentato come imminente. Sono passate sette settimane.
Il 6 settembre è apparso il repository openbmb/MiniCPM5-2B. Al momento in cui scrivo, la model card è l'annuncio di rilascio, ed è insolitamente completa per un rilascio in sordina:
• Pesi — il checkpoint finale post-addestrato con RL + OPD in BF16, con licenza Apache-2.0 e non soggetto a restrizioni di accesso — chiunque può scaricarlo.
• Checkpoint complementari — MiniCPM5-2B-SFT, -Midtrain e -Base per chi vuole il modello prima di RL/OPD, più -GGUF, -MLX, -GPTQ e un modello draft -DSpark, tutti elencati nella collezione MiniCPM5 su Hugging Face.
• Dati — anche i corpora di addestramento sono aperti, rilasciati come parte della famiglia UltraData: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 e UltraData-RL-2609.
• Mirror — il README rimanda sia a Hugging Face che a ModelScope.
Nel card, una riga conta più di quanto sembri: "niente kernel custom, niente fork del codice del modello." MiniCPM5-2B usa l'architettura standard LlamaForCausalLM, quindi qualsiasi motore che serve già modelli della famiglia Llama può caricarlo senza dover attendere un'implementazione ad hoc.
Perché un modello da 2.5B merita un secondo sguardo
La presentazione al WAIC era incentrata sulle classifiche. ModelBest ha dichiarato che MiniCPM5-2B ha ottenuto un Artificial Analysis Intelligence Index di 17, collocandosi al primo posto tra i modelli con meno di 4B parametri nella classifica AA al momento del lancio. A quel numero vanno associate due avvertenze. In primo luogo, i punteggi dell'indice sono confrontabili solo all'interno di una stessa versione della metodologia: il precedente 17,9 di MiniCPM5-1B proveniva da uno snapshot precedente di AA, quindi non è una prova che il modello più piccolo "ottenga un punteggio più alto", e per la stessa regola un punteggio più recente ottenuto con una metodologia più recente non è una regressione. In secondo luogo, i dati di AA alimentano la scheda del modello, ma la media principale della scheda è quella di OpenBMB, ottenuta con il proprio harness. Questa distinzione è importante perché AA ha successivamente adottato una metodologia più recente e pubblicato un nuovo punteggio — il primo controllo esterno sulla presentazione dal rilascio dei pesi aperti.
Un numero esterno è arrivato nella stessa settimana dei pesi. Il 4 settembre Artificial Analysis ha pubblicato Intelligence Index v4.2, una revisione metodologica che porta al 40% il peso sui test privati tenuti nascosti e aggiunge due nuove componenti — AA-Briefcase, una valutazione agentica, e Surge's GDP.pdf, un compito di ragionamento su documenti a lungo contesto. La voce dell'indice AA per MiniCPM5-2B ora riporta un punteggio v4.2 di 15: il miglior risultato tra i modelli open-weights sotto i 4B di parametri totali, e il primo dei 47 modelli open di quella classe dimensionale nella lista di AA. Questo mantiene il modello dove lo collocava la presentazione di luglio, questa volta su una metodologia più difficile da aggirare e con pesi che chiunque può scaricare e ricontrollare. Il 15 non è paragonabile al 17 dell'era del lancio, che proveniva dalla v4.1 — la metodologia è più severa, non il modello più debole — e il composito non riverifica le singole righe della scheda, la maggior parte delle quali OpenBMB ha riprodotto nel proprio harness. Quello che fa è attestarsi sui due assi che OpenBMB dice di aver ottimizzato: la v4.2 punta più forte sui compiti agentici, e il monitoraggio della verbosità di AA mostra MiniCPM5-2B che genera 57M di token di output nei compiti dell'indice, il modello più conciso della sua classe contro una mediana di 72M. OpenBMB ha ringraziato AA per l'esecuzione e l'ha inquadrata esattamente in quei termini — performance agentica ed efficienza dei token a 2.6B, ha detto, sono ciò per cui il modello è stato ottimizzato.
La rivendicazione sostanziale era la capacità agentica in un pacchetto piccolo: chiamata nativa degli strumenti, ricerca profonda e generazione di codice, addestrate da zero piuttosto che applicate a posteriori. La scheda descrive una pipeline a tre fasi — addestramento di base, addestramento intermedio e poi post-addestramento di SFT su 400 miliardi di token di dati di pensiero profondo, insegnanti RL specializzati e distillazione on-policy (OPD) che fonde sedici modelli esperti RL, cinque dei quali agentici, in un'unica piccola rete densa. OpenBMB attribuisce alla fase RL + OPD un guadagno medio di 10.96 punti su compiti di ragionamento e generali e di 6.96 punti su compiti agentici — delta interni, ma spiegano la forma insolita di questo modello: una rete da 2.5 miliardi di parametri costruita come un modello di ragionamento e orientata all'uso di strumenti.

Cosa contiene realmente il repository
La scheda tecnica è inequivocabile, perché è il file di configurazione. MiniCPM5-2B ha 2.516.756.480 parametri, di cui 1.981.982.720 sono parametri non-embedding — è questa la cifra che i vendor usano quando parlano di «classe 2B». Si tratta di un transformer denso con 42 layer, hidden size di 2048, grouped-query attention con 16 query head e solo 2 KV head, un vocabolario di 130.560 token e tensori BF16. L'intero modello viene distribuito come un singolo shard safetensors, abbastanza piccolo da poter essere scaricato con una connessione da laptop ed eseguito su una singola GPU di fascia media o su una NPU di classe smartphone.
• Parametri — 2.516.756.480 totali; 1.981.982.720 non-embedding.
• Architettura — LlamaForCausalLM denso, 42 layer, hidden 2048, GQA 16 query head / 2 KV head, vocab 130.560.
• Contesto — 131.072 token configurati (max_position_embeddings), nessuno scaling RoPE nella configurazione.
• Licenza — Apache-2.0, sia per il modello che per i dati di addestramento rilasciati.
• Formato — BF16; le versioni companion GGUF, MLX e GPTQ sono pubblicate separatamente.

Un numero della presentazione di luglio non compare nel checkpoint. I materiali WAIC vantavano una finestra di contesto di 512K token; la configurazione rilasciata imposta max_position_embeddings a 131.072 (128K) senza alcuna voce rope_scaling. È possibile che la cifra di 512K sia destinata a essere raggiunta tramite un'estensione al momento dell'inferenza, come alcuni modelli piccoli allungano il loro contesto — ma così com'è distribuito, il repository documenta 131.072, ed è quello il numero su cui progettare finché OpenBMB non pubblica una ricetta di estensione.
I numeri, ordinati per chi li ha misurati
La scheda del modello è attenta alla provenienza dei dati, e ricompensa chi legge le note a piè di pagina. I punteggi che contrassegna con un obelisco «provengono dalla release ufficiale di Artificial Analysis» — righe come GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6 e GDPval-AA v2 19.6. Tutto il resto è descritto come «riprodotto internamente», il che significa che OpenBMB ha eseguito quelle valutazioni nel proprio harness. In questa categoria rientrano i numeri che attirano l'attenzione: una media interna di 53.9 sul set di confronto della scheda, AIME 2025/2026 a 86.5, MATH-500 a 94.6, LiveCodeBench v6 a 69.1, SWE-bench Verified a 46.4, BFCL v4 a 66.6, τ²-Bench Telecom a 97.1, GAIA (Text-103) a 88.7 e MMLU-Pro a 70.8.
Tre cose rendono onesta la lettura di questi numeri. La media di 53.9 è un punteggio relativo, non assoluto: la scheda del modello normalizza ogni asse del radar, così che il miglior modello del confronto ottenga 100. Il set di confronto è scelto dal produttore: altri modelli open da 2B a 4B, inclusi Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B e LFM2.5-8B-A1B. In quel set, la scheda mostra MiniCPM5-2B superare il secondo miglior modello, Qwen3.5-4B, a 51.1 — un risultato davvero sorprendente per un modello grande la metà, e proprio il tipo di risultato che richiede una riproduzione indipendente prima di costruirci sopra. E un paio di voci singole sono difficili da far quadrare con il marketing: un punteggio SWE-bench Verified di 46.4 da un modello denso da 2.5B sarebbe notevole se si riproducesse, mentre un HLE di 8.9 ricorda che «leader sub-4B» e «frontiera» sono campionati diversi. Nessuno di questi è contraddetto dal repository, e il composite v4.2 di AA ha da allora confermato il piazzamento complessivo del modello al vertice della classe open-weights sotto i 4B — ma queste righe specifiche provengono da OpenBMB, ancora non verificate da nessuno al di fuori del laboratorio.
Esecuzione di MiniCPM5-2B oggi
Poiché l'architettura è Llama puro, i motori mainstream lo caricano direttamente. Il README di OpenBMB fornisce guide rapide per vLLM (0.21 o successivo), SGLang (0.5.16 o successivo) e Transformers (5.6 o successivo), con campionamento consigliato a temperatura 1.0 e top-p 0.95, e enable_thinking attivata quando si vuole il passaggio di ragionamento. I companion GGUF e MLX coprono llama.cpp, Ollama, LM Studio e Apple Silicon; la scheda elenca anche il runtime ArcLight e i consueti stack di fine-tuning (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).
Prima di iniziare, ci sono due dettagli di deployment che vale la pena conoscere. Per il tool e la function calling, SGLang è il backend consigliato: il modello genera chiamate di tool in stile XML e il parser minicpm5 integrato di SGLang le converte nativamente in tool_calls compatibili con OpenAI, il che significa che i client standard per il tool calling funzionano senza uno shim personalizzato. Quanto al modello draft DSpark, serve a rendere più economico il passaggio di ragionamento: avviato in SGLang con l'algoritmo di decodifica speculativa DSPARK, accelera la decodifica lasciando invariati gli output del modello target — il tipo di fattore che determina se un loop di agente con contesto a 128K su un laptop è utilizzabile o soltanto possibile.

Se preferisci valutare un gruppo di piccoli modelli open invece di ottimizzarne uno a mano, il livello di routing dimostra qui il suo valore: quando un provider elenca MiniCPM5-2B, un router è il modo economico per fare un test A/B contro Qwen3.5-2B e gli altri checkpoint open sotto i 4B sullo stesso compito senza una seconda integrazione. Su OrcaRouter ciò significa un'unica API su oltre 200 modelli, prezzi di listino del provider applicati senza margine (0%) e failover automatico se un checkpoint nuovissimo si blocca o va in loop su un percorso di produzione. Il repository ha appena due giorni e nessuna API hosted a cui possiamo puntare elenca ancora MiniCPM5-2B — quindi l'impostazione onesta oggi è trattarlo come un esperimento self-host, non come una dipendenza.
Chi dovrebbe tirare questi pesi?
Scaricateli oggi se il vostro lavoro riguarda agenti on-device, tool-calling per l'edge o esperimenti di coding e reasoning con modelli di piccole dimensioni, e volete l'opzione di classe 2B addestrata più aggressivamente tra quelle sul tavolo. La licenza Apache-2.0 e i dati di addestramento aperti eliminano i due motivi per cui la maggior parte dei team esita davanti a un modello piccolo di un laboratorio cinese: nessuna restrizione all'uso commerciale e nessun corpus a scatola chiusa. Scaricateli con cautela se scegliete un modello di produzione basandovi solo sulla tabella dei benchmark: le righe in evidenza nella scheda sono riproduzioni di OpenBMB, e il composito v4.2 di AA — l'unica misurazione esterna finora — non le garantisce. Un modello da 2.5B che secondo quanto riportato supera Qwen3.5-4B è un'affermazione che merita le due ore necessarie a riprodurre SWE-bench da soli.
Cosa guardare dopo. Il repository ha appena due giorni, quindi i segnali a breve termine sono ancora meccanici: se llama.cpp e la libreria Ollama adotteranno il GGUF, se lo specchio ModelScope e le build per i chip FlagOS andranno in produzione senza intoppi, e se un'API ospitata includerà MiniCPM5-2B — è in quel momento che smette di essere solo self-hosted. Il segnale sostanziale che questo pezzo aveva segnalato come mancante — una valutazione indipendente da parte di Artificial Analysis o di un laboratorio universitario — è ora arrivato sotto forma del punteggio dell'indice v4.2, e mantiene MiniCPM5-2B al primo posto tra i modelli a pesi aperti sotto i 4B. Ciò che manca ancora è la verifica a livello di riga: nessuno al di fuori di OpenBMB ha riprodotto le cifre interne della scheda, in particolare SWE-bench Verified a 46.4 e la media interna di 53.9. Finché quelle specifiche righe non verranno rieseguite, tratta MiniCPM5-2B come tratteresti qualsiasi modello rilasciato in sordina con una scheda impressionante: come un'ipotesi molto promettente che puoi eseguire in locale stasera, e un modello di cui dovresti verificare i numeri più eclatanti prima di affidargli un lavoro reale.
