
Kolibri vs MiniCPM5-2B: 78 miliardi di parametri contro 2,5, e perché quello piccolo non è l'opzione economica
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 217 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Kolibri accanto a MiniCPM5-2B e la lettura istintiva è che si tratti di un confronto dimensionale, e che il modello da 2,5 miliardi di parametri sia la scelta economica. Quella lettura è sbagliata in modo istruttivo. Kolibri è il modello mixture-of-experts da 78,1 miliardi di parametri di Aleph Alpha, rilasciato il 3 ottobre 2026, che attiva 3,46 miliardi di parametri per token, con un footprint FP8 di circa 78 GB e una configurazione minima di servizio di due schede A100 80 GB. MiniCPM5-2B è il modello denso da 2,52 miliardi di parametri di ModelBest e OpenBMB, presentato alla World Artificial Intelligence Conference il 19 luglio 2026, con i pesi approdati su Hugging Face il 6 settembre. MiniCPM5-2B è trentuno volte più piccolo per numero di parametri. È anche quello che esige un budget di valutazione prima che ci si fidi di lui, perché i suoi numeri più citati sono eseguiti dal fornitore e non riprodotti — che è esattamente l'opposto di ciò che "modello piccolo" di solito implica in termini di rischio.
Entrambi sono stati rilasciati in sordina; solo uno di loro è stato rilasciato di recente
Hanno storie di origine simili ed età molto diverse, e le età contano. Il repository di Aleph Alpha per Kolibri è stato creato il 2 ottobre 2026 con una data di rilascio dichiarata del 3 ottobre, e l'annuncio della newsroom dello stesso fornitore è stato diffuso quella mattina, nel Giorno dell'Unità Tedesca. La stampa AI generalista per lo più non se ne è accorta quel giorno, ed è da lì che è nata l'etichetta di "rilascio silenzioso", ma una model card, un rapporto tecnico e un post del fornitore non sono un rilascio in sordina. MiniCPM5-2B è stato davvero più silenzioso: l'annuncio al WAIC di luglio è stata una presentazione a una conferenza di un pitch e delle specifiche, e i pesi effettivi sono comparsi solo il 6 settembre, pubblicati senza un evento di lancio, insieme ai checkpoint GGUF, MLX, GPTQ, base, SFT e draft e ai corpora di addestramento alle loro spalle.
Vale la pena ricordare quel divario di cinque settimane tra l'annuncio e i pesi, perché è il motivo per cui esistono due serie diverse di numeri per questo modello. Il materiale di luglio vantava una finestra di contesto da 512K token. La configurazione distribuita imposta 131.072. L'artefatto rilasciato è quello che conta.
A cosa serve realmente ogni modello
Kolibri è progettato per il lavoro su documenti in tedesco e inglese, e Aleph Alpha è insolitamente precisa sul perché ciò abbia richiesto vera ingegneria. Piccoli esperimenti con modelli proxy hanno fissato un obiettivo di circa il 20 per cento di tedesco nel mix di addestramento, il che, per un addestramento da 20.000 miliardi di token, significava trovare 4.000 miliardi di token tedeschi. I dataset tedeschi aperti, deduplicati e filtrati, hanno prodotto 390 miliardi — un ordine di grandezza in meno — così il laboratorio ha ritarato un filtro di Common Crawl specificamente per il tedesco, producendo 1.300 miliardi di token organici unici, e ha riformulato documenti tedeschi esistenti in voci di enciclopedia, dialoghi e brani per circa altri 1.000 miliardi, che ha costituito la più grande singola fonte tedesca. La traduzione, usata per il predecessore Kolibri Origin, è stata abbandonata per Kolibri. Il dettaglio del filtro è quello da tenere a mente: una pipeline standard per dati linguistici scarta i documenti con troppe parole lunghe, e la prosa amministrativa tedesca supera regolarmente il limite inglese sulla lunghezza media delle parole, quindi le impostazioni predefinite eliminano silenziosamente il registro in cui scrive la pubblica amministrazione.
MiniCPM5-2B è stato creato per l'estremo opposto — un agente su dispositivo. La scheda descrive un transformer denso da 2,52 miliardi di parametri totali, 1,98 miliardi non di embedding, 42 livelli con dimensione nascosta 2048, grouped-query attention con 16 teste di query e 2 teste KV, e un'architettura standard LlamaForCausalLM senza kernel personalizzati. La pipeline di addestramento è orientata all'agente: mid-training agentico su scala di 200 miliardi, un ampio set agent-SFT, allineamento RL agentico e una fase finale di On-Policy Distillation che riconduce sedici modelli esperti RL in un'unica piccola rete densa. Include chiamate a strumenti in stile XML con un parser SGLang integrato, e la sua configurazione rilasciata imposta una finestra di 131.072 token.
• Parametri — Kolibri: 78.103.074.560 totali, 3.457.573.120 attivi, sparsità 22,6:1. MiniCPM5-2B: 2.516.756.480 totali, 1,98B non-embedding, denso.
• Rilasciato — Kolibri: 3 ottobre 2026. MiniCPM5-2B: annunciato il 19 luglio 2026, pesi il 6 settembre 2026.
• Contesto — Kolibri: 16.384 addestrati, 65.536 con addestramento intermedio, 262.144 nativi, 1.048.576 convalidati. MiniCPM5-2: 131.072 nella configurazione distribuita; la dichiarazione di 512K di luglio non è presente.
• Ingombro — Kolibri: circa 78 GB in FP8; minimo due A100 80 GB, due H100 SXM5, una H200, una B200 o una B300. MiniCPM5-2B: un singolo shard BF16, di classe laptop.
• Lingue — Kolibri: tedesco e inglese, per scelta progettuale e nient'altro. MiniCPM5-2B: inglese e cinese, con tutte le suite di valutazione pubblicate in inglese.
• Chiamata di strumenti — Kolibri: in stile Hermes con un parser vLLM incluso. MiniCPM5-2B: in stile XML con un parser SGLang.
• Licenza — entrambe Apache 2.0, entrambe senza una clausola aggiuntiva sull'uso accettabile.

I tabelloni segnapunti, e l'approvvigionamento che vi è dietro
Non esiste un numero di confronto diretto per questo abbinamento da nessuna parte, nel materiale dei fornitori, e non metteremo insieme un dato da due banchi di prova diversi per chiamarlo confronto. Vale la pena separare con attenzione ciò che pubblica ciascuna parte, perché i due insiemi di cifre hanno un peso probatorio molto diverso.
I numeri di Kolibri provengono dalla tabella comparativa a quattordici modelli di Aleph Alpha stessa, eseguita su un unico harness con Kolibri a reasoning effort high: 75,5 sulla media inglese, 70,8 sulla media tedesca. Quella tabella non lusinga il suo soggetto — Qwen3.8 27B ottiene 80,2 e 79,9 sulle stesse due medie e primeggia su GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified ed entrambi i benchmark a contesto lungo, attivando circa un ottavo dei parametri di Kolibri. L'inquadramento del fornitore per quel divario è una frontiera di Pareto della qualità rispetto ai token decodificati al secondo per GPU, che nessuno dei modelli confrontati supera. È un argomento di economia del serving, non di capacità, e nessuna terza parte l'ha misurato: non esiste una voce di Artificial Analysis per Kolibri né una replica dell'harness.
I numeri del MiniCPM5-2B provengono dalla sua stessa scheda: una media interna di 53,9 su un insieme di confronti selezionato dal fornitore, AIME 2025/2026 a 86,5, MATH-500 a 94,6 e un 46,4 ottenuto dal fornitore su SWE-bench Verified, che sarebbe notevole per un modello denso da 2,5 miliardi di parametri se superasse i test indipendenti. Su quella scheda, il Granite 4.2 3B di IBM si colloca a 42,7 contro il 53,9 del MiniCPM5-2B: un unico fornitore che esegue entrambi i modelli su una suite da lui scelta. Suite diverse, harness diversi, fornitori diversi. Niente di tutto ciò è un verdetto su questo abbinamento.
Ciò che è realmente utile sul fronte di MiniCPM5-2B è la divulgazione. OpenBMB ha rilasciato i corpora di addestramento UltraData insieme ai pesi — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, i set SFT e RL per agenti — tutti sotto Apache 2.0, il che trasforma una scatola nera in una ricetta che puoi ispezionare e portare avanti sul tuo dominio. Il modello viene inoltre fornito con adattamento day-zero su nove famiglie di chip attraverso la community FlagOS di ModelBest, da Huawei Ascend a NVIDIA e ARM, il che è una dichiarazione di deployment più che di benchmark. Di contro, IBM ha pubblicato i pesi di Granite 4.2 3B e un resoconto tecnico dettagliato della costruzione, ma non i suoi dati di addestramento, e Aleph Alpha ha pubblicato la pipeline dati di Kolibri e la rendicontazione energetica — 20 trilioni di token di pre-addestramento, 9,5×10² MWh includendo l'overhead del data centre ed escludendo il fine-tuning supervisionato e l'apprendimento per rinforzo — ma non il corpus stesso.
Dove il divario dimensionale si manifesta davvero
Il modo più utile per mettere questi due a confronto è sui due assi che decidono un deployment reale: che cosa deve esserci nella stanza, e che cosa succede quando il modello sbaglia.
Sull'hardware, MiniCPM5-2B vince e non di poco. Un modello denso da 2,52 miliardi di parametri in un singolo shard BF16 gira su un laptop, un edge box o una singola GPU consumer, e il supporto di FlagOS su nove famiglie di chip significa che gira su hardware che non è affatto un acceleratore NVIDIA. Il minimo di Kolibri è due schede A100 80 GB o una B200, circa 78 GB di pesi FP8, serviti tramite il plugin vLLM aleph-alpha-inference o il container pubblicato. Per un carico di lavoro da smart-cockpit o affine a un telefono, il 2B è l'unico dei due che si qualifica, e Kolibri non è mai stato progettato per competere in quel segmento.
Sulla verificabilità, Kolibri vince per una ragione più sottile. La sua affermazione più citata — l'economia del serving — non è testata, ma i suoi dati sulla qualità sono almeno pubblicati a confronto con tredici concorrenti nominati su un unico harness con le impostazioni divulgate, e la tabella dello stesso fornitore assegna la vittoria sulla maggior parte delle righe a un avversario. I numeri principali di MiniCPM5-2B sono del fornitore, sulla suite del fornitore, senza alcun harness di confronto divulgato, e il modello porta con sé l'incertezza aggiuntiva di un checkpoint vecchio di settimane anziché di giorni. Nessuno dei due modelli è stato sottoposto a benchmark indipendenti. La differenza è che un fornitore ha messo per iscritto un confronto che fa perdere il proprio modello, e l'altro ne ha messo per iscritto uno che fa vincere il proprio modello con un ampio margine.
Di proposito, non c'è proprio alcuna competizione. Kolibri esiste per l'elaborazione di documenti in lingua tedesca on premises, con un tokenizer bilingue che Aleph Alpha riporta a 4,90 byte medi per token su testo web tedesco rispetto ai 4,35 di GPT-5 e ai 3,28 di Kimi K3 — tutti misurati dal fornitore, e un effetto sul costo per token più che un'affermazione sulla qualità. MiniCPM5-2B esiste per agenti con tool-calling in inglese e cinese su hardware con risorse limitate. Un team con contratti tedeschi e un requisito di conformità non sta scegliendo tra i due.

La realtà del routing, e l'esperimento che vale la pena condurre
Nessuno dei due modelli figura oggi in un catalogo ospitato, e li abbiamo verificati entrambi invece di darlo per scontato. Kolibri non ha alcuno SKU API del fornitore — la release è composta da pesi, un report tecnico e un'immagine container — e non è presente su OrcaRouter: abbiamo sondato il catalogo con ogni variante ortografica del prefisso del fornitore e del nome del modello e restituisce non trovato. Nemmeno MiniCPM5-2B ha un endpoint ospitato da ModelBest, e non è instradato con noi. Entrambe sono proposte self-hosted e preferiamo dirlo piuttosto che lasciar intendere che ne serviamo una.
Il punto in cui la cosa diventa interessante è l'esperimento. Un modello agentico da 2,5 miliardi di parametri e un modello documentale da 78 miliardi di parametri risolvono problemi diversi, e l'unico modo per sapere quale serva al tuo carico di lavoro è metterli alla prova entrambi su di esso — che è esattamente la situazione per cui è costruito un livello di routing, anche quando non ospita nessuno dei due modelli. Punta un percorso di test verso una build MiniCPM5-2B self-hosted attraverso un endpoint compatibile con OpenAI con failover automatico, lasciando la produzione su un modello instradato collaudato, e il nuovo stack può bloccarsi o produrre assurdità senza far cadere nulla. I prezzi di listino dei provider sui modelli con cui fai il confronto passano senza alcun ricarico, così il test A/B resta economico e reversibile. E se ciò che l'esperimento rivela davvero è che il tuo carico di lavoro tedesco non ha bisogno di nessuno dei due modelli self-hosted, la stessa chiave raggiunge un piccolo tier mixture-of-experts già instradato — la variante Gemma 4 26B-A4B a $0.06 per milione di token di input e $0.33 per milione di output, con una finestra di 262.144 token e input di testo, immagini e video — che è il modo più economico per scoprirlo prima di comprare due GPU.
Quale, e cosa cambierebbe la risposta
Esegui MiniCPM5-2B se il vincolo è il dispositivo. Con 2,52 miliardi di parametri è l'unico dei due che entra in un laptop, in un cockpit o in un edge box, e se il tuo carico di lavoro è un agente interattivo con chiamata di strumenti in inglese o cinese, è il modello pensato per questo. Metti in conto il tempo necessario per riprodurre prima i suoi numeri: la media di 53,9 e il valore di 46,4 dichiarato su SWE-bench sono solo di ModelBest, e il fatto che i corpora di addestramento siano aperti rende quella riproduzione davvero possibile anziché teorica.
Esegui Kolibri se il corpus è in tedesco, l'hardware esiste e i pesi non possono uscire dall'edificio. Una finestra nativa da 262.144 token, una KV cache FP8, quattro livelli di sforzo di ragionamento e il tool calling di Hermes sono la forma giusta per il lavoro documentale regolamentato, e i termini Apache 2.0 più la pipeline dati pubblicata sono la parte che supera una revisione di approvvigionamento.
Due cose risolverebbero questa questione più in fretta di qualsiasi discussione. Un'esecuzione indipendente di SWE-bench Verified su MiniCPM5-2B confermerebbe o affonderebbe l'affermazione più sorprendente che l'una o l'altra scheda avanza. E una misurazione indipendente del throughput di Kolibri nella sua configurazione consigliata a due H100 — o una voce su Artificial Analysis, che oggi non esiste — trasformerebbe «78 miliardi di parametri» da specifica in costo, che è il numero che chiunque soppesi questo confronto rispetto all'hardware sta effettivamente cercando. Fino ad allora, il divario di dimensioni è reale, il divario di scopo è maggiore, e l'opzione dall'apparenza economica è quella che porta con sé l'affermazione non verificata.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
