Una card del titolo principale con la scritta "Kolibri vs MiniCPM5 2B" in caratteri grandi e in grassetto, con una singola riga più piccola sotto che recita "un modello di livello server contro un agente sul dispositivo", e due piccole icone lineari piatte affiancate — un colibrì a sinistra e il contorno di un piccolo chip mobile a destra — separate da un sottile divisore verticale, su uno sfondo bianco con morbidi accenti sfumati blu e ciano e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Kolibri vs MiniCPM5-2B: 78 miliardi di parametri contro 2,5, e perché quello piccolo non è l'opzione economica

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Kolibri accanto a MiniCPM5-2B e la lettura istintiva è che si tratti di un confronto dimensionale, e che il modello da 2,5 miliardi di parametri sia la scelta economica. Quella lettura è sbagliata in modo istruttivo. Kolibri è il modello mixture-of-experts da 78,1 miliardi di parametri di Aleph Alpha, rilasciato il 3 ottobre 2026, che attiva 3,46 miliardi di parametri per token, con un footprint FP8 di circa 78 GB e una configurazione minima di servizio di due schede A100 80 GB. MiniCPM5-2B è il modello denso da 2,52 miliardi di parametri di ModelBest e OpenBMB, presentato alla World Artificial Intelligence Conference il 19 luglio 2026, con i pesi approdati su Hugging Face il 6 settembre. MiniCPM5-2B è trentuno volte più piccolo per numero di parametri. È anche quello che esige un budget di valutazione prima che ci si fidi di lui, perché i suoi numeri più citati sono eseguiti dal fornitore e non riprodotti — che è esattamente l'opposto di ciò che "modello piccolo" di solito implica in termini di rischio.

Entrambi sono stati rilasciati in sordina; solo uno di loro è stato rilasciato di recente

Hanno storie di origine simili ed età molto diverse, e le età contano. Il repository di Aleph Alpha per Kolibri è stato creato il 2 ottobre 2026 con una data di rilascio dichiarata del 3 ottobre, e l'annuncio della newsroom dello stesso fornitore è stato diffuso quella mattina, nel Giorno dell'Unità Tedesca. La stampa AI generalista per lo più non se ne è accorta quel giorno, ed è da lì che è nata l'etichetta di "rilascio silenzioso", ma una model card, un rapporto tecnico e un post del fornitore non sono un rilascio in sordina. MiniCPM5-2B è stato davvero più silenzioso: l'annuncio al WAIC di luglio è stata una presentazione a una conferenza di un pitch e delle specifiche, e i pesi effettivi sono comparsi solo il 6 settembre, pubblicati senza un evento di lancio, insieme ai checkpoint GGUF, MLX, GPTQ, base, SFT e draft e ai corpora di addestramento alle loro spalle.

Vale la pena ricordare quel divario di cinque settimane tra l'annuncio e i pesi, perché è il motivo per cui esistono due serie diverse di numeri per questo modello. Il materiale di luglio vantava una finestra di contesto da 512K token. La configurazione distribuita imposta 131.072. L'artefatto rilasciato è quello che conta.

A cosa serve realmente ogni modello

Kolibri è progettato per il lavoro su documenti in tedesco e inglese, e Aleph Alpha è insolitamente precisa sul perché ciò abbia richiesto vera ingegneria. Piccoli esperimenti con modelli proxy hanno fissato un obiettivo di circa il 20 per cento di tedesco nel mix di addestramento, il che, per un addestramento da 20.000 miliardi di token, significava trovare 4.000 miliardi di token tedeschi. I dataset tedeschi aperti, deduplicati e filtrati, hanno prodotto 390 miliardi — un ordine di grandezza in meno — così il laboratorio ha ritarato un filtro di Common Crawl specificamente per il tedesco, producendo 1.300 miliardi di token organici unici, e ha riformulato documenti tedeschi esistenti in voci di enciclopedia, dialoghi e brani per circa altri 1.000 miliardi, che ha costituito la più grande singola fonte tedesca. La traduzione, usata per il predecessore Kolibri Origin, è stata abbandonata per Kolibri. Il dettaglio del filtro è quello da tenere a mente: una pipeline standard per dati linguistici scarta i documenti con troppe parole lunghe, e la prosa amministrativa tedesca supera regolarmente il limite inglese sulla lunghezza media delle parole, quindi le impostazioni predefinite eliminano silenziosamente il registro in cui scrive la pubblica amministrazione.

MiniCPM5-2B è stato creato per l'estremo opposto — un agente su dispositivo. La scheda descrive un transformer denso da 2,52 miliardi di parametri totali, 1,98 miliardi non di embedding, 42 livelli con dimensione nascosta 2048, grouped-query attention con 16 teste di query e 2 teste KV, e un'architettura standard LlamaForCausalLM senza kernel personalizzati. La pipeline di addestramento è orientata all'agente: mid-training agentico su scala di 200 miliardi, un ampio set agent-SFT, allineamento RL agentico e una fase finale di On-Policy Distillation che riconduce sedici modelli esperti RL in un'unica piccola rete densa. Include chiamate a strumenti in stile XML con un parser SGLang integrato, e la sua configurazione rilasciata imposta una finestra di 131.072 token.

• Parametri — Kolibri: 78.103.074.560 totali, 3.457.573.120 attivi, sparsità 22,6:1. MiniCPM5-2B: 2.516.756.480 totali, 1,98B non-embedding, denso.

• Rilasciato — Kolibri: 3 ottobre 2026. MiniCPM5-2B: annunciato il 19 luglio 2026, pesi il 6 settembre 2026.

• Contesto — Kolibri: 16.384 addestrati, 65.536 con addestramento intermedio, 262.144 nativi, 1.048.576 convalidati. MiniCPM5-2: 131.072 nella configurazione distribuita; la dichiarazione di 512K di luglio non è presente.

• Ingombro — Kolibri: circa 78 GB in FP8; minimo due A100 80 GB, due H100 SXM5, una H200, una B200 o una B300. MiniCPM5-2B: un singolo shard BF16, di classe laptop.

• Lingue — Kolibri: tedesco e inglese, per scelta progettuale e nient'altro. MiniCPM5-2B: inglese e cinese, con tutte le suite di valutazione pubblicate in inglese.

• Chiamata di strumenti — Kolibri: in stile Hermes con un parser vLLM incluso. MiniCPM5-2B: in stile XML con un parser SGLang.

• Licenza — entrambe Apache 2.0, entrambe senza una clausola aggiuntiva sull'uso accettabile.

A two-column comparison scoreboard titled 'Kolibri vs MiniCPM5 2B'. Left column Kolibri: Parameters 78.1B MoE / 3.46B active, Context 262,144 native / 1M validated, Footprint about 78 GB in FP8, Languages German and English, Tool calling Hermes-style with a vLLM parser, Licence Apache 2.0. Right column MiniCPM5 2B: Parameters 2.52B total / 1.98B non-embedding, Context 131,072 in the shipped config, Footprint a single BF16 shard, laptop-class, Languages English and Chinese, Tool calling XML-style with an SGLang parser, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; MiniCPM5 2B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

I tabelloni segnapunti, e l'approvvigionamento che vi è dietro

Non esiste un numero di confronto diretto per questo abbinamento da nessuna parte, nel materiale dei fornitori, e non metteremo insieme un dato da due banchi di prova diversi per chiamarlo confronto. Vale la pena separare con attenzione ciò che pubblica ciascuna parte, perché i due insiemi di cifre hanno un peso probatorio molto diverso.

I numeri di Kolibri provengono dalla tabella comparativa a quattordici modelli di Aleph Alpha stessa, eseguita su un unico harness con Kolibri a reasoning effort high: 75,5 sulla media inglese, 70,8 sulla media tedesca. Quella tabella non lusinga il suo soggetto — Qwen3.8 27B ottiene 80,2 e 79,9 sulle stesse due medie e primeggia su GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified ed entrambi i benchmark a contesto lungo, attivando circa un ottavo dei parametri di Kolibri. L'inquadramento del fornitore per quel divario è una frontiera di Pareto della qualità rispetto ai token decodificati al secondo per GPU, che nessuno dei modelli confrontati supera. È un argomento di economia del serving, non di capacità, e nessuna terza parte l'ha misurato: non esiste una voce di Artificial Analysis per Kolibri né una replica dell'harness.

I numeri del MiniCPM5-2B provengono dalla sua stessa scheda: una media interna di 53,9 su un insieme di confronti selezionato dal fornitore, AIME 2025/2026 a 86,5, MATH-500 a 94,6 e un 46,4 ottenuto dal fornitore su SWE-bench Verified, che sarebbe notevole per un modello denso da 2,5 miliardi di parametri se superasse i test indipendenti. Su quella scheda, il Granite 4.2 3B di IBM si colloca a 42,7 contro il 53,9 del MiniCPM5-2B: un unico fornitore che esegue entrambi i modelli su una suite da lui scelta. Suite diverse, harness diversi, fornitori diversi. Niente di tutto ciò è un verdetto su questo abbinamento.

Ciò che è realmente utile sul fronte di MiniCPM5-2B è la divulgazione. OpenBMB ha rilasciato i corpora di addestramento UltraData insieme ai pesi — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, i set SFT e RL per agenti — tutti sotto Apache 2.0, il che trasforma una scatola nera in una ricetta che puoi ispezionare e portare avanti sul tuo dominio. Il modello viene inoltre fornito con adattamento day-zero su nove famiglie di chip attraverso la community FlagOS di ModelBest, da Huawei Ascend a NVIDIA e ARM, il che è una dichiarazione di deployment più che di benchmark. Di contro, IBM ha pubblicato i pesi di Granite 4.2 3B e un resoconto tecnico dettagliato della costruzione, ma non i suoi dati di addestramento, e Aleph Alpha ha pubblicato la pipeline dati di Kolibri e la rendicontazione energetica — 20 trilioni di token di pre-addestramento, 9,5×10² MWh includendo l'overhead del data centre ed escludendo il fine-tuning supervisionato e l'apprendimento per rinforzo — ma non il corpus stesso.

Dove il divario dimensionale si manifesta davvero

Il modo più utile per mettere questi due a confronto è sui due assi che decidono un deployment reale: che cosa deve esserci nella stanza, e che cosa succede quando il modello sbaglia.

Sull'hardware, MiniCPM5-2B vince e non di poco. Un modello denso da 2,52 miliardi di parametri in un singolo shard BF16 gira su un laptop, un edge box o una singola GPU consumer, e il supporto di FlagOS su nove famiglie di chip significa che gira su hardware che non è affatto un acceleratore NVIDIA. Il minimo di Kolibri è due schede A100 80 GB o una B200, circa 78 GB di pesi FP8, serviti tramite il plugin vLLM aleph-alpha-inference o il container pubblicato. Per un carico di lavoro da smart-cockpit o affine a un telefono, il 2B è l'unico dei due che si qualifica, e Kolibri non è mai stato progettato per competere in quel segmento.

Sulla verificabilità, Kolibri vince per una ragione più sottile. La sua affermazione più citata — l'economia del serving — non è testata, ma i suoi dati sulla qualità sono almeno pubblicati a confronto con tredici concorrenti nominati su un unico harness con le impostazioni divulgate, e la tabella dello stesso fornitore assegna la vittoria sulla maggior parte delle righe a un avversario. I numeri principali di MiniCPM5-2B sono del fornitore, sulla suite del fornitore, senza alcun harness di confronto divulgato, e il modello porta con sé l'incertezza aggiuntiva di un checkpoint vecchio di settimane anziché di giorni. Nessuno dei due modelli è stato sottoposto a benchmark indipendenti. La differenza è che un fornitore ha messo per iscritto un confronto che fa perdere il proprio modello, e l'altro ne ha messo per iscritto uno che fa vincere il proprio modello con un ampio margine.

Di proposito, non c'è proprio alcuna competizione. Kolibri esiste per l'elaborazione di documenti in lingua tedesca on premises, con un tokenizer bilingue che Aleph Alpha riporta a 4,90 byte medi per token su testo web tedesco rispetto ai 4,35 di GPT-5 e ai 3,28 di Kimi K3 — tutti misurati dal fornitore, e un effetto sul costo per token più che un'affermazione sulla qualità. MiniCPM5-2B esiste per agenti con tool-calling in inglese e cinese su hardware con risorse limitate. Un team con contratti tedeschi e un requisito di conformità non sta scegliendo tra i due.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the card header with the OpenBMB organisation and its like count, the TextGeneration, Transformers and Safetensors tags, the English and Chinese language tags, the on-device and tool-calling tags, the Apache 2.0 licence, and the model-size line reading 3B parameters in BF16 tensor type.

La realtà del routing, e l'esperimento che vale la pena condurre

Nessuno dei due modelli figura oggi in un catalogo ospitato, e li abbiamo verificati entrambi invece di darlo per scontato. Kolibri non ha alcuno SKU API del fornitore — la release è composta da pesi, un report tecnico e un'immagine container — e non è presente su OrcaRouter: abbiamo sondato il catalogo con ogni variante ortografica del prefisso del fornitore e del nome del modello e restituisce non trovato. Nemmeno MiniCPM5-2B ha un endpoint ospitato da ModelBest, e non è instradato con noi. Entrambe sono proposte self-hosted e preferiamo dirlo piuttosto che lasciar intendere che ne serviamo una.

Il punto in cui la cosa diventa interessante è l'esperimento. Un modello agentico da 2,5 miliardi di parametri e un modello documentale da 78 miliardi di parametri risolvono problemi diversi, e l'unico modo per sapere quale serva al tuo carico di lavoro è metterli alla prova entrambi su di esso — che è esattamente la situazione per cui è costruito un livello di routing, anche quando non ospita nessuno dei due modelli. Punta un percorso di test verso una build MiniCPM5-2B self-hosted attraverso un endpoint compatibile con OpenAI con failover automatico, lasciando la produzione su un modello instradato collaudato, e il nuovo stack può bloccarsi o produrre assurdità senza far cadere nulla. I prezzi di listino dei provider sui modelli con cui fai il confronto passano senza alcun ricarico, così il test A/B resta economico e reversibile. E se ciò che l'esperimento rivela davvero è che il tuo carico di lavoro tedesco non ha bisogno di nessuno dei due modelli self-hosted, la stessa chiave raggiunge un piccolo tier mixture-of-experts già instradato — la variante Gemma 4 26B-A4B a $0.06 per milione di token di input e $0.33 per milione di output, con una finestra di 262.144 token e input di testo, immagini e video — che è il modo più economico per scoprirlo prima di comprare due GPU.

Quale, e cosa cambierebbe la risposta

Esegui MiniCPM5-2B se il vincolo è il dispositivo. Con 2,52 miliardi di parametri è l'unico dei due che entra in un laptop, in un cockpit o in un edge box, e se il tuo carico di lavoro è un agente interattivo con chiamata di strumenti in inglese o cinese, è il modello pensato per questo. Metti in conto il tempo necessario per riprodurre prima i suoi numeri: la media di 53,9 e il valore di 46,4 dichiarato su SWE-bench sono solo di ModelBest, e il fatto che i corpora di addestramento siano aperti rende quella riproduzione davvero possibile anziché teorica.

Esegui Kolibri se il corpus è in tedesco, l'hardware esiste e i pesi non possono uscire dall'edificio. Una finestra nativa da 262.144 token, una KV cache FP8, quattro livelli di sforzo di ragionamento e il tool calling di Hermes sono la forma giusta per il lavoro documentale regolamentato, e i termini Apache 2.0 più la pipeline dati pubblicata sono la parte che supera una revisione di approvvigionamento.

Due cose risolverebbero questa questione più in fretta di qualsiasi discussione. Un'esecuzione indipendente di SWE-bench Verified su MiniCPM5-2B confermerebbe o affonderebbe l'affermazione più sorprendente che l'una o l'altra scheda avanza. E una misurazione indipendente del throughput di Kolibri nella sua configurazione consigliata a due H100 — o una voce su Artificial Analysis, che oggi non esiste — trasformerebbe «78 miliardi di parametri» da specifica in costo, che è il numero che chiunque soppesi questo confronto rispetto all'hardware sta effettivamente cercando. Fino ad allora, il divario di dimensioni è reale, il divario di scopo è maggiore, e l'opzione dall'apparenza economica è quella che porta con sé l'affermazione non verificata.

A screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the model header under Google, the 262K-token context badge, the input line reading text plus image plus video, and the community description noting 25.2B total parameters with 3.8B activated per token during inference.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno