
Kolibri vs MiniCPM5-2B: 78 miljarder parametrar mot 2,5, och varför den lilla inte är det billiga alternativet
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 217 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Ställ Kolibribredvid MiniCPM5-2B och den instinktiva läsningen är att detta är en storleksjämförelse, och att modellen med 2,5 miljarder parametrar är det ekonomiska valet. Den läsningen är fel på ett lärorikt sätt. Kolibri är Aleph Alphas mixture-of-experts-modell med 78,1 miljarder parametrar, släppt den 3 oktober 2026, som aktiverar 3,46 miljarder parametrar per token, med ett FP8-minnesavtryck på cirka 78 GB och en minsta serveringskonfiguration på två A100 80 GB-kort. MiniCPM5-2B är ModelBest och OpenBMB:s täta modell med 2,52 miljarder parametrar, som presenterades på World Artificial Intelligence Conference den 19 juli 2026, med vikter som lades upp på Hugging Face den 6 september. MiniCPM5-2B är trettioen gånger mindre räknat i parametrar. Det är också den som kräver en utvärderingsbudget innan du litar på den, eftersom dess mest citerade siffror är leverantörskörda och icke-reproducerade — vilket är precis motsatsen till vad "liten modell" vanligtvis antyder om risk.
Båda släpptes i tysthet; bara en av dem släpptes nyligen.
De har liknande ursprungsberättelser och väldigt olika åldrar, och åldrarna spelar roll. Aleph Alphas repository för Kolibri skapades den 2 oktober 2026 med ett angivet releasedatum den 3 oktober, och leverantörens eget tillkännagivande i nyhetsrummet gick ut den morgonen, på Tysklands återföreningsdag. Den allmänna AI-pressen missade det till stor del den dagen, vilket är varifrån formuleringen "tyst lansering" kommer, men ett modellkort, en teknisk rapport och ett leverantörsinlägg är inte ett tyst släpp. MiniCPM5-2B var verkligen tystare: WAIC-tillkännagivandet i juli var en konferensavtäckning av en pitch och specifikationer, och de faktiska vikterna dök inte upp förrän den 6 september, publicerade utan ett lanseringsevenemang, tillsammans med GGUF-, MLX-, GPTQ-, bas-, SFT- och draft-checkpoints samt träningskorpusarna bakom dem.
Det där femveckorsgapet mellan tillkännagivandet och vikterna är värt att komma ihåg, för det är därför två olika uppsättningar siffror cirkulerar för den här modellen. Materialet från juli skröt om ett kontextfönster på 512K token. Den levererade konfigurationen anger 131 072. Den släppta artefakten är den som räknas.
Vad varje modell egentligen är till för
Kolibri är byggt för dokumentarbete på tyska och engelska, och Aleph Alpha är ovanligt specifika om varför det krävde verklig ingenjörskonst. Små experiment med proxymodeller satte ett mål på ungefär 20 procent tyska i träningsmixen, vilket för en körning på 20 biljoner token innebar att hitta 4 biljoner tyska token. Deduplicerade och filtrerade öppna tyska datamängder gav 390 miljarder – en storleksordning för lite – så labbet ställde om ett Common Crawl-filter specifikt för tyska, vilket producerade 1,3 biljoner unika organiska token, och omformulerade befintliga tyska dokument till encyklopediartiklar, dialog och avsnitt för ungefär ytterligare en biljon, vilket blev den största enskilda tyska källan. Översättning, som användes för föregångaren Kolibri Origin, slopades för Kolibri. Detaljen om filtret är den man bör hålla fast vid: en standardpipeline för språkdata kasserar dokument med för många långa ord, och tysk förvaltningsprosa överskrider regelmässigt den engelska gränsen för genomsnittlig ordlängd, så standardinställningar raderar tyst det register som offentlig förvaltning skriver i.
MiniCPM5-2B byggdes för den motsatta änden – en agent på enheten. Kortet beskriver en dense transformer med totalt 2,52 miljarder parametrar, 1,98 miljarder icke-inbäddade, 42 lager med dold storlek 2048, grouped-query attention med 16 query-huvuden och 2 KV-huvuden, samt en standardarkitektur av typen LlamaForCausalLM utan anpassade kärnor. Träningspipelinen är agentiskt präglad: agent-mellanträning i 200-miljardersskala, en stor agent-SFT-uppsättning, agent-RL-alignering och ett sista On-Policy Distillation-steg som viker samman sexton RL-expertmodeller till ett litet dense nätverk. Den levereras med XML-liknande verktygsanrop och en inbyggd SGLang-parser, och i den släppta konfigurationen anges ett fönster på 131 072 token.
• Parametrar — Kolibri: 78 103 074 560 totalt, 3 457 573 120 aktiva, 22,6:1 gleshet. MiniCPM5-2B: 2 516 756 480 totalt, 1,98B icke-inbäddning, tät.
• Släppt — Kolibri: 3 oktober 2026. MiniCPM5-2B: tillkännagavs 19 juli 2026, vikter 6 september 2026.
Kontext — Kolibri: 16 384 tränade, 65 536 mellantränade, 262 144 nativa, 1 048 576 validerade. MiniCPM5-2B: 131 072 i den levererade konfigurationen; 512K-påståendet från juli finns inte med i den.
• Fotavtryck – Kolibri: cirka 78 GB i FP8; minst två A100 80 GB, två H100 SXM5, en H200, en B200 eller en B300. MiniCPM5-2B: en enda BF16-shard, i laptopklass.
• Språk — Kolibri: tyska och engelska, avsiktligt och inget annat. MiniCPM5-2B: engelska och kinesiska, med alla publicerade utvärderingssviter på engelska.
• Verktygsanrop — Kolibri: Hermes-stil med en medföljande vLLM-parser. MiniCPM5-2B: XML-stil med en SGLang-parser.
• Licens — båda Apache 2.0, båda utan ett tillägg om godtagbar användning.

Resultattavlorna, och källorna bakom dem
Det finns inget direkt jämförelsetal för den här kombinationen någonstans, i någon av leverantörernas material, och vi kommer inte att sätta ihop ett från två olika testriggar och kalla det en jämförelse. Det som vardera sidan publicerar är värt att separera noggrant, eftersom de två uppsättningarna siffror har väldigt olika stort bevisvärde.
Kolibris siffror kommer från Aleph Alphas egen jämförelsetabell över fjorton modeller, körd i en och samma testram med Kolibri inställd på hög resonemangsansträngning: 75,5 i engelskt medelvärde, 70,8 i tyskt medelvärde. Den tabellen smickrar inte sitt subjekt — Qwen3.8 27B får 80,2 och 79,9 på samma två medelvärden och leder inom GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified och båda långkontextbenchmarkarna, samtidigt som den aktiverar ungefär en åttondel av Kolibris parametrar. Leverantörens inramning av gapet är en Paretofront av kvalitet mot avkodade tokens per sekund per GPU, som ingen av de jämförda modellerna slår. Det är ett serveringsekonomiskt argument, inte ett kvalitetsargument, och ingen tredje part har mätt det: det finns ingen Artificial Analysis-post för Kolibri och ingen replikering av testramen.
MiniCPM5-2B:s siffror kommer från dess eget modellkort: ett internt genomsnitt på 53,9 över en av leverantören vald jämförelseuppsättning, AIME 2025/2026 på 86,5, MATH-500 på 94,6 och ett leverantörsutfört resultat på 46,4 i SWE-bench Verified som skulle vara anmärkningsvärt för en dense modell med 2,5 miljarder parametrar om den klarar oberoende testning. På det kortet ligger IBMs Granite 4.2 3B på 42,7 mot MiniCPM5-2B:s 53,9 — en leverantör som kör båda modellerna i en svit som den själv har valt. Olika sviter, olika testramverk, olika leverantörer. Inget av detta är en dom över den här kombinationen.
Det som verkligen är användbart på MiniCPM5-2B:s sida är öppenheten. OpenBMB släppte UltraData-träningskorpusarna tillsammans med vikterna – Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, agent-SFT- och RL-uppsättningarna – alla under Apache 2.0, vilket förvandlar en svart låda till ett recept som du kan granska och fortsätta med inom din egen domän. Modellen levereras också med anpassning från dag ett över nio chippfamiljer genom ModelBests FlagOS-gemenskap, från Huawei Ascend till NVIDIA och ARM, vilket är ett uttalande om driftsättning snarare än ett benchmark-uttalande. Mot detta publicerade IBM vikterna för Granite 4.2 3B och en detaljerad teknisk redogörelse för bygget, men inte dess träningsdata, och Aleph Alpha publicerade Kolibris datapipeline och energiredovisning – 20 biljoner förträningstokens, 9,5×10² MWh inklusive datacenteroverhead och exklusive övervakad finjustering och förstärkningsinlärning – men inte själva korpusen.
Där storleksgapet faktiskt visar sig
Det mest användbara sättet att ställa dessa två sida vid sida är utifrån de två axlar som avgör en faktisk driftsättning: vad som måste finnas i rummet, och vad som händer när modellen har fel.
På hårdvarusidan vinner MiniCPM5-2B, och det är inte ens nära. En tät modell med 2,52 miljarder parametrar i en enda BF16-shard körs på en bärbar dator, en edge-box eller ett enda konsumentgrafikkort, och FlagOS-stöd över nio chipfamiljer innebär att den körs på hårdvara som inte är en NVIDIA-accelerator alls. Kolibris lägsta nivå är två A100 80 GB-kort eller ett B200, cirka 78 GB FP8-vikter, som serveras via aleph-alpha-inference vLLM-plugin eller den publicerade containern. För en smart-cockpit- eller telefonnära arbetsbelastning är 2B den enda av de två som kvalificerar sig, och Kolibri var aldrig designad för att konkurrera där.
I fråga om verifierbarhet vinner Kolibri av en subtilare anledning. Dess mest citerade påstående – serveringsekonomin – är otestat, men dess kvalitetssiffror är åtminstone publicerade mot tretton namngivna konkurrenter i en och samma testrigg med inställningarna redovisade, och leverantörens egen tabell ger segern på de flesta rader till en motståndare. MiniCPM5-2B:s huvudsiffror är leverantörens egna, på leverantörens egen testsvit, utan att någon jämförelsetestrigg redovisas, och modellen bär den extra osäkerheten hos en checkpoint som är veckor gammal i stället för dagar. Ingen av modellerna har oberoende benchmarkats. Skillnaden är att den ena leverantören skrev ned en jämförelse som får den egna modellen att förlora, och den andra skrev ned en som får den egna modellen att vinna med stor marginal.
Det är avsiktligt att det inte är någon tävlan alls. Kolibri finns för tyskspråkig dokumentbehandling lokalt, med en tvåspråkig tokenizer som Aleph Alpha rapporterar till 4,90 genomsnittliga byte per token på tysk webbtext mot GPT-5:s 4,35 och Kimi K3:s 3,28 – allt mätt av leverantören, och en kostnadseffekt per token snarare än ett kvalitetsanspråk. MiniCPM5-2B finns för agenter som anropar verktyg på engelska och kinesiska på begränsad hårdvara. Ett team med tyska kontrakt och ett krav på regelefterlevnad väljer inte mellan dem.

Routningsverkligheten, och experimentet som är värt att genomföra
Ingen av modellerna finns i en hostad katalog i dag, och vi kontrollerade båda i stället för att anta. Kolibri har inget leverantörs-API-SKU – utgåvan är vikter, en teknisk rapport och en containeravbild – och den finns inte på OrcaRouter: vi sökte igenom katalogen under varje stavning av leverantörsprefixet och modellnamnet, och den svarar "hittades inte". MiniCPM5-2B har inte heller någon hostad slutpunkt från ModelBest, och den routas inte hos oss. Båda är självhostade alternativ, och vi säger hellre det än antyder att vi tillhandahåller någon av dem.
Det är i experimentet som det här blir intressant. En agentmodell med 2,5 miljarder parametrar och en dokumentmodell med 78 miljarder parametrar löser olika problem, och det enda sättet att veta vilken din arbetsbelastning behöver är att köra båda mot den – vilket är precis den situation ett routningslager är byggt för, även när det inte innehåller någon av modellerna. Rikta en testväg mot ett egenhostat MiniCPM5-2B-bygge genom en OpenAI-kompatibel slutpunkt med automatisk failover, med produktionen kvar på en beprövad routad modell, och den nya stacken kan fastna eller producera nonsens utan att något går ner. Leverantörernas listpriser på modellerna du jämför mot förs vidare utan påslag, så A/B-testet förblir billigt och reversibelt. Och om experimentet faktiskt visar att din tyska arbetsbelastning inte behöver någon av de egenhostade modellerna, når samma nyckel en liten mixture-of-experts-nivå som redan är routad – varianten Gemma 4 26B-A4B för 0,06 USD per miljon indatatokens och 0,33 USD per miljon utdatatokens, med ett fönster på 262 144 token och text-, bild- och videoinmatning – vilket är det billigaste sättet att ta reda på det innan du köper två GPU:er.
Vilken, och vad skulle ändra svaret?
Kör MiniCPM5-2B om begränsningen är enheten. Med 2,52 miljarder parametrar är den den enda av de två som får plats i en laptop, en cockpit eller en edge-box, och om din arbetsbelastning är en interaktiv verktygsanropande agent på engelska eller kinesiska, är det den modell som är avsedd för det. Avsätt tid för att först reproducera dess siffror — genomsnittet på 53,9 och SWE-bench-påståendet på 46,4 är enbart ModelBests, och att träningskorpusarna är öppna gör att den reproduktionen är verkligt möjlig snarare än teoretisk.
Kör Kolibri om korpusen är tysk, hårdvaran finns och vikterna inte får lämna byggnaden. Ett nativt fönster på 262 144 token, en FP8-KV-cache, fyra nivåer för resonemangsansträngning och Hermes-verktygsanrop är rätt form för reglerat dokumentarbete, och Apache 2.0-villkoren plus den publicerade datapipelinen är den del som överlever en upphandlingsgranskning.
Två saker skulle avgöra detta snabbare än något argument. En oberoende SWE-bench Verified-körning på MiniCPM5-2B skulle bekräfta eller kullkasta det enskilt mest överraskande påståendet som något av korten gör. Och en oberoende genomströmningsmätning av Kolibri i dess rekommenderade konfiguration med två H100 – eller en Artificial Analysis-post, som inte finns i dag – skulle förvandla ”78 miljarder parametrar” från en specifikation till en kostnad, vilket är siffran som alla som väger den här jämförelsen mot hårdvara faktiskt letar efter. Fram till dess är storleksgapet verkligt, syftesgapet större, och det till synes billiga alternativet är det som bär det overifierade påståendet.

