Główna karta tytułowa z napisem „Kolibri vs MiniCPM5 2B” dużą pogrubioną czcionką, z pojedynczą mniejszą linijką poniżej o treści „model klasy serwerowej kontra agent działający na urządzeniu”, oraz dwiema małymi płaskimi ikonami liniowymi obok siebie — koliber po lewej i mały zarys układu mobilnego po prawej — oddzielonymi cienkim pionowym separatorem, na białym tle z delikatnymi niebiesko-cyjanowymi akcentami gradientowymi i logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Kolibri vs MiniCPM5-2B: 78 miliardów parametrów kontra 2,5 i dlaczego ten mały nie jest tanią opcją

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ustaw Kolibri obok MiniCPM5-2B, a instynktowna interpretacja jest taka, że to porównanie rozmiarów i że model o 2,5 miliarda parametrów jest oszczędnym wyborem. Ta interpretacja jest błędna w sposób pouczający. Kolibri to należący do Aleph Alpha model typu mixture-of-experts o 78,1 miliarda parametrów, wydany 3 października 2026 roku, aktywujący 3,46 miliarda parametrów na token, z zajętością w FP8 wynoszącą około 78 GB i minimalną konfiguracją serwowania złożoną z dwóch kart A100 80 GB. MiniCPM5-2B to gęsty model o 2,52 miliarda parametrów należący do ModelBest i OpenBMB, zaprezentowany na Światowej Konferencji Sztucznej Inteligencji 19 lipca 2026 roku, a jego wagi trafiły na Hugging Face 6 września. MiniCPM5-2B jest trzydzieści jeden razy mniejszy pod względem liczby parametrów. To także ten model, który wymaga budżetu na ewaluację, zanim mu zaufasz, ponieważ jego najczęściej cytowane liczby zostały uzyskane przez dostawcę i nie zostały odtworzone — co jest dokładnie przeciwieństwem tego, co „mały model” zwykle sugeruje w kwestii ryzyka.

Oba zostały wysłane po cichu; tylko jedno z nich zostało wysłane niedawno.

Mają podobne historie powstania i bardzo różny wiek, a wiek ma znaczenie. Repozytorium Kolibri firmy Aleph Alpha utworzono 2 października 2026 r. z podaną datą premiery 3 października, a własne ogłoszenie dostawcy w jego newsroomie ukazało się tego ranka, w Dzień Jedności Niemiec. Ogólna prasa poświęcona AI w dużej mierze to przeoczyła tego dnia, stąd wzięło się określenie „cicha premiera”, ale karta modelu, raport techniczny i wpis dostawcy to nie jest ciche wydanie. MiniCPM5-2B rzeczywiście był cichszy: ogłoszenie na WAIC w lipcu było konferencyjnym ujawnieniem zapowiedzi i specyfikacji, a same wagi pojawiły się dopiero 6 września, opublikowane bez wydarzenia premierowego, wraz z checkpointami GGUF, MLX, GPTQ, base, SFT i draft oraz stojącymi za nimi korpusami treningowymi.

Ta pięciotygodniowa przerwa między ogłoszeniem a wagami jest warta zapamiętania, ponieważ to właśnie dlatego w obiegu są dwa różne zestawy liczb dla tego modelu. Materiały z lipca zachwalały okno kontekstowe o rozmiarze 512 tys. tokenów. Wysłana konfiguracja ustawia 131 072. Liczy się ten wydany artefakt.

Do czego tak naprawdę służy każdy model

Kolibri powstał z myślą o pracy z dokumentami niemieckimi i angielskimi, a Aleph Alpha nietypowo konkretnie wyjaśnia, dlaczego wymagało to prawdziwej inżynierii. Niewielkie eksperymenty z modelami zastępczymi ustaliły cel około 20 procent niemieckiego w mieszance treningowej, co przy treningu na 20 bilionów tokenów oznaczało znalezienie 4 bilionów niemieckich tokenów. Zdeduplikowane i przefiltrowane otwarte niemieckojęzyczne zbiory danych dały 390 miliardów — o rząd wielkości za mało — więc laboratorium dostroiło filtr Common Crawl specjalnie do języka niemieckiego, uzyskując 1,3 biliona unikalnych organicznych tokenów, oraz przeformułowało istniejące niemieckie dokumenty na hasła encyklopedyczne, dialogi i fragmenty, dając w przybliżeniu kolejny bilion, który stał się największym pojedynczym niemieckojęzycznym źródłem. Tłumaczenie, wykorzystane w poprzedniku Kolibri Origin, zostało porzucone w Kolibri. To właśnie szczegół dotyczący filtra warto zapamiętać: standardowy potok danych językowych odrzuca dokumenty z zbyt dużą liczbą długich słów, a niemiecka proza administracyjna rutynowo przekracza angielski limit średniej długości słowa, więc domyślne ustawienia po cichu usuwają rejestr, w którym pisze administracja publiczna.

MiniCPM5-2B został stworzony z myślą o przeciwległym końcu — agencie działającym na urządzeniu. Karta opisuje gęsty transformer o łącznej liczbie 2,52 miliarda parametrów, 1,98 miliarda niebędących osadzeniami, 42 warstwach przy rozmiarze ukrytym 2048, grouped-query attention z 16 głowami zapytań i 2 głowami KV oraz standardową architekturę LlamaForCausalLM bez niestandardowych kerneli. Pipeline treningowy jest nastawiony na podejście agentowe: trening pośredni agenta w skali 200 miliardów, duży zestaw agent-SFT, dostrajanie RL agenta oraz końcowy etap destylacji on-policy (On-Policy Distillation), który składa szesnaście modeli eksperckich RL z powrotem w jedną małą gęstą sieć. Jest dostarczany z wywołaniami narzędzi w stylu XML i wbudowanym parserem SGLang, a jego udostępniona konfiguracja ustawia okno 131 072 tokenów.

• Parametry — Kolibri: łącznie 78 103 074 560, aktywne 3 457 573 120, rzadkość 22,6:1. MiniCPM5-2B: łącznie 2 516 756 480, 1,98 mld bez osadzeń, gęsty.

• Wydano — Kolibri: 3 października 2026. MiniCPM5-2B: ogłoszono 19 lipca 2026, wagi 6 września 2026.

• Kontekst — Kolibri: 16 384 wytrenowany, 65 536 średnio wytrenowany, 262 144 natywny, 1 048 576 zwalidowany. MiniCPM5-2B: 131 072 w dostarczanej konfiguracji; twierdzenie o 512K z lipca nie znajduje się w niej.

• Ślad — Kolibri: około 78 GB w FP8; minimum dwa A100 80 GB, dwa H100 SXM5, jeden H200, jeden B200 lub jeden B300. MiniCPM5-2B: pojedynczy shard BF16, klasy laptopa.

• Języki — Kolibri: niemiecki i angielski, z założenia i nic więcej. MiniCPM5-2B: angielski i chiński, a wszystkie opublikowane zestawy ewaluacyjne są w języku angielskim.

• Wywoływanie narzędzi — Kolibri: w stylu Hermes z dołączonym parserem vLLM. MiniCPM5-2B: w stylu XML z parserem SGLang.

• Licencja — obie Apache 2.0, obie bez klauzuli dopuszczalnego użytku.

A two-column comparison scoreboard titled 'Kolibri vs MiniCPM5 2B'. Left column Kolibri: Parameters 78.1B MoE / 3.46B active, Context 262,144 native / 1M validated, Footprint about 78 GB in FP8, Languages German and English, Tool calling Hermes-style with a vLLM parser, Licence Apache 2.0. Right column MiniCPM5 2B: Parameters 2.52B total / 1.98B non-embedding, Context 131,072 in the shipped config, Footprint a single BF16 shard, laptop-class, Languages English and Chinese, Tool calling XML-style with an SGLang parser, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; MiniCPM5 2B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

Tabele wyników i źródła danych, które za nimi stoją

Nigdzie nie ma bezpośredniego wyniku liczbowego dla tej pary — ani w materiałach jednego, ani drugiego dostawcy — i nie zamierzamy składać go z dwóch różnych stanowisk testowych i nazywać porównaniem. To, co publikuje każda ze stron, warto starannie rozdzielić, ponieważ oba zestawy liczb niosą ze sobą bardzo różną ilość dowodów.

Liczby Kolibri pochodzą z własnej czternastomodelowej tabeli porównawczej Aleph Alpha, uruchomionej na jednym harnessie z Kolibri przy wysokim poziomie wysiłku rozumowania: 75,5 w średniej dla języka angielskiego, 70,8 w średniej dla języka niemieckiego. Ta tabela nie schlebia swojemu obiektowi — Qwen3.8 27B uzyskuje 80,2 i 79,9 w tych samych dwóch średnich i prowadzi w GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified oraz obu benchmarkach długiego kontekstu, aktywując przy tym około jednej ósmej parametrów Kolibri. Sposób, w jaki dostawca ujmuje tę lukę, to front Pareto jakości względem dekodowanych tokenów na sekundę na GPU, którego nie przebija żaden z porównywanych modeli. To argument z zakresu ekonomiki serwowania, a nie argument o możliwościach, i żadna strona trzecia go nie zmierzyła: nie ma wpisu dla Kolibri w Artificial Analysis ani replikacji harnessu.

Liczby MiniCPM5-2B pochodzą z jego własnej karty: wewnętrzna średnia 53,9 w wybranym przez dostawcę zestawie porównawczym, AIME 2025/2026 na poziomie 86,5, MATH-500 na poziomie 94,6 oraz uzyskany przez dostawcę wynik 46,4 w SWE-bench Verified, który byłby niezwykły dla gęstego modelu o 2,5 miliarda parametrów, gdyby przetrwał niezależne testy. Na tej karcie Granite 4.2 3B od IBM plasuje się na 42,7 wobec 53,9 MiniCPM5-2B — jeden dostawca uruchamiający oba modele na jednym wybranym przez siebie zestawie. Różne zestawy, różne systemy testowe, różni dostawcy. Nic z tego nie stanowi werdyktu o tym zestawieniu.

To, co jest naprawdę użyteczne po stronie MiniCPM5-2B, to ujawnienie danych. OpenBMB udostępniło zbiory treningowe UltraData razem z wagami — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, zestawy SFT i RL dla agentów — wszystko na licencji Apache 2.0, co zamienia czarną skrzynkę w przepis, który można przejrzeć i kontynuować we własnej dziedzinie. Model jest też dostarczany z adaptacją od dnia zerowego dla dziewięciu rodzin układów za pośrednictwem społeczności FlagOS firmy ModelBest, od Huawei Ascend po NVIDIA i ARM, co jest deklaracją dotyczącą wdrożeń, a nie benchmarków. Na tym tle IBM opublikowało wagi Granite 4.2 3B i szczegółowy opis techniczny procesu budowy, ale nie swoje dane treningowe, a Aleph Alpha opublikowała potok danych Kolibri i bilans energetyczny — 20 bilionów tokenów pretreningowych, 9,5×10² MWh z uwzględnieniem narzutu centrów danych i z wyłączeniem nadzorowanego dostrajania oraz uczenia ze wzmocnieniem — ale nie sam korpus.

Gdzie faktycznie widać różnicę w rozmiarze

Najbardziej użytecznym sposobem zestawienia tych dwóch obok siebie jest umieszczenie ich na dwóch osiach, które decydują o rzeczywistym wdrożeniu: co musi znajdować się w pomieszczeniu i co się dzieje, gdy model się myli.

Na sprzęcie MiniCPM5-2B wygrywa i to bezapelacyjnie. Gęsty model o 2,52 miliarda parametrów w jednym shardzie BF16 działa na laptopie, urządzeniu brzegowym albo pojedynczym konsumenckim GPU, a wsparcie FlagOS dla dziewięciu rodzin układów oznacza, że działa na sprzęcie, który w ogóle nie jest akceleratorem NVIDIA. Minimalne wymagania Kolibri to dwie karty A100 80 GB albo jedna B200, około 78 GB wag FP8, obsługiwane przez wtyczkę aleph-alpha-inference do vLLM lub opublikowany kontener. W przypadku obciążenia dla inteligentnego kokpitu lub zastosowań związanych z telefonem 2B jest jedynym z tych dwóch, który się nadaje, a Kolibri nigdy nie był projektowany, by konkurować w tym segmencie.

Jeśli chodzi o weryfikowalność, Kolibri wygrywa z subtelniejszego powodu. Jego najczęściej cytowane twierdzenie — ekonomika serwowania — nie zostało przetestowane, ale jego liczby dotyczące jakości są przynajmniej opublikowane na tle trzynastu nazwanych konkurentów na jednym zestawie testowym, z ujawnionymi ustawieniami, a własna tabela dostawcy w większości wierszy przyznaje zwycięstwo przeciwnikowi. Najważniejsze liczby MiniCPM5-2B pochodzą od dostawcy i dotyczą zestawu dostawcy, bez ujawnionego zestawu porównawczego, a model ten obarczony jest dodatkową niepewnością wynikającą z checkpointu powstałego tygodnie, a nie dni temu. Żaden z modeli nie przeszedł niezależnych benchmarków. Różnica polega na tym, że jeden dostawca zapisał porównanie, w którym jego własny model przegrywa, a drugi zapisał takie, w którym jego własny model wygrywa z dużą przewagą.

Celowo nie ma tu żadnej rywalizacji. Kolibri istnieje po to, by przetwarzać dokumenty niemieckojęzyczne w środowisku lokalnym, z dwujęzycznym tokenizatorem, który według Aleph Alpha osiąga 4,90 średniej liczby bajtów na token na niemieckim tekście internetowym wobec 4,35 w GPT-5 i 3,28 w Kimi K3 — wszystkie wartości zmierzone przez dostawcę i oznaczające efekt kosztowy na token, a nie twierdzenie o jakości. MiniCPM5-2B istnieje dla agentów wywołujących narzędzia w języku angielskim i chińskim na ograniczonym sprzęcie. Zespół mający niemieckie umowy i wymóg zgodności nie wybiera między nimi.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the card header with the OpenBMB organisation and its like count, the TextGeneration, Transformers and Safetensors tags, the English and Chinese language tags, the on-device and tool-calling tags, the Apache 2.0 licence, and the model-size line reading 3B parameters in BF16 tensor type.

Rzeczywistość routingu i eksperyment, który warto przeprowadzić

Żaden z tych modeli nie znajduje się dziś w hostowanym katalogu i sprawdziliśmy oba, zamiast zakładać. Kolibri nie ma SKU API dostawcy — wydanie to wagi, raport techniczny i obraz kontenera — i nie ma go w OrcaRouter: sprawdziliśmy katalog pod każdą pisownią prefiksu dostawcy i nazwy modelu, a wynik to „nie znaleziono”. MiniCPM5-2B również nie ma hostowanego endpointu od ModelBest i nie jest u nas routowany. Oba są propozycjami do samodzielnego hostowania i wolimy powiedzieć to wprost, niż sugerować, że obsługujemy którykolwiek z nich.

Najciekawsze staje się to przy eksperymencie. Model agentowy z 2,5 miliarda parametrów i model dokumentowy z 78 miliardami parametrów rozwiązują różne problemy, a jedynym sposobem, by dowiedzieć się, którego z nich potrzebuje Twoje obciążenie, jest uruchomienie obu na nim — i dokładnie do takiej sytuacji służy warstwa routingu, nawet gdy nie zawiera żadnego z tych modeli. Skieruj ścieżkę testową na samodzielnie hostowaną kompilację MiniCPM5-2B przez jeden punkt końcowy zgodny z OpenAI z automatycznym przełączaniem awaryjnym, pozostawiając produkcję na sprawdzonym modelu z routingiem, a nowy stos może się zawieszać lub generować bzdury, nie powodując żadnej awarii. Ceny katalogowe dostawców dla modeli, z którymi porównujesz, są przenoszone bez marży, więc test A/B pozostaje tani i odwracalny. A jeśli eksperyment faktycznie ujawni, że Twoje niemieckie obciążenie nie potrzebuje żadnego z samodzielnie hostowanych modeli, ten sam klucz daje dostęp do małego poziomu mieszanki ekspertów, który jest już objęty routingiem — wariantu Gemma 4 26B-A4B za 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion wyjściowych, z oknem 262 144 tokenów oraz obsługą tekstu, obrazów i wideo — co jest najtańszym sposobem, aby się o tym przekonać, zanim kupisz dwa procesory graficzne.

Który z nich i co zmieniłoby odpowiedź?

Uruchom MiniCPM5-2B, jeśli ograniczeniem jest urządzenie. Przy 2,52 miliarda parametrów jest to jedyny z dwóch, który zmieści się na laptopie, w kokpicie czy w urządzeniu brzegowym, a jeśli Twoje obciążenie to interaktywny agent wywołujący narzędzia w języku angielskim lub chińskim, to właśnie do tego model jest przeznaczony. Zaplanuj czas na odtworzenie jego wyników najpierw — średnia 53,9 i deklaracja 46,4 w SWE-bench należą wyłącznie do ModelBest, a otwartość korpusów treningowych sprawia, że odtworzenie jest naprawdę możliwe, a nie tylko teoretyczne.

Uruchom Kolibri, jeśli korpus jest w języku niemieckim, sprzęt jest dostępny, a wagi nie mogą opuścić budynku. Natywne okno o długości 262 144 tokenów, pamięć podręczna KV w FP8, cztery poziomy wysiłku rozumowania i wywoływanie narzędzi Hermes są odpowiednie do pracy z dokumentami w środowisku regulowanym, a warunki licencji Apache 2.0 oraz opublikowany potok danych to część, która przetrwa przegląd zakupowy.

Dwie rzeczy rozstrzygnęłyby to szybciej niż jakikolwiek argument. Niezależny przebieg SWE-bench Verified na MiniCPM5-2B potwierdziłby albo obalił najbardziej zaskakujące twierdzenie, jakie zawiera którakolwiek z tych kart. A niezależny pomiar przepustowości Kolibri w zalecanej konfiguracji z dwoma H100 — albo wpis w Artificial Analysis, który nie istnieje dzisiaj — zamieniłby „78 miliardów parametrów” ze specyfikacji w koszt, czyli liczbę, której faktycznie szuka każdy, kto rozważa to porównanie pod kątem sprzętu. Do tego czasu różnica w rozmiarze jest realna, różnica w przeznaczeniu jest większa, a opcja wyglądająca na tanią to ta, która zawiera niezweryfikowane twierdzenie.

A screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the model header under Google, the 262K-token context badge, the input line reading text plus image plus video, and the community description noting 25.2B total parameters with 3.8B activated per token during inference.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie