
Kolibri vs MiniCPM5-2B: 78 miliardów parametrów kontra 2,5 i dlaczego ten mały nie jest tanią opcją
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 217 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Ustaw Kolibri obok MiniCPM5-2B, a instynktowna interpretacja jest taka, że to porównanie rozmiarów i że model o 2,5 miliarda parametrów jest oszczędnym wyborem. Ta interpretacja jest błędna w sposób pouczający. Kolibri to należący do Aleph Alpha model typu mixture-of-experts o 78,1 miliarda parametrów, wydany 3 października 2026 roku, aktywujący 3,46 miliarda parametrów na token, z zajętością w FP8 wynoszącą około 78 GB i minimalną konfiguracją serwowania złożoną z dwóch kart A100 80 GB. MiniCPM5-2B to gęsty model o 2,52 miliarda parametrów należący do ModelBest i OpenBMB, zaprezentowany na Światowej Konferencji Sztucznej Inteligencji 19 lipca 2026 roku, a jego wagi trafiły na Hugging Face 6 września. MiniCPM5-2B jest trzydzieści jeden razy mniejszy pod względem liczby parametrów. To także ten model, który wymaga budżetu na ewaluację, zanim mu zaufasz, ponieważ jego najczęściej cytowane liczby zostały uzyskane przez dostawcę i nie zostały odtworzone — co jest dokładnie przeciwieństwem tego, co „mały model” zwykle sugeruje w kwestii ryzyka.
Oba zostały wysłane po cichu; tylko jedno z nich zostało wysłane niedawno.
Mają podobne historie powstania i bardzo różny wiek, a wiek ma znaczenie. Repozytorium Kolibri firmy Aleph Alpha utworzono 2 października 2026 r. z podaną datą premiery 3 października, a własne ogłoszenie dostawcy w jego newsroomie ukazało się tego ranka, w Dzień Jedności Niemiec. Ogólna prasa poświęcona AI w dużej mierze to przeoczyła tego dnia, stąd wzięło się określenie „cicha premiera”, ale karta modelu, raport techniczny i wpis dostawcy to nie jest ciche wydanie. MiniCPM5-2B rzeczywiście był cichszy: ogłoszenie na WAIC w lipcu było konferencyjnym ujawnieniem zapowiedzi i specyfikacji, a same wagi pojawiły się dopiero 6 września, opublikowane bez wydarzenia premierowego, wraz z checkpointami GGUF, MLX, GPTQ, base, SFT i draft oraz stojącymi za nimi korpusami treningowymi.
Ta pięciotygodniowa przerwa między ogłoszeniem a wagami jest warta zapamiętania, ponieważ to właśnie dlatego w obiegu są dwa różne zestawy liczb dla tego modelu. Materiały z lipca zachwalały okno kontekstowe o rozmiarze 512 tys. tokenów. Wysłana konfiguracja ustawia 131 072. Liczy się ten wydany artefakt.
Do czego tak naprawdę służy każdy model
Kolibri powstał z myślą o pracy z dokumentami niemieckimi i angielskimi, a Aleph Alpha nietypowo konkretnie wyjaśnia, dlaczego wymagało to prawdziwej inżynierii. Niewielkie eksperymenty z modelami zastępczymi ustaliły cel około 20 procent niemieckiego w mieszance treningowej, co przy treningu na 20 bilionów tokenów oznaczało znalezienie 4 bilionów niemieckich tokenów. Zdeduplikowane i przefiltrowane otwarte niemieckojęzyczne zbiory danych dały 390 miliardów — o rząd wielkości za mało — więc laboratorium dostroiło filtr Common Crawl specjalnie do języka niemieckiego, uzyskując 1,3 biliona unikalnych organicznych tokenów, oraz przeformułowało istniejące niemieckie dokumenty na hasła encyklopedyczne, dialogi i fragmenty, dając w przybliżeniu kolejny bilion, który stał się największym pojedynczym niemieckojęzycznym źródłem. Tłumaczenie, wykorzystane w poprzedniku Kolibri Origin, zostało porzucone w Kolibri. To właśnie szczegół dotyczący filtra warto zapamiętać: standardowy potok danych językowych odrzuca dokumenty z zbyt dużą liczbą długich słów, a niemiecka proza administracyjna rutynowo przekracza angielski limit średniej długości słowa, więc domyślne ustawienia po cichu usuwają rejestr, w którym pisze administracja publiczna.
MiniCPM5-2B został stworzony z myślą o przeciwległym końcu — agencie działającym na urządzeniu. Karta opisuje gęsty transformer o łącznej liczbie 2,52 miliarda parametrów, 1,98 miliarda niebędących osadzeniami, 42 warstwach przy rozmiarze ukrytym 2048, grouped-query attention z 16 głowami zapytań i 2 głowami KV oraz standardową architekturę LlamaForCausalLM bez niestandardowych kerneli. Pipeline treningowy jest nastawiony na podejście agentowe: trening pośredni agenta w skali 200 miliardów, duży zestaw agent-SFT, dostrajanie RL agenta oraz końcowy etap destylacji on-policy (On-Policy Distillation), który składa szesnaście modeli eksperckich RL z powrotem w jedną małą gęstą sieć. Jest dostarczany z wywołaniami narzędzi w stylu XML i wbudowanym parserem SGLang, a jego udostępniona konfiguracja ustawia okno 131 072 tokenów.
• Parametry — Kolibri: łącznie 78 103 074 560, aktywne 3 457 573 120, rzadkość 22,6:1. MiniCPM5-2B: łącznie 2 516 756 480, 1,98 mld bez osadzeń, gęsty.
• Wydano — Kolibri: 3 października 2026. MiniCPM5-2B: ogłoszono 19 lipca 2026, wagi 6 września 2026.
• Kontekst — Kolibri: 16 384 wytrenowany, 65 536 średnio wytrenowany, 262 144 natywny, 1 048 576 zwalidowany. MiniCPM5-2B: 131 072 w dostarczanej konfiguracji; twierdzenie o 512K z lipca nie znajduje się w niej.
• Ślad — Kolibri: około 78 GB w FP8; minimum dwa A100 80 GB, dwa H100 SXM5, jeden H200, jeden B200 lub jeden B300. MiniCPM5-2B: pojedynczy shard BF16, klasy laptopa.
• Języki — Kolibri: niemiecki i angielski, z założenia i nic więcej. MiniCPM5-2B: angielski i chiński, a wszystkie opublikowane zestawy ewaluacyjne są w języku angielskim.
• Wywoływanie narzędzi — Kolibri: w stylu Hermes z dołączonym parserem vLLM. MiniCPM5-2B: w stylu XML z parserem SGLang.
• Licencja — obie Apache 2.0, obie bez klauzuli dopuszczalnego użytku.

Tabele wyników i źródła danych, które za nimi stoją
Nigdzie nie ma bezpośredniego wyniku liczbowego dla tej pary — ani w materiałach jednego, ani drugiego dostawcy — i nie zamierzamy składać go z dwóch różnych stanowisk testowych i nazywać porównaniem. To, co publikuje każda ze stron, warto starannie rozdzielić, ponieważ oba zestawy liczb niosą ze sobą bardzo różną ilość dowodów.
Liczby Kolibri pochodzą z własnej czternastomodelowej tabeli porównawczej Aleph Alpha, uruchomionej na jednym harnessie z Kolibri przy wysokim poziomie wysiłku rozumowania: 75,5 w średniej dla języka angielskiego, 70,8 w średniej dla języka niemieckiego. Ta tabela nie schlebia swojemu obiektowi — Qwen3.8 27B uzyskuje 80,2 i 79,9 w tych samych dwóch średnich i prowadzi w GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified oraz obu benchmarkach długiego kontekstu, aktywując przy tym około jednej ósmej parametrów Kolibri. Sposób, w jaki dostawca ujmuje tę lukę, to front Pareto jakości względem dekodowanych tokenów na sekundę na GPU, którego nie przebija żaden z porównywanych modeli. To argument z zakresu ekonomiki serwowania, a nie argument o możliwościach, i żadna strona trzecia go nie zmierzyła: nie ma wpisu dla Kolibri w Artificial Analysis ani replikacji harnessu.
Liczby MiniCPM5-2B pochodzą z jego własnej karty: wewnętrzna średnia 53,9 w wybranym przez dostawcę zestawie porównawczym, AIME 2025/2026 na poziomie 86,5, MATH-500 na poziomie 94,6 oraz uzyskany przez dostawcę wynik 46,4 w SWE-bench Verified, który byłby niezwykły dla gęstego modelu o 2,5 miliarda parametrów, gdyby przetrwał niezależne testy. Na tej karcie Granite 4.2 3B od IBM plasuje się na 42,7 wobec 53,9 MiniCPM5-2B — jeden dostawca uruchamiający oba modele na jednym wybranym przez siebie zestawie. Różne zestawy, różne systemy testowe, różni dostawcy. Nic z tego nie stanowi werdyktu o tym zestawieniu.
To, co jest naprawdę użyteczne po stronie MiniCPM5-2B, to ujawnienie danych. OpenBMB udostępniło zbiory treningowe UltraData razem z wagami — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, zestawy SFT i RL dla agentów — wszystko na licencji Apache 2.0, co zamienia czarną skrzynkę w przepis, który można przejrzeć i kontynuować we własnej dziedzinie. Model jest też dostarczany z adaptacją od dnia zerowego dla dziewięciu rodzin układów za pośrednictwem społeczności FlagOS firmy ModelBest, od Huawei Ascend po NVIDIA i ARM, co jest deklaracją dotyczącą wdrożeń, a nie benchmarków. Na tym tle IBM opublikowało wagi Granite 4.2 3B i szczegółowy opis techniczny procesu budowy, ale nie swoje dane treningowe, a Aleph Alpha opublikowała potok danych Kolibri i bilans energetyczny — 20 bilionów tokenów pretreningowych, 9,5×10² MWh z uwzględnieniem narzutu centrów danych i z wyłączeniem nadzorowanego dostrajania oraz uczenia ze wzmocnieniem — ale nie sam korpus.
Gdzie faktycznie widać różnicę w rozmiarze
Najbardziej użytecznym sposobem zestawienia tych dwóch obok siebie jest umieszczenie ich na dwóch osiach, które decydują o rzeczywistym wdrożeniu: co musi znajdować się w pomieszczeniu i co się dzieje, gdy model się myli.
Na sprzęcie MiniCPM5-2B wygrywa i to bezapelacyjnie. Gęsty model o 2,52 miliarda parametrów w jednym shardzie BF16 działa na laptopie, urządzeniu brzegowym albo pojedynczym konsumenckim GPU, a wsparcie FlagOS dla dziewięciu rodzin układów oznacza, że działa na sprzęcie, który w ogóle nie jest akceleratorem NVIDIA. Minimalne wymagania Kolibri to dwie karty A100 80 GB albo jedna B200, około 78 GB wag FP8, obsługiwane przez wtyczkę aleph-alpha-inference do vLLM lub opublikowany kontener. W przypadku obciążenia dla inteligentnego kokpitu lub zastosowań związanych z telefonem 2B jest jedynym z tych dwóch, który się nadaje, a Kolibri nigdy nie był projektowany, by konkurować w tym segmencie.
Jeśli chodzi o weryfikowalność, Kolibri wygrywa z subtelniejszego powodu. Jego najczęściej cytowane twierdzenie — ekonomika serwowania — nie zostało przetestowane, ale jego liczby dotyczące jakości są przynajmniej opublikowane na tle trzynastu nazwanych konkurentów na jednym zestawie testowym, z ujawnionymi ustawieniami, a własna tabela dostawcy w większości wierszy przyznaje zwycięstwo przeciwnikowi. Najważniejsze liczby MiniCPM5-2B pochodzą od dostawcy i dotyczą zestawu dostawcy, bez ujawnionego zestawu porównawczego, a model ten obarczony jest dodatkową niepewnością wynikającą z checkpointu powstałego tygodnie, a nie dni temu. Żaden z modeli nie przeszedł niezależnych benchmarków. Różnica polega na tym, że jeden dostawca zapisał porównanie, w którym jego własny model przegrywa, a drugi zapisał takie, w którym jego własny model wygrywa z dużą przewagą.
Celowo nie ma tu żadnej rywalizacji. Kolibri istnieje po to, by przetwarzać dokumenty niemieckojęzyczne w środowisku lokalnym, z dwujęzycznym tokenizatorem, który według Aleph Alpha osiąga 4,90 średniej liczby bajtów na token na niemieckim tekście internetowym wobec 4,35 w GPT-5 i 3,28 w Kimi K3 — wszystkie wartości zmierzone przez dostawcę i oznaczające efekt kosztowy na token, a nie twierdzenie o jakości. MiniCPM5-2B istnieje dla agentów wywołujących narzędzia w języku angielskim i chińskim na ograniczonym sprzęcie. Zespół mający niemieckie umowy i wymóg zgodności nie wybiera między nimi.

Rzeczywistość routingu i eksperyment, który warto przeprowadzić
Żaden z tych modeli nie znajduje się dziś w hostowanym katalogu i sprawdziliśmy oba, zamiast zakładać. Kolibri nie ma SKU API dostawcy — wydanie to wagi, raport techniczny i obraz kontenera — i nie ma go w OrcaRouter: sprawdziliśmy katalog pod każdą pisownią prefiksu dostawcy i nazwy modelu, a wynik to „nie znaleziono”. MiniCPM5-2B również nie ma hostowanego endpointu od ModelBest i nie jest u nas routowany. Oba są propozycjami do samodzielnego hostowania i wolimy powiedzieć to wprost, niż sugerować, że obsługujemy którykolwiek z nich.
Najciekawsze staje się to przy eksperymencie. Model agentowy z 2,5 miliarda parametrów i model dokumentowy z 78 miliardami parametrów rozwiązują różne problemy, a jedynym sposobem, by dowiedzieć się, którego z nich potrzebuje Twoje obciążenie, jest uruchomienie obu na nim — i dokładnie do takiej sytuacji służy warstwa routingu, nawet gdy nie zawiera żadnego z tych modeli. Skieruj ścieżkę testową na samodzielnie hostowaną kompilację MiniCPM5-2B przez jeden punkt końcowy zgodny z OpenAI z automatycznym przełączaniem awaryjnym, pozostawiając produkcję na sprawdzonym modelu z routingiem, a nowy stos może się zawieszać lub generować bzdury, nie powodując żadnej awarii. Ceny katalogowe dostawców dla modeli, z którymi porównujesz, są przenoszone bez marży, więc test A/B pozostaje tani i odwracalny. A jeśli eksperyment faktycznie ujawni, że Twoje niemieckie obciążenie nie potrzebuje żadnego z samodzielnie hostowanych modeli, ten sam klucz daje dostęp do małego poziomu mieszanki ekspertów, który jest już objęty routingiem — wariantu Gemma 4 26B-A4B za 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion wyjściowych, z oknem 262 144 tokenów oraz obsługą tekstu, obrazów i wideo — co jest najtańszym sposobem, aby się o tym przekonać, zanim kupisz dwa procesory graficzne.
Który z nich i co zmieniłoby odpowiedź?
Uruchom MiniCPM5-2B, jeśli ograniczeniem jest urządzenie. Przy 2,52 miliarda parametrów jest to jedyny z dwóch, który zmieści się na laptopie, w kokpicie czy w urządzeniu brzegowym, a jeśli Twoje obciążenie to interaktywny agent wywołujący narzędzia w języku angielskim lub chińskim, to właśnie do tego model jest przeznaczony. Zaplanuj czas na odtworzenie jego wyników najpierw — średnia 53,9 i deklaracja 46,4 w SWE-bench należą wyłącznie do ModelBest, a otwartość korpusów treningowych sprawia, że odtworzenie jest naprawdę możliwe, a nie tylko teoretyczne.
Uruchom Kolibri, jeśli korpus jest w języku niemieckim, sprzęt jest dostępny, a wagi nie mogą opuścić budynku. Natywne okno o długości 262 144 tokenów, pamięć podręczna KV w FP8, cztery poziomy wysiłku rozumowania i wywoływanie narzędzi Hermes są odpowiednie do pracy z dokumentami w środowisku regulowanym, a warunki licencji Apache 2.0 oraz opublikowany potok danych to część, która przetrwa przegląd zakupowy.
Dwie rzeczy rozstrzygnęłyby to szybciej niż jakikolwiek argument. Niezależny przebieg SWE-bench Verified na MiniCPM5-2B potwierdziłby albo obalił najbardziej zaskakujące twierdzenie, jakie zawiera którakolwiek z tych kart. A niezależny pomiar przepustowości Kolibri w zalecanej konfiguracji z dwoma H100 — albo wpis w Artificial Analysis, który nie istnieje dzisiaj — zamieniłby „78 miliardów parametrów” ze specyfikacji w koszt, czyli liczbę, której faktycznie szuka każdy, kto rozważa to porównanie pod kątem sprzętu. Do tego czasu różnica w rozmiarze jest realna, różnica w przeznaczeniu jest większa, a opcja wyglądająca na tanią to ta, która zawiera niezweryfikowane twierdzenie.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
