Karta tytułowa hero zatytułowana „Kolibri vs Granite 4.2 3B” z podtytułem „78-miliardowy rzadki mixture-of-experts kontra 3-miliardowy gęsty model rozumujący”, plakietki z napisami „78,1 mld łącznie | 3,46 mld aktywnych”, „~3 mld, gęsty”, „Apache 2.0 w obu przypadkach” oraz wiersz stopki o treści „Dane liczbowe podane przez dostawców po obu stronach”, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Kolibri kontra Granite 4.2 3B: zakład na rzadkość 78B i model 3B, który nie zamierza grać w tę samą grę

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw Kolibri i Granite 4.2 3B obok siebie, a pierwsza szczera obserwacja jest taka, że to nie jest uczciwa walka, i to nie w tym kierunku, który zakładasz. Kolibri to model typu mixture-of-experts Aleph Alpha o 78,1 miliarda parametrów, wydany 3 października 2026 roku, aktywujący 3,46 miliarda parametrów na token. Granite 4.2 3B to gęsty model rozumowania IBM o około trzech miliardach parametrów, którego wagi trafiły na Hugging Face 7 sierpnia 2026 roku, a karta modelu i blog techniczny pojawiły się 25 sierpnia. Jeden jest dwadzieścia sześć razy większy od drugiego pod względem całkowitej liczby parametrów. Powód, dla którego należą do tej samej decyzji, jest taki, że oba są na licencji Apache 2.0, oba obsługują tylko tekst, oba są z założenia do samodzielnego hostowania i oba były skierowane do tego samego nabywcy: zespołu, który chce analizy dokumentów na sprzęcie, który kontroluje, z pochodzeniem, które przetrwa przegląd zamówień. Interesujące pytanie nie brzmi, który jest lepszy. Brzmi: co tak naprawdę daje budżet 26-krotnie większej liczby parametrów i ile kosztuje jego utrzymanie.

Niedopasowanie, mówiąc wprost

Granite 4.2 3B to samodzielny gęsty model poddany treningowi końcowemu na bazie Granite-4.1-3B-Base, należący do rodziny Granite 4.2, którą IBM udostępniał do sierpnia. Ma 40 warstw z uwagą grupową (grouped-query attention), natywny kontekst 128K, który IBM rozszerza do 512K w piątej fazie wstępnego treningu, oraz trzy tryby myślenia na zapytanie: domyślnie pełne myślenie, ścieżkę niskiego wysiłku i ścieżkę bez myślenia. Karta IBM jest nietypowo szczera co do tego, czym 3B nie jest. W przeciwieństwie do swoich siostrzanych modeli 8B i 30B celowo pominął wyspecjalizowany blok agentowego uczenia ze wzmocnieniem trenowany w środowiskach SWE-agent, terminala i wyszukiwania, dlatego IBM nie podaje dla niego żadnego wyniku SWE-bench i przedstawia model jako specjalistę od rozumowania, a nie agenta.

Kolibri idzie w przeciwną stronę na każdej osi. Pięćdziesiąt warstw, każda z nich typu mixture-of-experts, po 384 ekspertów na warstwę, z jednym współdzielonym i sześcioma routowanymi, oraz współczynnikiem rzadkości około 22,6 do 1. Jego kontekst natywnie obejmuje 262 144 tokeny, zwalidowany do 1 048 576, przy czym karta zaleca, aby w zadaniach wrażliwych na opóźnienia pozostawać na poziomie 262 144 lub poniżej. Cztery poziomy wysiłku rozumowania. Wywoływanie narzędzi w stylu Hermes z parserem vLLM dostarczanym w tym samym repozytorium co wagi. A ślad pamięciowy to około 78 GB w FP8, a minimalna konfiguracja według karty to dwie karty A100 80 GB, dwa H100 SXM5, jeden H200, jeden B200 lub jeden B300.

• Parametry — Kolibri: łącznie 78,103,074,560, 3,457,573,120 aktywnych na token. Granite 4.2 3B: około 3B gęstych parametrów, wszystkie parametry aktywne przy każdym tokenie.

• Kontekst — Kolibri: 16 384 wytrenowany, 65 536 średnio wytrenowany, 262 144 natywny, 1 048 576 zwalidowany. Granite 4.2 3B: 128 tys. natywny, rozszerzony do 512 tys.

• Tryby myślenia — Kolibri: brak, niski, średni, wysoki, ustawiane przez szablon czatu. Granite 4.2 3B: pełny, niskiego wysiłku i bez myślenia, dla każdego zapytania.

• Wywoływanie narzędzi — Kolibri: w stylu Hermes, z dołączonym parserem. Granite 4.2 3B: tak, ale nie tą ścieżką trenowaną przez agentowe RL, którą otrzymało jego większe rodzeństwo.

• Języki — Kolibri: niemiecki i angielski, z założenia i nic więcej. Granite 4.2 3B: angielski na pierwszym miejscu, z szerszym wielojęzycznym treningiem IBM stojącym za nim.

• Ślad pamięciowy — Kolibri: około 78 GB w FP8, minimum dwa GPU. Granite 4.2 3B: około 6–8 GB w bfloat16, poniżej 2 GB po kwantyzacji, klasa laptopa.

• Licencja — oba na licencji Apache 2.0, oba bez klauzuli dopuszczalnego użytkowania ani progu miesięcznych aktywnych użytkowników.

• Serwowanie — Kolibri: wtyczka aleph-alpha-inference do vLLM lub opublikowany obraz kontenera. Granite 4.2 3B: vLLM, SGLang, Transformers, GGUF i Ollama pod granite4.2:3b.

A two-column comparison scoreboard titled 'Kolibri vs Granite 4.2 3B'. Left column Kolibri: Parameters 78.1B total / 3.46B active, Context 262,144 native / 1,048,576 validated, Thinking none / low / medium / high, Languages German and English, Licence Apache 2.0, Footprint about 78 GB FP8, two GPUs minimum. Right column Granite 4.2 3B: Parameters ~3B dense, Context 128K native / 512K extended, Thinking full / low / none, Languages English-first with IBM multilingual training, Licence Apache 2.0, Footprint 6-8 GB bfloat16 / under 2 GB quantized, laptop-class. Footer: 'Kolibri figures are Aleph Alpha's own; Granite 4.2 3B figures are IBM's own; nothing here is independently reproduced.' with the OrcaRouter logo in the bottom-right corner.

Co daje dodatkowe 75 miliardów parametrów

Trzy rzeczy — i warto być precyzyjnym co do tego, które z nich są ustalone, a które tylko twierdzone.

Pierwsza rzecz to niemiecki. To najwyraźniejsza realna różnica między oboma modelami i nie jest to wiersz z benchmarku. Aleph Alpha zbudowała Kolibri wokół dwujęzycznego korpusu niemiecko-angielskiego, celując w około 20 proc. niemieckiego w przebiegu pretreningu na 20 bilionów tokenów, i skończyła z niemieckim zbiorem 2,4 biliona tokenów, z którego 80 proc. laboratorium opracowało lub wygenerowało samodzielnie. Karta wyjaśnia, dlaczego wymagało to pracy: po deduplikacji otwarte niemieckie zbiory danych dostarczyły tylko 390 miliardów tokenów, o rząd wielkości za mało, więc laboratorium dostroiło filtr Common Crawl specjalnie pod kątem niemieckiego i przeformułowało istniejące niemieckie dokumenty na hasła encyklopedyczne, dialogi i fragmenty. To właśnie szczegół dotyczący filtra warto zapamiętać. Standardowy potok danych językowych odrzuca dokumenty z zbyt dużą liczbą długich słów, a niemiecka proza administracyjna regularnie przekracza angielski próg średniej długości słowa — więc domyślne ustawienia po cichu usuwają rejestr, w którym pisze administracja publiczna. IBM nie zbudował Granite z myślą o tym korpusie. Granite 4.2 3B poradzi sobie z niemieckim; nie został zaprojektowany wokół niemieckiego rejestru prawnego i administracyjnego, a żaden ranking nie powie ci, jaka jest różnica.

Drugi to długi kontekst, który wytrzymuje konfrontację z rzeczywistymi dokumentami. Pułap 512K modelu Granite jest naprawdę duży, ale oba modele osiągnęły go w różny sposób, a projekt pozycyjny modelu Kolibri to bardziej konwencjonalny argument za długim kontekstem. Traktuj wartości RULER firmy IBM — 67,52 przy 64K i 55,30 przy 128K w opublikowanych materiałach rodziny 4.2 — jako uczciwe ujawnienie, jak bardzo jakość wyszukiwania spada przy 128K, i pamiętaj, że Kolibri nie ma żadnej równoważnej opublikowanej krzywej degradacji.

Trzeci to surowy zapas na rozumowanie, i tu uczciwa odpowiedź brzmi: „nie aż tyle, ile sugeruje stosunek parametrów”. Potok treningowy Kolibri zapewnił mu przebieg wstępnego treningu na 20 bilionów tokenów na 768 układach NVIDIA B200 przez 21 dni, a własna tabela porównawcza Aleph Alpha, z Kolibri przy wysokim wysiłku rozumowania, umieszcza go na poziomie 75,5 w średniej angielskiej i 70,8 w średniej niemieckiej w porównaniu czternastu modeli — gdzie przegrywa z gęstym modelem o 27 miliardach parametrów od Alibaba w większości wierszy. Kluczowe twierdzenia Granite 4.2 3B są jego własne: AIME 2025 na poziomie 78,33, GPQA na poziomie 54,80, LiveCodeBench v6 na poziomie 69,71 i MMLU-Pro na poziomie 67,84, wszystkie raportowane przez IBM i nieodtworzone. Różne zestawy testów, różne środowiska testowe, różni dostawcy. Nie ma nigdzie wyniku dla tej pary w tym samym środowisku testowym i nie zamierzamy go wymyślać.

Gdzie każdy z nich faktycznie wygrywa

Uruchom Granite 4.2 3B, jeśli twoim ograniczeniem jest maszyna. Przy 6–8 GB w bfloat16 lub poniżej 2 GB po kwantyzacji zmieści się na laptopie, pojedynczym GPU stacji roboczej albo w odizolowanym od sieci urządzeniu edge, które nigdy nie zobaczy dwóch H100. Obsługuje pięć różnych środowisk uruchomieniowych, w tym Ollama i GGUF, co ma znaczenie, gdy celem wdrożenia jest cudzy laptop, a nie własna szafa rack. A jego karta modelu jest wyjątkowo godna zaufania właśnie dlatego, że IBM zapisało, co pominęło. Dostawca, który nie chce podawać wyników SWE-bench dla modelu 3B, mówi ci, gdzie kończą się możliwości tego modelu.

Uruchom Kolibri, jeśli korpus jest tu najważniejszy, a sprzęt jest dostępny. Zespół mający niemieckojęzyczne umowy, dokumentację techniczną lub dokumenty administracyjne, istniejący węzeł z dwoma GPU oraz wymóg, by wagi nigdy nie opuszczały budynku, to dokładnie ten odbiorca, dla którego zaprojektowano to wydanie. Natywne okno 262 144 tokenów, pamięć podręczna KV FP8, cztery poziomy wysiłku i ścieżka wywoływania narzędzi Hermes wskazują na przepływy pracy z dokumentami, a nie na czat. Dwujęzyczny tokenizer jest częścią tego samego argumentu: Aleph Alpha podaje średnio 4,90 bajta na token w niemieckim tekście internetowym wobec 4,35 dla GPT-5 i 3,28 dla Kimi K3, wszystko mierzone przez dostawcę na korpusie dostawcy, a większa liczba znaków na token to bezpośredni efekt kosztu wnioskowania, a nie wynik. Jeśli się to potwierdzi, kumuluje się na każdej przetwarzanej stronie.

Asymetria, której nikt nie reklamuje, tkwi w danych. IBM opublikował wagi Granite 4.2 3B i szczegółowy techniczny opis sposobu, w jaki model został zbudowany, ale nie dane treningowe. Aleph Alpha opublikowała pipeline, pochodzenie danych i wartość zużycia energii wraz z wagami Kolibri — 20 bilionów tokenów pretreningowych, 9,5×10² MWh z uwzględnieniem narzutu centrów danych i z wyłączeniem nadzorowanego dostrajania oraz uczenia ze wzmocnieniem. Dla zespołu, który musi odpowiedzieć na pytanie „skąd pochodzi tekst tego modelu”, ta różnica nie jest kosmetyczna.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the card header, the Apache 2.0 licence tag, the twelve tested languages, and the links to the Granite 4.2 Collection, the technical blog and the GitHub repository.

Rzeczywistość routingu dla obu

Żaden z tych modeli nie znajduje się dziś w hostowanym katalogu. Kolibri nie ma w ogóle SKU API dostawcy — wydanie to wagi plus raport techniczny — a Granite 4.2 3B jest dostarczany jako wagi dla pięciu stosów środowisk uruchomieniowych, bez hostowanego punktu końcowego od IBM. Oba są propozycjami do samodzielnego hostowania, a praktyczne pytanie dla większości zespołów nie brzmi, który z nich przyjąć, lecz czy obciążenie uzasadnia posiadanie któregokolwiek z nich.

I właśnie tu warstwa routingu zasługuje na swoje miejsce, nawet w przypadku modeli, których nie obsługuje. Sprawdziliśmy katalog OrcaRouter we wszystkich wariantach zapisu obu nazw modeli i nie ma tam ani Kolibri, ani Granite 4.2 3B, więc nie będziemy udawać, że jest inaczej. To, co OrcaRouter rzeczywiście daje, to tani sposób, by przekonać się, czy decyzja sprzętowa jest uzasadniona, zanim ją podejmiesz: skieruj ścieżkę testową na niewielki poziom mixture-of-experts, który ma już routing — wariant Gemma 4 26B-A4B w cenie $0.06 za milion tokenów wejściowych i $0.33 za milion tokenów wyjściowych, z oknem 262 144 tokenów — i sprawdź, czy Twoje obciążenie dokumentami niemieckojęzycznymi faktycznie potrzebuje tego, co zapewnia Kolibri, przy użyciu jednego klucza zgodnego z OpenAI, po cenie katalogowej dostawcy bez niczego dodatkowego. Jeśli tak, kupujesz GPU na podstawie dowodów, a nie przeczucia. Jeśli nie, właśnie uniknąłeś zamówienia sprzętu.

Werdykt i co by go zmieniło

To nie jest starcie z jednym zwycięzcą. Kolibri i Granite 4.2 3B odpowiadają na różne pytania w różnych przedziałach cenowych, a jedyny uczciwy ranking opiera się na ograniczeniach: jeśli ograniczeniem jest sprzęt, Granite 4.2 3B jest jedynym z tych dwóch, który się kwalifikuje. Jeśli ograniczeniem jest praca nad dokumentami niemieckiego rejestru regulacyjnego na miejscu, Granite 4.2 3B nigdy nie wchodził w grę, a Kolibri jest ciekawszym artefaktem — prawowitym wydaniem 78B z otwartymi wagami, na licencji Apache 2.0, z pipeline'em danych i tokenizerem opublikowanymi obok wag.

Dwie rzeczy rozstrzygnęłyby to porównanie. Niezależne uruchomienie Kolibri na niemieckojęzycznym zadaniu QA dotyczącym dokumentów pozwoliłoby sprawdzić twierdzenie, które to wydanie faktycznie miało uzasadniać, ponieważ obecnie żaden ranking tego nie mierzy. A niezależne odtworzenie wyników rozumowania Granite 4.2 3B powiedziałoby ci, czy komputer klasy laptopa może sobie poradzić w podzbiorze twojego obciążenia, który i tak nigdy nie potrzebował 78 miliardów parametrów. Dopóki jedno z tych się nie pojawi, kupuj według ograniczeń, a nie według liczby parametrów.

A screenshot of IBM's technical blog announcing the Granite 4.2 family, showing the post header and the discussion of the family's dense and mixture-of-experts tiers and their reasoning and thinking modes.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie