
Kolibri vs Gemma 4 12B: 78 miliardów parametrów kontra 12, a tylko jeden z nich ma wynik
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 218 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Kolibri i Gemma 4 12B to dwa przeciwne końce spektrum, którego wydania z otwartymi wagami zwykle nie pozwalają porównywać na równych warunkach. Kolibri od Aleph Alpha ukazało się 3 października 2026: 78,1 miliarda parametrów łącznie, 3,46 miliarda aktywnych na token, zweryfikowane okno kontekstu o długości 1 048 576 tokenów, wyłącznie niemiecki i angielski, Apache 2.0. Gemma 4 12B ukazała się 3 czerwca 2026: 11,95 miliarda gęstych parametrów, okno kontekstu 262 144 tokenów, dane wejściowe tekstowe, obrazowe, dźwiękowe i wideo, Apache 2.0. Jedno z nich ma niezależny, publicznie powtarzalny wynik. Drugie ma tabelę benchmarków od dostawcy. Ta asymetria nie jest przypisem do tego porównania; ona jest tym porównaniem, ponieważ wszystko inne, na czym zależy kupującemu — koszt na zadanie, jakość na wat, to, czy model sprawdzi się na twoich dokumentach — przechodzi właśnie przez nią.
Powinniśmy być równie bezpośredni w kwestii charakteru tego porównania, ponieważ nagłówek zestawiający model 78B z modelem 12B prowadzi do błędnego wniosku. To nie są konkurenci. Jeden to wdrożenie o rozmiarze 78 GB przeznaczone do pracy z dokumentami w niemieckim sektorze publicznym i w przemyśle, na szafach rack należących do klienta; drugi to jednolity model multimodalny o 12 miliardach parametrów, który działa na laptopie i ma niezależny indeks wynoszący 14. Poniżej przedstawiono, do czego każdy z nich faktycznie służy, gdzie opublikowane liczby pozwalają je uszeregować, a gdzie nie, oraz ile kosztuje brak niezależnego wyniku.
Jedna liczba, której możesz tu zaufać, i jedna, której nie możesz.
Artificial Analysis przeprowadziło pomiary modelu Gemma 4 12B w konfiguracji rozumowania. Wyniki opublikowane na ich stronie modelu są podstawą, na której należy się oprzeć:
• Inteligencja — indeks Artificial Analysis Intelligence Index wynoszący 14, który plasuje go w najwyższym przedziale klasowym z pozycją nr 21 spośród 142 modeli w tym porównaniu, wobec mediany 8 dla porównywalnych modeli.
• Szybkość — 112,5 tokena wyjściowego na sekundę, #21 z 142 w widoku szybkości i powyżej mediany 91 tokenów dla porównywalnych modeli.
• Cena — 0,10 USD za milion tokenów wejściowych i 0,30 USD za milion tokenów wyjściowych, co — jak zaznaczono na ich stronie — jest dość drogie w porównaniu z medianą wynoszącą 0,03 USD i 0,15 USD dla modeli o podobnej wielkości i klasie.
• Specyfikacja — kontekst 262 144 tokenów, łącznie 12 mld parametrów, Apache 2.0, wejście tekstowe, obrazowe, mowy i wideo, wyjście tekstowe.
Werdykt podsumowujący samego Artificial Analysis jest niezwykle dosadny jak na stronę rankingową i wart powtórzenia: Gemma 4 12B należy do wiodących modeli pod względem inteligencji, ale jest dość drogi w porównaniu z innymi modelami o otwartych wagach o podobnej wielkości. To prawdziwa, niezależna, powtarzalna ocena strony trzeciej, która nie ma interesu u żadnego z dostawców.
Kolibri nie ma niczego równoważnego. Nie istnieje strona modelu Artificial Analysis dla niego, a w chwili pisania tego tekstu żadna strona trzecia nie odtworzyła zestawu ewaluacyjnego. Istnieje natomiast własna tabela porównawcza Aleph Alpha, w której Kolibri uzyskuje 75,5 w średniej angielskiej i 70,8 w średniej niemieckiej w swoim zestawie zadań. To nieważone średnie procentowe po mieszance benchmarków wybranej przez dostawcę, na narzędziu testowym napisanym przez dostawcę, przy wysokim wysiłku rozumowania. Nie są to Intelligence Index, a tych dwóch liczb nie można przeliczyć jedną na drugą ani stawiać obok siebie. Każdy, kto przedstawia „Kolibri 75,5 kontra Gemma 14” jako ranking, porównuje procent w jednej skali z wynikiem w innej. Uczciwe stanowisko jest takie, że jakość Gemma 4 12B została zmierzona, a jakość Kolibri jest deklarowana.
To, na co tabela dostawcy faktycznie pozwala, to czytanie w poprzek wierszy. Gemma 4 26B-A4B IT, własny model Google oparty na mieszance ekspertów, bliźniaczy wobec 12B, pojawia się w tabeli Aleph Alpha z wynikiem 71,9 w języku angielskim i 66,3 w niemieckim, poniżej Kolibri w obu przypadkach. To najbliższa dostępna namiastka kontroli krzyżowej i wiąże się z tym samym zastrzeżeniem: harness dostawcy, liczby dostawcy. To słaby sygnał, nie dowód.

Gęsty 12B w porównaniu z rzadkim 78B to nie takie niedopasowanie, na jakie wygląda.
Luka architektoniczna jest większa niż luka w liczbie parametrów, gdy weźmie się pod uwagę to, co faktycznie jest obliczane na token.
• Obliczenia na token — Gemma 4 12B aktywuje wszystkie 11,95 miliarda parametrów przy każdym tokenie. Kolibri aktywuje 3 457 573 120 ze swoich 78 103 074 560, czyli około jednej dwudziestej drugiej modelu, z jednym wspólnym ekspertem i sześcioma ekspertami routowanymi na warstwę spośród 384.
• Pamięć — kompromis działa w drugą stronę i jest brutalny. Gemma 4 12B w bfloat16 to rzędu 24 GB wag. Karta Kolibri podaje wagi FP8 na około 78 GB, przy minimum dwóch kart A100 80 GB, dwóch H100 SXM5, jednego H200, jednego B200 lub jednego B300.
• Uwaga — Gemma 4 stosuje hybrydę lokalnej uwagi z przesuwnym oknem i pełnej uwagi globalnej, przy czym ostatnia warstwa jest zawsze globalna. Kolibri stosuje podział 4:1 między przesuwne okno a grupowane zapytania w 50 warstwach w pełni MoE.
• Kontekst — 262,144 tokenów dla Gemma 4 12B; 262,144 natywnie dla Kolibri, zweryfikowano do 1,048,576 bez skalowania pozycji.
Zatem uczciwe ujęcie zestawienia „78B kontra 12B” jest takie, że Kolibri wygrywa pod względem kosztu aktywacji, a przegrywa pod względem rozmiaru wag, i żadna z tych zalet nie jest darmowa. Model rzadki, który aktywuje 3,46 miliarda parametrów na token, nadal musi utrzymywać wszystkie 78 miliardów w pamięci, dlatego minimalnym wymaganiem wdrożeniowym jest para akceleratorów 80 GB, a nie jedna karta konsumencka. Gemma 4 12B dokonuje odwrotnego wyboru: większa część modelu uruchamia się przy każdym tokenie, ale mieści się na sprzęcie, który człowiek może kupić.
Po stronie Kolibri występuje niuans specyficzny dla języka niemieckiego, który zmienia arytmetykę, a nie ranking. Jego tokenizer osiąga średnio 4,90 bajta na token w niemieckim tekście internetowym, wobec 4,13 dla Gemini, 4,17 dla rodziny Qwen3.5–3.8 i 4,35 dla GPT-5, według pomiarów samego Aleph Alpha. Mniejsza liczba tokenów na niemiecki dokument to bezpośrednie obniżenie kosztu wnioskowania, a w przypadku obciążenia obejmującego miliony niemieckich tekstów administracyjnych ten efekt może być wart więcej niż kilka punktów indeksu. Jest to również w całości informacja przekazana przez dostawcę.

Co każde z nich może tak naprawdę zobaczyć
To tutaj porównanie przestaje być wyrównane, i jest to fakt dotyczący specyfikacji, a nie twierdzenie o jakości. Gemma 4 12B to zunifikowany model multimodalny: jego karta opisuje architekturę bez enkoderów, która rzutuje surowe fragmenty obrazów i przebiegi fal dźwiękowych bezpośrednio do przestrzeni osadzeń modelu językowego, przyjmując tekst, obraz, mowę i wideo na wejściu, a zwracając tekst na wyjściu. Został zaprojektowany do działania na urządzeniach konsumenckich, bez konieczności zapewniania osobnych enkoderów.
Kolibri czyta tekst w dwóch językach i nic więcej. Aleph Alpha celowo ujmuje to jako głębię zamiast szerokości: dwa języki, starannie wyselekcjonowane, a nie szeroka mieszanka wielojęzyczna. Nie ma wieży wizyjnej, ścieżki audio ani wideo. Jeśli Twoje obciążenie obejmuje skanowane formularze, nagrane rozmowy lub zdjęcia sprzętu, Gemma 4 12B jest kandydatem, a Kolibri nie — bez względu na to, co mówią wiersze benchmarków. Jeśli Twoje obciążenie to korpus dokumentów niemieckich i angielskich, które nigdy nie mogą opuścić budynku, bliżej prawdy jest odwrotność — ale zauważ, że wymóg „nigdy nie opuszcza budynku” spełnia również Gemma 4 12B, ponieważ wagi są objęte licencją Apache 2.0 i można je pobrać.
To, które jest tańsze, zależy od tego, co kupujesz.
Te dwa modele są wyceniane w walutach, których nie da się przeliczyć. Gemma 4 12B ma stawkę rynkową: 0,10 USD i 0,30 USD za milion tokenów, zgodnie z pomiarami u dostawców przeprowadzonymi przez Artificial Analysis, a taniej na poziomie MoE w przypadku routowanych endpointów. Kolibri nie ma żadnej stawki, ponieważ Aleph Alpha nie sprzedaje dla niego inferencji — wydanie obejmuje wagi, raport techniczny i kartę modelu.
• Gemma 4 12B w trasie hostowanej — 0,10 USD za milion tokenów wejściowych i 0,30 USD za milion tokenów wyjściowych według danych Artificial Analysis. W naszym własnym katalogu bliźniaczy model MoE Gemma 4 26B-A4B IT jest wyceniony na 0,06 USD za wejście i 0,33 USD za wyjście przy oknie 262 144 tokenów, a większy, gęsty Gemma 4 31B IT na 0,13 USD i 0,38 USD; to ceny katalogowe dostawców przekazywane dalej, jedyne kwoty, do których nic nie dodajemy.
• Kolibri na własnym sprzęcie — 78 GB wag, wtyczka vLLM z pakietu aleph-alpha-inference dostawcy oraz minimum jeden H200 lub B200 albo para H100 SXM5. Koszt to zakup kapitałowy, miejsce w szafie rack i osoba, która potrafi uruchomić wdrożenie vLLM, amortyzowany przez taką liczbę tokenów, jaką wygenerujesz.
To nie są te same zakupy, a porównanie nie polega na tym, „co jest tańsze”. Chodzi o to, czy obciążenie ma taki kształt, który uzasadnia posiadanie własnego sprzętu. Zespół przetwarzający stały, wrażliwy korpus dokumentów w dużym wolumenie może znacznie wyjść na plus po stronie self-hosted. Zespół budujący funkcję produktu, która wywołuje model kilka milionów tokenów dziennie, prawie nigdy nie wychodzi na plus.
Jedna praktyczna droga pośrednia: warstwa Gemma jest w OrcaRouter już dziś, na tym samym endpointcie zgodnym z OpenAI co wszystko inne, z przełączaniem awaryjnym między dostawcami i ceną katalogową dostawcy przekazywaną bez doliczania czegokolwiek za token. To tani sposób, by zmierzyć rzeczywisty wolumen tokenów na hostowanej trasie, zanim zdecydujesz, czy suwerenne wdrożenie o rozmiarze 78 GB jest uzasadnione. Warto powiedzieć wprost, czym to nie jest: nie kierujemy ruchu do Kolibri. Sprawdziliśmy katalog pod każdą możliwą pisownią nazwy dostawcy i modelu — nie ma go tam. Samodzielne hostowanie jest obecnie jedynym sposobem, aby go wywołać.

Kto powinien wybrać, które
Reguła decyzyjna jest wystarczająco krótka, by wyrazić ją w trzech linijkach.
Wybierz Gemma 4 12B, jeśli potrzebujesz czegokolwiek poza tekstem w języku niemieckim i angielskim, jeśli przed podjęciem decyzji potrzebujesz zmierzonego wskaźnika jakości, jeśli model musi działać na sprzęcie, który już masz, albo jeśli wolisz wynajmować tokeny, niż posiadać własną szafę serwerową. To jedyny z tych dwóch, który ma niezależny wynik, opublikowaną szybkość i cenę rynkową.
Wybierz Kolibri, jeśli Twoim wymaganiem jest model rozumowania o 78 miliardach parametrów, którego wagi, pochodzenie danych treningowych, zużycie energii i licencja są w pełni udokumentowane, wdrożony wewnątrz własnego perymetru, z tokenizerem zbudowanym dla niemieckiej prozy administracyjnej oraz zachowaniem polegającym na powstrzymaniu się od odpowiedzi, na którym może polegać regulowany proces. To wąski cel, a Aleph Alpha obrała go celowo.
Nie wybieraj żadnego z nich na podstawie wiersza benchmarku, który zobaczyłeś we wpisie o premierze. Wartość 14 dla modelu Gemma 4 12B to pomiar wykonany przez kogoś innego, który możesz sprawdzić. Wartość 75.5 dla Kolibri to twierdzenie autora, a jedyną osobą, która może je obecnie obalić, jest klient z dwiema kartami H100 i korpusem dokumentów.
