
Kolibri vs Solar Mini 4: Ten sam aktywny budżet 3B, dwa bardzo różne zakłady
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 217 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Dwa modele wydane siedemnaście dni od siebie, oba dostrojone tak, by zużywać trzy miliardy parametrów na token — a nie mogłyby się bardziej od siebie różnić. Kolibri to 78,1 miliarda parametrów w wagach na licencji Apache-2.0, które pobierasz i serwujesz samodzielnie: nie istnieje żaden hostowany endpoint, a na dziś nie ma dla niego ani jednego niezależnego wyniku w żadnym miejscu. Solar Mini 4 od Upstage to 35 miliardów parametrów, których nie można pobrać w ogóle — istnieje wyłącznie jako rozliczany za użycie endpoint i ma już wskaźnik Artificial Analysis Intelligence Index wynoszący 24,05. Liczba aktywnych parametrów mówi ci, ile kosztuje działanie każdego z nich. Nic więcej w tej liczbie nie mówi, ile kosztuje cię start.
Powód, dla którego sumy tak bardzo się rozchodzą — 78,1B wobec 35B przy niemal tej samej aktywnej części — jest taki, że oba są rzadkimi konstrukcjami typu mixture-of-experts, a oba laboratoria podjęły przeciwne decyzje co do tego, ile pojemności ekspertów zachować w rezerwie. Kolibri ma 384 ekspertów i kieruje każdy token do 1 wspólnego oraz 6 z nich. Solar Mini 4 ujawnia podział 35B/3B i nic na temat liczby swoich ekspertów. Gdy dwa modele reklamuje się tą samą aktywną liczbą parametrów, to całkowita liczba parametrów, a nie aktywna liczba, decyduje o rachunku za sprzęt — a tutaj oznacza to 2,2× różnicy przy tym samym deklarowanym budżecie obliczeniowym.
Czym każdy z nich właściwie jest
• Łączna liczba parametrów — Kolibri 78.10B vs Solar Mini 4 35B
• Aktywne parametry na token — Kolibri 3.46B vs Solar Mini 4 3B
• Wagi — Kolibri Apache 2.0, pełne wagi na Hugging Face w przeciwieństwie do zamkniętego Solar Mini 4; tylko API
• Kontekst — Kolibri: 1 048 576 tokenów potwierdzonych w porównaniu z Solar Mini 4 512K według dokumentacji Upstage, 1 048 576 według karty modelu Artificial Analysis
• Maksymalne wyjście — Kolibri bez limitu narzuconego przez dostawcę vs Solar Mini 4 128 000 tokenów
• Języki — Kolibri: niemiecki i angielski vs Solar Mini 4: angielski, koreański i japoński
• Data odcięcia wiedzy — Kolibri 18 czerwca 2026 vs Solar Mini 4 lutego 2026
• Dostarczanie — Kolibri self-hosted (vLLM) vs Solar Mini 4 hostowany w Upstage Console, Playground i lokalnie
• Niezależna ocena — Kolibri: brak opublikowanych wyników vs Solar Mini 4 AA Intelligence Index 24.05
Kolibri: 78 miliardów parametrów, a nikt spoza laboratorium go nie ocenił
Aleph Alpha opublikowała Kolibri 3 października 2026 r., celowo w Dzień Jedności Niemiec, jako pierwszy z nowej rodziny i następcę Kolibri Origin. Karta modelu jest wyjątkowo otwarcie o tym, co weszło w jego powstanie: 20 bilionów tokenów wstępnego treningu, 3,44 biliona treningu pośredniego i 201 miliardów treningu długiego kontekstu, przeprowadzonego na 768 GPU B200 w 21 dni, co dało około 6,4×10²³ FLOPs i około 950 MWh. Dostawca dobrowolnie podaje też liczbę awarii — 38 nieplanowanych przerw, około jednej na 10 000 godzin GPU — co jest liczbą, jaką laboratoria zwykle pomijają.

Architektura to czysta historia sparse-MoE. Pięćdziesiąt warstw w stosunku 4:1 uwagi z przesuwanym oknem (okna 512 tokenów) do uwagi globalnej, która uruchamia się tylko w co piątej warstwie. Wagi FP8 ze skalowaniem blokowym 128×128 i pamięć podręczna KV w FP8. Dla porównania Kolibri Origin używał 128 ekspertów routowanych po 8, ukrytego wymiaru eksperta o szerokości 768 i pełnej uwagi w każdej warstwie, na danych angielskich uciętych we wrześniu 2024 r. Kolibri przechodzi na 384 ekspertów routowanych po 6, z ukrytym wymiarem o szerokości 512, i przesuwa obie granice danych językowych na 18 czerwca 2026 r.
Niemiecki pipeline to część, którą naprawdę trudno kupić gdzie indziej. Aleph Alpha wytrenowała własny tokenizer UniBPE i podaje dla tekstu niemieckiego 4,90 bajta na token, wobec 4,35 dla GPT-5, 4,17 dla Qwen3.5 i 4,13 dla Gemini. To tokenizer deklarujący lepszą kompresję niemieckiego niż jakikolwiek z czołowych modeli wielojęzycznych, a zarazem konkretny mechanizm stojący za argumentem o suwerennym wdrożeniu: mniej tokenów na niemiecki dokument oznacza mniej rozliczanych tokenów i dłuższe efektywne okno na tym samym sprzęcie.
Każdy wynik wydajności, jaki istnieje dla Kolibri, pochodzi z karty modelu samego Aleph Alpha i właśnie tak należy go odczytywać. Tabela raportowana przez dostawcę podaje dla Kolibri ogólny wynik 75.5 w ewaluacjach angielskojęzycznych i 70.8 w niemieckojęzycznych, 84.3 w GPQA Diamond w języku angielskim wobec 81.3 w niemieckim, 21.5 w Humanity's Last Exam w języku angielskim wobec 15.9 w niemieckim, 66.4 w SWE-Bench Verified, 85.9 w LiveCodeBench v6 i 68.3 w AA-LCR. To liczby nieaudytowane. Nie istnieje strona Artificial Analysis dla Kolibri — adres URL modelu w trackerze zwraca 404 — więc nic z tej tabeli nie zostało niezależnie odtworzone, a czytany przez Ciebie artykuł nie może uczynić jej bardziej solidną, niż jest.
To, co ta karta rzeczywiście czyni solidnym, to historia serwowania. Minimalna konfiguracja sprzętowa to dwa A100 80GB, albo dwa H100 SXM5, albo pojedynczy H200, B200 lub B300. Opublikowana recepta vLLM uruchamia go z --kv-cache-dtype fp8 i dedykowanymi parserami rozumowania i wywołań narzędzi, przy temperaturze 1.0, top-p 0.97 i top-k 128, z regulacją reasoning_effort obejmującą none, low, medium i high. Pojedynczy B300 obsługujący model 78B przy zwalidowanym kontekście 1M tokenów to konkretny kształt oferty: kupujesz sprzęt, a potem ponosisz koszt krańcowy każdego tokenu.
Solar Mini 4: wynajmujesz aktywny wycinek 3B zamiast go kupować
Solar Mini 4 pojawił się 22 września 2026 — snapshot solar-mini4-260922, alias solar-mini4 — jako mały model Upstage zorientowany na agentów: 35B łącznie, 3B aktywnych, cutoff z lutego 2026, angielski, koreański i japoński, z trybami czatu, rozumowania, wyjścia strukturalnego i wywoływania narzędzi. Jest dostępny przez Console i Playground Upstage oraz do wdrożeń lokalnych, ale nie ma pobierania wag ani licencji do wglądu. Dokumentacja Upstage odnotowuje również „Dane nie są zbierane" w jego przypadku, co jest tym zapisem zgodności, który ma znaczenie, jeśli wystawiasz go na realny ruch.

W przeciwieństwie do Kolibri, Solar Mini 4 został poddany niezależnemu zestawowi testów. Artificial Analysis umieszcza go na Intelligence Index na poziomie 24,05, ze zmierzonym wynikiem 1,01% w Terminal-Bench 4.0, 47,6% w SciCode, 83,3% w AA-LCR i 25,8% w Humanity's Last Exam. W poście premierowym Upstage wynik 24,1 przedstawiono jako najwyższy Intelligence Index wśród modeli z 3B aktywnymi parametrami, wyprzedzając Qwen3.6 35B A3B z wynikiem 18 i Nemotron 3.5 Lightning z wynikiem 13 — ujęcie uczciwe na tyle, na ile sięga, i, co warto zauważyć, dokładnie tak wąskie, jak brzmi, ponieważ jest to twierdzenie o klasie modeli z 3B aktywnymi parametrami, a nie o małych modelach ogólnie.
Miara, która powinna kształtować sposób planowania na to budżetu, nie jest Indeksem. Zestawienie kosztów na zadanie od Artificial Analysis plasuje Solar Mini 4 na poziomie około 0,36 USD na zadanie Intelligence-Index, a około 0,30 USD z tego — jakieś 82% — to pamięci podręcznej promptów zapisy. Odczyty z pamięci podręcznej kosztują 0,03 USD, a generowane dane wyjściowe to tylko 0,035 USD. Model emituje około 88 300 tokenów wyjściowych na zadanie, z czego jakieś 71 600 to tokeny rozumowania. Innymi słowy: to tani model, którego rachunek zdominowany jest przez ponowne zapisywanie długiego kontekstu, a nie przez tokeny, które odsyła. Koszty na eval wahają się od 1,63 USD dla Terminal-Bench 4.0 do 0,95 USD dla AA-Briefcase. Mediana prędkości wyjściowej to 198 tokenów na sekundę przy czasie do pierwszego fragmentu wynoszącym 1,58 sekundy.
Cena każdej ścieżki
Solar Mini 4 nie jest dziś wyceniany według ceny cennikowej. Własna strona z cennikiem Upstage podaje dla niego datowaną drabinkę stawek: $0.03 za milion tokenów wejściowych, $0.003 za wejście z pamięci podręcznej i $0.12 za wyjście — 70% rabatu premierowego — do 10 października 2026 r. UTC, następnie $0.05 / $0.005 / $0.20 od 11 października, a na końcu cena cennikowa $0.10 / $0.01 / $0.40 od 23 października. Post premierowy Upstage opisuje rabat luźniej niż własny harmonogram na stronie cennika; powyższa drabinka to wersja z datami i to właśnie na niej warto opierać planowanie. Zwróć uwagę, gdzie znajduje się największy rabat: wejście z pamięci podręcznej spada do jednej dziesiątej stawki za wejście, co premiuje dokładnie to obciążenie z długim, stabilnym kontekstem, za które opłaty pobiera opisany powyżej profil kosztów zapisu do pamięci podręcznej.
Cena Kolibri to zamówienie zakupu. Nie ma stawki za milion tokenów do porównania, ponieważ nie ma hostowanego licznika — płacisz za GPU i energię elektryczną, a jedynym publicznym sygnałem kosztowym dostawcy jest sam przebieg treningu: około 950 MWh na wytworzenie modelu. Jeśli już posiadasz moc do wnioskowania, koszt krańcowy Kolibri na token zbliża się do kosztu energii elektrycznej; jeśli nie, bilet wstępu to maszyna z dwoma A100 lub lepsza. To zasadniczo inny kształt zobowiązania niż model, który możesz wywoływać milionami tokenów i przestać wywoływać jutro, i to jest rzeczywista decyzja, jaką przedstawiają te dwie opcje.
Gdzie się pokrywają, a gdzie porównanie zawodzi
• Aktywne obliczenia — niemal identyczne: 3,46 mld wobec 3 mld na token
• Wszystko, co z tego wynika — nieporównywalne, ponieważ tylko jedno z dwojga ma jakiekolwiek zweryfikowane dowody
• Najlepszy zmierzony wynik — Solar Mini 4 ma audytowany Indeks na poziomie 24,05; Kolibri ma tabelę dostawcy i nie ma żadnego audytowanego wyniku
• Niemiecki — Kolibri jest jedynym z tych dwóch, który został do tego wytrenowany, przy 4,90 bajta na token; Solar Mini 4 go nie wymienia
• koreański i japoński — Solar Mini 4 wymienia oba; Kolibri nie wymienia żadnego z nich
• Długi kontekst — Kolibri waliduje pełne 1 048 576 tokenów; własna dokumentacja Solar Mini 4 podaje 512 tys., a jej karta Artificial Analysis podaje 1 mln, więc traktuj górny limit jako zależny od dostawcy
• Czas do pierwszego tokenu — Solar Mini 4 to minuty, bo wystarczy się zarejestrować; Kolibri to dni, bo trzeba zamontować serwer w szafie
• Model kosztów — za token, malejący wraz z drabinką rabatową, w zestawieniu z kapitałem i mocą
Uczciwe podsumowanie jest takie, że to nie jest pojedynek, który rozstrzyga się w rankingu. Tabela dostawcy Kolibri zawiera nawet własny zestaw porównawczy — GLM-4.7 Flash 30B-A3B z wynikiem 64,7 ogólnie w języku angielskim, Nemotron 3 Nano 30B-A3B z 65,6, Qwen3.5 35B-A3B z 74,7, Qwen3.6 35B-A3B z 71,4, Gemma 4 26B-A4B IT z 71,9, wszystkie w zestawieniu z własnym wynikiem Kolibri 75,5 — a każdy z tych wierszy to własny wynik Aleph Alpha, uzyskany przez to samo laboratorium na jego własnym harnessie. To użyteczna mapa sąsiedztwa modeli o 3B aktywnych parametrów. To nie jest niezależny ranking.
Jeśli tym, czego chcesz, jest dziś MoE z 3B aktywnymi parametrami na kluczu
Żaden z modeli w tym porównaniu nie znajduje się w OrcaRouter i warto dokładnie wyjaśnić dlaczego. Kolibri nie ma jeszcze żadnego hostowanego wnioskowania — to wagi i przepis vLLM, więc router nie ma na co wskazywać. Solar Mini 4 jest udostępniany przez Upstage oraz przez własny kanał lokalny Upstage; nie routujemy go i nie routujemy żadnego modelu Upstage. Jeśli chcesz którykolwiek z nich, otrzymasz go bezpośrednio od samych dostawców.
Trasa „What we do” to otaczająca klasa — segment rzadkich małych MoE, w którym rywalizują oba te modele. Gemma 4 26B-A4B IT znajduje się w katalogu w cenie $0.06 za wejście i $0.33 za wyjście za milion tokenów, z oknem 262,144 tokenów. Qwen3.5 35B-A3B jest po $0.057 / $0.459, a Qwen3.6 35B-A3B po $0.248 / $1.485, z oknem 262,144 tokenów i maksymalnym wyjściem 65,536 tokenów. To ten sam kompromis, na który decydują się dwa powyższe modele — aktywny wycinek 3B–4B kupowany w cenie małego modelu — dostępny na jednym kluczu API z ceną katalogową dostawcy przekazywaną przy 0% marży, więc zmiana ceny u dostawcy trafia na Twój rachunek tego samego dnia, w którym zostanie ogłoszona, a nie przy kolejnym odnowieniu umowy. Automatyczne przełączanie awaryjne ma tu większe znaczenie niż zwykle: gdy oceniasz niesprawdzony model rzadki, druga trasa pod tym samym kluczem jest tym, co nie pozwala, by złe popołudnie zmieniło się w awarię.

Co robić i na co uważać
Wybierz Kolibri, jeśli niemiecki lub angielski to twoje obciążenie, jeśli dane nie mogą opuścić twojej własnej szafy, i jeśli masz — lub jesteś gotów kupić — GPU, aby obsłużyć 78B przy FP8. W tej konfiguracji jest to jedyny z tych dwóch modeli, który jest w ogóle opcją, a zwalidowany kontekst 1M tokenów z niemieckim tokenizerem o 4,90 bajta na token to realna, choć zmierzona przez dostawcę, zaleta. Wybierz Solar Mini 4, jeśli chcesz być w produkcji w tym tygodniu, jeśli koreański lub japoński jest na roadmapie, i jeśli twoim obciążeniem jest długi, stabilny kontekst, który jest nagradzany zniżką za cache; przewidź budżet na zapisy do cache, a nie na tokeny wyjściowe.
Otwarta kwestia jest taka sama w obu przypadkach i jest to kwestia dowodów, a nie możliwości. Wyniki 75,5 i 84,3 Kolibri to własne liczby Aleph Alpha na własnym środowisku testowym Aleph Alpha, a dopóki nie uruchomi go niezależny tracker, każdy, kto je cytuje, cytuje laboratorium. Wynik 24,05 Solar Mini 4 jest prawdziwy i odtworzony, ale Index to migawka modelu, który wciąż jest w połowie drabinki rabatowej, a ceny katalogowe pojawią się dopiero 23 października. Wypatruj pierwszej niezależnej oceny Kolibri i obserwuj, ile Solar Mini 4 faktycznie będzie kosztować, gdy drabinka się skończy — ponieważ przy $0,10 / $0,40 ekonomika wynajmowania wycinka 3B wygląda inaczej niż przy $0,03 / $0,12 z dzisiejszej wyceny.
