
Kolibri vs Intern-Decision 4B: Jeden pisze dokumenty, drugi odmawia napisania czegokolwiek
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 217 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Najbardziej użyteczną rzeczą do zauważenia w przypadku Kolibri i Intern-Decision-4B jest to, że nie są tym samym rodzajem obiektu, a traktowanie tego jako porównania modelu z modelem byłoby błędem kategorii. Kolibri to model językowy typu mixture of experts o 78,1 miliarda parametrów od Aleph Alpha, wydany 3 października 2026 roku, który aktywuje 3,46 miliarda parametrów na token i pisze tekst po niemiecku i angielsku. Intern-Decision-4B to multimodalny model ustrukturyzowanych decyzji o 4,54 miliarda parametrów zespołu InternLM, przesłany do Hugging Face 26 września 2026 roku, którego karta wprost stwierdza, że w ogóle „nie wywołuje generate() ani nie próbkuje tekstu swobodnego”. Jeden tworzy prozę. Drugi w jednym przejściu w przód tworzy rozkład prawdopodobieństwa nad opcjami, które podasz, i nie potrafi napisać zdania. Stają się konkurentami tylko w jednej wąskiej sytuacji, a wiedza o tym, jaka to dokładnie sytuacja, okazuje się najbardziej użyteczną rzeczą w obu tych wydaniach.
Dwa wydania, dwa całkowicie różne lakoniczne twierdzenia
Karta Kolibri to specyfikacja dużego rzadkiego modelu językowego: 50 warstw, każda w architekturze mieszaniny ekspertów, 384 ekspertów na warstwę, z jednym wspólnym i sześcioma kierowanymi, natywny kontekst 262 144 tokenów walidowany do 1 048 576, cztery poziomy wysiłku rozumowania, wywoływanie narzędzi w stylu Hermes z dołączonym parserem vLLM, wagi FP8 w blokach 128×128 oraz warunki Apache 2.0. Trening modelu przetworzył 20 bilionów tokenów na 768 układach NVIDIA B200 przez 21 dni — 392 000 godzin GPU przy raportowanych 6,4×10²³ FLOPs i szacowanych 9,5×10² MWh, z uwzględnieniem narzutu centrum danych, z wyłączeniem nadzorowanego dostrajania i uczenia ze wzmocnieniem. Minimalna konfiguracja serwowania według karty to dwie karty A100 80 GB, dwa H100 SXM5, jeden H200, jeden B200 lub jeden B300, a zajętość FP8 wynosi około 78 GB. To poważny element infrastruktury, a na pytania odpowiada, generując tekst.
Intern-Decision-4B to obiekt przeciwnego rodzaju, a karta modelu jest orzeźwiająco bezpośrednia w tej kwestii. To dostrojona wersja Qwen3.5-4B, w której wieża widzenia i projektor są zamrożone, a trenowany jest wyłącznie rdzeń językowy. Podajesz mu stan, schemat nazwanych pytań i opcjonalnie do ośmiu obrazów, a on zwraca rozkład nad odpowiedziami kandydującymi dla każdego pytania naraz. Mechanizm jest nietypowy i warto opisać go precyzyjnie: opcje są mapowane na symbole odpowiadające pojedynczym tokenom od A do Z, od a do z i od 0 do 9 — 62 kandydatów, czyli maksymalnie 62 opcje na pytanie — prompt jest renderowany z jednym symbolem zastępczym na pole, a model odczytuje logity na pozycji bezpośrednio przed każdym symbolem zastępczym. Softmax jest obliczany wyłącznie na logitach dozwolonych symboli danego pola, temperatura właściwa dla danego checkpointu kalibruje wynik, a symbole są mapowane z powrotem na oryginalne wartości opcji jako typowany JSON. Nie ma pętli dekodowania, próbkowania ani prozy.
• Dane wyjściowe — Kolibri: swobodnie generowany tekst w języku niemieckim lub angielskim, wywołania narzędzi, ślady rozumowania. Intern-Decision-4B: typowane odpowiedzi JSON z prawdopodobieństwem dla każdej opcji.
• Parametry — Kolibri: 78 103 074 560 łącznie, 3 457 573 120 aktywne. Intern-Decision-4B: 4,54 miliarda w czterech shardach safetensors w formacie bfloat16, z zamrożoną wieżą wizyjną.
• Dane wejściowe — Kolibri: tylko tekst. Intern-Decision-4B: tekst plus do ośmiu obrazów.
• Pojemność pytań: Intern-Decoder-4B: do 62 opcji na pole, w jednym przebiegu w przód, z typami pytań 'choice', 'score' i 'noul' (tak/nie). Kolibri: teoretycznie nieograniczona, w praktyce jedna na raz.
• Język — Kolibri: niemiecki i angielski z założenia. Intern-Decision-4B: cokolwiek zawiera Qwen3.5-4B, ze wszystkimi opublikowanymi zestawami ewaluacyjnymi w języku angielskim.
• Opóźnienie — Intern-Decision-4B: średnio 44,16 ms, mediana 44,03 ms i P95 44,60 ms na zapytanie na pojedynczym RTX 4090, według jego własnego pomiaru. Kolibri: brak jakichkolwiek publikowanych wartości dla pojedynczego zapytania.
• Licencja — obie Apache 2.0; Intern-Decision-4B jest dostarczany wraz z zachowanym plikiem licencji Qwen.

Dlaczego w ogóle istnieje skorer 4B
Argument za Intern-Decision-4B nie polega na tym, że jest mały. Polega na tym, że proszenie dużego modelu generatywnego o prawdopodobieństwo to nie to samo co mierzenie go, a różnica jest mierzalna.
Tabela benchmarkowa samej karty przedstawia argument z nietypowo dużą dozą ujawniania informacji o sobie. W siedmiu zestawach testów dokładności Intern-Decision-4B osiąga średnio 90,02 — wobec 88,74 dla najsilniejszego modelu odniesienia, z którym się porównuje, modelu o nazwie Jev. Ale dokładność to ta nieciekawa połowa. Tabela podaje też Brier score i oczekiwany błąd kalibracji, a tam obraz jest bardziej wymagający. Model 4B odnotowuje Brier 0,347 i ECE 0,065, wobec 0,358 i 0,095 w przypadku Jev. Mniejsze modele z tej samej rodziny to miejsce, w którym historia kalibracji staje się naprawdę pouczająca. Intern-Decision-2B osiąga średnio 84,68, znacznie wyprzedzając model 0.8B z wynikiem 79,38 — a jednak jego ECE wynoszące 0,100 jest gorsze niż 0,066 modelu 0.8B i gorsze niż 0,065 modelu 4B, przy wyniku Brier 0,437 wobec 0,530 modelu 0.8B. Najdokładniejszy z dwóch małych modeli jest najmniej uczciwy, jeśli chodzi o własną pewność siebie. Jeśli zakładałeś, że kalibracja poprawia się wraz z dokładnością albo wraz z liczbą parametrów, ta tabela jest kontrprzykładem w obu przypadkach.
Drugi, odrębny test diagnostyczny obejmuje 96 przypadków skonstruowanych na podstawie dokładnych rozkładów referencyjnych, a nie próbkowanych twardych etykiet — losowania, zdarzenia złożone, historia warunkowa, łamigłówki probabilistyczne. Błąd modelu 4B w tym pilotażu spadł z 0,628 do 0,550 w raportowanej metryce, podczas gdy model porównawczy utrzymywał się na poziomie 0,595. W karcie wyraźnie stwierdzono, że ten pilotaż nie posłużył do dopasowania ani wyboru opublikowanej temperatury; temperatura 1,992418 modelu 4B została dopasowana osobno na zbiorze kalibracyjnym. Zespół InternLM udostępnił także sam benchmark w repozytorium GitHub — deterministyczny generator, referencje oraz działający offline skrypt oceniający — co oznacza, że twierdzenie o kalibracji należy do rzadkiego rodzaju, który strona trzecia może faktycznie ponownie uruchomić, zamiast przyjmować na wiarę.
Nic w materiale wydania Kolibri nie oferuje odpowiednika. Jej tabela porównawcza podaje dokładność zadań dla czternastu modeli w ramach jednego środowiska testowego dostawcy, a dokładność to jedyne, czym można zmierzyć model generatywny. W całym materiale nie ma żadnej wartości kalibracji, żadnego wskaźnika Brier ani ECE i nie ma sposobu, by zapytać go o „prawdopodobieństwo, że ta klauzula umowy jest wykonalna”, który nie polegałby na wylosowaniu zdania i przeczytaniu go.
Jedyny szew, w którym rzeczywiście się spotykają
Zestaw oba obok siebie w prawdziwym pipeline, a ich kształty staną się oczywiste. Niemiecki workflow dokumentów potrzebuje obu połówek, a żadne z narzędzi nie obejmuje połowy drugiego.
Kolibri to ta połowa, która czyta i pisze. Zespół mający niemieckie umowy lub dokumentację techniczną otrzymuje natywne okno 262 144 tokenów, pamięć podręczną KV w FP8, dwujęzyczny tokenizer, który według Aleph Alpha osiąga średnio 4,90 bajta na token w niemieckim tekście internetowym, oraz wywoływanie narzędzi Hermes — co oznacza model, który potrafi streścić pismo urzędowe, przygotować odpowiedź i prowadzić pętlę narzędziową. Nie potrafi natomiast powiedzieć ci o swojej własnej pewności w sposób, który możesz audytować, ponieważ wszystko, co emituje, jest ciągiem znaków uzyskanym przez próbkowanie.
Intern-Decision-4B to ta połowa, która decyduje. Otrzymawszy stronę tekstu niemieckiego i stały zestaw opcji, zwraca skalibrowany rozkład w ciągu 44 milisekund na jednym GPU klasy konsumenckiej, bez etapu generowania, a zatem bez jakiejkolwiek wariancji próbkowania. Nie potrafi jednak w ogóle wygenerować tekstu niemieckiego, a jego opublikowane zestawy testów są angielskojęzyczne — jego zachowanie w języku niemieckim wynika z bazowego modelu Qwen3.5-4B, a nie z treningu pod tym kątem, co jest realnym ograniczeniem przy wdrożeniu w języku niemieckim i takim, którego nikt nie ocenił.
Zatem uczciwa odpowiedź inżynierska dla regulowanego przepływu pracy w języku niemieckim jest taka, że to dwa etapy jednego potoku, a nie dwóch kandydatów na jedno miejsce. Praktyczne pytanie brzmi: gdzie działa każdy z nich. Kolibri potrzebuje dwóch H100 albo jednego B200 i około 78 GB. Intern-Decision-4B potrzebuje jednego RTX 4090 i wykonuje zapytanie w mniej niż 45 milisekund. Asymetria kosztów to około dwóch rzędów wielkości w przypadku sprzętu i wskazuje na projekt, w którym mały moduł oceniający działa w sposób ciągły przy każdym przypadku, a duży generator jest wywoływany tylko wtedy, gdy przypadek rzeczywiście wymaga tekstu. To tańsza i bardziej przyjazna audytowi architektura niż kierowanie każdego przypadku przez model 78B, aby uzyskać odpowiedź, którą potem trzeba interpretować.

Rzeczywistość hostingu w obu przypadkach i do czego służy ta warstwa
Żaden z tych modeli nie jest dostępny jako hostowane API, a sprawdziliśmy to, zamiast zakładać. Intern-Decision-4B nie ma punktu końcowego dostawcy; wydanie to wagi, repozytorium GitHub i Hugging Face Space. Jego liczby pobrań i polubień zmieniły się od połowy tygodnia, co świadczy o tym, że ludzie zaczynają go używać, ale nadal nie ma płatnej, wywoływalnej ścieżki, którą moglibyśmy wskazać.
Kolibri również nie ma SKU API Aleph Alpha — wydanie to wagi, raport techniczny i obraz kontenera pod adresem ghcr.io/aleph-alpha/aleph-alpha-inference. Nie ma go też na OrcaRouter: sprawdziliśmy katalog dla każdej pisowni prefiksu dostawcy i nazwy modelu, a on zwraca „not found”, co wolimy powiedzieć wprost, niż sugerować inaczej.
To, co zmienia tutaj warstwa routingu, to nie dostęp do tych dwóch modeli, lecz ekonomia decyzji o tym, czy kupować sprzęt dla któregokolwiek z nich. Uczciwy test przed zakupem dla części generatywnej polega na uruchomieniu obciążenia na niewielkim poziomie mieszaniny ekspertów, który jest już routowany — wariant Gemma 4 26B-A4B za 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion tokenów wyjściowych, z oknem 262 144 tokenów oraz wejściem tekstowym, obrazowym i wideo — na jednym kluczu zgodnym z OpenAI w cenie katalogowej dostawcy bez żadnych dodatków, i sprawdzeniu, czy niemieckie obciążenie dokumentowe rzeczywiście potrzebuje 78 miliardów parametrów, zanim zamówi się GPU. Część decyzyjna nie ma takiego skrótu, ponieważ zachowanie skalibrowanego rozkładu jest całym sensem tego modelu i żaden routowany poziom tego nie zapewnia. Ale to samo w sobie jest wnioskiem: mówi ci, że scorer 4B to część, którą naprawdę będziesz hostować samodzielnie, a generator to część, którą warto ponownie przetestować na czymś, co możesz wynająć jeszcze dziś po południu.
Co by to rozstrzygnęło
Dwa pomiary, a żaden jeszcze nie istnieje.
Pierwszy to Intern-Decision-4B na niemieckich danych wejściowych. Każdy opublikowany zestaw testów jest w języku angielskim, a model powstał przez dostrojenie wielojęzycznej bazy, więc jego kalibracja dla języka niemieckiego jest nieznana — a kalibracja to dokładnie ta właściwość, która nie przenosi się za darmo między językami. Niemiecka wersja pilotażu dystrybucji obejmującego 96 przypadków byłaby pojedynczym najbardziej informatywnym artefaktem, jaki ktokolwiek mógłby opublikować na temat tego modelu.
Druga kwestia to koszt pojedynczej decyzji w przypadku Kolibri. Twierdzenie Kolibri o ekonomice udostępniania to granica Pareto jakości względem liczby dekodowanych tokenów na sekundę na GPU, a dla Kolibri nie ma strony Artificial Analysis ani niezależnej replikacji środowiska testowego. Dopóki ktoś go nie uruchomi, „78 miliardów parametrów” jest specyfikacją, a nie kosztem, a argument za utrzymywaniem przed nim 44-milisekundowego modułu oceniającego pozostaje argumentem projektowym, a nie opartym na pomiarach.
Do tego czasu właściwym sposobem odczytywania tego zestawienia nie jest traktowanie go jako konkursu. Intern-Decision-4B to bardziej interesujące technicznie wydanie z tych dwóch, ponieważ świadome kalibracji wyjście strukturalne to zdolność, którą oferuje niemal żaden model generatywny, a jego karta pozwala sprawdzić to twierdzenie. Kolibri to wydanie o większym znaczeniu, ponieważ europejskie laboratorium wypuszczające model Apache 2.0 o 78 miliardach parametrów wraz z opublikowanym obok niego potokiem danych to wydarzenie w łańcuchu dostaw, a nie wydarzenie modelowe. Żadne nie zastępuje drugiego. Zespoły, które potrzebują obu, powinny zaplanować oba i odpowiednio dobrać do nich sprzęt, a to właśnie harness wokół nich jest miejscem, w które tak naprawdę idzie wysiłek inżynieryjny.

