Wygenerowano kartę główną dla Kolibri vs Qwen 3.8, z nagłówkiem „Kolibri vs Qwen 3.8” i podtytułem „suwerenne niemieckie serwowanie przeciwko otwartej chińskiej rodzinie”, ikoną kolibra po lewej i konturem chmury po prawej, po obu stronach cienkiego separatora. Logo OrcaRouter znajduje się w pasku pod grafiką.
Guides & Insights

Kolibri vs Qwen 3.8: niemiecki model przegrywa we własnej tabeli — i o to właśnie chodzi

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zacznij od zdania, które większość relacji z premiery Kolibri pominęła. W tabeli benchmarków, którą Aleph Alpha opublikowała wraz z własnym modelem 3 października 2026 r., model, z którym jest porównywany najczęściej, nie jest europejskim rywalem ani amerykańskim. Jest to Qwen3.8 27B, otwarty wariant wagowy tego pokolenia od tego dostawcy, wydany 13 sierpnia 2026 r. — i według własnych liczb Aleph Alpha wygrywa. Qwen3.8 27B uzyskuje 80,2 w średniej angielskiej i 79,9 w średniej niemieckiej tego samego zestawu ewaluacyjnego, który daje Kolibri 75,5 i 70,8. Prowadzi w GPQA Diamond, 89,2 przeciw 84,3. Prowadzi w LiveCodeBench v6, 93,8 przeciw 85,9. Prowadzi w SWE-Bench Verified, 72,6 przeciw 66,4, oraz w obu benchmarkach długiego kontekstu, 76,9 przeciw 64,5 w LongBench Pro i 81,3 przeciw 68,3 w AA-LCR. Gęsty chiński model o 27 miliardach parametrów, oceniany przez niemieckie laboratorium, bije flagowy model tego laboratorium o 78 miliardach parametrów w większości jego własnej tabeli. To nie skandal. To najużyteczniejszy fakt w tej publikacji, ponieważ wymusza pytanie, do czego właściwie służy Kolibri.

Jedno wyjaśnienie, zanim porównanie pójdzie dalej, ponieważ „Qwen 3.8” nazywa rodzinę, a nie model, a te rozróżnienia mają tu znaczenie. Qwen3.8-Max to hostowany flagowiec Alibaby, dostępny od 3 sierpnia 2026 roku z oknem kontekstu 1 mln tokenów w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za tokeny wyjściowe. Qwen3.8-27B to warstwa z otwartymi wagami, wydana 13 sierpnia 2026 roku z oknem 262 144 tokenów. Qwen3.8-Flash to warstwa masowa, wydana 26 sierpnia 2026 roku z oknem 1 mln tokenów i znacznie niższymi cenami. A zwykły Qwen3.8 — ogłoszony 19 lipca 2026 roku jako flagowiec z otwartymi wagami o 2,4 biliona parametrów — nie został wydany; istnieje jako strona katalogowa do śledzenia i ogłoszenie. Wszystko poniżej dotyczy tego, którego wagi można pobrać i uruchomić, czyli 27B.

Gdzie Kolibri faktycznie wygrywa — odczytaj z tej samej tabeli.

Wiersze, w których Kolibri wyprzedza Qwen3.8 27B, nie są rozrzucone losowo. Tworzą skupienie, a skupienie jest produktem.

• Wstrzymanie się od odpowiedzi — w przypadku RGB Negative Kolibri uzyskuje 85,6 wobec 70,6. Gdy kontekst nie zawiera odpowiedzi, Kolibri mówi o tym znacznie częściej.

• Wywoływanie narzędzi w warunkach ograniczeń — w τ²-bench telecom 94,7 wobec 82,5; w branżowym zestawie testów dla dostawców motoryzacyjnych 99,0 wobec 97,3.

• Bardzo długi kontekst — w SealQA bez dystraktorów powyżej 24 tys. tokenów, 100,0 wobec 94,4.

• Niemiecka ekonomika serwowania — dwujęzyczny tokenizator przy 4,90 średnich bajtów na token w niemieckim tekście internetowym, w porównaniu z 4,17 dla rodziny Qwen3.5–3.8 według własnego pomiaru Aleph Alpha. Mniejsza liczba tokenów na niemiecki dokument to bezpośrednie obniżenie kosztów wnioskowania, które pojawia się na fakturze, a nie w żadnym wierszu benchmarku.

Trzy z tych czterech dotyczą zachowania, a nie możliwości. Wstrzymanie się od odpowiedzi, ograniczone wywoływanie narzędzi i ugruntowane wyszukiwanie w długim kontekście to coś, czego potrzebujesz od modelu, który czyta materiały własne Twojej organizacji i od którego oczekuje się, że przyzna, gdy materiały te nie odpowiadają na pytanie. Aleph Alpha zbudowała całe wydanie wokół tego założenia, a tabela pokazuje, że ten zakład się sprawdza.

Generated two-column scoreboard for Kolibri and Qwen3.8 27B. Left column Kolibri: English average 75.5, German average 70.8, abstention 85.6, GPQA Diamond 84.3, SWE-Bench Verified 66.4, licence Apache 2.0. Right column Qwen3.8 27B: English average 80.2, German average 79.9, abstention 70.6, GPQA Diamond 89.2, SWE-Bench Verified 72.6, licence Apache 2.0. The footer reads 'Both columns from Aleph Alpha's published table, vendor harness; no independent reproduction.'

Wiersze, w których wygrywa Qwen3.8 27B, dotyczą szerokiego zakresu: wiedzy w obu językach, pytań naukowych na poziomie magisterskim, programowania konkursowego, inżynierii oprogramowania na poziomie repozytorium i rozumienia długich dokumentów. Jeśli potrzebujesz silnego modelu ogólnego przeznaczenia w niskiej cenie za token, z otwartymi wagami, Qwen3.8 27B jest lepszym modelem, a tabela mówi to samo własnym atramentem dostawcy.

Ta interpretacja znajduje potwierdzenie, podczas gdy w przypadku Kolibriego nie. Artificial Analysis zmierzył Qwen3.8 27B niezależnie, w jego konfiguracji rozumowania Xhigh, i podaje Intelligence Index wynoszący 34 na miejscu #1 spośród 142 modeli w tym porównaniu, 45,4 tokena wyjściowego na sekundę, kontekst 256 000 tokenów oraz licencję Apache 2.0. Ich uwaga jest niepochlebna w znajomy sposób — bardzo gadatliwy, bo wygenerował 200 milionów tokenów podczas oceny indeksu wobec mediany 82 milionów, i powolny — ale sam wynik jest pomiarem strony trzeciej dotyczącym przeciwnika. Kolibri nie ma w ogóle strony w Artificial Analysis. Tak więc najsilniejszy model w tym porównaniu został niezależnie zweryfikowany, a słabszy opiera się na słowach dostawcy, co jest odwrotnością tego, jak zwykle przedstawia się pierwszej generacji europejski flagowiec.

Dwa rodzaje twierdzeń dotyczących łańcucha dostaw, skierowane w przeciwnych kierunkach

Oba te wydania to argumenty o tym, skąd pochodzi model, a te argumenty są swoimi lustrzanymi odbiciami.

Przypadek Aleph Alpha to pochodzenie jako cecha. Kolibri został wytrenowany przez niemieckie zespoły na infrastrukturze w Niemczech i Finlandii, zgodnie z prawem UE i Niemiec. Karta modelu ujawnia mieszankę pretreningową — 20 bilionów tokenów, w tym około 62,5 proc. angielskiego, 23,9 proc. niemieckiego i 13,6 proc. kodu — budżety treningu pośredniego i długiego kontekstu, dokładne zasoby obliczeniowe: 768 układów NVIDIA B200 w 96 węzłach HGX przez 21 dni oraz szacowane 9,5×10² MWh energii, z uwzględnieniem narzutu centrum danych. Podaje metodę treningu ze szczegółowością do pojedynczej warstwy: 50-warstwowy transformator typu mieszanka ekspertów z podziałem w stosunku 4:1 między uwagę z oknem przesuwnym a uwagę z grupowanymi zapytaniami, Muon i Exact Quantile Balancing w 384 ekspertach, z których 1 jest współdzielony, a 6 routowanych. Dwanaście tysięcy słów ujawnień dołączonych do pobrania o rozmiarze 78 GB oraz wyrażone stanowisko sygnatariusza wobec unijnego Kodeksu postępowania dla AI ogólnego przeznaczenia.

Przypadek Alibaby jest inny co do rodzaju: nie „możemy wyjaśnić każdej decyzji”, lecz „oto wagi, weźcie je”. Otwarte wagi na licencji Apache w skali i jakości, które uczyniły Qwen faktycznym domyślnym wyborem na całym świecie, słownik 248 077 tokenów obejmujący znacznie ponad sto języków oraz ekosystem obsługi dostrajany wokół tych checkpointów wystarczająco długo, że niemal każdy stos wnioskowania obsługuje je od razu. Argument o suwerenności sprowadza się tam do dostępności: żaden dostawca nie może wycofać modelu, ponieważ już masz plik.

Obie tezy są uczciwe i odpowiadają na różne obawy. Nabywca z sektora publicznego w Badenii-Wirtembergii martwi się o jurysdykcję i możliwość audytu, i do tej obawy odnosi się Kolibri. Grupa badawcza w Nairobi albo São Paulo martwi się, że model jest zamknięty za kartą kredytową w walucie, w której nie może płacić, i do tej obawy odnoszą się otwarte wagi Qwen. Nieuczciwe jest natomiast udawanie, że którekolwiek z nich jest porównaniem możliwości, ponieważ tabela możliwości już dała odpowiedź.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B (Xhigh), marked 'Open weights model, Released August 2026', showing an Intelligence Index of 34 against a median of 8, a #1/142 intelligence rank, a #55/142 speed rank at 45 tokens per second against a 91-token median, input pricing $0.50 per million tokens against a $0.03 median and output pricing $3.00 against a $0.15 median, an average cost of $1.01 per task on the Intelligence Index, a verbosity rank of #22/142 having generated 200M tokens during the index evaluation against a median of 82M, a 256k-token context window, and the Apache 2.0 licence badge.

Luka licencyjna jest realna, ale węższa, niż się wydaje.

Kolibri jest dostępny na licencji Apache 2.0. Qwen3.8 27B to model o otwartych wagach na licencji Apache. Oba są udostępniane bez klauzuli dopuszczalnego użytku, bez progu miesięcznej liczby aktywnych użytkowników i bez odrębnych warunków komercyjnych — co stawia je w niewielkim gronie i oznacza, że żadne z nich nie wymaga przeglądu prawnego przed użyciem komercyjnym.

To, co je odróżnia, to wszystko, co następuje po licencji. Kolibri trafia do nas z wtyczką vLLM i pakietem parserów od dostawcy, obrazem kontenera, czterema poziomami wysiłku wnioskowania konfigurowalnymi przez szablon czatu, jawnym zachowaniem polegającym na powstrzymaniu się od odpowiedzi oraz zalecaną konfiguracją próbkowania. Qwen3.8 27B trafia jako wagi, które Transformers, vLLM i SGLang już potrafią obsługiwać, z formatem wywoływania narzędzi, na którego przyswojenie szerszy ekosystem miał całe miesiące.

Sprzęt wdrożeniowy różni się w podobny sposób. Wagi FP8 modelu Kolibri zajmują około 78 GB i wymagają co najmniej dwóch kart A100 80 GB, dwóch H100 SXM5, jednej H200, jednej B200 lub jednej B300. Qwen3.8 27B w formacie bfloat16 to około 54 GB wag, co odpowiada pojedynczemu akceleratorowi 80 GB przy pełnej precyzji albo skwantyzowanej wersji na znacznie mniejszym sprzęcie. Model niemiecki wymaga więcej sprzętu i daje w zamian gorsze wyniki w benchmarkach. To zły interes tylko wtedy, gdy kupujesz wyniki benchmarków.

Co metki cenowe mówią, a czego nie mówią

Kolibri nie ma ceny, ponieważ Aleph Alpha nie sprzedaje dla niego wnioskowania. Wydanie to wagi, raport techniczny i karta; nie ma hostowanego SKU. Wszelkie dane kosztowe dla Kolibri to kalkulacja amortyzacji sprzętu, którą wykonujesz samodzielnie.

Qwen3.8 ma publicznie podane ceny w trzech progach, a środkowy z nich jest tym, który ma znaczenie dla zespołu porównującego własny hosting z wynajmem.

• Qwen3.8-Max — 2,00 USD za milion tokenów wejściowych i 6,00 USD za tokeny wyjściowe, kontekst 1 mln tokenów, odczyty z pamięci podręcznej po 0,25 USD, wydany 3 sierpnia 2026 r.

• Qwen3.8-27B — 0,33 USD za wejście i 2,40 USD za wyjście, kontekst 262 144 tokenów, wydany 13 sierpnia 2026 r. To otwarte wagi, więc ta cena to kwota, którą płacisz, jeśli wolisz ich nie uruchamiać.

• Qwen3.8-Flash — $0.15 za wejście i $0.47 za wyjście z oknem 1M tokenów, wydany 26 sierpnia 2026.

To są ceny katalogowe dostawców w OrcaRouter, przekazywane dalej bez doliczania czegokolwiek za token, co jest przydatną właściwością, gdy pytanie brzmi, czy wdrożenie hostowane samodzielnie się zwraca: możesz zmierzyć swój rzeczywisty wolumen tokenów na poziomach hostowanych, zanim zainwestujesz w sprzęt. Nie doliczamy marży, więc obniżka ceny wprowadzona przez dostawcę obowiązuje u nas tego samego dnia. Wszystkie trzy poziomy Qwen3.8 można dziś kierować przez jeden klucz zgodny z OpenAI z automatycznym przełączaniem awaryjnym między dostawcami, a nadchodzący Qwen3.8 o 2,4 biliona parametrów ma stronę katalogową czekającą na wagi, a nie zaślepkę udającą, że je obsługuje.

Kolibri nie jest routowalny. Sprawdziliśmy katalog pod każdą pisownią dostawcy i modelu i nie ma go tam — więc jedynym sposobem, aby go wywołać, jest pobranie 78 GB. Jeśli chcesz wiedzieć, ile niemiecki model kosztowałby Twoje obciążenie, odpowiedź brzmi: szafa rack i osoba, która potrafi uruchomić vLLM, a żadna strona trzecia nie może obecnie zaoferować ci niczego innego.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the 1M-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 2.35 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-03', the description as Alibaba's newest flagship in the Qwen line positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the pricing tiles $2.00 and $6.00, and the OpenAI-compatible and Anthropic-compatible base URLs at https://api.orcarouter.ai/v1 and https://api.orcarouter.ai.

Kto co powinien kupić

Decyzja nie zależy od jakości, ponieważ kwestię tę rozstrzygnęła własna tabela dostawcy na korzyść Alibaby. Zależy od tego, od jakiego ryzyka wykupujesz ubezpieczenie.

• Wybierz Kolibri, jeśli wiążącym ograniczeniem jest jurysdykcja, dokumentacja pochodzenia lub audytowalność — jeśli musisz umieć odpowiedzieć, skąd pochodziły dane treningowe, gdzie wykonywano obliczenia i na podstawie jakiego prawa, oraz jeśli obciążenie stanowią dokumenty niemieckie i angielskie przetwarzane w Twoim własnym obwodzie. Płacisz za to premię za możliwości, a premia jest widoczna w tabeli powyżej.

• Wybierz Qwen3.8 27B, jeśli wiążącym ograniczeniem są możliwości na dolara, szerokość obsługi języków lub wsparcie ekosystemu. To mocniejszy model według własnej oceny Aleph Alpha, ma licencję Apache, działa na jednym akceleratorze, a plany hostowane zaczynają się od 0,33 USD za milion tokenów wejściowych, jeśli wolisz w ogóle go nie uruchamiać.

• Rozważ oba w tej samej architekturze, jeśli obciążenie ma rdzeń objęty regulacjami i ogólną peryferię. Dokumenty, które nie mogą opuścić budynku, trafiają do samodzielnie hostowanego punktu końcowego Kolibri; praca nad streszczaniem, tłumaczeniem i kodem trafia do routowanej warstwy Qwen3.8 za jedną trzecią centa za tysiąc tokenów. Jeden klucz API, jedna reguła routingu, ceny katalogowe dostawcy przekazywane dalej, a przełączanie awaryjne obsłużone za Ciebie — co jest znacznie bardziej użytecznym rozwiązaniem niż wybranie jednego z tych dwóch i udawanie, że drugi nie istnieje.