
Qwen3.8-27B kontra Qwen 3.8: ta sama generacja, GPU kontra szafa
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
W tym tygodniu Alibaba umieściła Qwen3.8-27B na torze szybkiej inferencji Cerebras — po raz pierwszy gęsty model 27B ma naprawdę szybką opcję hostowaną — a Artificial Analysis w końcu uwzględniła obie strony tego starcia. Qwen3.8-27B uzyskuje 34 punkty w AA Intelligence Index. Qwen 3.8, czyli otwarty rdzeń, który większość ludzi ma na myśli, pisząc tę nazwę bez sufiksu, uzyskuje 40. Te dwie liczby resetują porównanie, które sierpniowe relacje z premiery musiały opierać wyłącznie na słowie dostawcy.
Modelem kryjącym się za samodzielną nazwą „Qwen 3.8” jest Qwen3.8-2.4T-A95B: wagi modelu mixture-of-experts o 2,4 biliona parametrów, które Alibaba opublikowała na licencji niestandardowej. Qwen3.8-27B to gęsty przedstawiciel tej samej generacji — około 27 miliardów parametrów, Apache 2.0, rozmiarem dopasowany do pojedynczej karty GPU. Mają wspólną nazwę rodziny, natywną długość kontekstu 262K i okno premiery. Wszystko inne na ich temat to studium przeciwieństw: jeden możesz mieć na własność, drugi możesz tylko wynajmować. Oto, do czego właściwie służy każdy z nich, skoro oba mają już niezależne liczby.
Ta sama generacja, przeciwne kształty
Qwen3.8-27B to model gęsty — 27 mld parametrów (28 mld z uwzględnieniem enkodera wizyjnego), 64 warstwy, hybrydowy stos uwagi złożony z 48 warstw liniowej uwagi Gated DeltaNet wobec 16 warstw pełnej uwagi. Ta hybryda sprawia, że model 27B może obsłużyć 262 144 tokeny natywnego kontekstu. Qwen3.8-2.4T-A95B to architektura flagowa: 2,4 bln parametrów łącznie, około 95 mld aktywnych na token, 92 warstwy z 512 ekspertami na warstwę, a 69 z tych 92 warstw opiera się na liniowej uwadze. Ten sam trik, dziewięćdziesięciokrotnie większy rozmiar.
• Architektura — Qwen3.8-27B: 27B gęsty, każdy token aktywuje cały model. Qwen3.8-2.4T-A95B: 2.4T łącznie / ~95B aktywnych MoE.
• Kontekst — oba mają natywnie 262K; rozszerzenie 1M modelu 27B jest dostępne wyłącznie w wersji hostowanej, a 2.4T osiąga w pomiarach ~984K.
• Wejście — Qwen3.8-27B: tekst, obraz i wideo. Qwen3.8-2.4T-A95B: tylko tekst, myślenie na stałe włączone.
• Licencja — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: niestandardowa licencja Qwen3.8-Max.
• Wagi — Qwen3.8-27B: 55,6 GB w BF16, po kwantyzacji do wersji Q4 około 16 GB. Qwen3.8-2.4T-A95B: ~2,4 TB w BF16, rack GPU, a nie desktop.
• Gdzie je spotkasz — Qwen3.8-27B: hostowane samodzielnie albo tanio wynajmowane. Qwen3.8-2.4T-A95B: wynajmowane, bo nikt rozsądny nie ma własnego racka.
Niezależne liczby, w końcu
Każdy sierpniowy artykuł porównawczy o Qwen3.8-27B zawierał to samo zastrzeżenie: „brak niezależnych wyników na razie”. To już nieprawda. Artificial Analysis ma oba modele zmierzone od tego tygodnia, a kształt danych jest naprawdę interesujący.
W Intelligence Index Qwen3.8-2.4T-A95B uzyskuje wynik 40, zajmując 4. miejsce na 113 w swojej klasie. Qwen3.8-27B uzyskuje 34 punkty — co daje mu pierwsze miejsce wśród 140 modeli w jego klasie rozmiarowej 4–40B z otwartymi wagami, co jest naprawdę mocnym wynikiem jak na gęsty model 27B. Oba są wolne według niezależnych pomiarów: 39,0 tokenów wyjściowych na sekundę dla 27B i 38,1 dla 2.4T, wobec mediany klasowej około 90. Oba są rozwlekłe; 27B generuje około 200 mln tokenów wyjściowych w przebiegach indeksu, wobec mediany klasowej 68 mln. Żaden z nich nie jest sztandarowym modelem frontier; oba to konie robocze, a indeks wskazuje, że 2.4T jest wyraźnie mocniejszym koniem roboczym.

Ceny po niezależnej stronie opowiadają tę samą historię w dolarach. Artificial Analysis wycenia model 27B na 0,50 USD za milion tokenów wejściowych i 3,00 USD za milion tokenów wyjściowych w hostowanej wersji Qwen Cloud (90% zniżki na cache), a model 2.4T na 2,00 USD / 6,00 USD (88% zniżki na cache). Koszt na zadanie Intelligence Index: 0,82 USD dla 27B wobec 2,16 USD dla 2.4T. Mniejszy model jest tańszy w przeliczeniu na jednostkę inteligencji — a oba są drogie na tle swojej klasy szybkości, ponieważ oba są modelami rozumującymi, które zużywają tokeny wyjściowe.
Wszystko inne — SWE-bench Pro 61,7, DeepSWE 1.1 42,2, LiveCodeBench v6 90,3 dla modelu 27B; 86,6 Terminal-Bench 2.1 i 67,7 SWE-bench Pro dla 2,4T — pozostaje danymi zgłoszonymi przez dostawcę, niepowtórzonymi i tak oznaczonymi w całym tym tekście. Wskaźniki AA powyżej stanowią niezależne minimum pod tym wszystkim.
Co zmienia debiut giełdowy Cerebras
12 września 2026 r. konto Qwen ogłosiło, że Qwen3.8-27B działa teraz na Cerebras, a jego wpis w katalogu jest już aktywny pod hasłem „Qwen 3.8 27B jest już dostępny w Cerebras PayGo”. Cerebras podaje cenę 0,99 USD za milion tokenów wejściowych i 1,49 USD za milion tokenów wyjściowych na sprzęcie klasy WSE, dzięki któremu firma zasłynęła z szybkości. To daje modelowi 27B coś, czego rdzeń 2.4T nigdy nie miał: szybką ścieżkę.

Ma to znaczenie, ponieważ powolny i rozwlekły był jedynym prawdziwym zarzutem wobec 27B od pierwszego dnia. W niezależnym harnessie osiąga 39 t/s; w naszej własnej telemetrii serwowania osiągał ~154 tokeny wyjściowe na sekundę przy p50 opóźnienia pierwszego tokena wynoszącym 4,48 s — a teraz drugi dostawca konkuruje na tej samej osi. Natomiast 2.4T nie ma żadnej szybkiej ścieżki: przy 38 t/s płacisz ceny z najwyższej półki za prędkość średniej klasy, a jedynym sposobem, by to obejść, jest wynajęty klaster GPU, na którym samodzielnie uruchamiasz otwarte wagi.
Trzy pasy dla 27B, jeden dla 2.4T
Od dziś model dense 27B można wynająć na trzy sposoby, a rozstrzał cen warto przejrzeć, zanim dokonasz wyboru:
• Ścieżka self-hosted — Qwen3.8-27B jest już dostępny w OrcaRouter w cenie $0.33 / $2.40 za milion, uruchamiany na naszej własnej infrastrukturze. Najtańszy koszt wejścia na rynku dla tego modelu, ~154 tok/s na wyjściu, kontekst 262K.
• Ścieżka dostawcy — hostowana wersja Qwen Cloud, 0,50 USD / 3,00 USD za milion, z kontekstem 1 mln tokenów i 90% zniżką na pamięć podręczną.
• {{1}}Szybka ścieżka{{/1}} — Cerebras PayGo, 0,99 / 1,49 USD za milion, pozycjonowany na szybkości, a nie na cenie.

Otwarty rdzeń 2.4T nie ma odpowiednika w postaci spreadu. Flagowe API obsługujące tę samą architekturę — Qwen3.8-Max — kosztuje $2,00 / $6,00 za milion, i to jest liczba, która obowiązuje niezależnie od tego, czy nazwiesz to Max, czy otwartym rdzeniem. Zamiast tego uruchom wagi, a ekonomia przechodzi na sprzęt: model 2.4T potrzebuje ~2,4 TB wag BF16 i węzła z wieloma GPU — decyzja kapitałowa, której nikt nie podejmuje lekką ręką. GPU z 24 GB uruchamia wersję Q4 modelu 27B przy koszcie krańcowym, który zaokrągla się do zera.
Przykład obliczeniowy, który jest rozstrzygający dla większości zespołów: 100 mln tokenów wejściowych i 20 mln tokenów wyjściowych dziennie. Przy stawce 2.4T wynoszącej $2/$6 to około 320 USD dziennie, ~117 000 USD rocznie. W przypadku 27B przy naszej stawce $0.33/$2.40 to około 81 USD dziennie — a w przypadku kopii hostowanej u siebie to koszt energii elektrycznej. 2.4T daje realną przewagę jakościową: AA 40 przeciwko 34. Czy ta przewaga jest warta pięciocyfrowego miesięcznego rachunku — oto całe pytanie, jakie stawia to zestawienie.
Tam, gdzie naprawdę się różnią
Poza indeksem o tym, który z nich pasuje do danego obciążenia, decydują trzy praktyczne różnice.
Multimodalne dane wejściowe to najczystszy filtr. Qwen3.8-27B czyta tekst, obrazy i wideo — zrzuty ekranu, wykresy, dokumenty z rycinami, klatki wideo, wszystkie trafiają do tego samego okna 262K. Qwen3.8-2.4T-A95B jest zdecydowanie wyłącznie tekstowy. Jeśli dane wejściowe zawierają cokolwiek wizualnego, model 2.4T jest wykluczony niezależnie od jego wyższego indeksu.
Kontrola myślenia jest drugorzędna. Tryb rozumowania modelu 27B można wyłączyć dla każdego żądania, co ma znaczenie w ekstrakcji wrażliwej na opóźnienia, gdzie łańcuch myśli jest czystym narzutem; udostępnia też reasoning_effort. Rdzeń 2.4T nie może wyłączyć myślenia — każda odpowiedź zaczyna się od bloku think>, a płacisz za te tokeny, niezależnie od tego, czy ich chciałeś, czy nie. Flagowe API to naprawia, ale otwarty rdzeń nie.
Licencjonowanie jest trzecie i po cichu ma znaczenie na dużą skalę. Apache 2.0 dla modelu 27B to permisywny standard: modyfikacja, redystrybucja, komercjalizacja, w tym grant patentowy. Model 2.4T jest udostępniany na podstawie niestandardowej licencji Qwen3.8-Max — permisywnej w duchu, ale to warunki Alibaby, a nie standard społeczności; warto przeczytać plik, zanim zbudujesz na jego podstawie produkt.
Kierowanie decyzji
Obie strony tego starcia są osiągalne przez jeden klucz OrcaRouter, co sprawia, że pytanie „który wybrać” można tanio rozstrzygnąć empirycznie. Qwen3.8-27B jest dostępny jako qwen/qwen3.8-27b w cenie katalogowej dostawcy, bez marży, a flagowe API zbudowane na tym samym rdzeniu 2.4T jest dostępne jako qwen/qwen3.8-max za 2,00 / 6,00 USD za milion — stawka samego Alibaby, przekazywana bezpośrednio, więc każda zmiana ceny dostawcy jest tu widoczna tego samego dnia.
Ta sama architektura 2.4T w formie wag do pobrania nie jest czymś, co udostępniamy — jeśli chcesz dziś korzystać z otwartego rdzenia przez API, flagowa ścieżka jest praktycznym sposobem, aby do niego dotrzeć, a qwen/qwen3.8 jest wstępnie skonfigurowany do włączenia w momencie, gdy dostawca udostępni otwarte wagi. Reguła routingu, która kieruje ruch wizualny i wrażliwy na opóźnienia do qwen/qwen3.8-27b, a trudniejsze zadania wymagające rozumowania do qwen/qwen3.8-max, nie wymaga żadnych kosztów konfiguracji i automatycznie przełącza się między dostawcami w razie awarii. Jeden klucz, bez drugiej umowy, a podział to zmiana konfiguracji, a nie przebudowa architektury — najtańszy sposób, aby sprawdzić, czy dodatkowe sześć punktów indeksowych 2.4T jest warte dla Ciebie 5,67 USD za milion tokenów wyjściowych.
Kto powinien wybrać, które
• Wybierz Qwen3.8-27B, jeśli Twoje dane wejściowe obejmują obrazy lub wideo, jeśli chcesz mieć możliwość wyłączenia trybu myślenia, jeśli masz GPU 24 GB lub planujesz go mieć, albo jeśli Twoje wydatki na token są na tyle duże, że $0.33/$2.40 w porównaniu z $2.00/$6.00 to cały argument.
• Wybierz Qwen 3.8 (rdzeń 2.4T), jeśli pracujesz wyłącznie na tekście, zależy Ci na najwyższym niezależnym wyniku rozumowania w rodzinie (AA 40), a stawka $2/$6 — albo koszt uruchomienia węzła GPU — wygodnie mieści się w Twoim budżecie.
• Wybierz oba, jeśli Twój ruch obejmuje oba profile: kieruj go przez bramę, pozwól routerowi rozdzielać go według modalności i trudności, a decyzję zmień, gdy pojawi się kolejny checkpoint lub cena któregoś z modeli.
Werdykt
Nazwa Qwen 3.8 zawsze oznaczała dwa produkty udające jedną rodzinę, a teraz oba mają osobne liczby, o których można dyskutować. Qwen3.8-2.4T-A95B to mocniejszy mózg: wyłącznie tekstowy, drogi i bezdyskusyjnie rentowny przy $2/$6. Qwen3.8-27B to ten, który można wdrożyć — multimodalny, Apache 2.0, do samodzielnego hostowania, a od tego tygodnia ma wreszcie także szybką ścieżkę. Różnica w indeksie jest realna: 40 kontra 34. Podobnie z różnicą cen: około pięciokrotnie wyższy koszt za token, gdy uruchamiasz 2.4T jako API. Dla większości zespołów decyzja nie sprowadza się do sześciu punktów indeksu. Sprowadza się do tego, czy kupujesz tokeny, czy kupujesz sprzęt — a 27B jest jedynym z tej dwójki, który pozwala ci kupić sprzęt.
