
Qwen3.8-27B Benchmarki: Pełna tabela z zastrzeżeniami
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Qwen/Qwen3.8-27B osiąga w Terminal-Bench 2.1 wynik 73,0, w SWE-bench Pro 61,7, w LiveCodeBench v6 90,3, a w OSWorld-Verified 84,3 — a każda z tych liczb pochodzi od samego Alibaba. Model o otwartych wagach liczący 27 miliardów parametrów trafił na Hugging Face 14 sierpnia 2026 roku na licencji Apache 2.0, a w ciągu pierwszych dwóch tygodni zdobył trzy niezależne wyniki od zewnętrznych podmiotów: pierwsze miejsce w kategorii modeli o otwartych wagach w benchmarku Harvey's Legal Agent, w badaniu przeprowadzonym przez firmę Harvey zajmującą się AI dla prawników oraz firmę pamięciową Engram; 9. miejsce w ogólnym rankingu na liście liderów WebDev serwisu Code Arena, jako jedyny model w swojej klasie rozmiarowej w pierwszej dziesiątce, zgodnie z ogłoszeniem Alibaba z 25 sierpnia; a także, ogłoszone 26 sierpnia, pierwsze miejsce w kategorii modeli o otwartych wagach na liście liderów Image-to-WebDev serwisu Arena.ai, z 7. miejscem w rankingu ogólnym i zgłoszonym wynikiem 1574. Ta strona to kompletne, oparte na źródłach zestawienie: wszystkie 25 oficjalnych benchmarków z karty modelu, co zmieniło się w porównaniu z poprzednikiem Qwen3.6-27B, co zmierzył niezależny test przepustowości AMD, wyniki z benchmarków prawniczych i webdev-arena, oraz które twierdzenia należy nadal traktować jako wstępne.
Przewodnik czytelniczy przed liczbami: „oficjalna” oznacza tutaj ocenę Alibaby podaną na karcie modelu w Qwen/Qwen3.8-27B. Jest to wynik raportowany przez dostawcę i niezweryfikowany niezależnie. „Niezależna” oznacza, że zmierzył ją ktoś spoza laboratorium — jak dotąd obejmuje to test przepustowości sprzętu, badanie agenta w domenie prawnej oraz miejsca na dwóch platformach rankingowych tworzenia stron internetowych od Arena.ai: Code Arena's WebDev i Image-to-WebDev arena. Benchmarki, w których istotne jest środowisko testowe (harness), są oznaczone w tekście.
Model, jedna linia na specyfikację
27B gęstych parametrów (28B wliczając enkoder wizyjny), 64 warstwy, ukryty rozmiar 5120.
Hybrydowa uwaga — 48 warstw liniowej uwagi Gated DeltaNet plus 16 warstw pełnej uwagi, w proporcji 3:1 — to właśnie dzięki niej uruchomienie okna obejmującego 262 tys. tokenów jest przystępne.
• Natywny kontekst 262 144 tokenów, rozszerzalny do 1 000 000 dzięki skalowaniu YaRN.
• Natywne wejście obrazu i wideo (wyjście tekstowe), wagi na licencji Apache 2.0, około 55,6 GB w BF16.
Krótka wersja: to model, który ma wziąć to, czego Alibaba nauczyła się, budując Qwen3.8-Max o 2,4 biliona parametrów, i skompresować to do czegoś, co może uruchomić pojedyncze GPU.
Karta wyników: każdy benchmark na karcie modelu
Wszystkie poniższe wyniki są raportowane przez Alibabę z karty modelu z 14 sierpnia, z wynikiem Qwen3.6-27B, który model zastępuje, w nawiasach.
Kodowanie. Terminal-Bench 2.1 (agentowe kodowanie w terminalu) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Testy SWE-bench Pro i QwenSWEBench zostały przeprowadzone z użyciem harnessu Claude Code, zgodnie z przypisem w karcie modelu — warto o tym pamiętać przed porównaniem ich z modelem ocenianym na innym harnessie.
Agenci długiego horyzontu i praca biurowa. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / wynik 42.9 (10.6 / 27.3).
Rozumowanie i wiedza. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). HLE jest oceniane przez GPT-4o, zgodnie z kartą modelu.
Wizja i obsługa komputera. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 z CI / 90.0 bez (85.1); BabyVision 85.6 z CI / 65.7 bez (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). „CI” to usprawnienie czasu wnioskowania firmy Alibaba; różnica między jego stanem włączonym i wyłączonym to najbardziej informacyjna pojedyncza liczba na karcie, mówiąca o tym, ile punktów można „dokupić” za dodatkową moc obliczeniową wnioskowania.

Co właściwie się zmieniło w porównaniu z Qwen3.6-27B?
Każdy benchmark na karcie wzrósł, ale różnice nie są jednolite — a sednem jest kształt tej poprawy. Zyski skupiają się w kodowaniu agentowym i korzystaniu z komputera, a nie w odzyskiwaniu wiedzy:
• DeepSWE 1.1 (kodowanie agentowe) 13.3 → 42.2, czyli mniej więcej 3-krotny skok
• QwenSWEBench 49.3 → 79.0
• Wynik agentów na ostatnim egzaminie: 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 i AndroidWorld 70.3 → 81.9
• BabyVision (z CI) 28.9 → 85.6 — największy względny wzrost na karcie
Tymczasem GPQA Diamond wzrosło z 87,8 do 89,2, a RealWorldQA z 84,1 do 85,9: realny, ale niewielki wzrost. To nie jest wydanie „mądrzejsze we wszystkim”. To wydanie skierowane wprost do agentów, którzy czytają ekrany, korzystają z narzędzi i piszą kod w wielu krokach.

Pierwszy niezależny wynik: #1 open-weight w benchmarku Legal Agent firmy Harvey.
Od czasu opublikowania tej strony najważniejszym wydarzeniem jest kwestia prawna, a nie techniczna. Alibaba ogłosiło, że Qwen3.8-27B jest modelem open-weight #1 na benchmarku Harvey's Legal Agent — to twierdzenie pochodzi od samego dostawcy, więc należy traktować je jako oświadczenie Alibaba. Badanie, które za tym stoi, nie jest badaniem Alibaba: Harvey, firma zajmująca się AI w prawie, oraz Engram, startup tworzący pamięć dla AI, zbudowali syntetyczną kancelarię prawną Calderwood & Harkness z 100M+ tokenów obejmujących około 10 000 dokumentów i 266 spraw, a następnie zaadaptowali do niej Qwen3.8-27B, wykorzystując pamięć parametryczną, skompresowane notatki i narzędzie do wyszukiwania.
Na 250 zadaniach prawnych dostosowany 27B osiągał średnio 67%, wyprzedzając wszystkie modele testowane w badaniu — w tym Claude Opus 4.8 — a w ścisłej ocenie typu wszystko-albo-nic pokonał Opusa 4.8 stosunkiem 30% do 25%, przy koszcie około 0,13 USD za zapytanie w porównaniu z 1,32 USD dla Opusa 4.8. Te dane pochodzą z raportów Harvey/Engram i nie zostały jeszcze niezależnie zweryfikowane. Przed treningiem na dokumentach firmy ten sam model uzyskiwał zaledwie 4,7% na pytaniach specyficznych dla firmy; po ich przestudiowaniu — 72,6%.
Przeczytaj #1 z jednym dużym zastrzeżeniem: model, który zwyciężył w benchmarku, wcześniej przestudiował korpus testowy — został dostosowany na 100 milionach tokenów firmy, zanim go oceniono. To czyni z tego demonstrację tego, co 27B może przyswoić dzięki dostrojeniu do konkretnej dziedziny, a nie wynik dla standardowych wag Apache-2.0 na neutralnym środowisku testowym — i obejmuje jedną dziedzinę, prawo, a nie ogólną jakość. To, co potwierdza, to teza stojąca za tweetem: 27B na tyle mały, by działać na lokalnej maszynie, jest wystarczająco mocny do pracy na poziomie profesjonalnym, gdy ma odpowiednią wiedzę.
Drugi niezależny wynik: #9 w klasyfikacji ogólnej na WebDev Code Areny.
Drugi niezależny wynik dotyczy kodowania i to właśnie z jego powodu ta strona zmieniła się 25 sierpnia. Code Arena to tablica liderów tworzenia aplikacji webowych należąca do Arena.ai — projekt znany wcześniej jako WebDev Arena, na stronie znanej wcześniej jako LMArena — gdzie użytkownicy budują prawdziwe aplikacje z anonimizowanymi parami modeli i głosują, który wynik woleliby wdrożyć. Na tej publicznej tablicy liderów Qwen3.8-27B zajmuje 9. miejsce w rankingu ogólnym z wynikiem 1595, jako jedyny model w swojej klasie rozmiarów w pierwszej dziesiątce.
Pozycja jest częścią niezależną — pochodzi z zewnętrznego rankingu, który każdy może otworzyć. Narracja wokół niej jest autorstwa Alibaba: ujęcie „jedyny mały model w pierwszej dziesiątce” oraz towarzyszące jej pozycje pochodzą z ogłoszenia Qwena z 25 sierpnia. Warto powtarzać je z taką etykietą. Model 27B plasuje się sześć miejsc poniżej znacznie większego modelu Qwen3.8-Max (który w ogłoszeniu jest na pozycji #3 w klasyfikacji ogólnej) i wyraźnie przed podobnie dużym modelem Gemma 4-31B (który w tym samym ogłoszeniu jest na pozycji #80). Nie chodzi o to, że model 27B pokonuje czołówkę w tworzeniu aplikacji webowych; chodzi o to, że model na tyle mały, by działać na jednym GPU, znajduje się w pierwszej dziesiątce ślepej areny kodowania, której pozostali uczestnicy to znacznie większe modele.
Trzeci niezależny wynik: #1 otwarty model na liście Image-to-WebDev serwisu Arena.ai.
Trzeci niezależny wynik pojawił się 26 sierpnia i jest jak dotąd najlepszy dla modelu tej wielkości. Image-to-WebDev to siostrzana tablica wyników WebDev z Code Arena na Arena.ai — arena, na której model otrzymuje zrzut ekranu lub inne odniesienie wizualne i musi zamienić je w działający interfejs internetowy, a ludzcy głosujący na ślepo wybierają wynik, który woleliby wdrożyć. Na tym publicznym rankingu Qwen3.8-27B zajmuje #1 wśród otwartych modeli i #7 w klasyfikacji ogólnej, z deklarowanym wynikiem areny 1 574.
Umiejscowienie jest częścią niezależną — znajduje się na zewnętrznym rankingu, który każdy może otworzyć. Nagłówek wokół niego pochodzi od Alibaby: ogłoszenie zespołu Qwen z 26 sierpnia określa 27B jako „dorównujący modelom 100 razy większym" w tym teście, a porównania tego ranking nie dokumentuje. A ranking preferencji nie jest wyrokiem o jakości kodu — głosy Image-to-WebDev mierzą, który wynik człowiek wolałby wdrożyć, a nie to, czy HTML jest bezpieczny, dostępny czy łatwy w utrzymaniu. To, co wynik ustala, to fakt, że model open-weights 27B prowadzi teraz w całym swoim otwartym polu w zamianie obrazu na stronę, co jest umiejętnością, na której opiera się rosnąca kategoria produktów „screenshot to site".
Uczciwe luki: gdzie wciąż przegrywa, oraz zastrzeżenia metodologiczne.
Na tle czołówki obraz jest pochlebny, ale nie jednostronny. Tam, gdzie Qwen3.8-27B i Claude Opus 4.6 Max mają wspólne wyniki, Qwen wygrywa w większości — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench i cały blok wizyjny. W starciu z Muse Glimmer-30B od Meta, naturalnym rywalem w klasie lokalnej, wygrywa wszystkie osiem wspólnych benchmarków bezdyskusyjnie. Ale wciąż przegrywa z Claude Opus 4.6 Max w Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) i NL2Repo-Bench (42.3 vs 47.6). Jeśli twoje obciążenie to najtrudniejsze zadania na granicy możliwości — matematyka na froncie, pytania szeroko interdyscyplinarne — to 27B jeszcze tam nie dociera.
Trzy zastrzeżenia, zanim zacytujesz cokolwiek z tego. Po pierwsze, tabela na karcie modelu powyżej jest wciąż w całości raportowana przez Alibaba — nie ma jeszcze wskaźnika Artificial Analysis dla wersji 27B. Ma już trzy niezależne wyniki od stron trzecich, ale każdy z nich jest wąski: ranking Code Arena mierzy budowanie aplikacji webowych na podstawie podpowiedzi tekstowych, ranking Image-to-WebDev mierzy przekształcanie zrzutu ekranu w działającą stronę, oba oceniane przez ślepe głosowanie na zanonimizowanych wynikach, a badanie Harvey dotyczące agenta prawnego obejmuje pojedynczą dziedzinę z modelem trenowanym pod ten test. Żaden z nich nie jest uruchomieniem oryginalnych wag na uniwersalnym harnessie. Po drugie, karta modelu wykorzystuje harness Claude Code dla SWE-bench Pro i QwenSWEBench oraz sędziego GPT-4o dla Humanity's Last Exam — porównania z modelami ocenianymi na innych konfiguracjach zmienią liczby. Po trzecie, w teście MathVision od Alibaba użyto stałego promptu, podczas gdy konkurencja otrzymała wyższą z dwóch wariantów. Nic z tego nie oznacza, że wyniki są błędne; oznacza to, że są one sufitem, a nie podłogą, dopóki niezależne laboratoria nie uruchomią modelu na neutralnych, ogólnego przeznaczenia harnessach.
Co jest potrzebne, aby to uruchomić
Qwen3.8-27B to model lokalny, co zmienia znaczenie słowa „wydajność”: przepustowość na własnym sprzęcie zamiast cennika. Wagi BF16 mają około 55,6 GB; po kwantyzacji do 4 bitów mieszczą się na karcie z 24 GB pamięci, takiej jak RTX 3090 lub 4090. AMD zapewniło wsparcie Day-0 w dniu premiery, a jego własne pomiary llama.cpp/Vulkan — sierpień 2026, średnia z trzech lub więcej przebiegów — wskazują na 24,5 tokena/s na układzie Ryzen AI Max+ 395 i 51,8 tokena/s na karcie Radeon AI PRO R9700 z 32 GB, w systemach z ponad około 24 GB zmiennej pamięci graficznej lub VRAM. Testy społeczności wersji FP8 na układzie NVIDIA GH200 utrzymały 10 równoczesnych żądań z kontekstem 262K przy czasie do pierwszego tokena poniżej 10 ms. Twoje własne wyniki będą inne — to cudze GPU — ale ogólny obraz jest prawdziwy: to pierwsze wydanie Qwen w tej klasie, które działa na pojedynczej stacji roboczej, nie tylko w recenzji.
Darmowe ciężary, czy płatne API?
Decyzja, którą wymusza ten model, to ta, która dzieli rozwiązania lokalne od hostowanych: wagi nic nie kosztują, ale Twoje GPU nie są darmowe. Self-hosting oznacza posiadanie własnego krzemu — jednej karty 24GB, jeśli akceptujesz kwantyzację 4-bitową i wolniejsze generowanie, czegoś większego, jeśli chcesz pełny kontekst 262K w pełnej jakości. Hostowana alternatywa na OrcaRouter kosztuje $0.33 za milion tokenów wejściowych i $2.40 za milion tokenów wyjściowych, z tym samym kontekstem 262K i wejściem w postaci obrazu i wideo oraz czasem p50 do pierwszego tokena wynoszącym 225ms, zmierzonym w ciągu ostatnich siedmiu dni — bez kupowania GPU, bez pilnowania VRAM. Arytmetyka jest taka, jaką zawsze wykonujesz z otwartymi wagami: przepustowość tokenów, której faktycznie potrzebujesz, razy Twój koszt za token, w porównaniu ze stałą ceną karty. Przy dużym, ciągłym wolumenie self-hosting wygrywa; przy zmiennym lub umiarkowanym wolumenie płacenie $0.33/$2.40 bije kupowanie krzemu, który w większości stoi bezczynnie.

Konkluzja
Qwen3.8-27B to najmocniejszy model o otwartych wagach, jaki Alibaba wypuściła w tej klasie rozmiarów, według danych samej Alibaby: najlepszy w swojej tabeli w kodowaniu agentowym, obsłudze komputera i rozumowaniu wizyjnym, z oknem kontekstowym o długości 262K i wagami na licencji Apache 2.0. Właściwe odczytanie tej karty wyników jest warunkowe — każda liczba w karcie modelu pochodzi od producenta, jest zależna od konkretnego środowiska testowego i jak dotąd nie została niezależnie zweryfikowana, a modele z czołówki wciąż wygrywają najtrudniejsze benchmarki rozumowania. Jeśli zastanawiasz się, czy wdrożyć go u siebie, czy korzystać z niego przez API, potraktuj tabelę benchmarków jako obietnicę, dane o przepustowości AMD jako pierwszy niezależny pomiar sprzętowy, wynik agenta prawnego Harvey jako pierwszy niezależny sygnał, że możliwości modelu działają także poza środowiskami testowymi Alibaby, a dwie pozycje w rankingu webdev — #9 w klasyfikacji ogólnej WebDev na Code Arena i #1 model o otwartych wagach w Image-to-WebDev na Arena.ai — jako pierwsze niezależne potwierdzenie tych możliwości w rankingach kodowania. Będziemy aktualizować tę stronę w miarę publikowania wyników przez kolejne niezależne laboratoria.
