Karta tytułowa podsumowania testów porównawczych Qwen3.8-27B, przedstawiająca kartę raportu z testów z pieczęcią z napisem OPEN WEIGHTS oraz ikonami kodowania, przepustowości, wizji, długiego kontekstu i lokalnego sprzętu, z plakietkami z napisami 27B DENSE, 262K CONTEXT i APACHE 2.0.
Guides & Insights

Qwen3.8-27B Benchmarki: Pełna tabela z zastrzeżeniami

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen/Qwen3.8-27B osiąga w Terminal-Bench 2.1 wynik 73,0, w SWE-bench Pro 61,7, w LiveCodeBench v6 90,3, a w OSWorld-Verified 84,3 — a każda z tych liczb pochodzi od samego Alibaba. Model o otwartych wagach liczący 27 miliardów parametrów trafił na Hugging Face 14 sierpnia 2026 roku na licencji Apache 2.0, a w ciągu pierwszych dwóch tygodni zdobył trzy niezależne wyniki od zewnętrznych podmiotów: pierwsze miejsce w kategorii modeli o otwartych wagach w benchmarku Harvey's Legal Agent, w badaniu przeprowadzonym przez firmę Harvey zajmującą się AI dla prawników oraz firmę pamięciową Engram; 9. miejsce w ogólnym rankingu na liście liderów WebDev serwisu Code Arena, jako jedyny model w swojej klasie rozmiarowej w pierwszej dziesiątce, zgodnie z ogłoszeniem Alibaba z 25 sierpnia; a także, ogłoszone 26 sierpnia, pierwsze miejsce w kategorii modeli o otwartych wagach na liście liderów Image-to-WebDev serwisu Arena.ai, z 7. miejscem w rankingu ogólnym i zgłoszonym wynikiem 1574. Ta strona to kompletne, oparte na źródłach zestawienie: wszystkie 25 oficjalnych benchmarków z karty modelu, co zmieniło się w porównaniu z poprzednikiem Qwen3.6-27B, co zmierzył niezależny test przepustowości AMD, wyniki z benchmarków prawniczych i webdev-arena, oraz które twierdzenia należy nadal traktować jako wstępne.

Przewodnik czytelniczy przed liczbami: „oficjalna” oznacza tutaj ocenę Alibaby podaną na karcie modelu w Qwen/Qwen3.8-27B. Jest to wynik raportowany przez dostawcę i niezweryfikowany niezależnie. „Niezależna” oznacza, że zmierzył ją ktoś spoza laboratorium — jak dotąd obejmuje to test przepustowości sprzętu, badanie agenta w domenie prawnej oraz miejsca na dwóch platformach rankingowych tworzenia stron internetowych od Arena.ai: Code Arena's WebDev i Image-to-WebDev arena. Benchmarki, w których istotne jest środowisko testowe (harness), są oznaczone w tekście.

Model, jedna linia na specyfikację

27B gęstych parametrów (28B wliczając enkoder wizyjny), 64 warstwy, ukryty rozmiar 5120.

Hybrydowa uwaga — 48 warstw liniowej uwagi Gated DeltaNet plus 16 warstw pełnej uwagi, w proporcji 3:1 — to właśnie dzięki niej uruchomienie okna obejmującego 262 tys. tokenów jest przystępne.

• Natywny kontekst 262 144 tokenów, rozszerzalny do 1 000 000 dzięki skalowaniu YaRN.

• Natywne wejście obrazu i wideo (wyjście tekstowe), wagi na licencji Apache 2.0, około 55,6 GB w BF16.

Krótka wersja: to model, który ma wziąć to, czego Alibaba nauczyła się, budując Qwen3.8-Max o 2,4 biliona parametrów, i skompresować to do czegoś, co może uruchomić pojedyncze GPU.

Karta wyników: każdy benchmark na karcie modelu

Wszystkie poniższe wyniki są raportowane przez Alibabę z karty modelu z 14 sierpnia, z wynikiem Qwen3.6-27B, który model zastępuje, w nawiasach.

Kodowanie. Terminal-Bench 2.1 (agentowe kodowanie w terminalu) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Testy SWE-bench Pro i QwenSWEBench zostały przeprowadzone z użyciem harnessu Claude Code, zgodnie z przypisem w karcie modelu — warto o tym pamiętać przed porównaniem ich z modelem ocenianym na innym harnessie.

Agenci długiego horyzontu i praca biurowa. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / wynik 42.9 (10.6 / 27.3).

Rozumowanie i wiedza. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). HLE jest oceniane przez GPT-4o, zgodnie z kartą modelu.

Wizja i obsługa komputera. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 z CI / 90.0 bez (85.1); BabyVision 85.6 z CI / 65.7 bez (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). „CI” to usprawnienie czasu wnioskowania firmy Alibaba; różnica między jego stanem włączonym i wyłączonym to najbardziej informacyjna pojedyncza liczba na karcie, mówiąca o tym, ile punktów można „dokupić” za dodatkową moc obliczeniową wnioskowania.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Co właściwie się zmieniło w porównaniu z Qwen3.6-27B?

Każdy benchmark na karcie wzrósł, ale różnice nie są jednolite — a sednem jest kształt tej poprawy. Zyski skupiają się w kodowaniu agentowym i korzystaniu z komputera, a nie w odzyskiwaniu wiedzy:

• DeepSWE 1.1 (kodowanie agentowe) 13.3 → 42.2, czyli mniej więcej 3-krotny skok

• QwenSWEBench 49.3 → 79.0

• Wynik agentów na ostatnim egzaminie: 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 i AndroidWorld 70.3 → 81.9

• BabyVision (z CI) 28.9 → 85.6 — największy względny wzrost na karcie

Tymczasem GPQA Diamond wzrosło z 87,8 do 89,2, a RealWorldQA z 84,1 do 85,9: realny, ale niewielki wzrost. To nie jest wydanie „mądrzejsze we wszystkim”. To wydanie skierowane wprost do agentów, którzy czytają ekrany, korzystają z narzędzi i piszą kod w wielu krokach.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Od czasu opublikowania tej strony najważniejszym wydarzeniem jest kwestia prawna, a nie techniczna. Alibaba ogłosiło, że Qw​en3.8-27B jest modelem open-weight #1 na benchmarku Harvey's Legal Agent — to twierdzenie pochodzi od samego dostawcy, więc należy traktować je jako oświadczenie Alibaba. Badanie, które za tym stoi, nie jest badaniem Alibaba: Harvey, firma zajmująca się AI w prawie, oraz Engram, startup tworzący pamięć dla AI, zbudowali syntetyczną kancelarię prawną Calderwood & Harkness z 100M+ tokenów obejmujących około 10 000 dokumentów i 266 spraw, a następnie zaadaptowali do niej Qw​en3.8-27B, wykorzystując pamięć parametryczną, skompresowane notatki i narzędzie do wyszukiwania.

Na 250 zadaniach prawnych dostosowany 27B osiągał średnio 67%, wyprzedzając wszystkie modele testowane w badaniu — w tym Claude Opus 4.8 — a w ścisłej ocenie typu wszystko-albo-nic pokonał Opusa 4.8 stosunkiem 30% do 25%, przy koszcie około 0,13 USD za zapytanie w porównaniu z 1,32 USD dla Opusa 4.8. Te dane pochodzą z raportów Harvey/Engram i nie zostały jeszcze niezależnie zweryfikowane. Przed treningiem na dokumentach firmy ten sam model uzyskiwał zaledwie 4,7% na pytaniach specyficznych dla firmy; po ich przestudiowaniu — 72,6%.

Przeczytaj #1 z jednym dużym zastrzeżeniem: model, który zwyciężył w benchmarku, wcześniej przestudiował korpus testowy — został dostosowany na 100 milionach tokenów firmy, zanim go oceniono. To czyni z tego demonstrację tego, co 27B może przyswoić dzięki dostrojeniu do konkretnej dziedziny, a nie wynik dla standardowych wag Apache-2.0 na neutralnym środowisku testowym — i obejmuje jedną dziedzinę, prawo, a nie ogólną jakość. To, co potwierdza, to teza stojąca za tweetem: 27B na tyle mały, by działać na lokalnej maszynie, jest wystarczająco mocny do pracy na poziomie profesjonalnym, gdy ma odpowiednią wiedzę.

Drugi niezależny wynik: #9 w klasyfikacji ogólnej na WebDev Code Areny.

Drugi niezależny wynik dotyczy kodowania i to właśnie z jego powodu ta strona zmieniła się 25 sierpnia. Code Arena to tablica liderów tworzenia aplikacji webowych należąca do Arena.ai — projekt znany wcześniej jako WebDev Arena, na stronie znanej wcześniej jako LMArena — gdzie użytkownicy budują prawdziwe aplikacje z anonimizowanymi parami modeli i głosują, który wynik woleliby wdrożyć. Na tej publicznej tablicy liderów Qw​en3.8-27B zajmuje 9. miejsce w rankingu ogólnym z wynikiem 1595, jako jedyny model w swojej klasie rozmiarów w pierwszej dziesiątce.

Pozycja jest częścią niezależną — pochodzi z zewnętrznego rankingu, który każdy może otworzyć. Narracja wokół niej jest autorstwa Alibaba: ujęcie „jedyny mały model w pierwszej dziesiątce” oraz towarzyszące jej pozycje pochodzą z ogłoszenia Qw​ena z 25 sierpnia. Warto powtarzać je z taką etykietą. Model 27B plasuje się sześć miejsc poniżej znacznie większego modelu Qwen3.8-Max (który w ogłoszeniu jest na pozycji #3 w klasyfikacji ogólnej) i wyraźnie przed podobnie dużym modelem Gemma 4-31B (który w tym samym ogłoszeniu jest na pozycji #80). Nie chodzi o to, że model 27B pokonuje czołówkę w tworzeniu aplikacji webowych; chodzi o to, że model na tyle mały, by działać na jednym GPU, znajduje się w pierwszej dziesiątce ślepej areny kodowania, której pozostali uczestnicy to znacznie większe modele.

Trzeci niezależny wynik: #1 otwarty model na liście Image-to-WebDev serwisu Arena.ai.

Trzeci niezależny wynik pojawił się 26 sierpnia i jest jak dotąd najlepszy dla modelu tej wielkości. Image-to-WebDev to siostrzana tablica wyników WebDev z Code Arena na Arena.ai — arena, na której model otrzymuje zrzut ekranu lub inne odniesienie wizualne i musi zamienić je w działający interfejs internetowy, a ludzcy głosujący na ślepo wybierają wynik, który woleliby wdrożyć. Na tym publicznym rankingu Qw​en3.8-27B zajmuje #1 wśród otwartych modeli i #7 w klasyfikacji ogólnej, z deklarowanym wynikiem areny 1 574.

Umiejscowienie jest częścią niezależną — znajduje się na zewnętrznym rankingu, który każdy może otworzyć. Nagłówek wokół niego pochodzi od Alibaby: ogłoszenie zespołu Qw​en z 26 sierpnia określa 27B jako „dorównujący modelom 100 razy większym" w tym teście, a porównania tego ranking nie dokumentuje. A ranking preferencji nie jest wyrokiem o jakości kodu — głosy Image-to-WebDev mierzą, który wynik człowiek wolałby wdrożyć, a nie to, czy HTML jest bezpieczny, dostępny czy łatwy w utrzymaniu. To, co wynik ustala, to fakt, że model open-weights 27B prowadzi teraz w całym swoim otwartym polu w zamianie obrazu na stronę, co jest umiejętnością, na której opiera się rosnąca kategoria produktów „screenshot to site".

Uczciwe luki: gdzie wciąż przegrywa, oraz zastrzeżenia metodologiczne.

Na tle czołówki obraz jest pochlebny, ale nie jednostronny. Tam, gdzie Qw​en3.8-27B i Claude Opus 4.6 Max mają wspólne wyniki, Qw​en wygrywa w większości — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench i cały blok wizyjny. W starciu z Muse Glimmer-30B od Meta, naturalnym rywalem w klasie lokalnej, wygrywa wszystkie osiem wspólnych benchmarków bezdyskusyjnie. Ale wciąż przegrywa z Claude Opus 4.6 Max w Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) i NL2Repo-Bench (42.3 vs 47.6). Jeśli twoje obciążenie to najtrudniejsze zadania na granicy możliwości — matematyka na froncie, pytania szeroko interdyscyplinarne — to 27B jeszcze tam nie dociera.

Trzy zastrzeżenia, zanim zacytujesz cokolwiek z tego. Po pierwsze, tabela na karcie modelu powyżej jest wciąż w całości raportowana przez Alibaba — nie ma jeszcze wskaźnika Artificial Analysis dla wersji 27B. Ma już trzy niezależne wyniki od stron trzecich, ale każdy z nich jest wąski: ranking Code Arena mierzy budowanie aplikacji webowych na podstawie podpowiedzi tekstowych, ranking Image-to-WebDev mierzy przekształcanie zrzutu ekranu w działającą stronę, oba oceniane przez ślepe głosowanie na zanonimizowanych wynikach, a badanie Harvey dotyczące agenta prawnego obejmuje pojedynczą dziedzinę z modelem trenowanym pod ten test. Żaden z nich nie jest uruchomieniem oryginalnych wag na uniwersalnym harnessie. Po drugie, karta modelu wykorzystuje harness Claude Code dla SWE-bench Pro i QwenSWEBench oraz sędziego GPT-4o dla Humanity's Last Exam — porównania z modelami ocenianymi na innych konfiguracjach zmienią liczby. Po trzecie, w teście MathVision od Alibaba użyto stałego promptu, podczas gdy konkurencja otrzymała wyższą z dwóch wariantów. Nic z tego nie oznacza, że wyniki są błędne; oznacza to, że są one sufitem, a nie podłogą, dopóki niezależne laboratoria nie uruchomią modelu na neutralnych, ogólnego przeznaczenia harnessach.

Co jest potrzebne, aby to uruchomić

Qw​en3.8-27B to model lokalny, co zmienia znaczenie słowa „wydajność”: przepustowość na własnym sprzęcie zamiast cennika. Wagi BF16 mają około 55,6 GB; po kwantyzacji do 4 bitów mieszczą się na karcie z 24 GB pamięci, takiej jak RTX 3090 lub 4090. AMD zapewniło wsparcie Day-0 w dniu premiery, a jego własne pomiary llama.cpp/Vulkan — sierpień 2026, średnia z trzech lub więcej przebiegów — wskazują na 24,5 tokena/s na układzie Ryzen AI Max+ 395 i 51,8 tokena/s na karcie Radeon AI PRO R9700 z 32 GB, w systemach z ponad około 24 GB zmiennej pamięci graficznej lub VRAM. Testy społeczności wersji FP8 na układzie NVIDIA GH200 utrzymały 10 równoczesnych żądań z kontekstem 262K przy czasie do pierwszego tokena poniżej 10 ms. Twoje własne wyniki będą inne — to cudze GPU — ale ogólny obraz jest prawdziwy: to pierwsze wydanie Qw​en w tej klasie, które działa na pojedynczej stacji roboczej, nie tylko w recenzji.

Darmowe ciężary, czy płatne API?

Decyzja, którą wymusza ten model, to ta, która dzieli rozwiązania lokalne od hostowanych: wagi nic nie kosztują, ale Twoje GPU nie są darmowe. Self-hosting oznacza posiadanie własnego krzemu — jednej karty 24GB, jeśli akceptujesz kwantyzację 4-bitową i wolniejsze generowanie, czegoś większego, jeśli chcesz pełny kontekst 262K w pełnej jakości. Hostowana alternatywa na OrcaRouter kosztuje $0.33 za milion tokenów wejściowych i $2.40 za milion tokenów wyjściowych, z tym samym kontekstem 262K i wejściem w postaci obrazu i wideo oraz czasem p50 do pierwszego tokena wynoszącym 225ms, zmierzonym w ciągu ostatnich siedmiu dni — bez kupowania GPU, bez pilnowania VRAM. Arytmetyka jest taka, jaką zawsze wykonujesz z otwartymi wagami: przepustowość tokenów, której faktycznie potrzebujesz, razy Twój koszt za token, w porównaniu ze stałą ceną karty. Przy dużym, ciągłym wolumenie self-hosting wygrywa; przy zmiennym lub umiarkowanym wolumenie płacenie $0.33/$2.40 bije kupowanie krzemu, który w większości stoi bezczynnie.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Konkluzja

Qw​en3.8-27B to najmocniejszy model o otwartych wagach, jaki Alibaba wypuściła w tej klasie rozmiarów, według danych samej Alibaby: najlepszy w swojej tabeli w kodowaniu agentowym, obsłudze komputera i rozumowaniu wizyjnym, z oknem kontekstowym o długości 262K i wagami na licencji Apache 2.0. Właściwe odczytanie tej karty wyników jest warunkowe — każda liczba w karcie modelu pochodzi od producenta, jest zależna od konkretnego środowiska testowego i jak dotąd nie została niezależnie zweryfikowana, a modele z czołówki wciąż wygrywają najtrudniejsze benchmarki rozumowania. Jeśli zastanawiasz się, czy wdrożyć go u siebie, czy korzystać z niego przez API, potraktuj tabelę benchmarków jako obietnicę, dane o przepustowości AMD jako pierwszy niezależny pomiar sprzętowy, wynik agenta prawnego Harvey jako pierwszy niezależny sygnał, że możliwości modelu działają także poza środowiskami testowymi Alibaby, a dwie pozycje w rankingu webdev — #9 w klasyfikacji ogólnej WebDev na Code Arena i #1 model o otwartych wagach w Image-to-WebDev na Arena.ai — jako pierwsze niezależne potwierdzenie tych możliwości w rankingach kodowania. Będziemy aktualizować tę stronę w miarę publikowania wyników przez kolejne niezależne laboratoria.