
Qwen3.8-27B Benchmarki: Pełna tabela z zastrzeżeniami
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
Qwen3.8-27B uzyskuje 73,0 w Terminal-Bench 2.1, 61,7 w SWE-bench Pro, 90,3 w LiveCodeBench v6 i 84,3 w OSWorld-Verified — i każda z tych liczb pochodzi od samego Alibaby. Model o otwartych wagach i 27 miliardach parametrów trafił na Hugging Face 14 sierpnia 2026 r. na licencji Apache 2.0, a od 15 sierpnia nikt poza Alibabą nie ocenił niezależnie jego jakości. Ta strona to kompletne, oparte na źródłach zestawienie: wszystkie 25 oficjalnych benchmarków z karty modelu, co zmieniło się w porównaniu z poprzednikiem Qwen3.6-27B, co zmierzył niezależny test przepustowości AMD oraz które twierdzenia należy traktować jako wstępne.
Zanim przejdziemy do liczb, krótki przewodnik: „oficjalny” oznacza tutaj ocenę firmy Alibaba zamieszczoną na karcie modelu pod adresem Qwen/Qwen3.8-27B. Jest to wynik deklarowany przez producenta, którego nikt niezależnie nie powtórzył. „Niezależny” oznacza, że zmierzył go ktoś spoza laboratorium — jak dotąd dotyczy to wyłącznie przepustowości sprzętu, nie zaś wyników jakości. Benchmarki, w których istotny jest harness, zostały oznaczone w tekście.
Model, jedna linia na specyfikację
27B gęstych parametrów (28B wliczając enkoder wizyjny), 64 warstwy, ukryty rozmiar 5120.
Hybrydowa uwaga — 48 warstw liniowej uwagi Gated DeltaNet plus 16 warstw pełnej uwagi, w proporcji 3:1 — to właśnie dzięki niej uruchomienie okna obejmującego 262 tys. tokenów jest przystępne.
• Natywny kontekst 262 144 tokenów, rozszerzalny do 1 000 000 dzięki skalowaniu YaRN.
• Natywne wejście obrazu i wideo (wyjście tekstowe), wagi na licencji Apache 2.0, około 55,6 GB w BF16.
Krótka wersja: to model, który ma wziąć to, czego Alibaba nauczyła się, budując Qwen3.8-Max o 2,4 biliona parametrów, i skompresować to do czegoś, co może uruchomić pojedyncze GPU.
Karta wyników: każdy benchmark na karcie modelu
Wszystkie poniższe wyniki są raportowane przez Alibabę z karty modelu z 14 sierpnia, z wynikiem Qwen3.6-27B, który model zastępuje, w nawiasach.
Kodowanie. Terminal-Bench 2.1 (agentowe kodowanie w terminalu) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Testy SWE-bench Pro i QwenSWEBench zostały przeprowadzone z użyciem harnessu Claude Code, zgodnie z przypisem w karcie modelu — warto o tym pamiętać przed porównaniem ich z modelem ocenianym na innym harnessie.
Agenci długiego horyzontu i praca biurowa. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / wynik 42.9 (10.6 / 27.3).
Rozumowanie i wiedza. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). HLE jest oceniane przez GPT-4o, zgodnie z kartą modelu.
Wizja i obsługa komputera. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 z CI / 90.0 bez (85.1); BabyVision 85.6 z CI / 65.7 bez (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). „CI” to usprawnienie czasu wnioskowania firmy Alibaba; różnica między jego stanem włączonym i wyłączonym to najbardziej informacyjna pojedyncza liczba na karcie, mówiąca o tym, ile punktów można „dokupić” za dodatkową moc obliczeniową wnioskowania.

Co właściwie się zmieniło w porównaniu z Qwen3.6-27B?
Każdy benchmark na karcie wzrósł, ale różnice nie są jednolite — a sednem jest kształt tej poprawy. Zyski skupiają się w kodowaniu agentowym i korzystaniu z komputera, a nie w odzyskiwaniu wiedzy:
• DeepSWE 1.1 (kodowanie agentowe) 13.3 → 42.2, czyli mniej więcej 3-krotny skok
• QwenSWEBench 49.3 → 79.0
• Wynik agentów na ostatnim egzaminie: 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 i AndroidWorld 70.3 → 81.9
• BabyVision (z CI) 28.9 → 85.6 — największy względny wzrost na karcie
Tymczasem GPQA Diamond wzrosło z 87,8 do 89,2, a RealWorldQA z 84,1 do 85,9: realny, ale niewielki wzrost. To nie jest wydanie „mądrzejsze we wszystkim”. To wydanie skierowane wprost do agentów, którzy czytają ekrany, korzystają z narzędzi i piszą kod w wielu krokach.

Uczciwe luki: gdzie wciąż przegrywa, oraz zastrzeżenia metodologiczne.
W porównaniu z czołówką obraz jest pochlebny, ale nie jednostronny. Tam, gdzie Qwen3.8-27B i Claude Opus 4.6 Max się pokrywają, Qwen wygrywa większość — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench oraz cały blok wizyjny. W starciu z Muse Glimmer-30B od Meta, naturalnym lokalnym rywalem, wygrywa bezdyskusyjnie we wszystkich ośmiu wspólnych benchmarkach. Wciąż jednak przegrywa z Claude Opus 4.6 Max w Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) oraz NL2Repo-Bench (42.3 vs 47.6). Jeśli Twoje zadania to najtrudniejsze rozumowanie graniczne — matematyka graniczna, masowo interdyscyplinarne pytania — model 27B jeszcze tam nie dotarł.
Trzy zastrzeżenia, zanim cokolwiek z tego zacytujesz. Po pierwsze, nic z tego nie zostało niezależnie zweryfikowane; nie ma indeksu Artificial Analysis ani uruchomienia LMArena dla modelu 27B na dzień 15 sierpnia, a własne środowiska testowe Alibaby nie są tymi, których użyją strony trzecie. Po drugie, karta modelu używa środowiska testowego Claude Code do SWE-bench Pro i QwenSWEBench oraz sędziego GPT-4o do Humanity's Last Exam — porównania z modelami ocenianymi w innych konfiguracjach zmienią te liczby. Po trzecie, uruchomienie MathVision przez Alibabę używało stałego promptu, podczas gdy konkurenci otrzymali wyższy z dwóch wariantów. Nic z tego nie oznacza, że wyniki są błędne; oznacza to, że są one sufitem, a nie podłogą, dopóki ktoś inny nie uruchomi tego modelu.
Co jest potrzebne, aby to uruchomić
Qwen3.8-27B to model lokalny, co zmienia znaczenie pojęcia „wydajność”: liczy się przepustowość na własnym sprzęcie, a nie cennik. Wagi BF16 zajmują około 55,6 GB; po kwantyzacji do 4 bitów model mieści się na karcie z 24 GB pamiści, takiej jak RTX 3090 lub 4090. AMD dostarczyło wsparcie Day-0 w dniu premiery, a jego własne pomiary w llama.cpp/Vulkan — sierpień 2026, średnia z trzech lub więcej przebiegów — dają 24,5 tokenów/s na Ryzen AI Max+ 395 i 51,8 tokenów/s na Radeon AI PRO R9700 z 32 GB, w systemach z więcej niż około 24 GB zmiennej pamięci graficznej lub VRAM. Testy społeczności dla wersji FP8 na NVIDIA GH200 utrzymały 10 równoczesnych żądań z kontekstem 262K z czasem do pierwszego tokenu poniżej 10 ms. Twoje wyniki będą inne — to cudze GPU — ale ogólny obraz jest prawdziwy: to pierwsze wydanie Qwen w tej klasie, które działa, nie tylko w recenzji, na pojedynczej stacji roboczej.
Darmowe ciężary, czy płatne API?
Decyzja, którą wymusza ten model, to ta, która dzieli rozwiązania lokalne od hostowanych: wagi nic nie kosztują, ale Twoje GPU nie są darmowe. Self-hosting oznacza posiadanie własnego krzemu — jednej karty 24GB, jeśli akceptujesz kwantyzację 4-bitową i wolniejsze generowanie, czegoś większego, jeśli chcesz pełny kontekst 262K w pełnej jakości. Hostowana alternatywa na OrcaRouter kosztuje $0.33 za milion tokenów wejściowych i $2.40 za milion tokenów wyjściowych, z tym samym kontekstem 262K i wejściem w postaci obrazu i wideo oraz czasem p50 do pierwszego tokena wynoszącym 225ms, zmierzonym w ciągu ostatnich siedmiu dni — bez kupowania GPU, bez pilnowania VRAM. Arytmetyka jest taka, jaką zawsze wykonujesz z otwartymi wagami: przepustowość tokenów, której faktycznie potrzebujesz, razy Twój koszt za token, w porównaniu ze stałą ceną karty. Przy dużym, ciągłym wolumenie self-hosting wygrywa; przy zmiennym lub umiarkowanym wolumenie płacenie $0.33/$2.40 bije kupowanie krzemu, który w większości stoi bezczynnie.

Sedno sprawy
Qwen3.8-27B to najmocniejszy model o otwartych wagach, jaki Alibaba wypuściła w tej klasie rozmiarów, według własnych danych AliBaba: najlepszy w tabeli w kodowaniu agentowym, obsłudze komputera i rozumowaniu wizyjnym, z oknem kontekstowym 262K i wagami Apache 2.0. Właściwa interpretacja tabeli wyników jest warunkowa — każda liczba pochodzi od dostawcy, dotyczy konkretnego środowiska testowego i nie została dotąd niezależnie potwierdzona, a czołowe modele wciąż wygrywają najtrudniejsze benchmarki rozumowania. Jeśli zastanawiasz się, czy hostować go samodzielnie, czy wywoływać przez API, potraktuj tabelę benchmarków jako obietnicę, a dane dotyczące przepustowości AMD jako jedyny niezależny pomiar, jaki obecnie istnieje. Zaktualizujemy tę stronę w dniu, w którym niezależne laboratorium opublikuje wynik.
