Karta tytułowa podsumowania testów porównawczych Qwen3.8-27B, przedstawiająca kartę raportu z testów z pieczęcią z napisem OPEN WEIGHTS oraz ikonami kodowania, przepustowości, wizji, długiego kontekstu i lokalnego sprzętu, z plakietkami z napisami 27B DENSE, 262K CONTEXT i APACHE 2.0.
Guides & Insights

Qwen3.8-27B Benchmarki: Pełna tabela z zastrzeżeniami

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen3.8-27B uzyskuje 73,0 w Terminal-Bench 2.1, 61,7 w SWE-bench Pro, 90,3 w LiveCodeBench v6 i 84,3 w OSWorld-Verified — i każda z tych liczb pochodzi od samego Alibaby. Model o otwartych wagach i 27 miliardach parametrów trafił na Hugging Face 14 sierpnia 2026 r. na licencji Apache 2.0, a od 15 sierpnia nikt poza Alibabą nie ocenił niezależnie jego jakości. Ta strona to kompletne, oparte na źródłach zestawienie: wszystkie 25 oficjalnych benchmarków z karty modelu, co zmieniło się w porównaniu z poprzednikiem Qwen3.6-27B, co zmierzył niezależny test przepustowości AMD oraz które twierdzenia należy traktować jako wstępne.

Zanim przejdziemy do liczb, krótki przewodnik: „oficjalny” oznacza tutaj ocenę firmy Alibaba zamieszczoną na karcie modelu pod adresem Qwen/Qwen3.8-27B. Jest to wynik deklarowany przez producenta, którego nikt niezależnie nie powtórzył. „Niezależny” oznacza, że zmierzył go ktoś spoza laboratorium — jak dotąd dotyczy to wyłącznie przepustowości sprzętu, nie zaś wyników jakości. Benchmarki, w których istotny jest harness, zostały oznaczone w tekście.

Model, jedna linia na specyfikację

27B gęstych parametrów (28B wliczając enkoder wizyjny), 64 warstwy, ukryty rozmiar 5120.

Hybrydowa uwaga — 48 warstw liniowej uwagi Gated DeltaNet plus 16 warstw pełnej uwagi, w proporcji 3:1 — to właśnie dzięki niej uruchomienie okna obejmującego 262 tys. tokenów jest przystępne.

• Natywny kontekst 262 144 tokenów, rozszerzalny do 1 000 000 dzięki skalowaniu YaRN.

• Natywne wejście obrazu i wideo (wyjście tekstowe), wagi na licencji Apache 2.0, około 55,6 GB w BF16.

Krótka wersja: to model, który ma wziąć to, czego Alibaba nauczyła się, budując Qwen3.8-Max o 2,4 biliona parametrów, i skompresować to do czegoś, co może uruchomić pojedyncze GPU.

Karta wyników: każdy benchmark na karcie modelu

Wszystkie poniższe wyniki są raportowane przez Alibabę z karty modelu z 14 sierpnia, z wynikiem Qwen3.6-27B, który model zastępuje, w nawiasach.

Kodowanie. Terminal-Bench 2.1 (agentowe kodowanie w terminalu) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Testy SWE-bench Pro i QwenSWEBench zostały przeprowadzone z użyciem harnessu Claude Code, zgodnie z przypisem w karcie modelu — warto o tym pamiętać przed porównaniem ich z modelem ocenianym na innym harnessie.

Agenci długiego horyzontu i praca biurowa. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / wynik 42.9 (10.6 / 27.3).

Rozumowanie i wiedza. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). HLE jest oceniane przez GPT-4o, zgodnie z kartą modelu.

Wizja i obsługa komputera. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 z CI / 90.0 bez (85.1); BabyVision 85.6 z CI / 65.7 bez (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). „CI” to usprawnienie czasu wnioskowania firmy Alibaba; różnica między jego stanem włączonym i wyłączonym to najbardziej informacyjna pojedyncza liczba na karcie, mówiąca o tym, ile punktów można „dokupić” za dodatkową moc obliczeniową wnioskowania.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Co właściwie się zmieniło w porównaniu z Qwen3.6-27B?

Każdy benchmark na karcie wzrósł, ale różnice nie są jednolite — a sednem jest kształt tej poprawy. Zyski skupiają się w kodowaniu agentowym i korzystaniu z komputera, a nie w odzyskiwaniu wiedzy:

• DeepSWE 1.1 (kodowanie agentowe) 13.3 → 42.2, czyli mniej więcej 3-krotny skok

• QwenSWEBench 49.3 → 79.0

• Wynik agentów na ostatnim egzaminie: 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 i AndroidWorld 70.3 → 81.9

• BabyVision (z CI) 28.9 → 85.6 — największy względny wzrost na karcie

Tymczasem GPQA Diamond wzrosło z 87,8 do 89,2, a RealWorldQA z 84,1 do 85,9: realny, ale niewielki wzrost. To nie jest wydanie „mądrzejsze we wszystkim”. To wydanie skierowane wprost do agentów, którzy czytają ekrany, korzystają z narzędzi i piszą kod w wielu krokach.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Uczciwe luki: gdzie wciąż przegrywa, oraz zastrzeżenia metodologiczne.

W porównaniu z czołówką obraz jest pochlebny, ale nie jednostronny. Tam, gdzie Qwen3.8-27B i Claude Opus 4.6 Max się pokrywają, Qwen wygrywa większość — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench oraz cały blok wizyjny. W starciu z Muse Glimmer-30B od Meta, naturalnym lokalnym rywalem, wygrywa bezdyskusyjnie we wszystkich ośmiu wspólnych benchmarkach. Wciąż jednak przegrywa z Claude Opus 4.6 Max w Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) oraz NL2Repo-Bench (42.3 vs 47.6). Jeśli Twoje zadania to najtrudniejsze rozumowanie graniczne — matematyka graniczna, masowo interdyscyplinarne pytania — model 27B jeszcze tam nie dotarł.

Trzy zastrzeżenia, zanim cokolwiek z tego zacytujesz. Po pierwsze, nic z tego nie zostało niezależnie zweryfikowane; nie ma indeksu Artificial Analysis ani uruchomienia LMArena dla modelu 27B na dzień 15 sierpnia, a własne środowiska testowe Alibaby nie są tymi, których użyją strony trzecie. Po drugie, karta modelu używa środowiska testowego Claude Code do SWE-bench Pro i QwenSWEBench oraz sędziego GPT-4o do Humanity's Last Exam — porównania z modelami ocenianymi w innych konfiguracjach zmienią te liczby. Po trzecie, uruchomienie MathVision przez Alibabę używało stałego promptu, podczas gdy konkurenci otrzymali wyższy z dwóch wariantów. Nic z tego nie oznacza, że wyniki są błędne; oznacza to, że są one sufitem, a nie podłogą, dopóki ktoś inny nie uruchomi tego modelu.

Co jest potrzebne, aby to uruchomić

Qwen3.8-27B to model lokalny, co zmienia znaczenie pojęcia „wydajność”: liczy się przepustowość na własnym sprzęcie, a nie cennik. Wagi BF16 zajmują około 55,6 GB; po kwantyzacji do 4 bitów model mieści się na karcie z 24 GB pamiści, takiej jak RTX 3090 lub 4090. AMD dostarczyło wsparcie Day-0 w dniu premiery, a jego własne pomiary w llama.cpp/Vulkan — sierpień 2026, średnia z trzech lub więcej przebiegów — dają 24,5 tokenów/s na Ryzen AI Max+ 395 i 51,8 tokenów/s na Radeon AI PRO R9700 z 32 GB, w systemach z więcej niż około 24 GB zmiennej pamięci graficznej lub VRAM. Testy społeczności dla wersji FP8 na NVIDIA GH200 utrzymały 10 równoczesnych żądań z kontekstem 262K z czasem do pierwszego tokenu poniżej 10 ms. Twoje wyniki będą inne — to cudze GPU — ale ogólny obraz jest prawdziwy: to pierwsze wydanie Qwen w tej klasie, które działa, nie tylko w recenzji, na pojedynczej stacji roboczej.

Darmowe ciężary, czy płatne API?

Decyzja, którą wymusza ten model, to ta, która dzieli rozwiązania lokalne od hostowanych: wagi nic nie kosztują, ale Twoje GPU nie są darmowe. Self-hosting oznacza posiadanie własnego krzemu — jednej karty 24GB, jeśli akceptujesz kwantyzację 4-bitową i wolniejsze generowanie, czegoś większego, jeśli chcesz pełny kontekst 262K w pełnej jakości. Hostowana alternatywa na OrcaRouter kosztuje $0.33 za milion tokenów wejściowych i $2.40 za milion tokenów wyjściowych, z tym samym kontekstem 262K i wejściem w postaci obrazu i wideo oraz czasem p50 do pierwszego tokena wynoszącym 225ms, zmierzonym w ciągu ostatnich siedmiu dni — bez kupowania GPU, bez pilnowania VRAM. Arytmetyka jest taka, jaką zawsze wykonujesz z otwartymi wagami: przepustowość tokenów, której faktycznie potrzebujesz, razy Twój koszt za token, w porównaniu ze stałą ceną karty. Przy dużym, ciągłym wolumenie self-hosting wygrywa; przy zmiennym lub umiarkowanym wolumenie płacenie $0.33/$2.40 bije kupowanie krzemu, który w większości stoi bezczynnie.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Sedno sprawy

Qwen3.8-27B to najmocniejszy model o otwartych wagach, jaki Alibaba wypuściła w tej klasie rozmiarów, według własnych danych AliBaba: najlepszy w tabeli w kodowaniu agentowym, obsłudze komputera i rozumowaniu wizyjnym, z oknem kontekstowym 262K i wagami Apache 2.0. Właściwa interpretacja tabeli wyników jest warunkowa — każda liczba pochodzi od dostawcy, dotyczy konkretnego środowiska testowego i nie została dotąd niezależnie potwierdzona, a czołowe modele wciąż wygrywają najtrudniejsze benchmarki rozumowania. Jeśli zastanawiasz się, czy hostować go samodzielnie, czy wywoływać przez API, potraktuj tabelę benchmarków jako obietnicę, a dane dotyczące przepustowości AMD jako jedyny niezależny pomiar, jaki obecnie istnieje. Zaktualizujemy tę stronę w dniu, w którym niezależne laboratorium opublikuje wynik.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube