Karta tytułowa hero dla recenzji Qwen3.8-27B, zatytułowana „Qwen3.8-27B Review" z podtytułem „Open-weight 27B, który jest Opusem w domu — testowany wobec szumu", przedstawiająca odznakę open-weights, odznakę Apache 2.0 oraz zestaw ikon GPU i serwera na czystym białym tle z delikatnymi niebieskimi gradientami.
Guides & Insights

Recenzja Qwen3.8-27B: otwarty model 27B, który jest "Opusem w domu" — sprawdzony w obliczu hype'u.

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen3.8 27B jest najlepszym modelem o otwartych wagach 27B, jaki możesz obecnie samodzielnie hostować, i to bezdyskusyjnie. Wagi opublikowano 14 sierpnia 2026 na licencji Apache 2.0: gęsty model 27B (28B z enkoderem wizyjnym) z natywnym kontekstem 262K, natywnym wejściem obrazu i wideo oraz raportowanymi przez producenta wynikami w kodowaniu agentowym, które plasują się na poziomie lub powyżej Cla​ude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Reklamowana cena to zero: pobierz 55.6 GB i uruchom. Zastrzeżenia też są realne — niezależne testy pokazują, że jest on mniej więcej trzy razy wolniejszy i bardziej łakomy na tokeny niż jego poprzednik, wszystkie benchmarki na karcie są nadal raportowane przez Ali​babę, a kontekst 1M jest funkcją dostępną tylko w wersji hostowanej. Werdykt: jeśli masz GPU 24 GB+ i chcesz możliwości zbliżone do czołówki bez opłat za zużycie, hostuj go samodzielnie — ale rób to, dokładnie wiedząc, gdzie te liczby są mało wiarygodne.

Najpierw werdykt: czy powinieneś używać Qwen3.8 27B?

Krótka odpowiedź — tak dla lokalnych i prywatnych obciążeń; przed decyzją o zakupie poczekaj na wyniki od niezależnych podmiotów. Qwen3.8 27B to rzadki model, w którym otwarte wagi są produktem, a API wygodą. Ponieważ licencja to Apache 2.0, cena za token jest trwale zerowa, gdy tylko masz odpowiedni sprzęt, a nic, co na nim zbudujesz, nie może zostać ponownie licencjonowane ani rozliczane z mocą wsteczną. Tracisz natomiast szybkość, weryfikowalność i wygodę.

Jeśli już używasz Qwen3.6-27B i jesteś z niego zadowolony, aktualizacja jest realna, ale nie darmowa pod względem czasu rzeczywistego. Jeśli trafiłeś tu po premierze Qwen3.8-Max, to jest mniejszy, możliwy do samodzielnego hostowania przedstawiciel tej samej generacji — inne narzędzie do innego zadania.

Szybkie fakty, sprawdzone 15 sierpnia 2026 r.

Wydano — wagi zostały udostępnione 14 sierpnia 2026 r. jako Qwen/Qwen3.8-27B na Hugging Face, z kopią lustrzaną na ModelScope; relacje w różnych strefach czasowych podają również 13 sierpnia, a premiera miała miejsce około tydzień po ogłoszeniu generacji Qwen3.8.

Licencja — Apache 2.0: pobieranie, modyfikacja, redystrybucja, użycie komercyjne, z wyraźnym przyznaniem patentów. Bezterminowa.

Parametry — 27B dense (28B wliczając enkoder wizyjny), 64 warstwy, rozmiar ukryty 5 120, słownik 248 320.

Architektura — hybrydowa uwaga: 48 warstw liniowej uwagi Gated DeltaNet wobec 16 pełnych warstw Gated Attention (podział 3:1). Dlatego gęsty model 27B może przenosić 262K tokenów natywnego kontekstu.

Kontekst — 262 144 tokeny natywnie; rozszerzalny do 1 000 000 przez YaRN w wersji hostowanej.

Wejście — natywna obsługa obrazu i wideo oraz tekstu; zwraca tekst. To dzięki enkoderowi wizyjnemu liczba parametrów wynosi 28B.

Myślenie — tryb rozumowania domyślnie włączony i możliwy do wyłączenia na żądanie; reasoning_effort (niski/średni/wysoki) oraz preserve_thinking dla długich przebiegów agenta.

Wagi — 55.6 GB tensorów safetensors BF16 w 18 fragmentach; dostępne są także FP8 i społecznościowe GGUFs.

Powyższe specyfikacje pochodzą z karty modelu i konfiguracji Hugging Face dla Qwen3.8 27B, odczytanych dzisiaj. Wyniki benchmarków są raportowane przez Ali​babę; jak dotąd żadne niezależne laboratorium ich nie odtworzyło.

W czym Qwen3.8 27B jest naprawdę dobry

Najmocniejszym argumentem jest agentyczna inżynieria oprogramowania. Alibaba raportuje 3-krotny skok w DeepSWE 1.1 w porównaniu z poprzednim 27B (42,2 vs 13,3) oraz wynik wyższy niż Claude Opus 4.6 Max w SWE-bench Pro (61,7 vs 53,4). To właśnie te liczby przyniosły mu przydomek „Opus w domu” — gęsty model 27B wykonujący kodowanie na pograniczu możliwości na sprzęcie, który można faktycznie posiadać.

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

Trzy rzeczy poza samymi liczbami sprawiają, że to zakup, który można obronić:

Natywnie multimodalny. Obraz i wideo na wejściu, tekst na wyjściu — dokument z diagramami lub wideo z omówieniem to nie odrębny model. To właśnie w wynikach rozumowania wizualnego (85,6 przy włączonej funkcji łańcucha myśli, 94,6 w matematyce wizualnej, obie wartości raportowane przez producenta) enkoder wizyjny pokazuje swoją wartość.

262K natywnego kontekstu. Zadania agentów o długim horyzoncie, duże bazy kodu i wielogodzinne transkrypty mieszczą się w jednym oknie. Hybrydowa konstrukcja z liniową uwagą utrzymuje koszt KV tego kontekstu niższy niż w przypadku czystego modelu z pełną uwagą o tym samym rozmiarze.

Darmowe, trwałe wagi. Na tym właśnie polega ta kategoria: model z zamkniętym API jest wynajmowany; Qwen3.8 27B jest własnością. Przy kwantyzacji 4-bit działa na karcie 24 GB (klasy RTX 3090/4090), a AMD udostępniło wsparcie Day-0 (do 24,5 tokenów/s na Ryzen AI Max+ 395 i do 51,8 tokenów/s na Radeon AI PRO R9700, według własnego bloga AMD).

Gdzie recenzja staje się nieprzyjemna: szybkość, tokeny i weryfikacja

Niezależne dotychczasowe testy to harness jednego testera, nie laboratorium — ale to najlepszy sygnał, jaki mamy. Porównując Qwen3.8 27B z Qwen3.6-27B na dziesięciu zadaniach z rzeczywistego świata (ocenianych przez GPT-5.5 za pomocą harnessu llmcompare), model 3.8 wygrał dziewięć z dziesięciu i uzyskał średnio 8.838 vs 6.862 — „jedno z bardziej imponujących podniesień inteligencji", jakie tester widział. Zużył też prawie trzy razy więcej tokenów i był znacznie wolniejszy; jedno zadanie zajęło około 600% więcej czasu. Tak więc skok jakości jest realny, a także koszt w czasie zegarowym.

Jeszcze cztery rzeczy, które można mu zarzucić:

Jeszcze nie ma benchmarków od zewnętrznych podmiotów. Każda liczba w tym artykule pochodzi od Ali​baba na dzień 15 sierpnia. Karta sprzedawcy jest szczegółowa, ale niezależne laboratorium nie przeprowadziło reprodukcji. Jeśli Twoja decyzja zależy od zweryfikowanych liczb, poczekaj na nie — wagi nadal tam będą.

Próg VRAM jest realny. BF16 wymaga GPU klasy 80 GB. Aby zmieścić się na karcie z 24 GB, musisz użyć kwantyzacji 4-bitowej, a raporty społeczności (wątek komentarzy na dev.to, kilka dni po premierze) mówią, że wersje skwantowane „tracą skupienie po długim kontekście”. Oficjalne wagi, jeśli masz odpowiednią ilość VRAM; skwantowane, jeśli nie.

Kontekst 1M jest dostępny tylko w wersji hostowanej. Otwarte wagi osiągają maksymalnie 262K. Rozszerzalność do 1M to funkcja hostowanej wersji Qwe​n Cloud, a nie coś, co lokalna kopia robi od razu po wyjęciu z pudełka.

„Beats Opus" wymaga zastrzeżeń. Benchmarki agentowe premiują zachowania specyficzne dla danego harnessa, a najwyżej oceniany komentarz pod postem o premierze na dev.to ujął to wprost: „Nie pokonują Opusa w rzeczywistym użyciu". Traktuj tabelę wyników jako górną granicę w najlepszym razie, a nie obietnicę.

Jak plasuje się w rodzinie Qwen 3.8

kontra Qwen3.6-27B — ta sama klasa sprzętu i kontekst 262K, ale znaczący skok możliwości kosztem szybkości i wydajności tokenowej. Jeśli już używasz 3.6 i ogranicza Cię przepustowość, pozostanie przy 3.6 jest uzasadnione.

vs Qwen3-Coder-30B-A3B — Coder to model MoE z około 3,3 mld aktywnych parametrów, który działa znacznie szybciej (~90–110 tokenów/s). Gęsty model 27B jest wolniejszy na token, ale dziedziczy agentowe zyski generacji; jeśli wyniki 27B w inżynierii oprogramowania utrzymają się w niezależnych testach, rola Codera-30B maleje.

vs Qwen3.8-Max — flagowy model 2.4T MoE to model centrum danych (tylko API, około $2/$6 za milion tokenów w opublikowanych raportach) z kontekstem 1M i wideo. Wersja 27B jest przeznaczona do wdrożenia. Odpowiadają na różne pytania.

Koszt: kwestia lokalnie kontra API — rozstrzygnięta.

W przypadku modelu zamkniętego porównujesz ceny za token. W przypadku Qwen3.8 27B koszt marginalnego tokena na własnym sprzęcie wynosi zero — prawdziwą ceną jest początkowy wydatek na GPU i Twój czas. W wersji 4-bitowej to karta 24 GB; w BF16 to maszyna klasy 80 GB. Jeśli potrzebujesz tylko ocenić model albo nie masz odpowiedniego sprzętu, istnieje opcja hostowana: OrcaRouter obecnie udostępnia Qwen3.8 27B z bezpłatnym, limitowanym pakietem, który pobiera 0 $ i po przekroczeniu limitu zwraca HTTP 429, a także płatnym pakietem w cenie 0,33 $ za milion tokenów wejściowych i 2,40 $ za milion tokenów wyjściowych (stan na 15 sierpnia). Hostowana wersja Qwe​n Cloud, z kontekstem 1M, oznaczona jest jako „wkrótce”.

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

Uczciwe ujęcie: w przypadku modelu o otwartych wagach dostawca jest wygodą, a nie zależnością. Darmowy poziom to najtańszy możliwy sposób, aby zdecydować, czy pobranie 55,6 GB jest warte zachodu. Ale gdy już podejmiesz decyzję, liczą się wagi — a one są darmowe.

Jak faktycznie to wypróbować

Najszybsza ocena — skorzystaj z darmowego hostowanego poziomu z limitem żądań; jeśli odpowie na to, czego potrzebujesz, sprawa załatwiona i nic cię to nie kosztuje.

Realny test na Twoim sprzęcie — pobierz społecznościowy plik GGUF (wersja Q4_K_M waży około 17 GB i mieści się na karcie 24 GB) i uruchom go w llama.cpp lub Ollama. Przekaż szablon czatu Jinja, w przeciwnym razie model odpowie w tagach myśli. Do obsługi wizji z GGUF potrzebujesz również osobnego pliku mmproj. Nasz poradnik uruchamiania Qwen3.8 27B lokalnie przeprowadzi Cię przez to.

Pełna precyzja — huggingface-cli download Qwen/Qwen3.8-27B na GPU klasy 80 GB.

Zweryfikuj to, co pobrałeś — sprawdź, czy wydawcą jest organizacja Qwe​n i zweryfikuj shardy względem crc32.txt; podobne repozytoria pojawiły się przed wydaniem.

Kiedy ta recenzja jest błędna (i kto powinien pominąć Qwen3.8 27B)

Nie masz GPU i nie zamierzasz go wynajmować. Darmowy poziom jest ograniczony limitem, a płatny kosztuje $0.33/$2.40 za milion — mały model API może być dla Ciebie tańszy i bardziej niezawodny. Ten model jest dla osób, które chcą posiadać własną inferencję.

Potrzebujesz umowy SLA. Hostowana warstwa ma zaledwie kilka dni; strona modelu OrcaRouter, odczytana dziś, pokazuje 33.3% współczynnik błędów w ciągu ostatnich siedmiu dni oraz p50 opóźnienia pierwszego tokenu wynoszące 225 ms. To zupełnie nowy model pod wczesnym obciążeniem, a nie umowa produkcyjna. Osoby hostujące samodzielnie powinny przypiąć commit pobranego kodu i zachować rozwiązanie zapasowe.

Potrzebujesz zweryfikowanych benchmarków do podjęcia decyzji o zakupie. Dane raportowane przez producentów są przydatne tylko orientacyjnie, a nie jako podstawa decyzji zakupowych. Poczekaj na niezależne odtworzenie wyników.

Kontekst 262K o otwartych wagach to za mało. Rozszerzenie 1M jest dziś dostępne tylko w wersji hostowanej.

Przepustowość to Twoje wąskie gardło. Masowe streszczanie lub duże partie dadzą się we znaki: to gęsty model 27B, który zużywa też około 3x więcej tokenów niż jego poprzednik. Do tanich, masowych zadań wygrywa mniejszy lub szybszy model.

Masz kartę 12 GB. Modele GGUF 2-bit mieszczą się, ale z widoczną utratą jakości; to nie jest model dla Ciebie.

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

Najważniejsze

Qwen3.8 27B to najmocniejszy model 27B z otwartymi wagami dostępny obecnie na rynku, a do tego jest darmowy na zawsze na licencji Apache 2.0. Jeśli masz kartę GPU o pojemności 24 GB+ i chcesz kodowania agentowego, kontekstu 262K oraz natywnego wejścia obrazu/wideo bez płatności za zużycie, to jest to właściwy wybór. Powody, aby się wstrzymać, są równie konkretne: potrzebujesz niezależnego potwierdzenia benchmarkami, umowy SLA, kontekstu z otwartymi wagami większego niż 262K lub wyższej przepustowości niż daje gęsty model 27B. Model się ukazał, wagi są prawdziwe, a liczby są dobre — tylko pamiętaj, czyje to liczby.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube