
Recenzja Qwen3.8-27B: otwarty model 27B, który jest "Opusem w domu" — sprawdzony w obliczu hype'u.
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 za 1 mln tokenów · 22 tok/s
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
Qwen3.8 27B jest najlepszym modelem o otwartych wagach 27B, jaki możesz obecnie samodzielnie hostować, i to bezdyskusyjnie. Wagi opublikowano 14 sierpnia 2026 na licencji Apache 2.0: gęsty model 27B (28B z enkoderem wizyjnym) z natywnym kontekstem 262K, natywnym wejściem obrazu i wideo oraz raportowanymi przez producenta wynikami w kodowaniu agentowym, które plasują się na poziomie lub powyżej Claude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Reklamowana cena to zero: pobierz 55.6 GB i uruchom. Zastrzeżenia też są realne — niezależne testy pokazują, że jest on mniej więcej trzy razy wolniejszy i bardziej łakomy na tokeny niż jego poprzednik, wszystkie benchmarki na karcie są nadal raportowane przez Alibabę, a kontekst 1M jest funkcją dostępną tylko w wersji hostowanej. Werdykt: jeśli masz GPU 24 GB+ i chcesz możliwości zbliżone do czołówki bez opłat za zużycie, hostuj go samodzielnie — ale rób to, dokładnie wiedząc, gdzie te liczby są mało wiarygodne.
Najpierw werdykt: czy powinieneś używać Qwen3.8 27B?
Krótka odpowiedź — tak dla lokalnych i prywatnych obciążeń; przed decyzją o zakupie poczekaj na wyniki od niezależnych podmiotów. Qwen3.8 27B to rzadki model, w którym otwarte wagi są produktem, a API wygodą. Ponieważ licencja to Apache 2.0, cena za token jest trwale zerowa, gdy tylko masz odpowiedni sprzęt, a nic, co na nim zbudujesz, nie może zostać ponownie licencjonowane ani rozliczane z mocą wsteczną. Tracisz natomiast szybkość, weryfikowalność i wygodę.
Jeśli już używasz Qwen3.6-27B i jesteś z niego zadowolony, aktualizacja jest realna, ale nie darmowa pod względem czasu rzeczywistego. Jeśli trafiłeś tu po premierze Qwen3.8-Max, to jest mniejszy, możliwy do samodzielnego hostowania przedstawiciel tej samej generacji — inne narzędzie do innego zadania.
Szybkie fakty, sprawdzone 15 sierpnia 2026 r.
• Wydano — wagi zostały udostępnione 14 sierpnia 2026 r. jako Qwen/Qwen3.8-27B na Hugging Face, z kopią lustrzaną na ModelScope; relacje w różnych strefach czasowych podają również 13 sierpnia, a premiera miała miejsce około tydzień po ogłoszeniu generacji Qwen3.8.
• Licencja — Apache 2.0: pobieranie, modyfikacja, redystrybucja, użycie komercyjne, z wyraźnym przyznaniem patentów. Bezterminowa.
• Parametry — 27B dense (28B wliczając enkoder wizyjny), 64 warstwy, rozmiar ukryty 5 120, słownik 248 320.
• Architektura — hybrydowa uwaga: 48 warstw liniowej uwagi Gated DeltaNet wobec 16 pełnych warstw Gated Attention (podział 3:1). Dlatego gęsty model 27B może przenosić 262K tokenów natywnego kontekstu.
• Kontekst — 262 144 tokeny natywnie; rozszerzalny do 1 000 000 przez YaRN w wersji hostowanej.
• Wejście — natywna obsługa obrazu i wideo oraz tekstu; zwraca tekst. To dzięki enkoderowi wizyjnemu liczba parametrów wynosi 28B.
• Myślenie — tryb rozumowania domyślnie włączony i możliwy do wyłączenia na żądanie; reasoning_effort (niski/średni/wysoki) oraz preserve_thinking dla długich przebiegów agenta.
• Wagi — 55.6 GB tensorów safetensors BF16 w 18 fragmentach; dostępne są także FP8 i społecznościowe GGUFs.
Powyższe specyfikacje pochodzą z karty modelu i konfiguracji Hugging Face dla Qwen3.8 27B, odczytanych dzisiaj. Wyniki benchmarków są raportowane przez Alibabę; jak dotąd żadne niezależne laboratorium ich nie odtworzyło.
W czym Qwen3.8 27B jest naprawdę dobry
Najmocniejszym argumentem jest agentyczna inżynieria oprogramowania. Alibaba raportuje 3-krotny skok w DeepSWE 1.1 w porównaniu z poprzednim 27B (42,2 vs 13,3) oraz wynik wyższy niż Claude Opus 4.6 Max w SWE-bench Pro (61,7 vs 53,4). To właśnie te liczby przyniosły mu przydomek „Opus w domu” — gęsty model 27B wykonujący kodowanie na pograniczu możliwości na sprzęcie, który można faktycznie posiadać.

Trzy rzeczy poza samymi liczbami sprawiają, że to zakup, który można obronić:
• Natywnie multimodalny. Obraz i wideo na wejściu, tekst na wyjściu — dokument z diagramami lub wideo z omówieniem to nie odrębny model. To właśnie w wynikach rozumowania wizualnego (85,6 przy włączonej funkcji łańcucha myśli, 94,6 w matematyce wizualnej, obie wartości raportowane przez producenta) enkoder wizyjny pokazuje swoją wartość.
• 262K natywnego kontekstu. Zadania agentów o długim horyzoncie, duże bazy kodu i wielogodzinne transkrypty mieszczą się w jednym oknie. Hybrydowa konstrukcja z liniową uwagą utrzymuje koszt KV tego kontekstu niższy niż w przypadku czystego modelu z pełną uwagą o tym samym rozmiarze.
• Darmowe, trwałe wagi. Na tym właśnie polega ta kategoria: model z zamkniętym API jest wynajmowany; Qwen3.8 27B jest własnością. Przy kwantyzacji 4-bit działa na karcie 24 GB (klasy RTX 3090/4090), a AMD udostępniło wsparcie Day-0 (do 24,5 tokenów/s na Ryzen AI Max+ 395 i do 51,8 tokenów/s na Radeon AI PRO R9700, według własnego bloga AMD).
Gdzie recenzja staje się nieprzyjemna: szybkość, tokeny i weryfikacja
Niezależne dotychczasowe testy to harness jednego testera, nie laboratorium — ale to najlepszy sygnał, jaki mamy. Porównując Qwen3.8 27B z Qwen3.6-27B na dziesięciu zadaniach z rzeczywistego świata (ocenianych przez GPT-5.5 za pomocą harnessu llmcompare), model 3.8 wygrał dziewięć z dziesięciu i uzyskał średnio 8.838 vs 6.862 — „jedno z bardziej imponujących podniesień inteligencji", jakie tester widział. Zużył też prawie trzy razy więcej tokenów i był znacznie wolniejszy; jedno zadanie zajęło około 600% więcej czasu. Tak więc skok jakości jest realny, a także koszt w czasie zegarowym.
Jeszcze cztery rzeczy, które można mu zarzucić:
• Jeszcze nie ma benchmarków od zewnętrznych podmiotów. Każda liczba w tym artykule pochodzi od Alibaba na dzień 15 sierpnia. Karta sprzedawcy jest szczegółowa, ale niezależne laboratorium nie przeprowadziło reprodukcji. Jeśli Twoja decyzja zależy od zweryfikowanych liczb, poczekaj na nie — wagi nadal tam będą.
• Próg VRAM jest realny. BF16 wymaga GPU klasy 80 GB. Aby zmieścić się na karcie z 24 GB, musisz użyć kwantyzacji 4-bitowej, a raporty społeczności (wątek komentarzy na dev.to, kilka dni po premierze) mówią, że wersje skwantowane „tracą skupienie po długim kontekście”. Oficjalne wagi, jeśli masz odpowiednią ilość VRAM; skwantowane, jeśli nie.
• Kontekst 1M jest dostępny tylko w wersji hostowanej. Otwarte wagi osiągają maksymalnie 262K. Rozszerzalność do 1M to funkcja hostowanej wersji Qwen Cloud, a nie coś, co lokalna kopia robi od razu po wyjęciu z pudełka.
• „Beats Opus" wymaga zastrzeżeń. Benchmarki agentowe premiują zachowania specyficzne dla danego harnessa, a najwyżej oceniany komentarz pod postem o premierze na dev.to ujął to wprost: „Nie pokonują Opusa w rzeczywistym użyciu". Traktuj tabelę wyników jako górną granicę w najlepszym razie, a nie obietnicę.
Jak plasuje się w rodzinie Qwen 3.8
• kontra Qwen3.6-27B — ta sama klasa sprzętu i kontekst 262K, ale znaczący skok możliwości kosztem szybkości i wydajności tokenowej. Jeśli już używasz 3.6 i ogranicza Cię przepustowość, pozostanie przy 3.6 jest uzasadnione.
• vs Qwen3-Coder-30B-A3B — Coder to model MoE z około 3,3 mld aktywnych parametrów, który działa znacznie szybciej (~90–110 tokenów/s). Gęsty model 27B jest wolniejszy na token, ale dziedziczy agentowe zyski generacji; jeśli wyniki 27B w inżynierii oprogramowania utrzymają się w niezależnych testach, rola Codera-30B maleje.
• vs Qwen3.8-Max — flagowy model 2.4T MoE to model centrum danych (tylko API, około $2/$6 za milion tokenów w opublikowanych raportach) z kontekstem 1M i wideo. Wersja 27B jest przeznaczona do wdrożenia. Odpowiadają na różne pytania.
Koszt: kwestia lokalnie kontra API — rozstrzygnięta.
W przypadku modelu zamkniętego porównujesz ceny za token. W przypadku Qwen3.8 27B koszt marginalnego tokena na własnym sprzęcie wynosi zero — prawdziwą ceną jest początkowy wydatek na GPU i Twój czas. W wersji 4-bitowej to karta 24 GB; w BF16 to maszyna klasy 80 GB. Jeśli potrzebujesz tylko ocenić model albo nie masz odpowiedniego sprzętu, istnieje opcja hostowana: OrcaRouter obecnie udostępnia Qwen3.8 27B z bezpłatnym, limitowanym pakietem, który pobiera 0 $ i po przekroczeniu limitu zwraca HTTP 429, a także płatnym pakietem w cenie 0,33 $ za milion tokenów wejściowych i 2,40 $ za milion tokenów wyjściowych (stan na 15 sierpnia). Hostowana wersja Qwen Cloud, z kontekstem 1M, oznaczona jest jako „wkrótce”.

Uczciwe ujęcie: w przypadku modelu o otwartych wagach dostawca jest wygodą, a nie zależnością. Darmowy poziom to najtańszy możliwy sposób, aby zdecydować, czy pobranie 55,6 GB jest warte zachodu. Ale gdy już podejmiesz decyzję, liczą się wagi — a one są darmowe.
Jak faktycznie to wypróbować
• Najszybsza ocena — skorzystaj z darmowego hostowanego poziomu z limitem żądań; jeśli odpowie na to, czego potrzebujesz, sprawa załatwiona i nic cię to nie kosztuje.
• Realny test na Twoim sprzęcie — pobierz społecznościowy plik GGUF (wersja Q4_K_M waży około 17 GB i mieści się na karcie 24 GB) i uruchom go w llama.cpp lub Ollama. Przekaż szablon czatu Jinja, w przeciwnym razie model odpowie w tagach myśli. Do obsługi wizji z GGUF potrzebujesz również osobnego pliku mmproj. Nasz poradnik uruchamiania Qwen3.8 27B lokalnie przeprowadzi Cię przez to.
• Pełna precyzja — huggingface-cli download Qwen/Qwen3.8-27B na GPU klasy 80 GB.
• Zweryfikuj to, co pobrałeś — sprawdź, czy wydawcą jest organizacja Qwen i zweryfikuj shardy względem crc32.txt; podobne repozytoria pojawiły się przed wydaniem.
Kiedy ta recenzja jest błędna (i kto powinien pominąć Qwen3.8 27B)
• Nie masz GPU i nie zamierzasz go wynajmować. Darmowy poziom jest ograniczony limitem, a płatny kosztuje $0.33/$2.40 za milion — mały model API może być dla Ciebie tańszy i bardziej niezawodny. Ten model jest dla osób, które chcą posiadać własną inferencję.
• Potrzebujesz umowy SLA. Hostowana warstwa ma zaledwie kilka dni; strona modelu OrcaRouter, odczytana dziś, pokazuje 33.3% współczynnik błędów w ciągu ostatnich siedmiu dni oraz p50 opóźnienia pierwszego tokenu wynoszące 225 ms. To zupełnie nowy model pod wczesnym obciążeniem, a nie umowa produkcyjna. Osoby hostujące samodzielnie powinny przypiąć commit pobranego kodu i zachować rozwiązanie zapasowe.
• Potrzebujesz zweryfikowanych benchmarków do podjęcia decyzji o zakupie. Dane raportowane przez producentów są przydatne tylko orientacyjnie, a nie jako podstawa decyzji zakupowych. Poczekaj na niezależne odtworzenie wyników.
• Kontekst 262K o otwartych wagach to za mało. Rozszerzenie 1M jest dziś dostępne tylko w wersji hostowanej.
• Przepustowość to Twoje wąskie gardło. Masowe streszczanie lub duże partie dadzą się we znaki: to gęsty model 27B, który zużywa też około 3x więcej tokenów niż jego poprzednik. Do tanich, masowych zadań wygrywa mniejszy lub szybszy model.
• Masz kartę 12 GB. Modele GGUF 2-bit mieszczą się, ale z widoczną utratą jakości; to nie jest model dla Ciebie.

Najważniejsze
Qwen3.8 27B to najmocniejszy model 27B z otwartymi wagami dostępny obecnie na rynku, a do tego jest darmowy na zawsze na licencji Apache 2.0. Jeśli masz kartę GPU o pojemności 24 GB+ i chcesz kodowania agentowego, kontekstu 262K oraz natywnego wejścia obrazu/wideo bez płatności za zużycie, to jest to właściwy wybór. Powody, aby się wstrzymać, są równie konkretne: potrzebujesz niezależnego potwierdzenia benchmarkami, umowy SLA, kontekstu z otwartymi wagami większego niż 262K lub wyższej przepustowości niż daje gęsty model 27B. Model się ukazał, wagi są prawdziwe, a liczby są dobre — tylko pamiętaj, czyje to liczby.
