
Qwen3.8-27B do programowania: czego się spodziewać przed publikacją wag
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 za 1 mln tokenów
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 2401 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
Jeśli używasz lokalnych modeli do kodowania, najważniejszą liczbą z premiery Qwen3.8 firmy Alibaba z 3 sierpnia 2026 r. nie jest 2,4-bilionowy parametr w nagłówku Qwen3.8-Max — ale wynik FrontierSWE, który wzrósł z 40,7 w poprzedniej generacji do 73,5 w tej. Ten skok nastąpił w modelu flagowym. Modelem, który może przenieść część tego na Twój własny sprzęt, jest Qwen3.8-27B — członek generacji Qwen3.8 o otwartych wagach i około 27 miliardach parametrów, ogłoszony tego samego dnia i na tę chwilę jeszcze niedostępny do pobrania. To artykuł o tym, co wiemy do tej pory, a nie recenzja: nikt poza laboratorium Alibaba nie uruchomił jeszcze Qwen3.8-27B, nie ma oficjalnej karty modelu, a każde pobranie, które obecnie podaje się za ten model, to atrapa lub upload od strony trzeciej.
Oto uczciwa pozycja wyjściowa dla każdego, kto planuje lokalną konfigurację do kodowania wokół 27B: zyski flagowca są deklarowane przez producenta, dopóki nie pojawią się niezależne testy, specyfikacje samego 27B nie są potwierdzone, a jedyną rzeczą, którą możemy dziś zmierzyć, jest jego poprzednik Qwen3.6-27B — który już był jednym z najlepszych lokalnych modeli do kodowania w 2026 roku. To jest poziom odniesienia, który ta generacja musi pobić, i to wysoki.
Dlaczego model 27B to ten, na którym programistom naprawdę zależy
Qwen3.8-Max to model klasy centrum danych: mieszanka ekspertów o 2.4T parametrów, z około 95 miliardami aktywnych parametrów, kontekstem 1M tokenów i bez ścieżki dla konsumentów do uruchomienia go lokalnie. Qwen3.8-27B to przeciwny zakład — model o otwartych wagach klasy ~27B, zaprojektowany pod pojedyncze GPU, pozycjonowany jako samodzielnie hostowana wersja tej generacji. Dla programistów 27B jest produktem. Max jest dowodem, że trening tej generacji przyniósł efekty.
Czym jest to „coś”, według własnych ocen Alibaby: Terminal-Bench 2.1 na poziomie 86,6 (wzrost z 74,5 dla Qwen 3.7 Max), SWE-bench Pro na poziomie 67,7, PaperBench na poziomie 93,0 oraz skok FrontierSWE z 40,7 do 73,5, który sygnalizuje skokową zmianę w długohoryzontowym, agentowym kodowaniu — model samodzielnie pracuje nad wieloetapowymi zadaniami w repozytorium, zamiast odpowiadać na pojedyncze zapytania. Niezależne serwisy śledzące wyceniają Qwen3.8-Max na 71,8 w indeksie kodowania Artificial Analysis i 58,1 w indeksie inteligencji, więc generacja jest realna, nawet gdy odejmiemy marketing Alibaby. Żadna z tych liczb nie przekłada się bezpośrednio na model 27B. Ale to one są powodem, dla którego 27B jest najbardziej wyczekiwanym lokalnym modelem do kodowania drugiej połowy 2026 roku: mniejszy model, który odziedziczy chociaż ułamek tej agentowej poprawy, zresetowałby to, co „dobre lokalne kodowanie” oznacza w skali 27B.

Poprzednik ustawił poprzeczkę: Qwen3.6-27B
Qwen3.6-27B to model, na którym opiera się każda projekcja dla 3.8 27B, ponieważ to ta sama klasa i ta sama fizyka. To gęsty model 27B z natywnym kontekstem 262K, dwoma trybami: myślenia i niemyślenia, natywnym wejściem tekst/obraz/wideo oraz licencją Apache 2.0. Swoją reputację lokalnego kodera zdobył nie dzięki wygrywaniu każdego benchmarku, ale dzięki byciu największym modelem, który wciąż mieścił się na konsumenckim GPU przy użytecznej jakości — punktem na krzywej rozmiar/jakość, w którym przestajesz wymieniać możliwości na sprzęt.
Taki jest kontekst dla 3.8-27B: musi być co najmniej tak dobry jak 3.6-27B przy tym samym koszcie sprzętowym, a najlepiej lepszy w pracy agentowej, bo to jedyny uczciwy powód, aby przejść. Jeśli dorówna 3.6 w surowym kodowaniu i doda ulepszenia agentowe tej generacji, stanie się domyślnym wyborem lokalnym. Jeśli tylko powtórzy te same wyniki, uaktualnienie będzie marginalne.
Rzeczywistość sprzętowa: 16 GB to niewłaściwe pytanie
{{1}}Ponieważ nie istnieją oficjalne specyfikacje, szacunki VRAM pochodzą z pomiarów Qwen3.6-27B, a uczciwe podsumowanie jest takie, że kwantyzacja 4-bitowa to gra na 24 GB, a nie na 16 GB.{{/1}} {{2}}Przy Q4_K_M wagi wynoszą mniej więcej 16–17 GB, co sugeruje, że karta z 16 GB powinna je pomieścić — dopóki pamięć podręczna KV i narzut modelu nie podniosą rzeczywistego zapotrzebowania do około 20–24 GB.{{/2}} {{3}}Praktyczne wskazówki z własnego opracowania Alibaba Cloud są dosadne: Q4_K_M nie mieści się na karcie GPU z 16 GB w rzeczywistym użyciu.{{/3}} {{4}}Szacunki społeczności oscylują wokół:{{/4}}
• Q3_K_M — ~13 GB wag, mieści się na kartach 12–16 GB przy obniżonej jakości
• Q4_K_M — ~16–17 GB wagi, realistycznie 20–24 GB z kontekstem — złoty środek dla RTX 3090/4090
• Q6_K — ~21–22 GB, prawie bezstratny na kartach 24 GB
• Q8_0 — ~28.6 GB, wymaga 32 GB
• BF16 pełna precyzja — ~54–56 GB, poza zasięgiem jakiejkolwiek konsumenckiej karty graficznej
Unsloth zaprezentował wersję 4-bitową działającą na około 17 GB, co jest zgodne z modelem ~27B w kwantyzacji 4-bitowej — traktuj to jako dolną granicę dla okrojonego obciążenia bez kontekstu, a nie jako liczbę produkcyjną. Jeśli planujesz sprzęt, planuj w oparciu o kartę z 24 GB.
Toolchain: co pojawia się pierwszego dnia, a co w drugim tygodniu
Gdy wagi zostaną udostępnione, wsparcie nie nadchodzi od razu. Silniki serwujące vLLM i SGLang zwykle dodają wsparcie w ciągu kilku dni od wydania Alibaby, dzięki czemu osoby hostujące samodzielnie szybko uzyskują punkt końcowy zgodny z OpenAI. Społecznościowe kwantyzacje GGUF i AWQ pozostają w tyle o jeden do dwóch tygodni, co oznacza, że doświadczenie „pull and run” w narzędziach opartych na llama.cpp (Ollama, LM Studio) będzie pozostawać w tyle za surowymi wagami — a jeśli 27B dzieli naprawdę nową architekturę z Maxem zamiast wykorzystywać układ 3.6, należy spodziewać się, że narzędzia będą potrzebować więcej czasu. Przez pierwszy tydzień lub dwa najszybszą ścieżką będzie vLLM na niewykwantyzowanych wagach, a nie proste „pull” jedną komendą.

Co 27B może faktycznie zrobić dla pracy agentowej
Ustaw oczekiwania właściwie: 16-dniowe autonomiczne demo — czyli Qwen3.8 od Alibaba budujący samorozwijający się harness agenta przez setki commitów bez ingerencji człowieka — to flagowa demonstracja. Model 27B tego nie zrobi. To, co lokalny koder klasy 27B ewidentnie robi dobrze, na podstawie doświadczeń społeczności z Qwen3.6-27B i Qwen3-Coder-30B-A3B:
• Porządkuj i segreguj zgłoszenia, identyfikuj przyczyny źródłowe oraz przygotuj grunt, aby silniejszy model dokończył.
• Obsługuj refaktoryzacje na skalę repozytorium i pętle wywołań narzędzi z interaktywną szybkością.
• Wykonuj codzienną porcję kodowania lokalnie — dane pozostają na Twojej maszynie, koszt jest stały
• Utrzymuj skuteczność na poziomie ~50/50 w całkowitym naprawianiu naprawdę złożonego błędu — wystarczająco dobrą, aby być przydatną, ale niewystarczająco niezawodną, aby być twoim jedynym agentem.
27B to model wolumenowy z ogonem decyzyjnym. Będzie doskonały w wysokowolumenowym środku Twojego obciążenia, ale w najtrudniejszych dziesięciu procentach będzie się mylić. To nie wada; taki jest projekt.
Budowanie wokół tego: rozdziel ruch
Rozwiązanie, na które decyduje się większość zespołów, to podział: lokalny model 27B obsługuje większość zadań — generowanie rutynowego kodu, boilerplate, refaktoryzacje, poprawki w stylu lint — a hostowany model graniczny zajmuje się trudnymi przypadkami, gdzie dodatkowe kilka punktów jakości uzasadnia koszt API. Czystym sposobem na wdrożenie takiego podziału jest router, ponieważ obie strony zawodzą w różnym tempie i nie chcesz, aby Twój potok agentowy utknął na lokalnym wąskim gardle lub awarii dostawcy.
Oto przepływ pracy, do którego zbudowano OrcaRouter. Qwen3.8-Max działa tam na żywo po cenie z listy dostawcy — 2 USD za milion tokenów wejściowych, 6 USD za milion wyjściowych — przekazywanej bez żadnej marży, więc gdy Alibaba obniży stawkę, Twój rachunek spada tego samego dnia. Wskazujesz jeden kompatybilny z OpenAI endpoint na ten podział, kierujesz trudny ogon zapytań do Qwen3.8-Max, zostawiasz lokalny model 27B do obsługi dużej liczby żądań, gdy tylko pojawią się jego wagi, a automatyczne przełączanie awaryjne przechwytuje wolnego lub zawodnego dostawcę bez zmiany kodu. Oceniasz model 27B na własnym sprzęcie, podczas gdy Twoja ścieżka produkcyjna pozostaje aktywna — model, który nie został jeszcze sprawdzony, nigdy nie staje się pojedynczym punktem awarii.

Co sprawdzić w dniu, w którym spadają ciężary
Gdy oficjalne repozytorium pojawi się na Hugging Face lub ModelScope, zweryfikuj poniższe, zanim cokolwiek na nim zbudujesz:
Repozytorium znajduje się w oficjalnej organizacji Qwen — to nie jest mirror ani squatter nazw.
• Plik LICENSE jest faktycznie obecny i zgadza się z licencją, którą deklarują notatki wydania.
• Karta modelu przedstawia okno kontekstu, architekturę (gęstą lub MoE) oraz tryby myślenia
Pierwsze niezależne przebiegi pojawiają się na Terminal-Bench lub Artificial Analysis — do tego czasu deklaracje producentów pozostają tylko deklaracjami.
• Wsparcie GGUF trafia do llama.cpp i Twojego ulubionego lokalnego środowiska uruchomieniowego
Co do tej ostatniej kwestii, obowiązuje wcześniejsza dyscyplina: dopóki niezależne uruchomienie nie potwierdzi zysków w kodowaniu, traktuj obietnicę odziedziczoną po FrontierSWE jako powód do testów, a nie powód do wdrożenia.
Oczekiwanie, uczciwie przedstawione: Qwen3.8-27B to na papierze najbardziej obiecujące lokalne wydanie do kodowania w 2026 roku — sprawdzony model bazowy 27B plus generacja osiągnięć z treningu agentowego, przy koszcie sprzętu, który społeczność już potrafi udźwignąć. Czy dotrzyma obietnicy, zależy od tego, co faktycznie kryją wagi. Obserwuj oficjalne repozytorium, przeczytaj licencję i pozwól, by rozstrzygnął pierwszy niezależny benchmark. Do tego czasu Qwen3.6-27B trzyma miejsce, a hostowany flagowiec z routingiem dźwiga trudny ogon.
