
Qwen3.8-27B na Ollamie: Jedno polecenie, cztery kwantyzacje i ile naprawdę kosztuje „darmowe”
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 za 1 mln tokenów · 18 tok/s
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
Uruchom to jednym poleceniem: ollama run qwen3.8:27b. To jest cała odpowiedź na pytanie, o którym traktuje ta strona. Qwen3.8 27B — gęsty model Alibaby o 27 miliardach parametrów, wagi wydane 14 sierpnia 2026 roku na licencji Apache 2.0 — pojawił się w tym tygodniu w bibliotece Ollama, a domyślna wersja to już rozsądne 18 GB w kwantyzacji Q4_K_M (17 GB wag plus 931 MB enkoder wizyjny). Działa w pełni na karcie GPU z 24 GB pamięci przy standardowych długościach kontekstu, przełącza się na CPU, gdy karta jest mniejsza, i nie kosztuje nic za token.
Wszystko tutaj jest datowane na 15 sierpnia 2026 r. Specyfikacje pochodzą z karty modelu Qwen3.8 27B; rozmiary do pobrania, tagi i liczby pobrań pochodzą z aktualnej strony biblioteki Ollama; wyniki benchmarków są raportowane przez Alibaba i nie zostały jeszcze niezależnie potwierdzone. Model został wydany kilka dni temu, więc wszystko, co może się zmienić, traktuj jako prowizoryczne.
Jednowierszowiec, który faktycznie działa.
Jeśli masz już zainstalowaną Ollamę, dzielą cię tylko dwa słowa:
ollama run qwen3.8:27b
Wsparcie dla Ollamy pojawiło się w wersji v0.32.12 — notatka wydania mówi wprost: „Ta wersja dodaje wsparcie dla Qwen 3.8 27B". Pierwsze uruchomienie pobiera domyślną kompilację (około 18 GB, Q4_K_M), a następnie przenosi do czatu REPL z trybem myślenia włączonym domyślnie. Strona biblioteki wymienia kompilację z tagami możliwości „vision tools thinking 27b", dzięki czemu wiesz, że ścieżki wizji i wywoływania narzędzi są podpięte do tego samego pobierania. W chwili pisania tego tekstu strona pokazuje ponad 40 000 pobrań i listę tagów obejmującą już jedenaście wariantów.

Dwa warianty, po które faktycznie sięgniesz:
• {{1}}ollama run qwen3.8:27b-mlx{{/1}} — wersja na Apple Silicon, ten sam rozmiar 18 GB, ale skompilowana pod Metal; to właśnie ją notatka wydania Ollamy optymalizuje „{{2}}pod kątem maksymalnej wydajności i jakości wyników odpowiednich dla powtarzalnych zadań i agentów kodowania{{/2}}”.
ollama run qwen3.8:27b-q8_0 — 8-bitowy kwant o rozmiarze 30 GB, gdy masz wystarczającą ilość VRAM i chcesz, aby wagi były bliższe pełnej precyzji.
Co faktycznie pobierasz
Nazwa mówi 27B, ale pełna liczba parametrów to 28B: 27.3B gęsty model językowy plus 461M enkoder wizyjny, który zapewnia natywne wejście obrazu i wideo. Pozostałe kluczowe specyfikacje, wprost z karty modelu:
• 64 warstwy, rozmiar ukryty 5 120, słownik 248 320.
• Atencja hybrydowa: 16 pełnych warstw Gated Attention i 48 liniowych warstw Gated DeltaNet — oszczędny miks 3:1 z przewagą warstw liniowych, dzięki któremu model 27B może utrzymać natywny kontekst 262 144 tokenów (rozszerzalny do 1M) bez pochłaniania przez cache KV całego centrum danych.
• Natywne rozumienie obrazów i wideo — „od diagramów STEM i dokumentów po filmy trwające godziny” to sformułowanie Alibaby.
• Apache 2.0. Pobierz go, zmodyfikuj go, sprzedaj na nim produkt. Ta licencja jest faktem prawnym, na którym opiera się ekonomia reszty tego artykułu.
Referencją pełnej precyzji jest BF16, dlatego istnieją tagi 56 GB; każdy mniejszy tag to wymiana precyzji na rozmiar, a własne benchmarki z karty modelu są tym, na czym tracisz.
Wybierz kwantyzację, a potem sprawdź swoją pamięć VRAM, a nie na odwrót.
Ollama daje ci jedenaście tagów, ale wybór sprowadza się do trzech rozmiarów.
• 18 GB — Q4_K_M (domyślna). W całości mieści się na karcie 24 GB (klasa RTX 4090 / 5090) przy normalnym kontekście, a na kartach 16 GB z częściowym odciążeniem CPU — wolniej, ale działa. To build, który „po prostu uruchamiasz”.
• 30 GB — Q8_0. Wagi o niemal pełnej precyzji wymagają około 40 GB VRAM, aby w całości zmieścić się na GPU. W przypadku 27B powinieneś już wiedzieć, dlaczego chcesz dodatkowej wierności, zanim za nią zapłacisz.
• 56 GB — BF16. Wersja referencyjna. Wymaga sprzętu klasy H100 lub 96 GB pamięci. Nikt nie uruchamia tego na konsumenckim GPU i to jest w porządku.

Liczba, która dezorientuje ludzi, to pamięć podręczna KV. Pobranie 18 GB nie oznacza, że 18 GB VRAM wystarczy na sesję z kontekstem 262K — przy długim kontekście pamięć podręczna dodaje kilka gigabajtów ponad wagi, dlatego karta z 24 GB VRAM pomieści ten model wygodnie przy kontekście 8K–32K, ale nie przy 262K. Na karcie balansującej na granicy zmniejsz kontekst, a nie kwantyzację.
Apple Silicon jest tutaj pełnoprawnym celem
Notatka z wydania Ollamy v0.32.12 w szczególności odnosi się do macOS. Konkretnie, `ollama run qwen3.8:27b-mlx` wymaga około 18 GB pamięci ujednoliconej, więc Mac z 24 GB+ uruchamia go w całości na GPU z zapasem na kontekst. Istnieje również tag mxfp8 MLX o wielkości 32 GB oraz tag mlx-bf16 o wielkości 56 GB dla maszyn z 64–128 GB. Jeśli Twój Mac z serii M śledził wieści o modelach klasy desktopowej, to jest ta wersja, na którą czekałeś.
262K na papierze, mniej w fotelu
Karta modelu wymienia 262 144 natywne tokeny, rozszerzalne do 1M; strona biblioteki Ollamy podaje to samo okno kontekstu jako 256K. Obie wartości są poprawne — 262 144 to 256K, czyli 256 razy 1024 — i żadna z nich nie oznacza, że powinieneś wpisać tę liczbę do --num-ctx na karcie z 24 GB. Pamięć podręczna KV rośnie mniej więcej liniowo wraz z rozmiarem kontekstu, więc na sprzęcie konsumenckim będziesz się poruszać w zakresie 16K–64K, a nie 262K. Zacznij od domyślnej wartości Ollamy, podnoś --num-ctx tylko wtedy, gdy zadanie naprawdę tego wymaga, i pamiętaj, że wartość 1M wymaga mechanizmu rozszerzania oraz VRAM, aby ją obsłużyć.
Co wciąż jest niepewne — przeczytaj to, zanim na to postawisz
• Nie ma jeszcze niezależnych benchmarków. Na dzień 15 sierpnia każda liczba na karcie modelu to tylko słowo Alibaba. Deklarowane poprawy względem Qwen3.6-27B są duże — SWE-bench Pro 61.7 vs 53.5, Terminal Bench 2.1 73.0 vs 63.4, LiveCodeBench v6 90.3 vs 83.9, GPQA Diamond 89.2 vs 87.8 — i wszystkie brzmią wiarygodnie, a żadna z nich nie została odtworzona przez zewnętrzny harness. Nie opieraj decyzji produkcyjnej wyłącznie na nich.
• Stos wizyjny ma zaledwie kilka dni. Wczesny raport o błędzie (ollama issue #17753) pokazał, że build Q4 przekazuje wejście wizyjne przez parser Qwen3.5 i zawodzi na obrazach; naprawiono go w ciągu kilku dni w PR #17755, ale multimodalna ścieżka w modelu mającym tydzień to dokładnie miejsce, które należy przetestować, zanim zacznie się na nim polegać.
• Domyślna kompilacja zawiera MTP. Tag q4_K_M to także kompilacja multi-token-prediction — szybsze dekodowanie i powód, dla którego "18 GB" i "27B" mogą współistnieć bez sprzeczności.
• Etykiety kwantyzacji mogą wprowadzać w błąd na Apple.Tagi „18 GB mlx" i „nvfp4" różnią się kwantyzacją — NVFP4 to format FP4 firmy NVIDIA — więc na Macu wybierz zwykłą wersję -mlx, chyba że potrzebujesz konkretnie wariantu FP8/FP4 dla GPU Blackwell.
„Free” robi w tym nagłówku dużo roboty.
Samodzielne hostowanie modelu 27B jest darmowe za token, ale nie jest darmowe. Uczciwe ujęcie to trzy opcje, które kosztują różne waluty:
• Uruchom to sam (Ollama). $0 za token, offline, nieograniczony, prywatny — a sprzęt jest twój. GPU 24 GB lub Mac 18 GB+ to realny koszt, podobnie jak prąd i czas konfiguracji. To właściwa decyzja, gdy Qwen3.8 27B stanie się codziennym narzędziem.
• Wywołaj API z limitem żądań za $0. OrcaRouter udostępnia Qwen3.8 27B na własnej infrastrukturze za zero kosztów (ID modelu: qwen/qwen3.8-27b-free, $0 za żądanie, limitowane) — ponieważ wagi są otwarte, nie ma żadnych kosztów dostawcy za token do przeniesienia. To właściwy wybór, gdy chcesz wypróbować model bez kupowania sprzętu, aby przetestować wersję sprzed tygodnia.
• Wywołaj nieograniczone API. Ten sam model bez limitu wywołań kosztuje 0,33 USD za milion tokenów wejściowych i 2,40 USD za milion tokenów wyjściowych w OrcaRouter (qwen/qwen3.8-27b, kontekst 262K, wejście tekstowe, obrazowe i wideo). To właściwy wybór, gdy potrzebujesz skali produkcyjnej i nie chcesz pilnować GPU.

Rachunek, który decyduje między nimi: sporadyczne użytkowanie bardziej się opłaca przy $0 lub $0.33/$2.40 niż przy cenie GPU; codzienne interaktywne użytkowanie jest tańsze lokalnie; ciągła przepustowość produkcyjna jest najtańsza jako API, którego nie trzeba utrzymywać przy życiu. Wymagania dotyczące prywatności i trybu offline przesuwają cię do pierwszej kolumny, bez względu na to, co mówi matematyka.
Gdy to zalecenie jest błędne
• Naprawdę potrzebujesz kontekstu 100K+. Model to potrafi; Twoja karta 24 GB nie potrafi. W prawdziwie długim kontekście GPU 40 GB+ lub API z dłuższym kontekstem to nie luksus.
• Potrzebujesz wideo w produkcji już dziś. Ścieżka wizyjna właśnie doczekała się naprawy błędu parsera; produkcja wideo na tygodniowym modelu multimodalnym to zakład, którego nie powinieneś obstawiać bez planu awaryjnego.
• Chcesz współbieżności. Jedna konsumencka karta graficzna obsługuje jedną lub dwie generacje na raz. Model 27B to nie serwer.
• Działasz na sprzęcie wyłącznie z CPU. Model 27B w kwantyzacji 4-bit na CPU to powolna demonstracja, a nie narzędzie. API to uczciwy wybór, dopóki nie masz GPU.
Najważniejsze
Qwen3.8 27B na Ollamie to najłatwiejszy sposób na uruchomienie obecnej generacji 27B, jaką ktokolwiek dotąd wypuścił: jedno polecenie, domyślne 18 GB mieszczące się na karcie 24 GB, pierwszorzędna wersja dla Apple Silicon i wolność na licencji Apache 2.0. Kwantyzacja, którą powinieneś wybrać, to prawie zawsze domyślna Q4_K_M — przejdź na q8_0 tylko wtedy, gdy możesz zmierzyć różnicę. A „free” jest warunkowe: jeśli będziesz korzystać z modelu okazjonalnie, API z limitem za 0 dolarów jest bardziej darmowe niż kupno sprzętu; jeśli stanie się Twoim codziennym narzędziem, lokalna kopia to najtańsza rzecz, jaką posiadasz. Zweryfikuj liczby, zanim na nich coś zbudujesz — wszystko w tym artykule było prawdziwe 15 sierpnia 2026, a ten model zmienia się z dnia na dzień.
