
Qwen3.8-27B z MLX na Apple Silicon: Tak, działa — oto czego naprawdę potrzebujesz
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 za 1 mln tokenów · 22 tok/s
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
Qwen3.8 27B działa dziś na Apple Silicon dzięki MLX. Tag to qwen3.8:27b-mlx w Ollama, dodany w Ollama v0.32.12, a wersja 4-bitowa pobiera około 18 GB i wymaga mniej więcej 16–19 GB pamięci zunifikowanej — co sprawia, że Mac z 24 GB+ to realistyczne minimum, a Mac z 16 GB nie wchodzi w grę. Wagi są na licencji Apache 2.0, bezpłatne w miejscu użycia na sprzęcie, który posiadasz, co jest całym sensem tego modelu. Wydanie Alibaby ma dwa dni (13–14 sierpnia 2026), więc każda liczba poniżej jest oznaczona: co pochodzi z karty modelu Alibaby, co zweryfikowaliśmy dziś na stronie Ollama, a co jest projekcją lub pomiarem zewnętrznym.
30-sekundowa karta informacyjna
Qwen3.8 27B to gęsty model Alibaby o 27 miliardach parametrów, wydany 13–14 sierpnia 2026 roku na licencji Apache 2.0 — wagi trafiły na Hugging Face i ModelScope 13-go, a plik LICENSE pojawił się następnego ranka. Jest to wdrażalny gęsty odpowiednik modelu Qwen3.8-Max o 2,4 biliona parametrów. Z karty modelu: wszystkie dane podane przez Alibabę, jeszcze niezależnie niepotwierdzone:
• Rozmiar — 27B gęsty, 27,78B łącznie parametrów, licząc enkoder wizyjny.
• Architektura — 64 warstwy, ukryty rozmiar 5 120, słownik 248 320.
• Hybrydowa uwaga — 16 warstw pełnej uwagi oraz 48 liniowych warstw Gated DeltaNet, w stosunku 3:1.
• Kontekst — 262,144 tokenów natywnie, rozszerzalny do 1M przez YaRN (Ollama podaje tag jako 256K).
• Wejście — natywne rozumienie obrazów i wideo oprócz tekstu, od dokumentów po wideo trwające godziny.
• Wagi — 55,6 GB w BF16, z dołączoną głowicą MTP do dekodowania spekulatywnego.

Po stronie MLX zweryfikowano dzisiaj: Ollama dostarcza qwen3.8:27b-mlx — natywną dla MLX kompilację dla Apple Silicon w formie ok. 18 GB pliku do pobrania w kwantyzacji 4-bitowej — a notatki wydania v0.32.12 podkreślają optymalizację pod Apple Silicon. mlx-lm, narzędzie Pythona od Apple, obsługuje tę architekturę do generowania i konwersji, a kwantyzacje MLX (3/5/6-bitowe, a także MXFP4 i NVFP4) pojawiły się w ciągu kilku godzin od udostępnienia wag. Pozostała część tego artykułu zakłada Maca z serii M z 24 GB lub więcej pamięci zunifikowanej.
Co MLX zmienia w pamięci
W Apple Silicon nie ma osobnej pamięci VRAM. MLX korzysta ze wspólnej puli pamięci serii M, więc liczy się całkowita ilość RAM w Macu minus to, co zajmują macOS i inne procesy. Model, który „mieści się w 17 GB", potrzebuje maszyny z wyraźnie większą pamięcią.
Dobra wiadomość jest taka, że utrzymanie Qwen3.8 27B jest tańsze, niż sugerowałaby liczba jego parametrów. Ponieważ tylko 16 warstw pełnej uwagi utrzymuje pamięć podręczną KV — a 48 warstw liniowych nie — koszt tej pamięci to około 64 KB na token, czyli mniej więcej jedna czwarta tego, co płaci konwencjonalny gęsty model o 64 warstwach. Na drugim końcu skali pełne okno o długości 262K tokenów wymaga ~16,4 GB pamięci podręcznej oprócz wag, co jest budżetem serwerowym, a nie budżetem laptopa.
Realistyczna skala dla Maca, rozmiar pliku plus zapas na cache:
• 4-bit MLX — ~16–19 GB łącznie. Mieści się na Macu z 24 GB i oknem około 64K–96K; to rozsądna opcja domyślna.
• 6-bit MLX — ~21–22 GB. Maszyny z 32 GB; poprawa jakości względem 4-bit jest niewielka.
• 8-bit MLX — ~27–30 GB. Maszyny 48 GB+; prawie bezstratnie.
• BF16 — ~55.6 GB. Tylko najwyższej klasy komputery studio M-series Max i Ultra.

Źródła: wartość 4-bitowa odpowiada zmierzonemu GGUF Q4_K_M (17,1 GB, unsloth, 14 sierpnia) i pobraniu 18 GB z Ollamy; wartości 8-bitowe i BF16 odpowiadają karcie BF16 firmy Alibaba i linii Qwen3.6-27B. Wartość pamięci podręcznej 64 KB na token wynika z architektury, a nie jest podana w arkuszu specyfikacji, i obowiązuje tylko dla środowisk uruchomieniowych, które pomijają pamięć podręczną KV w warstwach liniowych tak, jak robi to MLX.
Trzy sposoby uruchomienia — od najprostszego do dającego największą kontrolę.
Ścieżka A — Ollama, najprostsza
Zaktualizuj do Ollama 0.32.12 lub nowszej wersji, a następnie:
• ollama pull qwen3.8:27b-mlx — pobiera wersję MLX o rozmiarze ~18 GB.
• ollama run qwen3.8:27b-mlx — interaktywny czat z podłączonym szablonem myślenia.
• ollama serve — udostępnia API kompatybilne z OpenAI na localhost:11434 dla twoich aplikacji.

Jedna znana niedogodność, z aktywnego zgłoszenia na GitHubie w chwili pisania: qwen3.8:27b-mlx odrzuca rolę "developer" w punkcie końcowym /v1/responses, co psuje ollama launch codex dla tego modelu — podczas gdy bezpośrednie uruchomienie ollama run działa poprawnie. Jeśli budujesz pętlę agenta w stylu Codex na wersji MLX, przetestuj dokładnie ten punkt końcowy, którego planujesz użyć, zanim oprzesz na nim swoją pętlę.
Ścieżka B — mlx-lm, największa kontrola
Własny zestaw narzędzi Apple. Zainstaluj go za pomocą pip install mlx-lm, a następnie albo pobierz wstępnie skwantowany checkpoint MLX, albo samodzielnie przekonwertuj oficjalne wagi BF16:
• mlx_lm.generate --model <checkpoint> — uruchom checkpoint bezpośrednio; społecznościowe kwantyzacje 4-bitowe i 8-bitowe modelu 27B wciąż trafiały do mlx-community w ciągu kilku dni od premiery.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — przekonwertuj raz; kosztuje około jednego pobrania.
• mlx_lm.server --model <checkpoint> — Serwer zgodny z OpenAI, który automatycznie stosuje szablon czatu z blokiem myślowym.
Jeśli dokładnie ten quant, którego chcesz, nie jest jeszcze dostępny, przekonwertowanie oficjalnych wag to szybka sprawa na każdym Macu z serii M i usuwa wszelkie wątpliwości co do tego, co dostarczyła strona trzecia.
Ścieżka C — LM Studio, opcja jednego kliknięcia
LM Studio korzysta z backendu MLX na Apple Silicon i obsługuje Qwen3.8 27B od momentu premiery: wyszukaj model, wybierz kwantyzację dopasowaną do pamięci RAM, a on się pobierze i uruchomi. Jeśli wolisz GUI, to najbardziej przyjazna ścieżka, a nasz towarzyszący poradnik omawia ją od początku do końca — zobacz „How to Run Qwen3.8 27B Locally" w powiązanych artykułach poniżej.
Pułapka szablonu
Qwen3.8 27B domyślnie myśli, a bloki think są renderowane przez szablon czatu, a nie przez rdzeń modelu. Zewnętrzne testy z pierwszych 48 godzin wskazują, że oficjalny szablon opakowuje każdą turę asystenta w blok think — nawet te puste — a w wieloturowych pętlach agenta bloki się zagnieżdżają, a historia się ucina, co sprawia wrażenie amnezji. To nie wina kwantyzacji. Jeśli środowisko uruchomieniowe dostarcza poprawiony szablon, użyj go; gdy budujesz pętlę agenta i nie potrzebujesz rozumowania, wyłącz myślenie dla danego żądania — szablon czatu udostępnia flagę enable_thinking, a model przyjmuje reasoning_effort o wartości xhigh, medium lub low.
Jak to naprawdę jest
Niezależny test na Mac mini M4 z 32 GB pamięci zunifikowanej, przy użyciu wersji MLX 4-bit, zmierzył mniej więcej 5–6 tokenów/s generowania. To liczba, która powinna ustalić oczekiwania: wystarczająca do interaktywnego szkicowania, rozbudowanego rozumowania i okazjonalnych wywołań agentowych; uciążliwa przy długich pętlach agentowych i zadaniach wsadowych. Anegdota tego samego testera — kilkuminutowe myślenie, po którym nastąpiła mała aplikacja, która wyglądała poprawnie, ale w rzeczywistości się nie sumowała — jest dobrą przypominajką, że 27B na laptopie to asystent zdolny, ale nie nieomylny.
Szybkość skaluje się z poziomem układu: M-series Max z większą przepustowością pamięci i większą liczbą rdzeni działa wyraźnie szybciej niż podstawowy M4 w modelu mini. Ale 5–6 tok/s w wariancie podstawowym to uczciwa linia bazowa i każdy nagłówek o tym, że „działa na Apple Silicon”, należy oceniać właśnie w odniesieniu do niej.
Kontekst 262K to funkcja serwera.
Natywne okno 262K modelu Qwen3.8 27B jest naprawdę przydatne — ale na Macu ogranicza je pamięć, a nie sam model. Przy 64 KB pamięci podręcznej KV na token, okno 8K kosztuje około 0,5 GB, 32K około 2 GB, 128K około 8 GB, a pełne 262K około 16,4 GB ponad wagami. Na maszynie z 24 GB pamięci przy kwantyzacji 4-bitowej realny sufit to mniej więcej 64K–96K tokenów; zbliżanie się do 128K+ wymaga maszyny z 32 GB+, a pełne okno oznacza maszynę, której pamięć zunifikowana jest w większości pamięcią podręczną. Zaplanuj kontekst, którego faktycznie potrzebujesz, i ogranicz go w konfiguracji środowiska uruchomieniowego — model będzie zadowolony, a plik wymiany pozostanie cichy.
Kiedy Apple Silicon jest złą odpowiedzią
Wybierz inną ścieżkę, jeśli którekolwiek z tych jest Twoim obciążeniem:
• Masz Maca z 8 GB lub 16 GB. Wersja 4-bitowa już wymaga ~17 GB pamięci unifikowanej; mniej powoduje swapowanie i model staje się bezużyteczny. To najczęstsze przeoczenie i żadne sztuczki z kwantyzacją tego nie naprawią.
• Potrzebujesz pełnego okna 262K lub rozszerzenia YaRN 1M. Ten budżet KV to budżet serwera, a nie laptopa.
• Obsługujesz innych ludzi. Laptop to jedno stanowisko; obsługa wielu użytkowników wymaga serwera GPU lub hostowanego API.
• Musisz działać szybko w długich pętlach agentowych. 5–6 tok/s jest w porządku dla człowieka czytającego, ale zbyt wolne dla sub-agenta.
Mówiąc uczciwie: Qwen3.8 27B reklamuje się tym, że jest darmowy w momencie użycia na sprzęcie, który posiadasz — czyli jest przeciwieństwem modelu API, który pobiera opłatę za token. To właśnie dlatego nie ma go w katalogu OrcaRouter (katalog kieruje zapytania do wcześniejszej generacji Qwen3.6/3.5-27B oraz hostowanej linii API Qwen). Jesteśmy niewłaściwym narzędziem do historii o darmowym lokalnym modelu — i o to właśnie chodzi: gdy obciążenie przerasta możliwości Maca, alternatywą jest box GPU, wynajęte GPU lub hostowane API Qwen — a nie router, który akurat ma w ofercie ten konkretny model 27B.
Sedno sprawy
Qwen3.8 27B na Apple Silicon jest prawdziwy, jest dobry i ma wąskie zastosowanie. Wersja 4-bitowa MLX mieści się na Macu z 24 GB+ pamięci, instaluje się jako qwen3.8:27b-mlx w Ollamie, nie kosztuje nic za token i jest pierwszym realnie użytecznym modelem klasy agentowej o otwartej licencji, który mieści się w laptopie. Kompromisy to szybkość (5–6 tok/s na M4 mini) i kontekst (ogranicz go do wartości znacznie poniżej 262K, chyba że masz odpowiednią ilość RAM). Jeśli masz Maca z 24 GB+ pamięci i obciążenie, które 27B udźwignie, to jest najlepszy darmowy model lokalny dostępny w tym tygodniu. Jeśli masz Maca z 16 GB lub potrzebujesz przepustowości produkcyjnej, to nie jest — a alternatywą jest płatna ścieżka, co jest zupełnie inną decyzją.
