Karta tytułowa dla Qwen3.8-27B z MLX na Apple Silicon, przedstawiająca minimalistyczną ikonę laptopa z odznaką silnika MLX i metką z ceną z napisem „za darmo”, na Twoim Macu.
Guides & Insights

Qwen3.8-27B z MLX na Apple Silicon: Tak, działa — oto czego naprawdę potrzebujesz

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen3.8 27B działa dziś na Apple Silicon dzięki MLX. Tag to qwen3.8:27b-mlx w Ollama, dodany w Ollama v0.32.12, a wersja 4-bitowa pobiera około 18 GB i wymaga mniej więcej 16–19 GB pamięci zunifikowanej — co sprawia, że Mac z 24 GB+ to realistyczne minimum, a Mac z 16 GB nie wchodzi w grę. Wagi są na licencji Apache 2.0, bezpłatne w miejscu użycia na sprzęcie, który posiadasz, co jest całym sensem tego modelu. Wydanie Ali​baby ma dwa dni (13–14 sierpnia 2026), więc każda liczba poniżej jest oznaczona: co pochodzi z karty modelu Ali​baby, co zweryfikowaliśmy dziś na stronie Ollama, a co jest projekcją lub pomiarem zewnętrznym.

30-sekundowa karta informacyjna

Qwen3.8 27B to gęsty model Ali​baby o 27 miliardach parametrów, wydany 13–14 sierpnia 2026 roku na licencji Apache 2.0 — wagi trafiły na Hugging Face i ModelScope 13-go, a plik LICENSE pojawił się następnego ranka. Jest to wdrażalny gęsty odpowiednik modelu Qwen3.8-Max o 2,4 biliona parametrów. Z karty modelu: wszystkie dane podane przez Ali​babę, jeszcze niezależnie niepotwierdzone:

Rozmiar — 27B gęsty, 27,78B łącznie parametrów, licząc enkoder wizyjny.

Architektura — 64 warstwy, ukryty rozmiar 5 120, słownik 248 320.

Hybrydowa uwaga — 16 warstw pełnej uwagi oraz 48 liniowych warstw Gated DeltaNet, w stosunku 3:1.

Kontekst — 262,144 tokenów natywnie, rozszerzalny do 1M przez YaRN (Ollama podaje tag jako 256K).

Wejście — natywne rozumienie obrazów i wideo oprócz tekstu, od dokumentów po wideo trwające godziny.

Wagi — 55,6 GB w BF16, z dołączoną głowicą MTP do dekodowania spekulatywnego.

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

Po stronie MLX zweryfikowano dzisiaj: Ollama dostarcza qwen3.8:27b-mlx — natywną dla MLX kompilację dla Apple Silicon w formie ok. 18 GB pliku do pobrania w kwantyzacji 4-bitowej — a notatki wydania v0.32.12 podkreślają optymalizację pod Apple Silicon. mlx-lm, narzędzie Pythona od Apple, obsługuje tę architekturę do generowania i konwersji, a kwantyzacje MLX (3/5/6-bitowe, a także MXFP4 i NVFP4) pojawiły się w ciągu kilku godzin od udostępnienia wag. Pozostała część tego artykułu zakłada Maca z serii M z 24 GB lub więcej pamięci zunifikowanej.

Co MLX zmienia w pamięci

W Apple Silicon nie ma osobnej pamięci VRAM. MLX korzysta ze wspólnej puli pamięci serii M, więc liczy się całkowita ilość RAM w Macu minus to, co zajmują macOS i inne procesy. Model, który „mieści się w 17 GB", potrzebuje maszyny z wyraźnie większą pamięcią.

Dobra wiadomość jest taka, że utrzymanie Qwen3.8 27B jest tańsze, niż sugerowałaby liczba jego parametrów. Ponieważ tylko 16 warstw pełnej uwagi utrzymuje pamięć podręczną KV — a 48 warstw liniowych nie — koszt tej pamięci to około 64 KB na token, czyli mniej więcej jedna czwarta tego, co płaci konwencjonalny gęsty model o 64 warstwach. Na drugim końcu skali pełne okno o długości 262K tokenów wymaga ~16,4 GB pamięci podręcznej oprócz wag, co jest budżetem serwerowym, a nie budżetem laptopa.

Realistyczna skala dla Maca, rozmiar pliku plus zapas na cache:

4-bit MLX — ~16–19 GB łącznie. Mieści się na Macu z 24 GB i oknem około 64K–96K; to rozsądna opcja domyślna.

6-bit MLX — ~21–22 GB. Maszyny z 32 GB; poprawa jakości względem 4-bit jest niewielka.

8-bit MLX — ~27–30 GB. Maszyny 48 GB+; prawie bezstratnie.

BF16 — ~55.6 GB. Tylko najwyższej klasy komputery studio M-series Max i Ultra.

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

Źródła: wartość 4-bitowa odpowiada zmierzonemu GGUF Q4_K_M (17,1 GB, unsloth, 14 sierpnia) i pobraniu 18 GB z Ollamy; wartości 8-bitowe i BF16 odpowiadają karcie BF16 firmy Ali​baba i linii Qwen3.6-27B. Wartość pamięci podręcznej 64 KB na token wynika z architektury, a nie jest podana w arkuszu specyfikacji, i obowiązuje tylko dla środowisk uruchomieniowych, które pomijają pamięć podręczną KV w warstwach liniowych tak, jak robi to MLX.

Trzy sposoby uruchomienia — od najprostszego do dającego największą kontrolę.

Ścieżka A — Ollama, najprostsza

Zaktualizuj do Ollama 0.32.12 lub nowszej wersji, a następnie:

ollama pull qwen3.8:27b-mlx — pobiera wersję MLX o rozmiarze ~18 GB.

ollama run qwen3.8:27b-mlx — interaktywny czat z podłączonym szablonem myślenia.

ollama serve — udostępnia API kompatybilne z OpenAI na localhost:11434 dla twoich aplikacji.

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

Jedna znana niedogodność, z aktywnego zgłoszenia na GitHubie w chwili pisania: qwen3.8:27b-mlx odrzuca rolę "developer" w punkcie końcowym /v1/responses, co psuje ollama launch codex dla tego modelu — podczas gdy bezpośrednie uruchomienie ollama run działa poprawnie. Jeśli budujesz pętlę agenta w stylu Codex na wersji MLX, przetestuj dokładnie ten punkt końcowy, którego planujesz użyć, zanim oprzesz na nim swoją pętlę.

Ścieżka B — mlx-lm, największa kontrola

Własny zestaw narzędzi Apple. Zainstaluj go za pomocą pip install mlx-lm, a następnie albo pobierz wstępnie skwantowany checkpoint MLX, albo samodzielnie przekonwertuj oficjalne wagi BF16:

mlx_lm.generate --model <checkpoint> — uruchom checkpoint bezpośrednio; społecznościowe kwantyzacje 4-bitowe i 8-bitowe modelu 27B wciąż trafiały do mlx-community w ciągu kilku dni od premiery.

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — przekonwertuj raz; kosztuje około jednego pobrania.

mlx_lm.server --model <checkpoint> — Serwer zgodny z O​penAI, który automatycznie stosuje szablon czatu z blokiem myślowym.

Jeśli dokładnie ten quant, którego chcesz, nie jest jeszcze dostępny, przekonwertowanie oficjalnych wag to szybka sprawa na każdym Macu z serii M i usuwa wszelkie wątpliwości co do tego, co dostarczyła strona trzecia.

Ścieżka C — LM Studio, opcja jednego kliknięcia

LM Studio korzysta z backendu MLX na Apple Silicon i obsługuje Qwen3.8 27B od momentu premiery: wyszukaj model, wybierz kwantyzację dopasowaną do pamięci RAM, a on się pobierze i uruchomi. Jeśli wolisz GUI, to najbardziej przyjazna ścieżka, a nasz towarzyszący poradnik omawia ją od początku do końca — zobacz „How to Run Qwen3.8 27B Locally" w powiązanych artykułach poniżej.

Pułapka szablonu

Qwen3.8 27B domyślnie myśli, a bloki think są renderowane przez szablon czatu, a nie przez rdzeń modelu. Zewnętrzne testy z pierwszych 48 godzin wskazują, że oficjalny szablon opakowuje każdą turę asystenta w blok think — nawet te puste — a w wieloturowych pętlach agenta bloki się zagnieżdżają, a historia się ucina, co sprawia wrażenie amnezji. To nie wina kwantyzacji. Jeśli środowisko uruchomieniowe dostarcza poprawiony szablon, użyj go; gdy budujesz pętlę agenta i nie potrzebujesz rozumowania, wyłącz myślenie dla danego żądania — szablon czatu udostępnia flagę enable_thinking, a model przyjmuje reasoning_effort o wartości xhigh, medium lub low.

Jak to naprawdę jest

Niezależny test na Mac mini M4 z 32 GB pamięci zunifikowanej, przy użyciu wersji MLX 4-bit, zmierzył mniej więcej 5–6 tokenów/s generowania. To liczba, która powinna ustalić oczekiwania: wystarczająca do interaktywnego szkicowania, rozbudowanego rozumowania i okazjonalnych wywołań agentowych; uciążliwa przy długich pętlach agentowych i zadaniach wsadowych. Anegdota tego samego testera — kilkuminutowe myślenie, po którym nastąpiła mała aplikacja, która wyglądała poprawnie, ale w rzeczywistości się nie sumowała — jest dobrą przypominajką, że 27B na laptopie to asystent zdolny, ale nie nieomylny.

Szybkość skaluje się z poziomem układu: M-series Max z większą przepustowością pamięci i większą liczbą rdzeni działa wyraźnie szybciej niż podstawowy M4 w modelu mini. Ale 5–6 tok/s w wariancie podstawowym to uczciwa linia bazowa i każdy nagłówek o tym, że „działa na Apple Silicon”, należy oceniać właśnie w odniesieniu do niej.

Kontekst 262K to funkcja serwera.

Natywne okno 262K modelu Qwen3.8 27B jest naprawdę przydatne — ale na Macu ogranicza je pamięć, a nie sam model. Przy 64 KB pamięci podręcznej KV na token, okno 8K kosztuje około 0,5 GB, 32K około 2 GB, 128K około 8 GB, a pełne 262K około 16,4 GB ponad wagami. Na maszynie z 24 GB pamięci przy kwantyzacji 4-bitowej realny sufit to mniej więcej 64K–96K tokenów; zbliżanie się do 128K+ wymaga maszyny z 32 GB+, a pełne okno oznacza maszynę, której pamięć zunifikowana jest w większości pamięcią podręczną. Zaplanuj kontekst, którego faktycznie potrzebujesz, i ogranicz go w konfiguracji środowiska uruchomieniowego — model będzie zadowolony, a plik wymiany pozostanie cichy.

Kiedy Apple Silicon jest złą odpowiedzią

Wybierz inną ścieżkę, jeśli którekolwiek z tych jest Twoim obciążeniem:

• Masz Maca z 8 GB lub 16 GB. Wersja 4-bitowa już wymaga ~17 GB pamięci unifikowanej; mniej powoduje swapowanie i model staje się bezużyteczny. To najczęstsze przeoczenie i żadne sztuczki z kwantyzacją tego nie naprawią.

• Potrzebujesz pełnego okna 262K lub rozszerzenia YaRN 1M. Ten budżet KV to budżet serwera, a nie laptopa.

• Obsługujesz innych ludzi. Laptop to jedno stanowisko; obsługa wielu użytkowników wymaga serwera GPU lub hostowanego API.

• Musisz działać szybko w długich pętlach agentowych. 5–6 tok/s jest w porządku dla człowieka czytającego, ale zbyt wolne dla sub-agenta.

Mówiąc uczciwie: Qwen3.8 27B reklamuje się tym, że jest darmowy w momencie użycia na sprzęcie, który posiadasz — czyli jest przeciwieństwem modelu API, który pobiera opłatę za token. To właśnie dlatego nie ma go w katalogu OrcaRouter (katalog kieruje zapytania do wcześniejszej generacji Qwen3.6/3.5-27B oraz hostowanej linii API Qwen). Jesteśmy niewłaściwym narzędziem do historii o darmowym lokalnym modelu — i o to właśnie chodzi: gdy obciążenie przerasta możliwości Maca, alternatywą jest box GPU, wynajęte GPU lub hostowane API Qwen — a nie router, który akurat ma w ofercie ten konkretny model 27B.

Sedno sprawy

Qwen3.8 27B na Apple Silicon jest prawdziwy, jest dobry i ma wąskie zastosowanie. Wersja 4-bitowa MLX mieści się na Macu z 24 GB+ pamięci, instaluje się jako qwen3.8:27b-mlx w Ollamie, nie kosztuje nic za token i jest pierwszym realnie użytecznym modelem klasy agentowej o otwartej licencji, który mieści się w laptopie. Kompromisy to szybkość (5–6 tok/s na M4 mini) i kontekst (ogranicz go do wartości znacznie poniżej 262K, chyba że masz odpowiednią ilość RAM). Jeśli masz Maca z 24 GB+ pamięci i obciążenie, które 27B udźwignie, to jest najlepszy darmowy model lokalny dostępny w tym tygodniu. Jeśli masz Maca z 16 GB lub potrzebujesz przepustowości produkcyjnej, to nie jest — a alternatywą jest płatna ścieżka, co jest zupełnie inną decyzją.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube