Een titelkaart voor Qwen3.8-27B met MLX op Apple Silicon, met een minimalistisch laptopicoon met een MLX-enginebadge en een prijskaartje met de tekst 'gratis', op je Mac.
Guides & Insights

Qwen3.8-27B met MLX op Apple Silicon: Ja, het draait — Dit is wat je echt nodig hebt

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Qwen3.8 27B draait vandaag op Apple Silicon via MLX. De tag is qwen3.8:27b-mlx in Ollama, toegevoegd in Ollama v0.32.12, en de 4-bit-build downloadt ongeveer 18 GB en heeft ruwweg 16–19 GB unified memory nodig — waardoor een Mac met 24 GB+ de realistische ondergrens is en een Mac met 16 GB afvalt. De gewichten vallen onder Apache 2.0, gratis op het moment van gebruik op hardware die je zelf bezit, en dat is precies het punt van het model. Ali​baba's release is twee dagen oud (13–14 augustus 2026), dus elk getal hieronder is gelabeld: wat afkomstig is van Ali​baba's modelkaart, wat we vandaag op de Ollama-pagina hebben geverifieerd, en wat een externe projectie of meting is.

De 30-seconden factsheet

Qwen3.8 27B is Ali​baba's dense model met 27 miljard parameters, uitgebracht op 13–14 augustus 2026 onder Apache 2.0 — de gewichten verschenen op de 13e op Hugging Face en ModelScope, en het LICENSE-bestand verscheen de volgende ochtend. Het is de inzetbare dense tegenhanger van Qwen3.8-Max, dat 2,4 biljoen parameters telt. Volgens de modelkaart: alles door Ali​baba gerapporteerd en nog niet onafhankelijk gereproduceerd:

• Grootte — 27B dense, 27,78B totale parameters, de vision-encoder meegerekend.

• Architectuur — 64 lagen, verborgen grootte 5.120, vocabulaire 248.320.

• Hybride aandacht — 16 full-attention-lagen plus 48 Gated DeltaNet lineaire lagen, een verhouding van 3:1.

• Context — 262.144 tokens native, uitbreidbaar tot 1M via YaRN (Ollama vermeldt de tag op 256K).

• Invoer — native beeld- en videobegrip bovenop tekst, van documenten tot video van een uur.

• Gewichten — 55.6 GB in BF16, MTP speculatieve-decoderingkop inbegrepen.

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

Aan de MLX-kant, vandaag geverifieerd: Ollama levert qwen3.8:27b-mlx — een MLX-native build voor Apple Silicon met een ~18 GB 4-bit download — en de release notes van v0.32.12 benadrukken de optimalisatie voor Apple Silicon. mlx-lm, Apple's Python-toolchain, ondersteunt de architectuur voor generatie en conversie, en MLX-kwantizaties (3/5/6-bit, plus MXFP4 en NVFP4) verschenen binnen enkele uren na het verschijnen van de weights. De rest van dit artikel gaat uit van een Mac uit de M-serie met 24 GB of meer unified memory.

Wat MLX verandert aan geheugen

Op Apple Silicon is er geen apart VRAM. MLX draait op de unified memory-pool van de M-serie, dus het getal dat telt is het totale RAM in je Mac minus wat macOS en al het andere in beslag neemt. Een model dat "in 17 GB past" vereist een machine met ruim meer dan dat.

Het goede nieuws is dat Qwen3.8 27B goedkoper is om vast te houden dan het aantal parameters doet vermoeden. Omdat alleen de 16 full-attention-lagen een KV-cache bijhouden — de 48 lineaire lagen niet — kost de cache ongeveer 64 KB per token, ruwweg een kwart van wat een conventioneel dense model met 64 lagen kwijt is. Aan het andere uiterste vergt het volledige venster van 262K ongeveer 16,4 GB cache bovenop de gewichten, wat een serverbudget is, geen laptopbudget.

De realistische ladder voor een Mac, bestandsgrootte plus cache-headroom:

• 4-bit MLX — in totaal ~16–19 GB. Past op een 24GB-Mac met een venster van circa 64K–96K; de verstandige standaard.

• 6-bit MLX — ~21–22 GB. 32 GB-machines; de kwaliteitssprong ten opzichte van 4-bit is bescheiden.

• 8-bit MLX — ~27–30 GB. Machines met 48 GB+; bijna verliesvrij.

• BF16 — ongeveer 55,6 GB. Alleen de topmodellen van de M-serie Max en Ultra studio-machines.

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

Bronvermelding: het 4-bit-cijfer volgt de gemeten GGUF Q4_K_M (17,1 GB, unsloth, 14 augustus) en de 18 GB Ollama-download; de 8-bit- en BF16-cijfers volgen Ali​baba's eigen BF16-kaart en de Qwen3.6-27B-lijn. Het cijfer voor de cache van 64 KB per token is afgeleid van de architectuur, niet afgedrukt op een specificatieblad, en geldt alleen voor runtimes die de KV-cache op de lineaire lagen overslaan, zoals MLX dat doet.

Drie manieren om het uit te voeren, van de eenvoudigste tot de meeste controle

Pad A — Ollama, de eenvoudigste

Upgrade naar Ollama 0.32.12 of nieuwer, en dan:

• ollama pull qwen3.8:27b-mlx — downloadt de ~18 GB MLX-build.

• ollama run qwen3.8:27b-mlx — interactieve chat met het denk-sjabloon aangesloten.

• ollama serve — stelt de OpenAI-compatibele API beschikbaar op localhost:11434 voor je apps.

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

Een bekend probleem, afkomstig van een live GitHub-issue op het moment van schrijven: qwen3.8:27b-mlx weigert de 'developer'-rol op het /v1/responses-eindpunt, waardoor ollama launch codex voor dit model breekt — terwijl direct ollama run prima werkt. Als je een Codex-achtige agentloop op de MLX-build bouwt, test dan het exacte eindpunt dat je van plan bent te gebruiken voordat je de loop erop verwedt.

Pad B — mlx-lm, de meeste controle

Apple's eigen toolkit. Installeer het met pip install mlx-lm, haal vervolgens ofwel een vooraf gekwantiseerd MLX-checkpoint binnen, of converteer zelf de officiële BF16-gewichten:

• mlx_lm.generate --model <checkpoint>voer een checkpoint direct uit; community 4-bit- en 8-bit-quants van de 27B werden nog binnen enkele dagen na de release in mlx-community geplaatst.

• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — eenmalig converteren; kost ongeveer één download.

• mlx_lm.server --model <checkpoint> — O​penAI-compatibele server die de denkblok-chatsjabloon voor u toepast.

Als de exacte quant die je wilt nog niet online staat, is het converteren van de officiële gewichten een kleine klus op elke M-serie Mac en neemt het alle twijfel weg over wat een derde partij heeft geleverd.

Pad C — LM Studio, de één-klik-optie

LM Studio gebruikt de MLX-backend op Apple Silicon en ondersteunt Qwen3.8 27B sinds de release: zoek naar het model, kies een quant die in je RAM past, en het wordt gedownload en draait. Als je de voorkeur geeft aan een GUI, is dit de gebruiksvriendelijkste optie, en onze bijbehorende walkthrough behandelt het van begin tot eind — zie "How to Run Qwen3.8 27B Locally" in de gerelateerde artikelen hieronder.

De sjabloonval

Qwen3.8 27B denkt standaard na, en de think-blokken worden door de chat-template gerenderd, niet door de modelkern. Tests van derden in de eerste 48 uur merken op dat de officiële template elke assistentbeurt in een think-blok verpakt — zelfs lege blokken — en dat in multi-turn-agentloops de blokken in elkaar genest raken en de geschiedenis wordt afgekapt, wat als amnesie overkomt. Het komt niet door de kwantisatie. Als een runtime een gecorrigeerde template meelevert, gebruik die; wanneer je een agentloop bouwt en de redenering niet nodig hebt, schakel het denken per verzoek uit — de chat-template stelt een enable_thinking-vlag beschikbaar, en het model accepteert een reasoning_effort van xhigh, medium of low.

Hoe het eigenlijk aanvoelt

Een onafhankelijke test op een Mac mini M4 met 32 GB aan unified geheugen, met de MLX 4-bit-build, mat een generatie van ongeveer 5–6 tokens/s. Dat is het getal dat de verwachtingen moet bepalen: prima voor interactief opstellen, langdurig redeneren en incidentele agent-aanroepen; pijnlijk voor lange agentische lussen en batchtaken. De anekdote van dezelfde tester — een denkproces van meerdere minuten, gevolgd door een kleine applicatie die er goed uitzag maar niet echt klopte — is een goede herinnering dat een 27B op een laptop een capabele maar niet onfeilbare assistent is.

Snelheid schaalt mee met het chiptype: een M-serie Max met meer geheugenbandbreedte en kernen draait aanzienlijk sneller dan de basis-M4 in de mini. Maar 5–6 tok/s op het instapmodel is de eerlijke basislijn, en je moet elke 'draait op Apple Silicon'-kop eraan afmeten.

De 262K context is een serverfunctie.

Het native 262K-venster van Qwen3.8 27B is echt nuttig — maar op een Mac wordt het beperkt door geheugen, niet door het model. Bij 64 KB KV-cache per token kost een 8K-venster ongeveer 0,5 GB, 32K ongeveer 2 GB, 128K ongeveer 8 GB, en het volledige 262K ongeveer 16,4 GB bovenop de gewichten. Op een 24 GB-machine die 4-bit draait, ligt de realistische bovengrens op ongeveer 64K–96K tokens; richting 128K+ betekent een 32 GB+ machine, en het volledige venster betekent een machine waarvan het unified geheugen grotendeels uit cache bestaat. Plan de context die je daadwerkelijk nodig hebt en begrens die in de runtime-config — het model is tevreden, en je wisselbestand blijft rustig.

Wanneer Apple Silicon het verkeerde antwoord is

Neem een ander pad als een van deze jouw workload is:

• Je hebt een Mac van 8 GB of 16 GB. De 4-bits build heeft al ~17 GB aan unified geheugen nodig; alles minder zorgt voor swapping en het model wordt onbruikbaar. Dit is verreweg de meest gemaakte fout, en geen enkele quantisatietruc lost dat op.

• Je hebt het volledige 262K-venster nodig of de 1M YaRN-extensie. Dat KV-budget is een serverbudget, geen laptopbudget.

• Je bedient andere mensen. Een laptop is één zitplaats; voor doorvoer met meerdere gebruikers heb je een GPU-box of een gehoste API nodig.

• Je moet snel zijn bij lange agentische loops. 5–6 tok/s is prima voor een mens die meeleest, maar langzaam voor een sub-agent.

De eerlijke framing: de pitch van Qwen3.8 27B is dat het {{2}}gratis is op het moment van gebruik op hardware die je zelf bezit{{/2}} — {{3}}het tegenovergestelde van een API-model dat per token rekent{{/3}}. Dat is {{4}}precies waarom het niet in de OrcaRouter-catalogus staat{{/4}} ({{5}}de catalogus routeert de eerdere Qwen3.6/3.5-27B-generatie en de gehoste Qwe​n API-lijn{{/5}}). We zijn {{6}}het verkeerde hulpmiddel voor het gratis-lokale verhaal{{/6}}, en dat is precies het punt: {{7}}wanneer een workload een Mac ontgroeit, zijn de alternatieven een GPU-box, een gehuurde GPU, of een gehoste Qwe​n API{{/7}} — {{8}}geen router die toevallig deze specifieke 27B aanbiedt{{/8}}.

Kortom

Qwen3.8 27B op Apple Silicon is echt, het is goed, en het heeft een nauw afgebakende scope. De 4-bit MLX-build past op een Mac met 24 GB of meer, wordt in Ollama gedownload als qwen3.8:27b-mlx, kost niets per token, en is het eerste echt bruikbare agent-grade open model dat in een laptop past. De afwegingen zijn snelheid (5–6 tok/s op een M4 mini) en context (houd het ruim onder 262K tenzij je genoeg RAM hebt). Als je een Mac met 24 GB of meer hebt en een werklast die een 27B aankan, is dit het beste gratis lokale model dat deze week beschikbaar is. Als je een Mac met 16 GB hebt of productiedoorvoer nodig hebt, is het dat niet — en het alternatief is een betaald pad, wat een heel andere beslissing is.