Ett titelkort för Qwen3.8-27B med MLX på Apple Silicon, som visar en minimalistisk laptopikon med ett MLX-motormärke och en prislapp som säger gratis, på din Mac.
Guides & Insights

Qwen3.8-27B med MLX på Apple Silicon: Ja, den kör — Här är vad du verkligen behöver

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Qwen3.8 27B körs på Apple Silicon idag via MLX. Taggen är qwen3.8:27b-mlx i Ollama, tillagd i Ollama v0.32.12, och 4-bitarsversionen är cirka 18 GB att ladda ner och kräver ungefär 16–19 GB enhetligt minne — vilket gör en 24 GB+ Mac till den realistiska lägstanivån och en 16 GB Mac till ett icke-alternativ. Vikterna är Apache 2.0, gratis att använda på hårdvara du äger, vilket är hela poängen med modellen. Ali​babas release är två dagar gammal (13–14 augusti 2026), så varje siffra nedan är märkt: vad som kommer från Ali​babas modellkort, vad vi verifierade på Ollama-sidan idag, och vad som är tredjepartsprognos eller -mätning.

30-sekundersfaktabladet

Qwen3.8 27B är Alibabas täta modell med 27 miljarder parametrar, släppt den 13–14 augusti 2026 under Apache 2.0 — vikterna publicerades på Hugging Face och ModelScope den 13:e, med LICENSE-filen som dök upp nästa morgon. Den är den distribuerbara täta syskonmodellen till Qwen3.8-Max med 2,4 biljoner parametrar. Från modellkortet, allt rapporterat av Alibaba och ännu inte oberoende reproducerat:

Storlek — 27B täta, 27.78B totala parametrar inklusive vision-encodern.

Arkitektur — 64 lager, dold storlek 5,120, vokabulär 248,320.

Hybrid attention — 16 full-attention-lager plus 48 linjära Gated DeltaNet-lager, ett förhållande på 3:1.

Kontext — 262 144 tokens inbyggt, utbyggbart till 1M via YaRN (Ollama listar taggen som 256K).

Inmatning — inbyggd bild- och videoförståelse utöver text, från dokument till timslång video.

Vikter — 55,6 GB i BF16, MTP-spekulativ avkodningshuvud ingår.

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

På MLX-sidan, verifierat idag: Ollama levererar qwen3.8:27b-mlx — en MLX-nativ build för Apple Silicon med en ~18 GB 4-bitars nedladdning — och versionsnoterna för v0.32.12 lyfter fram Apple Silicon-optimering. mlx-lm, Apples Python-verktygskedja, stödjer arkitekturen för generering och konvertering, och MLX-kvantiseringar (3/5/6-bitars, plus MXFP4 och NVFP4) dök upp inom några timmar efter vikterna. Resten av denna artikel förutsätter en M-serie Mac med 24 GB eller mer enhetligt minne.

Vad MLX ändrar angående minne

På Apple Silicon finns det inget separat VRAM. MLX körs på M-seriens enhetliga minnespool, så det antal som räknas är det totala RAM-minnet i din Mac minus vad macOS och allt annat håller. En modell som "ryms i 17 GB" behöver en maskin med bekvämt mer än så.

Den goda nyheten är att Qwen3.8 27B är billigare att hålla i minnet än vad parameterantalet antyder. Eftersom endast de 16 full-attention-lagren håller en KV-cache – de 48 linjära lagren gör det inte – kostar cachen ungefär 64 KB per token, ungefär en fjärdedel av vad en konventionell 64-lagers tät modell betalar. I andra änden kräver det fulla 262K-fönstret ~16,4 GB cache utöver vikterna, vilket är en serverbudget, inte en laptopbudget.

Den realistiska stegen för en Mac, filstorlek plus cacheutrymme:

4-bit MLX — ~16–19 GB totalt. Passar en 24 GB Mac med ungefär ett 64K–96K-fönster; det förnuftiga standardvalet.

6-bit MLX — ~21–22 GB. 32 GB-maskiner; kvalitetshoppet jämfört med 4-bit är blygsamt.

8-bit MLX — ~27–30 GB. Maskiner med 48 GB+; nära förlustfritt.

BF16 — ~55,6 GB. Endast de mest avancerade M-seriens Max- och Ultra-studiomaskinerna.

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

Källhänvisning: 4-bitarsiffran följer den uppmätta GGUF Q4_K_M (17,1 GB, unsloth, 14 augusti) och Ollama-nedladdningen på 18 GB; 8-bitars- och BF16-siffrorna följer Ali​babas eget BF16-kort och Qwen3.6-27B-linjen. Siffran för 64 KB per token-cache härleds från arkitekturen, inte från ett specifikationsblad, och gäller endast för körtider som hoppar över KV-cachen på de linjära lagren på samma sätt som MLX gör.

Tre sätt att köra det, från enklast till mest kontroll.

Väg A — Ollama, det enklaste

Uppgradera till Ollama 0.32.12 eller nyare, sedan:

ollama pull qwen3.8:27b-mlx — laddar ner den ~18 GB stora MLX-versionen.

ollama run qwen3.8:27b-mlx — interaktiv chatt med thinking-mallen inkopplad.

ollama serve — exponerar det OpenAI-kompatibla API:t på localhost:11434 för dina appar.

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

En känd brist, från en aktiv GitHub-issue vid skrivande stund: qwen3.8:27b-mlx avvisar rollen "developer" på /v1/responses-endpointen, vilket bryter ollama launch codex för denna modell — medan direkt ollama run fungerar utmärkt. Om du bygger en Codex-liknande agentloop på MLX-bygget, testa exakt den endpoint du planerar att använda innan du satsar loopen på den.

Sökväg B — mlx-lm, mest kontroll.

Apples egen verktygslåda. Installera den med pip install mlx-lm, dra sedan antingen en förkvantiserad MLX-checkpoint eller konvertera de officiella BF16-vikterna själv:

mlx_lm.generate --model <checkpoint> — kör en checkpoint direkt; communityns 4-bitars och 8-bitars kvantiseringar av 27B lanserades fortfarande i mlx-community inom några dagar efter releasen.

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — konvertera en gång; kostar ungefär en nedladdning.

mlx_lm.server --model <checkpoint> — O​penAI-kompatibel server som tillämpar thinking-block-chatmallen åt dig.

Om den exakta kvantiseringen du vill ha inte finns uppe ännu, är konvertering från de officiella vikterna ett snabbt jobb på vilken M-serie Mac som helst och eliminerar alla tvivel om vad en tredje part har levererat.

Alternativ C — LM Studio, ettklicksalternativet

LM Studio använder MLX-backend på Apple Silicon och lade till stöd för Qwen3.8 27B vid lanseringen: sök efter modellen, välj en kvantisering som passar ditt RAM, så laddas den ner och körs. Om du föredrar ett GUI är detta den användarvänligaste vägen, och vår tillhörande guide täcker det från början till slut — se "How to Run Qwen3.8 27B Locally" i relaterade artiklar nedan.

Mallfällan

Qwen3.8 27B tänker som standard, och tankeblocken renderas av chattmallen, inte modellkärnan. Tester från tredje part under de första 48 timmarna noterar att den officiella mallen omsluter varje assistenttur i ett tankeblock – även tomma sådana – och att blocken i flervarviga agentloopar kapslas och historien trunkeras, vilket känns som minnesförlust. Det är inte kvantiseringen. Om en runtime levererar en korrigerad mall, använd den; när du bygger en agentloop och inte behöver resonemanget, inaktivera tänkande per förfrågan – chattmallen exponerar en enable_thinking-flagga, och modellen tar emot en reasoning_effort på xhigh, medium eller low.

Hur det faktiskt känns

Ett oberoende test på en Mac mini M4 med 32 GB enhetligt minne, som körde MLX 4-bitarsversionen, uppmätte ungefär 5–6 tokens/s i generering. Det är den siffra som bör sättas som förväntning: bra för interaktivt utkastarbete, längre resonemang och enstaka agentanrop; smärtsamt för långa agentiska loopar och batchjobb. Samma testares anekdot — en flera minuter lång tankeprocess följd av en liten applikation som såg rätt ut men som inte faktiskt gick ihop — är en bra påminnelse om att en 27B på en bärbar dator är en kapabel men inte ofelbar assistent.

Hastigheten skalar med chipnivån: en M-series Max med mer minnesbandbredd och fler kärnor kör märkbart snabbare än bas-M4:an i mini. Men 5–6 tok/s på ingångsmodellen är den ärliga baslinjen, och du bör bedöma alla "körs på Apple Silicon"-rubriker mot den.

262K-kontexten är en serverfunktion.

Qwen3.8 27B:s inbyggda 262K-fönster är verkligen användbart — men på en Mac begränsas det av minnet, inte av modellen. Med 64 KB KV-cache per token kostar ett 8K-fönster ungefär 0,5 GB, 32K ungefär 2 GB, 128K ungefär 8 GB, och hela 262K ungefär 16,4 GB utöver vikterna. På en maskin med 24 GB som kör 4-bitars är det realistiska taket ungefär 64K–96K tokens; att nå mot 128K+ kräver en maskin med 32 GB+, och hela fönstret innebär en maskin vars enhetliga minne till största delen är cache. Planera för det kontext du faktiskt behöver och begränsa det i körkonfigurationen — modellen är nöjd, och din växlingsfil håller sig lugn.

När Apple Silicon är fel svar

Ta en annan väg om något av detta är din arbetsbelastning:

• Du har en Mac med 8 GB eller 16 GB. 4-bitarsversionen behöver redan ~17 GB enhetligt minne; allt mindre swapar och modellen blir oanvändbar. Detta är det allra vanligaste misstaget, och ingen mängd kvantiseringsknep kan åtgärda det.

• Du behöver det fulla 262K-fönstret eller 1M YaRN-tillägget. Den KV-budgeten är en serverbudget, inte en laptopbudget.

• Du serverar andra människor. En laptop är en plats; genomströmning för flera användare kräver en GPU-box eller ett hostat API.

• Du måste agera snabbt i långa agentloopar. 5–6 tok/s är okej för en människa som läser med, långsamt för en sub-agent.

Den ärliga inramningen: Qwen3.8 27B:s försäljningsargument är att den är gratis vid användningstillfället på hårdvara du äger — motsatsen till en API-modell som tar betalt per token. Det är precis därför den inte finns i OrcaRouter-katalogen (katalogen dirigerar den tidigare Qwen3.6/3.5-27B-generationen och den hostade Qwe​n API-linjen). Vi är fel verktyg för den gratis-lokala historien, och det är just poängen: när en arbetsbelastning växer ur en Mac, är alternativen en GPU-låda, en hyrd GPU eller en hostad Qwe​n API — inte en router som råkar bära just denna 27B.

Slutsats

Qwen3.8 27B på Apple Silicon är på riktigt, det är bra, och det är snävt avgränsat. 4-bitars MLX-bygget passar en Mac med 24 GB+ minne, laddas ner som qwen3.8:27b-mlx i Ollama, kostar inget per token och är den första verkligt användbara agentklassade öppna modellen som får plats i en bärbar dator. Avvägningarna är hastighet (5–6 tok/s på en M4 mini) och kontext (begränsa den till väl under 262K såvida du inte har RAM-minnet). Om du har en Mac med 24 GB+ och en arbetsbelastning som en 27B klarar, är detta den bästa gratis lokala modellen som finns tillgänglig den här veckan. Om du har en Mac med 16 GB eller behöver produktionsgenomströmning, är den inte det — och alternativet är en betald väg, vilket är ett helt annat beslut.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube