
Qwen3.8-27B med MLX på Apple Silicon: Ja, den kör — Här är vad du verkligen behöver
- obsidianNYQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1M tokens · 22 tok/s
- qwenNYQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
Qwen3.8 27B körs på Apple Silicon idag via MLX. Taggen är qwen3.8:27b-mlx i Ollama, tillagd i Ollama v0.32.12, och 4-bitarsversionen är cirka 18 GB att ladda ner och kräver ungefär 16–19 GB enhetligt minne — vilket gör en 24 GB+ Mac till den realistiska lägstanivån och en 16 GB Mac till ett icke-alternativ. Vikterna är Apache 2.0, gratis att använda på hårdvara du äger, vilket är hela poängen med modellen. Alibabas release är två dagar gammal (13–14 augusti 2026), så varje siffra nedan är märkt: vad som kommer från Alibabas modellkort, vad vi verifierade på Ollama-sidan idag, och vad som är tredjepartsprognos eller -mätning.
30-sekundersfaktabladet
Qwen3.8 27B är Alibabas täta modell med 27 miljarder parametrar, släppt den 13–14 augusti 2026 under Apache 2.0 — vikterna publicerades på Hugging Face och ModelScope den 13:e, med LICENSE-filen som dök upp nästa morgon. Den är den distribuerbara täta syskonmodellen till Qwen3.8-Max med 2,4 biljoner parametrar. Från modellkortet, allt rapporterat av Alibaba och ännu inte oberoende reproducerat:
• Storlek — 27B täta, 27.78B totala parametrar inklusive vision-encodern.
• Arkitektur — 64 lager, dold storlek 5,120, vokabulär 248,320.
• Hybrid attention — 16 full-attention-lager plus 48 linjära Gated DeltaNet-lager, ett förhållande på 3:1.
• Kontext — 262 144 tokens inbyggt, utbyggbart till 1M via YaRN (Ollama listar taggen som 256K).
• Inmatning — inbyggd bild- och videoförståelse utöver text, från dokument till timslång video.
• Vikter — 55,6 GB i BF16, MTP-spekulativ avkodningshuvud ingår.

På MLX-sidan, verifierat idag: Ollama levererar qwen3.8:27b-mlx — en MLX-nativ build för Apple Silicon med en ~18 GB 4-bitars nedladdning — och versionsnoterna för v0.32.12 lyfter fram Apple Silicon-optimering. mlx-lm, Apples Python-verktygskedja, stödjer arkitekturen för generering och konvertering, och MLX-kvantiseringar (3/5/6-bitars, plus MXFP4 och NVFP4) dök upp inom några timmar efter vikterna. Resten av denna artikel förutsätter en M-serie Mac med 24 GB eller mer enhetligt minne.
Vad MLX ändrar angående minne
På Apple Silicon finns det inget separat VRAM. MLX körs på M-seriens enhetliga minnespool, så det antal som räknas är det totala RAM-minnet i din Mac minus vad macOS och allt annat håller. En modell som "ryms i 17 GB" behöver en maskin med bekvämt mer än så.
Den goda nyheten är att Qwen3.8 27B är billigare att hålla i minnet än vad parameterantalet antyder. Eftersom endast de 16 full-attention-lagren håller en KV-cache – de 48 linjära lagren gör det inte – kostar cachen ungefär 64 KB per token, ungefär en fjärdedel av vad en konventionell 64-lagers tät modell betalar. I andra änden kräver det fulla 262K-fönstret ~16,4 GB cache utöver vikterna, vilket är en serverbudget, inte en laptopbudget.
Den realistiska stegen för en Mac, filstorlek plus cacheutrymme:
• 4-bit MLX — ~16–19 GB totalt. Passar en 24 GB Mac med ungefär ett 64K–96K-fönster; det förnuftiga standardvalet.
• 6-bit MLX — ~21–22 GB. 32 GB-maskiner; kvalitetshoppet jämfört med 4-bit är blygsamt.
• 8-bit MLX — ~27–30 GB. Maskiner med 48 GB+; nära förlustfritt.
• BF16 — ~55,6 GB. Endast de mest avancerade M-seriens Max- och Ultra-studiomaskinerna.

Källhänvisning: 4-bitarsiffran följer den uppmätta GGUF Q4_K_M (17,1 GB, unsloth, 14 augusti) och Ollama-nedladdningen på 18 GB; 8-bitars- och BF16-siffrorna följer Alibabas eget BF16-kort och Qwen3.6-27B-linjen. Siffran för 64 KB per token-cache härleds från arkitekturen, inte från ett specifikationsblad, och gäller endast för körtider som hoppar över KV-cachen på de linjära lagren på samma sätt som MLX gör.
Tre sätt att köra det, från enklast till mest kontroll.
Väg A — Ollama, det enklaste
Uppgradera till Ollama 0.32.12 eller nyare, sedan:
• ollama pull qwen3.8:27b-mlx — laddar ner den ~18 GB stora MLX-versionen.
• ollama run qwen3.8:27b-mlx — interaktiv chatt med thinking-mallen inkopplad.
• ollama serve — exponerar det OpenAI-kompatibla API:t på localhost:11434 för dina appar.

En känd brist, från en aktiv GitHub-issue vid skrivande stund: qwen3.8:27b-mlx avvisar rollen "developer" på /v1/responses-endpointen, vilket bryter ollama launch codex för denna modell — medan direkt ollama run fungerar utmärkt. Om du bygger en Codex-liknande agentloop på MLX-bygget, testa exakt den endpoint du planerar att använda innan du satsar loopen på den.
Sökväg B — mlx-lm, mest kontroll.
Apples egen verktygslåda. Installera den med pip install mlx-lm, dra sedan antingen en förkvantiserad MLX-checkpoint eller konvertera de officiella BF16-vikterna själv:
• mlx_lm.generate --model <checkpoint> — kör en checkpoint direkt; communityns 4-bitars och 8-bitars kvantiseringar av 27B lanserades fortfarande i mlx-community inom några dagar efter releasen.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — konvertera en gång; kostar ungefär en nedladdning.
• mlx_lm.server --model <checkpoint> — OpenAI-kompatibel server som tillämpar thinking-block-chatmallen åt dig.
Om den exakta kvantiseringen du vill ha inte finns uppe ännu, är konvertering från de officiella vikterna ett snabbt jobb på vilken M-serie Mac som helst och eliminerar alla tvivel om vad en tredje part har levererat.
Alternativ C — LM Studio, ettklicksalternativet
LM Studio använder MLX-backend på Apple Silicon och lade till stöd för Qwen3.8 27B vid lanseringen: sök efter modellen, välj en kvantisering som passar ditt RAM, så laddas den ner och körs. Om du föredrar ett GUI är detta den användarvänligaste vägen, och vår tillhörande guide täcker det från början till slut — se "How to Run Qwen3.8 27B Locally" i relaterade artiklar nedan.
Mallfällan
Qwen3.8 27B tänker som standard, och tankeblocken renderas av chattmallen, inte modellkärnan. Tester från tredje part under de första 48 timmarna noterar att den officiella mallen omsluter varje assistenttur i ett tankeblock – även tomma sådana – och att blocken i flervarviga agentloopar kapslas och historien trunkeras, vilket känns som minnesförlust. Det är inte kvantiseringen. Om en runtime levererar en korrigerad mall, använd den; när du bygger en agentloop och inte behöver resonemanget, inaktivera tänkande per förfrågan – chattmallen exponerar en enable_thinking-flagga, och modellen tar emot en reasoning_effort på xhigh, medium eller low.
Hur det faktiskt känns
Ett oberoende test på en Mac mini M4 med 32 GB enhetligt minne, som körde MLX 4-bitarsversionen, uppmätte ungefär 5–6 tokens/s i generering. Det är den siffra som bör sättas som förväntning: bra för interaktivt utkastarbete, längre resonemang och enstaka agentanrop; smärtsamt för långa agentiska loopar och batchjobb. Samma testares anekdot — en flera minuter lång tankeprocess följd av en liten applikation som såg rätt ut men som inte faktiskt gick ihop — är en bra påminnelse om att en 27B på en bärbar dator är en kapabel men inte ofelbar assistent.
Hastigheten skalar med chipnivån: en M-series Max med mer minnesbandbredd och fler kärnor kör märkbart snabbare än bas-M4:an i mini. Men 5–6 tok/s på ingångsmodellen är den ärliga baslinjen, och du bör bedöma alla "körs på Apple Silicon"-rubriker mot den.
262K-kontexten är en serverfunktion.
Qwen3.8 27B:s inbyggda 262K-fönster är verkligen användbart — men på en Mac begränsas det av minnet, inte av modellen. Med 64 KB KV-cache per token kostar ett 8K-fönster ungefär 0,5 GB, 32K ungefär 2 GB, 128K ungefär 8 GB, och hela 262K ungefär 16,4 GB utöver vikterna. På en maskin med 24 GB som kör 4-bitars är det realistiska taket ungefär 64K–96K tokens; att nå mot 128K+ kräver en maskin med 32 GB+, och hela fönstret innebär en maskin vars enhetliga minne till största delen är cache. Planera för det kontext du faktiskt behöver och begränsa det i körkonfigurationen — modellen är nöjd, och din växlingsfil håller sig lugn.
När Apple Silicon är fel svar
Ta en annan väg om något av detta är din arbetsbelastning:
• Du har en Mac med 8 GB eller 16 GB. 4-bitarsversionen behöver redan ~17 GB enhetligt minne; allt mindre swapar och modellen blir oanvändbar. Detta är det allra vanligaste misstaget, och ingen mängd kvantiseringsknep kan åtgärda det.
• Du behöver det fulla 262K-fönstret eller 1M YaRN-tillägget. Den KV-budgeten är en serverbudget, inte en laptopbudget.
• Du serverar andra människor. En laptop är en plats; genomströmning för flera användare kräver en GPU-box eller ett hostat API.
• Du måste agera snabbt i långa agentloopar. 5–6 tok/s är okej för en människa som läser med, långsamt för en sub-agent.
Den ärliga inramningen: Qwen3.8 27B:s försäljningsargument är att den är gratis vid användningstillfället på hårdvara du äger — motsatsen till en API-modell som tar betalt per token. Det är precis därför den inte finns i OrcaRouter-katalogen (katalogen dirigerar den tidigare Qwen3.6/3.5-27B-generationen och den hostade Qwen API-linjen). Vi är fel verktyg för den gratis-lokala historien, och det är just poängen: när en arbetsbelastning växer ur en Mac, är alternativen en GPU-låda, en hyrd GPU eller en hostad Qwen API — inte en router som råkar bära just denna 27B.
Slutsats
Qwen3.8 27B på Apple Silicon är på riktigt, det är bra, och det är snävt avgränsat. 4-bitars MLX-bygget passar en Mac med 24 GB+ minne, laddas ner som qwen3.8:27b-mlx i Ollama, kostar inget per token och är den första verkligt användbara agentklassade öppna modellen som får plats i en bärbar dator. Avvägningarna är hastighet (5–6 tok/s på en M4 mini) och kontext (begränsa den till väl under 262K såvida du inte har RAM-minnet). Om du har en Mac med 24 GB+ och en arbetsbelastning som en 27B klarar, är detta den bästa gratis lokala modellen som finns tillgänglig den här veckan. Om du har en Mac med 16 GB eller behöver produktionsgenomströmning, är den inte det — och alternativet är en betald väg, vilket är ett helt annat beslut.
