Hero-titelkort för artikeln 'Qwen3.8-27B-Uncensored-MLX on Apple Silicon' som visar rubriken 'Qwen3.8-27B-Uncensored-MLX', underrubriken 'The Apple Silicon Runbook', en rad kvantchips märkta 2-bit, 4-bit, 6-bit och 8-bit med 4-bit framhävd, ett stiliserat LM Studio-fönster som visar '4-bit-bygge vid repots rot', och ett 262K-kontextmotiv, med OrcaRouter-logotypen sammansatt i hörnet.
Guides & Insights

Qwen3.8-27B-Uncensored-MLX på Apple Silicon: Så väljer du din build, laddar den i LM Studio eller mlx-vlm och tämjer 262K-kontexten

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det mest användbara att veta om orcarouter/Qwen3.8-27B-Uncensored-MLX är att du inte behöver välja en undermapp för att köra det. OrcaRouters abliterated Apple-Silicon-bygge av Qw​en/Qwen3.8-27B — publicerat på Hugging Face den 17 augusti 2026, så det är inte nytt, bara dåligt dokumenterat — behåller en kopia av 4-bit-bygget i repots rot, specifikt för att verktyg som behandlar ett repo som en modell, framför allt LM Studio, ska kunna ladda det utan någon konfiguration alls. Det enda beslutet är anledningen till att det här modellkortet har fått ungefär 83 000 nedladdningar den senaste månaden medan jämförbara MLX-konverteringar får en liten bråkdel av det. Allt annat med det är ett verkligt val: vilken av de fyra precisionerna som passar din Macs enhetliga minne, vilken runner du använder, huruvida vision och tool calling överlever vid din bitbredd, och huruvida kontextfönstret på 262 144 token är värt vad det kostar på din hårdvara. Den här runbooken går igenom dessa beslut i ordning. Det är förstapartsdokumentation — storlekarna, precisionerna och fidelitetssiffrorna nedan är OrcaRouters egna, uppmätta på just det här bygget, och varje communitysiffra är märkt som sådan.

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

Vad exakt finns i detta repo

Detta är en ablitererad build av Qw​en/Qwen3.8-27B — en tät hybrid-uppmärksamhetsmodell på 27B (Gated DeltaNet-linjär uppmärksamhet plus full uppmärksamhet), som i grunden är en vision-språkmodell, med tankelägeskontroll, verktygsanrop, ett multi-token-prediktionshuvud (MTP) och ett kontextfönster på 262 144 tokens. Abliteration tar bort modellens vägringsbeteende genom att ortogonalisera vägringsriktningen ut ur residualströmmen; om det är nytt för dig är vår introduktion till tekniken en bättre utgångspunkt än den här sidan, som handlar om att köra builden, inte metoden. Vikterna är Apache-2.0, ärvda från basmodellen.

Förväxla inte detta repo med qwen-3-8-27b-mlx, som är samma basmodell i MLX-format utan abliterationen. Läsare tar rutinmässigt fel en för den andra: den här är forskningsbygget med borttagen vägran; den där är den vanliga Qw​en/Qwen3.8-27B på Apple Silicon. Kontrollera repots namn innan du lägger ner tid på nedladdningen.

En strukturell detalj är viktigare än den verkar: visionstornet, alla normaliseringar och linear-attentionens conv1d förblir i BF16, och endast språkmodellens linjära lager — inklusive embed_tokens och lm_head — kvantiseras. Det är därför bildförståelsen överlever kvantiseringen, och det är också därför diskstorlekarna nedan är lite större än en naiv uppskattning på ”27B vid N bitar”: en del av modellen komprimeras aldrig.

Beslutet: vilken build passar vilken Mac

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

Fyra precisioner levereras som undermappar — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — all MLX-affin kvantisering med gruppstorlek 64. 4-bitarsversionen är dessutom speglad i repots rot. Välj först utifrån din Macs enhetliga minne, kvalitet i andra hand:

8-bit — ~27,5 GB på disk, vill ha en 64 GB Mac (en 32 GB-maskin kan ladda in den men lämnar lite utrymme för annat). Uppmätt cosinusfidelitet mot BF16-källan: 0,9997, i praktiken nära förlustfri. Välj den när kvalitet är hela poängen och det finns gott om minne.

6-bit — ~22 GB, passar för Macar med 24–32 GB. Fidelitet 0,9996, utmärkt. Den bästa kvalitet-per-gigabyte-balansen för de flesta som äger en 48 GB-maskin.

4-bit — ~15 GB, ryms bekvämt på en 24 GB Mac. Fidelity 0,996, mycket bra. Detta är vår rekommenderade standard, och det är därför den är kopian i repots rot.

2-bit — ~8,7 GB, ryms på en 16 GB Mac. Fidelity 0,92 och, vid 27B, kraftigt försämrad: upprepningsloopar, förvrängd text, kod och kinesiska, partiell syn. Kortet säger det tydligt — endast för arkivering, inte för riktigt arbete. En 16 GB Mac kan tekniskt sett ladda in den; det gör den inte användbar.

Storleken på disk är inte samma sak som minnesanvändningen. Vikterna måste få plats i det enhetliga minnet tillsammans med macOS, KV-cachen och Metalls temporära buffertar, så lämna marginal. En communitykörning av 4-bitarsversionen på en M1 Pro 32 GB Mac mätte ~16 GB vikter på disk men en inferenstopp på 18,5–21,7 GB; communitykörningar av 8-bitars MLX-versioner rapporterar toppar runt 34–36 GB även när vikterna är ~29,5 GB. Den praktiska vägledningen från samma communitytest är: 16 GB är inte ett reellt alternativ för en 27B-modell, 24 GB kan prova 4-bitars med kort kontext och 32 GB är den bekväma startpunkten. Vår artikel om VRAM-planering går igenom samma matematik för hela familjen.

Eftersom listningen för hela repot uppgår till ungefär 94 GB för alla precisioner, ladda bara ner den undermapp du behöver medhf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — ersätt med den precision du valt. Kopian på rotnivå för 4-bit är en dubblett av 4-bit-undermappen, så du behöver aldrig hämta båda.

Väg ett — LM Studio, noll konfiguration

Rotkopian med 4-bitars precision finns specifikt för att LM Studio ska kunna behandla hela repot som en enda modell. Sök efter modell-ID:t, välj den precision du vill ha (rotkopian är 4-bitars), så sköter appen resten. Tre fallgropar, alla från vårt kort, och de är hela skillnaden mellan att detta fungerar och att det misslyckas:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

Repot är låst. Anonyma nedladdningar får HTTP 401. Acceptera villkoren på modellsidan, klistra sedan in en Hugging Face-lästoken i LM Studios inställningar → Integrationer → Hugging Face. Hoppa över detta så misslyckas inläsningen helt enkelt.

Inaktivera KV-cache-kvantisering. MLX-visionmodeller stöder inte detta på den här arkitekturen och inläsningen misslyckas under initieringen om det är aktiverat (spåras som mlx-engine#286). Detta är motsatsen till rådet för GGUF-byggen, där kvantisering av K/V-cachen är en legitim VRAM-besparing — de två formaten är inte utbytbara här.

Uppdatera runtime. qwen3_5-arkitekturstödet lades till i mlx-vlm 0.6.x; en äldre inbyggd runtime kan inte alls ladda dessa vikter. LM Studios märkning "Likely too large" är däremot bara en RAM-varning, inte ett fel – ignorera den om ditt enhetliga minne uppfyller riktlinjerna ovan.

Vilken precision i LM Studio: 8-bit är ~29,5 GB på disk och kräver en 64 GB Mac; 6-bit ~22 GB passar en 48 GB-maskin; 4-bit på ~16 GB är rätt val på en 32 GB Mac. Om du vill gå llama.cpp / Ollama-vägen på annan hårdvara, täcker vår guide för lokal körning av den ocensurerade modellen den vägen separat.

Väg två — mlx-vlm och mlx-lm från en undermapp

Kommandoradsvägen ger dig precisionen direkt och en OpenAI-kompatibel server för agentverktyg. Krav: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 och mlx ≥ 0.32; Metal-backend väljs automatiskt på Apple Silicon). Efter nedladdningen av underkatalogen ovan:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Förklara kvantintrassling i en mening." --max-tokens 256

Lägg till --image path/to/image.png för bildinmatning, eller servera den:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

Vision överlever kvantiseringen

Eftersom vision tower och conv1d förblir i BF16, bevaras bildförståelsen vid 4/6/8-bit. På vår testbild — former, färger, position, bakgrund och text i bilden — beskrev 4/6/8-bit-byggen allt korrekt; 2-bit var endast delvis. Om du väljer ett bygge och vision spelar roll, är 4-bit det lägsta du bör gå. Vi har inte publicerat Apple-Silicon-specifik vision-genomströmning för detta bygge, så lita inte på en tok/s-siffra för det om den inte kommer från en namngiven körning på din egen chipklass.

Det bevarade visionstornet är också en del av riskytan, och det är värt att säga rakt ut: en ablitererad modell som också kan läsa bilder är inte ett säkerhetsproblem som endast gäller text.

Verktygsanrop och agentanvändning

Verktygsanrop är en kapacitet i grundmodellen och den överlever abliteration, vilket gör den här versionen genuint användbar för red-teaming av agentiska system — och genuint farlig om den riktas mot verkliga tjänster. Standardkonfigurationen är mlx_lm.server endpoint ovan, som vilken Open​AI-kompatibel agent som helst kan anropa. Om du verkligen kör den som en agent, förstå vad du har aktiverat: en modell utan vägran med funktionsanrop och 262K kontext är en annan säkerhetsprofil än en chattmodell, och kortets 'endast forskning'-inramning finns av den anledningen.

262K-kontexten och vad den verkligen kostar

Arkitekturen ger denna modell en ovanligt billig lång kontext. Hybrid attention innebär här 48 linjära attention-lager (Gated DeltaNet) varvat med 16 full-attention-lager, och endast de 16 full-attention-lagren har en klassisk KV-cache – de linjära lagren håller istället ett kompakt återkommande tillstånd. Så 262 144 tokens kostar betydligt mindre än det skulle göra på en full-attention 27B. Det är ett strukturellt faktum om basmodellen, inte ett löfte om din Mac.

I praktiken är kontextfönstret en kapacitet, inte en gratisnivå. Ett community-test med lång kontext på en M4 Max uppmätte ungefär 63 tok/s vid kort kontext, som sjunker till cirka 11 tok/s vid 31K tokens – avkodningen försämras kraftigt när cachen fylls, och första-token-latensen vid mycket långa prompts är oftast ett större hinder än rå genomströmning. Spekulativ och ANE-baserad prefill förbättrar inmatningen, inte avkodningen. Våra egna Apple-Silicon KV-cache-kostnadssiffror för denna build är inte publicerade; om du behöver exakta siffror för din hårdvara är community-körningarna den ärliga källan, och community-konsensus är att behandla hela 262K som något du använder medvetet, inte som en standardinställning du lämnar på.

Hastighet — vad som faktiskt mäts

Vi publicerar exakt en hastighetssiffra för denna build och det är inte Apple Silicon: ~32–37 tok/s i steady state på en enda H200 via MLX CUDA-backend, vilket bekräftar att vikterna även körs utanför macOS. På Macar publicerar vårt kort medvetet ingen tok/s, eftersom det beror på chippet, precisionen och körprogrammet. Praktikersiffror värda att känna till, alla märkta som sådana:

• Exakt den här builden, 4-bit, M1 Pro 32 GB: ~8,7 tok/s generering och ~41,7 tok/s prefill vid en kort körning (community-test, augusti 2026). Ett äldre chip, men en realistisk lägstanivå.

• oMLX med inbyggd MTP på en M4 Max, standard icke-abliterad checkpoint: 53,3 tok/s prosa och 72,1 tok/s kod, med ~273,7 tok/s prefill vid 4K; rå avkodning utan MTP ~24,6 tok/s. Uppmätt av en praktiker på en annan checkpoint och runtime, så betrakta det som en övre gräns som de abliterade vikterna kan närma sig snarare än ett löfte.

• oMLX dual-ANE prefill på en M3 Ultra, abliterated oQ4e-MTP: prefill upp ~17,7 % vid 16K och ~18,9 % vid 32K, och avkodning via Lightning MTP upp till ~75 tok/s vid 16K. Förbehållen är verkliga: den använder privata Apple-runtime-gränssnitt och approximativa INT8-vikter, lägger till ungefär 4 GB i toppminne och ökar modellens inläsningstid från ~3,4 s till ~28 s. Det är en optimering för promptinmatning, inte en generationsacceleration.

MTP-huvudet — en gratis snabbning om din runner stöder det.

Den här bygget levererar basmodellens multi-token-prediktionsdrafter i mtp/-undermappen (arkitektur qwen3_5_mtp), och den fungerar med vilken huvudprecision som helst. Acceptansen är förlustfri — med girig avkodning är utdata identisk med att köra utan draftern — så det är en genuin hastighetsökning utan kvalitetsförlust när den aktiveras. Två installationsanteckningar från vårt modellkort: det kräver ett mlx-vlm-bygge som inkluderar qwen3_5_mtp-draftern (main-grenen), och du måste skicka både --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp och --draft-kind mtp. Att bara ställa in mtp_enabled gör ingenting. Om din runner inte stöder draftern ignoreras den och modellen körs normalt — ingenting går sönder.

Säkerhet — läs detta innan du kör det, inte efter

Modellkortets egen ansvarsfriskrivning är ovanligt rak, och denna sida kommer inte att mjuka upp den. Säkerhetsanpassningen för denna build har i stort sett tagits bort. Den kommer att efterkomma skadliga, oetiska, stötande eller olagliga förfrågningar som basmodellen Qw​en/Qwen3.8-27B skulle vägra, och den har inga meningsfulla inbyggda skyddsräcken. Den släpps strikt för legitim forskning — tolkningsbarhet, AI-säkerhet och studier av vägrarmekanismer, red-teaming, robusthetsutvärdering och kontrollerade experiment. Om det inte är vad du ägnar dig åt, är detta fel modell.

Två varningar från kortet förtjänar att betonas. För det första: jailbreak- och säkerhetsprober ”lyckas” trivialt på en abliterad modell, och det är inte ett godkänt säkerhetstest – det är det förväntade beteendet hos en modell vars vägransriktning har tagits bort. Frånvaro av vägran är inte bevis på säkerhet. För det andra: det bevarade seendet, verktygsanropen och 262K-kontexten expanderar attackytan till bildförståelse och agentisk användning: en ocensurerad modell som kan läsa skärmbilder och anropa verktyg är en bredare risk än ett chatt-only-bygge med borttagen vägran. Lågbitskvantisering lägger till ett tredje lager av instabilitet ovanpå – vid 2 bitar kan förvrängd utdata till och med misstas för vägran, vilket är en egen typ av förvirrande misslyckande.

Du har fullt ansvar och full ansvarsskyldighet för användning och utdata. Apache-2.0-licensen ärvs från basmodellen och ändrar inte detta: den tillåter användning; den gör inte din driftsättning säker. Den som driftsätter detta för slutanvändare, minderåriga eller i någon produktionsmiljö måste först lägga till egna lager för moderering, säkerhet och missbruksskydd, samt följa tillämplig lag. För forskare som faktiskt kör det är de praktiska skyddsåtgärderna: en isolerad miljö, helst offline; agentverktyg som inte är riktade mot verkliga tjänster; ingen exponering för slutanvändare; och granskning av utdata innan de går vidare.

När lokalt inte är svaret

Det lokala är själva poängen med denna version — vikterna ligger på din disk, det finns ingen kostnad per token och ingenting lämnar maskinen. Men det lokala är också en begränsning: det är endast för Apple Silicon, du får leva med kvantiseringskvaliteten, och det finns ingen redundans om maskinen är upptagen. Om du behöver en icke-ablitererad 27B-modell via ett API för en verklig arbetsbelastning, eller om du vill A/B-testa denna lokala version mot en värdbaserad modell med samma prompts, är det den lucka som ett routinglager finns till för att fylla. OrcaRouter placerar 200+ modeller bakom en API-nyckel till leverantörens listpris, med automatisk failover och ett routing-DSL — en prissänkning från en leverantör går live hos oss samma dag som den tillkännages, eftersom vi för vidare listpriset. Ett API, en integration, och du kan jämföra en oprövad lokal installation mot en värdbaserad modell utan att skapa ett andra konto. Vi hostar inte denna MLX-version — den bygger medvetet på lokala vikter — så API:t är den kompletterande vägen, inte en ersättning för den.

Den snabba beslutsguiden

• 16 GB Mac — ärligt talat, inte den här modellen. 2-bit passar och är endast för arkivering; du får kämpa med minnet oavsett. Titta på en mindre ocensurerad modell, eller communityns blandade 3/6-bit-konvertering byggd för 18–24 GB-maskiner.

• 24 GB Mac — 4-bit, och håll kontexten kort; kör inte vision och lång kontext samtidigt.

• 32 GB Mac — 4-bit är den optimala nivån; 6-bit om du håller kontexten kompakt.

• 48 GB Mac — 6-bit med headroom; 8-bit om du inte pressar fönstret.

• 64 GB och uppåt — 8-bitars, nästan förlustfri och 262K kontext inom räckhåll med ovanstående förbehåll.

Det är hela runbooken. Modellen är från 17 augusti 2026, det är inte lanseringsnyheter, och det behöver det inte vara: 83 000 nedladdningar skedde för att människor ville ha en guide, och den här sidan är den guiden. Börja vid repots rot, ladda 4-bit i LM Studio, och lämna bara standardbygget när du vet vad du byter bort för kvaliteten. Om du kommer från GGUF- eller FP8-sidan av familjen, täcker de relaterade guiderna dessa vägar — beslutsramverket här är detsamma, kvantmatematiken är det inte.

Inte ännu en build av den här modellen — Qwen3.8-Flash-Next-Uncensored är en separat utgåva: ablitererad från Qwen3.8-Flash-Next, en 176B-lagrad / 6B-aktiv mixture-of-experts-förhandsversion av Qwen4-arkitekturen. Samma abliterationsteknik, andra vikter, egen kollektion.

Alla sex 27B-byggen — BF16, GGUF, MLX, FP8, INT8 och NVFP4 — är samlade i samlingen Qwen3.8-27B-Uncensored på Hugging Face.

Dessa vikter är endast lokala av design. För en hostad baslinje att mäta det abliterade bygget mot: Qwen3.8-27B serveras på OrcaRouter till leverantörens listpris med 0 % påslag — standardmodellen, med säkerhetsanpassningen intakt.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube