Hero-titelkaart voor het artikel 'Qwen3.8-27B-Uncensored-MLX on Apple Silicon' met de kop 'Qwen3.8-27B-Uncensored-MLX', ondertitel 'The Apple Silicon Runbook', een rij quant-chips gelabeld 2-bit, 4-bit, 6-bit en 8-bit met 4-bit gemarkeerd, een gestileerd LM Studio-venster met '4-bit build at repo root', en een 262K-contextmotief, met het OrcaRouter-logo gecomponeerd in de hoek.
Guides & Insights

Qwen3.8-27B-Uncensored-MLX op Apple Silicon: Hoe je je build kiest, hem in LM Studio of mlx-vlm laadt en de 262K-context temt

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het nuttigste om te weten over orcarouter/Qwen3.8-27B-Uncensored-MLX is dat je geen submap hoeft te kiezen om het te draaien. OrcaRouter's abliterated, Apple-Silicon-build van Qw​en/Qwen3.8-27B — gepubliceerd op Hugging Face op 17 augustus 2026, dus niet nieuw, alleen onvoldoende gedocumenteerd — houdt een kopie van de 4-bit-build in de repo-root, specifiek zodat tools die één repo als één model beschouwen, met name LM Studio, het zonder enige configuratie laden. Die ene beslissing is de reden dat deze kaart in de afgelopen maand ongeveer 83.000 downloads heeft getrokken, terwijl vergelijkbare MLX-conversies een klein deel daarvan krijgen. Al het andere eraan is een echte keuze: welke van de vier precisies past bij het unified memory van je Mac, welke runner je gebruikt, of vision en tool calling overleven bij jouw bit-breedte, en of het contextvenster van 262.144 tokens de kosten op jouw hardware waard is. Dit runbook doorloopt die beslissingen in volgorde. Het is first-party-documentatie — de groottes, precisies en getrouwheidscijfers hieronder zijn die van OrcaRouter zelf, gemeten op deze exacte build, en elk community-cijfer is als zodanig gelabeld.

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

Wat zit er precies in deze repo?

Dit is een geabliteerde build van Qw​en/Qwen3.8-27B — een 27B dicht, hybride-aandachtsmodel (Gated DeltaNet lineaire aandacht plus volledige aandacht), van nature visie-taal, met denkcontrole, toolaanroeping, een multi-token-predictie- (MTP-)kop en een contextvenster van 262.144 tokens. Abliteratie verwijdert het weigeringsgedrag van het model door de weigeringsrichting te orthogonaliseren uit de residustroom; als dat nieuw voor je is, is onze inleiding over de techniek een betere plek om te beginnen dan deze pagina, die gaat over het draaien van de build, niet over de methode. De gewichten vallen onder Apache-2.0, overgenomen van het basismodel.

Verwar deze repo niet met qwen-3-8-27b-mlx, dat hetzelfde basismodel in MLX-formaat is zonder de abliteratie. Lezers pakken regelmatig de een wanneer ze de ander bedoelen: deze is de onderzoeksbuild zonder weigeringen; die is de gewone Qwen/Qwen3.8-27B op Apple Silicon. Controleer de reponaam voordat je downloadtijd verspilt.

Eén structureel detail is belangrijker dan het lijkt: de vision tower, alle normen en de linear-attention conv1d blijven in BF16, en alleen de lineaire lagen van het taalmodel — inclusief embed_tokens en lm_head — worden gekwantiseerd. Dat is waarom beeldbegrip de kwantisering overleeft, en het is ook waarom de opslaggroottes hieronder een beetje groter zijn dan een naïeve "27B bij N bits" schatting: een deel van het model wordt nooit gecomprimeerd.

De beslissing: welke build past bij welke Mac

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

Vier precisies worden als submappen geleverd — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — allemaal MLX-affine kwantisatie met een groepsgrootte van 64. De 4-bit-versie wordt ook gespiegeld in de hoofdmap van de repository. Kies eerst op basis van het unified geheugen van je Mac, en pas daarna op kwaliteit:

8-bit — ~27,5 GB op schijf, vereist een 64 GB Mac (een machine met 32 GB kan het laden, maar laat weinig ruimte over voor iets anders). Gemeten cosinusgetrouwheid ten opzichte van de BF16-bron: 0,9997, feitelijk verliesvrij. Kies dit wanneer kwaliteit het allerbelangrijkste is en er voldoende geheugen is.

6-bit — ~22 GB, geschikt voor Macs met 24–32 GB. Nauwkeurigheid 0,9996, uitstekend. De beste kwaliteit-per-gigabyte-verhouding voor de meeste bezitters van een 48 GB-machine.

4-bit — ~15 GB, past comfortabel op een 24 GB Mac. Fidelity 0.996, zeer goed. Dit is onze aanbevolen standaard, en het is daarom de kopie in de repository-root.

2-bit — ~8.7 GB, past op een 16 GB Mac. Fidelity 0.92 en, bij 27B, ernstig gedegradeerd: herhalingslussen, onleesbare tekst, code en Chinees, gedeeltelijk zicht. De kaart zegt het duidelijk — alleen voor archivering, niet voor echt werk. Een 16 GB Mac kan het technisch laden; dat maakt het nog niet bruikbaar.

De grootte op schijf is {{1}}niet hetzelfde als het benodigde geheugen{{/1}}. De gewichten moeten in het unified memory passen, naast macOS, de KV-cache en de scratchbuffers van Metal, dus houd wat marge aan. Een communityrun van de 4-bit build op een Mac met M1 Pro en 32 GB mat ~16 GB aan gewichten op schijf, maar een piek van 18,5–21,7 GB tijdens inferentie; communityruns van 8-bit MLX-builds melden pieken rond 34–36 GB, zelfs wanneer de gewichten ~29,5 GB zijn. De praktijkrichtlijn uit diezelfde communitytest luidt: 16 GB is geen reële optie voor een 27B-model, 24 GB kan 4-bit proberen met een korte context, en 32 GB is het comfortabele startpunt. Ons artikel over VRAM-planning {{2}}hanteert dezelfde rekensom{{/2}} voor de hele familie.

Omdat de volledige repository-lijst in totaal ongeveer 94 GB groot is over alle precisies, download alleen de submap die je nodig hebt met hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — vervang dit door de door jou gekozen precisie. De 4-bit-kopie in de root is een duplicaat van de 4-bit-submap, dus je hoeft nooit beide op te halen.

Pad één — LM Studio, nul configuratie

De root-4-bit-kopie bestaat specifiek zodat LM Studio de hele repo als één model kan behandelen. Zoek de model-ID, selecteer de precisie die je wilt (de root-kopie is 4-bit), en de app regelt de rest. Drie valkuilen, allemaal van onze kaart, en ze vormen het hele verschil tussen dit werken en falen:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

De repo is afgeschermd.Anonieme downloads krijgen HTTP 401. Accepteer de voorwaarden op de modelpagina en plak dan een Hugging Face-leestoken in LM Studio's Instellingen → Integraties → Hugging Face. Sla dit over en het laden mislukt gewoon.

Schakel KV-cache-kwantalisering uit.MLX-visiemodellen ondersteunen dit niet op deze architectuur en het laden mislukt tijdens de initialisatie als dit is ingeschakeld (bijgehouden als mlx-engine#286). Dit is het tegenovergestelde van het advies voor de GGUF-builds, waar het kwantiseren van de K/V-cache een legitieme VRAM-besparing is — de twee formaten zijn hier niet onderling uitwisselbaar.

Werk de runtime bij. qwen3_5-architectuurondersteuning is in mlx-vlm 0.6.x toegevoegd; een oudere meegeleverde runtime kan deze gewichten helemaal niet laden. De badge "Likely too large" van LM Studio is daarentegen slechts een RAM-waarschuwing, geen fout — negeer deze als je unified memory aan de bovengenoemde richtlijn voldoet.

Welke precisie in LM Studio: 8-bit is ~29.5 GB op schijf en heeft een Mac met 64 GB nodig; 6-bit ~22 GB past bij een machine met 48 GB; 4-bit met ~16 GB is de juiste keuze op een Mac met 32 GB. Als je de llama.cpp / Ollama-route op andere hardware wilt, behandelt onze gids voor het lokaal draaien van het ongecensureerde model dat pad apart.

Pad twee — mlx-vlm en mlx-lm vanuit een submap

De commandoregel-route geeft je direct de precisie en een Open​AI-compatibele server voor agenttools. Vereisten: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 en mlx ≥ 0.32; de Metal-backend wordt automatisch geselecteerd op Apple Silicon). Na de bovenstaande download van de submap:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Leg kwantumverstrengeling in één zin uit." --max-tokens 256

Specificeer --image path/to/image.png voor visuele invoer, of serveer het:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

Visie overleeft de kwantisering.

Omdat de vision tower en de conv1d in BF16 blijven, blijft beeldbegrip behouden bij 4/6/8-bit. Op onze testafbeelding — vormen, kleuren, positie, achtergrond en tekst in de afbeelding — beschreven de 4/6/8-bit-builds alles correct; 2-bit was slechts gedeeltelijk. Als je een build kiest en vision belangrijk is, is 4-bit het laagste dat je zou moeten gaan. We hebben geen Apple-Silicon-specifieke vision-doorvoer voor deze build gepubliceerd, dus vertrouw geen tok/s-cijfer ervoor, tenzij het afkomstig is van een benoemde run op je eigen chipklasse.

De behouden vision tower maakt ook deel uit van het risico-oppervlak, en dat moet ronduit gezegd worden: een ge-ablitereerd model dat ook afbeeldingen kan lezen is geen veiligheidsprobleem dat alleen tekst betreft.

Toolaanroeping en agentgebruik

Tool calling is een capaciteit van het basismodel en overleeft abliteratie, wat deze build echt nuttig maakt voor red-teaming van agentische systemen — en echt gevaarlijk als hij op echte diensten wordt gericht. De standaardconfiguratie is de mlx_lm.server endpoint hierboven, die elke Open​AI-compatibele agent kan aanroepen. Als je deze build daadwerkelijk als agent draait, realiseer je dan wat je hebt ingeschakeld: een weigeringsvrij model met function-calling en 262K context is een andere veiligheidshouding dan een chatmodel, en de research-only framing van de kaart is er om die reden.

De 262K context en wat het echt kost

De architectuur geeft dit model een ongewoon goedkope lange context. Hybride aandacht betekent hier 48 linear-attention-lagen (Gated DeltaNet) afgewisseld met 16 full-attention-lagen, en alleen de 16 full-attention-lagen dragen een klassieke KV-cache — de lineaire lagen houden in plaats daarvan een compacte recurrente toestand bij. Dus 262.144 tokens kosten aanzienlijk minder dan op een full-attention 27B. Dat is een structureel feit over het basismodel, geen belofte over je Mac.

In de praktijk is het contextvenster een mogelijkheid, geen gratis laag. Een community-long-contexttest op een M4 Max mat ongeveer 63 tok/s bij korte context, dalend tot ongeveer 11 tok/s bij 31K tokens — de decode verslechtert scherp naarmate de cache zich vult, en de eerste-tokenlatentie bij zeer lange prompts is meestal de grotere hindernis dan de ruwe doorvoer. Speculatieve en op ANE gebaseerde prefill verbetert de ingestie, niet de decode. Onze eigen KV-cache-kostencijfers voor Apple Silicon voor deze build zijn niet gepubliceerd; als je harde cijfers voor je hardware nodig hebt, zijn de community-runs de eerlijke bron, en de community-consensus is om de volledige 262K te behandelen als iets waar je bewust naar grijpt, niet als een standaard die je aan laat staan.

Snelheid — wat er daadwerkelijk wordt gemeten

We publiceren precies één snelheidscijfer voor deze build en dat is niet Apple Silicon: ~32–37 tok/s steady-state op een enkele H200 via de MLX CUDA-backend, wat bevestigt dat de gewichten ook buiten macOS draaien. Op Macs publiceert onze kaart bewust geen tok/s, omdat het afhangt van de chip, de precisie en de runner. Praktijkcijfers die het weten waard zijn, allemaal als zodanig gelabeld:

• Deze exacte build, 4-bit, M1 Pro 32 GB: ~8.7 tok/s generatie en ~41.7 tok/s prefill bij een korte run (communitytest, augustus 2026). Een oudere chip, maar een realistische ondergrens.

• oMLX met native MTP op een M4 Max, standaard non-abliterated checkpoint: 53.3 tok/s proza en 72.1 tok/s code, met ~273.7 tok/s prefill bij 4K; ruwe decode zonder MTP ~24.6 tok/s. Gemeten door een practitioner op een ander checkpoint en runtime, dus beschouw het als een bovengrens die de abliterated gewichten zouden kunnen benaderen, niet als een belofte.

• oMLX dual-ANE prefill op een M3 Ultra, geabliteerde oQ4e-MTP: prefill tot ~17,7% bij 16K en ~18,9% bij 32K, en decode via Lightning MTP tot ~75 tok/s bij 16K. De kanttekeningen zijn reëel: het gebruikt privé-Apple-runtime-interfaces en benaderde INT8-gewichten, voegt ruwweg 4 GB aan piekgeheugen toe, en verhoogt de modelladetijd van ~3,4 s naar ~28 s. Dat is een optimalisatie voor promptverwerking, geen generatieversneller.

De MTP-head — een gratis versnelling als je runner hem ondersteunt

Deze build bevat de multi-token-predictie-drafter van het basismodel in de mtp/ submap (architectuur qwen3_5_mtp), en het werkt met elke hoofdprecisie. De acceptatie is verliesvrij — met greedy decoding is de output identiek aan draaien zonder de drafter — dus het is een echte versnelling zonder kwaliteitsverlies wanneer het inschakelt. Twee setup-opmerkingen van onze modelkaart: het vereist een mlx-vlm-build met de qwen3_5_mtp drafter (de main branch), en je moet beide doorgeven: --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp en --draft-kind mtp. Alleen het instellen van mtp_enabled doet niets. Als uw runner de drafter niet ondersteunt, wordt deze genegeerd en draait het model normaal — er gaat niets kapot.

Veiligheid — lees dit voordat je het uitvoert, niet erna

De eigen disclaimer van de modelkaart is ongewoon direct, en deze pagina zal die niet verzachten. De safety-afstemming van deze build is grotendeels verwijderd. Het zal voldoen aan schadelijke, onethische, aanstootgevende of illegale verzoeken die de basis-Qw​en/Qwen3.8-27B zou weigeren, en het heeft geen betekenisvolle ingebouwde beveiligingen. Het wordt uitsluitend uitgebracht voor legitiem onderzoek — interpreteerbaarheid, AI-veiligheid en onderzoek naar weigeringsmechanismen, red-teaming, robuustheidsevaluatie en gecontroleerde experimenten. Als u dat niet doet, is dit het verkeerde model.

Twee waarschuwingen uit de kaart verdienen nadruk. Ten eerste: jailbreak- en veiligheidssondes 'slagen' op triviale wijze op een abliterated model, en dat is geen geslaagde veiligheidsevaluatie — het is het verwachte gedrag van een model waarvan de weigeringsrichting is verwijderd. Afwezigheid van weigeringen is geen bewijs van veiligheid. Ten tweede vergroten de behouden visie, tool-calling en 262K-context het aanvalsoppervlak naar beeldbegrip en agentisch gebruik: een ongecensureerd model dat screenshots kan lezen en tools kan aanroepen vormt een breder risico dan een chat-only build waaruit weigeringen zijn verwijderd. Low-bit kwantisering voegt daar een derde laag van instabiliteit aan toe — bij 2-bit kan vervormde output zelfs worden aangezien voor een weigering, wat op zichzelf een verwarrende vorm van falen is.

U aanvaardt de volledige verantwoordelijkheid en aansprakelijkheid voor gebruik en outputs. De Apache-2.0-licentie is overgeërfd van het basismodel en verandert dat niet: zij staat gebruik toe; zij maakt uw implementatie niet veilig. Iedereen die dit implementeert voor eindgebruikers, minderjarigen of een productieomgeving, moet eerst eigen moderatie-, veiligheids- en misbruikpreventielagen toevoegen en voldoen aan de toepasselijke wetgeving. Voor onderzoekers die het daadwerkelijk draaien, zijn de praktische richtlijnen: een geïsoleerde, bij voorkeur offline, omgeving; agenttools die niet op echte services zijn gericht; geen blootstelling aan eindgebruikers; en beoordeling van outputs voordat ze ergens naartoe gaan.

Wanneer lokaal niet het antwoord is

Lokaal is het punt van deze build — de gewichten staan op je schijf, er zijn geen kosten per token, en niets verlaat de machine. Maar lokaal is ook een plafond: het is alleen voor Apple Silicon, je moet leven met de quant-kwaliteit, en er is geen redundantie als de machine bezig is. Als je een niet-abliterated model uit de 27B-klasse via een API nodig hebt voor een echte workload, of je wilt deze lokale build A/B-testen tegen een gehost model met dezelfde prompts, dan is dat de kloof die een routinglaag moet opvullen. OrcaRouter plaatst 200+ modellen achter één API-sleutel tegen de lijstprijs van de provider, met automatische failover en een routing-DSL — een prijsverlaging van een leverancier gaat dezelfde dag dat hij wordt aangekondigd live aan onze kant, omdat we de lijstprijs doorgeven. Eén API, één integratie, en je kunt een onbewezen lokale opstelling vergelijken met een gehost model zonder een tweede account op te zetten. We hosten deze MLX-build niet — het is per ontwerp lokale gewichten — dus de API is het complementaire pad, geen vervanging ervoor.

De snelle beslissingsgids

• 16 GB Mac — eerlijk gezegd, niet dit model. 2-bit past en is alleen voor archivering; je zult hoe dan ook tegen geheugenproblemen aanlopen. Kijk naar een kleiner ongecensureerd model, of de door de community samengestelde 3/6-bit conversie, gebouwd voor machines met 18–24 GB.

• 24 GB Mac — 4-bit, en houd de context kort; draai vision en lange context niet tegelijkertijd.

• 32 GB Mac — 4-bit is de sweet spot; 6-bit als je de context strak houdt.

• 48 GB Mac — 6-bit met headroom; 8-bit als u het venster niet pusht.

• 64 GB en meer — 8-bit, bijna verliesvrij, en 262K context binnen handbereik met bovenstaande kanttekeningen.

Dat is het hele runbook. Het model is van 17 augustus 2026, het is geen lanceringsnieuws en dat hoeft ook niet: er waren 83.000 downloads omdat mensen een handleiding wilden, en deze pagina is die handleiding. Begin bij de root van de repo, laad de 4-bit in LM Studio, en verlaat de standaardbuild pas als je weet wat je voor de kwaliteit inruilt. Als je van de GGUF- of FP8-kant van de familie komt, behandelen de gerelateerde handleidingen die paden — het beslissingskader is hier hetzelfde, de quant-wiskunde niet.

Niet weer een build van dit model — Qwen3.8-Flash-Next-Uncensored is een aparte release: geablitereerd van Qwen3.8-Flash-Next, een 176B-opgeslagen / 6B-actieve mixture-of-experts-preview van de Qwen4-architectuur. Dezelfde abliteratietechniek, andere gewichten, zijn eigen collectie.

Alle zes 27B-builds — BF16, GGUF, MLX, FP8, INT8 en NVFP4 — zijn verzameld in de Qwen3.8-27B-Uncensored-collectie op Hugging Face.

Deze gewichten zijn bewust uitsluitend lokaal beschikbaar. Om de abliterated build tegen een gehoste basislijn te meten, Qwen3.8-27B wordt aangeboden op OrcaRouter tegen de lijstprijs van de provider met 0% opslag — het standaardmodel, met intacte veiligheidsalignment.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube