Hero-kort för artikeln 'Qwen3.8-Flash-Next-Uncensored: Kör den ablitererade MoE:n på llama.cpp och Apple Silicon', som visar rubriken, underrubriken 'GGUF + native MLX – upp till 262K kontext' och tre spec-chips: 'Gated på Hugging Face', '13 GGUF-kvantiseringar' och '6-bitars MLX-bygge'.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored: Kör den abliterade MoE:n på llama.cpp och Apple Silicon

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Innan du laddar ner något: Qwen3.8-Flash-Next-Uncensored är inte Qwen3.8-27B-Uncensored. De delar ett familjenamn och en abliterationsteknik, men de är olika modeller från olika viktversioner, och varje tidigare inlägg om ”Qw​en uncensored” på den här bloggen handlar om 27B. Ämnet här är det par som OrcaRouter publicerade på Hugging Face den 26 augusti 2026 — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF och orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — ablitererade byggen av Qwen3.8-Flash-Next, Alibabas 176B-lagrade / 6B-aktiva routade mixture-of-experts-modell som förhandsvisar Qwen4-arkitekturen. Vi annonserade släppet som ”GGUF + native MLX, upp till 262K kontext,” riktat till säkerhetsforskare, red teams och blue teams. Den här runbooken är skriven utifrån våra egna model cards: vad refusal-borttagning gör inuti en routad MoE, vad 262K-kontextpåståendet faktiskt kostar i minne, hur man serverar båda filvarianterna, och var forskningslinjen ligger. Om du kom hit för att få abliterationsguiden eller 27B-kvantmatematiken, täcker de tidigare inläggen i den här serien det.

Scoreboard card for Qwen3.8-Flash-Next-Uncensored with six rows: base model Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + terms), GGUF quants 13 (IQ2_XXS to Q5_K_M), vision mmproj F16 projector, MLX build 4/6/8-bit, context 262,144 tokens (YaRN to 1M); footer reads 'OrcaRouter model-card data, August 2026 - not independently audited.'

Först, grinden

Båda reposen är gated på Hugging Face (gated: auto). Inga filnedladdningar sker förrän du är inloggad och har accepterat villkoren för varje repo — GGUF- och MLX-reposen har var sin egen gate. Detta är den mest praktiska skillnaden jämfört med en ogated GGUF-linje: den naiva one-linern "just hf download" misslyckas med ett autentiseringsfel innan den hämtar en enda byte. Flödet är:

• Logga in på Hugging Face (eller registrera dig) och installera huggingface_hub, kör sedan hf auth login en gång så att din token finns på disk.

• Öppna orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF i webbläsaren, acceptera villkoren, upprepa sedan för orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX.

• Från och med då fungerar hf download med din autentiserade token som vilket annat repo som helst. Varje kvantiserad modell du hämtar, och MLX-vikterna, är en forskningsartefakt under Apache-2.0 — samma licens som basmodellen — och grinden är en del av avtalet: att läsa villkoren är steg ett för att använda modellen.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF repository on Hugging Face, showing the gated access banner ('You need to agree to share your contact information to access this model'), the tags abliterated/uncensored/qwen4/Mixture of Experts/llama.cpp/vision-language/mmproj, and the Apache 2.0 licence.

Vad abliteration gör med en routad MoE

Tekniken är den vikteredigering i Arditi-stil som vi har behandlat tidigare på den här bloggen; det intressanta är vad den gör med just den här arkitekturen. På den täta 27B-modellen rörde det sig om 131 residualmatriser. För Qwen3.8-Flash-Next-Uncensored anger MLX-modellkortet att abliteration tillämpades på 149 residualskrivande tensorer, och de komponenter som gör den här modellen till vad den är – MoE-routern, den 51B stora n-gram-inbäddningstabellen, visionstornet – rördes uttryckligen aldrig.

Att den ”aldrig rörts” är hela historien för en routad modell. Varje token aktiverar 10 av 512 experter; ingen enskild expert äger vägran. Vägrarbeteendet lever i residualströmmen som komponerar slututmatningen, vilket är exakt den riktning som ortogonaliseringen avlägsnar. Så routern fortsätter att routera samma experter, n-gram-tabellen fortsätter att producera samma embeddingar, och det som förändras är vad modellen säger när outputprojektionen körs. GGUF-modellkortets publicerade resultat beskriver förändringens form som att vägran vid skadliga uppmaningar sjunker från 64–100 % på basmodellen till ungefär 0–3,3 % i denna byggversion, godartad övervägran nära 0 % och kapacitet inom ±2 procentenheter från basmodellen på MMLU-Pro / GSM8K / CMMLU-liknande tester. Dessa är kortets egna siffror, självrapporterade snarare än oberoende reproducerade.

MTP-huvudet: närvarande i MLX, utelämnat i GGUF

Qwen3.8-Flash-Next levereras med ett spekulativt ~4B-huvud för multi-token-prediktion, och de två byggena är oense om det. GGUF-repot utelämnar huvudet — modellkortet är tydligt med att dessa filer inte inkluderar mtp-huvudet för spekulativt utkast — eftersom llama.cpp:s qwen4exp-stöd ännu inte implementerar MTP, så huvudet skulle vara ren dödvikt i filen. MLX-bygget behåller det, så på Apple Silicon får du fortfarande spekulativ avkodning. Den praktiska konsekvensen, bekräftad av praktiker som kör basmodellen: llama.cpp GGUF-spåret körs idag utan spekulativ avkodning, medan en MTP-aktiverad SGLang-uppsättning mer än fördubblar avkodningshastigheten på samma typ av hårdvara. Om llama.cpp någonsin får in MTP för qwen4exp får GGUF-linjen en gratis hastighetsökning — men köp inte hårdvara i väntan på att det händer den här veckan.

Påståendet om 262K-kontext, och vad KV-cachen kostar

Den nativa kontexten är 262 144 tokens (utbyggbar med YaRN mot 1M), och den begränsning som faktiskt biter är minnet. Den goda nyheten är att arkitekturen håller KV-cachen liten: av de 48 lagren använder 36 linjär attention av typen Gated DeltaNet, som komprimerar historik till ett rekurrent tillstånd med fast storlek, och endast de 12 lagren med full attention har en konventionell KV-cache som växer med sekvenslängden.

Två community‑uppmätta datapunkter, båda på basmodellen, överförs direkt. En distribution med 4× RTX 3090 och GGUF rapporterade en ökning från 65K till 131K kontext med endast ~0,78 GB extra KV per kort, och en enda DGX Spark körde full 262K kontext med en fil av Q4‑klass samtidigt som modellen hölls i minnet på ~76,9 GB av dess 128 GB‑pool genom att låsa n‑gramtabellen till CPU och mmap:a den från NVMe. GGUF‑modellkortets egen budgetrad är total = filstorlek + KV‑cache + ~0,9 GB mmproj. Slutsatsen för kvantiseringsval: vid 262K är KV‑cachen en verklig post, men vikterna är den dominerande, så samma VRAM‑först‑logik från 27B GGUF‑guiden gäller — skillnaden här är själva filstorlekarna, som sträcker sig från IQ2_XXS på ungefär 52 GB till Q5_K_M på ungefär 125 GB.

GGUF-linjen: 13 kvantiseringar, splittade filer, mmproj och en llama.cpp-build

GGUF-repot levererar 13 kvantiseringsnivåer — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — där IQ-kvanterna är byggda från en viktmatris över engelsk, kinesisk och kodkalibreringstext. Varje kvant är uppdelad i flera delar med llama-gguf-split, så ladda ner hela uppsättningen för en kvant och peka lastaren mot ...-00001-of-000NN.gguf-delen. Det finns ingen Q6_K-, Q8_0- eller F16-nivå, och orsaken är strukturell snarare än ekonomisk: n-gram- (PLE) inbäddningstabellen är en tensor som är för stor för att uppfylla Hugging Faces gräns på 50 GB per fil vid 6-bitars och högre, och en enskild GGUF-tensor kan inte delas över filer — så linjen slutar vid Q5_K_M.

Den andra filen du inte får hoppa över är mmproj-...-F16.gguf, ungefär 0,9 GB: detta är en vision-språkmodell, och llama.cpp behöver projektorn för all bildinmatning. Qwen3.8-Flash-Next är multimodal, och det är även den här builden — abliterationen rör inte visionstornet.

Stöd för llama.cpp finns inte i mainline ännu. Arkitektur-id:t är qwen4exp, och standardbyggen misslyckas med "unknown architecture 'qwen4_exp'"; du behöver en bygg från PR #27742 (gren qwen4exp/qwen3.8-flash-next), kompilerad med målen llama-cli, llama-mtmd-cli, llama-server och llama-gguf-split. Därifrån är serverformen den vanliga llama.cpp-servern med Qwen-specifika flaggor, med kvantnamnet från dellfilerna:

llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Sätt -c till vilken kontext du får plats med; modellkortets exempel börjar vid 8192. Reasoning är på som standard och returneras i reasoning_content, och verktygsanrop fungerar via den OpenAI-kompatibla slutpunkten. Samplingsvärdena ovan är modellkortets rekommendation; användare av basmodellen använder temp 0.7 / top-p 0.80 / top-k 20 med en närvarostraff på 1.5 i icke-tänkande instruktionsläge, och justerar resonemangsdjupet med --chat-template-kwargs {"reasoning_effort":"medium"}.

MLX-bygget på Apple Silicon

MLX-repot är den inbyggda Apple-Silicon-vägen: samma vikter, samma vägransborttagning, en Metal-nativ körtid. Den levereras med 4-bit som standard (~163 GB), det annonserade 6-bit-bygget (~192 GB) och en 8-bit-nivå (~221 GB), och eftersom fused-3D-experterna och n-gram-tabellen hålls med högre precision än den nominella etiketten, ligger den effektiva precisionen väl över enhetlig 4-bit – modellkortet listar ~7,85 effektiva bitar per vikt för ”4-bit”-etiketten. Det är därför repostorlekarna ser stora ut: n-gram-tabellen är inte nerkomprimerad på det sätt som communityns kvantiseringar trycker ihop den.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX repository on Hugging Face, showing the gated access banner, the tags Mixture of Experts/vision-language/function-calling/reasoning/mtp/ai-red-team, licence apache-2.0, and the card line 'An abliterated (refusal-removed) MLX build (4/6/8-bit) of Qwen's Qwen3.8-Flash-Next for Apple Silicon'.

Hårdvara är den begränsande faktorn. MLX körs endast på Apple Silicon (Metal), och du behöver enhetligt minne för vikterna — modellkortets rad är "en Mac med tillräckligt enhetligt minne för de 163 GB vikterna (t.ex. M-series Ultra)". Behandla 4-bitarsnivån som en 192 GB-klassmaskin och 6-bitarsbygget som 256 GB-klass. Kortets taggar dokumenterar hela funktionsuppsättningen — qwen4_exp, MoE, MTP, funktionsanrop, vision-språk — och det drivs genom mlx-vlm för bildinmatning. MTP-spekulativa huvudet ingår här, vilket är MLX-byggets tysta fördel jämfört med GGUF-linjen.

Visionsvägen, för dem som använder den

Eftersom detta är en vision-språkmodell är den multimodala vägen en del av runbooken snarare än ett extra tillägg. På llama.cpp kräver bildinmatning både mmproj-projektorn och en build som inkluderar llama-mtmd-cli / llama-server. På MLX driver du den med mlx-vlm i stället för den textbaserade mlx-lm-drivrutinen. För red teams är visionsvägen där det intressanta eval-arbetet finns: multimodala skyddsräcken, prompt injection som förs in via en bild, OCR mot skärmbilder av dina egna system och adversariala bilder som riktas mot hela pipelinen. Eftersom abliterationen täcker hela modellen och lämnar visionstornet intakt, landar en bild som skulle ha utlöst en vägran i textdelen helt enkelt på en modell utan något vägransbeteende att träffa. GGUF-kortet säger att vision och flervarvsverktygsanrop verifierades på den här builden; ingen separat vision-evalsvit är publicerad.

Vad detta är till för, och var gränsen går.

Den här builden finns för en enda typ av arbete: att utvärdera vad en modell utan refusering kan göra, i syfte att förstå och försvara system. För ett red team innebär det att testa dina egna skyddsräcken mot en modell som inte artigt avböjer — motståndskraft mot prompt-injektion, exfiltreringsscenarier, missbruk av verktygsanvändning och gapet mellan "basmodellen vägrar" och "modellen kan faktiskt inte göra detta." Det gapet är hela forskningsvärdet av en ablitererad build: den talar om för dig vad refuseringslagret dolde, vilket är skillnaden mellan säkerhet genom policy och säkerhet genom förmåga. För ett blue team är samma vikter motståndarens troliga baslinje: om en fientlig aktör kan ladda ner och köra den här, måste dina försvar hålla mot en modell som svarar istället för att avböja. Utvärderingar som bygger på den är en nedre gräns för vad en skräddarsydd modell som aldrig varit aligned skulle kunna göra — behandla dem så, inte som ett tak.

Var tydlig med vad avlägsnandet av vägran förändrar och inte förändrar. Det förändrar outputbeteendet – modellen avböjer inte längre – och det förändrar inte förmågan. Ingen ny kunskap, inga nya färdigheter, ingen ny beräkningskapacitet; samma träning, samma begränsningar för vad modellen faktiskt kan producera. En ablitererad modell kan inte konstruera skadlig kod som den inte kunde tidigare; den svarar helt enkelt istället för att undvika, och dess utdata är inte sanningsenligare för att de är mer tillåtande. Modellkortets ±2-punktsförmågeband och kollapsen av vägranssiffrorna är samma faktum sett från två håll.

Var gränsen går är gated-repo-avtalet, och det är ingen standardtext. Legitim användning: utvärdera dina egna system, offentlig sårbarhetsforskning på modeller, bygga detektions- och försvarsutvärderingar, studera vägransmekanismer. Inte legitimt: att driftsätta detta som en användarriktad assistent, generera fungerande skadeprogram eller exploits mot system du inte äger eller saknar auktorisation att testa, bedrägeri, vapenmaterial. Apache-2.0-licensen och tillämplig lag är golvet; grinden är det explicita forskningsändamålsavtalet ovanför det. Om ditt användningsfall är att "leverera en chattbot till användare", är detta inte din modell — och det är medvetet, inte ett förbiscende.

Så här får du den serverade baslinjen

Dessa vikter är medvetet endast lokala: ett red teams probe-nyttolaster bör aldrig transitera genom ett tredjeparts-API, och self-hosting är hela poängen. När du vill ha den censurerade, serverade baslinjen för jämförelse — Alibabas Qwen3.8-Flash för 0,16 USD per miljon input och 0,47 USD per miljon output — dirigerar OrcaRouter den till leverantörens listpris med 0 % påslag och automatisk failover, så att en eval-harness kan växla mellan den hostade basen och din lokala ocensurerade build med en enda nyckel och utan ett andra avtal. De öppna Qwen3.8-Flash-Next-vikterna finns ännu inte i vår katalog; när en runtime som vi dirigerar hanterar dem hamnar de i samma upplägg med en enda nyckel och listpris.

Börja här

Bestäm vilken rad som matchar din hårdvara och läs sedan den relevanta gate. På en Mac med 128 GB+ enhetligt minne ger MLX-bygget dig MTP och vision på ett ställe — acceptera MLX-repots villkor, hämta 4-bitars eller 6-bitars vikter och driv dem med mlx-vlm. På NVIDIA, AMD eller en CPU-dator bygger du llama.cpp från PR #27742, accepterar GGUF-repots villkor, hämtar en kvantiserad modell som passar och glöm inte mmproj-filen. I båda fallen är avvisningssiffrorna och kapacitetsbandet repots egna, publicerade på kortet och inte reproducerade i nuläget — det ärliga sättet att läsa dem är som leverantörens mätning av sin egen ändring, inte som en oberoende granskning. Gaten, licensen och säkerhetsgränsen ovan är samma text från tre vinklar: detta är ett forskningsinstrument, och det släpps på det villkoret.

Alla fem Flash-Next-versioner — BF16, GGUF, MLX, FP8 och NVFP4 — finns samlade i samlingen Qwen3.8-Flash-Next-Uncensored på Hugging Face.

Ska inte förväxlas med 27B-familjen: Qwen3.8-27B-Uncensored är en annan modell ablitererad från en annan bas, med sin egen samling och sina egna runbooks. Samma teknik, andra vikter.

Dessa vikter är avsiktligt endast lokala. För en hostad baslinje att mäta den abliterade versionen mot är det Qwen3.8-Flash som serveras på OrcaRouter till leverantörens listpris med 0 % påslag — standardmodellen med säkerhetsanpassningen intakt.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube