En hero-titelruta med texten Qwen3.8-27B GGUF, undertiteln 'rätt kvantisering för ditt grafikkort', en nedladdningsikon och filchips för Q4_K_M 17,1 GB och UD-IQ2 9,0 GB.
Guides & Insights

Qwen3.8-27B GGUF: Vilken kvantisering att ladda ner för din GPU

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ladda ner unsloth/Qwen3.8-27B-GGUF-paketet, och matcha filen med det kort du faktiskt äger. Det är hela svaret: ett 24GB-grafikkort (RTX 4090 eller 3090) bör ta Q4_K_M på 17.1GB; ett 16GB-grafikkort bör ta IQ4_XS på 15.7GB (eller Q3_K_M på 13.8GB om du vill ha kontextutrymme); ett 12GB-grafikkort är begränsat till 2-bitarsfilerna, UD-IQ2_XXS på 9.0GB, och det är en medveten kompromiss. Qwen3.8 27B — Ali​babas täta modell med 27 miljarder parametrar, Apache 2.0-vikter släppta 13–14 augusti 2026 — körs ovanligt billigt lokalt eftersom dess hybridattention cachar endast 16 av sina 64 lager, så en 4-bitars kvantisering på 24GB klarar bekvämt 32K–64K kontexttoken. Och GGUF är den enda vägen med noll marginalkostnad: ingen API-nyckel, ingen per-token-faktura, ingen data lämnar din maskin.

Angående källorna: arkitekturen, kontextfönstret och licensen är officiella, från modellkortet för Qwen3.8 27B på Hugging Face, verifierat den 15 augusti 2026. GGUF-storlekarna är från unsloths och ggml-orgs GGUF-förråd, samma dag. VRAM-vägledningen per GPU är unsloths officiella rekommendation. KV-cache-byteuppskattningarna och siffrorna för tokens per sekund är uppmätta av communityn under de första dagarna efter lanseringen, inte leverantörsspecifikationer. Varje benchmark som nämns nedan är Ali​baba-rapporterad och inte reproducerad.

Filväljaren, en rad per quant

UD-IQ2_XXS — 9.0GB — det enda bekväma valet för ett 12GB-kort; förvänta dig synlig kvalitetsförlust.

UD-Q2_K_XL — 10.7GB — 12GB-kort, med nästan inget kontext till övers.

Q3_K_M — 13.8GB — 16GB-kort som vill ha utrymme för kontext.

IQ4_XS — 15,7GB — 16GB-kort: den största kvantiseringen som ryms helt.

Q4_K_M — 17.1GB — 24GB-kort: den optimala punkten, och filen som den här artikeln hänvisar dig till.

Q5_K_M — 19.8GB — 24GB, byter kontextutrymme mot en liten kvalitetsvinst.

Q6_K — 22,9GB — ryms i 24GB om du trycker till; nästan förlustfri.

Q8_0 — 29,0 GB — 32 GB, en uppdelning på två kort, eller CPU-avlastning.

BF16 — 54.7GB — serverkort och RAM-tunga CPU-konfigurationer; referensprecision.

Två paket, två Q4_K_M-storlekar: unsloths är 17,1 GB; ggml-orgs är 19,0 GB. Unsloth-paketet använder Dynamic V3.0 (förhandsversion) kvantisering för sina UD-*‑filer och är det som de flesta lokala appar använder som standard; ggml-org-paketet levereras med standard‑K-quants plus det separata huvudet för multi-token-prediktion som används för spekulativ avkodning. Båda Q4_K_M‑versionerna fungerar — skillnaden är några hundra megabyte och MTP‑filen.

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

Varför denna 27B ryms på kort som är mindre än de flesta.

Qwen3.8 27B har 64 lager, men endast 16 använder full attention. De övriga 48 använder Gated DeltaNet linjär attention, som håller ett tillstånd av fast storlek för återkommande bearbetning istället för en växande key-value-cache. Modellkortets egen blocklayout är 3×(Gated DeltaNet → FFN) för varje 1×(Gated Attention → FFN) — en hybridkvot på 3:1. Den praktiska effekten: KV-cachen är ungefär en fjärdedel av vad en konventionell 27B-tät modell behöver för samma kontext. Community-mätningar den här veckan uppskattar cachen till cirka 0,5 GB vid 8K-kontext, 2,0 GB vid 32K och 16,4 GB vid det fulla 262K-nativa fönstret. Det vänder på de vanliga råden — större delen av din VRAM-budget går till vikterna, inte kontexten, och ett 24GB-kort kan köra Q4_K_M med 64K–96K-kontext utan problem. Du kan krympa cachen ytterligare med llama.cpp:s --cache-type-k-flagga, som kvantiserar själva cachen.

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

Tre fallgropar som stjälper dig på dag ett.

Gamla llama.cpp-byggen avvisar filen. GGUF-filen anger den nya qwen35-arkitekturen, så du behöver en aktuell build — allt från före releasveckan vägrar att ladda den med ett arkitekturfel. Uppdatera llama.cpp först, innan du laddar ner.

Mallfällan.Den officiella Jinja-chatsmallen omsluter varje assistenttur i ett tankeblock även när resonemangsspåret är tomt, vilket ger kapslade block och trunkerad historik i flervarvschattar – det ser ut som att modellen glömt vad du sa. Kör llama.cpp med --jinja och föredra ett paket som levererar en korrigerad chat_template.jinja.

Vision behöver en separat fil. Text fungerar direkt; bilder och video ignoreras tyst om du inte också laddar mmproj-projektorn, ungefär 0,9 GB. Den är inte listad på unsloths GGUF-reposida — hämta den från basrepo eller ggml-org-paketet. Om du planerar att mata dokument eller skärmbilder, lägg till --mmproj till serverkommandot.

Kör det: kommandona

llama.cpp, när du har en aktuell build:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...och lägg till --mmproj Qwen3.8-27B-mmproj-bf16.gguf om du behöver bildigenkänning.

Ollama, om du vill ha biblioteksposten: `ollama pull qwen3.8:27b`, kör sedan `ollama run qwen3.8:27b`. LM Studio och Unsloth Desktop hanterar chatmallen och RAM-avlastningen automatiskt — de är den minst krångliga vägen för en första körning.

Lokalt kontra API: den ärliga ekonomin

GGUF är den kostnadsfria vägen: noll marginalkostnad, inga anropsbegränsningar, ingenting lämnar din dator. Det är inte den billiga vägen i absoluta tal — du står för GPU:n med 24 GB (en begagnad RTX 3090 eller en ny RTX 4090, plus el), och en 2-bitarsfil på ett 12 GB-kort är en kompromissad upplevelse.

API-vägen finns eftersom vikterna är Apache 2.0, så marginalkostnaden för att tillhandahålla är nära noll och vem som helst kan hosta. Qwen3.8 27B är live på OrcaRouter idag för 0,33 USD per miljon input-token och 2,40 USD per miljon output-token — leverantörens listpris förs vidare utan påslag — och eftersom vikterna är öppna finns det också en hastighetsbegränsad gratisnivå som tar 0 USD per begäran och returnerar HTTP 429 när du överskrider dess tak. En representativ månad med 10 miljoner token och 70 % inputandel kostar ungefär 9,51 USD på den betalda nivån. Om du redan äger GPU:n är lokalt billigare; om du inte gör det, är det bättre att hyra token än att köpa ett kort för ett sidoprojekt.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

När denna rekommendation är fel

Q4_K_M på 24GB är standard, inte det universella svaret. Välj något annat när:

Du behöver maximal kvalitet på en server eller arbetsstation — Q8_0 på 29GB eller BF16 på 54,7GB med CPU- och RAM-offload, inte en 4-bitars fil.

Du använder ett Blackwell RTX 50-serie-kort — NVFP4-varianten är ungefär 1,5× snabbare i samma 24 GB VRAM och använder en FP8-KV-cache för längre kontext. På en 5090 slår NVFP4 alla GGUF på den här modellen.

Du behöver hela 262K-kontexten — budgetera för ett cacheminne på ungefär 16GB utöver vikterna; det pressar ett 24GB-kort ner till Q3_K_M, eller tvingar fram KV-kvantisering.

Du förlitar dig på spekulativ avkodning — välj ggml-org-paketet, som behåller multi-token-prediktionshuvudet; vissa quantar tar bort det för att spara cirka 0,5 GB.

Du har bara 12 GB — ett ärligt svar: en 2-bit 27B är märkbart sämre än samma modell som serveras korrekt. Prova den kostnadsfria API-nivån innan du bestämmer dig för en lokal 2-bit-installation; om det är bra nog kan GGUF vänta tills hårdvaran hinner ikapp.

Slutsats

Qwen3.8 27B är den sällsynta 27B-modellen som får plats på ett 24GB-kort utan kompromisser: en 17.1GB Q4_K_M-nedladdning, en aktuell llama.cpp-build och en KV-cache som är så billig att lång kontext nästan kostar ingenting. Ladda ner den filen om du äger hårdvaran, kom ihåg att vision kräver den separata mmproj, och var beredd på mallfällan första gången en flervarvskonversation verkar glömsk. Om du inte äger hårdvaran är samma modell ett API för $0.33/$2.40 med en gratis hastighetsbegränsad nivå, så det finns ingen anledning att köra en 2-bitars fil du inte är nöjd med. GGUF-filen är den fria vägen; den är bara inte den enda vägen längre.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube