Een hero-titelkaart met de tekst Qwen3.8-27B GGUF, met het onderschrift 'de juiste quant voor je GPU', een downloadpictogram en bestandschips voor Q4_K_M 17.1GB en UD-IQ2 9.0GB.
Guides & Insights

Qwen3.8-27B GGUF: Welke quant moet je downloaden voor jouw GPU

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Download het pakket unsloth/Qwen3.8-27B-GGUF en kies het bestand dat bij de kaart past die je daadwerkelijk hebt. Dat is het hele antwoord: een GPU met 24GB (RTX 4090 of 3090) zou moeten kiezen voor Q4_K_M van 17,1GB; een GPU met 16GB zou moeten kiezen voor IQ4_XS van 15,7GB (of Q3_K_M van 13,8GB als je contextruimte wilt); een GPU met 12GB is beperkt tot de 2-bit bestanden, UD-IQ2_XXS van 9,0GB, en dat is een compromis dat je bewust moet sluiten. Qwen3.8 27B — Ali​baba's dense model met 27 miljard parameters, Apache 2.0-gewichten uitgebracht op 13–14 augustus 2026 — draait lokaal uitzonderlijk goedkoop omdat zijn hybride attention slechts 16 van de 64 lagen cached, dus een 4-bit quant op 24GB kan comfortabel 32K–64K context-tokens aan. En de GGUF is de enige route met nul marginale kosten: geen API-sleutel, geen rekening per token, geen data die je machine verlaat.

Wat betreft de bronnen: de architectuur, het contextvenster en de licentie zijn officieel, afkomstig van de Qwen3.8 27B-modelkaart op Hugging Face, geverifieerd op 15 augustus 2026. De GGUF-groottes zijn afkomstig van de GGUF-repositories van unsloth en ggml-org, op dezelfde dag. De per-GPU-VRAM-richtlijn is de officiële aanbeveling van unsloth. De KV-cache-byte-schattingen en tokens-per-seconde-cijfers zijn door de community gemeten in de eerste dagen na de release, niet afkomstig van leverancierspecificaties. Elke hieronder genoemde benchmark is door Ali​baba gerapporteerd en niet onafhankelijk gereproduceerd.

De bestandskiezer, één regel per quant.

UD-IQ2_XXS — 9.0GB — de enige die comfortabel in een 12GB-kaart past; reken op zichtbaar kwaliteitsverlies.

UD-Q2_K_XL — 10.7GB — 12GB-kaarten, met bijna geen context meer over.

Q3_K_M — 13,8GB — 16GB-kaarten die context-headroom willen.

IQ4_XS — 15,7GB — 16GB-kaarten: de grootste quant die in zijn geheel past.

Q4_K_M — 17.1GB — 24GB-kaarten: de ideale keuze, en het bestand waarnaar dit artikel je verwijst.

Q5_K_M — 19.8GB — 24GB, waarbij contextruimte wordt ingeruild voor een kleine kwaliteitswinst.

Q6_K — 22.9GB — past in 24GB als je het erin propt; bijna verliesloos.

Q8_0 — 29.0GB — 32GB, een verdeling over twee kaarten, of CPU-offload.

BF16 — 54.7GB — serverkaarten en RAM-intensieve CPU-configuraties; referentieprecisie.

Twee pakketten, twee Q4_K_M-groottes: unsloth's is 17.1GB; ggml-org's is 19.0GB. Het unsloth-pakket gebruikt Dynamic V3.0 (preview)-kwantisering voor zijn UD-* bestanden en is degene waar de meeste lokale apps standaard op terugvallen; het ggml-org-pakket levert de standaard K-quants plus de afzonderlijke multi-token-voorspellingskop die wordt gebruikt voor speculatieve decodering. Beide Q4_K_M werken — het verschil is een paar honderd megabyte en het MTP-bestand.

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

Waarom deze 27B past op kaarten kleiner dan de meeste

Qwen3.8 27B heeft 64 lagen, maar slechts 16 gebruiken volledige aandacht. De andere 48 gebruiken Gated DeltaNet lineaire aandacht, die een terugkerende toestand van vaste grootte bijhoudt in plaats van een groeiende key-value-cache. De eigen blokindeling van de modelkaart is 3×(Gated DeltaNet → FFN) voor elke 1×(Gated Attention → FFN) — een hybride verhouding van 3:1. Het praktische effect: de KV-cache is ongeveer een kwart van wat een conventioneel 27B dicht model nodig heeft voor dezelfde context. Gemeenschapsmetingen van deze week plaatsen de cache op ongeveer 0,5GB bij 8K context, 2,0GB bij 32K en 16,4GB bij het volledige native venster van 262K. Dat keert het gebruikelijke advies om — het grootste deel van je VRAM-budget gaat naar de gewichten, niet naar de context, en een 24GB-kaart kan Q4_K_M draaien met 64K–96K context zonder problemen. Je kunt de cache nog verder verkleinen met de --cache-type-k-vlag van llama.cpp, die de cache zelf kwantiseert.

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

Drie valkuilen die je op dag één doen struikelen.

Oude llama.cpp-builds wijzen het bestand af. De GGUF registreert de nieuwe qwen35-architectuur, dus je hebt een actuele build nodig — elke build van vóór de releaseweek weigert het te laden met een architectuurfout. Update eerst llama.cpp, voordat je downloadt.

De templateval.De officiële Jinja-chat-template wikkelt elke assistentbeurt in een think-blok, zelfs wanneer de redeneringstrace leeg is, wat geneste blokken en afgekapte geschiedenis oplevert in chats met meerdere beurten — het lijkt alsof het model is vergeten wat je zei. Voer llama.cpp uit met --jinja, en geef de voorkeur aan een pakket dat een gecorrigeerde chat_template.jinja meelevert.

Vision heeft een apart bestand nodig. Tekst werkt direct; afbeeldingen en video doen stilzwijgend niets tenzij je ook de mmproj-projector laadt, ongeveer 0,9GB. Deze staat niet vermeld op de GGUF-repopagina van unsloth — haal hem uit de basisrepository of het ggml-org-pakket. Als je documenten of screenshots wilt invoeren, voeg dan --mmproj toe aan het servercommando.

Voer het uit: de opdrachten

{{1}}llama.cpp{{/1}}, {{2}}zodra je een huidige build hebt:{{/2}}

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...en voeg --mmproj Qwen3.8-27B-mmproj-bf16.gguf toe als je visie nodig hebt.

Ollama, als je de bibliotheekvermelding wilt: ollama pull qwen3.8:27b, en dan ollama run qwen3.8:27b. LM Studio en Unsloth Desktop nemen de chat-template en het RAM-offloading automatisch over — dat is de minst gepeuterde manier voor een eerste keer.

Lokaal vs API: de eerlijke economie

De GGUF is de gratis route: nul marginale kosten, geen snelheidslimieten, niets verlaat je machine. Het is niet de goedkope route in absolute termen — jij levert de 24GB GPU (een gebruikte RTX 3090 of een nieuwe RTX 4090, plus elektriciteit), en een 2-bit bestand op een 12GB kaart is een gecompromitteerde ervaring.

De API-route bestaat omdat de gewichten Apache 2.0 zijn, dus de marginale kosten van het aanbieden liggen dicht bij nul en iedereen kan het hosten. Qwen3.8 27B is vandaag live op OrcaRouter voor $0,33 per miljoen invoertokens en $2,40 per miljoen uitvoer — de lijstprijs van de provider wordt zonder opslag doorberekend — en omdat de gewichten open zijn, is er ook een gratis limietniveau dat $0 per verzoek rekent en HTTP 429 retourneert wanneer je de limiet overschrijdt. Een representatieve maand van 10 miljoen tokens met een invoeraandeel van 70% kost ongeveer $9,51 op het betaalde niveau. Als je de GPU al bezit, wint lokaal op kosten; als je dat niet doet, is het huren van de tokens beter dan een kaart kopen voor een zijproject.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

Wanneer deze aanbeveling onjuist is

Q4_K_M op 24GB is de standaard, niet het universele antwoord. Kies iets anders wanneer:

Je hebt maximale kwaliteit nodig op een server of workstation — Q8_0 op 29GB of BF16 op 54.7GB met CPU- en RAM-offload, geen 4-bit bestand.

Je gebruikt een Blackwell RTX 50-serie kaart — de NVFP4-variant is ongeveer 1,5× sneller in dezelfde 24GB VRAM en gebruikt een FP8 KV-cache voor langere context. Op een 5090 verslaat NVFP4 elke GGUF op dit model.

Je hebt de volledige 262K context nodig — reken op een cache van ongeveer 16GB bovenop de gewichten; dat brengt een 24GB-kaart terug naar Q3_K_M, of dwingt KV-kwantificatie af.

Je vertrouwt op speculatieve decoding — kies de ggml-org pack, die de multi-token-prediction head behoudt; sommige quants verwijderen die om ongeveer 0,5 GB te besparen.

Je hebt maar 12GB — een eerlijk antwoord: een 2-bit 27B is merkbaar slechter dan hetzelfde model dat fatsoenlijk draait. Probeer het gratis API-niveau voordat je je vastlegt op een lokale 2-bit-opstelling; als het goed genoeg is, kan de GGUF wachten tot de hardware het bijbeent.

Kortom

Qwen3.8 27B is de zeldzame 27B die zonder compromissen op een 24GB-kaart past: een 17,1GB Q4_K_M-download, een recente llama.cpp-build en een KV-cache die goedkoop genoeg is dat lange context vrijwel niets kost. Download dat bestand als je de hardware hebt, onthoud dat visie de aparte mmproj nodig heeft, en verwacht de sjabloonval de eerste keer dat een gesprek met meerdere beurten vergeetachtig lijkt. Als je de hardware niet hebt, is hetzelfde model een API van $0,33/$2,40 met een gratis, snelheidsbeperkte laag, dus er is geen reden om een 2-bit bestand te draaien waar je niet tevreden mee bent. De GGUF is het gratis pad; het is alleen niet meer het enige pad.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube