
Qwen3.8-27B VRAM-vereisten: Hoeveel hardware je echt nodig hebt
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenNIEUWQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 2382 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligentie42Coderen
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligentie39Coderen
Ongeveer 17 GB VRAM is het getal dat rondgaat voor Qwen3.8-27B — Daniel Han van Unsloth zei dat het {{1}}"op release in ruwweg 17GB VRAM zou moeten passen"{{/1}} — en het is de moeite waard om precies te zijn over wat dat wel en niet is. Het is een projectie op basis van de voorganger van de 27B, geen specificatie van Alibaba, omdat het model nog niet is uitgebracht; de officiële repository was toegezegd voor de week van 10 augustus 2026 en was op het moment van schrijven nog niet verschenen. Dit artikel verdeelt de VRAM-kwestie in waar je op kunt rekenen, wat er werkelijk onzeker is, en hoe het getal verschuift met je kwantisering, je contextvenster en je runtime.
Het eerlijke antwoord eerst.
Er is nog geen officiële hardwarespecificatie voor Qwen3.8-27B. Alles hieronder is geprojecteerd vanuit Qwen3.6-27B, het model dat de 27B opvolgt — hetzelfde aantal parameters, dezelfde waarschijnlijke hybride architectuur, en de beste referentie die er is qua omvang. Beschouw de cijfers als een planningsbandbreedte, niet als een vereistenlijst. De eerste echte metingen komen binnen enkele dagen na het vrijkomen van de gewichten van degenen die kwantisatie en inference-frameworks onderhouden, en dat zijn de cijfers waar je je aankoop op moet baseren.
De quant-ladder
Hoeveel VRAM je nodig hebt hangt bijna volledig af van welke kwantisering je draait. Uitgaande van de door de community gemeten Qwen3.6-27B-tabel:
• Q4_K_M — ongeveer 16 GB VRAM. De sweet spot voor 24 GB-kaarten, en waarschijnlijk de oorsprong van dat "17 GB"-cijfer. De standaard voor de meeste teams.
• Q3_K_M / IQ3 — ongeveer 13 GB VRAM. Past op 16 GB en zelfs 12 GB kaarten, met een zichtbare kwaliteitsvermindering.
• Q6_K — ongeveer 21 GB VRAM. Nagenoeg verliesvrij, en een krappe maar realistische pasvorm op een kaart van 24 GB.
• Q8_0 — ongeveer 27–30 GB VRAM. Voor 48 GB-kaarten waar je de laatste beetjes kwaliteit wilt hebben.
• FP8-serving — ongeveer 27 GB VRAM voor de gewichten, daarom is een enkele L40S de gebruikelijke keuze als inference-GPU.
• Volledige precisie (BF16) — ongeveer 54 GB VRAM. Realistisch gezien een H100-klasse kaart, en het terrein waarop mensen het geen "lokaal" meer noemen.
De korte versie: een 24 GB GPU is de veilige keuze voor dit model, een 16 GB kaart kan het alleen draaien als je de lage quants accepteert, en alles met 8 GB of minder valt af, tenzij het model aanzienlijk slanker blijkt te zijn dan zijn voorganger.

De variabele die niemand noemt: contextlengte
Elk getal hierboven geldt voor een bescheiden context. VRAM schaalt mee met de context omdat de KV-cache naast de gewichten moet leven. Bij Qwen3.6-27B gebruikte een 2K-context ongeveer 11 GB, een 32K-context bracht dezelfde quant boven de 14 GB, en 128K meer dan verdubbelde de cache-voetafdruk. Als Qwen3.8-27B een groot native contextvenster behoudt — en de Qwen-generatie beweegt die kant op — plan dan een paar GB headroom boven de quant-grootte, of begrens de context in je runtime-configuratie. Het kiezen van een contextlengte die je niet daadwerkelijk gebruikt, is de meest voorkomende reden waarom teams uiteindelijk een grotere kaart kopen dan ze nodig hadden.
De wildcard van de hybride architectuur
Qwen3.6-27B was een hybride model: slechts 16 van de 65 lagen gebruikten een traditionele KV-cache, terwijl 48 een vaste recurrente toestand gebruikten. Het resultaat was ruwweg vier keer minder KV-geheugen dan een dense model van dezelfde grootte — wat grotendeels verklaart waarom een 27B aanvoelde als een model voor een 24 GB-kaart in plaats van een 48 GB-kaart. Als Qwen3.8-27B het hybride ontwerp behoudt (waarschijnlijk, maar niet bevestigd), wordt de bovenstaande berekening van de contextlengte vriendelijker dan het lijkt. Het addertje onder het gras is runtime-ondersteuning: een llama.cpp- of vLLM-build die de recurrente lagen niet implementeert, zal een veel hoger geheugengebruik rapporteren. Controleer welke runtimes de ondersteuning hebben gemerged voordat je ervan uitgaat dat de projecties kloppen.
Welke GPU's werken daadwerkelijk
Concreet, voor de gewone kaarten:
RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M met gemak, Q6_K als je bereid bent om te knijpen. Dit is de beoogde doelgroep.
• RTX 3060 / 4060 Ti 16 GB — alleen IQ4- of Q3-niveau quants, met bescheiden context. Werkbaar, niet prettig.
• 12 GB-kaarten — Q3_K_M met verminderde kwaliteit. Prima voor experimenten, niet voor het serveren.
• Apple Silicon — een 24 GB Mac draait dezelfde Q4-bestanden via MLX of llama.cpp; de 16 GB basismodellen swap-thrashen en vallen effectief af, net als bij Qwen3.6-27B.
• 48 GB en meer (A6000, L40S, dual-card-opstellingen) — Q8_0 of FP8 serving met echte headroom.

Of sla de GPU helemaal over.
Als de hardwareberekening niet voor u uitkomt, hoeft u het model niet zelf te draaien. OrcaRouter is één API voor meer dan 200 modellen — waaronder de Qwen-familie — en het geeft de lijstprijs van de provider door zonder opslag, dus Qwen3.8-Max kost momenteel $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens, hetzelfde als op de eigen prijspagina van de leverancier. De 27B zelf zal een lokaal model zijn, maar wanneer de gewichten vrijkomen en het vertrouwen wint, zal dezelfde sleutel doorsturen naar welke provider het ook host — u kunt nu al op deze generatie bouwen en de GPU-reseller-markt helemaal niet aanraken.

De kern van de hardwarevraag: reken op 16 GB voor een comfortabele 4-bit run, 24 GB om veilig te zitten en ruimte te hebben voor context en hogere quants, en behandel elk cijfer hier als voorlopig totdat de repository verschijnt en de eerste echte metingen er zijn. De "17 GB"-prognose is een verstandig planningsgetal — het is alleen nog geen feit.
