
Qwen3.8-27B VRAM-krav: Hur mycket hårdvara du verkligen behöver
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenNYQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 2382 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
Cirka 17 GB VRAM är siffran som cirkulerar för Qwen3.8-27B — Daniel Han på Unsloth sa att den "bör få plats i ungefär 17 GB VRAM vid lanseringen" — och det är värt att vara noggrann med vad det är och inte är. Det är en uppskattning baserad på föregångaren till 27B, inte en specifikation från Alibaba, eftersom modellen ännu inte har släppts; det officiella arkivet utlovades till veckan den 10 augusti 2026 och hade inte dykt upp när detta skrevs. Den här artikeln delar upp VRAM-frågan i vad du kan planera för, vad som är genuint osäkert och hur siffran förändras med din kvantisering, ditt kontextfönster och din runtime.
Det ärliga svaret först
Det finns ännu ingen officiell hårdvaruspecifikation för Qwen3.8-27B. Allt nedan är uppskattat från Qwen3.6-27B, modellen som 27B efterträder — samma parameterantal, samma troliga hybridarkitektur, och det närmaste som finns till en referens för storleksplanering. Betrakta siffrorna som en planeringsram, inte som en kravspecifikation. De första verkliga mätningarna kommer från kvantiserare och underhållare av inferensramverk inom några dagar efter att vikterna släpps, och det är de siffrorna du ska basera ditt inköp på.
Quant-stegen
Hur mycket VRAM du behöver beror nästan helt på vilken kvantisering du kör. Med utgångspunkt från den community-uppmätta Qwen3.6-27B-tabellen:
• Q4_K_M — ungefär 16 GB VRAM. Den perfekta storleken för 24 GB-kort, och troligen ursprunget till siffran "17 GB". Standardvalet för de flesta team.
• Q3_K_M / IQ3 — ungefär 13 GB VRAM. Passar på 16 GB och till och med 12 GB-kort, med en märkbar kvalitetsminskning.
• Q6_K — ungefär 21 GB VRAM. Nästan förlustfri, och en snäv men verklig passform på ett 24 GB-kort.
• Q8_0 — ungefär 27–30 GB VRAM. För 48 GB-kort där du vill ha de sista dropparna av kvalitet.
• FP8 serving — ungefär 27 GB VRAM för vikterna, vilket är anledningen till att en enda L40S är det vanliga valet av inferens-GPU.
• Full precision (BF16) — cirka 54 GB VRAM. Realistiskt sett ett kort i H100-klassen, och det område där folk slutar kalla det "lokalt."
Den korta versionen: en 24 GB GPU är det säkra köpet för den här modellen, ett 16 GB-kort kan köra den endast om du accepterar de låga kvantiseringarna, och allt med 8 GB eller mindre är uteslutet om inte modellen visar sig vara dramatiskt smalare än sin föregångare.

Variabeln ingen citerar: kontextlängd
Varje siffra ovan gäller för en måttlig kontext. VRAM skalar med kontexten eftersom KV-cachen måste finnas tillsammans med vikterna. På Qwen3.6-27B kördes en 2K-kontext på cirka 11 GB, en 32K-kontext pressade samma kvantisering över 14 GB, och 128K mer än fördubblade cache-fotavtrycket. Om Qwen3.8-27B behåller ett stort inbyggt kontextfönster – och Qwen-generationen har trendat åt det hållet – planera för några GB marginal utöver kvantiseringsstorleken, eller begränsa kontexten i din körningskonfiguration. Att välja en kontextlängd som du inte faktiskt använder är det vanligaste sättet som team hamnar i att köpa ett större kort än de behövde.
Hybridarkitekturens joker
Qwen3.6-27B var en hybridmodell: endast 16 av dess 65 lager använde en traditionell KV-cache, medan 48 använde ett fast rekurrent tillstånd. Resultatet var ungefär fyra gånger mindre KV-minne än en tät modell av samma storlek – vilket är en stor anledning till att en 27B kändes som en modell för ett 24 GB-kort snarare än ett 48 GB-kort. Om Qwen3.8-27B behåller hybriddesignen (troligt, men ej bekräftat) blir kontextlängdsberäkningen ovan mer fördelaktig än den ser ut. Haken är körtidsstödet: ett llama.cpp- eller vLLM-bygge som inte implementerar de rekurrenta lagren kommer att rapportera betydligt högre minnesanvändning. Kontrollera vilka körtider som har implementerat stöd innan du antar att beräkningarna håller.
Vilka GPU:er fungerar faktiskt
Konkret, för de vanliga korten:
RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M bekvämt, Q6_K om du är villig att pressa. Detta är den avsedda målgruppen.
• RTX 3060 / 4060 Ti 16 GB — endast IQ4- eller Q3-nivå kvantiseringar, med måttlig kontext. Fungerar, men inte angenämt.
• 12 GB-kort — Q3_K_M med reducerad kvalitet. Bra för experiment, inte för servering.
• Apple Silicon — en 24 GB Mac kör samma Q4-filer via MLX eller llama.cpp; 16 GB-basmodellerna fastnar i swap-thrashing och är i praktiken uteslutna, precis som de var med Qwen3.6-27B.
• 48 GB och uppåt (A6000, L40S, dubbelkortskonfigurationer) — Q8_0 eller FP8 serving med reell marginal.

Eller hoppa över GPU:n helt.
Om hårdvarukalkylen inte går ihop för dig, behöver modellen inte göra det heller. OrcaRouter är ett API för över 200 modeller — inklusive Qwen-familjen — och det förmedlar leverantörens listpris utan påslag, så Qwen3.8-Max kostar för närvarande $2.00 per miljon input-tokens och $6.00 per miljon output-tokens, samma som på leverantörens egen prissida. Själva 27B-modellen kommer att vara en lokal modell, men när dess vikter släpps och den vinner förtroende, kommer samma nyckel att dirigeras till vilken leverantör som helst som är värd för den — du kan bygga mot generationen nu och aldrig behöva röra GPU-återförsäljarmarknaden alls.

Slutsatsen i maskinvarufrågan: planera för 16 GB för en bekväm 4-bitarskörning, 24 GB för att vara säker och för att ge dig själv utrymme för kontext och högre kvantiseringar, och behandla varje siffra här som preliminär tills repot publiceras och de första verkliga mätningarna dyker upp. Projiceringen på "17 GB" är ett förnuftigt planeringsnummer – det är bara ännu inte ett faktum.
