
De bästa lokala LLM:erna för kodning i augusti 2026, sorterade efter VRAM: Qwen3-Coder 30B, gpt-oss-20b, Qwen 2.5 Coder 7B
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenNYQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxNYMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 2214 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
Den bästa lokala LLM:en för kodning i augusti 2026 avgörs först och främst av ditt VRAM. Om du har ett 24GB-kort — ett RTX 3090 eller 4090 — kör Qwen3-Coder-30B-A3B-Instruct: 30B totala parametrar med endast 3,3B aktiva per token, ett kontextfönster på 262 144 tokens och de bästa allround lokala kodningssiffrorna vi kan verifiera. På 16GB är det gpt-oss-20b, OpenAIs Apache-2.0 Mixture-of-Experts-modell som får plats helt på GPU:n vid ~14GB och mäter cirka 140 tokens/sek. På 8GB är det Qwen2.5-Coder-7B, den pålitliga arbetshästen på ~4,7GB. Resten av den här sidan är resonemanget, de uppmätta siffrorna och de specifika situationer där vart och ett av dessa val är fel.
Vad sida ett får rätt — och vad den hoppar över
Rankingen för "bästa lokala llm för kodning" just nu är en blandning av en genuint användbar artikel och en hel del domänstyrka. Tembos guide (5 juni 2026) har rätt form — den organiserar efter 8GB / 12–16GB / 24GB-nivåer och landar i Qwen Coder-familjen — men den publicerar inga benchmarksiffror för de lokala modellerna, inga tokens-per-sekund-siffror, inga kontextfönsterstorlekar och inga Apple Silicon-val baserat på RAM. Ett GitHub-utvärderingsverktyg (gauravvij/local-llm-coding-eval) har riktiga siffror men ingen dom och kördes bara på CPU. Resten är åsiktsinlägg av enskilda författare (XDA, Yahoo Tech) och tunna listiklar (apidog, Security Boulevard, SitePoint) som rankar efter domänstyrka, inte efter användbarhet.
Det som de alla hoppar över, i ordning efter hur mycket det kostar dig:
• Agentgapet. Kodgenerering är inte samma färdighet som att styra en agent genom en flerfilig ändring. Första sidan nämner det knappt; det är skillnaden mellan en modell du behåller och en modell du avinstallerar.
• Kontextfönster. Agentisk kodning bränner tokens på att ladda filer och testutdata. Ett påstående om att "30B får plats i 24GB" är meningslöst tills du frågar vid vilken kontext det gäller.
• Kvantiseringsmatematik. Ingen förklarar att 4-bit kräver ungefär parametrarna i gigabyte, eller att Q3 köper VRAM till priset av subtila syntaxfel.
• Uppmätt hastighet. Få publikationer anger tokens/sekund för de modeller de rekommenderar, och de som gör det skiljer sig kraftigt åt eftersom kontext och kvantisering förändrar allt.
• När lokalt är fel val. Ett fälttest från 2026 på en Flutter-app med 15 000 rader (EPAM) visar fortfarande att molnbaserade frontlinjemodeller vinner de svåraste flerstegsrefaktoreringarna. Ingen av listartiklarna berättar när du ska sluta.
VRAM-matten som de flesta listiklar hoppar över
Tumregeln som gör alla andra siffror i den här artikeln begripliga: vid 4-bitars kvantisering behöver en modell ungefär sitt parameterantal i gigabyte — 7B ≈ 5GB, 30B ≈ 18GB+, före KV-cache-omkostnader. Q4 är den bästa punkten för kodning; Q3 och lägre sparar VRAM men introducerar mätbart subtila syntaxfel. Och KV-cachen växer med din kontextlängd, vilket är anledningen till att "en 30B ryms i 24GB" bara är sant vid en kontext man faktiskt måste specificera.
Mixture-of-Experts förändrar matematiken på ett sätt som spelar roll för de två stora valen nedan. Totala parametrar bestämmer fotavtrycket; aktiva parametrar bestämmer hastigheten. Det är därför Qwen3-Coder-30B-A3B (30B totalt, 3,3B aktiva) och gpt-oss-20b (20,9B totalt, 3,61B aktiva) båda känns mycket snabbare än vad deras vikt på disk antyder, och varför DeepSeek V4 Flash — 284B totalt, 13B aktiva — är ett dåligt lokalt val även om dess API är billigt.

24GB VRAM: Qwen3-Coder 30B
Qwen3-Coder-30B-A3B-Instruct är den starkaste allsidiga lokala kodaren vi kan peka på just nu. Släppt i juli 2025 av Alibabas Qwen-team under Apache 2.0, är det en Mixture-of-Experts-modell med 30B totala parametrar och 3,3B aktiva per token, ett kontextfönster på 262 144 token och ett 4-bitars fotavtryck på cirka 17–20 GB — vilket lämnar rejält utrymme på ett 24 GB-kort för den KV-cache som en lång kodningssession behöver.
På den oberoende lokala testmiljö vi litar mest på (gauravvij/local-llm-coding-eval, fyra modeller körda lokalt via Ollama på CPU) fick qwen3-coder:30b 80 % i kodgenerering, 77 % i verktygsval och 80 % i agentträffsäkerhet — det mest balanserade resultatet av de fyra, och den enda modellen som var stark på alla tre uppgifterna samtidigt. Tredjepartsspårningar sammanställer dess SWE-bench Verified till cirka 50,3, Aider Polyglot till 66,2 och LiveCodeBench v6 till 58,9; betrakta dessa som sammanställda siffror, inte Alibabas officiella siffror, vilket är allt Qwen har publicerat för denna modell.
Uppmätt hastighet varierar kraftigt med hårdvaran. De mest användbara datapunkterna: en community-TurboQuant-uppsättning kör den på ett 8GB RTX 3060 Ti med ~29 tokens/sek generation med full 262K-kontext, och oMLX-riktmärket mätte 4-bitars MLX-bygget på en M4 Pro (48GB) till 73,6 tokens/sek vid 1K-kontext, som sjunker till 13,5 tokens/sek vid 64K. På ett 24GB-kort i en vanlig Ollama-uppsättning bör du förvänta dig tiotals tokens per sekund, inte hundratals — priset för att köra en frontier-nära kodare hemma.
Den ärliga varningen: det är inte den snabbaste lokala kodaren, och en nyare Qwen3-Coder-Next finns som riktar sig mot hostat och CLI-bruk snarare än kvantiserade lokala installationer. Men för agentbaserat arbete i reposkala på ett enda kort är Qwen3-Coder-30B valet idag.
16GB VRAM: gpt-oss-20b
På ett 16GB-kort är svaret gpt-oss-20b — och det är inte ens nära. Den släpptes den 5 augusti 2025 av OpenAI under Apache 2.0 och är en Mixture-of-Experts-modell med 20,9 miljarder parametrar totalt och 3,61 miljarder aktiva per token, ett kontextfönster på 131 072 tokens, och dess inbyggda MXFP4-kvantisering ligger på cirka 14GB. Det är den avgörande faktorn: den körs 100 % på GPU:n i ett 16GB-kort, utan att något spills över till systemets RAM.
Varför GPU-residens betyder mer än något benchmark: en modell som får plats i VRAM är 3–11x snabbare än en som lastar av. Ett oberoende benchmark uppmätte 139,93 tokens/sek för gpt-oss-20b på en RTX 4080 — ungefär 2,8x ett tätt alternativ med samma fotavtryck — och en testare gav den 2026 ett "intelligensindex" på 52,1 och kallade den oöverträffad i 16GB-klassen för professionell kodning och felsökning. Den får precis plats, så kör den ensam och håll kontexten måttlig; kvaliteten försämras vid fönstrets övre gräns.
Det agentiska alternativet på 16GB är Devstral 24B (devstral-small-2:24b), som redovisar det enda publicerade SWE-bench Verified-resultatet bland 16GB-klassens lokala kodare — 46,8% — men den är långsam, kräver ofta CPU-avlastning vid ~18 tokens/sek. Om ditt arbete består av agentiska redigeringar i flera filer och du kan acceptera hastigheten, förtjänar Devstral sin plats; om du vill ha hastighet plus ren kod är gpt-oss-20b det bättre standardvalet. Dense 14B-modeller — Qwen3-Coder 14B eller Qwen2.5-Coder 14B vid Q5 — är de bekväma, billiga fallbacks.
8GB VRAM: Qwen 2.5 Coder 7B
På 8GB är det ärliga svaret Qwen2.5-Coder-7B: 7B parametrar vid ~4,7 GB i Q4_K_M, ett nativt kontext på 32 768 token som kan utökas mot 128K, och de starkaste benchmark-poängen för kodkomplettering i 7B-klassen. Det är en äldre modell — släppt november 2024 — och det är okej, för inget nyare i 8GB-utrymmet har störtat den. Community-tester placerar den runt 50 token/sekund på en RTX 4060 eller 3070; ett oberoende RTX 4060-test i mars 2026 uppmätte 28–35 token/sekund, en spridning som nästan helt drivs av kontextinställningar.
Tre saker spelar roll på 8 GB som inte gör det någon annanstans. För det första, begränsa kontexten till 4–8K: KV-cachen är det som orsakar OOM på ett 8 GB-kort, inte vikterna — ett benchmark visade att hastigheten hoppade från ~3,6 till ~37 tokens/sek enbart genom att begränsa kontexten. För det andra, verifiera med ollama ps att modellen är 100 % på GPU:n; om någon del körs på CPU:n så kollapsar hastigheten. För det tredje, Q4_K_M, inte Q3 — Q3:s syntaxfel kostar dig mer än vad VRAM sparar.
Den anmärkningsvärda utvecklingen under 2026 är att Qwen3-Coder-30B-A3B-Instruct nu kan pressas in på 8 GB via TurboQuant KV-cache-komprimering — en community-installation uppmätte ~7,5 GB och ~29 tokens/sekund på ett RTX 3060 Ti med full 256K-kontext. Det fungerar, men det är tillräckligt krångligt för att vi inte rekommenderar det som standard. Om du vill ha ett nyare alternativ som fungerar direkt är Qwen3 8B (~5,2 GB, hybridtänkandeläge) ett litet steg upp från Qwen2.5-Coder-7B när det gäller allmänt resonemang, samtidigt som det ligger något efter på ren kod.

Hur är det med Apple Silicon?
Unified memory förändrar ekvationen i en riktning: kapaciteten ökar, genereringshastigheten sjunker. En 48 GB M4 Pro kan rymma modeller som ett 16 GB Windows-kort inte kan, men den genererar tokens betydligt långsammare vid lång kontext. Siffrorna vi har: 4-bitars MLX-bygget av Qwen3-Coder-30B-A3B-Instruct använde 16,6 GB vid 1K kontext och 25,5 GB vid 64K på en M4 Pro, med en genereringshastighet som sjönk från 73,6 till 13,5 tokens/sek allteftersom kontexten växte (oMLX benchmark). gpt-oss-20b ryms bekvämt i 16 GB unified memory och är ett utmärkt Mac-val. Om du vill ha multimodalt på Apple Silicon, Gemma 4 12B körs i ungefär 16 GB unified memory med 256K kontext — det starkaste lokala alternativet om ditt kodningsarbete sker vid sidan av bildtunga dokument.
De oberoende siffrorna: codegen är inte den färdighet som spelar roll
De tydligaste data vi hittade är ett enda lokalt benchmark värt att citera i sin helhet. gauravvij/local-llm-coding-eval körde fyra modeller lokalt via Ollama, på CPU, utan moln – kodgenerering, funktionsanrop och en flerstegs agentuppgift – med resultat som talar emot instinkten att ”större codegen-siffra vinner”.
• Qwen3.6 27B (qwen3.6:27b, dense, ~17GB): 80.0% codegen, 84.6% tools, 100% agent — den bästa allroundaren.
• Qwen3.6 35B A3B (qwen3.6:35b-a3b, MoE, ~18GB): 70.0% kodgenerering, 84.6% verktyg, 100% agent.
• Qwen3-Coder-30B-A3B-Instruct (qwen3-coder:30b, MoE, ~17 GB): 80,0 % kodgenerering, 76,9 % verktyg, 80 % agent — mest balanserad.
• DeepSeek-Coder-V2 33B (deepseek-coder:33b, dense, ~18GB): 90.0% kodgenerering — bäst av de fyra — men 10% agent, sist på flerstegsarbete.
Den sista raden är hela läxan. En modell som toppar ren kodgenerering men kollapsar på agentuppgifter är modellen du kommer att avinstallera efter den första "läs den här filen, ändra den här funktionen, kör testet"-loopen. Bedöm en lokal kodare efter agentkolumnen, inte kodgenereringskolumnen.

När det är fel val att köra lokalt
Local-first är rätt standardval för integritet, offlinearbete, noll marginalkostnad för tokens och autokomplettering där latens är viktigare än maximal kvalitet. Det är fel val i specifika, igenkännbara situationer – och det här är avsnittet som man hoppar över på första sidan:
• Det svåraste agentiska arbetet besegrar dig fortfarande. EPAM:s fälttest 2026 på en Flutter-app med 15 000 rader visade att molnbaserade frontlinjemodeller (GPT-5.3-codex) fortfarande överträffar lokala modeller vid den mest komplexa flerstegsrefaktoreringen. Om din dag består av åtta timmars refaktorering av äldre kod, är lokala modeller inte redo.
• Dina kontextbehov överstiger ditt kort. En kodningsagent som laddar in ett helt repo spränger förbi KV-cachen som ett 16GB-kort kan hålla. Qwen3-Coder-30B:s 256K-kontext är anledningen till att den vinner i 24GB-klassen — mindre kort förlorar det här spelet tidigt.
• Du kan inte passa hårdvara. Hårdvaran är riktiga pengar: ett 24GB-kort är i klassen $700–1,600, plus el och underhåll. Vid låg volym är det billigare att anropa ett API än strömförbrukningen.
• DeepSeek V4 Flash är beviset. Med totalt 284B parametrar är DeepSeek V4 Flash:s 4-bitarsvikter ensamma ungefär 140GB — inte en konsumentkortsmodell, punkt slut. Dess 13B-aktiva design är exakt anledningen till att dess API är snabbt och billigt till $0.15 / $0.29 per 1M tokens (MIT, 1M kontext). För den modellen är ”kör den lokalt” fel fråga; API:et är poängen.
• Team behöver enhetlighet. Om fyra ingenjörer var och en kör en annan kvantisering av en annan modell, blir "works on my machine" en byggrisk. Delade API-slutpunkter ger dig ett deterministiskt mål.
Om du vill ha API-sidan av svaret på samma fråga — vilken molnbaserad kodningsmodell som är standard när lokalt inte är rätt val — behandlade vi det separat i vår guide om bästa LLM för kodning, och vår artikel om AI-kodningsagenter täcker verktyg som Cline och OpenCode som fungerar med dessa lokala modeller.
Hur du testar kortet innan du köper
Det billigaste sättet att avgöra är att köra dina egna prompts innan du bestämmer dig för hårdvara. Ollama eller LM Studio får igång vilket som helst av de tre alternativen på några minuter, och det test som räknas är repots verkliga filer, inte ett benchmark. En router förtjänar sin plats i det angränsande beslutet: när du jämför en lokal kandidat med värdbaserade frontier-modeller, låter en enda endpoint dig köra samma prompt genom båda utan att behöva hantera flera nycklar. På OrcaRouter serveras DeepSeek V4 Flash till leverantörens listpris, som förs vidare oförändrat — $0.15 / $0.29 per 1M tokens, 0% påslag — med automatisk failover, vilket gör det till en billig och ärlig måttstock för "är min lokala modell faktiskt bättre än $0.15-API:t?"
En ärlig invändning: OrcaRouter är inte värd för Qwen3-Coder-30B-A3B-Instruct eller gpt-oss-20b. Om ditt mål är strikt offline är en router irrelevant för dig — självhosta så är du klar. Om ditt mål är att A/B-testa samma öppna viktmodell mot frontlinjen innan du spenderar på ett kort, är routerns jobb jämförelsen, inte värdskapet.
Slutsatsen
Ditt VRAM avgör först, modellkvalitet sedan. På 24GB kör du Qwen3-Coder-30B-A3B-Instruct — den starkaste allround-lokala kodaren, med 256K-kontext som agentiskt arbete kräver. På 16GB kör du gpt-oss-20b — den ovanliga modellen som är både snabb och helt på GPU. På 8GB kör du Qwen2.5-Coder-7B och håll kontexten blygsam. Bedöm dem utifrån agentik-kolumnen, inte kodgenereringskolumnen, och acceptera att den svåraste multi-fil-omstruktureringen fortfarande tillhör molnet. Siffrorna ovan är aktuella per den 10 augusti 2026 — verifiera om line-upen och listpriserna innan du lägger pengar, eftersom det här området rör sig varje vecka.
