Titelkort med texten 'Den bästa lokala LLM:en för kodning i augusti 2026' med undertiteln 'Efter VRAM: Qwen3-Coder 30B med 24GB · gpt-oss-20b med 16GB · Qwen 2.5 Coder 7B med 8GB', och tre rutor märkta '24GB Qwen3-Coder 30B A3B starkaste allround lokala kodaren 256K kontext', '16GB gpt-oss-20b ~140 tok/s helt på GPU:n, Apache 2.0', '8GB Qwen 2.5 Coder 7B den pålitliga arbetshästen ~4.7GB vid Q4', på en vit bakgrund med blå och cyan gradientaccenter och OrcaRouter-logotypen kompositerad längst ner till höger.
Guides & Insights

De bästa lokala LLM:erna för kodning i augusti 2026, sorterade efter VRAM: Qwen3-Coder 30B, gpt-oss-20b, Qwen 2.5 Coder 7B

Författare

Jim Song

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den bästa lokala LLM:en för kodning i augusti 2026 avgörs först och främst av ditt VRAM. Om du har ett 24GB-kort — ett RTX 3090 eller 4090 — kör Qwen3-Coder-30B-A3B-Instruct: 30B totala parametrar med endast 3,3B aktiva per token, ett kontextfönster på 262 144 tokens och de bästa allround lokala kodningssiffrorna vi kan verifiera. På 16GB är det gpt-oss-20b, OpenAIs Apache-2.0 Mixture-of-Experts-modell som får plats helt på GPU:n vid ~14GB och mäter cirka 140 tokens/sek. På 8GB är det Qwen2.5-Coder-7B, den pålitliga arbetshästen på ~4,7GB. Resten av den här sidan är resonemanget, de uppmätta siffrorna och de specifika situationer där vart och ett av dessa val är fel.

Vad sida ett får rätt — och vad den hoppar över

Rankingen för "bästa lokala llm för kodning" just nu är en blandning av en genuint användbar artikel och en hel del domänstyrka. Tembos guide (5 juni 2026) har rätt form — den organiserar efter 8GB / 12–16GB / 24GB-nivåer och landar i Qwen Coder-familjen — men den publicerar inga benchmarksiffror för de lokala modellerna, inga tokens-per-sekund-siffror, inga kontextfönsterstorlekar och inga Apple Silicon-val baserat på RAM. Ett GitHub-utvärderingsverktyg (gauravvij/local-llm-coding-eval) har riktiga siffror men ingen dom och kördes bara på CPU. Resten är åsiktsinlägg av enskilda författare (XDA, Yahoo Tech) och tunna listiklar (apidog, Security Boulevard, SitePoint) som rankar efter domänstyrka, inte efter användbarhet.

Det som de alla hoppar över, i ordning efter hur mycket det kostar dig:

Agentgapet. Kodgenerering är inte samma färdighet som att styra en agent genom en flerfilig ändring. Första sidan nämner det knappt; det är skillnaden mellan en modell du behåller och en modell du avinstallerar.

Kontextfönster. Agentisk kodning bränner tokens på att ladda filer och testutdata. Ett påstående om att "30B får plats i 24GB" är meningslöst tills du frågar vid vilken kontext det gäller.

Kvantiseringsmatematik. Ingen förklarar att 4-bit kräver ungefär parametrarna i gigabyte, eller att Q3 köper VRAM till priset av subtila syntaxfel.

Uppmätt hastighet. Få publikationer anger tokens/sekund för de modeller de rekommenderar, och de som gör det skiljer sig kraftigt åt eftersom kontext och kvantisering förändrar allt.

När lokalt är fel val. Ett fälttest från 2026 på en Flutter-app med 15 000 rader (EPAM) visar fortfarande att molnbaserade frontlinjemodeller vinner de svåraste flerstegsrefaktoreringarna. Ingen av listartiklarna berättar när du ska sluta.

VRAM-matten som de flesta listiklar hoppar över

Tumregeln som gör alla andra siffror i den här artikeln begripliga: vid 4-bitars kvantisering behöver en modell ungefär sitt parameterantal i gigabyte — 7B ≈ 5GB, 30B ≈ 18GB+, före KV-cache-omkostnader. Q4 är den bästa punkten för kodning; Q3 och lägre sparar VRAM men introducerar mätbart subtila syntaxfel. Och KV-cachen växer med din kontextlängd, vilket är anledningen till att "en 30B ryms i 24GB" bara är sant vid en kontext man faktiskt måste specificera.

Mixture-of-Experts förändrar matematiken på ett sätt som spelar roll för de två stora valen nedan. Totala parametrar bestämmer fotavtrycket; aktiva parametrar bestämmer hastigheten. Det är därför Qwen3-Coder-30B-A3B (30B totalt, 3,3B aktiva) och gpt-oss-20b (20,9B totalt, 3,61B aktiva) båda känns mycket snabbare än vad deras vikt på disk antyder, och varför DeepSeek V4 Flash — 284B totalt, 13B aktiva — är ett dåligt lokalt val även om dess API är billigt.

Card titled 'The VRAM math most listicles skip' with a rule box reading 'At 4-bit, a model needs roughly its parameter count in gigabytes, plus KV cache for your context window'. Three columns: 'Qwen3-Coder 30B' FP16 ~61GB, Q8 ~30GB, Q4 ~17-20GB, KV cache at 256K several GB extra; 'gpt-oss-20b' FP16 ~40GB, Q8 ~21GB, MXFP4 ~14GB, KV cache at 128K fits 16GB only at modest context; 'Qwen 2.5 Coder 7B' FP16 ~14GB, Q8 ~7GB, Q4 ~4.7GB, KV cache at 32K fits 8GB with headroom. A warning bar reads 'Q3 and below save VRAM but measurably introduce subtle syntax errors in code — Q4 is the coding sweet spot. MoE changes the math: total parameters set the footprint, active parameters set the speed.' with the OrcaRouter logo composited bottom-right.

24GB VRAM: Qwen3-Coder 30B

Qwen3-Coder-30B-A3B-Instruct är den starkaste allsidiga lokala kodaren vi kan peka på just nu. Släppt i juli 2025 av Alibabas Qwen-team under Apache 2.0, är det en Mixture-of-Experts-modell med 30B totala parametrar och 3,3B aktiva per token, ett kontextfönster på 262 144 token och ett 4-bitars fotavtryck på cirka 17–20 GB — vilket lämnar rejält utrymme på ett 24 GB-kort för den KV-cache som en lång kodningssession behöver.

På den oberoende lokala testmiljö vi litar mest på (gauravvij/local-llm-coding-eval, fyra modeller körda lokalt via Ollama på CPU) fick qwen3-coder:30b 80 % i kodgenerering, 77 % i verktygsval och 80 % i agentträffsäkerhet — det mest balanserade resultatet av de fyra, och den enda modellen som var stark på alla tre uppgifterna samtidigt. Tredjepartsspårningar sammanställer dess SWE-bench Verified till cirka 50,3, Aider Polyglot till 66,2 och LiveCodeBench v6 till 58,9; betrakta dessa som sammanställda siffror, inte Alibabas officiella siffror, vilket är allt Qwen har publicerat för denna modell.

Uppmätt hastighet varierar kraftigt med hårdvaran. De mest användbara datapunkterna: en community-TurboQuant-uppsättning kör den på ett 8GB RTX 3060 Ti med ~29 tokens/sek generation med full 262K-kontext, och oMLX-riktmärket mätte 4-bitars MLX-bygget på en M4 Pro (48GB) till 73,6 tokens/sek vid 1K-kontext, som sjunker till 13,5 tokens/sek vid 64K. På ett 24GB-kort i en vanlig Ollama-uppsättning bör du förvänta dig tiotals tokens per sekund, inte hundratals — priset för att köra en frontier-nära kodare hemma.

Den ärliga varningen: det är inte den snabbaste lokala kodaren, och en nyare Qwen3-Coder-Next finns som riktar sig mot hostat och CLI-bruk snarare än kvantiserade lokala installationer. Men för agentbaserat arbete i reposkala på ett enda kort är Qwen3-Coder-30B valet idag.

16GB VRAM: gpt-oss-20b

På ett 16GB-kort är svaret gpt-oss-20b — och det är inte ens nära. Den släpptes den 5 augusti 2025 av O​penAI under Apache 2.0 och är en Mixture-of-Experts-modell med 20,9 miljarder parametrar totalt och 3,61 miljarder aktiva per token, ett kontextfönster på 131 072 tokens, och dess inbyggda MXFP4-kvantisering ligger på cirka 14GB. Det är den avgörande faktorn: den körs 100 % på GPU:n i ett 16GB-kort, utan att något spills över till systemets RAM.

Varför GPU-residens betyder mer än något benchmark: en modell som får plats i VRAM är 3–11x snabbare än en som lastar av. Ett oberoende benchmark uppmätte 139,93 tokens/sek för gpt-oss-20b på en RTX 4080 — ungefär 2,8x ett tätt alternativ med samma fotavtryck — och en testare gav den 2026 ett "intelligensindex" på 52,1 och kallade den oöverträffad i 16GB-klassen för professionell kodning och felsökning. Den får precis plats, så kör den ensam och håll kontexten måttlig; kvaliteten försämras vid fönstrets övre gräns.

Det agentiska alternativet på 16GB är Devstral 24B (devstral-small-2:24b), som redovisar det enda publicerade SWE-bench Verified-resultatet bland 16GB-klassens lokala kodare — 46,8% — men den är långsam, kräver ofta CPU-avlastning vid ~18 tokens/sek. Om ditt arbete består av agentiska redigeringar i flera filer och du kan acceptera hastigheten, förtjänar Devstral sin plats; om du vill ha hastighet plus ren kod är gpt-oss-20b det bättre standardvalet. Dense 14B-modeller — Qwen3-Coder 14B eller Qwen2.5-Coder 14B vid Q5 — är de bekväma, billiga fallbacks.

8GB VRAM: Qwen 2.5 Coder 7B

På 8GB är det ärliga svaret Qwen2.5-Coder-7B: 7B parametrar vid ~4,7 GB i Q4_K_M, ett nativt kontext på 32 768 token som kan utökas mot 128K, och de starkaste benchmark-poängen för kodkomplettering i 7B-klassen. Det är en äldre modell — släppt november 2024 — och det är okej, för inget nyare i 8GB-utrymmet har störtat den. Community-tester placerar den runt 50 token/sekund på en RTX 4060 eller 3070; ett oberoende RTX 4060-test i mars 2026 uppmätte 28–35 token/sekund, en spridning som nästan helt drivs av kontextinställningar.

Tre saker spelar roll på 8 GB som inte gör det någon annanstans. För det första, begränsa kontexten till 4–8K: KV-cachen är det som orsakar OOM på ett 8 GB-kort, inte vikterna — ett benchmark visade att hastigheten hoppade från ~3,6 till ~37 tokens/sek enbart genom att begränsa kontexten. För det andra, verifiera med ollama ps att modellen är 100 % på GPU:n; om någon del körs på CPU:n så kollapsar hastigheten. För det tredje, Q4_K_M, inte Q3 — Q3:s syntaxfel kostar dig mer än vad VRAM sparar.

Den anmärkningsvärda utvecklingen under 2026 är att Qwen3-Coder-30B-A3B-Instruct nu kan pressas in på 8 GB via TurboQuant KV-cache-komprimering — en community-installation uppmätte ~7,5 GB och ~29 tokens/sekund på ett RTX 3060 Ti med full 256K-kontext. Det fungerar, men det är tillräckligt krångligt för att vi inte rekommenderar det som standard. Om du vill ha ett nyare alternativ som fungerar direkt är Qwen3 8B (~5,2 GB, hybridtänkandeläge) ett litet steg upp från Qwen2.5-Coder-7B när det gäller allmänt resonemang, samtidigt som det ligger något efter på ren kod.

Scoreboard card titled 'Three picks, three VRAM tiers' with three columns. Left '24GB · Qwen3-Coder 30B': VRAM at 4-bit ~19GB Q4_K_M, Context 262,144 tokens, Speed measured ~29 t/s tight 8GB run; 50-90 t/s on 24GB, Released Jul 2025, License Apache 2.0, Best for agentic repo-scale work. Middle '16GB · gpt-oss-20b': VRAM ~14GB MXFP4, Context 131,072 tokens, Speed ~140 t/s RTX 4080, Released Aug 5 2025, License Apache 2.0, Best for speed plus clean code. Right '8GB · Qwen 2.5 Coder 7B': VRAM ~4.7GB Q4_K_M, Context 32,768 native (128K via YaRN), Speed ~50 t/s RTX 4060/3070, Released Nov 2024, License Apache 2.0, Best for autocomplete, offline, privacy. Footer reads 'Speeds are third-party measurements; all figures read Aug 10 2026.' with the OrcaRouter logo composited bottom-right.

Hur är det med Apple Silicon?

Unified memory förändrar ekvationen i en riktning: kapaciteten ökar, genereringshastigheten sjunker. En 48 GB M4 Pro kan rymma modeller som ett 16 GB Windows-kort inte kan, men den genererar tokens betydligt långsammare vid lång kontext. Siffrorna vi har: 4-bitars MLX-bygget av Qwen3-Coder-30B-A3B-Instruct använde 16,6 GB vid 1K kontext och 25,5 GB vid 64K på en M4 Pro, med en genereringshastighet som sjönk från 73,6 till 13,5 tokens/sek allteftersom kontexten växte (oMLX benchmark). gpt-oss-20b ryms bekvämt i 16 GB unified memory och är ett utmärkt Mac-val. Om du vill ha multimodalt på Apple Silicon, Gemma 4 12B körs i ungefär 16 GB unified memory med 256K kontext — det starkaste lokala alternativet om ditt kodningsarbete sker vid sidan av bildtunga dokument.

De oberoende siffrorna: codegen är inte den färdighet som spelar roll

De tydligaste data vi hittade är ett enda lokalt benchmark värt att citera i sin helhet. gauravvij/local-llm-coding-eval körde fyra modeller lokalt via Ollama, på CPU, utan moln – kodgenerering, funktionsanrop och en flerstegs agentuppgift – med resultat som talar emot instinkten att ”större codegen-siffra vinner”.

Qwen3.6 27B (qwen3.6:27b, dense, ~17GB): 80.0% codegen, 84.6% tools, 100% agent — den bästa allroundaren.

Qwen3.6 35B A3B (qwen3.6:35b-a3b, MoE, ~18GB): 70.0% kodgenerering, 84.6% verktyg, 100% agent.

Qwen3-Coder-30B-A3B-Instruct (qwen3-coder:30b, MoE, ~17 GB): 80,0 % kodgenerering, 76,9 % verktyg, 80 % agent — mest balanserad.

DeepSeek-Coder-V2 33B (deepseek-coder:33b, dense, ~18GB): 90.0% kodgenerering — bäst av de fyra — men 10% agent, sist på flerstegsarbete.

Den sista raden är hela läxan. En modell som toppar ren kodgenerering men kollapsar på agentuppgifter är modellen du kommer att avinstallera efter den första "läs den här filen, ändra den här funktionen, kör testet"-loopen. Bedöm en lokal kodare efter agentkolumnen, inte kodgenereringskolumnen.

Benchmark card titled 'The independent local benchmark — agentic skill is the real gap' with four columns. 'qwen3.6:27b dense ~17GB': Codegen 80.0%, Tools 84.6%, Agent 100%. 'qwen3.6:35b-a3b MoE ~18GB': Codegen 70.0%, Tools 84.6%, Agent 100%. 'qwen3-coder:30b MoE ~17GB': Codegen 80.0%, Tools 76.9%, Agent 80%. 'deepseek-coder:33b dense ~18GB': Codegen 90.0%, Tools 84.6%, Agent 10%. Footer reads 'deepseek-coder:33b tops codegen yet collapses on agent tasks — codegen alone overrates a local coder. All four ran locally via Ollama, CPU-only, no cloud (gauravvij/local-llm-coding-eval, GitHub). On a 15k-LOC refactor, cloud frontier still wins (EPAM field test, 2026).' with the OrcaRouter logo composited bottom-right.

När det är fel val att köra lokalt

Local-first är rätt standardval för integritet, offlinearbete, noll marginalkostnad för tokens och autokomplettering där latens är viktigare än maximal kvalitet. Det är fel val i specifika, igenkännbara situationer – och det här är avsnittet som man hoppar över på första sidan:

Det svåraste agentiska arbetet besegrar dig fortfarande. EPAM:s fälttest 2026 på en Flutter-app med 15 000 rader visade att molnbaserade frontlinjemodeller (GPT-5.3-codex) fortfarande överträffar lokala modeller vid den mest komplexa flerstegsrefaktoreringen. Om din dag består av åtta timmars refaktorering av äldre kod, är lokala modeller inte redo.

Dina kontextbehov överstiger ditt kort. En kodningsagent som laddar in ett helt repo spränger förbi KV-cachen som ett 16GB-kort kan hålla. Qwen3-Coder-30B:s 256K-kontext är anledningen till att den vinner i 24GB-klassen — mindre kort förlorar det här spelet tidigt.

Du kan inte passa hårdvara. Hårdvaran är riktiga pengar: ett 24GB-kort är i klassen $700–1,600, plus el och underhåll. Vid låg volym är det billigare att anropa ett API än strömförbrukningen.

DeepSeek V4 Flash är beviset. Med totalt 284B parametrar är DeepSeek V4 Flash:s 4-bitarsvikter ensamma ungefär 140GB — inte en konsumentkortsmodell, punkt slut. Dess 13B-aktiva design är exakt anledningen till att dess API är snabbt och billigt till $0.15 / $0.29 per 1M tokens (MIT, 1M kontext). För den modellen är ”kör den lokalt” fel fråga; API:et är poängen.

Team behöver enhetlighet. Om fyra ingenjörer var och en kör en annan kvantisering av en annan modell, blir "works on my machine" en byggrisk. Delade API-slutpunkter ger dig ett deterministiskt mål.

Om du vill ha API-sidan av svaret på samma fråga — vilken molnbaserad kodningsmodell som är standard när lokalt inte är rätt val — behandlade vi det separat i vår guide om bästa LLM för kodning, och vår artikel om AI-kodningsagenter täcker verktyg som Cline och OpenCode som fungerar med dessa lokala modeller.

Hur du testar kortet innan du köper

Det billigaste sättet att avgöra är att köra dina egna prompts innan du bestämmer dig för hårdvara. Ollama eller LM Studio får igång vilket som helst av de tre alternativen på några minuter, och det test som räknas är repots verkliga filer, inte ett benchmark. En router förtjänar sin plats i det angränsande beslutet: när du jämför en lokal kandidat med värdbaserade frontier-modeller, låter en enda endpoint dig köra samma prompt genom båda utan att behöva hantera flera nycklar. På OrcaRouter serveras DeepSeek V4 Flash till leverantörens listpris, som förs vidare oförändrat — $0.15 / $0.29 per 1M tokens, 0% påslag — med automatisk failover, vilket gör det till en billig och ärlig måttstock för "är min lokala modell faktiskt bättre än $0.15-API:t?"

En ärlig invändning: OrcaRouter är inte värd för Qwen3-Coder-30B-A3B-Instruct eller gpt-oss-20b. Om ditt mål är strikt offline är en router irrelevant för dig — självhosta så är du klar. Om ditt mål är att A/B-testa samma öppna viktmodell mot frontlinjen innan du spenderar på ett kort, är routerns jobb jämförelsen, inte värdskapet.

Slutsatsen

Ditt VRAM avgör först, modellkvalitet sedan. På 24GB kör du Qwen3-Coder-30B-A3B-Instruct — den starkaste allround-lokala kodaren, med 256K-kontext som agentiskt arbete kräver. På 16GB kör du gpt-oss-20b — den ovanliga modellen som är både snabb och helt på GPU. På 8GB kör du Qwen2.5-Coder-7B och håll kontexten blygsam. Bedöm dem utifrån agentik-kolumnen, inte kodgenereringskolumnen, och acceptera att den svåraste multi-fil-omstruktureringen fortfarande tillhör molnet. Siffrorna ovan är aktuella per den 10 augusti 2026 — verifiera om line-upen och listpriserna innan du lägger pengar, eftersom det här området rör sig varje vecka.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube