
Le meilleur LLM local pour le codage en août 2026, par VRAM : Qwen3-Coder 30B, gpt-oss-20b, Qwen 2.5 Coder 7B
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxNOUVEAUMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 2214 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
Le meilleur LLM local pour le codage en août 2026 se décide avant tout par votre VRAM. Si vous avez une carte de 24 Go — une RTX 3090 ou 4090 — lancez Qwen3-Coder-30B-A3B-Instruct : 30B de paramètres au total avec seulement 3,3B actifs par jeton, une fenêtre de contexte de 262 144 jetons, et les meilleurs chiffres de codage local polyvalent que nous puissions vérifier. Sur 16 Go, c’est gpt-oss-20b, le modèle Mixture-of-Experts d’OpenAI sous licence Apache-2.0 qui tient entièrement sur GPU à ~14 Go et atteint environ 140 jetons/seconde. Sur 8 Go, c’est Qwen2.5-Coder-7B, le cheval de bataille fiable à ~4,7 Go. Le reste de cette page présente le raisonnement, les chiffres mesurés, et les situations précises où chacun de ces choix est inadapté.
Ce que la première page fait bien — et ce qu'elle omet
En ce moment, le classement pour « meilleur LLM local pour le codage » est un mélange d'un article réellement utile et de beaucoup d'autorité de domaine. Le guide de Tembo (5 juin 2026) a la bonne structure — il organise les modèles par tranches de 8 Go / 12–16 Go / 24 Go et retient la famille Qwen Coder — mais il ne publie aucun score de benchmark pour les modèles locaux, aucun chiffre de tokens par seconde, aucune taille de fenêtre de contexte, et aucune recommandation Apple Silicon en fonction de la RAM. Un harnais d'évaluation GitHub (gauravvij/local-llm-coding-eval) fournit de vrais chiffres mais aucun verdict, et n'a tourné que sur CPU. Le reste est composé d'articles d'opinion à auteur unique (XDA, Yahoo Tech) et de listicles superficiels (apidog, Security Boulevard, SitePoint) qui se classent grâce à l'autorité de domaine, et non parce qu'ils sont utiles.
Ce qu'ils sautent tous, par ordre de ce que cela vous coûte :
• Le fossé agentique. La génération de code n'est pas la même compétence que piloter un agent à travers une modification multi-fichiers. La première page le mentionne à peine ; c'est la différence entre un modèle que l'on garde et un modèle que l'on désinstalle.
• Fenêtres de contexte. Le codage agentique brûle des tokens en chargeant des fichiers et des sorties de tests. Une affirmation comme « 30B tient dans 24 Go » n'a aucun sens tant qu'on ne précise pas à quel contexte elle correspond.
• Mathématiques de la quantification.Personne n'explique que le 4-bit nécessite à peu près le nombre de paramètres en gigaoctets, ou que Q3 gagne de la VRAM au prix de subtiles erreurs de syntaxe.
• Vitesse mesurée. Peu d'articles affichent des tokens/sec pour les modèles qu'ils recommandent, et ceux qui le font divergent énormément, car le contexte et la quantification changent tout.
• Quand le local est le mauvais choix. Un test de terrain de 2026 sur une application Flutter de 15 000 lignes (EPAM) montre encore que les modèles frontière cloud l'emportent pour les refactorisations multi-étapes les plus difficiles. Aucun listicle ne vous dit quand vous arrêter.
Le calcul de la VRAM que la plupart des listicles négligent
La règle empirique qui rend tous les autres chiffres de cet article lisibles : en quantification 4 bits, un modèle nécessite approximativement son nombre de paramètres en gigaoctets — 7B ≈ 5 Go, 30B ≈ 18 Go+, avant le surcoût du cache KV. Q4 est le juste milieu pour le codage ; Q3 et en dessous économisent de la VRAM mais introduisent de manière mesurable des erreurs de syntaxe subtiles. Et le cache KV croît avec votre fenêtre de contexte, c'est pourquoi « un 30B tient dans 24 Go » n'est vrai que pour un contexte que vous devez réellement spécifier.
Mixture-of-Experts change la donne d'une manière qui compte pour les deux grands choix ci-dessous. Les paramètres totaux définissent l'empreinte ; les paramètres actifs définissent la vitesse. C'est pourquoi Qwen3-Coder-30B-A3B (30B total, 3.3B actifs) et gpt-oss-20b (20.9B total, 3.61B actifs) semblent tous deux bien plus rapides que ce que leur poids sur disque suggère, et pourquoi DeepSeek V4 Flash — 284B total, 13B actifs — est un mauvais choix pour une utilisation locale, même si son API est bon marché.

24 Go de VRAM : Qwen3-Coder 30B
Qwen3-Coder-30B-A3B-Instructest le meilleur codeur local polyvalent que nous puissions citer actuellement. Publié en juillet 2025 par l’équipe Qwen d’Alibaba sous licence Apache 2.0, il s’agit d’un modèle Mixture-of-Experts avec 30B de paramètres au total et 3,3B actifs par jeton, une fenêtre de contexte de 262 144 jetons, et une empreinte 4 bits d’environ 17 à 20 Go — ce qui laisse une vraie marge sur une carte de 24 Go pour le cache KV dont une longue session de codage a besoin.
Sur le harnais local indépendant auquel nous faisons le plus confiance (gauravvij/local-llm-coding-eval, quatre modèles exécutés localement via Ollama sur CPU), qwen3-coder:30b a obtenu 80 % en génération de code, 77 % en sélection d'outils et 80 % en précision d'agent — le résultat le plus équilibré des quatre, et le seul modèle performant dans ces trois tâches à la fois. Les trackers tiers compilent son SWE-bench Verified autour de 50,3, Aider Polyglot à 66,2 et LiveCodeBench v6 à 58,9 ; considérez ces chiffres comme des valeurs compilées, et non comme des chiffres officiels d'Alibaba, qui est tout ce que Qwen a publié pour ce modèle.
La vitesse mesurée varie considérablement selon le matériel. Les données les plus utiles : {{1}}une configuration communautaire TurboQuant l'exécute sur une RTX 3060 Ti 8 Go à ~29 tokens/s en génération avec un contexte complet de 262K{{/1}}, et {{2}}le benchmark oMLX a mesuré la version MLX 4 bits sur un M4 Pro (48 Go) à 73,6 tokens/s avec un contexte de 1K, tombant à 13,5 tokens/s à 64K{{/2}}. Sur une carte 24 Go dans une configuration Ollama normale, {{3}}vous devez vous attendre à une plage de dizaines de tokens par seconde, pas des centaines — c'est le compromis pour exécuter un codeur quasi-frontalier à la maison{{/3}}.
L'avertissement honnête : ce n'est pas le codeur local le plus rapide, et un Qwen3-Coder-Next plus récent existe, destiné à un usage hébergé et en CLI plutôt qu'à des installations locales quantifiées. Mais pour un travail agentique à l'échelle du dépôt sur une seule carte, Qwen3-Coder-30B est le choix aujourd'hui.
16GB VRAM : gpt-oss-20b
Sur une carte de 16 Go, la réponse est gpt-oss-20b — et de loin. Publié le 5 août 2025 par OpenAI sous licence Apache 2.0, c’est un modèle Mixture-of-Experts avec 20,9 milliards de paramètres au total et 3,61 milliards actifs par token, une fenêtre de contexte de 131 072 tokens, et sa quantification native MXFP4 occupe environ 14 Go. C’est là le fait décisif : il fonctionne à 100 % sur GPU sur une carte de 16 Go, sans rien déborder dans la RAM système.
Pourquoi la résidence sur GPU importe plus que n'importe quel benchmark : un modèle qui tient dans la VRAM est 3 à 11 fois plus rapide qu'un modèle qui décharge. Un benchmark indépendant a enregistré 139,93 tokens/sec pour gpt-oss-20b sur une RTX 4080 — soit environ 2,8 fois une alternative dense à empreinte identique — et un testeur en 2026 lui a attribué un « indice d'intelligence » de 52,1, le qualifiant d'inégalé dans la classe des 16 Go pour le codage et le débogage professionnels. Il tient de justesse, alors exécutez-le seul et gardez un contexte modeste ; la qualité se dégrade en haut de la fenêtre.
L'alternative agentique sur 16 Go est Devstral 24B (devstral-small-2:24b), qui affiche le seul nombre publié de SWE-bench Verified parmi les codeurs locaux de classe 16 Go — 46,8 % — mais elle est lente, nécessitant souvent un déchargement CPU à environ 18 tokens/sec. Si votre travail consiste en des modifications agentiques multi-fichiers et que vous pouvez supporter la lenteur, Devstral mérite sa place ; si vous voulez de la vitesse et un code propre, gpt-oss-20b est le meilleur choix par défaut. Les modèles denses 14B — Qwen3-Coder 14B ou Qwen2.5-Coder 14B en Q5 — sont les solutions de repli confortables et économiques.
8GB VRAM : Qwen 2.5 Coder 7B
Sur 8 Go, la réponse honnête est Qwen2.5-Coder-7B : 7B paramètres à ~4,7 Go en Q4_K_M, un contexte natif de 32 768 jetons extensible jusqu'à 128K, et les meilleurs scores de benchmark de complétion de code dans la classe 7B. C'est un modèle plus ancien — sorti en novembre 2024 — et ce n'est pas grave, car rien de plus récent dans la catégorie des 8 Go ne l'a détrôné. Les tests communautaires le situent à environ 50 jetons/seconde sur une RTX 4060 ou 3070 ; un test indépendant sur RTX 4060 en mars 2026 a mesuré 28–35 jetons/seconde, une variation due presque entièrement aux paramètres de contexte.
Trois choses comptent sur 8 Go qui ne comptent pas ailleurs. Premièrement, limitez le contexte à 4–8K : c'est le cache KV qui provoque une OOM sur une carte de 8 Go, pas les poids — un benchmark a vu la vitesse passer d'environ 3,6 à 37 tokens/s uniquement grâce à la limitation du contexte. Deuxièmement, vérifiez avec ollama ps que le modèle est à 100 % sur GPU ; toute part CPU signifie un effondrement de la vitesse. Troisièmement, Q4_K_M, pas Q3 — les erreurs de syntaxe de Q3 vous coûtent plus que ce que la VRAM économise.
Le développement notable de 2026 est que Qwen3-Coder-30B-A3B-Instruct peut désormais tenir sur 8 Go grâce à la compression du cache KV TurboQuant — une configuration communautaire a mesuré ~7,5 Go et ~29 tokens/s sur une RTX 3060 Ti avec un contexte complet de 256K. Cela fonctionne, mais c'est suffisamment délicat pour que nous ne le recommandions pas par défaut. Si vous voulez une option plus récente prête à l'emploi, Qwen3 8B (~5,2 Go, mode de pensée hybride) est un petit pas en avant par rapport à Qwen2.5-Coder-7B en raisonnement général, tout en restant légèrement en retrait sur le code pur.

Et pour Apple Silicon ?
La mémoire unifiée change l'équation dans un sens : la capacité augmente, la vitesse de génération diminue. Un M4 Pro de 48 Go peut contenir des modèles qu'une carte Windows de 16 Go ne peut pas contenir, mais il génère des tokens beaucoup plus lentement sur de longs contextes. Les chiffres que nous avons : la version MLX 4 bits de Qwen3-Coder-30B-A3B-Instruct a utilisé 16,6 Go à 1K de contexte et 25,5 Go à 64K sur un M4 Pro, avec une génération passant de 73,6 tokens/s à 13,5 à mesure que le contexte grandissait (benchmark oMLX). gpt-oss-20b tient confortablement dans 16 Go de mémoire unifiée et constitue un excellent choix pour Mac. Si vous voulez du multimodal sur Apple Silicon, Gemma 4 12B tourne avec environ 16 Go de mémoire unifiée et un contexte de 256K — la meilleure option locale si votre travail de codage côtoie des documents riches en images.
Les chiffres indépendants : le codegen n'est pas la compétence qui compte.
Les données les plus claires que nous avons trouvées sont un benchmark local unique qui mérite d'être cité dans son intégralité. gauravvij/local-llm-coding-eval a exécuté quatre modèles localement via Ollama, sur CPU, sans cloud — génération de code, appels de fonctions et une tâche d'agent en plusieurs étapes — avec des résultats qui vont à l'encontre de l'instinct selon lequel « un plus grand nombre de codegen l'emporte » :
• Qwen3.6 27B (qwen3.6:27b, dense, ~17GB) : 80,0 % codegen, 84,6 % outils, 100 % agent — le meilleur polyvalent.
• Qwen3.6 35B A3B (qwen3.6:35b-a3b, MoE, ~18 Go) : 70,0 % génération de code, 84,6 % outils, 100 % agent.
• Qwen3-Coder-30B-A3B-Instruct (qwen3-coder:30b, MoE, ~17GB) : 80,0 % codegen, 76,9 % outils, 80 % agent — le plus équilibré.
• DeepSeek-Coder-V2 33B (deepseek-coder:33b, dense, ~18GB) : 90,0 % codegen — le meilleur des quatre — mais 10 % agent, bon dernier pour le travail multi-étapes.
Cette dernière ligne est toute la leçon. Un modèle qui excelle en génération de code pur mais qui s'effondre sur les tâches d'agent est le modèle que vous désinstallerez après la première boucle « lis ce fichier, modifie cette fonction, exécute le test ». Jugez un codeur local par la colonne agentique, pas par la colonne codegen.

Exécuter localement est la mauvaise décision.
Local-first est le bon choix par défaut pour la confidentialité, le travail hors ligne, un coût marginal de jetons nul et l'autocomplétion lorsque la latence importe plus que la qualité maximale. C'est le mauvais choix dans des situations spécifiques et reconnaissables — et c'est la section que l'on saute en première page :
• Le travail agentique le plus difficile a encore raison de vous. Le test de terrain d'EPAM en 2026 sur une application Flutter de 15 000 lignes a montré que les modèles frontières cloud (GPT-5.3-codex) surpassaient encore les modèles locaux sur les refactorisations multi-étapes les plus complexes. Si votre journée se résume à des refactorisations de huit heures de code hérité, les modèles locaux ne sont pas prêts.
• Vos besoins en contexte dépassent votre carte. Un agent de codage qui charge un dépôt entier dépassera largement le cache KV qu'une carte de 16 Go peut contenir. Le contexte de 256K de Qwen3-Coder-30B est la raison pour laquelle il gagne dans la catégorie 24 Go — les cartes plus petites perdent cette partie dès le début.
• Vous ne pouvez pas surveiller le matériel en permanence. Le matériel, c'est de l'argent réel : une carte 24 Go coûte entre 700 et 1 600 dollars, plus l'électricité et la maintenance. À faible volume, appeler une API coûte moins cher que la consommation électrique.
• DeepSeek V4 Flash est la preuve. Avec 284B de paramètres au total, les poids 4 bits de DeepSeek V4 Flash représentent à eux seuls environ 140 Go — ce n'est pas un modèle pour carte grand public, point final. Sa conception à 13B actifs est exactement la raison pour laquelle son API est rapide et peu coûteuse à $0.15 / $0.29 pour 1M de jetons (MIT, contexte de 1M). Pour ce modèle, « l’exécuter localement » est la mauvaise question ; l’API est le but.
• Les équipes ont besoin de cohérence. Si quatre ingénieurs exécutent chacun une quantification différente d'un modèle différent, « ça marche sur ma machine » devient un danger pour le build. Des points de terminaison d'API partagés vous offrent une cible déterministe unique.
Si vous voulez la réponse côté API à cette même question — quel modèle de codage cloud est celui par défaut lorsque le local n'est pas le bon compromis — nous l'avons traitée séparément dans notre guide best-LLM-for-coding, et notre article AI-coding-agents couvre les outils comme Cline et OpenCode qui fonctionnent avec ces modèles locaux.
Comment tester avant d'acheter la carte
La façon la moins chère de décider est d'exécuter vos propres prompts avant de vous engager sur le matériel. Ollama ou LM Studio font tourner chacun des trois choix en quelques minutes, et le test qui compte, ce sont les vrais fichiers de votre dépôt, pas un benchmark. Un routeur trouve sa place dans la décision connexe : lorsque vous comparez un candidat local à des modèles frontaliers hébergés, un seul point de terminaison vous permet d'exécuter la même requête sur les deux sans avoir à jongler avec les clés. Sur OrcaRouter, DeepSeek V4 Flash est servi au prix catalogue de son fournisseur, répercuté sans modification — 0,15 $ / 0,29 $ par million de jetons, marge de 0 % — avec bascule automatique, ce qui en fait un étalon bon marché et honnête pour répondre à la question : « mon modèle local est-il vraiment meilleur que l'API à 0,15 $ ? »
Un avertissement honnête : OrcaRouter n’héberge ni Qwen3-Coder-30B-A3B-Instruct ni gpt-oss-20b. Si votre objectif est strictement hors ligne, un routeur ne vous concerne pas — auto-hébergez et vous avez terminé. Si votre objectif est de comparer en A/B le même modèle open-weight contre les modèles de pointe avant de dépenser pour une carte, le rôle du routeur est la comparaison, pas l’hébergement.
En résumé
Votre VRAM décide d'abord, la qualité du modèle ensuite. Sur 24 Go, exécutez Qwen3-Coder-30B-A3B-Instruct — le codeur local polyvalent le plus puissant, avec le contexte de 256K dont le travail agentique a besoin. Sur 16 Go, exécutez gpt-oss-20b — le rare modèle à la fois rapide et entièrement sur GPU. Sur 8 Go, exécutez Qwen2.5-Coder-7B et gardez un contexte modeste. Jugez-les par la colonne agentique, pas par la colonne codegen, et acceptez que le refactoring multi-fichiers le plus difficile appartienne encore au cloud. Les chiffres ci-dessus sont à jour au 10 août 2026 — revérifiez la gamme et les prix catalogue avant de dépenser, car ce domaine évolue chaque semaine.
