
2026年8月、コーディングに最適なローカルLLM(VRAM別):Qwen3-Coder 30B、gpt-oss-20b、Qwen 2.5 Coder 7B
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenNEWQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxNEWMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 2214 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
- tencentTencent: Hy32026-07-0642知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3055知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
2026年8月のコーディング向けローカルLLMの最適解は、何よりもまずVRAMで決まります。24GBのカード(RTX 3090または4090)をお持ちなら、Qwen3-Coder-30B-A3B-Instructを実行してください。総パラメータ30B、トークンあたりのアクティブパラメータはわずか3.3B、コンテキストウィンドウは262,144トークン、そして検証できる限りローカルコーディングの総合性能はこれが最高です。16GBの場合は、gpt-oss-20bです。OpenAIのApache-2.0ライセンスのMixture-of-Expertsモデルで、約14GBで完全にGPUに収まり、毎秒約140トークンの速度を記録します。8GBの場合は、Qwen2.5-Coder-7Bです。約4.7GBで信頼できる実働モデルです。このページの残りでは、その根拠、実測値、そして各選択肢が当てはまらない具体的な状況を説明します。
「1ページ目が正しくできていること — そして省略していること」
「best local llm for coding」の現在のランキングは、本当に役立つ記事が1つある一方で、大半はドメインの強さで上位に来ているという混在状態だ。Temboのガイド(2026年6月5日付)は構成は正しい。8GB / 12〜16GB / 24GBの各階層に分け、Qwen Coderファミリーを推奨している。しかし、ローカルモデルのベンチマークスコア、1秒あたりのトークン数、コンテキストウィンドウのサイズ、RAM別のApple Siliconの選択肢は一切公開されていない。GitHubの評価用ハーネス(gauravvij/local-llm-coding-eval)は実数値を出しているが、結論がなく、CPUのみで実行された。残りは単一著者による意見記事(XDA、Yahoo Tech)と中身の薄いリスト記事(apidog、Security Boulevard、SitePoint)で、有用性ではなくドメインの強さでランクインしている。
彼ら全員が省いているもの、あなたにかかるコストが高い順に:
• エージェント的ギャップ。コード生成は、エージェントを複数ファイルにわたる変更に導くスキルとは異なります。1ページ目ではほとんど触れられていません。それが、使い続けるモデルとアンインストールするモデルの違いです。
• コンテキストウィンドウ。エージェント型コーディングは、ファイルやテスト出力の読み込みでトークンを大量に消費します。「30Bは24GBに収まる」という主張は、どのコンテキストで収まるのかを問わなければ無意味です。
• 量子化の数学。4ビットならパラメータ数とほぼ同数のギガバイトが必要になることや、Q3は微妙な構文エラーという代償を払ってVRAMを節約できることは、誰も説明してくれない。
• 測定速度。推奨するモデルについてトークン/秒を記載している記事はほとんどなく、記載している場合でも、コンテキストと量子化によってすべてが変わるため、結果は大きく食い違います。
• ローカルが間違った選択となる場合。 15,000行のFlutterアプリ(EPAM)を用いた2026年のフィールドテストでも、最も難しい複数ステップのリファクタリングではクラウドのフロンティアモデルが勝っています。どのリスト記事も、どこで止めるべきかを教えてくれません。
多くのリスティクルが飛ばすVRAM計算
この記事の他のすべての数値を読みやすくする経験則:4ビット量子化では、モデルはKVキャッシュのオーバーヘッドを除き、おおよそパラメータ数に相当するギガバイトのメモリを必要とします。7B ≈ 5GB、30B ≈ 18GB+。Q4はコーディングに最適なポイントです。Q3以下はVRAMを節約できますが、測定可能な程度の微妙な構文エラーを導入します。また、KVキャッシュはコンテキストウィンドウとともに増大します。そのため、「30Bは24GBに収まる」というのは、実際に指定しなければならないコンテキストにおいてのみ真となります。
Mixture-of-Experts(MoE)は、以下の2つの主要な選択肢にとって重要な形で計算の仕組みを変えます。総パラメータ数がフットプリントを決め、アクティブパラメータ数が速度を決めます。そのため、Qwen3-Coder-30B-A3B(総計30B、アクティブ3.3B)とgpt-oss-20b(総計20.9B、アクティブ3.61B)はどちらも、ディスク上のサイズから想像されるよりもはるかに高速に感じられます。また、DeepSeek V4 Flash(総計284B、アクティブ13B)が、APIは安価なのにローカル実行に不向きなのもこのためです。

24GB VRAM:Qwen3-Coder 30B
Qwen3-Coder-30B-A3B-Instructは、現在私たちが指摘できる中で最も強力なオールラウンドなローカルコーダーです。2025年7月にAlibabaのQwenチームによってApache 2.0のもとでリリースされたこのモデルは、Mixture-of-Expertsアーキテクチャを採用し、合計30Bパラメータ、トークンあたり3.3Bのアクティブパラメータ、262,144トークンのコンテキストウィンドウ、そして約17〜20GBの4ビットフットプリントを備えています。これにより、24GBのGPUカード上でも、長いコーディングセッションに必要なKVキャッシュのための十分な余裕が確保されます。
私たちが最も信頼する独立系ローカルハーネス(gauravvij/local-llm-coding-eval、Ollama経由でCPU上でローカル実行される4モデル)では、qwen3-coder:30bはコード生成80%、ツール選択77%、エージェント精度80%を記録しました。これは4モデル中で最もバランスの取れた結果であり、3つのタスクすべてに強い唯一のモデルでした。サードパーティのトラッカーは、SWE-bench Verifiedを約50.3、Aider Polyglotを66.2、LiveCodeBench v6を58.9と集計しています。これらは集計値として扱ってください。Alibabaの公式数値ではなく、Qwenがこのモデルについて公開しているのは公式数値のみです。
測定速度はハードウェアによって大きく異なります。最も有用なデータポイントは次のとおりです: コミュニティのTurboQuantセットアップでは、8GBのRTX 3060 Ti上で完全な262Kコンテキストにおいて約29トークン/秒の生成速度で動作し、oMLXベンチマークでは48GBのM4 Pro上の4ビットMLXビルドが1Kコンテキストで73.6トークン/秒、64Kでは13.5トークン/秒に低下すると測定されました。通常のOllamaセットアップの24GBカードでは、毎秒数十トークンの範囲を期待すべきであり、数百ではありません — これは自宅でフロンティアに近いコーダーを実行するためのトレードオフです。
正直な注意点:これは最速のローカルコーダーではなく、新しいQwen3-Coder-Nextはホステッド利用やCLI利用を目的としており、量子化されたローカルインストール向けではありません。しかし、エージェント的でリポジトリ規模の作業を1枚のカードで行うなら、今日の選択はQwen3-Coder-30Bです。
16GBのVRAM:gpt-oss-20b
16GBカードの場合、答えはgpt-oss-20bであり、しかも僅差でもありません。2025年8月5日にOpenAIがApache 2.0ライセンスで公開した、総パラメータ20.9B・トークンあたりアクティブ3.61BのMixture-of-Expertsモデルです。131,072トークンのコンテキストウィンドウを備え、ネイティブのMXFP4量子化版は約14GBです。これが決定的な事実です:16GBカード上で100%GPUだけで動作し、システムRAMに溢れ出ることが一切ありません。
GPU常駐がどのベンチマークよりも重要な理由:VRAMに収まるモデルは、オフロードするモデルより3〜11倍高速です。{{1}}独立したベンチマークでは、RTX 4080上のgpt-oss-20bで139.93トークン/秒を記録し{{/1}} — 同じフットプリントのdense代替モデルの約2.8倍 — そして{{2}}2026年のテスターによるスコアリングでは、52.1の「インテリジェンス指数」を与え、16GBクラスではプロフェッショナルなコーディングとデバッグにおいて比類ないと評価されました。{{/2}}ぎりぎり収まるサイズなので、単独で実行し、コンテキストを控えめに保ってください。ウィンドウの上限付近では品質が低下します。
16GBにおけるエージェント向けの代替手段はDevstral 24B(devstral-small-2:24b)であり、公開されている16GBクラスのローカルコーダーの中で唯一のSWE-bench Verifiedスコア(46.8%)を記録しています。ただし、遅く、しばしばCPUオフロードを必要とし、約18トークン/秒です。作業が複数ファイルのエージェント編集であり、速度を許容できるなら、Devstralはその地位に値します。速度とクリーンなコードを求めるなら、gpt-oss-20bがより良いデフォルトです。Dense 14Bモデル(Qwen3-Coder 14BまたはQwen2.5-Coder 14B at Q5)は、快適で安価なフォールバックです。
8GB VRAM:Qwen 2.5 Coder 7B
8GBの場合、正直な答えはQwen2.5-Coder-7Bです。Q4_K_Mで約4.7GBの7Bパラメータ、32,768トークンのネイティブコンテキスト(128Kまで拡張可能)、そして7Bクラスで最強のコード補完ベンチマークスコアを誇ります。2024年11月リリースの古いモデルですが、それで問題ありません。8GBという枠組みの中で、それより新しいモデルはまだこれを打ち倒していないからです。コミュニティテストではRTX 4060または3070で毎秒約50トークン。2026年3月の独立したRTX 4060テストでは毎秒28〜35トークンと測定され、その差はほぼ完全にコンテキスト設定によるものです。
8GBのGPUでは、他の環境では当てはまらない3つの点が重要です。第一に、コンテキストを4〜8Kに制限することです。8GBカードのOOMを引き起こすのは重みではなくKVキャッシュです。あるベンチマークでは、コンテキストを制限するだけで、速度が毎秒約3.6トークンから約37トークンに跳ね上がりました。第二に、ollama psでモデルが100% GPU上にあることを確認することです。CPUに一部でもオフロードされていると、速度は一気に落ちます。第三に、Q3ではなくQ4_K_Mを使うことです。Q3の構文エラーは、VRAMの節約分以上のコストがかかります。
2026年の注目すべき進展は、Qwen3-Coder-30B-A3B-InstructがTurboQuant KV-cache圧縮によって8GBに収められるようになったことです。コミュニティのセットアップでは、フル256KコンテキストでRTX 3060 Ti上において約7.5GB、約29トークン/秒を計測しました。動作はしますが、デフォルトとして推奨するには厄介なほど細かい調整が必要です。より新しいすぐ使えるオプションをお求めなら、Qwen3 8B(約5.2GB、ハイブリッド思考モード)は、一般的な推論においてQwen2.5-Coder-7Bから一歩進んだ性能で、純粋なコードではわずかに劣ります。

Apple Siliconはどうですか?
ユニファイドメモリは状況を一方向に変えます:容量は増え、生成速度は低下します。48GBのM4 Proは、16GBのWindowsカードでは保持できないモデルを保持できますが、長いコンテキストではトークン生成がはるかに遅くなります。私たちが持っている数値では、M4 Pro上でQwen3-Coder-30B-A3B-Instructの4ビットMLXビルドは、1Kコンテキストで16.6GB、64Kで25.5GBを使用し、コンテキストが増えるにつれて生成速度は73.6トークン/秒から13.5に低下しました(oMLXベンチマーク)。gpt-oss-20bは16GBのユニファイドメモリに余裕を持って収まり、Macでの優れた選択肢です。Apple Siliconでマルチモーダルを求めるなら、Gemma 4 12Bは約16GBのユニファイドメモリで動作し、256Kコンテキストを備えています。— コード作業が画像中心のドキュメントの隣にある場合の最強のローカルオプションです。
独立した数字:codegenは重要なスキルではない
私たちが見つけた最も明確なデータは、全体を引用する価値のある単一のローカルベンチマークです。gauravvij/local-llm-coding-eval は、Ollama を介して4つのモデルをローカルで、CPU上で、クラウドなしで実行しました — コード生成、関数呼び出し、マルチステップのエージェントタスク — その結果は「コード生成数が大きい方が勝つ」という直感に反するものです:
• Qwen3.6 27B(qwen3.6:27b、dense、約17GB):コード生成80.0%、ツール84.6%、エージェント100%——最高のオールラウンダー。
• Qwen3.6 35B A3B(qwen3.6:35b-a3b、MoE、約18GB):コード生成70.0%、ツール84.6%、エージェント100%。
• Qwen3-Coder-30B-A3B-Instruct (qwen3-coder:30b、MoE、約17GB): コード生成80.0%、ツール76.9%、エージェント80% — 最もバランスが取れている。
• DeepSeek-Coder-V2 33B (deepseek-coder:33b, 高密度, 約18GB): コード生成90.0% — 4つのうちで最高 — しかし、 エージェント10%、マルチステップ作業では最下位。
その最後の一行が教訓のすべてだ。純粋なコード生成ではトップクラスなのに、エージェントタスクでは崩壊するモデル——そんなモデルは、最初の「このファイルを読んで、この関数を変更して、テストを実行して」のループでアンインストールすることになる。ローカルコーダーを評価するなら、コード生成の列ではなく、エージェントの列で見るべきだ。

ローカルで実行するのが誤った選択になる場合。
ローカルファーストは、プライバシー、オフライン作業、限界トークンコストゼロ、そして遅延が最高品質よりも重要となるオートコンプリートにとって、正しいデフォルトである。しかし、特定の認識可能な状況では誤った選択となる——そして、これこそが誰もが読み飛ばすセクションである。
• 最難関のエージェント作業は、今なおあなたを打ち負かす。 EPAMの2026年フィールドテストでは、15,000行のFlutterアプリを対象に、クラウドフロンティアモデル(GPT-5.3-codex)が最も複雑なマルチステップのリファクタリングにおいて依然としてローカルモデルを上回ることが判明した。1日8時間をレガシーコードのリファクタリングに費やす仕事なら、ローカルはまだ実用的ではない。
• 必要なコンテキスト量がカードの容量を超えています。 リポジトリ全体を読み込むコーディングエージェントは、16GBカードが保持できるKVキャッシュを軽く超えてしまいます。Qwen3-Coder-30Bの256Kコンテキストは、24GBクラスで勝利する理由です — より小さいカードはこのゲームで早々に負けてしまいます。
• ハードウェアを監視し続けることはできません。ハードウェアは実際にお金がかかります:24GBのカードは700〜1,600ドルのクラスで、それに電気代とメンテナンスがかかります。利用量が少なければ、APIを呼び出す方が電力消費よりも安価です。
• DeepSeek V4 Flash がその証拠です。総パラメータ数が284BのDeepSeek V4 Flashは、4ビット精度の重みだけで約140GBにもなり、コンシューマー向けカードで動かせるモデルではまったくありません。13Bがアクティブになる設計こそ、APIが1Mトークンあたり$0.15 / $0.29(MIT、1Mコンテキスト)という低価格で高速な理由です。そのモデルにとって「ローカルで動かす」は間違った問いであり、APIこそが本質です。
• チームには一貫性が必要です。 4人のエンジニアがそれぞれ異なるモデルの異なる量子化を実行しているなら、「自分のマシンでは動く」はビルド上の危険になります。共有APIエンドポイントがあれば、決定的なターゲットが一つに定まります。
この同じ質問に対するAPI側の回答(ローカルが適切なトレードオフではない場合にデフォルトとなるクラウドコーディングモデルはどれか)を知りたい場合は、当社のbest-LLM-for-codingガイドで別途解説しています。また、AI-coding-agentsの記事では、ClineやOpenCodeなど、これらのローカルモデルで動作するハーネスを取り上げています。
購入前にカードをテストする方法
最も安価な判断方法は、ハードウェアを導入する前に自分でプロンプトを実行することです。Ollama や LM Studio を使えば、3つの候補のいずれも数分で実行でき、重要なテストはベンチマークではなく、あなたのリポジトリの実際のファイルです。ルーターは隣接する判断において価値を発揮します。ローカルの候補とホスト型のフロンティアモデルを比較する場合、1つのエンドポイントがあれば、キーを切り替えることなく同じプロンプトを両方に実行できます。OrcaRouter では、DeepSeek V4 Flash がプロバイダーのリスト価格のまま透過的に提供されており、$0.15 / $0.29(1Mトークンあたり)、マークアップ0%、自動フェイルオーバー付きです。そのため、「私のローカルモデルは本当に$0.15のAPIより優れているのか?」という問いに対する、安価で正直な物差しとなります。
正直な注意点を一つ:OrcaRouterはQwen3-Coder-30B-A3B-Instructやgpt-oss-20bをホストしていません。目標が完全にオフライン運用なら、ルーターはあなたにとって無関係です——セルフホストすればそれで完了です。目標が、カードに費用をかける前に同じオープンウェイトモデルを最先端モデルとA/B比較することなら、ルーターの役割は比較であって、ホスティングではありません。
結論
VRAMが最優先で、モデルの品質は二の次です。24GBなら、Qwen3-Coder-30B-A3B-Instructを実行しましょう。これは最も強力な万能ローカルコーダーであり、エージェント型の作業に必要な256Kコンテキストを備えています。16GBなら、gpt-oss-20bを実行しましょう。これは高速でありながら完全にGPU内で動作する希少なモデルです。8GBなら、Qwen2.5-Coder-7Bを実行し、コンテキストは控えめに保ちましょう。いずれのモデルも、コード生成の欄ではなくエージェント型の欄で判断し、最も難しいマルチファイルリファクタリングは依然としてクラウドの領域であることを受け入れましょう。上記の数字は2026年8月10日時点のものです。この分野は毎週変化するため、購入前にラインナップと定価を再確認してください。
