Kartu judul yang bertuliskan 'LLM Lokal Terbaik untuk Coding pada Agustus 2026' dengan subjudul 'Berdasarkan VRAM: Qwen3-Coder 30B di 24GB · gpt-oss-20b di 16GB · Qwen 2.5 Coder 7B di 8GB', dan tiga ubin berlabel '24GB Qwen3-Coder 30B A3B koder lokal serba bisa terkuat dengan konteks 256K', '16GB gpt-oss-20b ~140 tok/s sepenuhnya di GPU, Apache 2.0', '8GB Qwen 2.5 Coder 7B kuda kerja andal ~4.7GB pada Q4', dengan latar belakang putih dengan aksen gradien biru dan cyan serta logo OrcaRouter yang ditempatkan di kanan bawah.
Guides & Insights

LLM Lokal Terbaik untuk Coding pada Agustus 2026, Berdasarkan VRAM: Qwen3-Coder 30B, gpt-oss-20b, Qwen 2.5 Coder 7B

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

LLM lokal terbaik untuk coding pada Agustus 2026 ditentukan oleh VRAM Anda sebelum hal lainnya. Jika Anda memiliki kartu 24GB — RTX 3090 atau 4090 — jalankan Qwen3-Coder-30B-A3B-Instruct: total 30B parameter dengan hanya 3.3B aktif per token, jendela konteks 262,144 token, dan angka coding lokal terbaik secara keseluruhan yang dapat kami verifikasi. Pada 16GB, modelnya adalah gpt-oss-20b, model Mixture-of-Experts berlisensi Apache-2.0 milik O​penAI yang muat sepenuhnya di GPU pada ~14GB dan mencapai sekitar 140 token/detik. Pada 8GB, modelnya adalah Qwen2.5-Coder-7B, kuda kerja yang andal dengan ~4.7GB. Sisa halaman ini berisi alasan, angka-angka terukur, dan situasi spesifik di mana masing-masing pilihan tersebut salah.

Apa yang halaman satu lakukan dengan benar — dan apa yang dilewatkannya

Peringkat untuk "best local llm for coding" saat ini merupakan campuran dari satu karya yang benar-benar berguna dan banyak kekuatan domain. Panduan Tembo (5 Juni 2026) sudah tepat bentuknya — ia mengelompokkan berdasarkan tingkatan 8GB / 12–16GB / 24GB dan bermuara pada keluarga Qwen Coder — tetapi tidak memublikasikan skor tolok ukur untuk model lokal, tidak ada angka token per detik, tidak ada ukuran jendela konteks, dan tidak ada pilihan Apple Silicon berdasarkan RAM. Sebuah kerangka evaluasi GitHub (gauravvij/local-llm-coding-eval) memiliki angka nyata tetapi tidak ada kesimpulan dan hanya dijalankan pada CPU. Sisanya adalah artikel opini penulis tunggal (XDA, Yahoo Tech) dan listicle tipis (apidog, Security Boulevard, SitePoint) yang diperingkat berdasarkan kekuatan domain, bukan berdasarkan kebermanfaatannya.

Apa yang mereka semua lewatkan, sesuai urutan seberapa besar biayanya bagi Anda:

Kesenjangan agentik. Generasi kode bukanlah keterampilan yang sama dengan mengarahkan agen melalui perubahan multi-file. Halaman pertama nyaris tidak menyebutkannya; itu adalah perbedaan antara model yang Anda pertahankan dan model yang Anda hapus.

Jendela konteks. Coding agentik menghabiskan token untuk memuat file dan output pengujian. Klaim "30B muat di 24GB" tidak berarti apa-apa sampai Anda bertanya pada konteks apa ia muat.

Matematika kuantisasi. Tidak ada yang menjelaskan bahwa 4-bit membutuhkan kira-kira jumlah parameter dalam gigabyte, atau bahwa Q3 menghemat VRAM tetapi menimbulkan kesalahan sintaks yang halus.

Kecepatan terukur. Hanya sedikit ulasan yang mencantumkan token/detik untuk model yang mereka rekomendasikan, dan yang melakukannya berbeda sangat jauh karena konteks dan kuantisasi mengubah segalanya.

Kapan lokal menjadi pilihan yang salah. Uji lapangan tahun 2026 pada aplikasi Flutter dengan 15.000 baris (EPAM) masih menunjukkan model frontier cloud memenangkan refactor multi-langkah tersulit. Tidak ada satu pun artikel daftar yang memberi tahu Anda kapan harus berhenti.

Perhitungan VRAM yang dilewatkan kebanyakan listicle

Aturan praktis yang membuat setiap angka lain dalam artikel ini mudah dibaca: pada kuantisasi 4-bit, sebuah model membutuhkan kira-kira jumlah parameternya dalam gigabyte — 7B ≈ 5GB, 30B ≈ 18GB+, sebelum overhead KV-cache. Q4 adalah titik optimal untuk coding; Q3 dan di bawahnya menghemat VRAM tetapi secara terukur menimbulkan kesalahan sintaks yang halus. Dan cache KV bertambah seiring dengan jendela konteks Anda, itulah sebabnya "30B muat di 24GB" hanya benar pada konteks yang sebenarnya harus Anda tentukan.

{{1}}Mixture-of-Experts mengubah perhitungan matematisnya dengan cara yang penting bagi dua pilihan besar di bawah ini.{{/1}} {{2}}Total parameter menentukan jejaknya; parameter aktif menentukan kecepatannya.{{/2}} {{3}}Itulah sebabnya Qwen3-Coder-30B-A3B (30B total, 3.3B aktif) dan gpt-oss-20b (20.9B total, 3.61B aktif) sama-sama terasa jauh lebih cepat daripada yang tersirat oleh bobotnya di disk,{{/3}} {{4}}dan mengapa DeepSeek V4 Flash — 284B total, 13B aktif — kurang cocok untuk penggunaan lokal meskipun API-nya murah.{{/4}}

Card titled 'The VRAM math most listicles skip' with a rule box reading 'At 4-bit, a model needs roughly its parameter count in gigabytes, plus KV cache for your context window'. Three columns: 'Qwen3-Coder 30B' FP16 ~61GB, Q8 ~30GB, Q4 ~17-20GB, KV cache at 256K several GB extra; 'gpt-oss-20b' FP16 ~40GB, Q8 ~21GB, MXFP4 ~14GB, KV cache at 128K fits 16GB only at modest context; 'Qwen 2.5 Coder 7B' FP16 ~14GB, Q8 ~7GB, Q4 ~4.7GB, KV cache at 32K fits 8GB with headroom. A warning bar reads 'Q3 and below save VRAM but measurably introduce subtle syntax errors in code — Q4 is the coding sweet spot. MoE changes the math: total parameters set the footprint, active parameters set the speed.' with the OrcaRouter logo composited bottom-right.

24GB VRAM: Qwen3-Coder 30B

Qwen3-Coder-30B-A3B-Instruct adalah coder lokal serba-bisa terkuat yang bisa kami tunjukkan saat ini. Dirilis pada Juli 2025 oleh tim Qwen dari Alibaba di bawah Apache 2.0, model ini adalah Mixture-of-Experts dengan total 30B parameter dan 3.3B parameter aktif per token, jendela konteks 262.144 token, dan ukuran 4-bit sekitar 17–20GB — yang menyisakan ruang kosong yang nyata pada kartu 24GB untuk cache KV yang dibutuhkan sesi coding panjang.

Pada harness lokal independen yang paling kami andalkan (gauravvij/local-llm-coding-eval, empat model dijalankan secara lokal melalui Ollama di CPU), qwen3-coder:30b mencetak skor 80% untuk pembuatan kode, 77% untuk pemilihan alat, dan 80% untuk akurasi agen — hasil paling seimbang di antara keempatnya, serta satu-satunya model yang kuat di ketiga tugas tersebut sekaligus. Pelacak pihak ketiga mengompilasi SWE-bench Verified sekitar 50,3, Aider Polyglot pada 66,2, dan LiveCodeBench v6 pada 58,9; anggap itu sebagai angka kompilasi, bukan angka resmi Alibaba, yang merupakan satu-satunya yang pernah dipublikasikan Qwen untuk model ini.

Kecepatan terukur bervariasi luas tergantung perangkat keras. Titik data yang paling berguna: sebuah pengaturan TurboQuant komunitas menjalankannya pada RTX 3060 Ti 8GB dengan kecepatan ~29 token/detik saat generasi, dengan konteks penuh 262K, dan benchmark oMLX mengukur build MLX 4-bit pada M4 Pro (48GB) pada 73.6 token/detik dengan konteks 1K, turun menjadi 13.5 token/detik pada 64K. Pada kartu 24GB dalam pengaturan Ollama normal, Anda harus mengharapkan kisaran puluhan token per detik, bukan ratusan — itulah harga yang harus dibayar untuk menjalankan coder yang mendekati kelas frontier di rumah.

Peringatan jujurnya: ini bukan coder lokal tercepat, dan Qwen3-Coder-Next yang lebih baru ada yang ditujukan untuk penggunaan hosted dan CLI daripada instalasi lokal terkuantisasi. Namun untuk pekerjaan agen skala-repo pada satu kartu, Qwen3-Coder-30B adalah pilihan hari ini.

16GB VRAM: gpt-oss-20b

Pada kartu grafis 16GB, jawabannya adalah gpt-oss-20b — dan itu tidak mendekati. Dirilis pada 5 Agustus 2025 oleh O​penAI di bawah lisensi Apache 2.0, model ini adalah Mixture-of-Experts dengan total 20.9B parameter dan 3.61B aktif per token, jendela konteks 131,072 token, dan kuantisasi MXFP4 aslinya berukuran sekitar 14GB. Itulah fakta yang menentukan: model ini berjalan 100% di GPU pada kartu 16GB, tanpa ada yang meluber ke RAM sistem.

Mengapa residensi di GPU lebih penting daripada tolok ukur apa pun: model yang muat di VRAM 3–11x lebih cepat daripada model yang melakukan offload. Sebuah benchmark independen mencatat 139.93 token/detik untuk gpt-oss-20b pada RTX 4080 — kira-kira 2.8x lipat alternatif padat dengan jejak yang sama — dan penilaian seorang penguji pada 2026 memberikannya indeks kecerdasan 52.1, menyebutnya tak tertandingi di kelas 16GB untuk pengodean dan debugging profesional. Model ini muatnya pas-pasan, jadi jalankan sendiri dan jaga konteksnya sederhana; kualitas menurun di bagian atas jendela.

Alternatif agentik pada 16GB adalah Devstral 24B (devstral-small-2:24b), yang mencatat satu-satunya angka SWE-bench Verified yang dipublikasikan di antara coder lokal kelas 16GB — 46,8% — tetapi lambat, sering kali memerlukan offload CPU pada ~18 token/detik. Jika pekerjaan Anda adalah pengeditan agentik multi-file dan Anda bisa menerima kecepatannya, Devstral layak mendapat tempatnya; jika Anda menginginkan kecepatan plus kode yang bersih, gpt-oss-20b adalah default yang lebih baik. Model 14B padat — Qwen3-Coder 14B atau Qwen2.5-Coder 14B pada Q5 — adalah pilihan cadangan yang nyaman dan murah.

VRAM 8GB: Qwen 2.5 Coder 7B

Pada 8GB, jawaban yang jujur adalah Qwen2.5-Coder-7B: 7B parameter pada ~4.7GB dalam Q4_K_M, konteks native 32.768 token yang dapat diperluas hingga 128K, dan skor benchmark penyelesaian kode terkuat di kelas 7B. Ini adalah model yang lebih lama — dirilis November 2024 — dan itu tidak masalah, karena tidak ada yang lebih baru di kelas 8GB yang menggulingkannya. Tes komunitas menempatkannya sekitar 50 token/detik pada RTX 4060 atau 3070; tes independen RTX 4060 pada Maret 2026 mengukur 28–35 token/detik, perbedaan yang hampir seluruhnya dipengaruhi oleh pengaturan konteks.

Tiga hal penting pada 8GB yang tidak penting di tempat lain. Pertama, batasi konteks pada 4–8K: cache KV-lah yang menyebabkan OOM pada kartu 8GB, bukan bobotnya — satu benchmark menunjukkan kecepatan melonjak dari ~3.6 menjadi ~37 token/detik murni karena membatasi konteks. Kedua, verifikasi dengan ollama ps bahwa model 100% berada di GPU; bagian CPU mana pun berarti kecepatan anjlok. Ketiga, Q4_K_M, bukan Q3 — error sintaks Q3 lebih merugikan daripada penghematan VRAM.

Perkembangan penting pada 2026 adalah bahwa Qwen3-Coder-30B-A3B-Instructkini dapat dipadatkan ke dalam 8GB melalui kompresi TurboQuant KV-cache — sebuah pengaturan dari komunitas yang diukur sekitar 7.5GB dan ~29 token/detik pada RTX 3060 Ti dengan konteks 256K penuh. Ini berfungsi, tetapi cukup rumit sehingga kami tidak merekomendasikannya sebagai default. Jika Anda menginginkan opsi baru yang langsung berfungsi, Qwen3 8B (~5.2GB, mode berpikir hibrida) adalah langkah kecil naik dari Qwen2.5-Coder-7B dalam penalaran umum sambil tetap sedikit tertinggal pada kode murni.

Scoreboard card titled 'Three picks, three VRAM tiers' with three columns. Left '24GB · Qwen3-Coder 30B': VRAM at 4-bit ~19GB Q4_K_M, Context 262,144 tokens, Speed measured ~29 t/s tight 8GB run; 50-90 t/s on 24GB, Released Jul 2025, License Apache 2.0, Best for agentic repo-scale work. Middle '16GB · gpt-oss-20b': VRAM ~14GB MXFP4, Context 131,072 tokens, Speed ~140 t/s RTX 4080, Released Aug 5 2025, License Apache 2.0, Best for speed plus clean code. Right '8GB · Qwen 2.5 Coder 7B': VRAM ~4.7GB Q4_K_M, Context 32,768 native (128K via YaRN), Speed ~50 t/s RTX 4060/3070, Released Nov 2024, License Apache 2.0, Best for autocomplete, offline, privacy. Footer reads 'Speeds are third-party measurements; all figures read Aug 10 2026.' with the OrcaRouter logo composited bottom-right.

Bagaimana dengan Apple Silicon?

Memori terpadu mengubah perhitungan ke satu arah: kapasitas naik, kecepatan generasi turun. M4 Pro 48GB dapat memuat model yang tidak bisa dimuat kartu Windows 16GB, tetapi menghasilkan token jauh lebih lambat pada konteks panjang. Angka yang kami miliki: build MLX 4-bit dari Qwen3-Coder-30B-A3B-Instruct menggunakan 16.6GB pada konteks 1K dan 25.5GB pada 64K di M4 Pro, dengan generasi turun dari 73.6 token/detik menjadi 13.5 seiring bertambahnya konteks (tolok ukur oMLX). gpt-oss-20b muat dengan nyaman dalam 16GB memori terpadu dan merupakan pilihan Mac yang bagus. Jika Anda ingin multimodal di Apple Silicon, Gemma 4 12B berjalan dalam sekitar 16GB memori terpadu dengan konteks 256K — opsi lokal terkuat jika pekerjaan coding Anda berdampingan dengan dokumen yang sarat gambar.

Angka-angka independen: codegen bukan keterampilan yang menentukan

Data paling jelas yang kami temukan adalah satu benchmark lokal yang layak dikutip secara utuh. gauravvij/local-llm-coding-eval menjalankan empat model secara lokal melalui Ollama, di CPU, tanpa cloud — pembuatan kode, pemanggilan fungsi, dan tugas agen multi-langkah — dengan hasil yang bertentangan dengan naluri "angka codegen yang lebih besar menang":

Qwen3.6 27B (qwen3.6:27b, dense, ~17GB): 80.0% codegen, 84.6% tools, 100% agen — yang paling serba bisa.

Qwen3.6 35B A3B (qwen3.6:35b-a3b, MoE, ~18GB): 70,0% generasi kode, 84,6% perkakas, 100% agen.

Qwen3-Coder-30B-A3B-Instruct (qwen3-coder:30b, MoE, ~17GB): 80,0% codegen, 76,9% tools, 80% agent — paling seimbang.

DeepSeek-Coder-V2 33B (deepseek-coder:33b, dense, ~18GB): 90.0% codegen — yang terbaik dari keempatnya — tetapi 10% agent, paling akhir dalam pekerjaan multi-langkah.

Baris terakhir itu adalah inti pelajarannya. Model yang unggul dalam pembuatan kode murni namun gagal dalam tugas-tugas agen adalah model yang akan kamu hapus setelah putaran pertama "baca file ini, ubah fungsi ini, jalankan tes". Nilai seorang coder lokal berdasarkan kolom agen, bukan kolom codegen.

Benchmark card titled 'The independent local benchmark — agentic skill is the real gap' with four columns. 'qwen3.6:27b dense ~17GB': Codegen 80.0%, Tools 84.6%, Agent 100%. 'qwen3.6:35b-a3b MoE ~18GB': Codegen 70.0%, Tools 84.6%, Agent 100%. 'qwen3-coder:30b MoE ~17GB': Codegen 80.0%, Tools 76.9%, Agent 80%. 'deepseek-coder:33b dense ~18GB': Codegen 90.0%, Tools 84.6%, Agent 10%. Footer reads 'deepseek-coder:33b tops codegen yet collapses on agent tasks — codegen alone overrates a local coder. All four ran locally via Ollama, CPU-only, no cloud (gauravvij/local-llm-coding-eval, GitHub). On a 15k-LOC refactor, cloud frontier still wins (EPAM field test, 2026).' with the OrcaRouter logo composited bottom-right.

Ketika menjalankan secara lokal adalah keputusan yang salah.

Local-first adalah default yang tepat untuk privasi, pekerjaan offline, biaya token marjinal nol, dan autocomplete yang latensinya lebih penting daripada kualitas puncak. Ini adalah pilihan yang salah dalam situasi spesifik yang dapat dikenali — dan inilah bagian yang dilewati orang:

Pekerjaan agentik terberat masih mengalahkan Anda. Uji lapangan EPAM tahun 2026 pada aplikasi Flutter dengan 15.000 baris kode menemukan bahwa model frontier cloud (GPT-5.3-codex) masih mengungguli model lokal pada refaktorisasi multi-langkah yang paling kompleks. Jika hari Anda diisi delapan jam refaktorisasi kode lama, model lokal belum siap.

Kebutuhan konteks Anda melebihi kapasitas kartu Anda. Agen coding yang memuat seluruh repositori akan melampaui cache KV yang dapat ditampung oleh kartu 16GB. Konteks 256K dari Qwen3-Coder-30B adalah alasan model ini memenangkan kelas 24GB — kartu yang lebih kecil kalah dalam permainan ini sejak awal.

Anda tidak bisa terus-menerus mengawasi perangkat keras. Perangkat keras adalah uang sungguhan: kartu 24GB berada di kelas $700–1,600, ditambah listrik dan perawatan. Pada volume rendah, memanggil API lebih murah daripada biaya daya.

DeepSeek V4 Flash adalah buktinya. Dengan total 284B parameter, bobot 4-bit DeepSeek V4 Flash saja kira-kira 140GB — bukan model kartu konsumen, titik. Desain aktif 13B-nya justru alasan mengapa API-nya cepat dan murah dengan harga $0.15 / $0.29 per 1M token (MIT, konteks 1M). Untuk model itu, "menjalankannya secara lokal" adalah pertanyaan yang salah; intinya adalah API-nya.

Tim membutuhkan konsistensi. Jika empat insinyur masing-masing menjalankan kuantisasi berbeda dari model yang berbeda, "works on my machine" menjadi bahaya build. Endpoint API bersama memberi Anda satu target deterministik.

Jika Anda menginginkan jawaban dari sisi API untuk pertanyaan yang sama — model coding cloud mana yang menjadi default ketika opsi lokal bukan pilihan yang tepat — kami telah membahasnya secara terpisah dalam panduan best-LLM-for-coding kami, dan artikel AI-coding-agents kami membahas perangkat seperti Cline dan OpenCode yang bekerja dengan model-model lokal ini.

Cara menguji sebelum Anda membeli kartu

Cara termurah untuk memutuskan adalah menjalankan prompt Anda sendiri sebelum berkomitmen pada perangkat keras. Ollama atau LM Studio membuat ketiga pilihan berjalan dalam hitungan menit, dan tes yang paling penting adalah file-file nyata dari repositori Anda, bukan benchmark. Router layak mendapat tempatnya pada keputusan yang berdekatan: ketika Anda membandingkan kandidat lokal dengan model frontier yang dihosting, satu titik akhir memungkinkan Anda menjalankan prompt yang sama melalui keduanya tanpa repot mengatur kunci. Di OrcaRouter, DeepSeek V4 Flash dilayani dengan harga daftar penyedianya yang diteruskan tanpa perubahan — $0,15 / $0,29 per 1 juta token, markup 0% — dengan failover otomatis, yang menjadikannya tolok ukur yang murah dan jujur untuk "apakah model lokal saya benar-benar lebih baik dari API $0,15?"

Satu peringatan jujur: OrcaRouter tidak menghosting Qwen3-Coder-30B-A3B-Instruct atau gpt-oss-20b. Jika tujuan Anda sepenuhnya offline, router tidak relevan bagi Anda — self-host dan Anda selesai. Jika tujuan Anda adalah menguji A/B model open-weight yang sama melawan frontier sebelum Anda mengeluarkan biaya untuk kartu, tugas router adalah perbandingan, bukan hosting.

Intinya

VRAM Anda yang utama, kualitas model yang kedua. Pada 24GB, jalankan Qwen3-Coder-30B-A3B-Instruct — coder lokal serba-bisa terkuat, dengan konteks 256K yang dibutuhkan pekerjaan agenik. Pada 16GB, jalankan gpt-oss-20b — model langka yang cepat sekaligus sepenuhnya on-GPU. Pada 8GB, jalankan Qwen2.5-Coder-7B dan jaga konteks Anda tetap moderat. Nilailah semuanya berdasarkan kolom agenik, bukan kolom codegen, dan terimalah bahwa refactoring multi-file tersulit masih menjadi ranah cloud. Angka-angka di atas berlaku per 10 Agustus 2026 — verifikasi ulang jajaran dan daftar harga sebelum Anda mengeluarkan uang, karena lanskap ini bergerak setiap minggu.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube