흰색 배경에 파란색과 청록색 그라데이션 악센트가 있고 오른쪽 하단에는 OrcaRouter 로고가 합성되어 있다. 제목 카드에는 '2026년 8월 최고의 로컬 LLM'이라는 제목과 'VRAM별: Qwen3-Coder 30B (24GB) · gpt-oss-20b (16GB) · Qwen 2.5 Coder 7B (8GB)'라는 부제가 있다. 또한 세 개의 타일에는 '24GB Qwen3-Coder 30B A3B, 가장 강력한 만능 로컬 코더, 256K 컨텍스트', '16GB gpt-oss-20b, 약 140 tok/s, 완전 GPU 구동, Apache 2.0', '8GB Qwen 2.5 Coder 7B, 믿음직한 워크호스, Q4에서 약 4.7GB'라고 표시되어 있다.
Guides & Insights

2026년 8월 최고의 코딩용 로컬 LLM, VRAM별: Qwen3-Coder 30B, gpt-oss-20b, Qwen 2.5 Coder 7B

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 8월 최고의 로컬 코딩 LLM은 무엇보다 먼저 여러분의 VRAM에 의해 결정됩니다. 24GB 카드(RTX 3090 또는 4090)가 있다면 실행하세요 Qwen3-Coder-30B-A3B-Instruct: 총 300억 개의 파라미터 중 토큰당 33억 개만 활성화되며, 262,144토큰의 컨텍스트 창과 저희가 검증할 수 있는 최고의 종합 로컬 코딩 성능 수치를 제공합니다. 16GB에서는 gpt-oss-20b, O​penAI의 Apache-2.0 Mixture-of-Experts 모델로서 약 14GB로 GPU에 완전히 들어가며 초당 약 140토큰의 속도를 냅니다. 8GB에서는 Qwen2.5-Coder-7B, 약 4.7GB로 안정적인 워크호스입니다. 이 페이지의 나머지 부분에서는 그 이유, 측정된 수치, 그리고 각 선택이 틀리는 특정 상황을 설명합니다.

첫 페이지가 제대로 하는 것 — 그리고 건너뛰는 것

지금 "코딩용 최고의 로컬 LLM" 순위는 진짜 유용한 하나와 많은 도메인 파워가 섞여 있다. Tembo의 가이드(2026년 6월 5일)는 형태는 잘 잡았다 — 8GB / 12–16GB / 24GB 계층으로 구성하고 Qwen Coder 제품군에 도달한다 — 그러나 로컬 모델에 대한 벤치마크 점수, 초당 토큰 수치, 컨텍스트 창 크기, RAM별 Apple Silicon 선택지를 게시하지 않는다. GitHub eval 하네스(gauravvij/local-llm-coding-eval)는 실제 수치가 있지만 결론이 없고 CPU에서만 실행되었다. 나머지는 단일 저자 의견 글(XDA, Yahoo Tech)과 얇은 목록형 글(apidog, Security Boulevard, SitePoint)로, 도메인 파워로 순위를 매기지 유용함으로 매기지 않는다.

그들이 모두 건너뛰는 것, 당신에게 비용이 많이 드는 순서대로:

에이전트 격차. 코드 생성은 에이전트가 여러 파일에 걸친 변경을 수행하도록 이끄는 것과 같은 능력이 아닙니다. 첫 페이지에서는 이를 거의 언급하지 않습니다. 이것이 유지할 모델과 삭제할 모델을 구분 짓는 차이입니다.

컨텍스트 윈도우. 에이전트 코딩은 파일과 테스트 출력을 로드하면서 토큰을 소모한다. "30B가 24GB에 들어맞는다"는 주장은 어떤 컨텍스트에서 맞는지 물어보기 전에는 의미가 없다.

양자화 수학. 아무도 4비트가 대략 파라미터 수만큼의 기가바이트를 필요로 한다거나, Q3가 미묘한 구문 오류를 대가로 VRAM을 확보한다는 것을 설명하지 않는다.

측정 속도. 추천하는 모델에 대한 tokens/sec를 명시하는 자료는 거의 없으며, 명시하는 자료들도 컨텍스트와 양자화가 모든 것을 바꾸기 때문에 수치가 크게 엇갈립니다.

로컬이 잘못된 선택일 때. 2026년 15,000줄 규모의 Flutter 앱(EPAM) 필드 테스트는 여전히 가장 어려운 다단계 리팩터링에서 클라우드 프론티어 모델이 승리하고 있음을 보여줍니다. 그 어떤 목록형 기사도 언제 멈춰야 하는지 알려주지 않습니다.

대부분의 리스트클이 건너뛰는 VRAM 계산

이 글의 다른 모든 숫자를 읽기 쉽게 만드는 경험칙: 4비트 양자화에서 모델은 대략 파라미터 수만큼의 기가바이트를 필요로 한다 — 7B ≈ 5GB, 30B ≈ 18GB+, KV-캐시 오버헤드 이전 기준이다. Q4는 코딩에 가장 적합한 지점이며, Q3 이하는 VRAM을 절약하지만 측정 가능할 정도로 미묘한 구문 오류를 유발한다. 그리고 KV 캐시는 컨텍스트 창에 따라 커지기 때문에, "30B가 24GB에 들어간다"는 말은 실제로 명시해야 하는 컨텍스트에서만 성립한다.

Mixture-of-Experts는 아래 두 가지 주요 선택에 중요한 영향을 미치는 방식으로 계산을 바꿉니다. 총 파라미터는 차지하는 용량을 결정하고, 활성 파라미터는 속도를 결정합니다. 이것이 바로 Qwen3-Coder-30B-A3B(총 30B, 활성 3.3B)와 gpt-oss-20b(총 20.9B, 활성 3.61B)가 둘 다 디스크 크기가 암시하는 것보다 훨씬 빠르게 느껴지고, DeepSeek V4 Flash(총 284B, 활성 13B)가 API가 저렴함에도 불구하고 로컬 구동에는 부적합한 이유입니다.

Card titled 'The VRAM math most listicles skip' with a rule box reading 'At 4-bit, a model needs roughly its parameter count in gigabytes, plus KV cache for your context window'. Three columns: 'Qwen3-Coder 30B' FP16 ~61GB, Q8 ~30GB, Q4 ~17-20GB, KV cache at 256K several GB extra; 'gpt-oss-20b' FP16 ~40GB, Q8 ~21GB, MXFP4 ~14GB, KV cache at 128K fits 16GB only at modest context; 'Qwen 2.5 Coder 7B' FP16 ~14GB, Q8 ~7GB, Q4 ~4.7GB, KV cache at 32K fits 8GB with headroom. A warning bar reads 'Q3 and below save VRAM but measurably introduce subtle syntax errors in code — Q4 is the coding sweet spot. MoE changes the math: total parameters set the footprint, active parameters set the speed.' with the OrcaRouter logo composited bottom-right.

24GB VRAM: Qwen3-Coder 30B

Qwen3-Coder-30B-A3B-Instruct는 현재 우리가 지목할 수 있는 가장 강력한 만능 로컬 코더입니다. 2025년 7월 Alibaba의 Qwen 팀이 Apache 2.0으로 출시한 이 모델은 총 30B 파라미터와 토큰당 3.3B 활성 파라미터를 가진 Mixture-of-Experts 모델로, 262,144 토큰의 컨텍스트 창과 약 17~20GB의 4비트 용량을 갖추고 있습니다. 이는 긴 코딩 세션에 필요한 KV 캐시를 위해 24GB 카드에 충분한 여유를 남겨줍니다.

우리가 가장 신뢰하는 독립 로컬 하네스(gauravvij/local-llm-coding-eval, Ollama를 통해 CPU에서 로컬로 실행된 4개 모델)에서 qwen3-coder:30b는 코드 생성 80%, 도구 선택 77%, 에이전트 정확도 80%를 기록했습니다. 이는 4개 중 가장 균형 잡힌 결과이며, 세 가지 작업 모두에서 강점을 보인 유일한 모델입니다. 제3자 트래커에 따르면 SWE-bench Verified는 약 50.3, Aider Polyglot은 66.2, LiveCodeBench v6은 58.9로 집계됩니다. 이는 컴파일된 수치로 간주해야 하며, Alibaba가 이 모델에 대해 공식 발표한 숫자가 아닙니다. 현재 Qwen이 이 모델에 대해 공개한 것은 그 공식 수치뿐입니다.

측정 속도는 하드웨어에 따라 크게 다릅니다. 가장 유용한 데이터 포인트는 다음과 같습니다: 커뮤니티의 TurboQuant 설정은 8GB RTX 3060 Ti에서 전체 262K 컨텍스트로 실행할 때 약 29 tokens/sec의 생성 속도를 보여줬고, oMLX 벤치마크에서는 M4 Pro(48GB)에서 4-bit MLX 빌드를 측정한 결과 1K 컨텍스트에서 73.6 tokens/sec, 64K에서는 13.5 tokens/sec까지 떨어졌습니다. 일반적인 Ollama 설정에서 24GB 카드를 사용한다면 초당 수백 개가 아닌 수십 개 수준의 토큰 속도를 기대해야 합니다. 이것이 프런티어에 준하는 코더 모델을 집에서 실행하기 위한 대가입니다.

솔직한 경고: 이것은 가장 빠른 로컬 코더는 아니며, 더 새로운 Qwen3-Coder-Next가 양자화된 로컬 설치보다는 호스팅 및 CLI 사용을 겨냥해 존재한다. 하지만 단일 카드에서 에이전틱한 레포 규모 작업에는 오늘날 Qwen3-Coder-30B가 선택이다.

16GB VRAM: gpt-oss-20b

16GB 카드에서의 답은 gpt-oss-20b입니다. —그리고 그건 압도적입니다. 2025년 8월 5일 OpenAI가 Apache 2.0 라이선스로 공개한 이 모델은 Mixture-of-Experts 모델로, 총 209억 개의 파라미터와 토큰당 36.1억 개의 활성 파라미터, 131,072 토큰의 컨텍스트 창을 갖추고 있으며, 기본 MXFP4 양자화 크기는 약 14GB입니다. 이것이 결정적인 사실입니다. 16GB 카드에서 시스템 RAM으로 넘치지 않고 100% GPU에서 실행됩니다.

GPU 상주가 어떤 벤치마크보다 중요한 이유: VRAM에 맞는 모델은 오프로드하는 모델보다 3~11배 빠르다. 독립 벤치마크에서 RTX 4080에서 gpt-oss-20b가 초당 139.93토큰을 기록했는데, 이는 동일한 메모리 사용량에서 dense 대안 모델보다 약 2.8배 빠른 수치다. 또한 2026년 한 테스터의 평가에서 52.1의 '지능 지수'를 받았으며, 전문적인 코딩 및 디버깅 분야에서 16GB 클래스 중 비교할 수 없는 성능이라고 평가했다. 메모리에 빡빡하게 맞으므로 단독으로 실행하고 컨텍스트 길이를 적당히 유지해야 한다. 컨텍스트 창의 상한 부근에서는 품질이 저하된다.

16GB에서의 에이전틱 대안은 Devstral 24B(devstral-small-2:24b)입니다. 이 모델은 16GB급 로컬 코딩 모델 중 유일하게 공개된 SWE-bench Verified 수치인 46.8%를 기록했지만, 속도가 느려 ~18 tokens/sec 수준이며 종종 CPU 오프로드가 필요합니다. 작업이 여러 파일에 걸친 에이전틱 편집이고 속도 저하를 감수할 수 있다면, Devstral은 그 자리를 차지할 만합니다. 속도와 깔끔한 코드를 원한다면, gpt-oss-20b가 더 나은 기본 선택입니다. 덴스 14B 모델(Q5로 양자화한 Qwen3-Coder 14B 또는 Qwen2.5-Coder 14B)은 부담 없이 쓸 수 있는 저렴한 차선책입니다.

8GB VRAM: Qwen 2.5 Coder 7B

8GB에서, 솔직한 답변은 Qwen2.5-Coder-7B: Q4_K_M 기준 약 4.7GB의 7B 매개변수, 128K까지 확장 가능한 32,768 토큰의 네이티브 컨텍스트, 그리고 7B 클래스에서 가장 높은 코드 완성 벤치마크 점수를 제공합니다. 이 모델은 2024년 11월에 출시된 구형 모델이지만, 8GB 범위에서 더 새로운 모델 중 이를 능가한 것이 없으므로 괜찮습니다. 커뮤니티 테스트에서는 RTX 4060 또는 3070에서 약 50 tokens/sec로 측정되었으며, 2026년 3월의 독립 RTX 4060 테스트에서는 28–35 tokens/sec로 측정되어 이 차이는 거의 전적으로 컨텍스트 설정에 의해 결정됩니다.

8GB에서는 중요하지만 다른 환경에서는 해당되지 않는 세 가지가 있습니다. 첫째, 컨텍스트를 4–8K로 제한하세요. 8GB 카드에서 OOM을 유발하는 것은 가중치가 아니라 KV 캐시입니다. 한 벤치마크에서는 컨텍스트 제한만으로 속도가 ~3.6에서 ~37 tokens/sec로 뛰는 것을 확인했습니다. 둘째, ollama ps로 모델이 100% GPU에 올라와 있는지 확인하세요. CPU에 조금이라도 할당되면 속도가 붕괴됩니다. 셋째, Q3가 아닌 Q4_K_M을 사용하세요. Q3의 구문 오류는 VRAM 절약보다 더 큰 비용을 초래합니다.

2026년의 주목할 만한 발전은 Qwen3-Coder-30B-A3B-Instruct가 이제 TurboQuant KV-cache 압축을 통해 8GB에 들어갈 수 있게 된 것입니다. 커뮤니티에서 만든 구성에서는 RTX 3060 Ti 기준 전체 256K 컨텍스트에서 약 7.5GB와 약 29 tokens/sec가 측정되었습니다. 작동은 하지만, 기본값으로 설정하기에는 너무 까다로워 권장하지 않습니다. 더 새로운 즉시 사용 가능한 옵션을 원한다면, Qwen3 8B(약 5.2GB, 하이브리드 사고 모드)는 일반 추론에서 Qwen2.5-Coder-7B보다 약간 앞서지만 순수 코드에서는 약간 뒤처집니다.

Scoreboard card titled 'Three picks, three VRAM tiers' with three columns. Left '24GB · Qwen3-Coder 30B': VRAM at 4-bit ~19GB Q4_K_M, Context 262,144 tokens, Speed measured ~29 t/s tight 8GB run; 50-90 t/s on 24GB, Released Jul 2025, License Apache 2.0, Best for agentic repo-scale work. Middle '16GB · gpt-oss-20b': VRAM ~14GB MXFP4, Context 131,072 tokens, Speed ~140 t/s RTX 4080, Released Aug 5 2025, License Apache 2.0, Best for speed plus clean code. Right '8GB · Qwen 2.5 Coder 7B': VRAM ~4.7GB Q4_K_M, Context 32,768 native (128K via YaRN), Speed ~50 t/s RTX 4060/3070, Released Nov 2024, License Apache 2.0, Best for autocomplete, offline, privacy. Footer reads 'Speeds are third-party measurements; all figures read Aug 10 2026.' with the OrcaRouter logo composited bottom-right.

Apple Silicon은 어떤가요?

통합 메모리는 용량은 늘고 생성 속도는 줄어드는 방향으로 계산의 균형을 바꾼다. 48GB M4 Pro는 16GB Windows 카드로는 담을 수 없는 모델을 실행할 수 있지만, 긴 컨텍스트에서는 토큰 생성이 훨씬 느리다. 수치를 보면: M4 Pro에서 Qwen3-Coder-30B-A3B-Instruct의 4비트 MLX 빌드는 1K 컨텍스트에서 16.6GB, 64K에서 25.5GB를 사용했고, 컨텍스트가 길어질수록 생성 속도는 73.6 tokens/sec에서 13.5로 떨어졌다(oMLX 벤치마크). gpt-oss-20b는 16GB 통합 메모리에 여유 있게 맞으며 Mac에서 좋은 선택이다. Apple Silicon에서 멀티모달을 원한다면, Gemma 4 12B는 약 16GB 통합 메모리와 256K 컨텍스트로 실행되며 — 이미지가 많은 문서와 함께 코딩 작업을 한다면 가장 강력한 로컬 옵션이다.

독립적인 숫자들: 코드 생성은 중요한 기술이 아니다

우리가 찾은 가장 명확한 데이터는 전체를 인용할 가치가 있는 단일 로컬 벤치마크입니다. gauravvij/local-llm-coding-eval은 Ollama를 통해 CPU에서, 클라우드 없이 로컬로 네 개의 모델을 실행했습니다 — 코드 생성, 함수 호출, 다단계 에이전트 작업 — 그리고 그 결과는 "더 큰 코드 생성 수치가 이긴다"는 직관에 반하는 것이었습니다.

Qwen3.6 27B (qwen3.6:27b, dense, ~17GB): 코드 생성 80.0%, 도구 84.6%, 에이전트 100% — 최고의 올라운더입니다.

Qwen3.6 35B A3B (qwen3.6:35b-a3b, MoE, ~18GB): 코드 생성 70.0%, 도구 84.6%, 에이전트 100%.

Qwen3-Coder-30B-A3B-Instruct (qwen3-coder:30b, MoE, ~17GB): 코드 생성 80.0%, 도구 76.9%, 에이전트 80% — 가장 균형 잡힌 모델.

DeepSeek-Coder-V2 33B (deepseek-coder:33b, 밀집, ~18GB): 코드 생성 90.0% — 네 가지 중 최고 — 하지만 에이전트 10%, 다단계 작업에서는 꼴찌.

그 마지막 줄이 교훈의 전부다. 순수 코드 생성에서는 최고지만 에이전트 작업에서는 무너지는 모델은 첫 번째 "이 파일을 읽고, 이 함수를 바꾸고, 테스트를 실행" 루프 후에 삭제하게 될 모델이다. 로컬 코더는 코드 생성 열이 아니라 에이전트 열로 판단하라.

Benchmark card titled 'The independent local benchmark — agentic skill is the real gap' with four columns. 'qwen3.6:27b dense ~17GB': Codegen 80.0%, Tools 84.6%, Agent 100%. 'qwen3.6:35b-a3b MoE ~18GB': Codegen 70.0%, Tools 84.6%, Agent 100%. 'qwen3-coder:30b MoE ~17GB': Codegen 80.0%, Tools 76.9%, Agent 80%. 'deepseek-coder:33b dense ~18GB': Codegen 90.0%, Tools 84.6%, Agent 10%. Footer reads 'deepseek-coder:33b tops codegen yet collapses on agent tasks — codegen alone overrates a local coder. All four ran locally via Ollama, CPU-only, no cloud (gauravvij/local-llm-coding-eval, GitHub). On a 15k-LOC refactor, cloud frontier still wins (EPAM field test, 2026).' with the OrcaRouter logo composited bottom-right.

로컬에서 실행하는 것이 잘못된 선택일 때

Local-first는 프라이버시, 오프라인 작업, 한계 토큰 비용 0, 그리고 지연 시간이 최고 품질보다 중요한 자동 완성에 있어 올바른 기본값입니다. 그러나 특정하고 인식 가능한 상황에서는 잘못된 선택입니다 — 그리고 이 부분이 바로 1페이지가 건너뛰는 섹션입니다:

가장 어려운 에이전트 작업은 여전히 당신을 압도합니다. EPAM이 2026년에 15,000줄 규모의 Flutter 앱에 대해 실시한 필드 테스트에 따르면, 클라우드 프런티어 모델(GPT-5.3-codex)은 가장 복잡한 다단계 리팩터링에서 여전히 로컬 모델을 능가하는 것으로 나타났습니다. 하루 종일 레거시 코드를 8시간 동안 리팩터링한다면, 로컬 모델은 아직 준비되지 않았습니다.

컨텍스트 요구량이 카드 용량을 초과합니다. 전체 리포지토리를 로드하는 코딩 에이전트는 16GB 카드가 담을 수 있는 KV 캐시를 훨씬 초과합니다. Qwen3-Coder-30B의 256K 컨텍스트가 24GB 등급에서 승리하는 이유입니다 — 더 작은 카드는 이 게임에서 일찍 패배합니다.

하드웨어를 돌볼 수는 없습니다. 하드웨어는 실제 자금이 들어갑니다: 24GB 카드는 700~1,600달러 등급이며, 전기와 유지보수 비용이 추가됩니다. 소량 사용 시에는 API 호출이 전력 소모보다 저렴합니다.

DeepSeek V4 Flash가 그 증거입니다. 총 284B 파라미터를 가진 DeepSeek V4 Flash는 4비트 가중치만 해도 약 140GB입니다. 소비자용 카드로는 절대 돌릴 수 없는 모델입니다. 13B 활성 파라미터 설계 덕분에 API가 1M 토큰당 $0.15 / $0.29 (MIT, 1M 컨텍스트)로 빠르고 저렴합니다. 그 모델에게 "로컬에서 실행"은 잘못된 질문이며, API가 핵심입니다.

팀에는 일관성이 필요합니다.네 명의 엔지니어가 각자 다른 모델의 다른 양자화를 실행한다면, "내 컴퓨터에서는 작동한다"는 빌드 위험이 됩니다. 공유 API 엔드포인트는 결정적인 단일 대상을 제공합니다.

로컬이 적절한 선택이 아닐 때 기본이 되는 클라우드 코딩 모델이 무엇인지에 대한 API 측면의 답변을 원한다면, 우리는 그것을 최고의 LLM 코딩 가이드에서 별도로 다루었으며, AI 코딩 에이전트에 대한 글에서는 이러한 로컬 모델과 함께 작동하는 Cline과 OpenCode 같은 하네스를 다룹니다.

카드를 구매하기 전에 테스트하는 방법

하드웨어 구매를 결정하기 전에 직접 프롬프트를 실행해 보는 것이 가장 저렴한 방법입니다. Ollama나 LM Studio를 사용하면 세 가지 후보 중 어떤 것이든 몇 분 안에 실행해 볼 수 있으며, 중요한 테스트는 벤치마크가 아니라 저장소의 실제 파일입니다. 라우터는 그다음 결정에서 가치를 발휘합니다. 로컬 후보와 호스팅된 프런티어 모델을 비교할 때, 하나의 엔드포인트로 키를 번갈아 관리하지 않고도 동일한 프롬프트를 양쪽에서 실행할 수 있습니다. OrcaRouter에서 DeepSeek V4 Flash는 공급업체 목록 가격 그대로 전달되며 — 100만 토큰당 $0.15 / $0.29, 마크업 0% — 자동 장애 조치를 지원합니다. 따라서 "내 로컬 모델이 실제로 $0.15 API보다 나은가?"를 판단하는 저렴하고 정직한 기준이 됩니다.

{{1}}솔직한 경고 하나: OrcaRouter는 Qwen3-Coder-30B-A3B-Instruct나 gpt-oss-20b를 호스팅하지 않습니다.{{/1}} {{2}}목표가 완전히 오프라인이라면 라우터는 당신에게 무의미합니다 — 직접 호스팅하면 끝입니다.{{/2}} {{3}}카드에 비용을 쓰기 전에 동일한 오픈웨이트 모델을 프론티어 모델과 A/B 비교하려는 것이 목표라면, 라우터의 역할은 호스팅이 아니라 비교입니다.{{/3}}

요점

VRAM이 먼저 결정하고, 그다음이 모델 품질입니다. 24GB에서는 {{1}}Qwen3-Coder-30B-A3B-Instruct{{/1}}를 실행하세요. 에이전트 작업에 필요한 256K 컨텍스트를 갖춘 가장 강력한 만능 로컬 코더입니다. 16GB에서는 {{2}}gpt-oss-20b{{/2}}를 실행하세요. 빠르면서도 완전히 GPU에서 실행되는 드문 모델입니다. 8GB에서는 {{3}}Qwen2.5-Coder-7B{{/3}}를 실행하고 컨텍스트는 적당히 유지하세요. 이 중 어떤 모델을 평가할 때든 codegen 항목이 아닌 agentic 항목 기준으로 판단하고, 가장 어려운 다중 파일 리팩토링은 여전히 클라우드의 몫임을 인정하세요. 위 수치는 2026년 8월 10일 기준이며, 이 분야는 매주 변하므로 지출 전에 라인업과 공시 가격을 다시 확인하세요.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube