
LLM cục bộ tốt nhất cho lập trình vào tháng 8 năm 2026, theo VRAM: Qwen3-Coder 30B, gpt-oss-20b, Qwen 2.5 Coder 7B
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMỚIMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 2214 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3055Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
LLM cục bộ tốt nhất cho việc viết mã vào tháng 8 năm 2026 được quyết định bởi VRAM của bạn trước bất kỳ điều gì khác. Nếu bạn có card 24GB — RTX 3090 hoặc 4090 — hãy chạy Qwen3-Coder-30B-A3B-Instruct: 30B tham số tổng cộng nhưng chỉ 3.3B kích hoạt mỗi token, cửa sổ ngữ cảnh 262,144 token, và các số liệu lập trình cục bộ toàn diện tốt nhất mà chúng tôi có thể xác minh. Trên 16GB, đó là gpt-oss-20b, mô hình Mixture-of-Experts Apache-2.0 của OpenAI, nằm gọn hoàn toàn trên GPU ở khoảng 14GB và đạt khoảng 140 token/giây. Trên 8GB, đó là Qwen2.5-Coder-7B, con ngựa thồ đáng tin cậy ở khoảng 4.7GB. Phần còn lại của trang này là lý do, các số liệu đo được, và các tình huống cụ thể mà mỗi lựa chọn trong số đó là sai.
Điều trang một làm đúng — và điều nó bỏ sót
Bảng xếp hạng cho "local LLM tốt nhất để viết mã" hiện tại là sự pha trộn giữa một bài viết thực sự hữu ích và rất nhiều bài có thế mạnh về lĩnh vực. Hướng dẫn của Tembo (ngày 5 tháng 6 năm 2026) có cấu trúc đúng — nó phân loại theo các mức 8GB / 12–16GB / 24GB và chọn ra dòng Qwen Coder — nhưng không công bố điểm benchmark cho các mô hình cục bộ, không có số liệu token mỗi giây, không có kích thước cửa sổ ngữ cảnh, và không có lựa chọn Apple Silicon theo RAM. Một bộ đánh giá trên GitHub (gauravvij/local-llm-coding-eval) có số liệu thực tế nhưng không có kết luận và chỉ chạy trên CPU. Còn lại là các bài viết quan điểm của một tác giả (XDA, Yahoo Tech) và các danh sách nông cạn (apidog, Security Boulevard, SitePoint) xếp hạng dựa trên thế mạnh lĩnh vực, chứ không phải dựa trên tính hữu ích.
Điều mà tất cả họ đều bỏ qua, theo thứ tự mức độ tốn kém đối với bạn:
• Khoảng cách tác nhân. Tạo mã không phải là kỹ năng giống như việc điều khiển một tác nhân thực hiện thay đổi trên nhiều tệp. Trang một hầu như không đề cập đến điều này; đó là sự khác biệt giữa một mô hình bạn giữ lại và một mô hình bạn gỡ cài đặt.
• Cửa sổ ngữ cảnh.Lập trình tác tử đốt token khi tải tệp và kết quả kiểm thử. Tuyên bố '30B vừa trong 24GB' là vô nghĩa cho đến khi bạn hỏi nó vừa với ngữ cảnh nào.
• Phép toán lượng tử hóa. Không ai giải thích rằng mô hình 4-bit cần dung lượng xấp xỉ số tham số tính bằng gigabyte, hoặc rằng Q3 tiết kiệm VRAM nhưng phải đánh đổi bằng những lỗi cú pháp tinh vi.
• Tốc độ đo được. Rất ít bài viết đưa ra tốc độ tokens/giây cho các mô hình họ khuyên dùng, và những bài có đưa ra thì khác biệt rất lớn vì ngữ cảnh và lượng tử hóa thay đổi mọi thứ.
• Khi local là lựa chọn sai. Một thử nghiệm thực tế năm 2026 trên ứng dụng Flutter 15.000 dòng (EPAM) vẫn cho thấy các mô hình frontier trên đám mây thắng các refactor nhiều bước khó nhất. Không bài viết dạng danh sách nào cho bạn biết khi nào nên dừng.
Phép tính VRAM mà hầu hết các bài viết dạng danh sách bỏ qua
Quy tắc ước lượng giúp mọi con số khác trong bài viết này trở nên dễ hiểu: ở mức lượng tử hóa 4-bit, một mô hình cần dung lượng xấp xỉ bằng số tham số của nó tính theo gigabyte — 7B ≈ 5GB, 30B ≈ 18GB+, chưa kể chi phí của KV-cache. Q4 là điểm tối ưu cho việc viết mã; Q3 trở xuống tiết kiệm VRAM nhưng tạo ra các lỗi cú pháp tinh vi ở mức đáng kể. Và KV-cache tăng theo cửa sổ ngữ cảnh của bạn, đó là lý do vì sao "một mô hình 30B vừa vặn trong 24GB" chỉ đúng ở một cửa sổ ngữ cảnh cụ thể mà bạn thực sự phải nêu rõ.
Kiến trúc Mixture-of-Experts thay đổi cách tính toán theo hướng quan trọng đối với hai lựa chọn lớn dưới đây. Tổng tham số quyết định dung lượng mô hình; tham số kích hoạt quyết định tốc độ. Đó là lý do vì sao Qwen3-Coder-30B-A3B (30B tổng, 3.3B kích hoạt) và gpt-oss-20b (20.9B tổng, 3.61B kích hoạt) đều có cảm giác nhanh hơn nhiều so với kích thước tệp lưu trên đĩa của chúng, và cũng là lý do vì sao DeepSeek V4 Flash — 284B tổng, 13B kích hoạt — là một lựa chọn kém để chạy cục bộ, dù API của nó rất rẻ.

VRAM 24GB: Qwen3-Coder 30B
Qwen3-Coder-30B-A3B-Instruct là mô hình viết mã cục bộ toàn diện mạnh nhất hiện nay. Được đội ngũ Qwen của Alibaba phát hành vào tháng 7 năm 2025 dưới giấy phép Apache 2.0, đây là mô hình Mixture-of-Experts với tổng cộng 30B tham số và 3.3B tham số hoạt động trên mỗi token, cửa sổ ngữ cảnh 262.144 token, và dung lượng 4-bit khoảng 17–20GB — để lại khoảng trống thực sự trên card 24GB cho bộ đệm KV mà một phiên viết mã dài cần đến.
Trên bộ kiểm thử cục bộ độc lập mà chúng tôi tin cậy nhất (gauravvij/local-llm-coding-eval, bốn mô hình chạy cục bộ qua Ollama trên CPU), qwen3-coder:30b đạt 80% tạo mã, 77% chọn công cụ và 80% độ chính xác agent — kết quả cân bằng nhất trong bốn mô hình và là mô hình duy nhất mạnh ở cả ba nhiệm vụ cùng lúc. Các bảng theo dõi bên thứ ba tổng hợp điểm SWE-bench Verified của mô hình này vào khoảng 50.3, Aider Polyglot ở 66.2 và LiveCodeBench v6 ở 58.9; hãy coi đó là các con số được tổng hợp, không phải số liệu chính thức của Alibaba — vốn là tất cả những gì Qwen đã công bố cho mô hình này.
Tốc độ đo được thay đổi rất nhiều tùy theo phần cứng. Các điểm dữ liệu hữu ích nhất: một thiết lập TurboQuant từ cộng đồng chạy nó trên RTX 3060 Ti 8GB với tốc độ sinh ~29 token/giây ở ngữ cảnh đầy đủ 262K, và benchmark oMLX đo bản dựng MLX 4-bit trên M4 Pro (48GB) đạt 73,6 token/giây ở ngữ cảnh 1K, giảm xuống còn 13,5 token/giây ở 64K. Trên card 24GB trong thiết lập Ollama thông thường, bạn nên mong đợi ở mức hàng chục token/giây, không phải hàng trăm — cái giá phải trả để chạy một trình viết mã gần ngang tầm tiên phong tại nhà.
Nói thật thì: đây không phải là mô hình viết mã cục bộ nhanh nhất, và một phiên bản mới hơn là Qwen3-Coder-Next đã ra đời, hướng tới việc sử dụng trên máy chủ và dòng lệnh (CLI) thay vì các bản cài đặt cục bộ đã lượng tử hóa. Nhưng đối với công việc tác nhân (agentic) ở quy mô repository trên một card đồ họa duy nhất, Qwen3-Coder-30B vẫn là lựa chọn tối ưu hiện tại.
16GB VRAM: gpt-oss-20b
Trên thẻ nhớ 16GB, câu trả lời là gpt-oss-20b — và kết quả không hề sát nút. Được OpenAI phát hành ngày 5 tháng 8 năm 2025 theo giấy phép Apache 2.0, đây là mô hình Mixture-of-Experts với tổng cộng 20,9B tham số và 3,61B tham số hoạt động cho mỗi token, cửa sổ ngữ cảnh 131.072 token, và bản lượng tử hóa MXFP4 gốc của nó chiếm khoảng 14GB. Đó là yếu tố quyết định: nó chạy 100% trên GPU của thẻ nhớ 16GB, không có gì tràn ra RAM hệ thống.
Lý do khiến việc chạy hoàn toàn trên GPU quan trọng hơn mọi điểm chuẩn: một mô hình vừa VRAM sẽ nhanh hơn 3–11 lần so với mô hình phải offload. Một điểm chuẩn độc lập ghi nhận 139,93 token/giây cho gpt-oss-20b trên RTX 4080 — nhanh gấp khoảng 2,8 lần một mô hình dense cùng dung lượng — và một người thử nghiệm năm 2026 chấm cho mô hình này chỉ số "trí thông minh" 52,1, gọi nó là vô đối trong phân khúc 16GB cho công việc lập trình và gỡ lỗi chuyên nghiệp. Đây là mô hình vừa khít với VRAM, vì vậy hãy chạy nó một mình và giữ ngữ cảnh ở mức khiêm tốn; chất lượng sẽ giảm ở cuối cửa sổ ngữ cảnh.
Phương án agentic thay thế trên 16GB là Devstral 24B (devstral-small-2:24b), mô hình duy nhất công bố chỉ số SWE-bench Verified trong số các mô hình lập trình cục bộ lớp 16GB — 46.8% — nhưng nó chậm, thường phải dùng CPU offload ở tốc độ ~18 token/giây. Nếu công việc của bạn là các thao tác agentic đa tệp và bạn chấp nhận được tốc độ đó, Devstral xứng đáng có vị trí của nó; còn nếu bạn muốn tốc độ lẫn mã sạch, gpt-oss-20b là lựa chọn mặc định tốt hơn. Các mô hình dense 14B — Qwen3-Coder 14B hoặc Qwen2.5-Coder 14B ở Q5 — là các phương án dự phòng thoải mái và tiết kiệm.
8GB VRAM: Qwen 2.5 Coder 7B
Với 8GB, câu trả lời trung thực là Qwen2.5-Coder-7B: 7B tham số với dung lượng ~4.7GB ở định dạng Q4_K_M, ngữ cảnh gốc 32.768 token có thể mở rộng lên tới 128K, và điểm benchmark hoàn thiện mã mạnh nhất trong phân khúc 7B. Đây là một mô hình cũ hơn — phát hành tháng 11 năm 2024 — và điều đó không sao, vì chưa có mô hình mới nào trong phạm vi 8GB vượt qua nó. Các bài kiểm tra cộng đồng cho thấy tốc độ khoảng 50 token/giây trên RTX 4060 hoặc 3070; một bài kiểm tra RTX 4060 độc lập vào tháng 3 năm 2026 đo được 28–35 token/giây, sự chênh lệch gần như hoàn toàn do cài đặt ngữ cảnh quyết định.
Trên 8GB có ba điều quan trọng mà không quan trọng ở nơi khác. Thứ nhất, giới hạn context ở mức 4–8K: KV cache mới là thứ khiến card 8GB bị OOM, không phải trọng số — một bài benchmark ghi nhận tốc độ tăng từ ~3,6 lên ~37 token/giây chỉ nhờ việc giới hạn context. Thứ hai, xác minh bằng lệnh ollama ps rằng model đang chạy 100% trên GPU; bất kỳ phần nào chạy trên CPU đều khiến tốc độ sụp đổ. Thứ ba, dùng Q4_K_M, không phải Q3 — lỗi cú pháp của Q3 khiến bạn mất nhiều hơn số VRAM tiết kiệm được.
Bước phát triển đáng chú ý trong năm 2026 là Qwen3-Coder-30B-A3B-Instructhiện có thể được nén vừa vào 8GB nhờ nén KV-cache TurboQuant — một thiết lập từ cộng đồng đo được ~7,5GB và ~29 token/giây trên RTX 3060 Ti ở ngữ cảnh đầy đủ 256K. Nó chạy được, nhưng đủ rắc rối đến mức chúng tôi không khuyên dùng làm mặc định. Nếu bạn muốn một lựa chọn mới hơn, dùng ngay được, Qwen3 8B (~5,2GB, chế độ suy luận lai) là một bước tiến nhỏ so với Qwen2.5-Coder-7B về suy luận tổng quát, trong khi vẫn hơi tụt lại phía sau về code thuần túy.

Còn Apple Silicon thì sao?
Bộ nhớ hợp nhất thay đổi cách tính toán theo một hướng: dung lượng tăng lên, tốc độ sinh token giảm xuống. M4 Pro 48GB có thể chứa các mô hình mà card Windows 16GB không thể, nhưng nó sinh token chậm hơn nhiều ở ngữ cảnh dài. Các con số chúng ta có: bản dựng MLX 4-bit của Qwen3-Coder-30B-A3B-Instruct dùng 16.6GB ở ngữ cảnh 1K và 25.5GB ở 64K trên M4 Pro, với tốc độ sinh giảm từ 73.6 token/giây xuống còn 13.5 khi ngữ cảnh tăng lên (điểm chuẩn oMLX). gpt-oss-20b nằm gọn trong 16GB bộ nhớ hợp nhất và là một lựa chọn Mac tốt. Nếu bạn muốn đa phương thức trên Apple Silicon, Gemma 4 12B chạy trong khoảng 16GB bộ nhớ hợp nhất với ngữ cảnh 256K — lựa chọn cục bộ mạnh nhất nếu công việc lập trình của bạn nằm cạnh các tài liệu nặng về hình ảnh.
Các con số độc lập: codegen không phải là kỹ năng quan trọng
Dữ liệu rõ ràng nhất mà chúng tôi tìm thấy là một benchmark cục bộ duy nhất đáng trích dẫn toàn bộ. gauravvij/local-llm-coding-eval đã chạy bốn mô hình cục bộ qua Ollama, trên CPU, không dùng cloud — sinh mã, gọi hàm, và một tác vụ agent đa bước — với kết quả đi ngược lại trực giác "số codegen lớn hơn thì thắng":
• Qwen3.6 27B (qwen3.6:27b, dense, ~17GB): 80.0% tạo mã, 84.6% công cụ, 100% tác tử — lựa chọn toàn diện nhất.
• Qwen3.6 35B A3B (qwen3.6:35b-a3b, MoE, ~18GB): 70.0% sinh mã, 84.6% công cụ, 100% tác nhân.
• Qwen3-Coder-30B-A3B-Instruct (qwen3-coder:30b, MoE, ~17GB): 80,0% sinh mã, 76,9% công cụ, 80% tác nhân — cân bằng nhất.
• DeepSeek-Coder-V2 33B (deepseek-coder:33b, dense, ~18GB): 90.0% codegen — tốt nhất trong bốn — nhưng 10% agent, xếp cuối trong các tác vụ đa bước.
Câu cuối cùng đó chính là toàn bộ bài học. Một mô hình đứng đầu về tạo mã thuần túy nhưng lại thất bại trong các tác vụ agent chính là mô hình bạn sẽ gỡ cài đặt ngay sau vòng lặp đầu tiên "đọc tệp này, sửa hàm này, chạy thử nghiệm". Hãy đánh giá một lập trình viên cục bộ dựa trên cột agentic, không phải cột codegen.

Khi chạy cục bộ là quyết định sai.
Local-first là lựa chọn mặc định đúng đắn{{1}} cho quyền riêng tư, làm việc ngoại tuyến, chi phí token cận biên bằng không{{/1}}, và{{2}} tính năng tự động hoàn thành nơi độ trễ quan trọng hơn chất lượng tối đa{{/2}}. Đây là lựa chọn sai{{3}} trong những tình huống cụ thể, dễ nhận biết{{/3}} — và đây là phần mà ai cũng bỏ qua:{{4}}{{5}}{{/5}}{{/4}}
• Công việc agent khó nhất vẫn đánh bại bạn. Thử nghiệm thực tế năm 2026 của EPAM trên một ứng dụng Flutter 15.000 dòng mã cho thấy các mô hình frontier trên đám mây (GPT-5.3-codex) vẫn vượt trội hơn các mô hình cục bộ trong những lần tái cấu trúc đa bước phức tạp nhất. Nếu ngày làm việc của bạn là tám giờ tái cấu trúc mã kế thừa, thì mô hình cục bộ chưa sẵn sàng.
• Nhu cầu ngữ cảnh của bạn vượt quá khả năng của card. Một agent lập trình tải toàn bộ repo sẽ vượt xa bộ đệm KV mà một card 16GB có thể chứa. Ngữ cảnh 256K của Qwen3-Coder-30B là lý do nó thắng ở phân khúc 24GB — các card nhỏ hơn sẽ thua cuộc từ sớm.
• Bạn không thể trông chừng phần cứng. Phần cứng chính là tiền thật: một thẻ 24GB thuộc phân khúc $700–1,600, cộng thêm điện năng và bảo trì. Khi khối lượng thấp, gọi API rẻ hơn chi phí điện năng tiêu thụ.
• DeepSeek V4 Flash chính là minh chứng. Với tổng cộng 284B tham số, riêng trọng số 4-bit của DeepSeek V4 Flash đã khoảng 140GB — không phải mô hình dành cho card đồ họa tiêu dùng, chấm hết. Thiết kế 13B-active chính là lý do API của nó nhanh và rẻ, chỉ $0.15 / $0.29 cho mỗi 1M token (MIT, ngữ cảnh 1M). Với mô hình đó, “chạy cục bộ” là câu hỏi sai; API mới là điểm mấu chốt.
• Các đội cần sự nhất quán. Nếu bốn kỹ sư mỗi người chạy một lượng tử hóa khác nhau của một mô hình khác nhau, "chạy trên máy của tôi" trở thành một mối nguy khi build. Các endpoint API dùng chung cho bạn một mục tiêu xác định.
Nếu bạn muốn câu trả lời từ phía API cho cùng câu hỏi này — mô hình viết mã đám mây nào là mặc định khi mô hình cục bộ không phải là lựa chọn phù hợp — chúng tôi đã đề cập riêng trong hướng dẫn best-LLM-for-coding của mình, và bài viết AI-coding-agents của chúng tôi đề cập đến các bộ công cụ như Cline và OpenCode hoạt động với các mô hình cục bộ này.
Cách kiểm tra trước khi mua thẻ
Cách rẻ nhất để quyết định là tự chạy các prompt của bạn trước khi đầu tư vào phần cứng. Ollama hoặc LM Studio có thể khiến bất kỳ lựa chọn nào trong ba lựa chọn chạy được chỉ trong vài phút, và bài kiểm tra thực sự có ý nghĩa là các tệp thật trong repo của bạn, chứ không phải một benchmark. Một router xứng đáng có vị trí trong quyết định liền kề: khi bạn so sánh một ứng viên cục bộ với các mô hình frontier được lưu trữ, một endpoint duy nhất cho phép bạn chạy cùng một prompt qua cả hai mà không cần xoay xở với các khóa. Trên OrcaRouter, DeepSeek V4 Flash được phục vụ với giá niêm yết của nhà cung cấp, chuyển qua nguyên vẹn — $0,15 / $0,29 mỗi 1 triệu token, 0% phụ phí — kèm tự động chuyển đổi dự phòng, khiến nó trở thành thước đo rẻ và trung thực cho câu hỏi "mô hình cục bộ của tôi có thực sự tốt hơn API $0,15 không?"
Một lưu ý thành thật: OrcaRouter không lưu trữ Qwen3-Coder-30B-A3B-Instruct hay gpt-oss-20b. Nếu mục tiêu của bạn hoàn toàn là ngoại tuyến, router không liên quan gì đến bạn — tự lưu trữ là xong. Nếu mục tiêu của bạn là so sánh A/B cùng một mô hình trọng số mở với các mô hình tiên tiến nhất trước khi bạn chi tiền cho một card, việc của router là so sánh, không phải lưu trữ.
Điểm mấu chốt
VRAM của bạn quyết định trước tiên, chất lượng mô hình chỉ đứng thứ hai. Với 24GB, hãy chạy Qwen3-Coder-30B-A3B-Instruct — mô hình mã nguồn cục bộ toàn diện mạnh nhất, với ngữ cảnh 256K mà các tác vụ agentic cần. Với 16GB, hãy chạy gpt-oss-20b — mô hình hiếm hoi vừa nhanh vừa chạy hoàn toàn trên GPU. Với 8GB, hãy chạy Qwen2.5-Coder-7B và giữ ngữ cảnh của bạn ở mức vừa phải. Đánh giá bất kỳ mô hình nào trong số đó theo cột agentic, không phải cột codegen, và chấp nhận rằng việc tái cấu trúc đa tệp khó nhất vẫn thuộc về đám mây. Các con số trên là hiện hành tính đến ngày 10 tháng 8 năm 2026 — hãy kiểm tra lại danh sách và giá niêm yết trước khi chi tiền, vì lĩnh vực này thay đổi hàng tuần.
