
Лучшая локальная LLM для программирования в августе 2026 года, по объему VRAM: Qwen3-Coder 30B, gpt-oss-20b, Qwen 2.5 Coder 7B
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxНОВИНКАMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 2214 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3055Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
Лучшая локальная LLM для программирования в августе 2026 года определяется прежде всего вашей VRAM. Если у вас карта на 24 ГБ — RTX 3090 или 4090 — запускайте Qwen3-Coder-30B-A3B-Instruct: 30B параметров всего, но только 3.3B активны на токен, контекстное окно на 262 144 токена и лучшие универсальные показатели локального кодинга, которые мы можем проверить. На 16 ГБ это gpt-oss-20b, модель Mixture-of-Experts от OpenAI под лицензией Apache-2.0, которая полностью помещается в GPU при ~14 ГБ и выдаёт около 140 токенов/сек. На 8 ГБ это Qwen2.5-Coder-7B, надёжная рабочая лошадка при ~4.7 ГБ. Остальная часть этой страницы — обоснование, измеренные показатели и конкретные ситуации, в которых каждый из этих выборов оказывается неверным.
Что первая страница делает правильно — и что она пропускает
Рейтинг «лучшая локальная LLM для программирования» на данный момент — это смесь одного действительно полезного материала и множества сайтов с сильным доменным авторитетом. Гайд Tembo (5 июня 2026 года) задаёт правильную структуру — он распределяет модели по категориям 8 ГБ / 12–16 ГБ / 24 ГБ и останавливается на семействе Qwen Coder — но не публикует ни результатов бенчмарков для локальных моделей, ни показателей токенов в секунду, ни размеров контекстного окна, ни подборок для Apple Silicon в зависимости от объёма RAM. Оценочный стенд на GitHub (gauravvij/local-llm-coding-eval) содержит реальные цифры, но без вердикта и работал только на CPU. Остальное — авторские мнения в одном лице (XDA, Yahoo Tech) и поверхностные списки (apidog, Security Boulevard, SitePoint), которые ранжируют по доменному авторитету, а не по полезности.
Что они все пропускают, в порядке того, сколько это вам стоит:
• Агентный разрыв. Генерация кода — это не то же самое, что управлять агентом при внесении изменений в несколько файлов. На первой странице об этом едва упоминается; это разница между моделью, которую вы оставляете, и моделью, которую удаляете.
• Контекстные окна. Агентное программирование сжигает токены на загрузку файлов и вывод тестов. Утверждение «30B помещается в 24GB» бессмысленно, пока не уточнишь, при каком контексте.
• Математика квантования. Никто не объясняет, что 4-бит требует примерно столько гигабайт, сколько параметров, или что Q3 экономит VRAM ценой едва заметных синтаксических ошибок.
• Измеренная скорость. Немногие публикации приводят токены/сек для рекомендуемых моделей, а те, что приводят, сильно расходятся, потому что контекст и квантование меняют всё.
• Когда локальный подход — неверный выбор. Полевое тестирование 2026 года на Flutter-приложении из 15 000 строк (EPAM) по-прежнему показывает, что облачные фронтирные модели побеждают в самых сложных многошаговых рефакторингах. Ни один из листиклов не подскажет вам, когда остановиться.
Математика VRAM, которую большинство листиклов пропускают
Эмпирическое правило, благодаря которому все остальные цифры в этой статье становятся понятными: при 4-битном квантовании модели требуется примерно столько гигабайт, сколько у неё параметров — 7B ≈ 5 ГБ, 30B ≈ 18 ГБ+ до учёта накладных расходов KV-кэша. Q4 — оптимальная точка для программирования; Q3 и ниже экономят видеопамять, но ощутимо вносят тонкие синтаксические ошибки. А KV-кэш растёт вместе с вашим контекстным окном, поэтому утверждение «30B помещается в 24 ГБ» верно только при том контексте, который вам ещё предстоит указать.
Mixture-of-Experts меняет математику так, что это важно для двух крупных вариантов ниже. Общее количество параметров определяет занимаемое место; активные параметры определяют скорость. Именно поэтому Qwen3-Coder-30B-A3B (30B всего, 3.3B активных) и gpt-oss-20b (20.9B всего, 3.61B активных) оба ощущаются гораздо быстрее, чем можно предположить по их размеру на диске, и поэтому DeepSeek V4 Flash — 284B всего, 13B активных — плохо подходит для локального запуска, даже несмотря на то, что его API дёшев.

24 ГБ видеопамяти: Qwen3-Coder 30B
Qwen3-Coder-30B-A3B-Instruct — самый сильный универсальный локальный кодер из доступных на данный момент. Выпущенная в июле 2025 года командой Qwen из Alibaba под лицензией Apache 2.0, она представляет собой модель Mixture-of-Experts с 30B суммарных параметров и 3.3B активных на токен, окном контекста на 262 144 токена, а также размером примерно 17–20 ГБ в 4-битной квантизации — что оставляет реальный запас на видеокарте с 24 ГБ для KV-кэша, необходимого для длительной сессии кодирования.
На независимом локальном стенде, которому мы больше всего доверяем (gauravvij/local-llm-coding-eval, четыре модели запускаются локально через Ollama на CPU), qwen3-coder:30b показал 80% в генерации кода, 77% в выборе инструментов и 80% в точности агента — наиболее сбалансированный результат среди четырёх и единственная модель, которая была сильна сразу во всех трёх задачах. Сторонние трекеры собирают для неё SWE-bench Verified около 50.3, Aider Polyglot на уровне 66.2 и LiveCodeBench v6 на 58.9; воспринимайте их как сводные цифры, а не официальные числа Alibaba, поскольку Qwen опубликовал только их для этой модели.
{{1}}Измеренная скорость сильно зависит от оборудования.{{/1}} Наиболее полезные показатели: community-сборка TurboQuant запускает её на 8 ГБ RTX 3060 Ti со скоростью ~29 токенов/сек при полном контексте 262K, а бенчмарк oMLX измерил 4-битную сборку MLX на M4 Pro (48 ГБ) в 73.6 токенов/сек при контексте 1K, снижаясь до 13.5 токенов/сек при 64K. {{2}}На карте с 24 ГБ в обычной настройке Ollama стоит ожидать диапазон десятков токенов в секунду, а не сотен — это плата за запуск кодера, близкого к передовым моделям, дома.{{/2}} {{3}}С 8 ГБ RTX 3060 Ti вы получите ~13 токенов/сек; с 24 ГБ GPU — ~30-60 токенов/сек.{{/3}}
Честное предостережение: это не самый быстрый локальный кодер, и существует более новый Qwen3-Coder-Next, предназначенный для хостинга и использования через CLI, а не для квантованных локальных установок. Но для агентной работы масштаба репозитория на одной карте Qwen3-Coder-30B сегодня является лучшим выбором.
16 ГБ видеопамяти: gpt-oss-20b
На видеокарте с 16 ГБ памяти ответ — gpt-oss-20b — и это даже не близко. Выпущенная 5 августа 2025 года компанией OpenAI под лицензией Apache 2.0, она представляет собой модель Mixture-of-Experts с 20,9 млрд суммарных параметров и 3,61 млрд активных на токен, контекстным окном на 131 072 токена, и её нативное квантование MXFP4 занимает примерно 14 ГБ. Это решающий факт: она полностью работает на GPU видеокарты с 16 ГБ памяти, и ничего не выгружается в системную оперативную память.
Почему размещение в GPU важнее любого бенчмарка: модель, которая помещается в VRAM, в 3–11 раз быстрее, чем та, что использует выгрузку. Независимый бенчмарк зафиксировал 139.93 токенов/сек для gpt-oss-20b на RTX 4080 — примерно в 2.8 раза быстрее, чем у плотной альтернативы при том же объёме памяти — а оценка одного тестировщика в 2026 году дала ей 52.1 «индекса интеллекта», назвав её непревзойдённой в классе 16 ГБ для профессионального программирования и отладки. Это плотное размещение, поэтому запускайте её в одиночку и держите контекст умеренным; качество ухудшается у верхней границы окна.
Агентная альтернатива на 16 ГБ — это Devstral 24B (devstral-small-2:24b), который показывает единственный опубликованный результат SWE-bench Verified среди локальных кодеров класса 16 ГБ — 46,8% — но он медленный, часто требуя выгрузки на CPU при скорости ~18 токенов/сек. Если ваша работа — это многофайловые агентные правки и вы готовы смириться с такой скоростью, Devstral заслуживает своего места; если вам нужна скорость и чистый код, gpt-oss-20b — лучший выбор по умолчанию. Плотные 14B-модели — Qwen3-Coder 14B или Qwen2.5-Coder 14B в Q5 — это удобные и недорогие запасные варианты.
8GB VRAM: Qwen 2.5 Coder 7B
При 8 ГБ честный ответ — Qwen2.5-Coder-7B: 7B параметров при ~4.7 ГБ в Q4_K_M, родной контекст на 32 768 токенов с расширением до 128K, и самые высокие показатели в бенчмарках завершения кода в классе 7B. Это более старая модель — выпущена в ноябре 2024 года — и это нормально, потому что ничего новее в категории 8 ГБ её не превзошло. Сообщество в тестах получает около 50 токенов/сек на RTX 4060 или 3070; независимый тест на RTX 4060 в марте 2026 года показал 28–35 токенов/сек, разброс обусловлен почти исключительно настройками контекста.
На 8 ГБ важны три вещи, которые не важны больше нигде. Во-первых, ограничьте контекст до 4–8K: карту на 8 ГБ переполняет именно KV-кэш, а не веса — один бенчмарк показал скачок скорости с ~3.6 до ~37 токенов/сек только за счёт ограничения контекста. Во-вторых, убедитесь с помощью ollama ps, что модель на 100% загружена на GPU; любая доля CPU означает резкое падение скорости. В-третьих, Q4_K_M, а не Q3 — синтаксические ошибки Q3 обходятся дороже, чем экономия VRAM.
Примечательное событие 2026 года заключается в том, что Qwen3-Coder-30B-A3B-Instruct теперь можно ужать до 8 ГБ с помощью сжатия TurboQuant KV-cache — замеры сообщества показали ~7.5 ГБ и ~29 токенов/с на RTX 3060 Ti при полном контексте 256K. Это работает, но настолько капризно, что мы не рекомендуем использовать это по умолчанию. Если вы хотите более новый готовый вариант, Qwen3 8B (~5.2 ГБ, гибридный режим мышления) является небольшим шагом вперёд по сравнению с Qwen2.5-Coder-7B в общих рассуждениях, при этом немного отстаёт в чистом коде.

А как насчёт Apple Silicon?
Унифицированная память меняет расклад в одну сторону: ёмкость растёт, а скорость генерации падает. M4 Pro с 48 ГБ может вместить модели, которые не потянет 16-гигабайтная Windows-карта, но при длинном контексте он генерирует токены гораздо медленнее. Вот цифры: 4-битная MLX-сборка Qwen3-Coder-30B-A3B-Instruct на M4 Pro использовала 16,6 ГБ при контексте 1K и 25,5 ГБ при 64K, а скорость генерации падала с 73,6 токена/с до 13,5 по мере роста контекста (бенчмарк oMLX). gpt-oss-20b с комфортом помещается в 16 ГБ унифицированной памяти и является отличным выбором для Mac. Если вам нужна мультимодальность на Apple Silicon, Gemma 4 12B работает примерно в 16 ГБ унифицированной памяти с контекстом 256K — самый мощный локальный вариант, если помимо кода вы работаете с документами, насыщенными изображениями.
Независимые цифры: генерация кода — не тот навык, который имеет значение.
Самые ясные данные, которые мы нашли, — это один локальный бенчмарк, который стоит процитировать целиком. gauravvij/local-llm-coding-eval запустил четыре модели локально через Ollama, на CPU, без облака — генерацию кода, вызов функций и многошаговую агентную задачу — с результатами, которые противоречат инстинкту «чем больше число codegen, тем лучше»:
• Qwen3.6 27B (qwen3.6:27b, dense, ~17GB): 80.0% генерация кода, 84.6% инструменты, 100% агент — лучший универсал.
• Qwen3.6 35B A3B (qwen3.6:35b-a3b, MoE, ~18 ГБ): 70,0% генерация кода, 84,6% инструменты, 100% агент.
• Qwen3-Coder-30B-A3B-Instruct (qwen3-coder:30b, MoE, ~17GB): 80.0% генерации кода, 76.9% инструментов, 80% агент — самая сбалансированная.
• DeepSeek-Coder-V2 33B (deepseek-coder:33b, dense, ~18GB): 90.0% codegen — лучший из четырёх — но 10% agent, последний в многошаговых задачах.
Эта последняя строка — весь урок. Модель, которая превосходит всех в чистой генерации кода, но разваливается на агентных задачах, — это модель, которую вы удалите после первого же цикла «прочитай этот файл, измени эту функцию, запусти тест». Судите о локальном кодере по агентной колонке, а не по колонке генерации кода.

Когда локальный запуск — неверное решение.
Локальный подход — правильный выбор по умолчанию для конфиденциальности, офлайн-работы, нулевой предельной стоимости токенов и автодополнения там, где задержка важнее потолка качества. Он оказывается неверным решением в конкретных узнаваемых ситуациях — и именно этот раздел все пропускают:
• Самая сложная агентная работа всё ещё вам не по зубам. Полевое тестирование EPAM в 2026 году на Flutter-приложении объёмом 15 000 строк показало, что облачные передовые модели (GPT-5.3-codex) по-прежнему превосходят локальные модели в наиболее сложном многоэтапном рефакторинге. Если ваш день состоит из восьмичасового рефакторинга унаследованного кода, локальные модели ещё не готовы.
• Ваши потребности в контексте превышают возможности вашей карты. Кодинг-агент, загружающий целый репозиторий, легко выйдет за пределы KV-кэша, который может вместить карта на 16 ГБ. Контекст в 256K у Qwen3-Coder-30B — вот почему она побеждает в категории 24 ГБ — карты поменьше проигрывают эту игру с самого начала.
• Вы не можете нянчиться с оборудованием. Оборудование — это реальные деньги: карта на 24 ГБ относится к классу $700–1600, плюс электричество и обслуживание. При низких объёмах вызов API дешевле, чем расходы на электроэнергию.
• DeepSeek V4 Flash — тому доказательство. При 284B общих параметрах только 4-битные веса DeepSeek V4 Flash составляют примерно 140 ГБ — это не модель для потребительских видеокарт, и точка. Именно из-за архитектуры с 13B активных параметров его API быстрый и дешёвый: $0.15 / $0.29 за 1M токенов (MIT, контекст 1M). Для этой модели вопрос «запустить локально» неверен; смысл в API.
• Командам нужна согласованность. Если четыре инженера используют разную квантизацию разных моделей, «работает на моей машине» превращается в опасность для сборки. Общие конечные точки API дают вам одну детерминированную цель.
Если вам нужен ответ со стороны API на тот же вопрос — какая облачная модель кодирования используется по умолчанию, когда локальная не является правильным компромиссом, — мы рассмотрели это отдельно в нашем руководстве по лучшим LLM для кодирования, а наша статья о ИИ-агентах для кодирования охватывает такие инструменты, как Cline и OpenCode, которые работают с этими локальными моделями.
Как протестировать карту перед покупкой
Самый дешёвый способ решить — прогнать свои собственные промпты, прежде чем вкладываться в оборудование. Ollama или LM Studio запустят любой из трёх вариантов за считанные минуты, а настоящий тест — это реальные файлы вашего репозитория, а не бенчмарк. Роутер оправдывает себя в смежном вопросе: когда вы сравниваете локального кандидата с облачными frontier-моделями, один эндпоинт позволяет прогнать один и тот же промпт через обе, не жонглируя ключами. На OrcaRouter DeepSeek V4 Flash отдаётся по прейскурантной цене провайдера без изменений — $0.15 / $0.29 за 1 млн токенов, наценка 0% — с автоматическим фейловером, что делает его дешёвым и честным мерилом для вопроса: «действительно ли моя локальная модель лучше API за $0.15?»
Одно честное предостережение: OrcaRouter не размещает Qwen3-Coder-30B-A3B-Instruct или gpt-oss-20b. Если ваша цель — строго офлайн, роутер вам не нужен: разместите модель самостоятельно — и готово. Если ваша цель — A/B-сравнение той же модели с открытым весом с передовыми моделями, прежде чем потратиться на карту, задача роутера — сравнение, а не хостинг.
Суть
VRAM решает в первую очередь, качество модели — во вторую. На 24GB запускайте Qwen3-Coder-30B-A3B-Instruct — самый сильный универсальный локальный кодер с контекстом 256K, необходимым для агентной работы. На 16GB запускайте gpt-oss-20b — редкая модель, которая одновременно быстра и полностью работает на GPU. На 8GB запускайте Qwen2.5-Coder-7B и держите контекст умеренным. Оценивайте любую из них по столбцу агентных задач, а не по столбцу генерации кода, и признайте, что самый сложный многофайловый рефакторинг по-прежнему остаётся за облаком. Приведённые выше цифры актуальны по состоянию на 10 августа 2026 года — перепроверьте линейку и цены, прежде чем тратить деньги, потому что эта сфера меняется еженедельно.
