
Qwen3.8-27B: требования к VRAM — сколько оборудования вам действительно понадобится
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 2382 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
Примерно 17 ГБ видеопамяти — вот цифра, которая циркулирует для Qwen3.8-27B: Дэниел Хан из Unsloth сказал, что модель «должна уместиться примерно в 17 ГБ видеопамяти при выпуске», — и стоит внести ясность, чем это является, а чем нет. Это прогноз, основанный на предшественнике 27B, а не спецификация от Alibaba, поскольку модель ещё не выпущена; официальный репозиторий был обещан на неделю 10 августа 2026 года и на момент написания так и не появился. Эта статья разбивает вопрос о видеопамяти на то, на что вы можете рассчитывать, что действительно неопределённо и как цифра меняется в зависимости от квантования, окна контекста и среды выполнения.
Сначала честный ответ
Официальных аппаратных спецификаций для Qwen3.8-27B пока нет. Всё ниже спроецировано с Qwen3.6-27B — модели, которую 27B сменяет: то же количество параметров, та же вероятная гибридная архитектура и ближайший доступный ориентир по размеру. Относитесь к цифрам как к плановой вилке, а не как к списку требований. Первые реальные замеры появятся от квантизаторов и мейнтейнеров инференс-фреймворков в течение нескольких дней после релиза весов — именно на эти цифры и стоит ориентироваться при покупке.
Лестница квантов
Сколько VRAM вам нужно, почти полностью зависит от того, какую квантизацию вы используете. Если отталкиваться от таблицы Qwen3.6-27B, составленной сообществом:
• Q4_K_M — примерно 16 ГБ видеопамяти. Золотая середина для видеокарт на 24 ГБ и вероятный источник той самой цифры «17 ГБ». Стандартный выбор большинства команд.
• Q3_K_M / IQ3 — примерно 13 ГБ видеопамяти. Помещается в карты на 16 ГБ и даже 12 ГБ, с заметным снижением качества.
• Q6_K — примерно 21 ГБ видеопамяти. Почти без потерь, и впритык, но реально помещается на карте с 24 ГБ.
• Q8_0 — примерно 27–30 ГБ видеопамяти. Для карт с 48 ГБ, где нужны последние капли качества.
• FP8-инференс — примерно 27 ГБ VRAM для весов, поэтому одиночный L40S является обычным выбором GPU для инференса.
• Полная точность (BF16) — примерно 54 ГБ видеопамяти. Реалистично, это карта класса H100, и та территория, где люди перестают называть это «локальным».
Краткая версия: видеокарта с 24 ГБ — безопасная покупка для этой модели, карта на 16 ГБ может запустить её только если вы согласны на низкие квантизации, а всё, что имеет 8 ГБ и менее, не подходит, если только модель не окажется значительно легче своего предшественника.

Переменная, которую никто не упоминает: длина контекста
Все указанные выше числа соответствуют умеренному контексту. Объём VRAM масштабируется вместе с контекстом, поскольку KV-кэш должен храниться вместе с весами. На Qwen3.6-27B контекст 2K укладывался примерно в 11 ГБ, контекст 32K поднимал ту же квантованную модель выше 14 ГБ, а 128K более чем вдвое увеличивал объём кэша. Если Qwen3.8-27B сохранит большое нативное контекстное окно — а поколение Qwen движется именно к этому — заложите несколько ГБ запаса поверх размера квантованной модели или ограничьте контекст в конфигурации среды выполнения. Выбор длины контекста, которую вы на самом деле не используете, — самый распространённый путь, которым команды приходят к покупке более мощной видеокарты, чем им было нужно.
Джокер гибридной архитектуры
Qwen3.6-27B была гибридной моделью: только 16 из 65 слоёв использовали традиционный KV-кэш, а 48 использовали фиксированное рекуррентное состояние. В результате объём KV-памяти был примерно в четыре раза меньше, чем у плотной модели того же размера — что во многом объясняет, почему 27B ощущалась как модель для карты на 24 ГБ, а не на 48 ГБ. Если Qwen3.8-27B сохранит гибридную архитектуру (вероятно, но не подтверждено), приведённые выше расчёты длины контекста станут более благоприятными, чем кажется. Загвоздка в поддержке на уровне рантайма: сборка llama.cpp или vLLM, в которой не реализованы рекуррентные слои, покажет гораздо более высокое использование памяти. Прежде чем считать, что прогнозы верны, проверьте, в каких рантаймах уже есть поддержка.
Какие видеокарты действительно работают
Конкретно, для обычных карт:
• RTX 4090 / 3090 / 5090 (24 ГБ) — Q4_K_M с комфортом, Q6_K, если вы готовы потесниться. Это целевая аудитория.
• RTX 3060 / 4060 Ti 16 ГБ — только кванты уровня IQ4 или Q3, со скромным контекстом. Работать можно, но удовольствия мало.
• Карты на 12 ГБ — Q3_K_M с пониженным качеством. Годится для экспериментов, но не для сервинга.
• Apple Silicon — Mac с 24 ГБ памяти запускает те же Q4-файлы через MLX или llama.cpp; базовые конфигурации на 16 ГБ тонут в свопе и фактически выбывают из игры, как это было и с Qwen3.6-27B.
• От 48 ГБ и выше (A6000, L40S, двухкарточные конфигурации) — запуск Q8_0 или FP8 с реальным запасом.

Или вообще обойтись без GPU.
Если вам не подходит математика железа, модель тоже не обязана. OrcaRouter — это один API для более чем 200 моделей, включая семейство Qwen, и он передаёт заявленную провайдером цену без наценки, так что Qwen3.8-Max сейчас стоит $2.00 за миллион входных токенов и $6.00 за миллион выходных токенов — столько же, сколько на странице цен самого вендора. Сама 27B будет локальной моделью, но когда её веса выйдут и она завоюет доверие, тот же ключ будет направлять запросы к любому провайдеру, который её разместит — вы можете уже сейчас создавать приложения на основе этого поколения моделей и вообще не иметь дела с рынком перепродажи GPU.

Итог по аппаратной части: рассчитывайте на 16 ГБ для комфортного запуска в 4-битном режиме, на 24 ГБ для подстраховки и запаса под контекст и более высокие квантизации, и относитесь ко всем цифрам здесь как к предварительным, пока репозиторий не появится и не появятся первые реальные измерения. Прогноз в «17 ГБ» — разумное плановое число, но это ещё не факт.
