Титульная карточка для статьи «Qwen3.8-27B VRAM Requirements» с изображением чипа GPU с меткой памяти ~17 ГБ и значками квантизации для Q4_K_M, Q6_K и Q8_0.
Guides & Insights

Qwen3.8-27B: требования к VRAM — сколько оборудования вам действительно понадобится

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Примерно 17 ГБ видеопамяти — вот цифра, которая циркулирует для Qwen3.8-27B: Дэниел Хан из Unsloth сказал, что модель «должна уместиться примерно в 17 ГБ видеопамяти при выпуске», — и стоит внести ясность, чем это является, а чем нет. Это прогноз, основанный на предшественнике 27B, а не спецификация от Alibaba, поскольку модель ещё не выпущена; официальный репозиторий был обещан на неделю 10 августа 2026 года и на момент написания так и не появился. Эта статья разбивает вопрос о видеопамяти на то, на что вы можете рассчитывать, что действительно неопределённо и как цифра меняется в зависимости от квантования, окна контекста и среды выполнения.

Сначала честный ответ

Официальных аппаратных спецификаций для Qwen3.8-27B пока нет. Всё ниже спроецировано с Qwen3.6-27B — модели, которую 27B сменяет: то же количество параметров, та же вероятная гибридная архитектура и ближайший доступный ориентир по размеру. Относитесь к цифрам как к плановой вилке, а не как к списку требований. Первые реальные замеры появятся от квантизаторов и мейнтейнеров инференс-фреймворков в течение нескольких дней после релиза весов — именно на эти цифры и стоит ориентироваться при покупке.

Лестница квантов

Сколько VRAM вам нужно, почти полностью зависит от того, какую квантизацию вы используете. Если отталкиваться от таблицы Qwen3.6-27B, составленной сообществом:

• Q4_K_M — примерно 16 ГБ видеопамяти. Золотая середина для видеокарт на 24 ГБ и вероятный источник той самой цифры «17 ГБ». Стандартный выбор большинства команд.

• Q3_K_M / IQ3 — примерно 13 ГБ видеопамяти. Помещается в карты на 16 ГБ и даже 12 ГБ, с заметным снижением качества.

• Q6_K — примерно 21 ГБ видеопамяти. Почти без потерь, и впритык, но реально помещается на карте с 24 ГБ.

• Q8_0 — примерно 27–30 ГБ видеопамяти. Для карт с 48 ГБ, где нужны последние капли качества.

• FP8-инференс — примерно 27 ГБ VRAM для весов, поэтому одиночный L40S является обычным выбором GPU для инференса.

• Полная точность (BF16) — примерно 54 ГБ видеопамяти. Реалистично, это карта класса H100, и та территория, где люди перестают называть это «локальным».

Краткая версия: видеокарта с 24 ГБ — безопасная покупка для этой модели, карта на 16 ГБ может запустить её только если вы согласны на низкие квантизации, а всё, что имеет 8 ГБ и менее, не подходит, если только модель не окажется значительно легче своего предшественника.

An infographic titled 'Qwen3.8-27B - the quant ladder' listing six quantization tiers with VRAM figures: Q3_K_M ~13 GB, Q4_K_M ~16 GB, Q6_K ~21 GB, Q8_0 ~27-30 GB, FP8 serving ~27 GB, BF16 full ~54 GB, with the Q4_K_M row highlighted as the sweet spot for 24 GB cards.

Переменная, которую никто не упоминает: длина контекста

Все указанные выше числа соответствуют умеренному контексту. Объём VRAM масштабируется вместе с контекстом, поскольку KV-кэш должен храниться вместе с весами. На Qwen3.6-27B контекст 2K укладывался примерно в 11 ГБ, контекст 32K поднимал ту же квантованную модель выше 14 ГБ, а 128K более чем вдвое увеличивал объём кэша. Если Qwen3.8-27B сохранит большое нативное контекстное окно — а поколение Qwe​n движется именно к этому — заложите несколько ГБ запаса поверх размера квантованной модели или ограничьте контекст в конфигурации среды выполнения. Выбор длины контекста, которую вы на самом деле не используете, — самый распространённый путь, которым команды приходят к покупке более мощной видеокарты, чем им было нужно.

Джокер гибридной архитектуры

Qwen3.6-27B была гибридной моделью: только 16 из 65 слоёв использовали традиционный KV-кэш, а 48 использовали фиксированное рекуррентное состояние. В результате объём KV-памяти был примерно в четыре раза меньше, чем у плотной модели того же размера — что во многом объясняет, почему 27B ощущалась как модель для карты на 24 ГБ, а не на 48 ГБ. Если Qwen3.8-27B сохранит гибридную архитектуру (вероятно, но не подтверждено), приведённые выше расчёты длины контекста станут более благоприятными, чем кажется. Загвоздка в поддержке на уровне рантайма: сборка llama.cpp или vLLM, в которой не реализованы рекуррентные слои, покажет гораздо более высокое использование памяти. Прежде чем считать, что прогнозы верны, проверьте, в каких рантаймах уже есть поддержка.

Какие видеокарты действительно работают

Конкретно, для обычных карт:

• RTX 4090 / 3090 / 5090 (24 ГБ) — Q4_K_M с комфортом, Q6_K, если вы готовы потесниться. Это целевая аудитория.

• RTX 3060 / 4060 Ti 16 ГБ — только кванты уровня IQ4 или Q3, со скромным контекстом. Работать можно, но удовольствия мало.

• Карты на 12 ГБ — Q3_K_M с пониженным качеством. Годится для экспериментов, но не для сервинга.

• Apple Silicon — Mac с 24 ГБ памяти запускает те же Q4-файлы через MLX или llama.cpp; базовые конфигурации на 16 ГБ тонут в свопе и фактически выбывают из игры, как это было и с Qwen3.6-27B.

• От 48 ГБ и выше (A6000, L40S, двухкарточные конфигурации) — запуск Q8_0 или FP8 с реальным запасом.

An infographic titled 'Context vs VRAM' comparing the same Q4 quant at 2K context (~11 GB) versus 32K context (~14 GB+), with a tip box advising to cap context at what you actually use.

Или вообще обойтись без GPU.

Если вам не подходит математика железа, модель тоже не обязана. OrcaRouter — это один API для более чем 200 моделей, включая семейство Qwe​n, и он передаёт заявленную провайдером цену без наценки, так что Qwen3.8-Max сейчас стоит $2.00 за миллион входных токенов и $6.00 за миллион выходных токенов — столько же, сколько на странице цен самого вендора. Сама 27B будет локальной моделью, но когда её веса выйдут и она завоюет доверие, тот же ключ будет направлять запросы к любому провайдеру, который её разместит — вы можете уже сейчас создавать приложения на основе этого поколения моделей и вообще не иметь дела с рынком перепродажи GPU.

OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the NEW FEATURED badge, Vision and Tools capabilities, $2.00 per million input tokens and $6.00 per million output tokens, a p50 time-to-first-token of 4.84 seconds, a 1M-token context window, and OpenAI-compatible API code samples.

Итог по аппаратной части: рассчитывайте на 16 ГБ для комфортного запуска в 4-битном режиме, на 24 ГБ для подстраховки и запаса под контекст и более высокие квантизации, и относитесь ко всем цифрам здесь как к предварительным, пока репозиторий не появится и не появятся первые реальные измерения. Прогноз в «17 ГБ» — разумное плановое число, но это ещё не факт.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube