
Требования к VRAM для GLM-5.3-Flash: сколько памяти нужно для запуска 320B MoE
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 221 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
GLM-5.3-Flash не помещается ни на один потребительский GPU. Минимальная рабочая сборка, 2bit-lite, требует ~102 ГБ весов и 112 ГБ оперативной памяти. Mac с 128 ГБ — это минимальный порог входа; один H200 вмещает 2bit-lite с запасом ~39 ГБ; всем остальным следует использовать размещённый API z-ai/glm-5.3-flash.
Вот и весь ответ одним духом, и его стоит произнести прямо здесь: не существует конфигурации потребительского железа, на которой эта модель работает. Модель Z.ai с 320 млрд параметров — зрение-язык, архитектура mixture-of-experts, выпущенная 26 августа 2026 года, — требует памяти серверного класса при любой квантизации. Цифра «18B активных» описывает вычисления на токен, а не занимаемую память: все 320 млрд весов остаются загруженными. Реалистичные локальные цели — это крупные Mac с унифицированной памятью, многопроцессорные серверы и один H200 на 141 ГБ. Если у вас нет ни одного из них, цифры ниже — не список покупок; это повод вызывать модель через API.
Одно предварительное замечание перед цифрами: показатели памяти в этом материале — это данные сообщества, а не рекомендации вендора. Z.ai публикует веса и спецификации API; требований к памяти для локального инференса она не публикует. Таблица по каждому типу квантования взята из карточки модели orcarouter/GLM-5.3-Flash-MLX на Hugging Face — это MLX-квантование открытых весов, поддерживаемое группой сообщества, а данные о развёртывании получены от практиков, которые реально загружали модель. Там, где цифра указана вендором — цены и заявления об эффективности KV-кэша архитектуры, — мы помечаем это соответствующим образом.
Короткий ответ: что подходит к тому, что у вас есть.
Начните с того, что у вас есть на самом деле, потому что лестница квантования имеет смысл только относительно целевой машины:
• Потребительские GPU (RTX 4090, RTX 5090 и всё, что ниже) — нет. Ни одна потребительская карта не имеет достаточно видеопамяти: минимальная сборка требует ~102 ГБ только под веса, то есть примерно как пять RTX 5090. Системная оперативная память этого не меняет, потому что веса должны постоянно находиться на устройстве.
• 128 ГБ Mac (M4 или M5 Max) — сборка 2bit-lite (~102 ГБ весов / 112 ГБ минимум ОЗУ), и только после повышения лимита закреплённой памяти. Подробнее об этом ниже. Это единственная машина потребительского класса, на которой помещается модель.
• 192 ГБ и 256 ГБ Mac Studio — 3-битный (~184 / 200 ГБ) и 2-битный (~145 / 160 ГБ) становятся достижимыми; для 4-битного требуется ~224 ГБ, к которому приближается только вариант на 256 ГБ.
• Один H200 (141 ГБ VRAM) — 2bit-lite помещается, оставляя примерно 39 ГБ для KV-кэша, что означает только короткие контексты.
• Multi-GPU сервер — всё, включая 4-бит, 6-бит и эталонную сборку FP8 объемом ~328 ГБ.
Все остальные — размещённый API, z-ai/glm-5.3-flash. Это не утешительный приз: именно там модель действительно быстрая и дешёвая в использовании, и об этом рассказано внизу этой страницы.
Два числа, а не одно: веса против общего объёма памяти
Каждая квантизация на карточке модели имеет две колонки — размер весов и минимальный объём ОЗУ — и разрыв между ними — это та часть, которую большинство статей пропускает. Колонка весов — это файлы модели: каждый параметр в этой точности, размещённый в памяти. Колонка минимального объёма ОЗУ — это то, что машина должна хранить в памяти во время выполнения: веса плюс KV-кэш, активации и буферы, которые растут с длиной контекста.
Цифра «18B активных» — вот где люди ошибаются. GLM-5.3-Flash — это MoE с общим объёмом 320B и 18B активных параметров: на каждый токен вычисляется только около 18B параметров. Это экономия вычислений, а не памяти. Все 320B весов находятся в памяти независимо от того, какие эксперты срабатывают, потому что маршрутизатор не знает, какие эксперты ему понадобятся, пока не увидит токен. MoE даёт скорость, а не компактность — этот момент иллюстрирует и карточка самой модели, где рядом с 18B активных указан полный объём 320B.
Так что когда в сборке указано «~204 GB весов / 224 GB минимум ОЗУ», дополнительные ~20 GB — это накладные расходы во время выполнения: KV-кэш, активации, буферы контекста. Увеличьте длину контекста — и эта разница растёт. Именно колонка минимального ОЗУ, а не колонка весов, определяет размер машины.

Сама модель — архитектура, лицензия и собственная подача Z.ai — описана на официальной карточке вендора, показанной выше. Локальная память там не освещена; именно поэтому существует эта страница. Приведённые ниже цифры взяты из порта MLX, созданного сообществом на основе открытых весов.
Лестница квантования
Таблица на карточке orcarouter/GLM-5.3-Flash-MLX — именно то, откуда практики сегодня фактически загружают модель. В ней перечислены пять квантованных сборок плюс эталонная FP8, для каждой указаны размер весов и минимальный объем ОЗУ:
FP8 reference — ~328 ГБ весов. Неквантованная эталонная точка, в которой поставляются открытые веса.
• 6-бит — ~296 ГБ весов / 320 ГБ мин. ОЗУ. Почти без потерь; сборка наилучшего качества.
• 4-битный — ~204 ГБ / 224 ГБ. Рекомендуемый вариант по умолчанию для повседневного использования.
• 3-bit — ~184 ГБ / 200 ГБ. Агрессивно, но применимо.
• 2-битный — ~145 ГБ / 160 ГБ. Максимальное качество.
• 2bit-lite — ~102 ГБ / 112 ГБ. Самая маленькая сборка; единственная, которая помещается в 128-гигабайтный Mac или на один H200.
Качество падает по мере снижения разрядности, и карточка модели дает этому количественную оценку. По сравнению с эталоном FP8 перплексия ухудшается на +0,24% при 6-бит, +2,96% при 4-бит, +9,96% при 3-бит, +56,9% при 2-бит и +141% при 2bit-lite (показатели перплексии из той же карточки модели). Рекомендации самой карточки: 6-бит — почти без потерь, 4-бит — повседневный вариант по умолчанию, 3-бит и 2-бит — при ограниченной памяти, 2bit-lite — только когда больше ничего не помещается; при этом генерация длинного кода на 2bit-lite ненадежна. Это последнее предупреждение важно для модели рассуждений на 320B: именно 2bit-lite позволяет обойтись Mac на 128 ГБ, и расплата за качество приходится ровно туда, где больнее всего для работы с кодом.

Два числа в этой лестнице заслуживают более пристального внимания, потому что они решают весь вопрос об аппаратном обеспечении.
Почему существует 2bit-lite
2bit-lite — это не дополнительный уровень качества, а размерная категория, созданная по одной причине: обычный 2-bit не помещается. При ~102 ГБ весов это единственная сборка, которая вписывается в ~112 ГБ доступной памяти на Mac с 128 ГБ, и единственная, которая помещается в 141 ГБ одного H200 с остатком места под KV-кэш. В карточке модели это прямо указано: обычный 2-bit не помещается на Mac с 128 ГБ; 2bit-lite помещается при повышенном лимите зарезервированной памяти. На H200 он помещается «с ~39 ГБ остатка под KV-кэш» (слова карточки). Эти 39 ГБ — весь рабочий бюджет на всё, что модель делает после загрузки, — что подводит нас к контексту.
Во что обходится KV-кэш при длинном контексте
GLM-5.3-Flash имеет окно контекста в 1 млн токенов, и длинный контекст — это то, где планы на локальную память умирают. Гибридное разреженно-линейное внимание модели — NoPE-MLA с механизмом index-pool — действительно эффективно: Z.ai сообщает, что оно сокращает вычисления внимания в 3.01×, а размер KV-кэша в 4.44× по сравнению с собственной моделью GLM-5.3 (данные производителя). Но даже «в 4.44× меньше, чем GLM-5.3» всё равно оставляет кэш объёмом в десятки ГиБ при подходе к полному контексту в 1M.
Лучшая публичная цифра, которая у нас есть, — из развёртывания сообществом, где модель запускалась на четырёх узлах DGX Spark: 16 ГиБ KV-кэша на ранг — около 64 ГиБ суммарно на все четыре — для удержания полного контекста в 1M токенов, рассчитанного на несколько одновременных запросов с полным контекстом. Это больше, чем весь бюджет памяти большинства отдельных машин, ещё до учёта хотя бы одного веса. На одной H200 арифметика и есть суть этой страницы: 2bit-lite оставляет ~39 ГБ на всё, что после весов, — с комфортом для короткого чата, но исчезает за минуты, когда контекст приближается к 100K токенов.
Практическое правило: {{1}}колонка min-RAM предполагает разумный контекст{{/1}}. Если ваша нагрузка включает длинные документы, циклы агентов или код масштаба репозитория, {{2}}закладывайте сверху память под KV-кэш{{/2}} — а для всего, что близко к 1M токенов, {{3}}прекратите заниматься арифметикой и используйте API{{/3}}. Эти наблюдения о расчёте размеров — {{4}}результаты сообщества; руководств от вендоров по расчёту KV-кэша не существует{{/4}}.
Ограничение невыгружаемой памяти в macOS: почему Mac с 128 ГБ всё ещё не загружается
Самый частый сбой, о котором сообщают практики, — это не «не хватает оперативной памяти». Это Mac на 128 ГБ с моделью примерно на 102 ГБ, которая отказывается загружаться. Причина — ограничение wired-памяти в macOS. На Apple Silicon GPU не может адресовать всю унифицированную память: Metal устанавливает «рекомендуемый максимальный рабочий набор» примерно в две трети физической RAM, и выделения сверх этого объёма завершаются ошибкой, даже если на машине есть свободная память.
Итак, стандартный бюджет Metal у Mac с 128 ГБ находится в диапазоне 80–90 ГБ — меньше, чем требуется для сборки 2bit-lite (~112 ГБ минимальной RAM с моделью ~102 ГБ в резидентной памяти). Загрузка не проходит из-за бюджета Metal, а не из-за объёма RAM. Решение во всех найденных нами отчётах практиков одинаковое: поднять предел закреплённой памяти через sudo sysctl iogpu.wired_limit_mb=…, установив значение выше полного объёма модели в МБ, и рассчитывать на сброс после перезагрузки. Некоторые гайды из сообщества также устанавливают предел закреплённой памяти из Python через mlx.metal.set_wired_limit(), чтобы веса модели были закреплены и macOS перестал сжимать неактивные страницы Metal.
Ещё один нюанс: среды выполнения ведут себя по-разному. MLX соблюдает лимит Metal и жёстко падает при его превышении, тогда как среды выполнения на основе llama.cpp (путь GGUF) обычно не соблюдают его и позволяют macOS использовать подкачку (swap). Вот почему одна и та же модель может отказываться загружаться в одной среде и «загружаться» в другой — и почему модель, ушедшая в подкачку, может тормозить до полной непригодности. Это выводы сообщества о поведении macOS, а не рекомендации Apple.
Хостинговая альтернатива: z-ai/glm-5.3-flash
Для всех, кого исключают приведённые выше цифры, — а это большинство людей, — Z.ai предоставляет саму модель как z-ai/glm-5.3-flash, и именно здесь по-настоящему проявляется «Flash» в названии. Прейскурантная цена Z.ai составляет $0,15 за миллион входных токенов, $0,03 за миллион кэшированных входных токенов и $0,50 за миллион выходных токенов; промоакция к запуску действует до 9 сентября 2026 года по ставкам $0,075 / $0,015 / $0,25 (цены указаны вендором, актуальны на момент написания). Кэшированный ввод, стоящий пятую часть нового, — это самый мощный рычаг снижения затрат: любая нагрузка с повторно используемым префиксом — системные промпты, определения инструментов, длинные общие документы — должна работать по тарифу чтения из кэша.
Расчёт памяти должен учитываться при принятии решения. Развёртывание модели на 320B параметров собственными силами означает выделение 112–320 GB памяти под неё, независимо от того, простаивает она или загружена на полную. Облачный эндпоинт снимает всю эту нагрузку с ваших машин, а по промо-ценам в рамках запуска модель стоит меньше за токен, чем многие модели в десять раз меньшего размера, — в этом весь смысл MoE с 18B активных параметров.
Это также естественное место для точки маршрутизации. Через OrcaRouter z-ai/glm-5.3-flash — одна из 200+ моделей за единым API, доступная по цене провайдера с нулевой наценкой, поэтому акция на запуск и любые будущие снижения цен вступают в силу в день объявления. Автоматическое переключение означает, что трёхдневная модель с нестабильным путём обслуживания — не ставка против вашего продакшена: если провайдер ошибается или перегружен, запрос перенаправляется на исправного провайдера, а не завершается ошибкой. Безопасное опробование непроверенной модели — это как раз то, для чего нужен роутер.

Часто задаваемые вопросы
Могу ли я запустить GLM-5.3-Flash на RTX 5090?
Нет. Самая маленькая сборка — это ~102 ГБ только весов, а у RTX 5090 32 ГБ видеопамяти. Ни один потребительский GPU даже близко не подходит; модели нужны Mac с унифицированной памятью, один H200 или сервер с несколькими GPU.
Означает ли 18B активных параметров, что GLM-5.3-Flash работает на потребительском оборудовании?
Нет. Цифра 18B активных параметров относится к вычислениям на токен. Все 320B параметров остаются в памяти, поскольку маршрутизатор не может знать, какие эксперты понадобятся токену, пока не увидит сам токен. MoE экономит вычисления, а не память.
Какой самый дешевый способ попробовать GLM-5.3-Flash?
Хостируемый API z-ai/glm-5.3-flash. По акционной цене запуска он стоит $0.075 за миллион входных токенов, а токены из кэша — $0.015. Самостоятельный хостинг самой маленькой сборки означает выделение около 112 ГБ оперативной памяти, что имеет смысл только в том случае, если у вас уже есть собственное оборудование.
Честный итог: GLM-5.3-Flash — модель серверного класса в любой сборке. Mac на 128 ГБ получает единственную подходящую сборку — 2bit-lite — с увеличенным лимитом wired-памяти, короткими контекстами и документированным снижением качества на длинном коде. Один H200 получает ту же сборку с ~39 ГБ запаса по KV. Серверное оборудование получает настоящую лестницу вариантов: от 4-bit по умолчанию до почти без потерь 6-bit. А для всех остальных — большинства читателей — правильный ответ — хостируемый эндпоинт z-ai/glm-5.3-flash, и цифры выше — причина, а не список покупок. Для пошаговой установки на MacBook Pro наше руководство по установке на MacBook охватывает весь процесс от начала до конца; о том, как сборки с разной квантизацией сравниваются по качеству и когда какую выбирать, подробно рассказывается в руководстве по сборке MLX; а в обзоре релиза — контекст запуска и заявленные результаты бенчмарков.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
