Титульная карточка статьи «Как запустить GLM-5.3-Flash на MacBook Pro» с подзаголовком «The 2bit-Lite MLX Playbook», на которой изображён стилизованный MacBook Pro с мягким нейросетевым мотивом над клавиатурой и три чипа с надписями «2bit-lite», «~102 GB» и «128 GB Mac».
Guides & Insights

Как запустить GLM-5.3-Flash на MacBook Pro: руководство по 2bit-Lite MLX

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Запуск GLM-5.3-Flash на MacBook Pro означает ровно одну машину: 128 ГБ M4/M5 Max MacBook Pro с запущенной 2bit-lite сборкой нашей MLX-конвертации, с поднятым лимитом зарезервированной памяти macOS. Если ваш MacBook Pro имеет меньше 128 ГБ — 36 ГБ M4 Pro, 48 ГБ M4 Max — эта инструкция не для вас; перейдите к последнему разделу и вместо этого используйте размещённый API z-ai/glm-5.3-flash. GLM-5.3-Flash (веса по адресу zai-org/GLM-5.3-Flash) — это модель Z.ai с 320 миллиардами параметров, Mixture-of-Experts, в которой активны 18B параметров на токен — выпущена 26 августа 2026 года, первая нативно мультимодальная GLM-5 — и даже самая маленькая сборка нашего MLX-порта требует около 102 ГБ весов и примерно 112 ГБ памяти. Это весь рынок, и мы не собираемся смягчать это.

Это официальная документация, а не анонс: приведённые ниже веса — это собственная сборка OrcaRouter (orcarouter/GLM-5.3-Flash-MLX, MIT), созданная с помощью нашего метода квантизации OrcaSAQ без калибровки. Мы выпустили её 26 августа и на следующий день публично скорректировали курс, потому что исходный диапазон квантизации не делал использование MacBook Pro практичным для большинства людей — обычная 2-битная сборка по-прежнему требовала ~160 ГБ, которых нет ни в одном ноутбуке. 27 августа мы пересобрали наименьший вариант как 2bit-lite специально, чтобы поместиться в MacBook Pro на 128 ГБ, и этот материал — честный рассказ о том, что это вам даёт и чего это стоит. Каждое число, отмеченное как полевая заметка ниже, было измерено в ходе нашего единственного проверочного запуска на H200; ничто здесь не является вендорским бенчмарком. Там, где мы повторяем практику сообщества — команду wired-memory, версионирование mlx-vlm — мы помечаем это как таковое.

Какая сборка подходит для какого Mac (прочитайте это перед тем, как что-либо загружать)

Пять сборок в репозитории соответствуют минимальному объёму ОЗУ. На MacBook Pro на вопрос «какая сборка» есть ровно один ответ — всё, что выше 2bit-lite, это разговор о Mac Studio:

6-bit — ~296 ГБ весов / ~320 ГБ ОЗУ / почти без потерь. Только Mac Studio с 512 ГБ.

4-bit — ~204 ГБ / ~224 ГБ / наш рекомендуемый вариант по умолчанию. Mac Studio 256 ГБ. Именно это зеркалирует корень репозитория.

3-бит — ~184 ГБ / ~200 ГБ. Mac Studio 256 ГБ.

2-bit — ~145 ГБ / ~160 ГБ. Mac Studio 192 ГБ. Это была самая маленькая сборка, которую мы выпустили в первый день, и она была промахом.

2bit-lite — ~102 ГБ / ~112 ГБ. Единственная сборка, которая умещается в устройство с 128 ГБ, — это M4/M5 Max MacBook Pro с 128 ГБ, Mac Studio с 128 ГБ или Mac mini с 128 ГБ. Любой ноутбук на Apple Silicon с 128 ГБ (M3 Max или новее) — та же история, просто медленнее.

Ловушка, скрытая в этой лестнице: команда загрузки по умолчанию из README скачивает 4-bit сборку (~204 ГБ), что является правильным выбором по умолчанию для машины с 256 ГБ и бесполезно на ноутбуке. Если вы выполните команду по умолчанию на MacBook Pro, вы получите модель, которая не сможет выделить память. Путь 2bit-lite требует явного --include, описанного ниже.

Существует также жёсткий потолок, в который вы упрётесь ещё до того, как приведённые выше расчёты вообще начнут действовать. macOS не позволяет процессу захватить всю унифицированную память 128-гигабайтного Mac; потолок доступной GPU памяти по умолчанию составляет примерно 91–96 ГБ (значение выведено сообществом методом обратной разработки и подтверждается в нескольких статьях о конфигурациях MLX для больших моделей). Это меньше ~102 ГБ, занимаемых одними лишь весами, поэтому даже 2bit-lite не загрузится, пока вы не поднимете лимит wired-памяти. Этот шаг обязателен, и он описан в разделе 4.

Установите mlx-vlm — и только mlx-vlm.

GLM-5.3-Flash — это визуально-языковая модель, поэтому она работает под управлением mlx-vlm, а не mlx-lm. Это самая распространённая причина, по которой люди застревают, поэтому скажу сразу: mlx-lm предназначен только для текстовых моделей; запуск мультимодальной модели через него приводит к непонятной ошибке загрузки. Установите пакет VLM версии 0.6.17 или выше:

pip install -U "mlx-vlm>=0.6.17"

Фиксация версии — это не украшение. glm5_next — гибридная архитектура разреженного и линейного внимания, лежащая в основе GLM-5.3-Flash — появилась в mlx-vlm только в тот же день, когда вышла модель (26 августа 2026 года), и любые более старые версии не распознают конфигурацию. Архитектура важна и по второй причине: это совершенно новая топология, и у первых портов были реальные ошибки корректности, которые не выявил бы связный вывод. Аудит рантайма раннего MLX-пути glm5_next, проведённый сообществом, выявил и исправил четыре из них: неприменённый SwiGLU-кламп в каждом FFN-блоке, тензоры гиперсвязей, ограниченные многообразием, приведённые к неверному dtype (что незаметно портило матрицу смешивания внимания), два несоответствия epsilon в нормах внимания и bf16-логиты роутера, тогда как эталон использует float32. После исправлений численные результаты совпадали с эталоном примерно до 1e-7. Вывод для вас: поддерживайте mlx-vlm в актуальном состоянии и относитесь с подозрением к самому первому релизу порта любой новой архитектуры.

Скачайте веса: флаги исключения и включение, которое вам действительно нужно.

Корень репозитория повторяет 4-битную сборку, а все пять вариантов поставляются как вложенные папки. Команда по умолчанию загружает корень и использует --exclude, чтобы ни одна из пяти папок вариантов (которые вместе занимают порядка 800 ГБ) не скачивалась вместе:

hf download orcarouter/GLM-5.3-Flash-MLX --local-dir ./GLM-5.3-Flash-MLX --exclude "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"

На MacBook Pro эта команда для вас неправильна — она выдаёт вам 4-битный корень. Для ноутбука с 128 ГБ загрузите только 2bit-lite подпапку:

hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX

Это загрузка объёмом ~102 ГБ, и она самодостаточна — папка 2bit-lite/ содержит собственный config.json, так что вы можете сразу указать генератору на неё. Если hf отсутствует в вашем PATH, установите его: pip install -U huggingface_hub. Перед началом убедитесь, что у вас есть ~110 ГБ свободного места на диске и что это не последние свободные 100 ГБ на вашем Mac — MLX отображает веса в память, а из-за почти заполненного SSD такие установки умирают в середине загрузки.

Screenshot of the Hugging Face repository card for orcarouter/GLM-5.3-Flash-MLX showing the title, the tagline 'An MLX build of the official GLM-5.3-Flash — 2bit-lite / 2 / 3 / 4 / 6-bit OrcaSAQ quant for Apple Silicon & MLX', and the model tags glm5_next, Apple Silicon, quantized 2-8bit, Mixture of Experts, vision-language and MIT

Поднимите лимит закреплённой памяти — шаг, который все забывают.

Это решающий шаг для MacBook Pro на 128 ГБ, и карточка README предполагает, что вы знаете команду, а не расписывает её. Стандартный предел рабочего набора Metal на Mac с 128 ГБ составляет примерно 91–96 ГБ, что меньше ~102 ГБ весов 2bit-lite — поэтому без этого шага модели не удаётся выделить память, и загрузка завершается сбоем. Стандартное решение сообщества — sysctl, повышающий предел закреплённой памяти GPU в мегабайтах:

sudo sysctl iogpu.wired_limit_mb=114688

Это устанавливает потолок ~112 ГБ, оставляя примерно 14 ГБ в резерве ОС. На машинах с 128 ГБ реальные значения, используемые в сообществе, варьируются от ~114688 (112 ГБ) до ~122880 (120 ГБ); не выставляйте максимум — macOS нужен запас, иначе вы получите прерывистую работу оконного сервера и зависание системы при нехватке памяти. После установки загрузите модель и следите за Activity Monitor: если давление памяти станет жёлтым, уменьшите число.

Два практических замечания, оба основаны на опыте сообщества, а не на наших полевых заметках. Во-первых, sysctl сбрасывается при перезагрузке и применяется к той сессии терминала, в которой вы его установили, так что планируйте запускать его снова (или пропишите его через LaunchAgent) — забыть о нём после перезагрузки — это классический сбой «вчера же работало». Во-вторых, MLX также предоставляет внутрипроцессный параметр, mlx.core.metal.set_wired_limit(bytes), на macOS 15.0 и новее; он должен оставаться ниже предела sysctl, и это более переносимый вариант, если вы пишете скрипты в ноутбуке. Какой бы вариант вы ни использовали, эффект одинаков: без него здесь ничего не запустится.

Запустите: текст, изображение и Python API

При установленных весах и повышенном лимите генерация — одна команда.

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "Объясните квантовую запутанность одним предложением." --max-tokens 256

Ввод изображений работает так же с --image флагом — именно здесь мультимодальная модель оправдывает себя на ноутбуке, поскольку визуальная башня сохраняет более высокую точность в компоновке OrcaSAQ:

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "Опиши это изображение." --max-tokens 256

Для скрипта Python API имеет ту же форму, которую знают пользователи mlx-vlm:

from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "Опишите это изображение.", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))

держите --max-tokens умеренным. На нашем прогоне H200 с полевыми заметками, 2bit-lite выдаёт примерно 10 ток/с, так что ответ на 1 024 токена — уже двухминутное ожидание — и длинные выходы — это то, где бюджет KV и падение качества дают о себе знать (ниже). На ноутбуке вы должны ожидать, что это будет ощущаться медленнее, а не быстрее, пока не появится измеренный показатель.

Какое качество вы на самом деле получаете (измеряемая лестница)

Вот честная часть методички, и мы не будем её приукрашивать. OrcaSAQ плавно деградирует до 3 бит, а затем стоимость резко растёт. По сравнению с эталоном FP8 (перплексия 2.7797):

6-бит — перплексия 2.7864 (+0.24%), совпадение top-1 токенов 97.76%. Почти без потерь, как и заявлено.

4-bit — перплексия 2.8620 (+2.96%), top-1 96.13%. Рекомендуемый вариант по умолчанию.

3-bit — перплексия 3.0566 (+9.96%), top-1 92.06%. Агрессивно, но применимо.

2-битный — перплексия 4.3622 (+56.9%), top-1 86.56%. Реальная цена.

2bit-lite — perplexity 6.7018 (+141%), top-1 77.19%. Самая маленькая сборка и единственная, которая умещается в MacBook Pro.

Это измеренные значения из нашего собственного конвейера конвертации. 2bit-lite демонстрирует ухудшение перплексии на 141% и согласованность top-1 токенов ниже 78% — вы используете заметно деградированную модель, и описанные ниже сбои — это то, как эта деградация выглядит на практике. Это блестящее демо и разумный ассистент для коротких запросов; но это не замена модели полной точности.

Что касается скорости, мы обязаны быть с вами так же честны. Опубликованная полевая заметка — H200: ~10 tok/s, стабильный многоходовой диалог, для повседневных вопросов-ответов и коротких текстов — нормально. У нас пока нет измеренного показателя для MacBook Pro на 2bit-lite, и мы не собираемся его выдумывать — пропускная способность Apple Silicon здесь зависит от пропускной способности памяти, тепловых характеристик и покрытия ядер MLX для гибридного внимания, ни одно из которых мы не измеряли для этой сборки на этом ноутбуке. Ближайшая опубликованная точка данных для Apple Silicon, на которую мы можем указать, — это независимые ~450 tok/s для 4-битной сборки GLM-5.3-Flash на Mac с 512 ГБ под другим рантаймом MLX — другая сборка, другая точность и настольная машина, так что не стоит читать это и как вашу цифру. Планируйте медленную работу; приятно удивитесь, если окажется быстрее.

KV кэш и длинный контекст: учитывайте запас

GLM-5.3-Flash рекламирует контекстное окно в 1M токенов. Это число неактуально для данного оборудования, и руководство, утверждающее обратное, оказало бы вам медвежью услугу. Практическое замечание укладывается в одну строку: выделите среде выполнения достаточный бюджет KV для вашей целевой длины. На одном H200 2bit-lite оставляет около 39 ГБ запаса под KV-кэш после загрузки весов. На MacBook Pro с 128 ГБ арифметика суровее: ~102 ГБ весов против потолка ~112 ГБ оставляют порядка 26 ГБ до учёта собственного рабочего набора macOS — и гибридные слои линейного внимания делают объём KV-памяти этой модели небольшим по сравнению с плотной моделью такого размера, но он всё равно растёт линейно с ростом контекста.

Рекомендации по серверному инференсу от широкого сообщества подтверждают этот тезис: конфигурация, которая без проблем загружается с контекстом 8K, может исчерпать память на 128K. На ноутбуке держите контексты короткими — несколько тысяч токенов для вопросов-ответов или одно изображение — и не пытайтесь скормить ему книгу. Когда рабочей нагрузке действительно нужен длинный контекст, вы оказываетесь в последнем разделе этой статьи.

Генерация длинного кода ненадёжна при 2bit-lite (прочтите это дважды)

Это раздел, без которого руководство, скрывающее свои режимы отказа, было бы бесполезным, поэтому он заслуживает отдельного заголовка. Полевые заметки H200 недвусмысленны: обычные вопросы и ответы и короткие тексты получаются нормально, а длинная генерация кода при такой точности ненадёжна. Три режима отказа, воспроизведённых в ходе нашего проверочного прогона:

Повторяющиеся циклы — модель начинает повторять одни и те же строки или блоки вместо того, чтобы продвигаться вперёд, как правило, через несколько сотен токенов.

Отсутствует связующий код — импорты, связывание и обработка ошибок молча опущены. Сгенерированная функция выглядит правильно сама по себе, но не запускается, потому что окружающий каркас просто отсутствует.

Переписывание вместо точечной правки — вместо минимального изменения модель переписывает большие фрагменты файла, а результаты последовательных итераций противоречат друг другу.

Это воспроизводимо на 2bit-lite, и это именно то, что предсказывает согласие на 77% top-1. Что на самом деле делают практики, которые держат сборку для ноутбука под рукой:

• Используйте его для объяснений, суммаризации, вопросов и ответов и понимания изображений — коротких задач, где он действительно хорош.

• Если вам нужно попросить код, просите одну небольшую функцию за раз с явной сигнатурой, и проверяйте каждую перед тем, как двигаться дальше. Не передавайте ему целый файл и не просите добавить функцию.

• Для всего длительного — полного модуля, рефакторинга, долгой сессии агента — направляйте в API полной точности. Это не обходной путь; это правильная архитектура, и это последний раздел.

Когда вообще не следует этого делать: вместо этого вызовите z-ai/glm-5.3-flash

Comparison scoreboard titled 'GLM-5.3-Flash on a Mac — the scoreboard' contrasting the 2bit-lite MLX local build (102 GB weights on disk, 112 GB minimum RAM, +141% perplexity vs FP8, 77.19% top-1 agreement, unreliable long code generation, ~10 tok/s per H200 field note) against the hosted z-ai/glm-5.3-flash API (0 GB on disk, no RAM, FP8 reference quality, reliable long code, datacenter speed), with a footer noting quality is measured by OrcaRouter, speed is an H200 field note, and the API is at Z.ai launch pricing

Честное правило принятия решений: запускайте 2bit-lite на 128 ГБ M4/M5 Max MacBook Pro только тогда, когда вам нужна именно мультимодальная модель 320B на ноутбуке, который можно носить с собой — офлайн Q&A, приватные документы, понимание изображений без выхода данных за пределы устройства. Для всего остального выбирайте API:

Любой MacBook Pro с объемом менее 128 ГБ — для вас нет сборки. Не пытайтесь загрузить ее; используйте API.

Генерация длинного кода или рассуждения с длинным контекстом — 2bit-lite с этим стабильно не справляется. Используйте API.

Требовательная к качеству работа — 77.19% совпадений top-1 и +141% перплексии — это реальное падение, а не ошибка округления. Используйте API.

Гарантированная пропускная способность или предсказуемая задержка — измеренных показателей для ноутбука пока нет, а в полевых условиях — 10 tok/s. Используйте API.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash showing the model ID, 'by Z.ai - 2026-08-26', a 1M-token context window, text plus image plus video in / text out, 320B total / 18B active parameters, and the input/output price of $0.07 / $0.25 per million tokens

Хостируемая модель — это z-ai/glm-5.3-flash, предоставляемая с полной точностью на OrcaRouter по текущим ценам Z.ai — $0.07 за миллион входных токенов и $0.25 за миллион выходных токенов на момент написания (цены на период запуска; опубликованный прайс-лист Z.ai — $0.15 / $0.50). Это цена, указанная вендором, и она передается с нулевой наценкой, поэтому снижение цены Z.ai появляется у нас в тот же день. Вы получаете один API-ключ, который также работает с другими 200+ моделями, которые мы маршрутизируем, а автоматическое переключение означает, что эксперимент с этой новой моделью не ставит ваш продакшн-путь в зависимость от одного провайдера. За то же время, которое требуется для загрузки 102 ГБ и ожидания первой холодной генерации, API уже ответило на недельный объем вопросов — и отвечает на них с полной точностью.

Локальный инференс стоит того, когда причина локальна — конфиденциальность, офлайн-работа, отсутствие лимитов, демо, работающее от батареи. Он не стоит того с точки зрения затрат или качества ни по какой другой причине и вообще не стоит того на машине с объёмом памяти менее 128 ГБ.

Часто задаваемые вопросы

Может ли Mac с 64 или 96 ГБ памяти запустить GLM-5.3-Flash локально? Нет. Самая маленькая сборка, 2bit-lite, требует по меньшей мере около 112 ГБ с учётом накладных расходов macOS, и даже машине со 128 ГБ придётся поднять лимит несбрасываемой памяти, чтобы загрузить её. Если ваш Mac имеет менее 128 ГБ, локального пути не существует; используйте z-ai/glm-5.3-flash через API.

Я установил mlx-vlm, и модель не загружается — что не так? Две обычные причины, по порядку: версия ниже 0.6.17, которая предшествует поддержке glm5_next и не распознает архитектуру; и не поднятый лимит закреплённой памяти, потому что сборка ~102 ГБ не может выделить память при стандартном ограничении Metal в ~91–96 ГБ на Mac с 128 ГБ. Исправьте обе (обновите пакет, выполните sysctl), и она загрузится.

Является ли локальная сборка 2bit-lite той же моделью, что и API z-ai/glm-5.3-flash?Те же базовые веса GLM-5.3-Flash, но не то же качество. 2bit-lite — это 2-битное квантование с 77,19% совпадения токенов top-1 с эталоном FP8, а длинная генерация кода ненадёжна. API работает с полной точностью. Они взаимозаменяемы только для коротких задач, не требовательных к качеству.

Тридцатисекундная версия

Одна машина, одна сборка, один обязательный sysctl. Если у вас MacBook Pro M4/M5 Max на 128 ГБ: установите mlx-vlm>=0.6.17, скачайте только 2bit-lite/ (~102 ГБ), поднимите лимит wired-памяти с помощью sudo sysctl iogpu.wired_limit_mb=114688, и запустите mlx_vlm.generate — для Q&A, коротких текстов и изображений. Примите, что длинная генерация кода ненадёжна при такой точности, что измеренной пропускной способности ноутбука пока нет, и что Mac на 128 ГБ — это минимум, а не стандарт. Если любое из этих предостережений неприемлемо — или если память вашего Mac меньше 128 ГБ — та же модель с полной точностью доступна одним API-запросом на z-ai/glm-5.3-flash.

Не на Mac с 128 ГБ? z-ai/glm-5.3-flash предоставляет ту же модель в полной точности на OrcaRouter — один API-ключ, цены провайдера с нулевой наценкой и без скачивания 102 ГБ.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube