Титульная карточка для Qwen3.8-27B с MLX на Apple Silicon, на которой изображены минималистичная иконка ноутбука со значком движка MLX и ценник с надписью «бесплатно», на вашем Mac.
Guides & Insights

Qwen3.8-27B с MLX на Apple Silicon: Да, это работает — вот что вам действительно нужно

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen3.8 27B сегодня работает на Apple Silicon через MLX. Тег — qwen3.8:27b-mlx в Ollama, добавлен в Ollama v0.32.12; размер загрузки 4-битной сборки — около 18 ГБ, и ей требуется примерно 16–19 ГБ унифицированной памяти, что делает Mac с 24 ГБ+ реалистичным минимумом, а Mac с 16 ГБ — непригодным. Веса распространяются под лицензией Apache 2.0 и бесплатны для использования на вашем собственном оборудовании — в этом и заключается весь смысл модели. Релиз Ali​baba вышел два дня назад (13–14 августа 2026 года), поэтому каждая цифра ниже помечена: что взято из карточки модели Ali​baba, что мы проверили на странице Ollama сегодня, а что является сторонним прогнозом или измерением.

30-секундный факт-лист

Qwen3.8 27B — это плотная модель Ali​baba с 27 миллиардами параметров, выпущенная 13–14 августа 2026 года под лицензией Apache 2.0 — веса появились на Hugging Face и ModelScope 13-го числа, а файл LICENSE — на следующее утро. Это развёртываемая плотная родственная модель Qwen3.8-Max с 2,4 трлн параметров. Из карточки модели: все данные сообщены Ali​baba и ещё не воспроизведены независимо:

Размер — 27B dense, всего 27,78 млрд параметров с учетом визуального энкодера.

Архитектура — 64 слоя, скрытый размер 5 120, словарь 248 320.

Гибридное внимание — 16 слоёв полного внимания плюс 48 линейных слоёв Gated DeltaNet, соотношение 3:1.

Контекст — 262,144 токена нативно, расширяется до 1M через YaRN (Ollama указывает тег на 256K).

Вход — нативное понимание изображений и видео в дополнение к тексту, от документов до часового видео.

Веса — 55.6 ГБ в BF16, включая голову MTP для спекулятивного декодирования.

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

Со стороны MLX, проверено сегодня: Ollama поставляет qwen3.8:27b-mlx — нативную сборку MLX для Apple Silicon с загрузкой ~18 ГБ в 4-битном формате — а в примечаниях к выпуску v0.32.12 отмечается оптимизация для Apple Silicon. mlx-lm — инструментарий Python от Apple — поддерживает эту архитектуру для генерации и конвертации, а MLX-квантизации (3/5/6-бит, плюс MXFP4 и NVFP4) появились в течение нескольких часов после выхода весов. Остальная часть статьи предполагает Mac на M-серии с 24 ГБ или более унифицированной памяти.

Что MLX меняет в памяти

На Apple Silicon нет отдельной видеопамяти. MLX работает с объединённым пулом памяти M-серии, поэтому ключевое значение имеет общий объём RAM вашего Mac за вычетом того, что занимают macOS и всё остальное. Модель, которая «помещается в 17 ГБ», требует машины с запасом заметно больше этого объёма.

Хорошая новость в том, что Qwen3.8 27B обходится дешевле в содержании, чем можно предположить по количеству параметров. Поскольку KV-кэш хранят только 16 слоёв полного внимания, а 48 линейных слоёв — нет, стоимость кэша составляет около 64 КБ на токен — примерно четверть того, что платит обычная 64-слойная плотная модель. На другом конце спектра для полного окна в 262K требуется около 16,4 ГБ кэша в дополнение к весам — это серверный бюджет, а не бюджет ноутбука.

Реалистичная лестница для Mac, размер файла плюс запас кэша:

4-битный MLX — всего ~16–19 ГБ. Помещается на Mac с 24 ГБ с окном примерно 64K–96K; разумный выбор по умолчанию.

6-битный MLX — ~21–22 ГБ. Для машин с 32 ГБ; прирост качества по сравнению с 4-битным незначителен.

8-битный MLX — ~27–30 ГБ. Для машин с 48+ ГБ; почти без потерь.

BF16 — ~55,6 ГБ. Только топовые студийные машины M-series Max и Ultra.

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

Источники: значение для 4-бит соответствует измеренному GGUF Q4_K_M (17.1 ГБ, unsloth, 14 августа) и загрузке Ollama на 18 ГБ; значения для 8-бит и BF16 соответствуют собственной карте Ali​baba с BF16 и линейке Qwen3.6-27B. Значение кэша 64 КБ на токен выведено из архитектуры, а не из спецификации, и применимо только к средам выполнения, которые пропускают KV-кэш на линейных слоях так же, как это делает MLX.

Три способа запуска, от самого простого до максимального контроля.

Путь A — Ollama, самый простой.

Обновите до Ollama 0.32.12 или новее, затем:

ollama pull qwen3.8:27b-mlx — загружает сборку MLX объемом ~18 ГБ.

ollama run qwen3.8:27b-mlx — интерактивный чат с подключённым шаблоном мышления.

ollama serve — предоставляет OpenAI-совместимый API на localhost:11434 для ваших приложений.

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

Один известный недостаток, взятый из открытого GitHub issue на момент написания: qwen3.8:27b-mlx отклоняет роль "developer" на конечной точке /v1/responses, что ломает ollama launch codex для этой модели — в то время как прямой ollama run работает нормально. Если вы строите агентный цикл в стиле Codex на MLX-сборке, протестируйте именно ту конечную точку, которую планируете использовать, прежде чем строить на ней цикл.

Путь B — mlx-lm, максимальный контроль

Собственный инструментарий Apple. Установите его с помощью pip install mlx-lm, а затем либо скачайте предварительно квантованный чекпойнт MLX, либо преобразуйте официальные веса BF16 самостоятельно:

mlx_lm.generate --model <checkpoint> — запустите чекпоинт напрямую; 4-битные и 8-битные квантизации 27B от сообщества продолжали появляться в mlx-community в течение нескольких дней после релиза.

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — конвертация выполняется один раз; по стоимости это примерно как одна загрузка.

mlx_lm.server --model <checkpoint> — OpenAI-совместимый сервер, который применяет шаблон чата с блоком мышления за вас.

If the exact quant you want is not up yet, converting from the official weights is a short job on any M-series Mac and removes any doubt about what a third party shipped.

Путь C — LM Studio, в один клик

LM Studio использует бэкенд MLX на Apple Silicon и добавила поддержку Qwen3.8 27B сразу после релиза: найдите модель, выберите подходящий под вашу оперативную память квант — и она скачается и запустится. Если вы предпочитаете графический интерфейс, это самый удобный вариант, а наше сопутствующее руководство описывает его от начала до конца — см. «Как запустить Qwen3.8 27B локально» в связанных материалах ниже.

Ловушка шаблона

Qwen3.8 27B по умолчанию думает, и think-блоки рендерятся шаблоном чата, а не ядром модели. Стороннее тестирование за первые 48 часов отмечает, что официальный шаблон оборачивает каждый ход ассистента в think-блок, даже пустой, и что в многоходовых циклах агента блоки вкладываются друг в друга, а история усекается, что воспринимается как амнезия. Дело не в квантовании. Если рантайм поставляет исправленный шаблон, используйте его; когда вы строите цикл агента и рассуждения не нужны, отключайте thinking для каждого запроса — шаблон чата предоставляет флаг enable_thinking, а модель принимает reasoning_effort со значениями xhigh, medium или low.

Каково это на самом деле

Независимый тест на Mac mini M4 с 32 ГБ унифицированной памяти, запускавший сборку MLX с 4-битным квантованием, показал примерно 5–6 токенов/с генерации. Именно эту цифру стоит принимать за ориентир: она приемлема для интерактивного черновика, длинных рассуждений и редких вызовов агента, но мучительна для длительных агентских циклов и пакетных заданий. Анекдот того же тестировщика — многоиминутное обдумывание с последующим небольшим приложением, которое выглядело правильно, но на самом деле не сходилось, — хорошее напоминание о том, что модель 27B на ноутбуке — это способный, но не безошибочный помощник.

Скорость зависит от уровня чипа: M-series Max с большей пропускной способностью памяти и большим числом ядер работает заметно быстрее, чем базовый M4 в mini. Но 5–6 tok/s на базовой модели — это честный базовый показатель, и любой заголовок вроде «работает на Apple Silicon» следует оценивать относительно него.

Контекст 262K — это серверная функция.

Родное окно контекста в 262K у Qwen3.8 27B действительно полезно — но на Mac оно ограничено памятью, а не моделью. При 64 КБ KV-кэша на токен окно 8K обходится примерно в 0,5 ГБ, 32K — в 2 ГБ, 128K — в 8 ГБ, а полные 262K — в 16,4 ГБ поверх весов. На машине с 24 ГБ памяти в 4-битном режиме реалистичный потолок — примерно 64K–96K токенов; стремление к 128K+ означает машину с 32 ГБ+, а полное окно — машину, чья унифицированная память почти полностью занята кэшем. Планируйте контекст, который вам действительно нужен, и ограничивайте его в конфигурации рантайма — модель довольна, а ваш файл подкачки остаётся в покое.

Когда Apple Silicon — неправильный ответ

Выберите другой путь, если ваш рабочий нагрузка соответствует любому из этих случаев:

• У вас Mac на 8 или 16 ГБ. 4-битная сборка уже требует ~17 ГБ единой памяти; всё, что меньше, приводит к подкачке, и модель становится непригодной. Это самая распространённая ошибка, и никакие уловки с квантованием её не исправят.

• Вам нужен полный контекст на 262K или расширение YaRN на 1M. Этот KV-бюджет — бюджет для сервера, а не для ноутбука.

• Вы обслуживаете других людей. Ноутбук — это одно место; для многопользовательской нагрузки нужен GPU-сервер или размещённый API.

• Вам нужно действовать быстро в длинных агентных циклах. 5–6 tok/s — нормально для человека, читающего по ходу, но медленно для субагента.

Честная формулировка: фишка Qwen3.8 27B в том, что он бесплатен в момент использования на вашем собственном оборудовании — в отличие от API-моделей, которые берут плату за каждый токен. Именно поэтому его нет в каталоге OrcaRouter (каталог маршрутизирует более раннее поколение Qwen3.6/3.5-27B и хостируемую линию API Qwen). Мы — не тот инструмент для истории про бесплатный локальный запуск, и в этом вся суть: когда рабочая нагрузка перерастает возможности Mac, альтернативы — это GPU-бокс, арендованный GPU или хостируемый API Qwen, а не роутер, который так уж получилось, поддерживает именно эту 27B.

Суть

Qwen3.8 27B на Apple Silicon — это реальность, он хорош, но сфера его применения узка. Сборка 4-bit MLX умещается в Mac с 24 ГБ+ памяти, загружается как qwen3.8:27b-mlx в Ollama, ничего не стоит за токен и является первой по-настоящему пригодной для использования открытой моделью агентного уровня, которая умещается в ноутбуке. Компромиссы — скорость (5–6 ток/с на M4 mini) и контекст (ограничивайте его значительно ниже 262K, если у вас нет достаточного объёма ОЗУ). Если у вас Mac с 24 ГБ+ и нагрузка, которую может потянуть 27B, это лучшая бесплатная локальная модель на этой неделе. Если у вас Mac с 16 ГБ или вам нужна пропускная способность для продакшена, это не ваш вариант — а альтернатива в виде платного пути — это совершенно другое решение.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube