
Qwen3.8-27B с MLX на Apple Silicon: Да, это работает — вот что вам действительно нужно
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 за 1 млн токенов · 22 tok/s
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
Qwen3.8 27B сегодня работает на Apple Silicon через MLX. Тег — qwen3.8:27b-mlx в Ollama, добавлен в Ollama v0.32.12; размер загрузки 4-битной сборки — около 18 ГБ, и ей требуется примерно 16–19 ГБ унифицированной памяти, что делает Mac с 24 ГБ+ реалистичным минимумом, а Mac с 16 ГБ — непригодным. Веса распространяются под лицензией Apache 2.0 и бесплатны для использования на вашем собственном оборудовании — в этом и заключается весь смысл модели. Релиз Alibaba вышел два дня назад (13–14 августа 2026 года), поэтому каждая цифра ниже помечена: что взято из карточки модели Alibaba, что мы проверили на странице Ollama сегодня, а что является сторонним прогнозом или измерением.
30-секундный факт-лист
Qwen3.8 27B — это плотная модель Alibaba с 27 миллиардами параметров, выпущенная 13–14 августа 2026 года под лицензией Apache 2.0 — веса появились на Hugging Face и ModelScope 13-го числа, а файл LICENSE — на следующее утро. Это развёртываемая плотная родственная модель Qwen3.8-Max с 2,4 трлн параметров. Из карточки модели: все данные сообщены Alibaba и ещё не воспроизведены независимо:
• Размер — 27B dense, всего 27,78 млрд параметров с учетом визуального энкодера.
• Архитектура — 64 слоя, скрытый размер 5 120, словарь 248 320.
• Гибридное внимание — 16 слоёв полного внимания плюс 48 линейных слоёв Gated DeltaNet, соотношение 3:1.
• Контекст — 262,144 токена нативно, расширяется до 1M через YaRN (Ollama указывает тег на 256K).
• Вход — нативное понимание изображений и видео в дополнение к тексту, от документов до часового видео.
• Веса — 55.6 ГБ в BF16, включая голову MTP для спекулятивного декодирования.

Со стороны MLX, проверено сегодня: Ollama поставляет qwen3.8:27b-mlx — нативную сборку MLX для Apple Silicon с загрузкой ~18 ГБ в 4-битном формате — а в примечаниях к выпуску v0.32.12 отмечается оптимизация для Apple Silicon. mlx-lm — инструментарий Python от Apple — поддерживает эту архитектуру для генерации и конвертации, а MLX-квантизации (3/5/6-бит, плюс MXFP4 и NVFP4) появились в течение нескольких часов после выхода весов. Остальная часть статьи предполагает Mac на M-серии с 24 ГБ или более унифицированной памяти.
Что MLX меняет в памяти
На Apple Silicon нет отдельной видеопамяти. MLX работает с объединённым пулом памяти M-серии, поэтому ключевое значение имеет общий объём RAM вашего Mac за вычетом того, что занимают macOS и всё остальное. Модель, которая «помещается в 17 ГБ», требует машины с запасом заметно больше этого объёма.
Хорошая новость в том, что Qwen3.8 27B обходится дешевле в содержании, чем можно предположить по количеству параметров. Поскольку KV-кэш хранят только 16 слоёв полного внимания, а 48 линейных слоёв — нет, стоимость кэша составляет около 64 КБ на токен — примерно четверть того, что платит обычная 64-слойная плотная модель. На другом конце спектра для полного окна в 262K требуется около 16,4 ГБ кэша в дополнение к весам — это серверный бюджет, а не бюджет ноутбука.
Реалистичная лестница для Mac, размер файла плюс запас кэша:
• 4-битный MLX — всего ~16–19 ГБ. Помещается на Mac с 24 ГБ с окном примерно 64K–96K; разумный выбор по умолчанию.
• 6-битный MLX — ~21–22 ГБ. Для машин с 32 ГБ; прирост качества по сравнению с 4-битным незначителен.
• 8-битный MLX — ~27–30 ГБ. Для машин с 48+ ГБ; почти без потерь.
• BF16 — ~55,6 ГБ. Только топовые студийные машины M-series Max и Ultra.

Источники: значение для 4-бит соответствует измеренному GGUF Q4_K_M (17.1 ГБ, unsloth, 14 августа) и загрузке Ollama на 18 ГБ; значения для 8-бит и BF16 соответствуют собственной карте Alibaba с BF16 и линейке Qwen3.6-27B. Значение кэша 64 КБ на токен выведено из архитектуры, а не из спецификации, и применимо только к средам выполнения, которые пропускают KV-кэш на линейных слоях так же, как это делает MLX.
Три способа запуска, от самого простого до максимального контроля.
Путь A — Ollama, самый простой.
Обновите до Ollama 0.32.12 или новее, затем:
• ollama pull qwen3.8:27b-mlx — загружает сборку MLX объемом ~18 ГБ.
• ollama run qwen3.8:27b-mlx — интерактивный чат с подключённым шаблоном мышления.
• ollama serve — предоставляет OpenAI-совместимый API на localhost:11434 для ваших приложений.

Один известный недостаток, взятый из открытого GitHub issue на момент написания: qwen3.8:27b-mlx отклоняет роль "developer" на конечной точке /v1/responses, что ломает ollama launch codex для этой модели — в то время как прямой ollama run работает нормально. Если вы строите агентный цикл в стиле Codex на MLX-сборке, протестируйте именно ту конечную точку, которую планируете использовать, прежде чем строить на ней цикл.
Путь B — mlx-lm, максимальный контроль
Собственный инструментарий Apple. Установите его с помощью pip install mlx-lm, а затем либо скачайте предварительно квантованный чекпойнт MLX, либо преобразуйте официальные веса BF16 самостоятельно:
• mlx_lm.generate --model <checkpoint> — запустите чекпоинт напрямую; 4-битные и 8-битные квантизации 27B от сообщества продолжали появляться в mlx-community в течение нескольких дней после релиза.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — конвертация выполняется один раз; по стоимости это примерно как одна загрузка.
• mlx_lm.server --model <checkpoint> — OpenAI-совместимый сервер, который применяет шаблон чата с блоком мышления за вас.
If the exact quant you want is not up yet, converting from the official weights is a short job on any M-series Mac and removes any doubt about what a third party shipped.
Путь C — LM Studio, в один клик
LM Studio использует бэкенд MLX на Apple Silicon и добавила поддержку Qwen3.8 27B сразу после релиза: найдите модель, выберите подходящий под вашу оперативную память квант — и она скачается и запустится. Если вы предпочитаете графический интерфейс, это самый удобный вариант, а наше сопутствующее руководство описывает его от начала до конца — см. «Как запустить Qwen3.8 27B локально» в связанных материалах ниже.
Ловушка шаблона
Qwen3.8 27B по умолчанию думает, и think-блоки рендерятся шаблоном чата, а не ядром модели. Стороннее тестирование за первые 48 часов отмечает, что официальный шаблон оборачивает каждый ход ассистента в think-блок, даже пустой, и что в многоходовых циклах агента блоки вкладываются друг в друга, а история усекается, что воспринимается как амнезия. Дело не в квантовании. Если рантайм поставляет исправленный шаблон, используйте его; когда вы строите цикл агента и рассуждения не нужны, отключайте thinking для каждого запроса — шаблон чата предоставляет флаг enable_thinking, а модель принимает reasoning_effort со значениями xhigh, medium или low.
Каково это на самом деле
Независимый тест на Mac mini M4 с 32 ГБ унифицированной памяти, запускавший сборку MLX с 4-битным квантованием, показал примерно 5–6 токенов/с генерации. Именно эту цифру стоит принимать за ориентир: она приемлема для интерактивного черновика, длинных рассуждений и редких вызовов агента, но мучительна для длительных агентских циклов и пакетных заданий. Анекдот того же тестировщика — многоиминутное обдумывание с последующим небольшим приложением, которое выглядело правильно, но на самом деле не сходилось, — хорошее напоминание о том, что модель 27B на ноутбуке — это способный, но не безошибочный помощник.
Скорость зависит от уровня чипа: M-series Max с большей пропускной способностью памяти и большим числом ядер работает заметно быстрее, чем базовый M4 в mini. Но 5–6 tok/s на базовой модели — это честный базовый показатель, и любой заголовок вроде «работает на Apple Silicon» следует оценивать относительно него.
Контекст 262K — это серверная функция.
Родное окно контекста в 262K у Qwen3.8 27B действительно полезно — но на Mac оно ограничено памятью, а не моделью. При 64 КБ KV-кэша на токен окно 8K обходится примерно в 0,5 ГБ, 32K — в 2 ГБ, 128K — в 8 ГБ, а полные 262K — в 16,4 ГБ поверх весов. На машине с 24 ГБ памяти в 4-битном режиме реалистичный потолок — примерно 64K–96K токенов; стремление к 128K+ означает машину с 32 ГБ+, а полное окно — машину, чья унифицированная память почти полностью занята кэшем. Планируйте контекст, который вам действительно нужен, и ограничивайте его в конфигурации рантайма — модель довольна, а ваш файл подкачки остаётся в покое.
Когда Apple Silicon — неправильный ответ
Выберите другой путь, если ваш рабочий нагрузка соответствует любому из этих случаев:
• У вас Mac на 8 или 16 ГБ. 4-битная сборка уже требует ~17 ГБ единой памяти; всё, что меньше, приводит к подкачке, и модель становится непригодной. Это самая распространённая ошибка, и никакие уловки с квантованием её не исправят.
• Вам нужен полный контекст на 262K или расширение YaRN на 1M. Этот KV-бюджет — бюджет для сервера, а не для ноутбука.
• Вы обслуживаете других людей. Ноутбук — это одно место; для многопользовательской нагрузки нужен GPU-сервер или размещённый API.
• Вам нужно действовать быстро в длинных агентных циклах. 5–6 tok/s — нормально для человека, читающего по ходу, но медленно для субагента.
Честная формулировка: фишка Qwen3.8 27B в том, что он бесплатен в момент использования на вашем собственном оборудовании — в отличие от API-моделей, которые берут плату за каждый токен. Именно поэтому его нет в каталоге OrcaRouter (каталог маршрутизирует более раннее поколение Qwen3.6/3.5-27B и хостируемую линию API Qwen). Мы — не тот инструмент для истории про бесплатный локальный запуск, и в этом вся суть: когда рабочая нагрузка перерастает возможности Mac, альтернативы — это GPU-бокс, арендованный GPU или хостируемый API Qwen, а не роутер, который так уж получилось, поддерживает именно эту 27B.
Суть
Qwen3.8 27B на Apple Silicon — это реальность, он хорош, но сфера его применения узка. Сборка 4-bit MLX умещается в Mac с 24 ГБ+ памяти, загружается как qwen3.8:27b-mlx в Ollama, ничего не стоит за токен и является первой по-настоящему пригодной для использования открытой моделью агентного уровня, которая умещается в ноутбуке. Компромиссы — скорость (5–6 ток/с на M4 mini) и контекст (ограничивайте его значительно ниже 262K, если у вас нет достаточного объёма ОЗУ). Если у вас Mac с 24 ГБ+ и нагрузка, которую может потянуть 27B, это лучшая бесплатная локальная модель на этой неделе. Если у вас Mac с 16 ГБ или вам нужна пропускная способность для продакшена, это не ваш вариант — а альтернатива в виде платного пути — это совершенно другое решение.
