
Qwen3.8-27B-Uncensored-MLX на Apple Silicon: как выбрать сборку, загрузить её в LM Studio или mlx-vlm и обуздать контекст 262K
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Самое полезное, что нужно знать об orcarouter/Qwen3.8-27B-Uncensored-MLX, — это то, что вам не нужно выбирать подпапку для его запуска. Аблитерированная сборка OrcaRouter для Apple Silicon на основе Qwen/Qwen3.8-27B — опубликованная на Hugging Face 17 августа 2026 года, а значит, не новая, просто недостаточно документированная, — хранит копию 4-битной сборки в корне репозитория, специально для того, чтобы инструменты, которые рассматривают один репозиторий как одну модель, в первую очередь LM Studio, загружали её вообще без какой-либо настройки. Именно это решение — причина, по которой эта карточка набрала около 83 000 скачиваний за последний месяц, тогда как сопоставимые MLX-конвертации получают лишь малую долю от этого. Всё остальное в ней — это действительно выбор: какая из четырёх точностей помещается в унифицированную память вашего Mac, какой раннер вы используете, сохраняются ли зрение и вызов инструментов при вашей битности и оправдывает ли контекстное окно на 262 144 токена свою цену на вашем оборудовании. Этот ранбук последовательно проводит вас через эти решения. Это официальная документация — приведённые ниже размеры, точности и показатели соответствия оригиналу являются собственными данными OrcaRouter, измеренными именно на этой сборке, а каждое значение из сообщества помечено соответствующим образом.

Что именно находится в этом репозитории?
Это аблятированная сборка Qwen/Qwen3.8-27B — плотная модель на 27B параметров с гибридным вниманием (линейное внимание Gated DeltaNet плюс полное внимание), изначально vision-language, с управлением мышлением, вызовом инструментов, головой множественного предсказания токенов (MTP) и контекстным окном на 262 144 токена. Абляция убирает отказное поведение модели за счёт ортогонализации направления отказа из остаточного потока; если вы не знакомы с этим приёмом, лучше начать с нашего введения в эту технику, а не с этой страницы — она посвящена запуску сборки, а не методу. Веса распространяются под лицензией Apache-2.0, унаследованной от базовой модели.
Не путайте этот репозиторий с qwen-3-8-27b-mlx, который представляет собой ту же базовую модель в формате MLXбез аблитерации. Читатели регулярно скачивают один, имея в виду другой: этот — исследовательская сборка с удалёнными отказами; тот — обычный Qwen/Qwen3.8-27B на Apple Silicon. Проверьте название репозитория, прежде чем потратить время на загрузку.
Одна структурная деталь важнее, чем кажется: vision tower, все нормы и linear-attention conv1d остаются в BF16, и только линейные слои языковой модели — включая embed_tokens и lm_head — квантуются. Именно поэтому понимание изображений переживает квантование, и именно поэтому приведённые ниже размеры на диске немного больше, чем наивная оценка «27B при N битах»: часть модели никогда не сжимается.
Решение: какая сборка подходит для какого Mac

Четыре варианта точности поставляются в виде подпапок — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — всё это MLX-аффинное квантование с размером группы 64. Сборка 4-bit дополнительно продублирована в корне репозитория. Выбирайте в первую очередь по объёму унифицированной памяти вашего Mac, качество — во вторую.
• 8-bit — ~27,5 ГБ на диске, требует Mac с 64 ГБ (на машине с 32 ГБ его можно загрузить, но почти не останется места для чего-либо ещё). Измеренная косинусная точность относительно исходника BF16: 0,9997, практически без потерь. Выбирайте его, когда качество важнее всего, а памяти достаточно.
• 6-бит — ~22 ГБ, подходит для Mac с 24–32 ГБ. Точность 0.9996, отлично. Лучшее соотношение качества на гигабайт для большинства владельцев компьютеров с 48 ГБ.
• 4-bit — ~15 ГБ, комфортно работает на Mac с 24 ГБ. Точность 0.996, очень хорошо. Это наш рекомендуемый вариант по умолчанию, и именно эта копия находится в корне репозитория.
• 2-bit — ~8.7 ГБ, помещается на Mac с 16 ГБ. Точность 0.92, и при 27B она сильно деградирует: повторяющиеся циклы, искажённый текст, код и китайский, частичное зрение. На карточке прямо сказано: только для архива, не для реальной работы. Mac с 16 ГБ технически может её загрузить, но от этого она не становится пригодной.
Размер на диске — это не объём памяти. Веса должны помещаться в единую память вместе с macOS, KV-кэшем и служебными буферами Metal, так что оставляйте запас. В прогоне сообществом 4-битной сборки на Mac M1 Pro с 32 ГБ измерили ~16 ГБ весов на диске, но пиковое потребление при инференсе составило 18,5–21,7 ГБ; прогоны сообществом 8-битных сборок MLX сообщают о пиках около 34–36 ГБ, даже когда веса занимают ~29,5 ГБ. Рабочая рекомендация из того же теста сообщества: 16 ГБ — не реальный вариант для модели 27B, 24 ГБ можно попробовать с 4-бит и коротким контекстом, а 32 ГБ — комфортная отправная точка. Наша статья о планировании VRAM рассматривает те же расчёты для всего семейства.
Поскольку общий объём репозитория составляет примерно 94 ГБ для всех точностей, скачайте только нужную подпапку с помощью hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — подставив выбранную вами точность. Корневая копия 4-bit является дубликатом подпапки 4-bit, поэтому вам не нужно загружать обе.
Путь первый — LM Studio, нулевая настройка
Корневая 4-bit копия существует специально для того, чтобы LM Studio могла рассматривать весь репозиторий как одну модель. Найдите ID модели, выберите нужную точность (корневая копия — 4-bit), и приложение сделает всё остальное. Три подводных камня, все из нашей карточки, и именно они — вся разница между успехом и провалом:

• Репозиторий закрыт.Анонимные загрузки получают HTTP 401. Примите условия на странице модели, затем вставьте read-токен Hugging Face в настройках LM Studio: Settings → Integrations → Hugging Face. Если пропустить этот шаг, загрузка просто не удастся.
• Отключите квантование KV-кэша. MLX-модели для компьютерного зрения не поддерживают его на этой архитектуре, и при включении загрузка завершается ошибкой во время инициализации (отслеживается как mlx-engine#286). Это противоположно рекомендации для сборок GGUF, где квантование K/V-кэша является оправданной экономией VRAM — эти два формата здесь не взаимозаменяемы.
• Обновите среду выполнения. qwen3_5 — поддержка этой архитектуры появилась в mlx-vlm 0.6.x; более старая встроенная среда выполнения вообще не может загрузить эти веса. Значок «Likely too large» в LM Studio, напротив, всего лишь предупреждение об объёме ОЗУ, а не ошибка — игнорируйте его, если ваша унифицированная память соответствует приведённым выше рекомендациям.
Какую точность выбрать в LM Studio: 8-битная занимает ~29,5 ГБ на диске и требует Mac с 64 ГБ; 6-битная ~22 ГБ подходит для машины с 48 ГБ; 4-битная ~16 ГБ — правильный выбор для Mac с 32 ГБ. Если вы хотите использовать подход llama.cpp / Ollama на другом оборудовании, наше руководство по локальному запуску модели без цензуры рассматривает этот путь отдельно.
Путь второй — mlx-vlm и mlx-lm из подпапки
Путь через командную строку даёт вам точность напрямую и OpenAI-совместимый сервер для инструментов агентов. Требования: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 и mlx ≥ 0.32; бэкенд Metal выбирается автоматически на Apple Silicon). После загрузки указанной выше подпапки:
python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Объясните квантовую запутанность одним предложением." --max-tokens 256
Добавьте --image path/to/image.png для визуального ввода или предоставьте его:
python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080
For agent frameworks that speak OpenAI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.
Зрение переживает квантование.
Поскольку vision tower и conv1d остаются в BF16, понимание изображений сохраняется при 4/6/8-битном квантовании. На нашем пробном изображении — формы, цвета, положение, фон и текст на изображении — 4/6/8-битные сборки корректно описали всё; 2-битная справилась лишь частично. Если вы выбираете сборку и для вас важно качество vision, 4 бита — это самый низкий уровень, на который стоит опускаться. Мы не публиковали замеры пропускной способности vision для этой сборки на Apple Silicon, поэтому не доверяйте цифрам tok/s для неё, если только они не получены в именованном запуске на вашем собственном классе чипов.
Сохранённая зрительная башня также является частью поверхности риска, и об этом стоит сказать прямо: abliterated-модель, которая также может читать изображения, — это не проблема безопасности, ограничивающаяся только текстом.
Вызов инструментов и использование агентов
Вызов инструментов — это базовая возможность модели, и она сохраняется после abliteration, что делает эту сборку по-настоящему полезной для red-teaming агентных систем — и по-настоящему опасной, если направить её на реальные сервисы. Стандартная настройка — это конечная точка mlx_lm.server, указанная выше, к которой может обращаться любой агент, совместимый с OpenAI. Если вы действительно запускаете её как агента, поймите, что вы включили: модель без отказов с вызовом функций и контекстом 262K — это иной подход к безопасности, чем у чат-модели, и исследовательская направленность карточки существует именно поэтому.
Контекст 262K и его реальная стоимость
{{1}}Архитектура обеспечивает этой модели необычно дешёвый длинный контекст.{{/1}} {{2}}Гибридное внимание здесь означает 48 слоёв линейного внимания (Gated DeltaNet), перемежающихся с 16 слоями полного внимания,{{/2}} {{3}}и только 16 слоёв полного внимания имеют классический KV-кэш — линейные слои вместо этого хранят компактное рекуррентное состояние.{{/3}} {{4}}Таким образом, 262 144 токена стоят значительно меньше, чем на 27B с полным вниманием.{{/4}} {{5}}Это структурный факт о базовой модели, а не обещание насчёт вашего Mac.{{/5}}
На практике {{1}}окно контекста — это возможность, а не бесплатный уровень{{/1}}. Тест сообщества на длинном контексте на M4 Max показал {{2}}примерно 63 ток/с на коротком контексте с падением примерно до 11 ток/с при 31K токенах{{/2}} — {{3}}декодирование резко деградирует по мере заполнения кэша, и задержка первого токена на очень длинных промптах обычно является более серьёзным барьером, чем сырая пропускная способность{{/3}}. {{4}}Предзаполнение — как спекулятивное, так и на базе ANE — улучшает приём входных данных, а не декодирование{{/4}}. {{5}}Наши собственные цифры затрат на KV-кэш на Apple Silicon для этой сборки не опубликованы{{/5}}; {{6}}если вам нужны точные цифры для вашего оборудования, честным источником являются прогоны сообщества{{/6}}, и {{7}}консенсус сообщества состоит в том, чтобы рассматривать полные 262K как то, к чему обращаются осознанно, а не как настройку по умолчанию, которую оставляют включённой{{/7}}.
Скорость — что на самом деле измеряется
Мы публикуем ровно одну цифру скорости для этой сборки, и это не Apple Silicon: ~32–37 ток/с в установившемся режиме на одном H200 через бэкенд MLX CUDA, что подтверждает, что веса также работают за пределами macOS. На Mac наша карточка намеренно не публикует ток/с, потому что это зависит от чипа, точности и раннера. Практические цифры, которые стоит знать, все помечены соответствующим образом:
• Эта конкретная сборка, 4-битная, M1 Pro 32 ГБ: ~8.7 ток/с на генерации и ~41.7 ток/с на префилле при коротком прогоне (тест сообщества, август 2026). Более старый чип, но реалистичный минимум.
• oMLX с нативным MTP на M4 Max, стандартный не-abliterated чекпоинт: 53.3 tok/s для прозы и 72.1 tok/s для кода, с ~273.7 tok/s prefill при 4K; сырое декодирование без MTP ~24.6 tok/s. Измерено практикующим специалистом на другом чекпоинте и рантайме, так что рассматривайте это как верхнюю границу, к которой могут приблизиться abliterated веса, а не как гарантию.
oMLX dual-ANE prefill на M3 Ultra, abliterated oQ4e-MTP: prefill ускоряется примерно на 17,7% при 16K и на 18,9% при 32K, а декодирование через Lightning MTP достигает до ~75 tok/s при 16K. Предостережения реальны: используются приватные интерфейсы Apple runtime и приближённые INT8-веса, добавляется около 4 ГБ пиковой памяти, а время загрузки модели увеличивается с ~3,4 с до ~28 с. Это оптимизация приёма промпта, а не ускоритель генерации.
Головка MTP — бесплатное ускорение, если ваш раннер её поддерживает
Эта сборка содержит черновик с многотокеновым предсказанием базовой модели в mtp/ подпапке (архитектура qwen3_5_mtp), и она работает с любой основной точностью. Принятие без потерь — при жадном декодировании вывод идентичен работе без черновика — так что это настоящее ускорение без потери качества, когда он задействован. Два примечания по настройке из нашей карточки: требуется сборка mlx-vlm, которая включает qwen3_5_mtp черновик (ветка main ветка), и вы должны передать оба --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp и --draft-kind mtp. Установка mtp_enabled в одиночку ничего не делает. Если ваш раннер не поддерживает черновик, он игнорируется, и модель работает нормально — ничего не ломается.
Безопасность — прочтите это до запуска, а не после.
Дисклеймер самой карточки модели необычно прямолинеен, и эта страница не собирается его смягчать. Выравнивание безопасности в этой сборке было в значительной степени удалено. Она будет выполнять вредоносные, неэтичные, оскорбительные или незаконные запросы, от которых отказалась бы базовая Qwen/Qwen3.8-27B, и в ней нет значимых встроенных ограничителей. Она выпущена строго для легитимных исследований — интерпретируемости, изучения механизмов безопасности и отказа, red-teaming, оценки устойчивости и контролируемых экспериментов. Если вы занимаетесь не этим, эта модель вам не подходит.
Два предупреждения из карточки заслуживают особого внимания. Во-первых, джейлбрейк и проверки безопасности тривиально «срабатывают» на аблетированной модели, и это не является успешным прохождением оценки безопасности — это ожидаемое поведение модели, у которой удалено направление отказа. Отсутствие отказов не является свидетельством безопасности. Во-вторых, сохранённые зрение, вызов инструментов и контекст в 262K расширяют поверхность атаки на понимание изображений и агентное использование: нецензурированная модель, которая может читать скриншоты и вызывать инструменты, представляет более широкий риск, чем сборка только для чата с удалёнными отказами. Низкобитовая квантизация добавляет третий уровень нестабильности сверху — при 2-битах искажённый вывод можно даже принять за отказ, что само по себе является отдельным типом сбивающего с толку сбоя.
Вы берёте на себя полную ответственность за использование и результаты. Лицензия Apache-2.0 унаследована от базовой модели и не меняет этого: она разрешает использование, но не делает ваше развёртывание безопасным. Любой, кто развёртывает это для конечных пользователей, несовершеннолетних или в любой производственной среде, должен сначала добавить собственные уровни модерации, безопасности и предотвращения злоупотреблений, а также соблюдать применимое законодательство. Для исследователей, которые действительно запускают её, практические ограничения таковы: изолированная, в идеале офлайн, среда; инструменты-агенты, не направленные на реальные сервисы; отсутствие доступа для конечных пользователей; и проверка выходных данных, прежде чем они куда-либо попадут.
Когда локальное не является ответом
Локальность — вот суть этой сборки: веса лежат на вашем диске, нет платы за токен, и ничего не покидает машину. Но локальность — это и потолок: она работает только на Apple Silicon, приходится мириться с качеством квантования, и нет резервирования, если машина занята. Если вам нужна неаблатерированная модель класса 27B через API для реальной рабочей нагрузки или вы хотите A/B-сравнить эту локальную сборку с размещенной моделью на одних и тех же промптах — именно этот разрыв призван закрыть слой маршрутизации. OrcaRouter ставит более 200 моделей за одним API-ключом по ценам провайдера, с автоматическим переключением при сбое и DSL для маршрутизации; снижение цены вендора вступает в силу у нас в тот же день, когда оно анонсировано, потому что мы передаем цену без изменений. Один API, одна интеграция — и вы можете сравнить непроверенную локальную настройку с размещенной моделью, не заводя второй аккаунт. Мы не размещаем эту сборку MLX — по замыслу это локальные веса, — так что API дополняет этот путь, а не заменяет его.
Краткое руководство по принятию решений
• 16 ГБ Mac — честно, не эта модель. 2-битная версия помещается, но годится только для архива; так или иначе будете бороться с памятью. Обратите внимание на меньшую модель без цензуры или на созданную сообществом смешанную 3/6-битную конверсию для машин с 18–24 ГБ.
• Mac с 24 ГБ — 4-бит, и держите контекст коротким; не запускайте vision и длинный контекст одновременно.
• Mac на 32 ГБ — 4-бит — золотая середина; 6-бит, если контекст ограничен.
• 48 ГБ Mac — 6-бит с запасом; 8-бит, если не расширять окно.
• 64 ГБ и выше — 8-битный, почти без потерь и 262K контекст в пределах досягаемости с учетом указанных выше оговорок.
Это весь ранбук. Модель от 17 августа 2026 года — это не новость о запуске, и ей не обязательно быть таковой: 83 000 загрузок произошло потому, что людям нужна была инструкция, и эта страница — та самая инструкция. Начните в корне репозитория, загрузите 4-битную версию в LM Studio и отходите от сборки по умолчанию, только когда будете знать, чем платите за качество. Если вы пришли со стороны GGUF или FP8, соответствующие руководства описывают эти пути — здесь та же логика выбора, но не математика квантизации.
Это не очередная сборка этой модели — Qwen3.8-Flash-Next-Uncensored — это отдельный релиз: версия Qwen3.8-Flash-Next, прошедшая abliteration (сам Qwen3.8-Flash-Next — превью архитектуры Qwen4 со смесью экспертов: 176B в хранилище / 6B активных). Та же техника abliteration, другие веса, собственная коллекция.
Все шесть сборок 27B — BF16, GGUF, MLX, FP8, INT8 и NVFP4 — собраны в коллекции Qwen3.8-27B-Uncensored на Hugging Face.
Эти веса предназначены только для локального использования. Для размещённой базовой модели, с которой можно сравнить аблятированную сборку, Qwen3.8-27B доступна на OrcaRouter по цене провайдера с 0% наценкой — стандартная модель, с сохранённой настройкой безопасности.
