Главная карточка-заголовок для статьи 'Qwen3.8-27B-Uncensored-MLX on Apple Silicon', показывающая заголовок 'Qwen3.8-27B-Uncensored-MLX', подзаголовок 'The Apple Silicon Runbook', ряд чипов квантизации с маркировкой 2-bit, 4-bit, 6-bit и 8-bit, где 4-bit выделен, стилизованное окно LM Studio, отображающее '4-bit build at repo root', и мотив контекста 262K, с логотипом OrcaRouter, скомпонованным в углу.
Guides & Insights

Qwen3.8-27B-Uncensored-MLX на Apple Silicon: как выбрать сборку, загрузить её в LM Studio или mlx-vlm и обуздать контекст 262K

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самое полезное, что нужно знать об orcarouter/Qwen3.8-27B-Uncensored-MLX, — это то, что вам не нужно выбирать подпапку для его запуска. Аблитерированная сборка OrcaRouter для Apple Silicon на основе Qw​en/Qwen3.8-27B — опубликованная на Hugging Face 17 августа 2026 года, а значит, не новая, просто недостаточно документированная, — хранит копию 4-битной сборки в корне репозитория, специально для того, чтобы инструменты, которые рассматривают один репозиторий как одну модель, в первую очередь LM Studio, загружали её вообще без какой-либо настройки. Именно это решение — причина, по которой эта карточка набрала около 83 000 скачиваний за последний месяц, тогда как сопоставимые MLX-конвертации получают лишь малую долю от этого. Всё остальное в ней — это действительно выбор: какая из четырёх точностей помещается в унифицированную память вашего Mac, какой раннер вы используете, сохраняются ли зрение и вызов инструментов при вашей битности и оправдывает ли контекстное окно на 262 144 токена свою цену на вашем оборудовании. Этот ранбук последовательно проводит вас через эти решения. Это официальная документация — приведённые ниже размеры, точности и показатели соответствия оригиналу являются собственными данными OrcaRouter, измеренными именно на этой сборке, а каждое значение из сообщества помечено соответствующим образом.

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

Что именно находится в этом репозитории?

Это аблятированная сборка Qw​en/Qwen3.8-27B — плотная модель на 27B параметров с гибридным вниманием (линейное внимание Gated DeltaNet плюс полное внимание), изначально vision-language, с управлением мышлением, вызовом инструментов, головой множественного предсказания токенов (MTP) и контекстным окном на 262 144 токена. Абляция убирает отказное поведение модели за счёт ортогонализации направления отказа из остаточного потока; если вы не знакомы с этим приёмом, лучше начать с нашего введения в эту технику, а не с этой страницы — она посвящена запуску сборки, а не методу. Веса распространяются под лицензией Apache-2.0, унаследованной от базовой модели.

Не путайте этот репозиторий с qwen-3-8-27b-mlx, который представляет собой ту же базовую модель в формате MLXбез аблитерации. Читатели регулярно скачивают один, имея в виду другой: этот — исследовательская сборка с удалёнными отказами; тот — обычный Qw​en/Qwen3.8-27B на Apple Silicon. Проверьте название репозитория, прежде чем потратить время на загрузку.

Одна структурная деталь важнее, чем кажется: vision tower, все нормы и linear-attention conv1d остаются в BF16, и только линейные слои языковой модели — включая embed_tokens и lm_head — квантуются. Именно поэтому понимание изображений переживает квантование, и именно поэтому приведённые ниже размеры на диске немного больше, чем наивная оценка «27B при N битах»: часть модели никогда не сжимается.

Решение: какая сборка подходит для какого Mac

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

Четыре варианта точности поставляются в виде подпапок — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — всё это MLX-аффинное квантование с размером группы 64. Сборка 4-bit дополнительно продублирована в корне репозитория. Выбирайте в первую очередь по объёму унифицированной памяти вашего Mac, качество — во вторую.

8-bit — ~27,5 ГБ на диске, требует Mac с 64 ГБ (на машине с 32 ГБ его можно загрузить, но почти не останется места для чего-либо ещё). Измеренная косинусная точность относительно исходника BF16: 0,9997, практически без потерь. Выбирайте его, когда качество важнее всего, а памяти достаточно.

6-бит — ~22 ГБ, подходит для Mac с 24–32 ГБ. Точность 0.9996, отлично. Лучшее соотношение качества на гигабайт для большинства владельцев компьютеров с 48 ГБ.

4-bit — ~15 ГБ, комфортно работает на Mac с 24 ГБ. Точность 0.996, очень хорошо. Это наш рекомендуемый вариант по умолчанию, и именно эта копия находится в корне репозитория.

2-bit — ~8.7 ГБ, помещается на Mac с 16 ГБ. Точность 0.92, и при 27B она сильно деградирует: повторяющиеся циклы, искажённый текст, код и китайский, частичное зрение. На карточке прямо сказано: только для архива, не для реальной работы. Mac с 16 ГБ технически может её загрузить, но от этого она не становится пригодной.

Размер на диске — это не объём памяти. Веса должны помещаться в единую память вместе с macOS, KV-кэшем и служебными буферами Metal, так что оставляйте запас. В прогоне сообществом 4-битной сборки на Mac M1 Pro с 32 ГБ измерили ~16 ГБ весов на диске, но пиковое потребление при инференсе составило 18,5–21,7 ГБ; прогоны сообществом 8-битных сборок MLX сообщают о пиках около 34–36 ГБ, даже когда веса занимают ~29,5 ГБ. Рабочая рекомендация из того же теста сообщества: 16 ГБ — не реальный вариант для модели 27B, 24 ГБ можно попробовать с 4-бит и коротким контекстом, а 32 ГБ — комфортная отправная точка. Наша статья о планировании VRAM рассматривает те же расчёты для всего семейства.

Поскольку общий объём репозитория составляет примерно 94 ГБ для всех точностей, скачайте только нужную подпапку с помощью hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — подставив выбранную вами точность. Корневая копия 4-bit является дубликатом подпапки 4-bit, поэтому вам не нужно загружать обе.

Путь первый — LM Studio, нулевая настройка

Корневая 4-bit копия существует специально для того, чтобы LM Studio могла рассматривать весь репозиторий как одну модель. Найдите ID модели, выберите нужную точность (корневая копия — 4-bit), и приложение сделает всё остальное. Три подводных камня, все из нашей карточки, и именно они — вся разница между успехом и провалом:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

Репозиторий закрыт.Анонимные загрузки получают HTTP 401. Примите условия на странице модели, затем вставьте read-токен Hugging Face в настройках LM Studio: Settings → Integrations → Hugging Face. Если пропустить этот шаг, загрузка просто не удастся.

Отключите квантование KV-кэша. MLX-модели для компьютерного зрения не поддерживают его на этой архитектуре, и при включении загрузка завершается ошибкой во время инициализации (отслеживается как mlx-engine#286). Это противоположно рекомендации для сборок GGUF, где квантование K/V-кэша является оправданной экономией VRAM — эти два формата здесь не взаимозаменяемы.

Обновите среду выполнения. qwen3_5 — поддержка этой архитектуры появилась в mlx-vlm 0.6.x; более старая встроенная среда выполнения вообще не может загрузить эти веса. Значок «Likely too large» в LM Studio, напротив, всего лишь предупреждение об объёме ОЗУ, а не ошибка — игнорируйте его, если ваша унифицированная память соответствует приведённым выше рекомендациям.

Какую точность выбрать в LM Studio: 8-битная занимает ~29,5 ГБ на диске и требует Mac с 64 ГБ; 6-битная ~22 ГБ подходит для машины с 48 ГБ; 4-битная ~16 ГБ — правильный выбор для Mac с 32 ГБ. Если вы хотите использовать подход llama.cpp / Ollama на другом оборудовании, наше руководство по локальному запуску модели без цензуры рассматривает этот путь отдельно.

Путь второй — mlx-vlm и mlx-lm из подпапки

Путь через командную строку даёт вам точность напрямую и Open​AI-совместимый сервер для инструментов агентов. Требования: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 и mlx ≥ 0.32; бэкенд Metal выбирается автоматически на Apple Silicon). После загрузки указанной выше подпапки:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Объясните квантовую запутанность одним предложением." --max-tokens 256

Добавьте --image path/to/image.png для визуального ввода или предоставьте его:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

Зрение переживает квантование.

Поскольку vision tower и conv1d остаются в BF16, понимание изображений сохраняется при 4/6/8-битном квантовании. На нашем пробном изображении — формы, цвета, положение, фон и текст на изображении — 4/6/8-битные сборки корректно описали всё; 2-битная справилась лишь частично. Если вы выбираете сборку и для вас важно качество vision, 4 бита — это самый низкий уровень, на который стоит опускаться. Мы не публиковали замеры пропускной способности vision для этой сборки на Apple Silicon, поэтому не доверяйте цифрам tok/s для неё, если только они не получены в именованном запуске на вашем собственном классе чипов.

Сохранённая зрительная башня также является частью поверхности риска, и об этом стоит сказать прямо: abliterated-модель, которая также может читать изображения, — это не проблема безопасности, ограничивающаяся только текстом.

Вызов инструментов и использование агентов

Вызов инструментов — это базовая возможность модели, и она сохраняется после abliteration, что делает эту сборку по-настоящему полезной для red-teaming агентных систем — и по-настоящему опасной, если направить её на реальные сервисы. Стандартная настройка — это конечная точка mlx_lm.server, указанная выше, к которой может обращаться любой агент, совместимый с OpenAI. Если вы действительно запускаете её как агента, поймите, что вы включили: модель без отказов с вызовом функций и контекстом 262K — это иной подход к безопасности, чем у чат-модели, и исследовательская направленность карточки существует именно поэтому.

Контекст 262K и его реальная стоимость

{{1}}Архитектура обеспечивает этой модели необычно дешёвый длинный контекст.{{/1}} {{2}}Гибридное внимание здесь означает 48 слоёв линейного внимания (Gated DeltaNet), перемежающихся с 16 слоями полного внимания,{{/2}} {{3}}и только 16 слоёв полного внимания имеют классический KV-кэш — линейные слои вместо этого хранят компактное рекуррентное состояние.{{/3}} {{4}}Таким образом, 262 144 токена стоят значительно меньше, чем на 27B с полным вниманием.{{/4}} {{5}}Это структурный факт о базовой модели, а не обещание насчёт вашего Mac.{{/5}}

На практике {{1}}окно контекста — это возможность, а не бесплатный уровень{{/1}}. Тест сообщества на длинном контексте на M4 Max показал {{2}}примерно 63 ток/с на коротком контексте с падением примерно до 11 ток/с при 31K токенах{{/2}} — {{3}}декодирование резко деградирует по мере заполнения кэша, и задержка первого токена на очень длинных промптах обычно является более серьёзным барьером, чем сырая пропускная способность{{/3}}. {{4}}Предзаполнение — как спекулятивное, так и на базе ANE — улучшает приём входных данных, а не декодирование{{/4}}. {{5}}Наши собственные цифры затрат на KV-кэш на Apple Silicon для этой сборки не опубликованы{{/5}}; {{6}}если вам нужны точные цифры для вашего оборудования, честным источником являются прогоны сообщества{{/6}}, и {{7}}консенсус сообщества состоит в том, чтобы рассматривать полные 262K как то, к чему обращаются осознанно, а не как настройку по умолчанию, которую оставляют включённой{{/7}}.

Скорость — что на самом деле измеряется

Мы публикуем ровно одну цифру скорости для этой сборки, и это не Apple Silicon: ~32–37 ток/с в установившемся режиме на одном H200 через бэкенд MLX CUDA, что подтверждает, что веса также работают за пределами macOS. На Mac наша карточка намеренно не публикует ток/с, потому что это зависит от чипа, точности и раннера. Практические цифры, которые стоит знать, все помечены соответствующим образом:

• Эта конкретная сборка, 4-битная, M1 Pro 32 ГБ: ~8.7 ток/с на генерации и ~41.7 ток/с на префилле при коротком прогоне (тест сообщества, август 2026). Более старый чип, но реалистичный минимум.

• oMLX с нативным MTP на M4 Max, стандартный не-abliterated чекпоинт: 53.3 tok/s для прозы и 72.1 tok/s для кода, с ~273.7 tok/s prefill при 4K; сырое декодирование без MTP ~24.6 tok/s. Измерено практикующим специалистом на другом чекпоинте и рантайме, так что рассматривайте это как верхнюю границу, к которой могут приблизиться abliterated веса, а не как гарантию.

oMLX dual-ANE prefill на M3 Ultra, abliterated oQ4e-MTP: prefill ускоряется примерно на 17,7% при 16K и на 18,9% при 32K, а декодирование через Lightning MTP достигает до ~75 tok/s при 16K. Предостережения реальны: используются приватные интерфейсы Apple runtime и приближённые INT8-веса, добавляется около 4 ГБ пиковой памяти, а время загрузки модели увеличивается с ~3,4 с до ~28 с. Это оптимизация приёма промпта, а не ускоритель генерации.

Головка MTP — бесплатное ускорение, если ваш раннер её поддерживает

Эта сборка содержит черновик с многотокеновым предсказанием базовой модели в mtp/ подпапке (архитектура qwen3_5_mtp), и она работает с любой основной точностью. Принятие без потерь — при жадном декодировании вывод идентичен работе без черновика — так что это настоящее ускорение без потери качества, когда он задействован. Два примечания по настройке из нашей карточки: требуется сборка mlx-vlm, которая включает qwen3_5_mtp черновик (ветка main ветка), и вы должны передать оба --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp и --draft-kind mtp. Установка mtp_enabled в одиночку ничего не делает. Если ваш раннер не поддерживает черновик, он игнорируется, и модель работает нормально — ничего не ломается.

Безопасность — прочтите это до запуска, а не после.

Дисклеймер самой карточки модели необычно прямолинеен, и эта страница не собирается его смягчать. Выравнивание безопасности в этой сборке было в значительной степени удалено. Она будет выполнять вредоносные, неэтичные, оскорбительные или незаконные запросы, от которых отказалась бы базовая Qw​en/Qwen3.8-27B, и в ней нет значимых встроенных ограничителей. Она выпущена строго для легитимных исследований — интерпретируемости, изучения механизмов безопасности и отказа, red-teaming, оценки устойчивости и контролируемых экспериментов. Если вы занимаетесь не этим, эта модель вам не подходит.

Два предупреждения из карточки заслуживают особого внимания. Во-первых, джейлбрейк и проверки безопасности тривиально «срабатывают» на аблетированной модели, и это не является успешным прохождением оценки безопасности — это ожидаемое поведение модели, у которой удалено направление отказа. Отсутствие отказов не является свидетельством безопасности. Во-вторых, сохранённые зрение, вызов инструментов и контекст в 262K расширяют поверхность атаки на понимание изображений и агентное использование: нецензурированная модель, которая может читать скриншоты и вызывать инструменты, представляет более широкий риск, чем сборка только для чата с удалёнными отказами. Низкобитовая квантизация добавляет третий уровень нестабильности сверху — при 2-битах искажённый вывод можно даже принять за отказ, что само по себе является отдельным типом сбивающего с толку сбоя.

Вы берёте на себя полную ответственность за использование и результаты. Лицензия Apache-2.0 унаследована от базовой модели и не меняет этого: она разрешает использование, но не делает ваше развёртывание безопасным. Любой, кто развёртывает это для конечных пользователей, несовершеннолетних или в любой производственной среде, должен сначала добавить собственные уровни модерации, безопасности и предотвращения злоупотреблений, а также соблюдать применимое законодательство. Для исследователей, которые действительно запускают её, практические ограничения таковы: изолированная, в идеале офлайн, среда; инструменты-агенты, не направленные на реальные сервисы; отсутствие доступа для конечных пользователей; и проверка выходных данных, прежде чем они куда-либо попадут.

Когда локальное не является ответом

Локальность — вот суть этой сборки: веса лежат на вашем диске, нет платы за токен, и ничего не покидает машину. Но локальность — это и потолок: она работает только на Apple Silicon, приходится мириться с качеством квантования, и нет резервирования, если машина занята. Если вам нужна неаблатерированная модель класса 27B через API для реальной рабочей нагрузки или вы хотите A/B-сравнить эту локальную сборку с размещенной моделью на одних и тех же промптах — именно этот разрыв призван закрыть слой маршрутизации. OrcaRouter ставит более 200 моделей за одним API-ключом по ценам провайдера, с автоматическим переключением при сбое и DSL для маршрутизации; снижение цены вендора вступает в силу у нас в тот же день, когда оно анонсировано, потому что мы передаем цену без изменений. Один API, одна интеграция — и вы можете сравнить непроверенную локальную настройку с размещенной моделью, не заводя второй аккаунт. Мы не размещаем эту сборку MLX — по замыслу это локальные веса, — так что API дополняет этот путь, а не заменяет его.

Краткое руководство по принятию решений

• 16 ГБ Mac — честно, не эта модель. 2-битная версия помещается, но годится только для архива; так или иначе будете бороться с памятью. Обратите внимание на меньшую модель без цензуры или на созданную сообществом смешанную 3/6-битную конверсию для машин с 18–24 ГБ.

• Mac с 24 ГБ — 4-бит, и держите контекст коротким; не запускайте vision и длинный контекст одновременно.

• Mac на 32 ГБ — 4-бит — золотая середина; 6-бит, если контекст ограничен.

• 48 ГБ Mac — 6-бит с запасом; 8-бит, если не расширять окно.

• 64 ГБ и выше — 8-битный, почти без потерь и 262K контекст в пределах досягаемости с учетом указанных выше оговорок.

Это весь ранбук. Модель от 17 августа 2026 года — это не новость о запуске, и ей не обязательно быть таковой: 83 000 загрузок произошло потому, что людям нужна была инструкция, и эта страница — та самая инструкция. Начните в корне репозитория, загрузите 4-битную версию в LM Studio и отходите от сборки по умолчанию, только когда будете знать, чем платите за качество. Если вы пришли со стороны GGUF или FP8, соответствующие руководства описывают эти пути — здесь та же логика выбора, но не математика квантизации.

Это не очередная сборка этой модели — Qwen3.8-Flash-Next-Uncensored — это отдельный релиз: версия Qwen3.8-Flash-Next, прошедшая abliteration (сам Qwen3.8-Flash-Next — превью архитектуры Qwen4 со смесью экспертов: 176B в хранилище / 6B активных). Та же техника abliteration, другие веса, собственная коллекция.

Все шесть сборок 27B — BF16, GGUF, MLX, FP8, INT8 и NVFP4 — собраны в коллекции Qwen3.8-27B-Uncensored на Hugging Face.

Эти веса предназначены только для локального использования. Для размещённой базовой модели, с которой можно сравнить аблятированную сборку, Qwen3.8-27B доступна на OrcaRouter по цене провайдера с 0% наценкой — стандартная модель, с сохранённой настройкой безопасности.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube