
Qwen3.8-Flash-Next-Uncensored: Запуск Abliterated MoE на llama.cpp и Apple Silicon
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Прежде чем что-либо скачивать: Qwen3.8-Flash-Next-Uncensored — это не Qwen3.8-27B-Uncensored. Они имеют общее семейное имя и технику abliteration, но это разные модели из разных выпусков весов, и каждый более ранний пост «Qwen uncensored» в этом блоге посвящён 27B. Тема здесь — пара, которую OrcaRouter опубликовал на Hugging Face 26 августа 2026 года — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF и orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — abliterated-сборки Qwen3.8-Flash-Next, модель Alibaba, представляющая собой маршрутизированную смесь экспертов (MoE) с 176B параметров в хранилище и 6B активных, которая демонстрирует предварительную версию архитектуры Qwen4. Мы анонсировали релиз как «GGUF + нативный MLX, контекст до 262K», предназначенный для исследователей безопасности, красных команд и синих команд. Этот runbook написан на основе наших собственных карточек моделей: что делает удаление отказов внутри маршрутизированной MoE, сколько на самом деле стоит заявление о контексте 262K в памяти, как обслуживать обе линейки файлов и где пролегает граница исследований. Если вы пришли за введением в abliteration или математикой квантования 27B, более ранние посты в этой серии освещают эти темы.

Сначала ворота
Оба репозитория закрыты на Hugging Face (gated: auto). Скачивание файлов невозможно, пока вы не войдете в систему и не примете условия использования каждого репозитория — у репозиториев GGUF и MLX своя собственная блокировка. Это наиболее существенное отличие от открытой линейки GGUF: наивная однострочная команда «просто hf download» завершается ошибкой авторизации, не успев скачать ни одного байта. Процесс выглядит так:
• Войдите в Hugging Face (или зарегистрируйтесь) и установите huggingface_hub, затем один раз выполните hf auth login, чтобы ваш токен оказался на диске.
• Откройте orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF в браузере, примите условия, затем повторите для orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX.
• С этого момента hf download с вашим аутентифицированным токеном работает как с любым другим репозиторием. Каждый квант, который вы загружаете, и веса MLX — это исследовательский артефакт под лицензией Apache-2.0 — той же лицензией, что и базовая модель — и шлюз является частью соглашения: чтение условий — первый шаг к использованию модели.

Что аблитерация делает с маршрутизированным MoE
Техника — это редактирование весов в стиле Ардити, о котором мы уже рассказывали в этом блоге; самое интересное — то, как она влияет именно на эту архитектуру. На плотной модели 27B это составляло 131 остаточную матрицу. Для Qwen3.8-Flash-Next-Uncensored в карточке модели MLX указано, что к 149 тензорам, записывающим в остаточный поток, применена техника abliteration, а компоненты, которые делают эту модель тем, чем она является, — маршрутизатор MoE, таблица n-граммных эмбеддингов размером 51B, визуальная башня — намеренно не тронуты вовсе.
Это «{{1}}никогда не трогали{{/1}}» и есть вся история для маршрутизированной модели. Каждый токен активирует 10 из 512 экспертов; ни один отдельный эксперт не отвечает за отказ. Отказное поведение живёт в остаточном потоке, формирующем итоговый выход, а это ровно то направление, которое ортогонализация и удаляет. Поэтому маршрутизатор продолжает направлять запросы тем же экспертам, таблица n-грамм продолжает выдавать те же эмбеддинги, а меняется лишь то, что модель говорит после того, как отработает выходная проекция. Согласно опубликованным в карточке модели GGUF замерам, форма этого изменения такова: отказы на вредоносные промпты снижаются с {{2}}64–100%{{/2}} на базовой модели до примерно {{3}}0–3.3%{{/3}} в этой сборке, избыточные отказы на безвредные промпты — около 0%, а производительность на {{4}}проверках в стиле MMLU-Pro / GSM8K / CMMLU{{/4}} — в пределах ±2 пунктов от базовой. Это цифры самой карточки модели — самоотчёт, а не независимо воспроизведённый результат.
MTP-голова: присутствует в MLX, удалена в GGUF
Qwen3.8-Flash-Next поставляется со спекулятивной головой мультитокенного предсказания объёмом около 4B параметров, и две сборки по-разному к ней относятся. Репозиторий GGUF её исключает — в карточке прямо указано, что эти файлы не включают спекулятивную голову-черновик MTP, — потому что поддержка qwen4exp в llama.cpp пока не реализует MTP, так что в файле эта голова была бы мёртвым грузом. Сборка MLX сохраняет её, поэтому на Apple Silicon вы по-прежнему получаете спекулятивное декодирование. Практическое следствие, подтверждаемое практиками, запускающими базовую модель: ветка llama.cpp GGUF сегодня работает без спекулятивного декодирования, в то время как конфигурация SGLang с включённым MTP более чем удваивает скорость декодирования на том же классе оборудования. Если llama.cpp когда-нибудь добавит MTP для qwen4exp, ветка GGUF получит бесплатное ускорение — но не покупайте оборудование, рассчитывая на это уже на этой неделе.
Утверждение о контексте 262K и во что обходится KV-кэш
Нативный контекст — 262 144 токена (расширяемый через YaRN в сторону 1M), и реально ограничивающим фактором является память. Хорошая новость в том, что архитектура сохраняет KV-кэш небольшим: из 48 слоёв 36 используют линейное внимание Gated DeltaNet, которое сжимает историю в состояние фиксированного размера с рекуррентной структурой, и только 12 слоёв полного внимания несут обычный KV-кэш, растущий с длиной последовательности.
Два измеренных сообществом показателя, оба на базовой модели, переносятся напрямую. Развёртывание GGUF на 4× RTX 3090 сообщило о переходе с 65K до 131K контекста всего при ~0,78 GB дополнительного KV на карту, а один DGX Spark запустил полный контекст 262K с файлом класса Q4, удерживая модель в памяти при ~76,9 GB из его пула 128 GB за счёт пиннинга n-граммной таблицы на CPU и mmap'а её с NVMe. Собственная строка бюджета в карточке GGUF-модели: всего = размер файла + KV-кэш + ~0,9 GB mmproj. Итог для выбора квантизации: при 262K KV-кэш — реальная статья расходов, но веса остаются доминирующей, поэтому та же логика «сначала VRAM» из руководства по 27B GGUF применима — разница здесь в самих размерах файлов, которые варьируются от IQ2_XXS примерно 52 GB до Q5_K_M примерно 125 GB.
Линейка GGUF: 13 квантизаций, раздельные файлы, mmproj и сборка llama.cpp.
Репозиторий GGUF предлагает 13 уровней квантования — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — при этом IQ-кванты построены на основе матрицы важности, полученной на калибровочных текстах на английском, китайском и программном коде. Каждый квант состоит из нескольких частей, разделённых с помощью llama-gguf-split, поэтому загрузите полный набор для кванта и укажите загрузчику на часть ...-00001-of-000NN.gguf. Уровней Q6_K, Q8_0 или F16 нет, и причина структурная, а не экономическая: таблица вложений n-грамм (PLE) представляет собой один тензор, слишком большой для соблюдения лимита Hugging Face в 50 ГБ на файл при 6-битном квантовании и выше, а один тензор GGUF нельзя разбить между файлами — поэтому линейка заканчивается на Q5_K_M.
Другой файл, который нельзя пропустить, — это mmproj-...-F16.gguf, примерно 0,9 ГБ: это визуально-языковая модель, и для любого ввода изображений llama.cpp требуется проектор. Qwen3.8-Flash-Next является мультимодальной, как и эта сборка — аблатерация не затрагивает зрительную башню.
Поддержка llama.cpp еще не в основной ветке. Идентификатор архитектуры — qwen4exp, и стандартные сборки завершаются с ошибкой «unknown architecture 'qwen4_exp'»; вам нужна сборка из PR #27742 (ветка qwen4exp/qwen3.8-flash-next), скомпилированная с целями llama-cli, llama-mtmd-cli, llama-server и llama-gguf-split. Далее схема запуска — это обычный сервер llama.cpp с флагами для Qwen, использующий имя кванта из файлов частей:
llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
Установите -c на любой контекст, который помещается; пример на карточке модели начинается с 8192. Рассуждение включено по умолчанию и возвращается в reasoning_content, а вызов инструментов работает через совместимую с OpenAI конечную точку. Приведённые выше значения сэмплирования — рекомендация из карточки модели; практики на базовой модели используют temp 0.7 / top-p 0.80 / top-k 20 со штрафом присутствия 1.5 в инструктивном режиме без рассуждений, а глубину рассуждения настраивают через --chat-template-kwargs {"reasoning_effort":"medium"}.
Сборка MLX на Apple Silicon
Репозиторий MLX — это нативный путь для Apple Silicon: те же веса, то же удаление отказов, рантайм, нативный для Metal. Он включает 4-битную сборку по умолчанию (~163 ГБ), анонсированную 6-битную (~192 ГБ) и 8-битный уровень (~221 ГБ). Поскольку fused-3D эксперты и n-граммная таблица хранятся с более высокой точностью, чем номинальный тег, эффективная точность заметно превосходит равномерный 4-битный уровень — в карточке модели указано ~7,85 эффективных бит на вес для тега «4-бит». Именно поэтому размеры репозитория выглядят большими: n-граммная таблица не ужимается так, как её ужимают квантизаторы из сообщества.

Аппаратное обеспечение — это ключевое ограничение. MLX работает только на Apple Silicon (Metal), и для весов нужна унифицированная память — в карточке модели указано: «Mac с достаточным объёмом унифицированной памяти для весов объёмом 163 ГБ (например, M-series Ultra)». Считайте 4-битный уровень машиной класса 192 ГБ, а 6-битную сборку — класса 256 ГБ. Теги карточки фиксируют полный набор функций — qwen4_exp, MoE, MTP, function calling, vision-language, — а для ввода изображений используется mlx-vlm. Спекулятивная голова MTP включена сюда — это незаметное преимущество сборки MLX над линейкой GGUF.
Путь видения для тех, кто им пользуется.
Поскольку это визуально-языковая модель, мультимодальный путь — часть runbook, а не дополнение. В llama.cpp для ввода изображений нужны и mmproj-проектор, и сборка с llama-mtmd-cli / llama-server. В MLX вы работаете с ней через mlx-vlm, а не через текстовый драйвер mlx-lm. Для red team именно на визуальном пути сосредоточена интересная eval-работа: мультимодальные guardrails, prompt-инъекции, переносимые в изображении, OCR по скриншотам ваших собственных систем и состязательные изображения, нацеленные на весь конвейер. Поскольку abliteration покрывает всю модель и оставляет визуальный энкодер нетронутым, изображение, которое в текстовой голове спровоцировало бы отказ, просто попадает на модель, где не осталось поведения отказа, которое можно было бы задеть. В карточке GGUF указано, что на этой сборке проверены зрение и многошаговый вызов инструментов; отдельного набора для оценки зрения не опубликовано.
Для чего это нужно, и где проходит граница
Эта сборка существует для одного класса задач: оценить, на что способна модель с удалённым отказным поведением, — ради понимания и защиты систем. Для красной команды это означает проверку собственных защитных механизмов против модели, которая не будет вежливо отказывать: устойчивость к промпт-инъекциям, сценарии эксфильтрации, злоупотребление инструментами и разрыв между «базовая модель отказывается» и «модель на самом деле не умеет этого делать». Этот разрыв и есть вся исследовательская ценность сборки, лишённой механизма отказов: она показывает, что скрывал слой отказа, а это разница между безопасностью за счёт политики и безопасностью за счёт возможностей. Для синей команды те же веса — реалистичный базовый уровень противника: если злоумышленник может скачать и запустить эту модель, ваша защита должна выстоять против модели, которая отвечает, а не уклоняется. Оценки, построенные на её основе, — нижняя граница того, на что способна кастомная модель, никогда не проходившая выравнивание; относитесь к ним именно так, а не как к потолку.
Следует четко понимать, что устранение отказов меняет, а что — нет. Оно меняет выходное поведение — модель больше не отказывается отвечать, — но не меняет её возможности. Никаких новых знаний, никаких новых навыков, никаких новых вычислительных мощностей; то же обучение, те же ограничения на то, что модель реально может выдать. Аблитерированная модель не может создать вредоносное ПО, которое было ей не под силу раньше; она просто отвечает вместо того, чтобы уклоняться, и её результаты не становятся правдивее из-за большей дозволенности. Заявленный в карточке диапазон возможностей ±2 балла и обвал показателей отказов — это один и тот же факт, увиденный с двух сторон.
Где проходит граница — это соглашение о закрытом репозитории, и это не шаблонный текст. Легитимное использование: оценка собственных систем, публичные исследования уязвимостей моделей, создание систем обнаружения и защитных оценок, изучение механизмов отказа. Нелегитимное: развёртывание этого в качестве пользовательского ассистента, создание рабочего вредоносного ПО или эксплойтов против систем, которыми вы не владеете или на тестирование которых у вас нет разрешения, мошенничество, материалы для оружия. Лицензия Apache-2.0 и применимое законодательство — это нижняя планка; шлюз — это явное соглашение об исследовательских целях поверх неё. Если ваш случай использования — «запустить чат-бота для пользователей», это не ваша модель — и это задумано, а не упущение.
Как получить развернутую базовую модель
Эти веса намеренно доступны только локально: пробные пейлоады red team никогда не должны проходить через сторонний API, и весь смысл именно в самохостинге. Когда для сравнения нужен цензурированный серверный бейзлайн — Qwen3.8-Flash от Alibaba по $0.16 за миллион входных токенов и $0.47 за миллион выходных — OrcaRouter маршрутизирует его по цене из прайс-листа провайдера с наценкой 0% и автоматическим переключением при сбое, так что оценочный стенд может переключаться между серверной базой и вашей локальной сборкой без цензуры с одним ключом и без второго контракта. Открытые веса Qwen3.8-Flash-Next пока отсутствуют в нашем каталоге; когда рантайм, который мы маршрутизируем, начнёт их предоставлять, они попадут в ту же схему с одним ключом и ценами из прайс-листа.
Начните здесь
Определите, какая строка соответствует вашему оборудованию, затем ознакомьтесь с соответствующим гейтом. На Mac с унифицированной памятью 128 ГБ+ сборка MLX даёт вам MTP и зрение в одном месте — примите условия репозитория MLX, скачайте 4-битные или 6-битные веса и запускайте их через mlx-vlm. На NVIDIA, AMD или на машине с CPU соберите llama.cpp из PR #27742, примите условия репозитория GGUF, скачайте подходящий квантизованный файл и не забудьте файл mmproj. В обоих случаях показатели отказов и диапазон возможностей — собственные данные репозитория, опубликованные на карточке и на момент написания никем не воспроизведённые; честный способ их читать — как измерение вендором собственной доработки, а не как независимый аудит. Гейт, лицензия и описанная выше граница безопасности — один и тот же текст с трёх сторон: это исследовательский инструмент, и он выпущен на этом условии.
Все пять сборок Flash-Next — BF16, GGUF, MLX, FP8 и NVFP4 — собраны в коллекции Qwen3.8-Flash-Next-Uncensored на Hugging Face.
Не путать с семейством 27B: Qwen3.8-27B-Uncensored — это другая модель, аблитерированная от другой базы, со своей собственной коллекцией и собственными плейбуками. Та же техника, другие веса.
Эти веса по замыслу предназначены только для локального использования. Для размещенной эталонной модели, с которой можно сравнивать abliterated-сборку, Qwen3.8-Flash обслуживается на OrcaRouter по цене провайдера с нулевой наценкой — исходная модель с сохранённым выравниванием безопасности.
