Hero-карточка для статьи «Qwen3.8-Flash-Next-Uncensored: запуск Abliterated MoE на llama.cpp и Apple Silicon», отображающая заголовок, подзаголовок «GGUF + нативный MLX — до 262K контекста» и три чипа характеристик: «Доступ по запросу на Hugging Face», «13 GGUF-квантов» и «6-битная MLX-сборка».
Guides & Insights

Qwen3.8-Flash-Next-Uncensored: Запуск Abliterated MoE на llama.cpp и Apple Silicon

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Прежде чем что-либо скачивать: Qwen3.8-Flash-Next-Uncensored — это не Qwen3.8-27B-Uncensored. Они имеют общее семейное имя и технику abliteration, но это разные модели из разных выпусков весов, и каждый более ранний пост «Qw​en uncensored» в этом блоге посвящён 27B. Тема здесь — пара, которую OrcaRouter опубликовал на Hugging Face 26 августа 2026 года — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF и orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — abliterated-сборки Qwen3.8-Flash-Next, модель Alibaba, представляющая собой маршрутизированную смесь экспертов (MoE) с 176B параметров в хранилище и 6B активных, которая демонстрирует предварительную версию архитектуры Qwen4. Мы анонсировали релиз как «GGUF + нативный MLX, контекст до 262K», предназначенный для исследователей безопасности, красных команд и синих команд. Этот runbook написан на основе наших собственных карточек моделей: что делает удаление отказов внутри маршрутизированной MoE, сколько на самом деле стоит заявление о контексте 262K в памяти, как обслуживать обе линейки файлов и где пролегает граница исследований. Если вы пришли за введением в abliteration или математикой квантования 27B, более ранние посты в этой серии освещают эти темы.

Scoreboard card for Qwen3.8-Flash-Next-Uncensored with six rows: base model Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + terms), GGUF quants 13 (IQ2_XXS to Q5_K_M), vision mmproj F16 projector, MLX build 4/6/8-bit, context 262,144 tokens (YaRN to 1M); footer reads 'OrcaRouter model-card data, August 2026 - not independently audited.'

Сначала ворота

Оба репозитория закрыты на Hugging Face (gated: auto). Скачивание файлов невозможно, пока вы не войдете в систему и не примете условия использования каждого репозитория — у репозиториев GGUF и MLX своя собственная блокировка. Это наиболее существенное отличие от открытой линейки GGUF: наивная однострочная команда «просто hf download» завершается ошибкой авторизации, не успев скачать ни одного байта. Процесс выглядит так:

• Войдите в Hugging Face (или зарегистрируйтесь) и установите huggingface_hub, затем один раз выполните hf auth login, чтобы ваш токен оказался на диске.

• Откройте orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF в браузере, примите условия, затем повторите для orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX.

• С этого момента hf download с вашим аутентифицированным токеном работает как с любым другим репозиторием. Каждый квант, который вы загружаете, и веса MLX — это исследовательский артефакт под лицензией Apache-2.0 — той же лицензией, что и базовая модель — и шлюз является частью соглашения: чтение условий — первый шаг к использованию модели.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF repository on Hugging Face, showing the gated access banner ('You need to agree to share your contact information to access this model'), the tags abliterated/uncensored/qwen4/Mixture of Experts/llama.cpp/vision-language/mmproj, and the Apache 2.0 licence.

Что аблитерация делает с маршрутизированным MoE

Техника — это редактирование весов в стиле Ардити, о котором мы уже рассказывали в этом блоге; самое интересное — то, как она влияет именно на эту архитектуру. На плотной модели 27B это составляло 131 остаточную матрицу. Для Qwen3.8-Flash-Next-Uncensored в карточке модели MLX указано, что к 149 тензорам, записывающим в остаточный поток, применена техника abliteration, а компоненты, которые делают эту модель тем, чем она является, — маршрутизатор MoE, таблица n-граммных эмбеддингов размером 51B, визуальная башня — намеренно не тронуты вовсе.

Это «{{1}}никогда не трогали{{/1}}» и есть вся история для маршрутизированной модели. Каждый токен активирует 10 из 512 экспертов; ни один отдельный эксперт не отвечает за отказ. Отказное поведение живёт в остаточном потоке, формирующем итоговый выход, а это ровно то направление, которое ортогонализация и удаляет. Поэтому маршрутизатор продолжает направлять запросы тем же экспертам, таблица n-грамм продолжает выдавать те же эмбеддинги, а меняется лишь то, что модель говорит после того, как отработает выходная проекция. Согласно опубликованным в карточке модели GGUF замерам, форма этого изменения такова: отказы на вредоносные промпты снижаются с {{2}}64–100%{{/2}} на базовой модели до примерно {{3}}0–3.3%{{/3}} в этой сборке, избыточные отказы на безвредные промпты — около 0%, а производительность на {{4}}проверках в стиле MMLU-Pro / GSM8K / CMMLU{{/4}} — в пределах ±2 пунктов от базовой. Это цифры самой карточки модели — самоотчёт, а не независимо воспроизведённый результат.

MTP-голова: присутствует в MLX, удалена в GGUF

Qwen3.8-Flash-Next поставляется со спекулятивной головой мультитокенного предсказания объёмом около 4B параметров, и две сборки по-разному к ней относятся. Репозиторий GGUF её исключает — в карточке прямо указано, что эти файлы не включают спекулятивную голову-черновик MTP, — потому что поддержка qwen4exp в llama.cpp пока не реализует MTP, так что в файле эта голова была бы мёртвым грузом. Сборка MLX сохраняет её, поэтому на Apple Silicon вы по-прежнему получаете спекулятивное декодирование. Практическое следствие, подтверждаемое практиками, запускающими базовую модель: ветка llama.cpp GGUF сегодня работает без спекулятивного декодирования, в то время как конфигурация SGLang с включённым MTP более чем удваивает скорость декодирования на том же классе оборудования. Если llama.cpp когда-нибудь добавит MTP для qwen4exp, ветка GGUF получит бесплатное ускорение — но не покупайте оборудование, рассчитывая на это уже на этой неделе.

Утверждение о контексте 262K и во что обходится KV-кэш

Нативный контекст — 262 144 токена (расширяемый через YaRN в сторону 1M), и реально ограничивающим фактором является память. Хорошая новость в том, что архитектура сохраняет KV-кэш небольшим: из 48 слоёв 36 используют линейное внимание Gated DeltaNet, которое сжимает историю в состояние фиксированного размера с рекуррентной структурой, и только 12 слоёв полного внимания несут обычный KV-кэш, растущий с длиной последовательности.

Два измеренных сообществом показателя, оба на базовой модели, переносятся напрямую. Развёртывание GGUF на 4× RTX 3090 сообщило о переходе с 65K до 131K контекста всего при ~0,78 GB дополнительного KV на карту, а один DGX Spark запустил полный контекст 262K с файлом класса Q4, удерживая модель в памяти при ~76,9 GB из его пула 128 GB за счёт пиннинга n-граммной таблицы на CPU и mmap'а её с NVMe. Собственная строка бюджета в карточке GGUF-модели: всего = размер файла + KV-кэш + ~0,9 GB mmproj. Итог для выбора квантизации: при 262K KV-кэш — реальная статья расходов, но веса остаются доминирующей, поэтому та же логика «сначала VRAM» из руководства по 27B GGUF применима — разница здесь в самих размерах файлов, которые варьируются от IQ2_XXS примерно 52 GB до Q5_K_M примерно 125 GB.

Линейка GGUF: 13 квантизаций, раздельные файлы, mmproj и сборка llama.cpp.

Репозиторий GGUF предлагает 13 уровней квантования — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — при этом IQ-кванты построены на основе матрицы важности, полученной на калибровочных текстах на английском, китайском и программном коде. Каждый квант состоит из нескольких частей, разделённых с помощью llama-gguf-split, поэтому загрузите полный набор для кванта и укажите загрузчику на часть ...-00001-of-000NN.gguf. Уровней Q6_K, Q8_0 или F16 нет, и причина структурная, а не экономическая: таблица вложений n-грамм (PLE) представляет собой один тензор, слишком большой для соблюдения лимита Hugging Face в 50 ГБ на файл при 6-битном квантовании и выше, а один тензор GGUF нельзя разбить между файлами — поэтому линейка заканчивается на Q5_K_M.

Другой файл, который нельзя пропустить, — это mmproj-...-F16.gguf, примерно 0,9 ГБ: это визуально-языковая модель, и для любого ввода изображений llama.cpp требуется проектор. Qwen3.8-Flash-Next является мультимодальной, как и эта сборка — аблатерация не затрагивает зрительную башню.

Поддержка llama.cpp еще не в основной ветке. Идентификатор архитектуры — qwen4exp, и стандартные сборки завершаются с ошибкой «unknown architecture 'qwen4_exp'»; вам нужна сборка из PR #27742 (ветка qwen4exp/qwen3.8-flash-next), скомпилированная с целями llama-cli, llama-mtmd-cli, llama-server и llama-gguf-split. Далее схема запуска — это обычный сервер llama.cpp с флагами для Qwen, использующий имя кванта из файлов частей:

llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Установите -c на любой контекст, который помещается; пример на карточке модели начинается с 8192. Рассуждение включено по умолчанию и возвращается в reasoning_content, а вызов инструментов работает через совместимую с OpenAI конечную точку. Приведённые выше значения сэмплирования — рекомендация из карточки модели; практики на базовой модели используют temp 0.7 / top-p 0.80 / top-k 20 со штрафом присутствия 1.5 в инструктивном режиме без рассуждений, а глубину рассуждения настраивают через --chat-template-kwargs {"reasoning_effort":"medium"}.

Сборка MLX на Apple Silicon

Репозиторий MLX — это нативный путь для Apple Silicon: те же веса, то же удаление отказов, рантайм, нативный для Metal. Он включает 4-битную сборку по умолчанию (~163 ГБ), анонсированную 6-битную (~192 ГБ) и 8-битный уровень (~221 ГБ). Поскольку fused-3D эксперты и n-граммная таблица хранятся с более высокой точностью, чем номинальный тег, эффективная точность заметно превосходит равномерный 4-битный уровень — в карточке модели указано ~7,85 эффективных бит на вес для тега «4-бит». Именно поэтому размеры репозитория выглядят большими: n-граммная таблица не ужимается так, как её ужимают квантизаторы из сообщества.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX repository on Hugging Face, showing the gated access banner, the tags Mixture of Experts/vision-language/function-calling/reasoning/mtp/ai-red-team, licence apache-2.0, and the card line 'An abliterated (refusal-removed) MLX build (4/6/8-bit) of Qwen's Qwen3.8-Flash-Next for Apple Silicon'.

Аппаратное обеспечение — это ключевое ограничение. MLX работает только на Apple Silicon (Metal), и для весов нужна унифицированная память — в карточке модели указано: «Mac с достаточным объёмом унифицированной памяти для весов объёмом 163 ГБ (например, M-series Ultra)». Считайте 4-битный уровень машиной класса 192 ГБ, а 6-битную сборку — класса 256 ГБ. Теги карточки фиксируют полный набор функций — qwen4_exp, MoE, MTP, function calling, vision-language, — а для ввода изображений используется mlx-vlm. Спекулятивная голова MTP включена сюда — это незаметное преимущество сборки MLX над линейкой GGUF.

Путь видения для тех, кто им пользуется.

Поскольку это визуально-языковая модель, мультимодальный путь — часть runbook, а не дополнение. В llama.cpp для ввода изображений нужны и mmproj-проектор, и сборка с llama-mtmd-cli / llama-server. В MLX вы работаете с ней через mlx-vlm, а не через текстовый драйвер mlx-lm. Для red team именно на визуальном пути сосредоточена интересная eval-работа: мультимодальные guardrails, prompt-инъекции, переносимые в изображении, OCR по скриншотам ваших собственных систем и состязательные изображения, нацеленные на весь конвейер. Поскольку abliteration покрывает всю модель и оставляет визуальный энкодер нетронутым, изображение, которое в текстовой голове спровоцировало бы отказ, просто попадает на модель, где не осталось поведения отказа, которое можно было бы задеть. В карточке GGUF указано, что на этой сборке проверены зрение и многошаговый вызов инструментов; отдельного набора для оценки зрения не опубликовано.

Для чего это нужно, и где проходит граница

Эта сборка существует для одного класса задач: оценить, на что способна модель с удалённым отказным поведением, — ради понимания и защиты систем. Для красной команды это означает проверку собственных защитных механизмов против модели, которая не будет вежливо отказывать: устойчивость к промпт-инъекциям, сценарии эксфильтрации, злоупотребление инструментами и разрыв между «базовая модель отказывается» и «модель на самом деле не умеет этого делать». Этот разрыв и есть вся исследовательская ценность сборки, лишённой механизма отказов: она показывает, что скрывал слой отказа, а это разница между безопасностью за счёт политики и безопасностью за счёт возможностей. Для синей команды те же веса — реалистичный базовый уровень противника: если злоумышленник может скачать и запустить эту модель, ваша защита должна выстоять против модели, которая отвечает, а не уклоняется. Оценки, построенные на её основе, — нижняя граница того, на что способна кастомная модель, никогда не проходившая выравнивание; относитесь к ним именно так, а не как к потолку.

Следует четко понимать, что устранение отказов меняет, а что — нет. Оно меняет выходное поведение — модель больше не отказывается отвечать, — но не меняет её возможности. Никаких новых знаний, никаких новых навыков, никаких новых вычислительных мощностей; то же обучение, те же ограничения на то, что модель реально может выдать. Аблитерированная модель не может создать вредоносное ПО, которое было ей не под силу раньше; она просто отвечает вместо того, чтобы уклоняться, и её результаты не становятся правдивее из-за большей дозволенности. Заявленный в карточке диапазон возможностей ±2 балла и обвал показателей отказов — это один и тот же факт, увиденный с двух сторон.

Где проходит граница — это соглашение о закрытом репозитории, и это не шаблонный текст. Легитимное использование: оценка собственных систем, публичные исследования уязвимостей моделей, создание систем обнаружения и защитных оценок, изучение механизмов отказа. Нелегитимное: развёртывание этого в качестве пользовательского ассистента, создание рабочего вредоносного ПО или эксплойтов против систем, которыми вы не владеете или на тестирование которых у вас нет разрешения, мошенничество, материалы для оружия. Лицензия Apache-2.0 и применимое законодательство — это нижняя планка; шлюз — это явное соглашение об исследовательских целях поверх неё. Если ваш случай использования — «запустить чат-бота для пользователей», это не ваша модель — и это задумано, а не упущение.

Как получить развернутую базовую модель

Эти веса намеренно доступны только локально: пробные пейлоады red team никогда не должны проходить через сторонний API, и весь смысл именно в самохостинге. Когда для сравнения нужен цензурированный серверный бейзлайн — Qwen3.8-Flash от Alibaba по $0.16 за миллион входных токенов и $0.47 за миллион выходных — OrcaRouter маршрутизирует его по цене из прайс-листа провайдера с наценкой 0% и автоматическим переключением при сбое, так что оценочный стенд может переключаться между серверной базой и вашей локальной сборкой без цензуры с одним ключом и без второго контракта. Открытые веса Qwen3.8-Flash-Next пока отсутствуют в нашем каталоге; когда рантайм, который мы маршрутизируем, начнёт их предоставлять, они попадут в ту же схему с одним ключом и ценами из прайс-листа.

Начните здесь

Определите, какая строка соответствует вашему оборудованию, затем ознакомьтесь с соответствующим гейтом. На Mac с унифицированной памятью 128 ГБ+ сборка MLX даёт вам MTP и зрение в одном месте — примите условия репозитория MLX, скачайте 4-битные или 6-битные веса и запускайте их через mlx-vlm. На NVIDIA, AMD или на машине с CPU соберите llama.cpp из PR #27742, примите условия репозитория GGUF, скачайте подходящий квантизованный файл и не забудьте файл mmproj. В обоих случаях показатели отказов и диапазон возможностей — собственные данные репозитория, опубликованные на карточке и на момент написания никем не воспроизведённые; честный способ их читать — как измерение вендором собственной доработки, а не как независимый аудит. Гейт, лицензия и описанная выше граница безопасности — один и тот же текст с трёх сторон: это исследовательский инструмент, и он выпущен на этом условии.

Все пять сборок Flash-Next — BF16, GGUF, MLX, FP8 и NVFP4 — собраны в коллекции Qwen3.8-Flash-Next-Uncensored на Hugging Face.

Не путать с семейством 27B: Qwen3.8-27B-Uncensored — это другая модель, аблитерированная от другой базы, со своей собственной коллекцией и собственными плейбуками. Та же техника, другие веса.

Эти веса по замыслу предназначены только для локального использования. Для размещенной эталонной модели, с которой можно сравнивать abliterated-сборку, Qwen3.8-Flash обслуживается на OrcaRouter по цене провайдера с нулевой наценкой — исходная модель с сохранённым выравниванием безопасности.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube