
Развертывание Qwen3.8-Flash-Next-Uncensored-FP8: руководство по vLLM для сборки block-FP8
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Qwen3.8-Flash-Next-Uncensored-FP8 — block-FP8-сборка abliterated Flash-Next — это артефакт, который вы фактически загружаете при развертывании этой модели на оборудовании дата-центра, и она последняя в коллекции, получившая собственное руководство по эксплуатации. Она размещена на orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 на Hugging Face: направление отказа удалено из Qwen3.8-Flash-Next от Qwen, затем модель повторно квантизована офлайн в точную схему FP8 официальной Qwen3.8-Flash-Next-FP8, чтобы vLLM обслуживала её на том же пути ядра. Это та сборка, к которой обратится любой, кто запускает эту модель на GPU класса Hopper и новее, и в процессе обслуживания есть один флаг, который легко перепутать, а когда он перепутан, это трудно диагностировать.
Во-первых, граница: читатели постоянно её размывают, а она определяет всё, что ниже. Qwen3.8-Flash-Next-Uncensored и Qwen3.8-27B-Uncensored — это две разные модели, а не две сборки одной модели. Разные базовые веса — Qwen3.8-Flash-Next против Qwen3.8-27B — разные архитектуры, разные релизы весов, разные коллекции Hugging Face. Их объединяют техника аблитерации и название семейства; и это всё. Ни одно число со страницы 27B не переносится на эту модель, и если вы попали сюда из поиска по 27B, локальный ранбук самой 27B — это отдельная страница с отдельным набором решений.
Эта страница посвящена исключительно обслуживанию Flash-Next FP8 и ничему другому. В руководстве по GGUF/MLX раскрывается объяснение аблитерации для этой модели и две линии сборки для потребительского оборудования; технология, лежащая в основе всего семейства, объясняется во введении в аблитерацию и более широком обзоре uncensored-LLM; а Qwen3.8-27B-Uncensored-FP8, собрат, на которого вас, возможно, направили, имеет собственное руководство по FP8. Здесь мы останавливаемся на одном вопросе: как обслуживать сборку block-FP8, что ломается при неправильном выполнении и что говорят и о чём умалчивают собственные цифры карты.
Перед началом: шлюз и среда выполнения
Две вещи блокируют этот репозиторий, и обе приводят к сбоям, которые выглядят как что-то другое.
Первое — это доступ. Репозиторий закрыт: вы должны быть авторизованы на Hugging Face и принять условия репозитория, прежде чем загрузка заработает. Сама страница модели читается без аккаунта — полный текст карточки публичен, — но веса — нет. Проще говоря, без авторизованной сессии, принявшей условия, и hf download, и vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 завершаются ошибкой аутентификации, а не дружелюбным «нужно нажать Agree». Сначала выполните разовое подтверждение (кликните Agree), затем скачайте ~186 ГБ с помощью hf CLI или позвольте vLLM разрешить репозиторий при первом запуске.
Второе — это среда выполнения. Чекпоинт регистрируется под архитектурой qwen4_exp (Qwen4ExpForConditionalGeneration), которую стандартные vLLM и стандартные Transformers загрузить не могут. Вам нужен образ vLLM нулевого дня и transformers 5.16+. Это самая распространённая ошибка «не загружается» во всех сообществах на этой неделе — не битое скачивание, а среда выполнения, которая старше архитектуры. Образ не опционален; это и есть путь.
Оборудование, чтобы вы могли спланировать всё заранее, прежде чем что-либо вытаскивать: запуск карты рассчитан на узел с 8 GPU, и рекомендации официального рецепта vLLM для чекпоинта FP8 применимы здесь, поскольку сборки полностью совпадают по тензорам — порядка 265 ГБ видеопамяти GPU для развёртывания на полном узле, при этом TP2 считается минимумом для класса GB300, а TEP4/TEP8 — проверенными полнолотковыми конфигурациями.
Почему существует сборка FP8 — и почему «идентичный путь ядра» — это и есть вся суть.
Аблатерированные веса BF16 являются источником истины; этот репозиторий — та же модель, повторно квантизованная офлайн, намеренно воспроизводящая официальный рецепт Qwen3.8-Flash-Next-FP8. Квантизатор затрагивает только 512 проекций маршрутизируемых экспертов — experts.{e}.down/gate/up_proj — извлекая их из 3D-раскладки BF16-сборки и сохраняя каждую как веса float8_e4m3fn плюс шкалы BF16 weight_scale_inv блоками 128×128. Активации — динамический FP8 на токен; калибровочного набора нет. Всё остальное остаётся в BF16: attention и linear_attn, общий эксперт, маршрутизатор MoE (mlp.gate), микшеры Hyper-Connection, эмбеддинги, lm_head, спекулятивная голова декодирования MTP и вся зрительная башня.
Строка «identical kernel path» — это не просто маркетинг, и она заслуживает одного предложения. Сборка была проверена по официальному FP8-чекпойнту: блочные масштабы воспроизводятся точно (scale_relerr = 0), а FP8-коды совпадают с точностью до суб-ULP округления. Именно поэтому vLLM запускает её с теми же FP8-ядрами с блочным масштабированием и тем же спекулятивным декодированием MTP, что и официальный релиз — тензоры фактически являются теми же тензорами, за вычетом направления отказа.
Конкретно это даёт вам ~186 ГБ на 131 шарде (152 089 тензоров, из них 75 264 в FP8), 262 144 токена нативного контекста, башню vision + video, сохранённую побайтово (333 тензора visual.*), и нетронутую MTP-голову. Сначала веса подвергли аблитерации — одно направление отказа, оценённое на слое 24 и ортогонализованное в float32 из 149 тензоров, записывающих в остаточный поток, согласно Arditi et al. (2024), — а записывающие в остаточный поток компоненты MTP-головы были согласованно отредактированы, так что спекулятивное декодирование продолжает работать. Эта последняя деталь неочевидна, и именно она отличает голову, которая ускоряет декодирование, от той, которая незаметно его ухудшает.

Единственный флаг, от которого зависит успех загрузки.
Запустите эту сборку без --enable-expert-parallel, и вы получите сбой, который выглядит как ошибка формы, а не ошибка конфигурации. Это самый часто сообщаемый сбой обслуживания для этого чекпоинта, и он полностью детерминирован.
Вот арифметика. У маршрутизируемых экспертов слитная проекция gate+up имеет промежуточный размер 640. Block-FP8 выполняет квантование блоками по 128. При обычном тензорном параллелизме эти 640 делятся между рангами — 640 ÷ TP — и для распространённых значений TP (2, 4, 8) доля каждого ранга не кратна 128: TP8 даёт 80, TP4 — 160, TP2 — 320. Тогда vLLM отказывается загружать веса, выдавая ошибку, которая выглядит как несоответствие форм: «The output_size of gate's and up's weight = 80 is not divisible by weight quantization block_n = 128».
Экспертный параллелизм решает эту проблему, разбивая веса экспертов по рангам экспертного параллелизма вместо рангов тензорного параллелизма, что сохраняет границы блоков FP8. Именно поэтому этот флаг обязателен для данной сборки: с --enable-expert-parallel TP8 становится рабочей TEP8. (Для сборки BF16 это безвредно, так как там нет блоков FP8, которые нужно сохранять.) В официальном руководстве vLLM явно указано, что обычный TP8 несовместим с 128-элементными блоками квантования контрольной точки, а тикет vLLM, созданный через два дня после публикации весов, документирует точно такой же сбой на узле с 8×L40s при TP2, TP4 и TP8. Если загрузка падает с ошибкой, похожей на проблему с размерностями, сначала проверьте флаг, а потом уже загрузку.
Точная команда
Вот вызов docker для карты, точно воспроизведённый:
docker run -d --name flashnext --gpus all --ipc host -p 8000:8000 -v /path/to/Qwen3.8-Flash-Next-Uncensored-FP8:/model vllm/vllm-openai:qwen38-flash-next-x86_64-cu130 --model /model --served-model-name Qwen3.8-Flash-Next-Uncensored --tensor-parallel-size 8 --trust-remote-code --max-model-len 262144 --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder
Проработайте неочевидные флаги:
• vllm/vllm-openai:qwen38-flash-next-x86_64-cu130 — образ qwen4_exp, выпущенный в день релиза. Это не универсальный vLLM, а образ, привязанный к конкретной архитектуре, и стандартные образы, выпущенные до qwen4_exp, вообще не загрузят эту контрольную точку.
• --trust-remote-code — загружает код модели qwen4_exp, поставляемый с репозиторием. Без него загрузчик принципиально отказывается работать.
• --max-model-len 262144 — соответствует собственному контекстному окну. Здесь лучше указать его явно, а не оставлять значение по умолчанию.
• --enable-expert-parallel — требуется для сборки FP8 по причинам, указанным в разделе выше. В карточке отмечено, что для BF16 он безвреден.
• --enable-auto-tool-choice --tool-call-parser qwen3_coder — включает использование инструментов и вызов функций в формате XML Qwen3-Coder. Если их отключить, модель по-прежнему общается, но агентный режим использования инструментов отключён.
• --tensor-parallel-size 8 — вызов карты предполагает узел с 8 GPU (8× класса Hopper). С --enable-expert-parallel это развёртывание TEP8.
После запуска контейнера эндпоинт OpenAI-совместим по адресу :8000/v1. Задайте --served-model-name в соответствии с ожиданиями ваших клиентов; в карточке используется Qwen3.8-Flash-Next-Uncensored.
Альтернативы, все указаны в карточке или подтверждены практиками на этой неделе: vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 напрямую после аутентификации вашей HF-сессии; SGLang через образ lmsysorg/sglang:qwen38flashnext с --tp 8 --ep 8 — то же требование экспертного параллелизма, по той же причине; и Transformers с pipeline("image-text-to-text", ...) на transformers 5.16+, если вы хотите работать с моделью через скрипт, а не разворачивать её как сервис.
Что действительно работает, когда вы это подаёте
Закономерности в этом разделе — это выводы сообщества из практических руководств и обсуждений на форумах за эту неделю, а не рекомендации вендора. Если более чем одна конфигурация сообщает об одном и том же поведении, это стоит рассматривать как реальный факт:
• MTP-спекулятивное декодирование работает. Добавьте --speculative-config '{"method":"mtp","num_speculative_tokens":3}' — и vLLM использует сохранённую MTP-голову. Согласно многочисленным runbook'ам, именно MTP позволяет декодированию этой модели оставаться работоспособным, несмотря на её размер.
• OOM при загрузке? Выгрузите таблицу n-грамм. В этой архитектуре n-граммный эмбеддинг PLE с 51 млрд параметров — неожиданный источник расхода памяти. VLLM_PLE_CPU_OFFLOAD=1 перемещает его в оперативную память хоста — выделите там как минимум ~51 ГБ. Официальный рецепт и community-руководства по многоузловому запуску обращаются к этому флагу.
• Зрение реально, а не рудиментарно. Башня vision + video сохранена побайтово, так что это остаётся полноценной vision-language моделью. Передайте content part с image_url в chat completion, и тот же endpoint обеспечит понимание изображений; community OCR-проверки на этой сборке показывают чистые прохождения.
• Рассуждение включено по умолчанию — и это меняет картину безопасности.Шаблон чата включает режим мышления, если вы не укажете иное. Переключайте его по запросу с помощью chat_template_kwargs={"enable_thinking": true|false}, и добавьте парсер рассуждений, если хотите отделить текст рассуждений от ответа. Из-за этой настройки по умолчанию вы почти всегда обслуживаете модель с включённым мышлением, если только явно не отключите его.
• 262K нативно, 1M с переопределением rope.Нативный контекст — 262 144 токена. Для продвижения к 1M требуется явное переопределение YaRN rope-scaling плюс переменная окружения, снимающая лимит max-model-len в vLLM — и сначала стоит прогнать регрессионное тестирование качества на коротких контекстах, потому что слепое 4-кратное расширение — это как раз то, где качество длинного контекста обычно деградирует.

Что говорят цифры на карте — и о чём они умалчивают
Это собственные измерения вендора, выполненные на его собственной редакции, опубликованные в карточке модели и полученные на этих самых весах, поданных через vLLM, в сравнении с официальной базовой моделью при одинаковых скриптах и настройках. Подавайте их как то, чем они являются: ориентировочными данными, а не независимым аудитом.
Главная новость — коллапс отказов при выключенном мышлении. На наборе вредоносных промптов из карточки (n от 50 до 150 на бенчмарк) базовый уровень отказов составляет 64–100%, а у этой сборки — 0–2,7%: AdvBench 100%→2,0%, JailbreakBench 94%→0,0%, StrongREJECT 99,3%→1,3%, HarmBench 100%→1,3%, MaliciousInstruct 98%→0,0%, SimpleSafetyTests 64%→2,0%, ForbiddenQuestions 75,3%→2,7% и собственный китайско-английский пробник 63,6%→0,0%.
Теперь честная половина. Собственный показатель отказов базовой модели резко падает, когда включено мышление — AdvBench снижается со 100% на базе до 7,0% с рассуждениями — так что сравнение при включённом мышлении гораздо менее драматично: эта сборка показывает 0,0% на том же наборе, но она срезает небольшое число с числа, которое база уже уменьшила. Цитируйте только показатели без мышления — и вы представляете лестную половину истории, а именно на эту половину оценка безопасности полагаться не должна.
Чрезмерный отказ на безобидных запросах (XSTest-safe, n=250) снижается с 9,6% на базовой версии до 1,2% на этой сборке при выключенном мышлении — реальное улучшение, поскольку модель, отказывающаяся отвечать на безобидные запросы, является менее заметным режимом отказа. Сохранение способностей на MMLU / MMLU-Pro / GSM8K / CMMLU показывает дельты −2,0, −1,2, −1,3 и −0,6 пункта соответственно, что согласуется с утверждением, что ортогонализация одного направления почти не снижает общую способность. Инструментальные вызовы, vision/OCR и рассуждения — всё, по сообщениям, работает в этой сборке.
Две оговорки применимы ко всему вышесказанному. Показатель отказов получен из классификатора вступительных фраз, основанного на правилах, который сама карточка называет индикативным, а не оценкой LLM-судьи или числом публикационного уровня — человеческая панель или модель-судья не воспроизведут эти точные цифры. И колонка оговорок важна: в наборе с отключённым мышлением примерно от половины до трёх четвертей выходных данных этой сборки всё ещё начинаются с краткого дисклеймера перед выполнением запроса. Модель редко отказывается; она добавляет оговорки. «Нецензурированная» здесь означает, что модель отвечает, а не то, что она отвечает без предисловий.
Раздел безопасности — не формальность.
Прочитайте это перед тем, как поднимать веса, а не после.
У этой модели существенно удалено выравнивание безопасности, и механизм конкретен: единственное направление отказа было оценено в остаточном потоке и ортогонализировано из каждой матрицы записи в остаточный поток — их 149 — вычисленных в float32. Следствие заявлено открыто, а не случайно. Карточка модели недвусмысленно заявляет, что модель будет выполнять вредные, неэтичные, оскорбительные или незаконные запросы, которые базовая Qwen3.8-Flash-Next отклонила бы, и что у неё нет значимых встроенных защитных механизмов. Она выпущена строго для легитимных исследований — интерпретируемости, ИИ-безопасности и изучения механизма отказа, ред-тимминга, оценки устойчивости и контролируемых экспериментов — и пользователь принимает на себя полную ответственность за всё, что она генерирует. Apache 2.0 определяет, что вы можете делать с весами.
Две вещи нужно сделать точно правильно, потому что в этой сборке на них легко ошибиться.
Во-первых, джейлбрейк-проба, которая «успешно» срабатывает против этой модели, не является прохождением оценки безопасности. Это заявленное поведение. Если ваша оценка утверждает, что «безопасность этой модели была обойдена», вы измерили дизайн, а не уязвимость. Что действительно было бы находкой — это отказ, который переживает абliteration, или регрессия возможностей — и цифры в карточке предполагают, что оба случая редки.
Во-вторых, сохранившаяся поверхность атаки шире, чем текст. Зрительная башня неповреждена байт в байт, а вызов инструментов работает, так что ввод изображений и агентное использование — оба активны. План red-team, проверяющий только текстовые промпты, упускает модальности, которые эта модель реально предоставляет. А приведённые выше цифры отказов — это основанный на правилах классификатор, применённый к собственной правке вендора, а не независимый аудит чего-либо, включая безопасность.
Не разворачивайте это для конечных пользователей и не выводите в продакшен, не добавив собственных уровней безопасности, модерации и предотвращения злоупотреблений. Условия репозитория говорят об этом прямо, и это не шаблонная фраза: результаты не отражают мнения загрузивших или Qwen / Alibaba.

Как получить цензурированный базовый уровень для сравнения
Если ваша работа связана с исследованием механизмов отказа или ред-тимингом, вам почти наверняка захочется иметь бок о бок цензурированную версию этой модели — ту же архитектуру без правки — чтобы измерить дельту. Эта бесцензурная сборка изначально рассчитана только на локальное использование: доступ к репозиторию ограничен и развёртывание для инференса на внешнем хостинге отсутствует — это сознательное решение, чтобы чувствительные пейлоады никогда не передавались через сторонний API.
Для размещенного базового варианта OrcaRouter маршрутизирует линейку {{KEEP}}Qwen{{/KEEP}} по прейскурантной цене провайдера с нулевой наценкой — {{1}}Qwen3.8-Flash по $0,15 за миллион входных токенов и $0,47 за миллион выходных, передается как есть, с автоматическим переключением и одним ключом для 200+ моделей.{{/1}} Изменение цены поставщика отражается в тот же день. Если вы оцениваете, стоит ли вообще запускать эту сборку или какую часть стека она потянет, {{2}}это дешевый способ сопоставить цензурированную версию с ней без второго контракта и второй кодовой базы.{{/2}}
Начните здесь
Сводка решения. Вам потребуется: учётная запись Hugging Face с принятыми условиями репозитория; узел класса Hopper или новее — команда из карточки модели рассчитана на 8 GPU и порядка 265 ГБ видеопамяти GPU согласно указаниям официального руководства для соответствующего FP8-контрольного снимка; образ vLLM day-0 и transformers 5.16+; а также примерно 186 ГБ дискового пространства для весов.
Порядок выполнения: примите условия репозитория → скачайте веса → загрузите образ day-0 → запустите сервер с --enable-expert-parallel → проверьте запросом к :8000/v1/chat/completions → затем запустите свои эвалы. Если загрузка не удается с ошибкой, похожей на проблему с формой, сначала проверьте флаг, а не загрузку.
И сохраните рамку. Это исследовательский инструмент, выпущенный при этом условии. Его цифры — это собственные ориентировочные измерения вендора в его собственной редакции. Его поведение в области безопасности — суть упражнения, а не ошибка, которую нужно обходить. Обслуживайте его, измеряйте его и помещайте собственную модерацию между ним и всем человеческим.
Все пять сборок Flash-Next — BF16, GGUF, MLX, FP8 и NVFP4 — собраны в коллекции Qwen3.8-Flash-Next-Uncensored на Hugging Face.
Это другая модель, а не очередная сборка этой: Qwen3.8-27B-Uncensored является abliterated-версией другой базовой модели и имеет собственную коллекцию и собственные инструкции.
Эти веса по замыслу предназначены только для локального использования. Для размещенной эталонной модели, с которой можно сравнивать abliterated-сборку, Qwen3.8-Flash обслуживается на OrcaRouter по цене провайдера с нулевой наценкой — исходная модель с сохранённым выравниванием безопасности.
