Титульная карточка для статьи «Сервинг Qwen3.8-Flash-Next-Uncensored-FP8» с кикером «РУКОВОДСТВО ПО СЕРВИНГУ VLLM», значком с надписью «BLOCK-FP8 · E4M3», подзаголовком «Руководство по сервингу vLLM для сборки block-FP8 — GPU класса Hopper» и двумя скругленными карточками с надписями «~186 ГБ · 131 шард» и «262K контекст · MTP + vision сохранены». Логотип OrcaRouter размещен в правом нижнем углу.
Guides & Insights

Развертывание Qwen3.8-Flash-Next-Uncensored-FP8: руководство по vLLM для сборки block-FP8

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen3.8-Flash-Next-Uncensored-FP8 — block-FP8-сборка abliterated Flash-Next — это артефакт, который вы фактически загружаете при развертывании этой модели на оборудовании дата-центра, и она последняя в коллекции, получившая собственное руководство по эксплуатации. Она размещена на orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 на Hugging Face: направление отказа удалено из Qwen3.8-Flash-Next от Qwen, затем модель повторно квантизована офлайн в точную схему FP8 официальной Qwen3.8-Flash-Next-FP8, чтобы vLLM обслуживала её на том же пути ядра. Это та сборка, к которой обратится любой, кто запускает эту модель на GPU класса Hopper и новее, и в процессе обслуживания есть один флаг, который легко перепутать, а когда он перепутан, это трудно диагностировать.

Во-первых, граница: читатели постоянно её размывают, а она определяет всё, что ниже. Qwen3.8-Flash-Next-Uncensored и Qwen3.8-27B-Uncensored — это две разные модели, а не две сборки одной модели. Разные базовые веса — Qwen3.8-Flash-Next против Qwen3.8-27B — разные архитектуры, разные релизы весов, разные коллекции Hugging Face. Их объединяют техника аблитерации и название семейства; и это всё. Ни одно число со страницы 27B не переносится на эту модель, и если вы попали сюда из поиска по 27B, локальный ранбук самой 27B — это отдельная страница с отдельным набором решений.

Эта страница посвящена исключительно обслуживанию Flash-Next FP8 и ничему другому. В руководстве по GGUF/MLX раскрывается объяснение аблитерации для этой модели и две линии сборки для потребительского оборудования; технология, лежащая в основе всего семейства, объясняется во введении в аблитерацию и более широком обзоре uncensored-LLM; а Qwen3.8-27B-Uncensored-FP8, собрат, на которого вас, возможно, направили, имеет собственное руководство по FP8. Здесь мы останавливаемся на одном вопросе: как обслуживать сборку block-FP8, что ломается при неправильном выполнении и что говорят и о чём умалчивают собственные цифры карты.

Перед началом: шлюз и среда выполнения

Две вещи блокируют этот репозиторий, и обе приводят к сбоям, которые выглядят как что-то другое.

Первое — это доступ. Репозиторий закрыт: вы должны быть авторизованы на Hugging Face и принять условия репозитория, прежде чем загрузка заработает. Сама страница модели читается без аккаунта — полный текст карточки публичен, — но веса — нет. Проще говоря, без авторизованной сессии, принявшей условия, и hf download, и vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 завершаются ошибкой аутентификации, а не дружелюбным «нужно нажать Agree». Сначала выполните разовое подтверждение (кликните Agree), затем скачайте ~186 ГБ с помощью hf CLI или позвольте vLLM разрешить репозиторий при первом запуске.

Второе — это среда выполнения. Чекпоинт регистрируется под архитектурой qwen4_exp (Qwen4ExpForConditionalGeneration), которую стандартные vLLM и стандартные Transformers загрузить не могут. Вам нужен образ vLLM нулевого дня и transformers 5.16+. Это самая распространённая ошибка «не загружается» во всех сообществах на этой неделе — не битое скачивание, а среда выполнения, которая старше архитектуры. Образ не опционален; это и есть путь.

Оборудование, чтобы вы могли спланировать всё заранее, прежде чем что-либо вытаскивать: запуск карты рассчитан на узел с 8 GPU, и рекомендации официального рецепта vLLM для чекпоинта FP8 применимы здесь, поскольку сборки полностью совпадают по тензорам — порядка 265 ГБ видеопамяти GPU для развёртывания на полном узле, при этом TP2 считается минимумом для класса GB300, а TEP4/TEP8 — проверенными полнолотковыми конфигурациями.

Почему существует сборка FP8 — и почему «идентичный путь ядра» — это и есть вся суть.

Аблатерированные веса BF16 являются источником истины; этот репозиторий — та же модель, повторно квантизованная офлайн, намеренно воспроизводящая официальный рецепт Qwen3.8-Flash-Next-FP8. Квантизатор затрагивает только 512 проекций маршрутизируемых экспертов — experts.{e}.down/gate/up_proj — извлекая их из 3D-раскладки BF16-сборки и сохраняя каждую как веса float8_e4m3fn плюс шкалы BF16 weight_scale_inv блоками 128×128. Активации — динамический FP8 на токен; калибровочного набора нет. Всё остальное остаётся в BF16: attention и linear_attn, общий эксперт, маршрутизатор MoE (mlp.gate), микшеры Hyper-Connection, эмбеддинги, lm_head, спекулятивная голова декодирования MTP и вся зрительная башня.

Строка «identical kernel path» — это не просто маркетинг, и она заслуживает одного предложения. Сборка была проверена по официальному FP8-чекпойнту: блочные масштабы воспроизводятся точно (scale_relerr = 0), а FP8-коды совпадают с точностью до суб-ULP округления. Именно поэтому vLLM запускает её с теми же FP8-ядрами с блочным масштабированием и тем же спекулятивным декодированием MTP, что и официальный релиз — тензоры фактически являются теми же тензорами, за вычетом направления отказа.

Конкретно это даёт вам ~186 ГБ на 131 шарде (152 089 тензоров, из них 75 264 в FP8), 262 144 токена нативного контекста, башню vision + video, сохранённую побайтово (333 тензора visual.*), и нетронутую MTP-голову. Сначала веса подвергли аблитерации — одно направление отказа, оценённое на слое 24 и ортогонализованное в float32 из 149 тензоров, записывающих в остаточный поток, согласно Arditi et al. (2024), — а записывающие в остаточный поток компоненты MTP-головы были согласованно отредактированы, так что спекулятивное декодирование продолжает работать. Эта последняя деталь неочевидна, и именно она отличает голову, которая ускоряет декодирование, от той, которая незаметно его ухудшает.

A spec-sheet infographic for Qwen3.8-Flash-Next-Uncensored-FP8 titled 'the build, at a glance', listing six rows: Quantized 512 routed-expert projections only, Format block-FP8 E4M3 128×128 blocks, Stays BF16 attention / shared expert / vision / MTP, Size ~186 GB · 131 shards (75,264 FP8 tensors), Verified scale_relerr 0 vs official FP8, and Required flag --enable-expert-parallel. Footer: 'All figures from the model card, orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8.' The OrcaRouter logo is composited in the bottom-right corner.

Единственный флаг, от которого зависит успех загрузки.

Запустите эту сборку без --enable-expert-parallel, и вы получите сбой, который выглядит как ошибка формы, а не ошибка конфигурации. Это самый часто сообщаемый сбой обслуживания для этого чекпоинта, и он полностью детерминирован.

Вот арифметика. У маршрутизируемых экспертов слитная проекция gate+up имеет промежуточный размер 640. Block-FP8 выполняет квантование блоками по 128. При обычном тензорном параллелизме эти 640 делятся между рангами — 640 ÷ TP — и для распространённых значений TP (2, 4, 8) доля каждого ранга не кратна 128: TP8 даёт 80, TP4 — 160, TP2 — 320. Тогда vLLM отказывается загружать веса, выдавая ошибку, которая выглядит как несоответствие форм: «The output_size of gate's and up's weight = 80 is not divisible by weight quantization block_n = 128».

Экспертный параллелизм решает эту проблему, разбивая веса экспертов по рангам экспертного параллелизма вместо рангов тензорного параллелизма, что сохраняет границы блоков FP8. Именно поэтому этот флаг обязателен для данной сборки: с --enable-expert-parallel TP8 становится рабочей TEP8. (Для сборки BF16 это безвредно, так как там нет блоков FP8, которые нужно сохранять.) В официальном руководстве vLLM явно указано, что обычный TP8 несовместим с 128-элементными блоками квантования контрольной точки, а тикет vLLM, созданный через два дня после публикации весов, документирует точно такой же сбой на узле с 8×L40s при TP2, TP4 и TP8. Если загрузка падает с ошибкой, похожей на проблему с размерностями, сначала проверьте флаг, а потом уже загрузку.

Точная команда

Вот вызов docker для карты, точно воспроизведённый:

docker run -d --name flashnext --gpus all --ipc host -p 8000:8000 -v /path/to/Qwen3.8-Flash-Next-Uncensored-FP8:/model vllm/vllm-openai:qwen38-flash-next-x86_64-cu130 --model /model --served-model-name Qwen3.8-Flash-Next-Uncensored --tensor-parallel-size 8 --trust-remote-code --max-model-len 262144 --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder

Проработайте неочевидные флаги:

vllm/vllm-openai:qwen38-flash-next-x86_64-cu130 — образ qwen4_exp, выпущенный в день релиза. Это не универсальный vLLM, а образ, привязанный к конкретной архитектуре, и стандартные образы, выпущенные до qwen4_exp, вообще не загрузят эту контрольную точку.

--trust-remote-code — загружает код модели qwen4_exp, поставляемый с репозиторием. Без него загрузчик принципиально отказывается работать.

--max-model-len 262144 — соответствует собственному контекстному окну. Здесь лучше указать его явно, а не оставлять значение по умолчанию.

--enable-expert-parallel — требуется для сборки FP8 по причинам, указанным в разделе выше. В карточке отмечено, что для BF16 он безвреден.

--enable-auto-tool-choice --tool-call-parser qwen3_coder — включает использование инструментов и вызов функций в формате XML Qwen3-Coder. Если их отключить, модель по-прежнему общается, но агентный режим использования инструментов отключён.

--tensor-parallel-size 8 — вызов карты предполагает узел с 8 GPU (8× класса Hopper). С --enable-expert-parallel это развёртывание TEP8.

После запуска контейнера эндпоинт OpenAI-совместим по адресу :8000/v1. Задайте --served-model-name в соответствии с ожиданиями ваших клиентов; в карточке используется Qwen3.8-Flash-Next-Uncensored.

Альтернативы, все указаны в карточке или подтверждены практиками на этой неделе: vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 напрямую после аутентификации вашей HF-сессии; SGLang через образ lmsysorg/sglang:qwen38flashnext с --tp 8 --ep 8 — то же требование экспертного параллелизма, по той же причине; и Transformers с pipeline("image-text-to-text", ...) на transformers 5.16+, если вы хотите работать с моделью через скрипт, а не разворачивать её как сервис.

Что действительно работает, когда вы это подаёте

Закономерности в этом разделе — это выводы сообщества из практических руководств и обсуждений на форумах за эту неделю, а не рекомендации вендора. Если более чем одна конфигурация сообщает об одном и том же поведении, это стоит рассматривать как реальный факт:

MTP-спекулятивное декодирование работает. Добавьте --speculative-config '{"method":"mtp","num_speculative_tokens":3}' — и vLLM использует сохранённую MTP-голову. Согласно многочисленным runbook'ам, именно MTP позволяет декодированию этой модели оставаться работоспособным, несмотря на её размер.

OOM при загрузке? Выгрузите таблицу n-грамм. В этой архитектуре n-граммный эмбеддинг PLE с 51 млрд параметров — неожиданный источник расхода памяти. VLLM_PLE_CPU_OFFLOAD=1 перемещает его в оперативную память хоста — выделите там как минимум ~51 ГБ. Официальный рецепт и community-руководства по многоузловому запуску обращаются к этому флагу.

Зрение реально, а не рудиментарно. Башня vision + video сохранена побайтово, так что это остаётся полноценной vision-language моделью. Передайте content part с image_url в chat completion, и тот же endpoint обеспечит понимание изображений; community OCR-проверки на этой сборке показывают чистые прохождения.

Рассуждение включено по умолчанию — и это меняет картину безопасности.Шаблон чата включает режим мышления, если вы не укажете иное. Переключайте его по запросу с помощью chat_template_kwargs={"enable_thinking": true|false}, и добавьте парсер рассуждений, если хотите отделить текст рассуждений от ответа. Из-за этой настройки по умолчанию вы почти всегда обслуживаете модель с включённым мышлением, если только явно не отключите его.

262K нативно, 1M с переопределением rope.Нативный контекст — 262 144 токена. Для продвижения к 1M требуется явное переопределение YaRN rope-scaling плюс переменная окружения, снимающая лимит max-model-len в vLLM — и сначала стоит прогнать регрессионное тестирование качества на коротких контекстах, потому что слепое 4-кратное расширение — это как раз то, где качество длинного контекста обычно деградирует.

A screenshot of the Hugging Face model page for orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8, showing the model id, the gated-access notice 'You need to agree to share your contact information to access this model', model size 180B params with tensor type BF16 and F8_E4M3, the base-model line Qwen/Qwen3.8-Flash-Next, the tags abliterated, red-teaming, vision-language, function-calling, reasoning, MTP and block-FP8, and the card's opening line describing it as an abliterated and offline block-FP8 build of Qwen's Qwen3.8-Flash-Next.

Что говорят цифры на карте — и о чём они умалчивают

Это собственные измерения вендора, выполненные на его собственной редакции, опубликованные в карточке модели и полученные на этих самых весах, поданных через vLLM, в сравнении с официальной базовой моделью при одинаковых скриптах и настройках. Подавайте их как то, чем они являются: ориентировочными данными, а не независимым аудитом.

Главная новость — коллапс отказов при выключенном мышлении. На наборе вредоносных промптов из карточки (n от 50 до 150 на бенчмарк) базовый уровень отказов составляет 64–100%, а у этой сборки — 0–2,7%: AdvBench 100%→2,0%, JailbreakBench 94%→0,0%, StrongREJECT 99,3%→1,3%, HarmBench 100%→1,3%, MaliciousInstruct 98%→0,0%, SimpleSafetyTests 64%→2,0%, ForbiddenQuestions 75,3%→2,7% и собственный китайско-английский пробник 63,6%→0,0%.

Теперь честная половина. Собственный показатель отказов базовой модели резко падает, когда включено мышление — AdvBench снижается со 100% на базе до 7,0% с рассуждениями — так что сравнение при включённом мышлении гораздо менее драматично: эта сборка показывает 0,0% на том же наборе, но она срезает небольшое число с числа, которое база уже уменьшила. Цитируйте только показатели без мышления — и вы представляете лестную половину истории, а именно на эту половину оценка безопасности полагаться не должна.

Чрезмерный отказ на безобидных запросах (XSTest-safe, n=250) снижается с 9,6% на базовой версии до 1,2% на этой сборке при выключенном мышлении — реальное улучшение, поскольку модель, отказывающаяся отвечать на безобидные запросы, является менее заметным режимом отказа. Сохранение способностей на MMLU / MMLU-Pro / GSM8K / CMMLU показывает дельты −2,0, −1,2, −1,3 и −0,6 пункта соответственно, что согласуется с утверждением, что ортогонализация одного направления почти не снижает общую способность. Инструментальные вызовы, vision/OCR и рассуждения — всё, по сообщениям, работает в этой сборке.

Две оговорки применимы ко всему вышесказанному. Показатель отказов получен из классификатора вступительных фраз, основанного на правилах, который сама карточка называет индикативным, а не оценкой LLM-судьи или числом публикационного уровня — человеческая панель или модель-судья не воспроизведут эти точные цифры. И колонка оговорок важна: в наборе с отключённым мышлением примерно от половины до трёх четвертей выходных данных этой сборки всё ещё начинаются с краткого дисклеймера перед выполнением запроса. Модель редко отказывается; она добавляет оговорки. «Нецензурированная» здесь означает, что модель отвечает, а не то, что она отвечает без предисловий.

Раздел безопасности — не формальность.

Прочитайте это перед тем, как поднимать веса, а не после.

У этой модели существенно удалено выравнивание безопасности, и механизм конкретен: единственное направление отказа было оценено в остаточном потоке и ортогонализировано из каждой матрицы записи в остаточный поток — их 149 — вычисленных в float32. Следствие заявлено открыто, а не случайно. Карточка модели недвусмысленно заявляет, что модель будет выполнять вредные, неэтичные, оскорбительные или незаконные запросы, которые базовая Qwen3.8-Flash-Next отклонила бы, и что у неё нет значимых встроенных защитных механизмов. Она выпущена строго для легитимных исследований — интерпретируемости, ИИ-безопасности и изучения механизма отказа, ред-тимминга, оценки устойчивости и контролируемых экспериментов — и пользователь принимает на себя полную ответственность за всё, что она генерирует. Apache 2.0 определяет, что вы можете делать с весами.

Две вещи нужно сделать точно правильно, потому что в этой сборке на них легко ошибиться.

Во-первых, джейлбрейк-проба, которая «успешно» срабатывает против этой модели, не является прохождением оценки безопасности. Это заявленное поведение. Если ваша оценка утверждает, что «безопасность этой модели была обойдена», вы измерили дизайн, а не уязвимость. Что действительно было бы находкой — это отказ, который переживает абliteration, или регрессия возможностей — и цифры в карточке предполагают, что оба случая редки.

Во-вторых, сохранившаяся поверхность атаки шире, чем текст. Зрительная башня неповреждена байт в байт, а вызов инструментов работает, так что ввод изображений и агентное использование — оба активны. План red-team, проверяющий только текстовые промпты, упускает модальности, которые эта модель реально предоставляет. А приведённые выше цифры отказов — это основанный на правилах классификатор, применённый к собственной правке вендора, а не независимый аудит чего-либо, включая безопасность.

Не разворачивайте это для конечных пользователей и не выводите в продакшен, не добавив собственных уровней безопасности, модерации и предотвращения злоупотреблений. Условия репозитория говорят об этом прямо, и это не шаблонная фраза: результаты не отражают мнения загрузивших или Qw​en / Ali​baba.

A screenshot of the OrcaRouter model page for Qwen3.8-Flash (model id qwen/qwen3.8-flash), showing the breadcrumb Home / Models / Qwen, the model name Qwen3.8 Flash, the Vision, Tools, JSON and Reasoning capability chips, input price $0.15 and output price $0.47, context 1M tokens with max output 131K, input types text + image + video, output text, and a p50 time-to-first-token of 10.00 s, dated 2026-08-26.

Как получить цензурированный базовый уровень для сравнения

Если ваша работа связана с исследованием механизмов отказа или ред-тимингом, вам почти наверняка захочется иметь бок о бок цензурированную версию этой модели — ту же архитектуру без правки — чтобы измерить дельту. Эта бесцензурная сборка изначально рассчитана только на локальное использование: доступ к репозиторию ограничен и развёртывание для инференса на внешнем хостинге отсутствует — это сознательное решение, чтобы чувствительные пейлоады никогда не передавались через сторонний API.

Для размещенного базового варианта OrcaRouter маршрутизирует линейку {{KEEP}}Qwen{{/KEEP}} по прейскурантной цене провайдера с нулевой наценкой — {{1}}Qwen3.8-Flash по $0,15 за миллион входных токенов и $0,47 за миллион выходных, передается как есть, с автоматическим переключением и одним ключом для 200+ моделей.{{/1}} Изменение цены поставщика отражается в тот же день. Если вы оцениваете, стоит ли вообще запускать эту сборку или какую часть стека она потянет, {{2}}это дешевый способ сопоставить цензурированную версию с ней без второго контракта и второй кодовой базы.{{/2}}

Начните здесь

Сводка решения. Вам потребуется: учётная запись Hugging Face с принятыми условиями репозитория; узел класса Hopper или новее — команда из карточки модели рассчитана на 8 GPU и порядка 265 ГБ видеопамяти GPU согласно указаниям официального руководства для соответствующего FP8-контрольного снимка; образ vLLM day-0 и transformers 5.16+; а также примерно 186 ГБ дискового пространства для весов.

Порядок выполнения: примите условия репозитория → скачайте веса → загрузите образ day-0 → запустите сервер с --enable-expert-parallel → проверьте запросом к :8000/v1/chat/completions → затем запустите свои эвалы. Если загрузка не удается с ошибкой, похожей на проблему с формой, сначала проверьте флаг, а не загрузку.

И сохраните рамку. Это исследовательский инструмент, выпущенный при этом условии. Его цифры — это собственные ориентировочные измерения вендора в его собственной редакции. Его поведение в области безопасности — суть упражнения, а не ошибка, которую нужно обходить. Обслуживайте его, измеряйте его и помещайте собственную модерацию между ним и всем человеческим.

Все пять сборок Flash-Next — BF16, GGUF, MLX, FP8 и NVFP4 — собраны в коллекции Qwen3.8-Flash-Next-Uncensored на Hugging Face.

Это другая модель, а не очередная сборка этой: Qwen3.8-27B-Uncensored является abliterated-версией другой базовой модели и имеет собственную коллекцию и собственные инструкции.

Эти веса по замыслу предназначены только для локального использования. Для размещенной эталонной модели, с которой можно сравнивать abliterated-сборку, Qwen3.8-Flash обслуживается на OrcaRouter по цене провайдера с нулевой наценкой — исходная модель с сохранённым выравниванием безопасности.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube