Титульная карточка для статьи «Qwen3.8-Flash-Next-Uncensored-NVFP4: Руководство по обслуживанию Blackwell»: показаны заголовок, подзаголовок «Руководство по обслуживанию Blackwell — эксперты NVFP4, внимание FP8, BF16 PLE» и четыре плашки характеристик: «Только Blackwell — тензорные ядра FP4», «330 ГБ → 178 ГБ», «Доступ по запросу на Hugging Face» и «Контекст 262K», с логотипом OrcaRouter, помещённым в правый нижний угол.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored-NVFP4: руководство по развертыванию на Blackwell

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen3.8-Flash-Next-Uncensored-NVFP4 работает ровно на одном семействе GPU: Blackwell. NVFP4 выполняется на аппаратных FP4-тензорных ядрах, а Hopper (H100/H200) и всё, что старше, их просто не имеют. Если у вас Hopper, остановитесь здесь — Qwen3.8-Flash-Next-Uncensored-FP8 сборка — именно то, что вам нужно. Далее предполагается Blackwell (B100, B200, GB200 или карта серии RTX 50), свежая сборка vLLM с поддержкой qwen4_exp и transformers ≥ 5.16.

Это NVFP4-квантование abliterated-сборки (с удалёнными отказами) Qw​en Qw​en/Qwen3.8-Flash-Next, ужатой с 330 ГБ в BF16 до 178 ГБ на диске. OrcaRouter опубликовал её на Hugging Face 27 августа 2026 года как orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4. Доступ к репозиторию ограничен: вы должны быть авторизованы в Hugging Face и принять условия репозитория, иначе hf download и vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 оба завершатся ошибкой аутентификации, не успев переслать ни байта. Эта страница — практическое руководство по развёртыванию, а не анонс запуска: сборке два дня, и вопросы, с которыми люди реально сталкиваются, — это железо, флаги и какую сборку выбрать.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 repo (captured August 29 2026), showing the gate banner 'You need to agree to share your contact information to access this model', 'Login or Sign Up to review the conditions', Model size 125B params, tensor types F8_E4M3 · BF16 · U8 · I64, the apache-2.0 licence, the base-model line Qwen/Qwen3.8-Flash-Next, and the abliterated, uncensored, nvfp4, fp4, fp8, vllm and vision-language tags.

И прежде чем перейти к цифрам: Qwen3.8-Flash-Next-Uncensored — это не Qwen3.8-27B-Uncensored. Это две разные модели, у которых общее лишь семейное имя и техника аблитерации: разные базовые веса, разная архитектура, разные коллекции на Hugging Face. Flash-Next — результат аблитерации модели Qw​en/Qwen3.8-Flash-Next, маршрутизируемой смеси экспертов, представляющей собой превью архитектуры Qwen4 (qwen4_exp): 512 экспертов, из которых одновременно активны десять маршрутизируемых и один общий, гибридное внимание (линейные слои Gated DeltaNet наряду со слоями полного внимания), Hyper-Connections, n-граммный эмбеддинг PLE, нативная башня обработки изображений и видео, а также спекулятивная декодирующая голова MTP. Модель 27B — результат аблитерации модели Qw​en/Qwen3.8-27B, совершенно другой плотной базовой модели. Никакие цифры инференса со страницы 27B на эту модель не переносятся; там, где страница 27B действительно полезна — вводная по аблитерации, общая математика выбора квантов — она приведена ниже с указанием, что из этого применимо, а что нет.

A scoreboard card for Qwen3.8-Flash-Next-Uncensored-NVFP4 with six rows: base model Qwen/Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + accepted terms), precision NVFP4 experts - FP8 attention - BF16 PLE, on-disk size 178 GB from 330 GB BF16, KV cache BF16 (not quantized), hardware Blackwell only (FP4 tensor cores); footer reads 'All figures from the orcarouter model card, August 29 2026 - self-reported, not independently audited.'

Что это за билд, точность за точностью

Qwen3.8-Flash-Next — это маршрутизируемый MoE: каждый токен активирует 10 из 512 экспертов плюс один общий эксперт, и лишь несколько миллиардов параметров работают на токен, хотя сохранённая модель значительно больше. Сборка NVFP4 — это смешанно-точное сжато-тензорное квантование этого стека, и вся суть — в расщеплении:

• Веса экспертов MoE — NVFP4 (4-битный, NVIDIA FP4 E2M1, группы по 16 с блочными масштабами FP8).

• Внимание (self_attn.{q,k,v,o}), проекции linear_attn, общий эксперт и lm_head — FP8 (8-битный).

• PLE n-gram эмбеддинг, токен- и визуальные эмбеддинги, Hyper-Connections, индексатор QSA, Gated-DeltaNet conv/dt, все нормализации и весь vision tower — BF16, сохранены в полной точности.

Три свойства преобразования важнее, чем само разделение по точности. Во-первых, оно затрагивает только веса: активации квантуются динамически во время выполнения, статической калибровки нет, а веса получаются напрямую из контрольной точки BF16 (в карточке этот вывод называют «data-free»). Во-вторых, правка abliteration вшита в веса, поэтому удаление отказов переживает квантование — 4-битное преобразование это изменение точности, а не вмешательство в безопасность. В-третьих, KV-кэш не квантуется; во время выполнения он остаётся в BF16. Последнее легко упустить из виду, и оно важно при родном контексте модели в 262 144 токена, где KV-кэш — реальная статья расхода памяти наряду с весами.

Объём на диске определяется одним тензором. Карточка описывает PLE n-граммный эмбеддинг как единый тензор с ~66 млрд параметров, который намеренно хранится в BF16; это самый большой шард и причина того, что сборка занимает 178 ГБ, а не более скромный объём. Стоит указать на одно расхождение, а не замалчивать его: родственная карточка FP8 называет ту же таблицу PLE n-граммом с 51 млрд параметров, а примечание W4A4 в этой карточке указывает для неё ~100 ГБ. В двух карточках приведены разные цифры для одной и той же таблицы, поэтому относитесь к каждой как к числу соответствующей карточки — и при расчёте развёртывания исходите из того, что таблица велика в BF16, и планируйте с учётом этого.

Аппаратное предусловие, в деталях

Это самый короткий, но самый важный раздел страницы. NVFP4 — это формат Blackwell: быстрый путь — это нативный FP4 GEMM на тензорных ядрах пятого поколения, и без этого аппаратного обеспечения формату не на чем работать. Собственная строка требований карты недвусмысленна — графический процессор Blackwell (B100 / B200 / GB200 / RTX 50-серии), поскольку NVFP4 использует аппаратные тензорные ядра FP4, и он не будет работать на Hopper (H100/H200) или более старых, в которых отсутствует поддержка вычислений FP4.

Все редиректы — в одном месте:

• На Hopper (H100/H200) — вместо этого используйте Qwen3.8-Flash-Next-Uncensored-FP8. Это те же веса в 8-битном формате, он работает на Hopper и Blackwell, и это именно та сборка, которую описывает руководство по FP8 из этого блога.

• На потребительском GPU NVIDIA или на CPU-системе — сборка GGUF с её 13 квантизациями llama.cpp — это локальный путь.

• На Apple Silicon — сборка MLX в вариантах 4/6/8 бит — это нативный путь Metal.

Требование к среде выполнения столь же непреложно, как и сам кремний. qwen4_exp — это совершенно новая архитектура, поэтому стандартные сборки vLLM, выпущенные до неё, откажутся загружать чекпоинт. Вам нужен свежий vLLM с поддержкой qwen4_exp, а также модуль чтения compressed-tensors NVFP4 (формат определяется из config.json, а не выбирается вручную), и transformers ≥ 5.16. Мультимодальный ввод дополнительно требует стека компьютерного зрения Qw​en в среде выполнения; для обслуживания только текстовых запросов он не требуется.

Команда serve карты, флаг за флагом

Вызов самой карточки модели — хорошая отправная точка, и стоит понимать, для чего нужен каждый флаг, а не копировать вслепую:

vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 --tensor-parallel-size 4 --trust-remote-code --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder

--tensor-parallel-size 4 — веса занимают ~178 ГБ на диске, поэтому карта распределяет их по четырём GPU. Именно под такую конфигурацию рассчитана сборка; не воспринимайте это как рекомендацию.

--trust-remote-code — обязателен для пользовательской архитектуры. Код модели qwen4_exp ещё не включён в стандартный реестр transformers, поэтому vLLM загружает код архитектуры из репозитория. Вы доверяете этому коду — это нормальное, но ответственное решение для совершенно новой архитектуры.

--enable-expert-parallel — разбивает экспертов по рангам тензорного параллелизма вместо их репликации, что делает MoE с 512 экспертами осуществимым при TP4. В карточке FP8 указана более точная причина для этой сборки: без этого флага промежуточная ширина MoE, разделённая на TP, не делится на размер блока FP8. Считайте это обязательным, а не опциональным.

--enable-auto-tool-choice и --tool-call-parser qwen3_coder — вместе они включают вызов функций. Флаг auto позволяет модели решать, вызывать ли инструмент, а парсер qwen3_coder декодирует формат вызова инструмента, то же семейство парсеров, которое используется с Qwen3.8-27B и Qwen3.8-Flash-Next.

После запуска OpenAI-совместимый эндпоинт /v1/chat/completions предоставляет полный набор функций через стек Qwen4 среды выполнения: вызов инструментов, как указано выше, рассуждения через chat_template_kwargs.enable_thinking и зрение через части контента image_url. Для мультимодальности не нужен отдельный сервер — это тот же эндпоинт.

Одно структурное замечание из карточки: у этой сборки нет полностью статического варианта W4A4, и дешёвого варианта не будет. Для статического преобразования W4A4 требуется прямой проход калибровки активаций, и этот проход должен удерживать ~100 ГБ n-граммных эмбеддингов на одном GPU. Это та же причина, по которой таблица PLE доминирует в списке файлов, и именно поэтому данная сборка остаётся weight-only с динамическими активациями.

Полевые отчёты сообщества — как на самом деле выглядит это служение

Для этого конкретного репозитория не опубликовано ни показателей пропускной способности, ни задержек, и эта страница не будет их выдумывать. Что действительно существует, так это растущий набор полевых отчётов от практиков, обслуживающих базовые сборки Qwen3.8-Flash-Next NVFP4 — та же архитектура, то же разделение точности NVFP4/FP8/BF16, без правки abliteration — и поведение при обслуживании переносится напрямую. Это находки сообщества, а не рекомендации вендора, и люди, которые их сообщили, работали на оборудовании Blackwell с той же схемой квантования.

Спекулятивное декодирование MTP — это самый мощный рычаг производительности. Модель поставляется с черновой головкой предсказания нескольких токенов, и на одном RTX PRO 6000 (96 ГБ, SM120) модуль MTP загружается в квантованном до NVFP4 виде, занимая около 0,51 ГБ видеопамяти — в отчёте измерены длина принятия 2,3–3,9 из максимума 4 и доля принятия 0,86–0,96. Тот же отчёт показал медианную скорость декодирования в однопоточном режиме 180–226 ток/с (216,9 на кодировании, 225,8 на агентной рабочей нагрузке с вызовами инструментов, 136,6 на рассуждениях) по сравнению с базовым показателем примерно 105 ток/с, а ответ на запрос из 216 685 токенов занял 8,4 секунды. Считайте эти цифры характеристиками конкретной машины, а не спецификацией.

Выгрузите PLE-эмбеддинг n-грамм в оперативную память хоста. Поскольку таблица огромна и редко является узким местом пропускной способности, рецепты сообщества для одиночных карт Blackwell закрепляют её на хосте (~50 ГиБ свободной оперативной памяти хоста в отчёте RTX PRO 6000) и отображают через mmap с NVMe, жертвуя небольшой задержкой ради возможности вообще разместить модель. Рассчитывайте сделать что-то подобное, если только у вас не очень большой бюджет видеопамяти.

Явно задайте окно контекста.При активном BF16 KV-кэше и MTP автоматически подбираемый пул KV-кэша раздулся сверх того, что могла вместить карта, и приводил к OOM на длинном prefill; закрепление max-model-len / max-total-tokens на 262144 восстановило запас по памяти. При контексте 262K KV-кэш — это статья расходов, которую нужно закладывать в бюджет, а не значение по умолчанию.

Ошибка автоподбора FlashInfer молча портит выходные данные. Самый важный сбой на практике: автоподбор выбирает тактики ядра fused-MoE только по задержке и никогда не проверяет числовые результаты, поэтому при некоторых формах данных декодирование вырождается в повторяющийся токен. В отчёте на RTX PRO 6000 это воспроизвелось как 36 из 36 повреждённых генераций с включённым автоподбором и 0 из 36 с выключенным — обходной путь: отключить автоподбор FlashInfer (в vLLM: --no-enable-flashinfer-autotune; в SGLang: --disable-flashinfer-autotune). Если ваши выдаваемые результаты внезапно деградируют, проверьте это, прежде чем трогать что-либо ещё.

DGX Spark (GB10, SM121) требует собственных патчей. Веса NVFP4 (~126 ГиБ в community-сборке) не помещаются в один Spark на 128 ГБ, поэтому рецепты SGLang запускают tensor-parallel 2 на двух узлах через RoCE, а резолвер QSA sparse-decode ставит быстрый kernel FlashInfer за проверку is_sm100_supported(), которая не проходит на SM121, что приводит к откату на путь, умирающий на warmup. Исправление — небольшой патч плюс офлоад PLE. Ожидайте ~47–50 tok/s на декодировании, с пиком около 70 при использовании MTP4 и CUDA graphs, и проверьте, что ваш kernel действительно работает на SM121, прежде чем обещать бенчмарк.

Рассуждение, вызов инструментов и зрение на основе стека Qwen4

Консенсус сообщества относительно поколения Qwen3.8 переносится и на эту модель с обычной оговоркой, что это полевая практика, а не рекомендация производителя.

reasoning_effort — это регулятор, который важнее всего.Шаблон чата по умолчанию использует xhigh, из-за чего модель размышляет над каждым запросом очень долго. Операторы агентного цикла по умолчанию задают medium и понижают его до low для вызовов, чувствительных к задержке; enable_thinking false полностью отключает рассуждения, когда они не нужны. На одной карте Blackwell, оставив xhigh для рутинных вызовов, вы получите медленные ответы от быстрой модели.

Сочетайте сэмплеры с режимом мышления. Практики сходятся на температуре 1.0 / top-p 0.95, когда мышление включено, и на температуре 0.7 / top-p 0.80 со штрафом присутствия около 1.5, когда оно выключено. Смешивание этих двух наборов ухудшает качество вывода.

Вызов инструментов переживает и abliteration, и преобразование в 4-битный формат. Путь вызова функций остаётся нетронутым, что и подключают парсер qwen3_coder и флаги автоматического выбора инструментов. Для red team это обоюдоострый факт: злоупотребление агентными возможностями полностью работоспособно на невыровненной модели — подробнее ниже.

Зрение сохраняется, а это расширяет поверхность атаки. Vision tower никогда не подвергался процедуре abliteration и остаётся в BF16, поэтому ввод изображений работает через content parts вида image_url. Специалисты, тестирующие линейку без цензуры, рассматривают мультимодальный путь как первоочередную цель для оценки: prompt-инъекция, переносимая изображением, попадает на модель, у которой нет поведения отказа, способного её отразить.

Какую сборку следует раздавать

В коллекции Flash-Next пять сборок — BF16, GGUF, MLX, FP8 и эта NVFP4 — и честная логика выбора основана на аппаратном обеспечении и компромиссах, а не на рейтинге.

NVFP4 (данная сборка, ~178 ГБ на диске) — выбор Blackwell. Тензорные ядра FP4, 4-битные эксперты, новейшая сборка в коллекции и самая маленькая из его vLLM-серверных сборок — и именно о ней эта страница.

FP8 (~186 ГБ на диске) — выбор для Hopper, и он одинаково хорош на Blackwell. Те же веса в 8-битном формате — это более широко проверенный путь vLLM и тот, у которого более чёткое требование к параллелизму экспертов.

GGUF (13 квантов, от IQ2_XXS ~52 ГБ до Q5_K_M ~125 ГБ) — выбор llama.cpp для потребительских систем на NVIDIA, AMD или CPU. Не нужен ни Blackwell, ни vLLM.

MLX (уровни 4/6/8-бит, примерно 163–221 ГБ) — выбор для Apple Silicon, нативный Metal, MTP-головка в комплекте.

Два честных замечания перед тем, как вы сделаете выбор. Во-первых, сборки NVFP4 и FP8 различаются по объёму на диске всего примерно на восемь ГБ, поскольку обе хранят большую таблицу n-грамм в BF16 — экономия за счёт 4-битного представления сосредоточена в весах экспертов, а не в общем размере файла. Реальное преимущество NVFP4 на Blackwell — скорость FP4-тензорных ядер на этих экспертах, а не значительно меньший файл. Во-вторых, карточка описывает NVFP4 как детерминированный вывод весов, который наследует оценку abliteration с небольшим дополнительным компромиссом по качеству из-за 4-битных экспертов, и она не количественно оценивает этот компромисс. Он не количественно определён — относитесь к нему как к реальной, но неуточнённой стоимости меньших экспертов, а не как к незначительной.

Оценка, прочитанная правильно

В карточке сообщается об аблитерации, измеренной на сборке BF16, развёрнутой с помощью vLLM, в сравнении с официальной моделью Qw​en/Qwen3.8-Flash-Next: отказы на вредоносные промпты падают с 64–100% до примерно 0–3,3%, избыточные отказы на безобидные промпты остаются вблизи нуля, а возможности — в пределах ±2 пунктов от базовой модели. Об этих цифрах нужно правильно понимать три вещи. Это измерения на сборке BF16, унаследованные данной 4-битной сборкой на основании аргументации, а не измеренные на ней. Это собственные цифры вендора, полученные с помощью основанного на правилах классификатора вступительных фраз, который карточки этой коллекции описывают как индикативный, а не публикационного уровня, — внутреннее измерение собственной правки, а не независимый аудит. И они ничего не говорят о компромиссе по качеству NVFP4, упомянутом выше, который карточка не оценивает количественно.

Граница безопасности — только для исследований

Предупреждение в карточке модели сформулировано без обиняков, и это та часть страницы, которая не должна читаться как шаблонная отписка. {{1}}У этой модели выравнивание безопасности в значительной степени удалено: направление отказа было ортогонализировано из остаточного потока, и модель будет выполнять вредоносные, неэтичные или незаконные запросы, которые исходная модель Qwen3.8-Flash-Next отклонила бы.{{/2}} {{3}}Она выпущена строго для легитимных исследований — интерпретируемости, изучения безопасности ИИ и механизмов отказа, red-teaming и оценки робастности — и авторы не несут ответственности за неправомерное использование.{{/3}} {{4}}Вы берёте на себя полную ответственность за то, что она генерирует, и добавляете собственные уровни безопасности и модерации, прежде чем что-либо попадёт к пользователю.{{/4}} {{5}}Apache 2.0 — это нижний предел; над ним находится шлюз, ограничивающий использование только исследовательскими целями.{{/5}}

Две вещи, в которых {{1}}дискурс о моделях без цензуры ошибается{{/1}}, и эта карточка не даёт их не заметить. Во-первых, {{2}}успешный джейлбрейк-проб против этой модели — не пройденная оценка безопасности{{/2}}, а заявленное поведение. Аблитерированная модель намеренно проваливает такие пробы; проверка её одним тестом «можно ли её взломать» показывает лишь, что правка сработала, а не что защитный барьер прочен. Во-вторых, {{3}}сохранённая зрительная башня и нетронутый путь вызова инструментов расширяют реальную поверхность атаки за пределы текста{{/3}}: инъекция промптов через изображения и нецелевое использование инструментов агентом полностью работоспособны — именно поэтому в подходе red-team это рассматривается как проверка возможностей, а не как кандидат в чат-боты. Если ваша задача — выпустить ассистента для пользователей, {{4}}это не ваша модель{{/4}}, и так задумано.

Где применяется OrcaRouter

Двухдневная сборка с ограниченным доступом, предназначенная только для самостоятельного хостинга, — классический случай для маршрутизации, а не жёсткой привязки. Когда вы сами запускаете эту сборку NVFP4, вы можете развернуть маршрут, который указывает на неё и переключается на размещённую модель, если сборка начнёт вести себя некорректно под нагрузкой — один интерфейс, без перенастройки между провайдерами при переключении. В частности, для eval-задач размещённая цензурированная базовая модель — это нужная вам точка сравнения, и она в одном шаге: каталог содержит модель Qwen3.8-Flash от Ali​baba по $0,15 за миллион входных токенов и $0,47 за миллион выходных токенов, причём цена передаётся по прайс-листу провайдера с нулевой наценкой, так что инструментарий red-team может переключаться между размещённой цензурированной базовой моделью и вашей локальной сборкой без цензуры, не заключая второго контракта, а любое изменение цены поставщика в тот же день попадает на вашу конечную точку.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash (captured August 29 2026), showing the tagline 'Qwen3.8 Flash is a multimodal reasoning model from Alibaba', the Vision / Tools / JSON / Reasoning feature tags, pricing of $0.15 per 1M input tokens and $0.47 per 1M output tokens, a 1M-token context window with 131K max output, and the API endpoint https://api.orcarouter.ai/v1.

Кому стоит скачать это — а кому не стоит.

Скачайте orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4, если вы работаете на Blackwell, хотите минимальный серверный след в коллекции Flash-Next со скоростью тензорных ядер FP4 и занимаетесь той исследовательской работой, ради которой существует эта линейка. Скачайте Qwen3.8-Flash-Next-Uncensored-FP8, если вы на Hopper или хотите более широко проверенный путь. Скачайте сборку GGUF, если у вас потребительский GPU или машина на CPU, сборку MLX — если у вас Apple Silicon, и ничего не скачивайте, если цель — развёртывание для конечных пользователей. Прочитайте гейт и дисклеймер, прежде чем принять любой из них, — это условия модели, а не формальность.

Все пять сборок Flash-Next — BF16, GGUF, MLX, FP8 и NVFP4 — собраны в коллекции Qwen3.8-Flash-Next-Uncensored на Hugging Face.

Это другая модель, а не очередная сборка этой: Qwen3.8-27B-Uncensored является abliterated-версией другой базовой модели и имеет собственную коллекцию и собственные инструкции.

Эти веса по замыслу предназначены только для локального использования. Для размещенной эталонной модели, с которой можно сравнивать abliterated-сборку, Qwen3.8-Flash обслуживается на OrcaRouter по цене провайдера с нулевой наценкой — исходная модель с сохранённым выравниванием безопасности.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube