
Qwen3.8-Flash-Next-Uncensored-NVFP4: руководство по развертыванию на Blackwell
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Qwen3.8-Flash-Next-Uncensored-NVFP4 работает ровно на одном семействе GPU: Blackwell. NVFP4 выполняется на аппаратных FP4-тензорных ядрах, а Hopper (H100/H200) и всё, что старше, их просто не имеют. Если у вас Hopper, остановитесь здесь — Qwen3.8-Flash-Next-Uncensored-FP8 сборка — именно то, что вам нужно. Далее предполагается Blackwell (B100, B200, GB200 или карта серии RTX 50), свежая сборка vLLM с поддержкой qwen4_exp и transformers ≥ 5.16.
Это NVFP4-квантование abliterated-сборки (с удалёнными отказами) Qwen Qwen/Qwen3.8-Flash-Next, ужатой с 330 ГБ в BF16 до 178 ГБ на диске. OrcaRouter опубликовал её на Hugging Face 27 августа 2026 года как orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4. Доступ к репозиторию ограничен: вы должны быть авторизованы в Hugging Face и принять условия репозитория, иначе hf download и vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 оба завершатся ошибкой аутентификации, не успев переслать ни байта. Эта страница — практическое руководство по развёртыванию, а не анонс запуска: сборке два дня, и вопросы, с которыми люди реально сталкиваются, — это железо, флаги и какую сборку выбрать.

И прежде чем перейти к цифрам: Qwen3.8-Flash-Next-Uncensored — это не Qwen3.8-27B-Uncensored. Это две разные модели, у которых общее лишь семейное имя и техника аблитерации: разные базовые веса, разная архитектура, разные коллекции на Hugging Face. Flash-Next — результат аблитерации модели Qwen/Qwen3.8-Flash-Next, маршрутизируемой смеси экспертов, представляющей собой превью архитектуры Qwen4 (qwen4_exp): 512 экспертов, из которых одновременно активны десять маршрутизируемых и один общий, гибридное внимание (линейные слои Gated DeltaNet наряду со слоями полного внимания), Hyper-Connections, n-граммный эмбеддинг PLE, нативная башня обработки изображений и видео, а также спекулятивная декодирующая голова MTP. Модель 27B — результат аблитерации модели Qwen/Qwen3.8-27B, совершенно другой плотной базовой модели. Никакие цифры инференса со страницы 27B на эту модель не переносятся; там, где страница 27B действительно полезна — вводная по аблитерации, общая математика выбора квантов — она приведена ниже с указанием, что из этого применимо, а что нет.

Что это за билд, точность за точностью
Qwen3.8-Flash-Next — это маршрутизируемый MoE: каждый токен активирует 10 из 512 экспертов плюс один общий эксперт, и лишь несколько миллиардов параметров работают на токен, хотя сохранённая модель значительно больше. Сборка NVFP4 — это смешанно-точное сжато-тензорное квантование этого стека, и вся суть — в расщеплении:
• Веса экспертов MoE — NVFP4 (4-битный, NVIDIA FP4 E2M1, группы по 16 с блочными масштабами FP8).
• Внимание (self_attn.{q,k,v,o}), проекции linear_attn, общий эксперт и lm_head — FP8 (8-битный).
• PLE n-gram эмбеддинг, токен- и визуальные эмбеддинги, Hyper-Connections, индексатор QSA, Gated-DeltaNet conv/dt, все нормализации и весь vision tower — BF16, сохранены в полной точности.
Три свойства преобразования важнее, чем само разделение по точности. Во-первых, оно затрагивает только веса: активации квантуются динамически во время выполнения, статической калибровки нет, а веса получаются напрямую из контрольной точки BF16 (в карточке этот вывод называют «data-free»). Во-вторых, правка abliteration вшита в веса, поэтому удаление отказов переживает квантование — 4-битное преобразование это изменение точности, а не вмешательство в безопасность. В-третьих, KV-кэш не квантуется; во время выполнения он остаётся в BF16. Последнее легко упустить из виду, и оно важно при родном контексте модели в 262 144 токена, где KV-кэш — реальная статья расхода памяти наряду с весами.
Объём на диске определяется одним тензором. Карточка описывает PLE n-граммный эмбеддинг как единый тензор с ~66 млрд параметров, который намеренно хранится в BF16; это самый большой шард и причина того, что сборка занимает 178 ГБ, а не более скромный объём. Стоит указать на одно расхождение, а не замалчивать его: родственная карточка FP8 называет ту же таблицу PLE n-граммом с 51 млрд параметров, а примечание W4A4 в этой карточке указывает для неё ~100 ГБ. В двух карточках приведены разные цифры для одной и той же таблицы, поэтому относитесь к каждой как к числу соответствующей карточки — и при расчёте развёртывания исходите из того, что таблица велика в BF16, и планируйте с учётом этого.
Аппаратное предусловие, в деталях
Это самый короткий, но самый важный раздел страницы. NVFP4 — это формат Blackwell: быстрый путь — это нативный FP4 GEMM на тензорных ядрах пятого поколения, и без этого аппаратного обеспечения формату не на чем работать. Собственная строка требований карты недвусмысленна — графический процессор Blackwell (B100 / B200 / GB200 / RTX 50-серии), поскольку NVFP4 использует аппаратные тензорные ядра FP4, и он не будет работать на Hopper (H100/H200) или более старых, в которых отсутствует поддержка вычислений FP4.
Все редиректы — в одном месте:
• На Hopper (H100/H200) — вместо этого используйте Qwen3.8-Flash-Next-Uncensored-FP8. Это те же веса в 8-битном формате, он работает на Hopper и Blackwell, и это именно та сборка, которую описывает руководство по FP8 из этого блога.
• На потребительском GPU NVIDIA или на CPU-системе — сборка GGUF с её 13 квантизациями llama.cpp — это локальный путь.
• На Apple Silicon — сборка MLX в вариантах 4/6/8 бит — это нативный путь Metal.
Требование к среде выполнения столь же непреложно, как и сам кремний. qwen4_exp — это совершенно новая архитектура, поэтому стандартные сборки vLLM, выпущенные до неё, откажутся загружать чекпоинт. Вам нужен свежий vLLM с поддержкой qwen4_exp, а также модуль чтения compressed-tensors NVFP4 (формат определяется из config.json, а не выбирается вручную), и transformers ≥ 5.16. Мультимодальный ввод дополнительно требует стека компьютерного зрения Qwen в среде выполнения; для обслуживания только текстовых запросов он не требуется.
Команда serve карты, флаг за флагом
Вызов самой карточки модели — хорошая отправная точка, и стоит понимать, для чего нужен каждый флаг, а не копировать вслепую:
vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 --tensor-parallel-size 4 --trust-remote-code --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder
• --tensor-parallel-size 4 — веса занимают ~178 ГБ на диске, поэтому карта распределяет их по четырём GPU. Именно под такую конфигурацию рассчитана сборка; не воспринимайте это как рекомендацию.
• --trust-remote-code — обязателен для пользовательской архитектуры. Код модели qwen4_exp ещё не включён в стандартный реестр transformers, поэтому vLLM загружает код архитектуры из репозитория. Вы доверяете этому коду — это нормальное, но ответственное решение для совершенно новой архитектуры.
• --enable-expert-parallel — разбивает экспертов по рангам тензорного параллелизма вместо их репликации, что делает MoE с 512 экспертами осуществимым при TP4. В карточке FP8 указана более точная причина для этой сборки: без этого флага промежуточная ширина MoE, разделённая на TP, не делится на размер блока FP8. Считайте это обязательным, а не опциональным.
• --enable-auto-tool-choice и --tool-call-parser qwen3_coder — вместе они включают вызов функций. Флаг auto позволяет модели решать, вызывать ли инструмент, а парсер qwen3_coder декодирует формат вызова инструмента, то же семейство парсеров, которое используется с Qwen3.8-27B и Qwen3.8-Flash-Next.
После запуска OpenAI-совместимый эндпоинт /v1/chat/completions предоставляет полный набор функций через стек Qwen4 среды выполнения: вызов инструментов, как указано выше, рассуждения через chat_template_kwargs.enable_thinking и зрение через части контента image_url. Для мультимодальности не нужен отдельный сервер — это тот же эндпоинт.
Одно структурное замечание из карточки: у этой сборки нет полностью статического варианта W4A4, и дешёвого варианта не будет. Для статического преобразования W4A4 требуется прямой проход калибровки активаций, и этот проход должен удерживать ~100 ГБ n-граммных эмбеддингов на одном GPU. Это та же причина, по которой таблица PLE доминирует в списке файлов, и именно поэтому данная сборка остаётся weight-only с динамическими активациями.
Полевые отчёты сообщества — как на самом деле выглядит это служение
Для этого конкретного репозитория не опубликовано ни показателей пропускной способности, ни задержек, и эта страница не будет их выдумывать. Что действительно существует, так это растущий набор полевых отчётов от практиков, обслуживающих базовые сборки Qwen3.8-Flash-Next NVFP4 — та же архитектура, то же разделение точности NVFP4/FP8/BF16, без правки abliteration — и поведение при обслуживании переносится напрямую. Это находки сообщества, а не рекомендации вендора, и люди, которые их сообщили, работали на оборудовании Blackwell с той же схемой квантования.
• Спекулятивное декодирование MTP — это самый мощный рычаг производительности. Модель поставляется с черновой головкой предсказания нескольких токенов, и на одном RTX PRO 6000 (96 ГБ, SM120) модуль MTP загружается в квантованном до NVFP4 виде, занимая около 0,51 ГБ видеопамяти — в отчёте измерены длина принятия 2,3–3,9 из максимума 4 и доля принятия 0,86–0,96. Тот же отчёт показал медианную скорость декодирования в однопоточном режиме 180–226 ток/с (216,9 на кодировании, 225,8 на агентной рабочей нагрузке с вызовами инструментов, 136,6 на рассуждениях) по сравнению с базовым показателем примерно 105 ток/с, а ответ на запрос из 216 685 токенов занял 8,4 секунды. Считайте эти цифры характеристиками конкретной машины, а не спецификацией.
• Выгрузите PLE-эмбеддинг n-грамм в оперативную память хоста. Поскольку таблица огромна и редко является узким местом пропускной способности, рецепты сообщества для одиночных карт Blackwell закрепляют её на хосте (~50 ГиБ свободной оперативной памяти хоста в отчёте RTX PRO 6000) и отображают через mmap с NVMe, жертвуя небольшой задержкой ради возможности вообще разместить модель. Рассчитывайте сделать что-то подобное, если только у вас не очень большой бюджет видеопамяти.
• Явно задайте окно контекста.При активном BF16 KV-кэше и MTP автоматически подбираемый пул KV-кэша раздулся сверх того, что могла вместить карта, и приводил к OOM на длинном prefill; закрепление max-model-len / max-total-tokens на 262144 восстановило запас по памяти. При контексте 262K KV-кэш — это статья расходов, которую нужно закладывать в бюджет, а не значение по умолчанию.
• Ошибка автоподбора FlashInfer молча портит выходные данные. Самый важный сбой на практике: автоподбор выбирает тактики ядра fused-MoE только по задержке и никогда не проверяет числовые результаты, поэтому при некоторых формах данных декодирование вырождается в повторяющийся токен. В отчёте на RTX PRO 6000 это воспроизвелось как 36 из 36 повреждённых генераций с включённым автоподбором и 0 из 36 с выключенным — обходной путь: отключить автоподбор FlashInfer (в vLLM: --no-enable-flashinfer-autotune; в SGLang: --disable-flashinfer-autotune). Если ваши выдаваемые результаты внезапно деградируют, проверьте это, прежде чем трогать что-либо ещё.
• DGX Spark (GB10, SM121) требует собственных патчей. Веса NVFP4 (~126 ГиБ в community-сборке) не помещаются в один Spark на 128 ГБ, поэтому рецепты SGLang запускают tensor-parallel 2 на двух узлах через RoCE, а резолвер QSA sparse-decode ставит быстрый kernel FlashInfer за проверку is_sm100_supported(), которая не проходит на SM121, что приводит к откату на путь, умирающий на warmup. Исправление — небольшой патч плюс офлоад PLE. Ожидайте ~47–50 tok/s на декодировании, с пиком около 70 при использовании MTP4 и CUDA graphs, и проверьте, что ваш kernel действительно работает на SM121, прежде чем обещать бенчмарк.
Рассуждение, вызов инструментов и зрение на основе стека Qwen4
Консенсус сообщества относительно поколения Qwen3.8 переносится и на эту модель с обычной оговоркой, что это полевая практика, а не рекомендация производителя.
• reasoning_effort — это регулятор, который важнее всего.Шаблон чата по умолчанию использует xhigh, из-за чего модель размышляет над каждым запросом очень долго. Операторы агентного цикла по умолчанию задают medium и понижают его до low для вызовов, чувствительных к задержке; enable_thinking false полностью отключает рассуждения, когда они не нужны. На одной карте Blackwell, оставив xhigh для рутинных вызовов, вы получите медленные ответы от быстрой модели.
• Сочетайте сэмплеры с режимом мышления. Практики сходятся на температуре 1.0 / top-p 0.95, когда мышление включено, и на температуре 0.7 / top-p 0.80 со штрафом присутствия около 1.5, когда оно выключено. Смешивание этих двух наборов ухудшает качество вывода.
• Вызов инструментов переживает и abliteration, и преобразование в 4-битный формат. Путь вызова функций остаётся нетронутым, что и подключают парсер qwen3_coder и флаги автоматического выбора инструментов. Для red team это обоюдоострый факт: злоупотребление агентными возможностями полностью работоспособно на невыровненной модели — подробнее ниже.
• Зрение сохраняется, а это расширяет поверхность атаки. Vision tower никогда не подвергался процедуре abliteration и остаётся в BF16, поэтому ввод изображений работает через content parts вида image_url. Специалисты, тестирующие линейку без цензуры, рассматривают мультимодальный путь как первоочередную цель для оценки: prompt-инъекция, переносимая изображением, попадает на модель, у которой нет поведения отказа, способного её отразить.
Какую сборку следует раздавать
В коллекции Flash-Next пять сборок — BF16, GGUF, MLX, FP8 и эта NVFP4 — и честная логика выбора основана на аппаратном обеспечении и компромиссах, а не на рейтинге.
• NVFP4 (данная сборка, ~178 ГБ на диске) — выбор Blackwell. Тензорные ядра FP4, 4-битные эксперты, новейшая сборка в коллекции и самая маленькая из его vLLM-серверных сборок — и именно о ней эта страница.
• FP8 (~186 ГБ на диске) — выбор для Hopper, и он одинаково хорош на Blackwell. Те же веса в 8-битном формате — это более широко проверенный путь vLLM и тот, у которого более чёткое требование к параллелизму экспертов.
• GGUF (13 квантов, от IQ2_XXS ~52 ГБ до Q5_K_M ~125 ГБ) — выбор llama.cpp для потребительских систем на NVIDIA, AMD или CPU. Не нужен ни Blackwell, ни vLLM.
• MLX (уровни 4/6/8-бит, примерно 163–221 ГБ) — выбор для Apple Silicon, нативный Metal, MTP-головка в комплекте.
Два честных замечания перед тем, как вы сделаете выбор. Во-первых, сборки NVFP4 и FP8 различаются по объёму на диске всего примерно на восемь ГБ, поскольку обе хранят большую таблицу n-грамм в BF16 — экономия за счёт 4-битного представления сосредоточена в весах экспертов, а не в общем размере файла. Реальное преимущество NVFP4 на Blackwell — скорость FP4-тензорных ядер на этих экспертах, а не значительно меньший файл. Во-вторых, карточка описывает NVFP4 как детерминированный вывод весов, который наследует оценку abliteration с небольшим дополнительным компромиссом по качеству из-за 4-битных экспертов, и она не количественно оценивает этот компромисс. Он не количественно определён — относитесь к нему как к реальной, но неуточнённой стоимости меньших экспертов, а не как к незначительной.
Оценка, прочитанная правильно
В карточке сообщается об аблитерации, измеренной на сборке BF16, развёрнутой с помощью vLLM, в сравнении с официальной моделью Qwen/Qwen3.8-Flash-Next: отказы на вредоносные промпты падают с 64–100% до примерно 0–3,3%, избыточные отказы на безобидные промпты остаются вблизи нуля, а возможности — в пределах ±2 пунктов от базовой модели. Об этих цифрах нужно правильно понимать три вещи. Это измерения на сборке BF16, унаследованные данной 4-битной сборкой на основании аргументации, а не измеренные на ней. Это собственные цифры вендора, полученные с помощью основанного на правилах классификатора вступительных фраз, который карточки этой коллекции описывают как индикативный, а не публикационного уровня, — внутреннее измерение собственной правки, а не независимый аудит. И они ничего не говорят о компромиссе по качеству NVFP4, упомянутом выше, который карточка не оценивает количественно.
Граница безопасности — только для исследований
Предупреждение в карточке модели сформулировано без обиняков, и это та часть страницы, которая не должна читаться как шаблонная отписка. {{1}}У этой модели выравнивание безопасности в значительной степени удалено: направление отказа было ортогонализировано из остаточного потока, и модель будет выполнять вредоносные, неэтичные или незаконные запросы, которые исходная модель Qwen3.8-Flash-Next отклонила бы.{{/2}} {{3}}Она выпущена строго для легитимных исследований — интерпретируемости, изучения безопасности ИИ и механизмов отказа, red-teaming и оценки робастности — и авторы не несут ответственности за неправомерное использование.{{/3}} {{4}}Вы берёте на себя полную ответственность за то, что она генерирует, и добавляете собственные уровни безопасности и модерации, прежде чем что-либо попадёт к пользователю.{{/4}} {{5}}Apache 2.0 — это нижний предел; над ним находится шлюз, ограничивающий использование только исследовательскими целями.{{/5}}
Две вещи, в которых {{1}}дискурс о моделях без цензуры ошибается{{/1}}, и эта карточка не даёт их не заметить. Во-первых, {{2}}успешный джейлбрейк-проб против этой модели — не пройденная оценка безопасности{{/2}}, а заявленное поведение. Аблитерированная модель намеренно проваливает такие пробы; проверка её одним тестом «можно ли её взломать» показывает лишь, что правка сработала, а не что защитный барьер прочен. Во-вторых, {{3}}сохранённая зрительная башня и нетронутый путь вызова инструментов расширяют реальную поверхность атаки за пределы текста{{/3}}: инъекция промптов через изображения и нецелевое использование инструментов агентом полностью работоспособны — именно поэтому в подходе red-team это рассматривается как проверка возможностей, а не как кандидат в чат-боты. Если ваша задача — выпустить ассистента для пользователей, {{4}}это не ваша модель{{/4}}, и так задумано.
Где применяется OrcaRouter
Двухдневная сборка с ограниченным доступом, предназначенная только для самостоятельного хостинга, — классический случай для маршрутизации, а не жёсткой привязки. Когда вы сами запускаете эту сборку NVFP4, вы можете развернуть маршрут, который указывает на неё и переключается на размещённую модель, если сборка начнёт вести себя некорректно под нагрузкой — один интерфейс, без перенастройки между провайдерами при переключении. В частности, для eval-задач размещённая цензурированная базовая модель — это нужная вам точка сравнения, и она в одном шаге: каталог содержит модель Qwen3.8-Flash от Alibaba по $0,15 за миллион входных токенов и $0,47 за миллион выходных токенов, причём цена передаётся по прайс-листу провайдера с нулевой наценкой, так что инструментарий red-team может переключаться между размещённой цензурированной базовой моделью и вашей локальной сборкой без цензуры, не заключая второго контракта, а любое изменение цены поставщика в тот же день попадает на вашу конечную точку.

Кому стоит скачать это — а кому не стоит.
Скачайте orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4, если вы работаете на Blackwell, хотите минимальный серверный след в коллекции Flash-Next со скоростью тензорных ядер FP4 и занимаетесь той исследовательской работой, ради которой существует эта линейка. Скачайте Qwen3.8-Flash-Next-Uncensored-FP8, если вы на Hopper или хотите более широко проверенный путь. Скачайте сборку GGUF, если у вас потребительский GPU или машина на CPU, сборку MLX — если у вас Apple Silicon, и ничего не скачивайте, если цель — развёртывание для конечных пользователей. Прочитайте гейт и дисклеймер, прежде чем принять любой из них, — это условия модели, а не формальность.
Все пять сборок Flash-Next — BF16, GGUF, MLX, FP8 и NVFP4 — собраны в коллекции Qwen3.8-Flash-Next-Uncensored на Hugging Face.
Это другая модель, а не очередная сборка этой: Qwen3.8-27B-Uncensored является abliterated-версией другой базовой модели и имеет собственную коллекцию и собственные инструкции.
Эти веса по замыслу предназначены только для локального использования. Для размещенной эталонной модели, с которой можно сравнивать abliterated-сборку, Qwen3.8-Flash обслуживается на OrcaRouter по цене провайдера с нулевой наценкой — исходная модель с сохранённым выравниванием безопасности.
