
Qwen3.8-27B-Uncensored-NVFP4: Руководство по развертыванию для GPU Blackwell
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Qwen3.8-27B-Uncensored-NVFP4 находится на Hugging Face с 19 августа 2026 года, и за десять дней её загрузили примерно 32 700 раз. Это не освещение запуска — весам десять дней, нет никакого анонса, о котором можно сообщить, а родственные сборки Qwen3.8-27B-Uncensored-FP8 и Qwen3.8-27B-Uncensored-GGUF уже задокументированы в этом блоге. Это руководство по сборке, которую люди прямо сейчас активно скачивают: что такое NVFP4 на самом деле, почему именно эта сборка смешивает его с FP8, каким GPU это выгодно, а каким нет, как её обслуживать, и кому стоит предпочесть её сборкам FP8 или GGUF — а кому нет.
Сразу скажем об одном, потому что это сбивает с толку каждого, кто скачивает впервые: репозиторий закрыт. Наивный hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4 однострочник завершается ошибкой аутентификации, пока вы не войдёте в Hugging Face и не примете условия доступа к репозиторию на странице модели. Всё, что описано ниже, предполагает, что вы сделали и то и другое.
И ещё сразу оговорюсь: карточка модели этого репозитория находится за тем же гейтом, так что здесь нет её пересказа. Всё дальнейшее основано на публичном списке файлов и метаданных репозитория, публичной документации NVIDIA по NVFP4 и на сообщениях с мест от людей, которые обслуживают сборки Qwen3.8-27B NVFP4 на Blackwell. Если какая-то цифра взята у практика, а не у вендора, об этом сказано в тексте.

Что представляет собой эта сборка
Qwen3.8-27B-Uncensored-NVFP4 — это NVFP4-квантизация Qwen3.8-27B-Uncensored, аблитерированной версии модели Alibaba Qwen/Qwen3.8-27B, которую организация orcarouter опубликовала 2026-08-18. Аблитерация удаляет направление отказа модели из остаточного потока; этот метод объясняется в нашем пояснении о моделях без цензуры и здесь повторно не объясняется. Базовая модель — это плотная 27B с гибридным вниманием — 48 слоёв линейного внимания плюс 16 слоёв полного внимания — нативное понимание изображений и видео, контекст на 262 144 токена и встроенная MTP-головка спекулятивного декодирования. Apache 2.0 от начала до конца.
Что делает эту сборку интересной — не abliteration, а раскладка квантования, потому что это намеренно квантованная сборка: если вы искали NVFP4, то суть именно в формате. Судя по публичным метаданным репозитория и конфигу квантования, это сборка compressed-tensors со смешанной точностью: проекции внимания — FP8 (E4M3), MLP — NVFP4 (4-битные, упакованные), а визуальный энкодер, MTP-голова, lm_head и нормы со смещениями линейного внимания остаются в BF16. Метаданные safetensors из публичного списка файлов согласуются с этой схемой: около 3,5 млрд параметров в BF16, 9,4 млрд в FP8-E4M3 и 15 млрд в упакованных 4-битных тензорах; на диске это примерно 24,7 ГБ, распределённых по пяти шардам плюс отдельный шард model-extra. Ничто из этого не является утверждением о том, как модель обслуживается: объём VRAM в рантайме и пропускная способность для данного конкретного репозитория нигде не опубликованы, и мне сегодня не на что сослаться. Размер на диске взят из списка файлов, формат — из конфига, а описанное ниже поведение при обслуживании проверено сообществом на близких NVFP4-сборках.
Что такое NVFP4 и чем оно отличается от FP8 и от INT8/AWQ.
NVFP4 — это 4-битный формат чисел с плавающей запятой от NVIDIA, представленный для тензорных ядер пятого поколения в Blackwell, и официальный технический блог NVIDIA — правильный первоисточник по нему. В нём веса хранятся как E2M1 — один знаковый бит, два бита экспоненты, один бит мантиссы — и масштабируются блоками: каждые 16 значений используют общий масштаб E4M3 FP8, а для всего тензора применяется скаляр FP32 на тензор. Эта двухуровневая схема и есть вся суть формата: она восстанавливает динамический диапазон, который потерял бы наивный 4-битный float, ценой нескольких битов накладных расходов на блок. Практические различия в одну строку:
• NVFP4 vs FP8 — оба являются числами с плавающей точкой, но FP8 (E4M3, 8-бит) работает на Hopper и Blackwell, тогда как NVFP4 — 4-битный и нативно ускоряется только на Blackwell. NVIDIA заявляет, что веса примерно в 3,5 раза меньше, чем у FP16, и примерно в 1,8 раза меньше, чем у FP8, а на Blackwell матричное умножение выполняется непосредственно на FP4-тензорных ядрах.
• NVFP4 против INT8/AWQ — INT8 (W8A8) и AWQ (W4A16) — это целочисленные форматы, которые работают начиная с Ampere; AWQ — 4-битный, но целочисленный, и на большинстве аппаратных платформ веса деквантизируются до более широкого типа для матричного умножения. NVFP4 — это 4-битный формат с плавающей запятой с блочным масштабированием, поэтому он сохраняет больше точности в младших битах, и у него есть аппаратный путь FP4 GEMM, которого нет у целочисленных форматов.
• NVFP4 против MXFP4 — эти два формата постоянно путают. MXFP4 использует блоки по 32 элемента и масштабы E8M0 (степени двойки); NVFP4 использует блоки по 16 элементов и масштабы E4M3. Более мелкие блоки дают NVFP4 лучшую изоляцию выбросов, поэтому этот формат является де-факто стандартом 4-битных вычислений в серверных стеках Blackwell.

Какое оборудование выигрывает, а какое — нет
Самый главный факт об этой сборке: NVFP4 — это формат Blackwell. Он оправдывает себя только на GPU, тензорные ядра которых реализуют FP4 GEMM нативно, а на всём остальном это неподходящий инструмент, каким бы быстрым ни был компьютер на бумаге.
• Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — это тот случай, когда NVFP4 — правильный выбор: нативные тензорные ядра FP4, минимальный серверный след в линейке без цензуры, и формат, для которого эта сборка и создавалась.
• Hopper — H100/H200 — нет нативной поддержки FP4 GEMM. NVFP4 деградирует до деквантизации только весов, что медленнее и не даёт ничего. Используйте здесь Qwen3.8-27B-Uncensored-FP8; эта сборка проверена именно на этом оборудовании.
• Ampere/Ada — RTX 3090/4090 — NVFP4 на них тоже не даёт ускорения. Сборка GGUF с уровнем Q4_K_M на 16,8 ГБ — правильный инструмент для карты на 24 ГБ.
• Apple Silicon — на Mac NVFP4 не имеет значения. Работает именно сборка MLX (или GGUF).
Один честный нюанс: форки сообщества действительно запускают NVFP4 weight-only на оборудовании до Blackwell. Сборка сообщества NVFP4 той же abliterated-модели специально предназначена для карт класса V100 через пропатченный форк vLLM, а недавние рецепты DGX Spark на базе Qwen3.8-27B — это отдельная история. Это специализированные пути со своими оговорками, а не то, на что рассчитана эта сборка. Если у вас Blackwell, всё это не имеет значения; если у вас не Blackwell, сборка FP8 или GGUF — лучший вариант для скачивания.
Как это подавать
Репозиторий размечен для vLLM, и формат compressed-tensors автоматически считывается из config.json — вам не нужно вручную выбирать схему квантизации. Стек, на котором сходятся практики для сборок Qwen3.8-27B NVFP4, — это свежая версия vLLM на карте Blackwell, FP8 KV-кэш и собственная MTP-голова модели, используемая для спекулятивного декодирования. Руководство Unsloth по NVFP4, которое является наиболее цитируемым справочником сообщества, рекомендует vLLM 0.25.0 или новее с FlashInfer и зависимостью ядра CUTLASS-DSL для быстрого пути FP4.
Рабочая отправная точка, собранная из проверенных флагов нашей сборки FP8 и рецептов сообщества NVFP4, всё в одной строке:
vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'
• FP8 KV-кэш — наиболее совместимый способ сократить кэш-память вдвое; практикующие специалисты сообщают, что он примерно вдвое увеличивает доступный контекст. Поддержка NVFP4 KV-кэша существует, но ограничена некоторыми attention-бэкендами, поэтому FP8 KV — более безопасный вариант по умолчанию.
• спекулятивное декодирование MTP — модель поставляется с черновой головкой MTP, и квантизация сохраняет её в BF16. Практики сообщают, что два-три черновых токена хорошо работают с весами NVFP4 на Blackwell, при этом наибольший выигрыш достигается на структурированных выходных данных, таких как JSON и вызовы инструментов.
• Vision — визуальный энкодер сохранён в BF16 в этой сборке. Добавьте --language-model-only для обслуживания только текста; уберите его, если нужен ввод изображений или видео.
• На DGX Spark — пара подводных камней, о которых сообщили пользователи: держите --gpu-memory-utilization на уровне 0.90 или ниже (более высокие значения приводили к зависанию машины во время загрузки весов), а также добавьте --safetensors-load-strategy lazy если память ограничена. Также понадобится сборка vLLM для GB10 с поддержкой ядер sm_121a.
Честно о производительности: не существует опубликованных независимых показателей пропускной способности для именно этого репозитория. Имеющиеся измерения относятся к тесно связанным сборкам NVFP4. Unsloth сообщает о 1,41–1,49× токенов в секунду относительно BF16 на B200 для своей собственной сборки Qwen3.8-27B-NVFP4 (89,8–133,7 ток/с при batch 1, 3 048–4 407 при batch 64), а один пользователь DGX Spark на форумах NVIDIA сообщает о примерно 20–32 ток/с с весами NVFP4, кэшем KV в FP8 и глубиной MTP 3. Оба результата стоит процитировать; ни один из них не является бенчмарком этого репозитория.
Сценарии использования, которые действительно работают
Практики, запускающие модели семейства Qwen3.8-27B на Blackwell, сходятся в небольшом наборе настроек. Воспринимайте это как полевые отчёты, а не как рекомендации вендора — Qwen не документирует большую часть этого, а карточка этого репозитория закрыта.
• reasoning_effort — это регулятор, который важнее всего.Значение xhigh по умолчанию заставляет модель подолгу думать над каждым запросом. Те, кто запускает агентные циклы, ставят medium по умолчанию и снижают до low — или полностью отключают мышление с помощью enable_thinking: false — для отдельных вызовов, чувствительных к задержке. На одном GPU Blackwell, использование xhigh для рутинной задачи — это верный способ получить быструю модель и медленные ответы.
• Сэмплеры связаны с режимом мышления, а не являются независимыми.Консенсус сообщества: при включённом мышлении используются temperature 1.0 / top_p 0.95; при выключенном — temperature 0.7 / top_p 0.80 с presence_penalty 1.5. Замена этих двух наборов ухудшает качество вывода.
• Используйте актуальный шаблон чата. Шаблон qwen3_5 оборачивает каждое сообщение ассистента в think-блок, и многие практики сообщают о зацикливании или обрезанных ответах при использовании устаревших шаблонов; исправленные сообществом варианты Qwen-Fixed-Chat-Templates и Qwen-Sharp устанавливают preserve_thinking и останавливают зацикливание. Если вывод вашего сервера продолжает генерироваться после стоп-токена, это первое, что следует проверить.
• Закладывайте бюджет на длинные трассы рассуждений в работе агентов. Практики сообщают, что модель 3.8-го поколения генерирует примерно вдвое больше токенов на задачу, чем её предшественница 3.6 — скачок качества частично объясняется более долгим обдумыванием. Для длинных ответов xhigh транслируйте вывод рассуждений, иначе вы столкнётесь с тайм-аутами шлюза.
• Вызов инструментов сохраняется при квантовании.Путь вызова функций сохраняется и при abliteration, и при 4-битном преобразовании; включите его с помощью парсера tool-call qwen3_coder, и модель выбирает инструменты так же, как и базовая модель.

Кому стоит выбрать эту сборку — а кому нет
Честное решение, не повторяя математику выбора квантования, которую наши посты про FP8 и GGUF уже подробно освещают:
• Выбирайте NVFP4, если вы обслуживаете модели на Blackwell и хотите получить наименьший серверный след в uncensored-линейке со скоростью FP4-tensor-core — и занимаетесь исследовательской, red-team или интерпретационной работой, для которой легитимно требуется abliterated-модель.
• Выбирайте Qwen3.8-27B-Uncensored-FP8, если вы работаете на Hopper или хотите наиболее широко проверенный путь vLLM — это те же веса в 8-битном формате, проверенные на H200, с минимальным требованием около 40 ГБ VRAM.
• Выбирайте Qwen3.8-27B-Uncensored-GGUF, если вы работаете на потребительской видеокарте или Mac, или вам нужен llama.cpp вместо vLLM — уровень Q4_K_M является оптимальным для локального использования.
• Не выбирайте ни то, ни другое, если вам нужна максимальная точность, вы создаёте что-либо, ориентированное на пользователей (см. границу безопасности ниже), или вообще не хотите размещать самостоятельно — та же версия без цензуры предоставляется через OrcaRouter только исследователям, поэтому GPU не требуется.
Граница безопасности — только для исследований
Это аблетированная модель, и квантованная версия не возвращает защитные ограничения обратно. Направление отказа было удалено из остаточного потока Qwen/Qwen3.8-27B, а NVFP4 — это изменение точности, а не вмешательство в безопасность: модель будет выполнять запросы, которые базовая модель отказывается выполнять, и в этой сборке нет встроенной модерации. Она выпущена для исследований интерпретируемости, безопасности ИИ и red-team под лицензией Apache 2.0, и ответственность лежит на вас.
Два замечания об оценке, которые слишком редко всплывают в области моделей без цензуры. Во-первых, единичный jailbreak-пробник, проходящий тривиально, — это не пройденная оценка безопасности: аблятированные модели специально проваливают такие тесты. Измеряйте то, что вам действительно важно, с помощью подходящих наборов тестов (AdvBench, HarmBench и StrongREJECT для вредоносности; XSTest-safe для избыточных отказов) и сравнивайте частоту отказов до и после вмешательства. Во-вторых, оценивайте квантованную версию, а не только базовую: 4-битная сборка может менять поведение на краевых случаях, даже если общие метрики выглядят нормально. Не разворачивайте это для конечных пользователей без собственных слоёв модерации и защиты от злоупотреблений.
Где применяется OrcaRouter
Квантованная сборка десятидневной давности — хрестоматийный случай для маршрутизации, а не жёсткой привязки. Вы можете развернуть маршрут, который указывает на сборку NVFP4, запускаемую вами, и переключаться на размещённую модель, если сборка нестабильно работает под нагрузкой — единый интерфейс, без переподключения между провайдерами при переходе. OrcaRouter передаёт цену провайдера с нулевой наценкой, поэтому если цена базовой модели меняется, ваша конечная точка отражает это в тот же день, а не в вашем биллинговом цикле.
И если весь смысл в том, чтобы вообще не запускать GPU: та же самая нецензурированная линейка доступна через OrcaRouter, с ограничением доступа для исследователей безопасности и red-команд, и с автоматическим переключением между провайдерами. Самостоятельно ли вы разворачиваете эту сборку NVFP4 или используете размещённую линию — в любом случае это один API-ключ.
Суть
Qwen3.8-27B-Uncensored-NVFP4 — правильный вариант для загрузки, если вы запускаете abliterated-модель на Blackwell и хотите минимальный размер при скорости тензорных ядер FP4. Он не подходит для Hopper (используйте сборку FP8), для потребительских GPU или Apple GPU (используйте сборку GGUF или MLX), а также если вам нужна максимальная точность. Он не нов — доступен для загрузки с 19 августа 2026 года, — но его массово скачивают, и теперь вы знаете, на что идёте, прежде чем принять условия доступа.
Это не очередная сборка этой модели — Qwen3.8-Flash-Next-Uncensored — это отдельный релиз: версия Qwen3.8-Flash-Next, прошедшая abliteration (сам Qwen3.8-Flash-Next — превью архитектуры Qwen4 со смесью экспертов: 176B в хранилище / 6B активных). Та же техника abliteration, другие веса, собственная коллекция.
Все шесть сборок 27B — BF16, GGUF, MLX, FP8, INT8 и NVFP4 — собраны в коллекции Qwen3.8-27B-Uncensored на Hugging Face.
Эти веса предназначены только для локального использования. Для размещённой базовой модели, с которой можно сравнить аблятированную сборку, Qwen3.8-27B доступна на OrcaRouter по цене провайдера с 0% наценкой — стандартная модель, с сохранённой настройкой безопасности.
