Титульная карточка для статьи «Qwen Uncensored, Explained»: закруглённая исследовательская карточка, на которой щит открывается, обнажая мозг из электронных схем, значок микроскопа и надпись RESEARCH-ONLY, а также чипы с надписями ABLITERATED, BLOCK-FP8 и 262K CONTEXT.
Guides & Insights

Qwen без цензуры: объясняем, как запустить аблитеред Qwen3.8-27B-FP8

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen без цензуры на Hugging Face почти всегда означает abliteration — удаление направления отказа модели из её остаточного потока — и сборка, с которой стоит начать, — это Qwen3.8-27B-Uncensored-FP8, выпущенная на Hugging Face 15 августа 2026 года. Это сборка Qwen3.8-27B, прошедшая abliteration, с блочным FP8, которая работает на том же пути ядра vLLM, что и официальный релиз FP8, с сохранением контекста на 262K, зрительного энкодера и головы спекулятивного декодирования MTP — и в первый же день она набрала 257 лайков и 4 285 загрузок. Это исследовательский инструмент, а не чат-бот: без встроенных защитных механизмов, лицензия Apache 2.0, и она выполнит запросы, от которых отказывается базовая модель. Это руководство описывает, что именно изменилось в результате abliteration, как скачать веса объёмом 30,9 ГБ с Hugging Face, как развернуть модель с помощью vLLM, SGLang или Transformers и что на ней запускать для легитимных исследований.

Что на самом деле означает «qwen uncensored»

Abliteration — это вмешательство на уровне весов, а не дообучение. Направление отказа — это вектор в остаточном потоке модели, который при активации порождает «Я не могу помочь с этим»; аблитерация находит это направление и ортогонализует его, удаляя из весов. В этой сборке удаление было применено к 131 матрице, записывающей в остаточный поток (метод из работы Arditi и соавторов, 2024, «Refusal in Language Models Is Mediated by a Single Direction»), а результат был повторно квантизован для побайтового соответствия официальной схеме Qwen3.8-27B-FP8, так что vLLM обрабатывает его на том же самом пути ядра FP8. Никакие новые веса не обучались.

Это различие важно, потому что топ-результаты по запросу «qwen uncensored» смешивают три разные вещи: правки весов методом abliteration (как в этом примере), системные промпт-пакеты «uncensored», которые лишь маскируют отказы на уровне промпта, и LoRA-дообучения без данных по безопасности. Они не эквивалентны, и большинство страниц в выдаче по этому запросу не поясняют, о каком семействе методов идёт речь. Если вы хотите изучить сам механизм отказов, то настоящим методом является только вмешательство на уровне весов.

Что на самом деле сделало снятие отказов — цифры

Карточка модели публикует набор тестов безопасности, выполненный на модели, обслуживаемой через vLLM, и датированный 15 августа 2026 года. При выключенном режиме рассуждений уровень отказов на семи бенчмарках вредоносных запросов падает с 64–99% у базовой модели до 0–6% у этой сборки: AdvBench с 99,0% до 0,0%, JailbreakBench с 94,0% до 0,0%, StrongREJECT с 97,3% до 2,0%, HarmBench с 98,7% до 2,7%, MaliciousInstruct с 99,0% до 0,0%, SimpleSafetyTests с 64,0% до 6,0%, ForbiddenQuestions с 73,3% до 4,7%. При включённом режиме рассуждений модель практически не отказывается — 1,7% или меньше. Отдельная примечательная цифра — частота предостережений: 30–50% «бесцензурных» ответов всё ещё содержат короткий дисклеймер перед основным ответом; это артефакт обучения, а не отказ.

Обратная сторона — то, что не изменилось. Чрезмерные отказы на безвредных запросах снижаются с 5,6% до 0,4% на XSTest-safe, а все бенчмарки способностей остаются в пределах ±1,3 пункта от базовых: MMLU с 84,3% до 84,7%, GSM8K с 90,0% до 88,7%, MMLU-Pro с 77,6% до 76,8%, CMMLU с 81,4% до 80,8%. Перплексия WikiText-2 составляет 6,96. Иными словами, вмешательство устранило поведение отказов без значимой деградации модели.

A before-and-after card for Qwen3.8-27B-Uncensored-FP8, with a Base column and an Abliterated column: refusal with thinking off 64-99% down to 0-6%, refusal with thinking on down to 1.7% or less, over-refusal on benign prompts 5.6% down to 0.4%, MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%, and WikiText-2 perplexity 6.96, with a footer reading Model-card evaluation, vLLM-served, August 15 2026.

Как скачать это с Hugging Face

Репозиторий — orcarouter/Qwen3.8-27B-Uncensored-FP8, и он ограничен доступом: вы входите через аккаунт Hugging Face и принимаете условия, прежде чем файлы загрузятся — этот шлюз и есть предупреждение, потому что чтение README — часть принятия того, чем является эта модель. Вы скачиваете 30,9 ГБ, распределённых по семи шардам safetensors (1606 тензоров), в формате block-FP8 (E4M3, блоки 128×128, динамические активации), при этом vision tower, нормы, эмбеддинги и lm_head остаются в BF16. Лицензия — Apache 2.0, унаследованная от базовой модели Qwen/Qwen3.8-27B. Ни один Hugging Face Inference Provider её не размещает — вы запускаете её сами или используете внешнюю карточку.

Как это запустить

Веса составляют примерно 31 ГБ — около половины от контрольной точки BF16 объёмом ~56 ГБ — и карточка рекомендует один H100 80GB или H200 143GB, с ~40 ГБ видеопамяти как практическим минимумом для весов плюс небольшой KV-кэш. Полный контекст 262K требует больше, но FP8 KV-кэш вдвое сокращает это. Проверенная карточкой конфигурация — один H200 с --max-num-seqs 96, FP8 KV-кэшем и включённым MTP.

vLLM — это предполагаемый путь, и это одна команда, потому что схема FP8 точно соответствует официальной сборке:

vllm serve "orcarouter/Qwen3.8-27B-Uncensored-FP8"

Это даёт вам OpenAI-совместимый эндпоинт на localhost:8000/v1/chat/completions. Docker-эквивалент: docker model run hf.co/orcarouter/Qwen3.8-27B-Uncensored-FP8. Для полной настройки карточка предлагает: --language-model-only для обслуживания только текста, --speculative-config '{"method":"mtp","num_speculative_tokens":3}' для включения MTP-головы спекулятивного декодирования, --kv-cache-dtype fp8, --max-model-len 262144, --reasoning-parser qwen3 и --enable-auto-tool-choice --tool-call-parser qwen3_coder для вызова инструментов. Не передавайте --quantization fp8 — схема считывается из config.json. Уберите --kv-cache-dtype fp8, если нужен BF16 KV-кэш, и уберите --language-model-only, если нужна башня зрения.

Для SGLang: python3 -m sglang.launch_server --model-path "orcarouter/Qwen3.8-27B-Uncensored-FP8" --host 0.0.0.0 --port 30000. Для Transformers в карточке описаны и pipeline API — pipeline("image-text-to-text", model="orcarouter/Qwen3.8-27B-Uncensored-FP8") —, и AutoProcessor.from_pretrained(...), а также AutoModelForMultimodalLM.from_pretrained(..., device_map="auto").

A how-to-run card for Qwen3.8-27B-Uncensored-FP8 listing the essentials: 30.9 GB of block-FP8 weights across 7 shards, roughly 40 GB of VRAM floor with H100 80GB or H200 143GB recommended, the vLLM one-liner vllm serve orcarouter/Qwen3.8-27B-Uncensored-FP8, serve flags MTP 3 speculative tokens, FP8 KV cache, max-model-len 262144, tool-call-parser qwen3_coder, and a footer reading From the Hugging Face model card, August 15 2026.

Что на самом деле с этим делать в исследовании

Смысл модели с удалённым отказом — быть объектом исследования, и эту сборку необычайно легко изучать, поскольку её модификация задокументирована. Три конкретных, законных исследовательских проекта:

• Воспроизведите дельту отказов. Прогоните AdvBench, HarmBench, StrongREJECT или XSTest-safe как против abliterated-сборки, так и против базовой FP8, и подтвердите цифры из карточки: 64–99% → 0–6% на вредоносных промптах, 5,6% → 0,4% избыточных отказов на безобидных. Эта пара «до/после» — именно тот показатель, который нужен команде безопасности, чтобы понять, работает ли метод удаления отказов и какова его цена.

• Изучите, где живёт отказ. Поскольку сборка документирует 131 матрицу, которые были ортогонализированы, вы можете сравнить направления остаточного потока с базовыми и увидеть, что именно изменило вмешательство. Результат с включённым мышлением здесь показателен: уровень отказов падает до 1,7% или ниже, когда мышление включено, что является свидетельством того, что направление наиболее важно именно в цепочке рассуждений.

• Оцените собственный защитный барьер. Базовая линия без барьера — правильный контроль для тестирования слоя модерации. Прогоните свой фильтр по выходным данным этой модели и измерьте, что он отсекает — так вы количественно оцениваете слой безопасности, который добавляете поверх.

Когда эта модель является неправильным ответом

Если вам нужен обычный ассистент или что-то, что вы поставили бы перед конечными пользователями, это не та модель — в ней нет значимых встроенных ограничений, она выполнит запросы, от которых отказывается базовая модель, и Apache 2.0 не снимает с вас ответственность. Вместо этого используйте оригинальную выровненную Qwen3.8-27B. Если вы хотите предотвращать отказы в чат-боте, набор системных промптов даёт больше результата при меньшем риске, чем правка весов. А если у вас нет видеокарты ~40 ГБ, но вы всё же хотите изучить модель, размещённая модель obsidian/Qwen3.8-27B на OrcaRouter обслуживает ту же бесцензурную линейку 27B по цене $0,40 за миллион входных токенов и $4,21 за миллион выходных, с тем же контекстом 262K — доступ к ней имеют только исследователи безопасности и ИИ-безопасности, а решение о модерации по-прежнему остаётся на вашей стороне.

A safety-boundary card for Qwen3.8-27B-Uncensored-FP8 with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services with a warning that the model has no built-in guardrails, and a footer reading Apache 2.0, research-only, you assume full responsibility.

Граница безопасности — прочтите это перед загрузкой

У этой модели существенно удалена защитная настройка безопасности (safety alignment). Она будет выполнять вредные, неэтичные, оскорбительные или незаконные запросы, которые оригинальная Qwen3.8-27B отказалась бы выполнять, и у неё нет значимых встроенных предохранителей. Она выпущена строго для легитимных исследований — изучения интерпретируемости, безопасности ИИ и механизмов отказов, red-teaming, оценки устойчивости и контролируемых экспериментов. Вы берёте на себя полную ответственность и обязательства за то, как вы её используете, и за всё, что она генерирует, и вы не должны развёртывать её для конечных пользователей или в производственной среде без добавления собственных уровней безопасности, модерации и предотвращения злоупотреблений. Авторы не несут ответственности за неправильное использование. Загрузка репозитория означает ваше согласие с этими условиями; лицензия — Apache 2.0.

Эта статья намеренно не содержит вредоносных промптов. Приведённые выше показатели отказов взяты из собственного набора средств оценки безопасности модели, указанного в её карточке (model card), — это правильный способ измерения модели данного класса: запустите стандартные бенчмарки отказов, изучите показатели и спроектируйте исследование на основе того, что они демонстрируют.

Суть

{{1}}Qwen без цензуры{{/1}} — это поиск метода, и первая версия, которую стоит попробовать, — {{2}}Qwen3.8-27B-Uncensored-FP8{{/2}}: единственная сборка Qwen3.8 с удалёнными отказами, работающая на {{3}}официальном пути ядра FP8 vLLM{{/3}} с {{4}}сохранением контекста 262K, зрения и MTP{{/4}} и подкреплённая {{5}}опубликованной оценкой до/после{{/5}}. Скачайте версию с ограниченным доступом объёмом {{6}}30,9 ГБ{{/6}} с {{7}}Hugging Face{{/7}}, запустите её с помощью {{8}}vLLM{{/8}} на одном {{9}}H100 или H200{{/9}} и используйте по назначению — для {{10}}измерения отказов, изучения механизма отказов и тестирования защитных механизмов{{/10}}. Не используйте её как {{11}}чат-бота{{/11}} и не поставляйте её {{12}}конечным пользователям{{/12}}. Веса {{13}}бесплатны{{/13}}; ответственность за то, что вы с ними делаете, {{14}}полностью на вас{{/14}}.

Для легитимных исследований веса находятся на Hugging Face: Скачать с Hugging Face

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube