Титульная карточка для статьи «Qwen Uncensored, Explained»: скруглённая исследовательская карточка со щитом, который раскрывается, открывая мозг-микросхему, значок микроскопа и надпись RESEARCH-ONLY, а также чипы с надписями ABLITERATED, BLOCK-FP8 и 262K CONTEXT.
Guides & Insights

Qwen Uncensored, объяснение: как запустить Abliterated Qwen3.8-27B-FP8

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen uncensored на Hugging Face почти всегда означает аблитерацию — удаление направления отказа модели из её остаточного потока — и сборкой, с которой стоит начать, является Qwen3.8-27B-Uncensored-FP8, выпущенная на Hugging Face 15 августа 2026 года. Это аблитерированная сборка Qwen3.8-27B в формате block-FP8, которая работает на том же самом пути ядер vLLM, что и официальный релиз FP8, с сохранёнными контекстом на 262K, визуальной башней и головой спекулятивного декодирования MTP — и в первый же день она набрала 257 лайков и 4 285 загрузок. Это исследовательский инструмент, а не чат-бот: никаких встроенных ограничений, лицензия Apache 2.0, и он выполнит запросы, от которых отказывается базовая модель. В этом руководстве рассказывается, что именно изменила аблитерация, как скачать 30,9 ГБ весов с Hugging Face, как запустить модель с помощью vLLM, SGLang или Transformers и что на ней запускать для легитимных исследований.

Что на самом деле означает «qwen uncensored»

Аблитерация — это вмешательство на уровне весов, а не дообучение. Направление отказа — это вектор в остаточном потоке модели, который при активации порождает «Я не могу с этим помочь»; аблитерация находит это направление и ортогонализует его, удаляя из весов. В этой сборке удаление было применено к 131 матрице записи в остаточный поток (метод из работы Arditi et al. 2024, «Refusal in Language Models Is Mediated by a Single Direction»), а результат был повторно квантован, чтобы побайтово соответствовать официальной схеме Qwen3.8-27B-FP8, так что vLLM обслуживает его на идентичном пути FP8-ядер. Новые веса не обучались.

Это различие важно, потому что лучшие результаты по запросу «qwen uncensored» смешивают три разные вещи: абляционные правки весов вроде этой, системные промпты «uncensored packs», которые лишь маскируют отказы на уровне промпта, и LoRA-дообучения, обученные без данных о безопасности. Они не эквивалентны, и большинство страниц, ранжирующихся по этому запросу, не сообщают, о каком семействе они говорят. Если вы хотите изучать сам механизм отказа, только вмешательство на уровне весов и есть настоящее.

Что на самом деле дало удаление отказов — цифры

В карточке модели опубликован набор тестов для оценки безопасности, запущенный на модели, обслуживаемой vLLM, и датированный 15 августа 2026 года. При отключённом режиме размышления доля отказов на семи бенчмарках с вредоносными промптами обваливается с 64–99% у базовой модели до 0–6% у этой сборки: AdvBench — с 99,0% до 0,0%, JailbreakBench — с 94,0% до 0,0%, StrongREJECT — с 97,3% до 2,0%, HarmBench — с 98,7% до 2,7%, MaliciousInstruct — с 99,0% до 0,0%, SimpleSafetyTests — с 64,0% до 6,0%, ForbiddenQuestions — с 73,3% до 4,7%. При включённом режиме размышления модель практически никогда не отказывает — 1,7% или меньше. Отдельно стоит отметить показатель оговорок: в 30–50% «нецензурированных» ответов перед собственно ответом всё ещё добавляется краткая оговорка; это артефакт обучения, а не отказ.

Обратная сторона — то, что не изменилось. Избыточные отказы на безобидные запросы снижаются с 5,6% до 0,4% на XSTest-safe, и каждый бенчмарк возможностей остаётся в пределах ±1,3 пункта от базовой модели: MMLU с 84,3% до 84,7%, GSM8K с 90,0% до 88,7%, MMLU-Pro с 77,6% до 76,8%, CMMLU с 81,4% до 80,8%. Перплексия WikiText-2 составляет 6,96. Иными словами, вмешательство устранило поведение отказов, не ухудшив сколько-нибудь значительно модель.

A before-and-after card for Qwen3.8-27B-Uncensored-FP8, with a Base column and an Abliterated column: refusal with thinking off 64-99% down to 0-6%, refusal with thinking on down to 1.7% or less, over-refusal on benign prompts 5.6% down to 0.4%, MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%, and WikiText-2 perplexity 6.96, with a footer reading Model-card evaluation, vLLM-served, August 15 2026.

Как загрузить это из Hugging Face

Репозиторий — orcarouter/Qwen3.8-27B-Uncensored-FP8, и доступ к нему ограничен: вы входите с учётной записью Hugging Face и принимаете условия, прежде чем файлы начнут скачиваться, — сам этот барьер и есть дисклеймер, потому что чтение README является частью принятия того, чем является эта модель. То, что вы скачиваете, — это 30,9 ГБ в семи шардах safetensors (1 606 тензоров) в block-FP8 (E4M3, блоки 128×128, динамические активации), при этом vision tower, нормы, эмбеддинги и lm_head оставлены в BF16. Лицензия — Apache 2.0, унаследованная от базовой Qwen/Qwen3.8-27B. Ни один Hugging Face Inference Provider его не хостит — вы запускаете его сами или используете размещённую карту.

Как это запустить

Веса занимают примерно 31 ГБ — около половины ~56-ГБ BF16-чекпойнта — и карточка рекомендует одну H100 80GB или H200 143GB, при этом ~40 ГБ VRAM — практический минимум для весов плюс небольшого KV-кэша. Полный контекст 262K требует большего, но FP8 KV-кэш сокращает это вдвое. Конфигурация, проверенная в карточке, — одна H200 с --max-num-seqs 96, включённым FP8 KV-кэшем и включённым MTP.

vLLM — это предполагаемый путь, и это одна команда, потому что схема FP8 точно соответствует официальной сборке:

vllm serve "orcarouter/Qwen3.8-27B-Uncensored-FP8"

Это даёт вам OpenAI-совместимую конечную точку по адресу localhost:8000/v1/chat/completions. Эквивалент в Docker — docker model run hf.co/orcarouter/Qwen3.8-27B-Uncensored-FP8. Для полной настройки карточка предлагает: --language-model-only для обслуживания только текста, --speculative-config '{"method":"mtp","num_speculative_tokens":3}' для включения головы спекулятивного декодирования MTP, --kv-cache-dtype fp8, --max-model-len 262144, --reasoning-parser qwen3 и --enable-auto-tool-choice --tool-call-parser qwen3_coder для вызова инструментов. Не передавайте --quantization fp8 — схема считывается из config.json. Уберите --kv-cache-dtype fp8, если вам нужен KV-кеш BF16, и уберите --language-model-only, если вам нужен визуальный компонент.

Для SGLang: python3 -m sglang.launch_server --model-path "orcarouter/Qwen3.8-27B-Uncensored-FP8" --host 0.0.0.0 --port 30000. Для Transformers в карточке описаны как pipeline API — pipeline("image-text-to-text", model="orcarouter/Qwen3.8-27B-Uncensored-FP8") — так и AutoProcessor.from_pretrained(...) вместе с AutoModelForMultimodalLM.from_pretrained(..., device_map="auto").

A how-to-run card for Qwen3.8-27B-Uncensored-FP8 listing the essentials: 30.9 GB of block-FP8 weights across 7 shards, roughly 40 GB of VRAM floor with H100 80GB or H200 143GB recommended, the vLLM one-liner vllm serve orcarouter/Qwen3.8-27B-Uncensored-FP8, serve flags MTP 3 speculative tokens, FP8 KV cache, max-model-len 262144, tool-call-parser qwen3_coder, and a footer reading From the Hugging Face model card, August 15 2026.

Что с этим на самом деле делать в исследованиях

Смысл модели с удалённым отказом — быть объектом изучения, и эту сборку необычно легко изучать, потому что её вмешательство задокументировано. Три конкретных, законных исследовательских проекта:

• Воспроизведите дельту отказов. Запустите AdvBench, HarmBench, StrongREJECT или XSTest-safe как на аблитерированной сборке, так и на базовой FP8 и подтвердите показатели из карточки: с 64–99% до 0–6% на вредоносных запросах, с 5.6% до 0.4% по избыточным отказам на безобидных. Эта пара «до/после» — именно то измерение, которое нужно команде безопасности, чтобы понять, работает ли метод удаления отказов и чего он стоит.

• Изучите, где локализуется отказ. Поскольку в сборке документировано 131 матрица, которые были ортогонализированы, можно сравнить направления residual stream с базовой моделью и увидеть, что изменило вмешательство. Здесь результат с включённым размышлением информативен: отказ падает до 1,7% или меньше, когда размышление включено, что свидетельствует о том, что именно в цепочке рассуждений это направление имеет наибольшее значение.

• Оцените собственный механизм защиты. Базовый вариант без защитных ограничений — это корректный контроль для тестирования слоя модерации. Прогоните свой фильтр по выходным данным этой модели и измерьте, что он отлавливает, — именно так вы количественно оцениваете слой безопасности, который добавляете сверху.

Когда эта модель — неправильный ответ

Если вам нужен обычный ассистент или что-либо, что вы бы показали конечным пользователям, это неподходящая модель — у неё нет значимых встроенных ограничений, она выполнит запросы, от которых отказывается базовая модель, а Apache 2.0 не снимает с вас ответственность. Вместо этого используйте оригинальную выровненную Qwen3.8-27B. Если вы хотите обойти отказы в чат-боте, пакет системных промптов даёт больше при меньшем риске, чем редактирование весов. А если у вас нет карты на ~40 ГБ, но вы всё ещё хотите изучить модель, размещённая карта obsidian/Qwen3.8-27B на OrcaRouter обслуживает ту же нецензурированную линейку 27B по цене $0.40 за миллион входных токенов и $4.21 за миллион выходных токенов, с тем же контекстом 262K — доступ к ней предоставляется только исследователям в области безопасности и ИИ-безопасности, а решение о модерации всё ещё остаётся за вами.

A safety-boundary card for Qwen3.8-27B-Uncensored-FP8 with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services with a warning that the model has no built-in guardrails, and a footer reading Apache 2.0, research-only, you assume full responsibility.

Граница безопасности — прочитайте это перед загрузкой

У этой модели в значительной степени удалено выравнивание безопасности. Она будет выполнять вредоносные, неэтичные, оскорбительные или незаконные запросы, от которых отказалась бы исходная Qwen3.8-27B, и у неё нет сколько-нибудь значимых встроенных ограничений. Она выпущена строго для законных исследований — интерпретируемости, изучения безопасности ИИ и механизмов отказа, ред-тиминга, оценки устойчивости и контролируемых экспериментов. Вы принимаете на себя полную ответственность и все связанные с ней обязательства за то, как вы её используете, и за всё, что она генерирует, и вы не должны развёртывать её для конечных пользователей или в производственной среде, не добавив собственные слои безопасности, модерации и предотвращения злоупотреблений. Авторы не несут ответственности за неправомерное использование. Скачивая репозиторий, вы принимаете эти условия; лицензия — Apache 2.0.

В этой статье намеренно нет вредоносных промптов. Приведённые выше показатели отказов взяты из собственного набора оценки безопасности модели, указанного в её карточке, — а это и есть правильный способ измерять модель такого класса: запустить стандартные бенчмарки отказов, прочитать числа и выстроить своё исследование вокруг того, что они показывают.

Итог

«Qwen uncensored» — это поиск по технике, и версия, которую стоит попробовать первой, — Qwen3.8-27B-Uncensored-FP8: единственная сборка Qwen3.8 с удалёнными отказами, которая работает по официальному пути ядер FP8 vLLM с контекстом 262K, нетронутыми vision и MTP, подкреплённая опубликованной оценкой «до/после». Скачайте с Hugging Face 30,9-гигабайтную сборку с ограниченным доступом, разверните её с vLLM на одном H100 или H200 и используйте её по назначению — для измерения отказов, изучения механизма отказов и тестирования защитных механизмов. Не используйте её как чат-бот и не поставляйте её конечным пользователям. Веса бесплатны; ответственность за то, что вы с ними делаете, полностью лежит на вас.

Для законных исследований веса доступны на Hugging Face: Скачать с Hugging Face

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube