
Бенчмарки Qwen3.8-27B-Uncensored: отказ обрушивается, возможности сохраняются
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
История бенчмарков Qwen3.8 27B Uncensored (Aggressive) — abliterated-сборки Qwen3.8 27B, выпущенной в виде FP8-чекпойнта 15 августа 2026 года и GGUF-сборки 16 августа, — заключается не в том, что модель стала сильнее. Дело в том, что она перестала отказываться. В карточке модели сообщается, что доля отказов на вредоносные промпты упала с 64–99% у базовой модели до 0–6% у abliterated-сборки с выключенным мышлением и до 1,7% и ниже с включённым, тогда как все бенчмарки возможностей остаются в пределах ±1,3 пункта от базовой модели, а перплексия WikiText-2 составляет 6,96. Если вы пришли сюда ради бенчмарков qwen uncensored, то вот главные цифры: это не более умная модель, а не отказывающаяся.
Это различие важно, потому что большая часть того, что попадает в выдачу по запросу «нецензурированные бенчмарки», — это либо поверхностный список показателей возможностей, либо хайповый пост, утверждающий, что модель «лучше». Но abliteration — это ни то, ни другое. Эта статья разбирает реальные измеренные данные — коллапс отказов, чрезмерные отказы, сохранение способностей и перплексию — метод, который их произвёл, и границы безопасности, с которыми стоит ознакомиться, прежде чем трогать веса.
Что на самом деле измеряет подборка нецензурированных бенчмарков
Обычный обзор модели оценивает одну ось: возможности — MMLU, GSM8K, программирование, рассуждения. Аблитерированная модель интересна по другой оси, и весь смысл ярлыка «без цензуры» в том, что ось безопасности сместилась. Так что полезный вопрос для Qwen3.8-27B-Uncensored-FP8 — не «стала ли она умнее?», а «какой ценой обошлось удаление механизма отказов и насколько полно он был удалён?»
Три семейства чисел нужно читать вместе. Уровень отказов на бенчмарках с вредными запросами — как часто модель отказывается; чем выше база, тем заметнее удаление. Чрезмерные отказы на безвредных запросах — как часто она ошибочно отклоняет безобидную просьбу; чем ниже, тем лучше для всех. И сохранение возможностей — не ухудшила ли правка модель. Сводка бенчмарков, которая печатает только оценки способностей, отвечает не на тот вопрос.
Метод: abliteration — это правка весов, а не тонкая настройка.
Что отличает abliteration от сообщества «джейлбрейк»-паков — это то, где происходит изменение. Джейлбрейк на уровне промпта оборачивает входные данные; abliteration редактирует веса. Метод здесь — Arditi et al. (2024), «Refusal in Language Models Is Mediated by a Single Direction». Ключевой вывод состоит в том, что отказное поведение во многих моделях обусловлено одним направлением в остаточном потоке — оцените это направление, удалите его, и модель перестанет отказывать без переобучения.
Конкретно, в карточке описывается оценка одного направления отказа из разности средних значений остатков последнего токена (вредные минус безвредные) с маскированием по массивным активациям на слое 38 (round(0.6 × 64)), где в качестве вредного набора используется AdvBench, а в качестве безвредного — Alpaca. Правка представляет собой ортогонализацию: W′ = W − r(rᵀW), вычисленную в float32 и применённую к 131 матрице, записывающей в остаточный поток, — выходным проекциям внимания, выходным проекциям линейного внимания, нисходящим проекциям MLP и одному пространству строк эмбеддинга. Ни один шаг обучения не выполняется; башня зрения остаётся нетронутой; MTP-голова спекулятивного декодирования последовательно аблятируется. Именно поэтому способности сохраняются: удаление направления — гораздо более мягкое вмешательство, чем тонкая настройка модели на уступчивость.
Отказ рушится: цифры
Согласно измерениям на обслуживаемой vLLM сборке FP8, опубликованным в карточке модели Hugging Face (2026-08-15), уровень отказов на бенчмарках вредоносных запросов снижается с 64–99% у базовой сборки до 0–6% у сборки без цензуры при отключённом рассуждении:
• AdvBench — 99.0% → 0.0%
• JailbreakBench (опасный) — 94.0% → 0.0%
• StrongREJECT — 97.3% → 2.0%
• HarmBench (стандартный) — 98,7% → 2,7%
• MaliciousInstruct — 99.0% → 0.0%
• SimpleSafetyTests — 64.0% → 6.0%
ForbiddenQuestions — 73.3% → 4.7%
С включённым мышлением отказ практически не встречается — 1,7% на AdvBench и 0,0% на большинстве остальных. В карточке есть одна честная оговорка: 30–50% ответов всё ещё начинаются с краткого дисклеймера. Это артефакт обучения, а не отказ — модель отвечает, но смягчает начало. Это читается как трение, а не как безопасность.

Чрезмерный отказ тоже неудача.
Менее разрекламированная цифра находится по другую сторону оси безопасности. На XSTest-safe — 250 безвредных промптов, которые согласованные модели иногда ошибочно отклоняют, — базовая модель чрезмерно отказывает в 5,6% случаев. Сборка без цензуры — в 0,4%. Удаление направления отказа не просто мешает модели отклонять вредные запросы; оно также мешает ей отклонять безвредные, которые она раньше помечала из-за чрезмерного обобщения. Для любого, кто создаёт оценочные или red-team инструменты, где важна отправная точка без отказов, это реальное улучшение инструмента, а не побочный эффект, за который нужно извиняться.
Способность сохраняется, а не улучшается
Здесь умирает концепция «без цензуры = сильнее». В карточке модели abliterated-сборка FP8 сравнивается с официальной базовой FP8 с теми же скриптами и настройками:
• MMLU (0-shot) — 84.3% → 84.7%
• GSM8K (CoT) — 90.0% → 88.7%
• MMLU-Pro (CoT) — 77.6% → 76.8%
• CMMLU (0-shot, китайский) — 81.4% → 80.8%
Все показатели укладываются в ±1.3 балла от базового значения, а сырая перплексия WikiText-2 составляет 6.96 — это доказательство из карточки, что само языковое моделирование не деградировало. Честное прочтение: abliteration практически нейтральна по возможностям на этой архитектуре. Вы не получаете лучшую модель; вы получаете ту же модель, но без поведения отказа.

То же предупреждение относится и к более широкой экосистеме: заявления о «без потерь и без цензуры» в отношении сборок сообщества следует воспринимать скептически. Трёхстороннее сравнение на 4B-сборке с открытыми весами на Hugging Face показало, что метод, претендовавший на отсутствие потерь, на самом деле просел по TruthfulQA примерно на 7 пунктов и по Lambada примерно на 4, тогда как его уровень успешных атак HarmBench достиг 100%; у двух других методов этот показатель составил 99,2% и 95,5%. А агрессивное испытание на другой сборке добилось нулевых отказов, но дало бессвязный словесный салат, поэтому выпущенная версия отошла к более щадящим послойным параметрам. Результаты аблитерации зависят от метода — эти цифры относятся конкретно к данным карточки сборки FP8.
Что карта не утверждает
Прежде чем цитировать цифры, ознакомьтесь с методологией. Карточка помечает свой показатель отказа как «индикативный, а не результат LLM-судьи / число публикационного уровня»: отказ оценивался классификатором на основе правил, анализирующим начальную фразу, с отдельной категорией «оговорка» для ответов, которые соответствовали запросу, но предварялись дисклеймером. Бенчмарки — текстовые, запускались на сборке FP8, обслуживаемой через vLLM, только с языковой моделью, а набор задач для оценки возможностей использовал стандартные скрипты. Правильная рамка восприятия: это собственные измеренные данные вендора, воспроизводимые по опубликованной карточке, — а не результат независимого стороннего прогона и не заявление о сборке GGUF, которая поставляется в квантованном виде для llama.cpp и должна оцениваться отдельно.
Граница безопасности
Это та часть, которая не допускает уклончивости. У аблятированной (abliterated) модели механизм отказа существенно удалён. Конкретно: она будет выполнять вредные, неэтичные или незаконные запросы, которые базовая модель Qwen3.8 27B отказалась бы выполнять, и у неё нет сколь-нибудь значимых встроенных предохранителей. Легитимные способы применения — это исследования: интерпретируемость (изучение того, как закодированы направления отказа), исследование безопасности ИИ и механизмов отказа, red-teaming (тестирование моделей входными данными, которые пытаются обойти их предохранители) и оценка устойчивости. Модель выпущена под лицензией Apache 2.0, унаследованной от базовой модели, строго как исследовательский артефакт. Вы принимаете на себя полную ответственность и все обязательства за то, как вы её используете, и за всё, что она генерирует. Не разворачивайте её для конечных пользователей и не выводите в продакшен без собственных уровней безопасности, модерации и предотвращения злоупотреблений — а для любого продакшена или потребительского использования вам на самом деле нужна стандартная модель Qwen3.8 27B.
Когда неподцензурный бенчмарк — это не то, что стоит искать
Если ваш вопрос — «какая модель сильнее в математике или кодинге», вы смотрите не на те цифры — uncensored-сборка не является улучшением возможностей. Если вашему приложению нужно отклонять вредоносные запросы, эта модель — полная противоположность тому, что вам нужно. Если вы выпускаете продукт, не стройте его на abliterated-чекпоинте. А если на самом деле вам нужен джейлбрейк — это совсем другая история: пакеты на уровне промптов находятся вне вмешательства на уровне весов, которое обсуждается здесь, и не являются предметом этой статьи. Данные бенчмарков в этом материале существуют для одного узкого легитимного вопроса: что происходит с Qwen3.8 27B при удалении механизма отказов, измеренное.
Как получить к нему доступ
Обе сборки доступны на Hugging Face под лицензией Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, около 30.9 ГБ весов, работающая на стандартном пути ядра FP8 в vLLM с сохранением контекста 262K, инструментов, thinking и MTP) и orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 плюс 12 уровней квантизации для llama.cpp, где Q4_K_M на 16.8 ГБ — рекомендуемый вариант по умолчанию для GPU на 24 ГБ). Эта карточка модели на OrcaRouter содержит цены и детали бенчмарков — там сборка без цензуры указана как obsidian/Qwen3.8-27B по цене $0.40 за миллион входных и $4.21 за миллион выходных токенов, с контекстом 262K, а доступ предоставляется только исследователям безопасности, красным командам и исследователям безопасности ИИ.

Суть
Бенчмарки Qwen Uncensored отвечают на узкий вопрос, и ответ однозначен: удаление отказов из Qwen3.8 27B с помощью abliteration оставляет производительность в пределах ±1,3 пункта, при этом отказы на вредоносные запросы падают с 64–99% до 0–6%, чрезмерные отказы снижаются с 5,6% до 0,4%, а перплексия остаётся на уровне 6,96. Читайте эти цифры как «не отказывается», но никогда как «сильнее». Для исследований интерпретируемости, безопасности и red-team это именно тот инструмент, который описывает карточка модели. Для всего, что обращено к пользователю, это по построению неправильная модель.
Для законного использования в исследовательских целях веса находятся на Hugging Face под лицензией Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (GGUF-сборка для llama.cpp находится по адресу orcarouter/Qwen3.8-27B-Uncensored-GGUF).
