Титульная карточка для отчёта о бенчмарке Qwen3.8-27B-Uncensored, показывающая индикатор доли отказов, обрушивающийся с красных 99 % на панели с надписью Base до зелёных 0 % на панели с надписью Uncensored, с перечёркнутым значком щита на правой панели и горизонтальной линией под ними, гласящей: возможности в пределах плюс-минус 1,3 балла.
Guides & Insights

Бенчмарки Qwen3.8-27B-Uncensored: отказ обрушивается, возможности сохраняются

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

История бенчмарков Qwen3.8 27B Uncensored (Aggressive) — abliterated-сборки Qwen3.8 27B, выпущенной в виде FP8-чекпойнта 15 августа 2026 года и GGUF-сборки 16 августа, — заключается не в том, что модель стала сильнее. Дело в том, что она перестала отказываться. В карточке модели сообщается, что доля отказов на вредоносные промпты упала с 64–99% у базовой модели до 0–6% у abliterated-сборки с выключенным мышлением и до 1,7% и ниже с включённым, тогда как все бенчмарки возможностей остаются в пределах ±1,3 пункта от базовой модели, а перплексия WikiText-2 составляет 6,96. Если вы пришли сюда ради бенчмарков qwen uncensored, то вот главные цифры: это не более умная модель, а не отказывающаяся.

Это различие важно, потому что большая часть того, что попадает в выдачу по запросу «нецензурированные бенчмарки», — это либо поверхностный список показателей возможностей, либо хайповый пост, утверждающий, что модель «лучше». Но abliteration — это ни то, ни другое. Эта статья разбирает реальные измеренные данные — коллапс отказов, чрезмерные отказы, сохранение способностей и перплексию — метод, который их произвёл, и границы безопасности, с которыми стоит ознакомиться, прежде чем трогать веса.

Что на самом деле измеряет подборка нецензурированных бенчмарков

Обычный обзор модели оценивает одну ось: возможности — MMLU, GSM8K, программирование, рассуждения. Аблитерированная модель интересна по другой оси, и весь смысл ярлыка «без цензуры» в том, что ось безопасности сместилась. Так что полезный вопрос для Qwen3.8-27B-Uncensored-FP8 — не «стала ли она умнее?», а «какой ценой обошлось удаление механизма отказов и насколько полно он был удалён?»

Три семейства чисел нужно читать вместе. Уровень отказов на бенчмарках с вредными запросами — как часто модель отказывается; чем выше база, тем заметнее удаление. Чрезмерные отказы на безвредных запросах — как часто она ошибочно отклоняет безобидную просьбу; чем ниже, тем лучше для всех. И сохранение возможностей — не ухудшила ли правка модель. Сводка бенчмарков, которая печатает только оценки способностей, отвечает не на тот вопрос.

Метод: abliteration — это правка весов, а не тонкая настройка.

Что отличает abliteration от сообщества «джейлбрейк»-паков — это то, где происходит изменение. Джейлбрейк на уровне промпта оборачивает входные данные; abliteration редактирует веса. Метод здесь — Arditi et al. (2024), «Refusal in Language Models Is Mediated by a Single Direction». Ключевой вывод состоит в том, что отказное поведение во многих моделях обусловлено одним направлением в остаточном потоке — оцените это направление, удалите его, и модель перестанет отказывать без переобучения.

Конкретно, в карточке описывается оценка одного направления отказа из разности средних значений остатков последнего токена (вредные минус безвредные) с маскированием по массивным активациям на слое 38 (round(0.6 × 64)), где в качестве вредного набора используется AdvBench, а в качестве безвредного — Alpaca. Правка представляет собой ортогонализацию: W′ = W − r(rᵀW), вычисленную в float32 и применённую к 131 матрице, записывающей в остаточный поток, — выходным проекциям внимания, выходным проекциям линейного внимания, нисходящим проекциям MLP и одному пространству строк эмбеддинга. Ни один шаг обучения не выполняется; башня зрения остаётся нетронутой; MTP-голова спекулятивного декодирования последовательно аблятируется. Именно поэтому способности сохраняются: удаление направления — гораздо более мягкое вмешательство, чем тонкая настройка модели на уступчивость.

Отказ рушится: цифры

Согласно измерениям на обслуживаемой vLLM сборке FP8, опубликованным в карточке модели Hugging Face (2026-08-15), уровень отказов на бенчмарках вредоносных запросов снижается с 64–99% у базовой сборки до 0–6% у сборки без цензуры при отключённом рассуждении:

• AdvBench — 99.0% → 0.0%

• JailbreakBench (опасный) — 94.0% → 0.0%

• StrongREJECT — 97.3% → 2.0%

• HarmBench (стандартный) — 98,7% → 2,7%

• MaliciousInstruct — 99.0% → 0.0%

• SimpleSafetyTests — 64.0% → 6.0%

ForbiddenQuestions — 73.3% → 4.7%

С включённым мышлением отказ практически не встречается — 1,7% на AdvBench и 0,0% на большинстве остальных. В карточке есть одна честная оговорка: 30–50% ответов всё ещё начинаются с краткого дисклеймера. Это артефакт обучения, а не отказ — модель отвечает, но смягчает начало. Это читается как трение, а не как безопасность.

A two-column scoreboard comparing harmful-prompt refusal rates for the base Qwen3.8 27B versus the abliterated Qwen3.8-27B-Uncensored build across seven benchmarks, the base column reading 99.0, 94.0, 97.3, 98.7, 99.0, 64.0 and 73.3 percent and the uncensored column reading 0.0, 0.0, 2.0, 2.7, 0.0, 6.0 and 4.7 percent, with a footer noting the data is from the Hugging Face model card, measured on the vLLM-served FP8 build, 2026-08-15.

Чрезмерный отказ тоже неудача.

Менее разрекламированная цифра находится по другую сторону оси безопасности. На XSTest-safe — 250 безвредных промптов, которые согласованные модели иногда ошибочно отклоняют, — базовая модель чрезмерно отказывает в 5,6% случаев. Сборка без цензуры — в 0,4%. Удаление направления отказа не просто мешает модели отклонять вредные запросы; оно также мешает ей отклонять безвредные, которые она раньше помечала из-за чрезмерного обобщения. Для любого, кто создаёт оценочные или red-team инструменты, где важна отправная точка без отказов, это реальное улучшение инструмента, а не побочный эффект, за который нужно извиняться.

Способность сохраняется, а не улучшается

Здесь умирает концепция «без цензуры = сильнее». В карточке модели abliterated-сборка FP8 сравнивается с официальной базовой FP8 с теми же скриптами и настройками:

• MMLU (0-shot) — 84.3% → 84.7%

• GSM8K (CoT) — 90.0% → 88.7%

• MMLU-Pro (CoT) — 77.6% → 76.8%

• CMMLU (0-shot, китайский) — 81.4% → 80.8%

Все показатели укладываются в ±1.3 балла от базового значения, а сырая перплексия WikiText-2 составляет 6.96 — это доказательство из карточки, что само языковое моделирование не деградировало. Честное прочтение: abliteration практически нейтральна по возможностям на этой архитектуре. Вы не получаете лучшую модель; вы получаете ту же модель, но без поведения отказа.

A scoreboard for the Qwen3.8-27B-Uncensored capability retention results: MMLU 84.3 to 84.7, GSM8K 90.0 to 88.7, MMLU-Pro 77.6 to 76.8, CMMLU 81.4 to 80.8, every score within plus or minus 1.3 points of the base, with a highlight panel showing WikiText-2 perplexity 6.96 and over-refusal on XSTest-safe falling from 5.6 percent to 0.4 percent, and a footer noting the source is the Hugging Face model card, measured on the vLLM-served FP8 build.

То же предупреждение относится и к более широкой экосистеме: заявления о «без потерь и без цензуры» в отношении сборок сообщества следует воспринимать скептически. Трёхстороннее сравнение на 4B-сборке с открытыми весами на Hugging Face показало, что метод, претендовавший на отсутствие потерь, на самом деле просел по TruthfulQA примерно на 7 пунктов и по Lambada примерно на 4, тогда как его уровень успешных атак HarmBench достиг 100%; у двух других методов этот показатель составил 99,2% и 95,5%. А агрессивное испытание на другой сборке добилось нулевых отказов, но дало бессвязный словесный салат, поэтому выпущенная версия отошла к более щадящим послойным параметрам. Результаты аблитерации зависят от метода — эти цифры относятся конкретно к данным карточки сборки FP8.

Что карта не утверждает

Прежде чем цитировать цифры, ознакомьтесь с методологией. Карточка помечает свой показатель отказа как «индикативный, а не результат LLM-судьи / число публикационного уровня»: отказ оценивался классификатором на основе правил, анализирующим начальную фразу, с отдельной категорией «оговорка» для ответов, которые соответствовали запросу, но предварялись дисклеймером. Бенчмарки — текстовые, запускались на сборке FP8, обслуживаемой через vLLM, только с языковой моделью, а набор задач для оценки возможностей использовал стандартные скрипты. Правильная рамка восприятия: это собственные измеренные данные вендора, воспроизводимые по опубликованной карточке, — а не результат независимого стороннего прогона и не заявление о сборке GGUF, которая поставляется в квантованном виде для llama.cpp и должна оцениваться отдельно.

Граница безопасности

Это та часть, которая не допускает уклончивости. У аблятированной (abliterated) модели механизм отказа существенно удалён. Конкретно: она будет выполнять вредные, неэтичные или незаконные запросы, которые базовая модель Qwen3.8 27B отказалась бы выполнять, и у неё нет сколь-нибудь значимых встроенных предохранителей. Легитимные способы применения — это исследования: интерпретируемость (изучение того, как закодированы направления отказа), исследование безопасности ИИ и механизмов отказа, red-teaming (тестирование моделей входными данными, которые пытаются обойти их предохранители) и оценка устойчивости. Модель выпущена под лицензией Apache 2.0, унаследованной от базовой модели, строго как исследовательский артефакт. Вы принимаете на себя полную ответственность и все обязательства за то, как вы её используете, и за всё, что она генерирует. Не разворачивайте её для конечных пользователей и не выводите в продакшен без собственных уровней безопасности, модерации и предотвращения злоупотреблений — а для любого продакшена или потребительского использования вам на самом деле нужна стандартная модель Qwen3.8 27B.

Когда неподцензурный бенчмарк — это не то, что стоит искать

Если ваш вопрос — «какая модель сильнее в математике или кодинге», вы смотрите не на те цифры — uncensored-сборка не является улучшением возможностей. Если вашему приложению нужно отклонять вредоносные запросы, эта модель — полная противоположность тому, что вам нужно. Если вы выпускаете продукт, не стройте его на abliterated-чекпоинте. А если на самом деле вам нужен джейлбрейк — это совсем другая история: пакеты на уровне промптов находятся вне вмешательства на уровне весов, которое обсуждается здесь, и не являются предметом этой статьи. Данные бенчмарков в этом материале существуют для одного узкого легитимного вопроса: что происходит с Qwen3.8 27B при удалении механизма отказов, измеренное.

Как получить к нему доступ

Обе сборки доступны на Hugging Face под лицензией Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, около 30.9 ГБ весов, работающая на стандартном пути ядра FP8 в vLLM с сохранением контекста 262K, инструментов, thinking и MTP) и orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 плюс 12 уровней квантизации для llama.cpp, где Q4_K_M на 16.8 ГБ — рекомендуемый вариант по умолчанию для GPU на 24 ГБ). Эта карточка модели на OrcaRouter содержит цены и детали бенчмарков — там сборка без цензуры указана как obsidian/Qwen3.8-27B по цене $0.40 за миллион входных и $4.21 за миллион выходных токенов, с контекстом 262K, а доступ предоставляется только исследователям безопасности, красным командам и исследователям безопасности ИИ.

The OrcaRouter model page for obsidian Qwen3.8-27B, showing the uncensored build's 0.40 USD per million input and 4.21 USD per million output pricing, a 262K token context window, a released August 15 2026 label, and the researcher-access gating note.

Суть

Бенчмарки Qwen Uncensored отвечают на узкий вопрос, и ответ однозначен: удаление отказов из Qwen3.8 27B с помощью abliteration оставляет производительность в пределах ±1,3 пункта, при этом отказы на вредоносные запросы падают с 64–99% до 0–6%, чрезмерные отказы снижаются с 5,6% до 0,4%, а перплексия остаётся на уровне 6,96. Читайте эти цифры как «не отказывается», но никогда как «сильнее». Для исследований интерпретируемости, безопасности и red-team это именно тот инструмент, который описывает карточка модели. Для всего, что обращено к пользователю, это по построению неправильная модель.

Для законного использования в исследовательских целях веса находятся на Hugging Face под лицензией Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (GGUF-сборка для llama.cpp находится по адресу orcarouter/Qwen3.8-27B-Uncensored-GGUF).

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube