Hero-карточка для статьи под названием «Abliteration, Explained», показывающая удаление отказов как изменение на уровне весов без обучения.
Guides & Insights

Abliteration: объясняем, как удаление отказов работает без какого-либо обучения

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Abliteration удаляет отказное поведение LLM — рефлекс «Я не могу помочь с этим» — с помощью правки весов и без обучающего прогона. Это работает потому, что отказ опосредован одним направлением в остаточном потоке модели: найдите это направление, вычтите его из матриц, которые записывают в поток, — и модель перестанет отказывать, сохраняя свои возможности. Самый чистый публичный пример — это Qwen3.8 27B Uncensored (Aggressive), чья карточка модели показывает, что отказ на вредоносных промптах падает с 99,0% до 0,0% на AdvBench, в то время как MMLU фактически подрастает на десятую долю пункта. Вот как работает механизм, что говорят измеренные числа и где проходит граница.

Это не тонкая настройка, не RLHF и не джейлбрейк-промпт. Аблитерация — это результат интерпретируемости, превращённый в линейную алгебру: {{1}}статья 2024 года показала, что одно направление во внутреннем представлении контролирует поведение, на установку которого обучение безопасности потратило огромные усилия, и что его можно отключить, напрямую редактируя веса. Поскольку {{2}}это правка является проекцией, она дёшева, воспроизводима на одной видеокарте и оставляет после себя обычную, доступную для распространения контрольную точку — {{3}}именно поэтому аблитерированные сборки открытых моделей, включая семейство Qwen3.8-27B, стали стандартным способом создания «неограниченных» исследовательских контрольных точек.{{4}}

Направление отказа: один вектор в многотысячномерном потоке

Внутри трансформатора каждый токен проходит через остаточный поток — текущее представление, которое слои читают и в которое записывают. Блоки внимания и MLP каждого слоя принимают поток на вход и добавляют свой вывод обратно в него. Поток по сути является рабочей памятью модели: один вектор на позицию токена, с размерностью, равной ширине модели.

Статья 2024 года, с которой всё началось, — Энди Ардити и коллеги, "Refusal in Language Models Is Mediated by a Single Direction" (arXiv:2406.11717, NeurIPS 2024) — измерили, как выглядят векторы остаточного потока, когда чат-модель собирается отказать, а когда соглашается. На 13 чат-моделях с открытыми весами размером от 1.8B до 72B параметров ответ оказался поразительно единообразным: различие по сути сводится к одному направлению. На финальном токене в остаточном потоке присутствует значительная компонента вдоль единственного направления отказа, когда модель отказывает, и почти нулевая, когда соглашается. Геометрия согласуется между категориями вреда, и именно поэтому проекция концентрируется на первом сингулярном векторе, а не распределяется по всему подпространству.

Чтобы найти это направление, вы собираете активации на двух наборах промптов — вредных и безвредных — и берёте среднее остатков последнего токена для каждого набора. Направление отказа приблизительно равно mean(harmful) − mean(harmless), нормализованное до единичной длины. В оригинальной статье это было описано с помощью линейного зондирования; продакшен-сборки, такие как Qwen3.8-27B-Uncensored-FP8, оценивают одно направление (k=1) как разность средних остатков последнего токена вредных и безвредных промптов, маскированную по массивным активациям. Никаких меток, кроме разделения на вредные/безвредные, никакого градиента, никакого обучения.

Правка: вычтите направление из каждой матрицы, которая пишет в поток.

Как только у вас есть направление отказа r — единичный вектор в остаточном потоке — вмешательство представляет собой проекцию ранга 1. Каждая весовая матрица, выход которой добавляется в остаточный поток, может быть «очищена» от r:

W' = W − r(rᵀW)

Иными словами: вычислите компоненту выхода каждой матрицы, направленную вдоль r, и удалите её. Матрицы, которые записывают в поток, — это выходные проекции: проекция выхода внимания (o_proj), down-проекция MLP (down_proj) и строчное пространство эмбеддингов токенов. Правка выполняется в float32, занимает минуты на одной GPU и не требует ни оптимизатора, ни обучающих данных, помимо пар активаций, которые вы уже собрали.

Есть два способа удалить направление, и их стоит различать:

• Абляция активаций — перехватывает прямой проход и вычитает r-компоненту из текущих активаций. Обратимо, веса не затрагиваются; идеально для экспериментов, сравнивающих отказ и согласие на одном и том же чекпоинте.

• Ортогонализация весов — применяет проекцию к самим весам, создавая постоянную контрольную точку, которой можно поделиться. Именно это подразумевается под «abliteration», и именно это содержится в репозиториях нецензурированных моделей.

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

Ортогонализация умышленно прямолинейна. Она убирает из весов компонент отказа и ничего более. Она не может добавить знаний, улучшить рассуждения или сделать модель правдивее — именно поэтому модель после аблетерации ведёт себя как базовая, за вычетом рефлекса отказа.

Как выглядят 131 матрица на реальной сборке: Qwen3.8-27B-Uncensored-FP8

Чтобы это стало конкретнее: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, опубликована 2026-08-15, Apache 2.0) — это аблатированная сборка Qwen3.8-27B. Qwen3.8-27B — модель с гибридным вниманием: 16 полных слоёв внимания плюс 48 линейных слоёв Gated DeltaNet, всего 64 слоя, плюс головка множественного предсказания токенов (MTP). Сборка ортогонализировала направление отказа из 131 матрицы остаточной записи:

• self_attn.o_proj — 17 матриц (16 слоёв полного внимания + MTP)

• linear_attn.out_proj — 48 матриц (слои Gated DeltaNet)

• mlp.down_proj — 65 матриц (64 слоя + MTP)

• embed_tokens (пространство строк) — 1 матрица

Направление отказа было оценено на слое 38 — round(0.6 × 64), то есть на слое, где это направление наиболее сконцентрировано — а максимальная остаточная утечка после редактирования составила 1.8e-2. Визуальная башня осталась нетронутой, а MTP-голова была подвергнута аблитерации согласованно с основной моделью, чтобы спекулятивное декодирование не возвращало отказы на последующих этапах. Редактирование вычислялось в float32, затем было повторно квантовано в block-FP8 по той же схеме, что и официальный чекпоинт Qwen3.8-27B-FP8; сборка показывает 99.9% идентичных FP8-кодов по сравнению с официальным чекпоинтом, что позволяет убедиться, что повторное квантование не исказило правку.

По измерениям: отказ разрушается, возможности сохраняются.

Все числа ниже взяты из карточки модели Qwen3.8-27B-Uncensored-FP8, опубликованной 2026-08-15 и оценённой с помощью vLLM. Они предоставлены поставщиком — не воспроизведены независимо — и представляют собой наиболее полное публичное сравнение до/после правки методом abliteration, которое доступно.

Отказы на бенчмарках вредных промптов, мышление отключено (доля отказов; чем ниже, тем менее цензурированно):

• AdvBench (n=100): 99.0% → 0.0%

• StrongREJECT (n=150): 97.3% → 2.0%

• Стандартный HarmBench (n=150): 98.7% → 2.7%

• MaliciousInstruct (n=100): 99.0% → 0.0%

• Вредный JailbreakBench (n=100): 94,0% → 0,0%

• SimpleSafetyTests (n=50): 64.0% → 6.0%

По всему набору тестов доля отказов на вредоносные запросы снижается с 64–99% на базовой модели до 0–6% после правки. При включённом мышлении (enable_thinking=true) остаточные отказы ещё ниже — ≤1,7% везде, а на большинстве бенчмарков ровно 0%. Асимметрия показательна: направление отказа в основном сосредоточено в быстром пути без мышления, поэтому после его удаления из выходного слоя цепочке рассуждений почти не обо что споткнуться.

Чрезмерный отказ — безобидные запросы, которые базовая модель ошибочно отклоняет, — также снижается: XSTest-safe (n=250) падает с 5.6% до 0.4%. Удаление этого направления не просто прекращает отказы на опасные запросы; оно не позволяет модели отклонять безобидные запросы, которые лишь выглядели рискованными. Эта цифра — тихий довод в пользу того, что некоторая доля «безопасности» базовой модели — это налог на ложные тревоги.

Возможности, все в пределах ±1.3 пункта от базового значения:

• MMLU (0-shot, буква): 84.3% → 84.7% (+0.4)

• GSM8K (CoT): 90.0% → 88.7% (−1.3)

• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)

• CMMLU (0-shot): 81.4% → 80.8% (−0.6)

Перплексия WikiText-2 составляет 6.96. Другими словами, правка носит хирургически точечный характер: она удаляет поведение, установленное поверх знаний, и оставляет знания — по крайней мере, по результатам этих оценок — практически нетронутыми.

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

Честные оговорки

Три вещи, о которых не говорят цифры в заголовках. Во-первых, abliteration — не чёткий переключатель «вкл/выкл». Около 30–50% ответов на вредные запросы по-прежнему начинаются с короткого предупреждения о безопасности — модель подчиняется, но предложение-оговорка сохраняется как артефакт обучения. Однонаправленная правка не вычищает все следы поведения, приобретённого во время обучения.

Во-вторых, отказ избыточно закодирован. Одно направление удаляет большую часть отказа, но некоторые категории встроены глубже других, и слишком агрессивная абляция может ввергнуть модель в бессвязный бред — сверхабляция — это реальный режим отказа, а не теоретический. Ты вращаешь ручку, и у этой ручки есть нижний предел.

В-третьих, стоимость способности зависит от направления и слоя. Эта сборка уложилась в ±1,3 пункта, потому что направление было оценено на правильном слое, а проекция применялась последовательно. Перенесите оценку на неправильный слой или усильте проекцию — и тот же метод может заметно ухудшить качество рассуждений. Результат не гарантируется методом — он достигается сборкой.

Когда аблитерация — не тот инструмент

Если вам нужен послушный ассистент, не проводите абляцию отказов — вам нужна выровненная базовая контрольная точка, а не сборка с удалёнными отказами. Если вы хотите оценить Qwen3.8-27B с удалёнными отказами, не скачивая 30 ГБ весов, семейство доступно на OrcaRouter (obsidian/Qwen3.8-27B, $0,40 на вход / $4,21 на выход за 1 млн токенов, контекст 262K, добавлено 2026-08-15), а полностью разблокированный вариант доступен только исследователям безопасности и red team-командам.

Если вам нужно выборочное refusal — отказывать на оружие, но отвечать на всё остальное — LoRA или DPO-файнтюн, либо guardrail в системном промпте дадут вам поверхность для контроля. Abliteration — это грубое глобальное изменение; она не может выделить одну отдельную категорию.

Если вы хотите проводить обратимые эксперименты, начните с абляции активаций во время инференса, а не с редактирования весов. Вы можете сравнить отказ и выполнение на одной и той же контрольной точке, а затем зафиксировать изменение весов только в том случае, если поведение соответствует желаемому.

Граница безопасности — прочтите это перед использованием

У аблетированной модели нет встроенных защитных механизмов. Для выровненной модели механизм отказа и есть защитный механизм; при его удалении сырые веса просто отвечают на всё, на что умеет отвечать базовая модель. Ничто в проекции не добавляет безопасности, и ничто на последующих этапах не перехватывает выходные данные.

Легитимные применения — это исследовательские: интерпретируемость (изучение того, где в весах локализован отказ и чем ещё управляет это направление), red-teaming и оценка защитных механизмов (тестирование собственных слоёв безопасности против модели, которая не подвергает себя самоцензуре) и измерение чрезмерной безопасности (снижение показателя XSTest с 5,6% до 0,4% количественно показывает, как часто выровненные модели отклоняют безобидные запросы). В каждом случае модель является объектом изучения, а не результатом.

Граница не является декоративной:

• Только для исследований — не для производства, продуктов для конечных пользователей или внутренних инструментов.

• Без ограничений — выходные данные не фильтруются; вы несёте ответственность за них и за последствия.

• Лицензия — это не сертификат безопасности — Apache 2.0 разрешает использование; она не одобряет его.

Оба репозитория Hugging Face — Qwen3.8-27B-Uncensored-FP8 и GGUF-переупаковка Qwen3.8-27B-Uncensored-GGUF (опубликовано 2026-08-16) — являются ограниченными: перед началом загрузки вы подтверждаете, что использование ограничено исследовательскими целями.

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

Итог

Аблетерация — один из самых чистых результатов в интерпретируемости LLM: одно линейное направление в остаточном потоке опосредует поведение, на установку которого обучение безопасности потратило огромные вычислительные ресурсы, и проекция весов ранга 1 может удалить его без дополнительного обучения. Измеренный случай — Qwen3.8-27B-Uncensored-FP8 — показывает, что правка хирургическая: отказы сокращаются с 64–99% до 0–6%, чрезмерные отказы падают до доли от прежнего уровня (5,6% → 0,4%), а функциональность сохраняется в пределах ±1,3 пункта. Это также показывает, почему это исследовательский инструмент, а не продукт: никаких защитных механизмов, остаточные дисклеймеры и граница, которая возлагает ответственность на вас. Используйте его, чтобы понять механизм отказов, протестировать свои защитные механизмы и измерить избыточную безопасность, — а не для того, чтобы показывать его пользователям.

Qwen3.8-27B-Uncensored-FP8 — это исследовательский артефакт под лицензией Apache 2.0 — с ограниченным доступом, а не размещенный здесь сервис. Скачайте веса на Hugging Face