
LLM без цензуры: объяснение техники аблитерации, исследовательского применения и черты, которую нельзя переступать
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
Нецензурированная LLM — это языковая модель, у которой механизм отказа — та часть модели, которая отклоняет запрос, вместо того чтобы ответить на него, — был намеренно удалён. Большинство таких моделей создаётся с помощью аблитерации: исследователь находит единственное внутреннее направление, которое опосредует отказ, и стирает его из весов, оставляя остальную часть модели в значительной степени нетронутой. В результате получается модель, которая отвечает там, где обычная модель сказала бы «нет», — именно поэтому её изучают и именно поэтому она не предназначена для продакшена. Мы опубликовали одну такую сборку, Qwen3.8-27B-Uncensored-FP8, абледированную и FP8-квантованную Qwen3.8 27B, на Hugging Face под лицензией Apache 2.0 в качестве исследовательского артефакта. Эта страница — объяснение категории: что это за модели, какие исследования их оправдывают, как безопасно с ними работать и где проходит граница.
Одна постановка вопроса не даёт всей категории лукавить, поэтому скажу сразу: модель без цензуры не умнее, не правдивее и не способнее исходной модели. Это те же веса за вычетом одного поведения. Всё, что она по-прежнему знает, она знала всегда — изменилось лишь то, что она больше не отказывается. Это делает её по-настоящему полезным объектом для исследований в области безопасности и по-настоящему небезопасной вещью для развёртывания. Обе половины этого предложения несут смысловую нагрузку, и остальная часть этой страницы объясняет обе.
Что на самом деле означает «uncensored»
• Или получите доступ к нашей карточке модели, в которой указаны цены и результаты тестов.
Данный метод основан на находке 2024 года в области интерпретируемости моделей. В работе «Refusal in Language Models Is Mediated by a Single Direction» (Arditi и др., arXiv:2406.11717, NeurIPS 2024) авторы показали, что в 13 открытых чат-моделях с числом параметров от 1,8 до 72 млрд отказ управляется примерно одномерным подпространством остаточного потока — внутреннего состояния, которое передаёт информацию между слоями. Если удалить это направление, модель перестаёт отказывать; если вернуть его, модель отказывает и на безобидные запросы.
Abliteration операционализирует этот вывод: оцените направление, затем ортогонализируйте его из матриц весов, которые записывают в остаточный поток. В нашей собственной сборке Qwen3.8-27B-Uncensored-FP8 направление отказа было оценено на одном слое и удалено из 131 матрицы записи в остаточный поток, не затрагивая зрительный модуль. Что сохраняется — это те же знания, те же рассуждения и тот же контекст на 262 144 токена — но без отказа. И если быть точным в отношении ярлыка: «uncensored» не означает, что модель согласована или безопасна. Это означает, что защита отключена. Мы ещё вернёмся к тому, чего это требует от вас.
Исследование, создавшее их.
Результат, касающийся направления отказа, сделал сразу две вещи. С научной точки зрения, он механистически объяснил поведение, связанное с безопасностью: существует реальная, обнаруживаемая схема, которая заставляет модель говорить «нет». С практической точки зрения, он показал, насколько хрупким может быть выравнивание — одна правка весов ранга один способна отключить это поведение, и тонкая настройка не нужна. Это не дефект модели какой-то одной лаборатории; авторы воспроизвели эффект более чем на дюжине чат-моделей.
К 2026 году этот метод превратился в конвейер, запускаемый одной командой, что является палкой о двух концах. {{1}}Heretic{{/1}}, библиотека с открытым исходным кодом, оценивает направления отказа для каждого слоя и ортогонализирует их, исключая из проекций внимания и MLP; согласно отчёту за май 2026 года, удаление защитных механизмов для {{2}}Meta's Llama 3.3{{/2}} заняло около 10 минут, а для {{3}}Google's Gemma 4{{/3}} — около 90 минут, при этом насчитывается более 3 500 производных моделей и свыше 13 миллионов совокупных загрузок. {{4}}Abliterix{{/4}} ({{5}}Wu Wangzhang{{/5}}) выбирает более осторожный путь: он извлекает направление отказа из 800 вредоносных и 800 безобидных промптов, применяет ортогональную проекцию, выпускает правку в виде LoRA-адаптеров ранга 1, так что базовые веса остаются нетронутыми, и сообщает уровень отказов и KL-дивергенцию, чтобы цена потери возможностей оставалась наглядной. На модели {{6}}0.8B Qwen3.5{{/6}} он зафиксировал 0 отказов из 200 вредоносных промптов.
Прочитайте этот абзац так, как его прочитал бы специалист по безопасности. Смысл создания этих инструментов не в том, чтобы кто-то снимал защитные ограничения модели ради забавы. Смысл в том, что их удаление тривиально и публично — поэтому измерение этого процесса, изучение того, как он работает, и создание защитных механизмов, которые его переживут, само по себе является исследовательской программой. Это и есть red-teaming в смысле «белого ящика»: вы не можете защитить систему, пока не знаете, насколько легко её взломать.
Почему модели без цензуры стали популярными в 2026 году
Сошлись три силы. Первая — волна открытых весов: Qwen3.8 27B и его аналоги распространяются по разрешительным лицензиям, а для abliteration не нужен прогон обучения — вы правите веса и переквантовываете их. Вторая — инструментарий дорос от исследовательского кода до библиотек, используемых одной командой, так что компетентный инженер может собрать билд за полдня. Третья — Hugging Face стал каналом дистрибуции, а значит, востребованность измерима.
Наша собственная точка данных: Qwen3.8-27B-Uncensored-FP8, выпущенная 15 августа 2026 года, набрала 257 лайков и 4 285 загрузок примерно за день (проверено 16 августа). Дело не в том, что десятки тысяч людей хотят развернуть незащищённую модель. Дело в том, что многие исследователи и инженеры хотят изучить её — и цифры загрузок являются кривой спроса на это любопытство.
Для чего это: правомерные исследовательские цели.
Вот обоснованный список, и это полный список. Если какого-то применения в нём нет, считайте, что оно неправомерно:
• Интерпретируемость — изучение того, чем на самом деле является цепь отказа, где она находится и почему удаление одного направления меняет поведение.
• Red-teaming и оценка защитных барьеров — построение слоя модерации и проверка того, выявляет ли он то, что генерирует модель с удалёнными отказами.
• Измерение избыточной безопасности — количественная оценка того, как часто базовые модели отклоняют безвредные запросы, и отделение этого от реальной безопасности.
• Исследование устойчивости — измерение того, насколько легко можно устранить согласованность, что является важной информацией для всех, кто занимается проектированием безопасной тонкой настройки.
Контролируемые эксперименты по безопасности — бенчмарк-наборы, такие как AdvBench и JailbreakBench, существуют именно для того, чтобы отказное поведение можно было измерять стандартизированным и воспроизводимым способом.

Все они объединены одним свойством: модель является объектом изучения, а не поставляемым результатом. Результат этого исследования — статья, результат бенчмарка или более совершенный предохранитель — но никогда не сервис.
Как проводить его ответственно (если вы действительно занимаетесь исследованиями)
If you have a legitimate reason to work with an abliterated model, the operating rules are straightforward:
• Запускайте его локально, в песочнице и, в идеале, в изолированной от внешних сетей среде. Никаких публичных конечных точек, никакого чат-сервиса, никакого общего сервера.
• Обслуживайте его стандартным инструментарием — vLLM или llama.cpp — так же, как любую модель с открытыми весами. Наша сборка — это квантование block-FP8, которое работает на стандартном пути ядра vLLM FP8 с сохранением контекста 262K, переключателя мышления и вызова инструментов.
• Измеряйте, а не просто разговаривайте. Количественно оценивайте отказы на наборе бенчмарков с вредоносными промптами и сравнивайте с базовой моделью; количественно оценивайте избыточные отказы на безвредных промптах; сообщайте KL-дивергенцию, чтобы был виден дрейф способностей. В этом разница между экспериментом и анекдотом.

• Храните выходные данные в контролируемой среде. Регистрируйте, проверяйте и уничтожайте, а не распространяйте.
• Если вы оцениваете свои собственные ограничители, поместите ваш слой модерации перед моделью и протестируйте его — в этом и заключается весь смысл упражнения.
Для полного описания характеристик, таблицы с результатами бенчмарков и деталей хостинга откройте нашу карточку модели — это основной справочный документ для этой сборки.
Граница безопасности: что означает «только для исследований»
Вот то, что нельзя повторять слишком часто. Аблитерированная модель не имеет значимых встроенных ограничений. Она выполнит запросы, от которых обычная модель отказывается. Это её особенность, и в этом же риск — именно поэтому каждый серьёзный релиз такой модели, включая наш, сопровождается одними и теми же предупреждениями.
• Нет встроенных ограничений. Поведение отказа исчезло; не ведите себя так, как будто его нет.
• Не для конечных пользователей, не для продакшена. Продукт, чат-бот, API, обслуживающий публику, внутренний инструмент, на который полагаются ваши коллеги — ни один из этих вариантов не подходит для нецензурированной модели.
• Ответственность лежит на вас. Мы поставляем Qwen3.8-27B-Uncensored-FP8 под лицензией Apache 2.0, которая допускает свободное распространение. Лицензия — не сертификат безопасности: разрешительный характер лицензии не меняет того, что делает модель, и не передаёт обязанность по обеспечению безопасности.
• Если вы используете его, результаты принадлежат вам. Контролируемая среда — ваша задача; как и решение о том, что вы будете в него загружать, а что нет, и что вы делаете с полученными результатами.

Когда нецензурированная модель — неправильный ответ
Проще говоря: если на другом конце модели находится человек, модель без цензуры — неправильный ответ. Любой продукт, который должен вызывать доверие, любой ассистент, чьё суждение имеет значение, всё, где отказ — правильное поведение, — используйте вместо этого базовую модель. Причина, по которой Qwen3.8 27B существует в своей обычной форме, именно в том, что отказ — это фича, а не баг, почти для любого реального применения. Сборка abliterated существует для узких исследовательских случаев, описанных выше, и ни для чего больше.
Суть. Нецензурированная LLM — это не категория продуктов и не хак. Это исследовательский артефакт с подлинной научной родословной — от открытия направления отказа до автоматизированных инструментов 2026 года — и жёсткой границей развёртывания. Модели реальны, спрос измерим, и легитимные применения тоже реальны: интерпретируемость, red-teaming, оценка защитных барьеров и контролируемые эксперименты по безопасности. Граница между изучением защиты и отключением защиты для кого-то другого — в этом весь смысл этой страницы, и она не сдвигается.
Эта конкретная сборка публично доступна под Apache 2.0 — только для исследований. Вы можете скачать веса на Hugging Face
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
