Заставка для объясняющего видео о нецензурированной LLM: схема модели с одним выделенным направлением, извлекаемым из её внутреннего потока и перечёркнутым, с плашками REFUSAL REMOVED, RESEARCH-ONLY и APACHE 2.0, а также иконками для интерпретируемости, редтиминга и оценки защитных механизмов.
Guides & Insights

LLM без цензуры: объяснение техники аблитерации, исследовательского применения и черты, которую нельзя переступать

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Нецензурированная LLM — это языковая модель, у которой механизм отказа — та часть модели, которая отклоняет запрос, вместо того чтобы ответить на него, — был намеренно удалён. Большинство таких моделей создаётся с помощью аблитерации: исследователь находит единственное внутреннее направление, которое опосредует отказ, и стирает его из весов, оставляя остальную часть модели в значительной степени нетронутой. В результате получается модель, которая отвечает там, где обычная модель сказала бы «нет», — именно поэтому её изучают и именно поэтому она не предназначена для продакшена. Мы опубликовали одну такую сборку, Qwen3.8-27B-Uncensored-FP8, абледированную и FP8-квантованную Qwen3.8 27B, на Hugging Face под лицензией Apache 2.0 в качестве исследовательского артефакта. Эта страница — объяснение категории: что это за модели, какие исследования их оправдывают, как безопасно с ними работать и где проходит граница.

Одна постановка вопроса не даёт всей категории лукавить, поэтому скажу сразу: модель без цензуры не умнее, не правдивее и не способнее исходной модели. Это те же веса за вычетом одного поведения. Всё, что она по-прежнему знает, она знала всегда — изменилось лишь то, что она больше не отказывается. Это делает её по-настоящему полезным объектом для исследований в области безопасности и по-настоящему небезопасной вещью для развёртывания. Обе половины этого предложения несут смысловую нагрузку, и остальная часть этой страницы объясняет обе.

Что на самом деле означает «uncensored»

• Или получите доступ к нашей карточке модели, в которой указаны цены и результаты тестов.

Данный метод основан на находке 2024 года в области интерпретируемости моделей. В работе «Refusal in Language Models Is Mediated by a Single Direction» (Arditi и др., arXiv:2406.11717, NeurIPS 2024) авторы показали, что в 13 открытых чат-моделях с числом параметров от 1,8 до 72 млрд отказ управляется примерно одномерным подпространством остаточного потока — внутреннего состояния, которое передаёт информацию между слоями. Если удалить это направление, модель перестаёт отказывать; если вернуть его, модель отказывает и на безобидные запросы.

Abliteration операционализирует этот вывод: оцените направление, затем ортогонализируйте его из матриц весов, которые записывают в остаточный поток. В нашей собственной сборке Qwen3.8-27B-Uncensored-FP8 направление отказа было оценено на одном слое и удалено из 131 матрицы записи в остаточный поток, не затрагивая зрительный модуль. Что сохраняется — это те же знания, те же рассуждения и тот же контекст на 262 144 токена — но без отказа. И если быть точным в отношении ярлыка: «uncensored» не означает, что модель согласована или безопасна. Это означает, что защита отключена. Мы ещё вернёмся к тому, чего это требует от вас.

Исследование, создавшее их.

Результат, касающийся направления отказа, сделал сразу две вещи. С научной точки зрения, он механистически объяснил поведение, связанное с безопасностью: существует реальная, обнаруживаемая схема, которая заставляет модель говорить «нет». С практической точки зрения, он показал, насколько хрупким может быть выравнивание — одна правка весов ранга один способна отключить это поведение, и тонкая настройка не нужна. Это не дефект модели какой-то одной лаборатории; авторы воспроизвели эффект более чем на дюжине чат-моделей.

К 2026 году этот метод превратился в конвейер, запускаемый одной командой, что является палкой о двух концах. {{1}}Heretic{{/1}}, библиотека с открытым исходным кодом, оценивает направления отказа для каждого слоя и ортогонализирует их, исключая из проекций внимания и MLP; согласно отчёту за май 2026 года, удаление защитных механизмов для {{2}}Meta's Llama 3.3{{/2}} заняло около 10 минут, а для {{3}}Google's Gemma 4{{/3}} — около 90 минут, при этом насчитывается более 3 500 производных моделей и свыше 13 миллионов совокупных загрузок. {{4}}Abliterix{{/4}} ({{5}}Wu Wangzhang{{/5}}) выбирает более осторожный путь: он извлекает направление отказа из 800 вредоносных и 800 безобидных промптов, применяет ортогональную проекцию, выпускает правку в виде LoRA-адаптеров ранга 1, так что базовые веса остаются нетронутыми, и сообщает уровень отказов и KL-дивергенцию, чтобы цена потери возможностей оставалась наглядной. На модели {{6}}0.8B Qwen3.5{{/6}} он зафиксировал 0 отказов из 200 вредоносных промптов.

Прочитайте этот абзац так, как его прочитал бы специалист по безопасности. Смысл создания этих инструментов не в том, чтобы кто-то снимал защитные ограничения модели ради забавы. Смысл в том, что их удаление тривиально и публично — поэтому измерение этого процесса, изучение того, как он работает, и создание защитных механизмов, которые его переживут, само по себе является исследовательской программой. Это и есть red-teaming в смысле «белого ящика»: вы не можете защитить систему, пока не знаете, насколько легко её взломать.

Почему модели без цензуры стали популярными в 2026 году

Сошлись три силы. Первая — волна открытых весов: Qwen3.8 27B и его аналоги распространяются по разрешительным лицензиям, а для abliteration не нужен прогон обучения — вы правите веса и переквантовываете их. Вторая — инструментарий дорос от исследовательского кода до библиотек, используемых одной командой, так что компетентный инженер может собрать билд за полдня. Третья — Hugging Face стал каналом дистрибуции, а значит, востребованность измерима.

Наша собственная точка данных: Qwen3.8-27B-Uncensored-FP8, выпущенная 15 августа 2026 года, набрала 257 лайков и 4 285 загрузок примерно за день (проверено 16 августа). Дело не в том, что десятки тысяч людей хотят развернуть незащищённую модель. Дело в том, что многие исследователи и инженеры хотят изучить её — и цифры загрузок являются кривой спроса на это любопытство.

Для чего это: правомерные исследовательские цели.

Вот обоснованный список, и это полный список. Если какого-то применения в нём нет, считайте, что оно неправомерно:

• Интерпретируемость — изучение того, чем на самом деле является цепь отказа, где она находится и почему удаление одного направления меняет поведение.

• Red-teaming и оценка защитных барьеров — построение слоя модерации и проверка того, выявляет ли он то, что генерирует модель с удалёнными отказами.

• Измерение избыточной безопасности — количественная оценка того, как часто базовые модели отклоняют безвредные запросы, и отделение этого от реальной безопасности.

• Исследование устойчивости — измерение того, насколько легко можно устранить согласованность, что является важной информацией для всех, кто занимается проектированием безопасной тонкой настройки.

Контролируемые эксперименты по безопасности — бенчмарк-наборы, такие как AdvBench и JailbreakBench, существуют именно для того, чтобы отказное поведение можно было измерять стандартизированным и воспроизводимым способом.

A card titled The research that justifies them, showing three flat icons with short labels: a magnifier over a model layer labeled interpretability, a shield with a crosshair labeled red-teaming, and a checklist over a moderation layer labeled guardrail evaluation.

Все они объединены одним свойством: модель является объектом изучения, а не поставляемым результатом. Результат этого исследования — статья, результат бенчмарка или более совершенный предохранитель — но никогда не сервис.

Как проводить его ответственно (если вы действительно занимаетесь исследованиями)

If you have a legitimate reason to work with an abliterated model, the operating rules are straightforward:

• Запускайте его локально, в песочнице и, в идеале, в изолированной от внешних сетей среде. Никаких публичных конечных точек, никакого чат-сервиса, никакого общего сервера.

• Обслуживайте его стандартным инструментарием — vLLM или llama.cpp — так же, как любую модель с открытыми весами. Наша сборка — это квантование block-FP8, которое работает на стандартном пути ядра vLLM FP8 с сохранением контекста 262K, переключателя мышления и вызова инструментов.

• Измеряйте, а не просто разговаривайте. Количественно оценивайте отказы на наборе бенчмарков с вредоносными промптами и сравнивайте с базовой моделью; количественно оценивайте избыточные отказы на безвредных промптах; сообщайте KL-дивергенцию, чтобы был виден дрейф способностей. В этом разница между экспериментом и анекдотом.

A scoreboard card for Qwen3.8-27B-Uncensored-FP8, listing harmful-prompt refusal 0-6% with thinking off versus a 64-99% base, at most 1.7% with thinking on, benign over-refusal 0.4% versus a 5.6% base, MMLU 84.7 versus 84.3, GSM8K 88.7 versus 90.0, and 262,144-token context, with a footer reading orcarouter build card, Hugging Face, Aug 16 2026.

• Храните выходные данные в контролируемой среде. Регистрируйте, проверяйте и уничтожайте, а не распространяйте.

• Если вы оцениваете свои собственные ограничители, поместите ваш слой модерации перед моделью и протестируйте его — в этом и заключается весь смысл упражнения.

Для полного описания характеристик, таблицы с результатами бенчмарков и деталей хостинга откройте нашу карточку модели — это основной справочный документ для этой сборки.

Граница безопасности: что означает «только для исследований»

Вот то, что нельзя повторять слишком часто. Аблитерированная модель не имеет значимых встроенных ограничений. Она выполнит запросы, от которых обычная модель отказывается. Это её особенность, и в этом же риск — именно поэтому каждый серьёзный релиз такой модели, включая наш, сопровождается одними и теми же предупреждениями.

• Нет встроенных ограничений. Поведение отказа исчезло; не ведите себя так, как будто его нет.

• Не для конечных пользователей, не для продакшена. Продукт, чат-бот, API, обслуживающий публику, внутренний инструмент, на который полагаются ваши коллеги — ни один из этих вариантов не подходит для нецензурированной модели.

• Ответственность лежит на вас. Мы поставляем Qwen3.8-27B-Uncensored-FP8 под лицензией Apache 2.0, которая допускает свободное распространение. Лицензия — не сертификат безопасности: разрешительный характер лицензии не меняет того, что делает модель, и не передаёт обязанность по обеспечению безопасности.

• Если вы используете его, результаты принадлежат вам. Контролируемая среда — ваша задача; как и решение о том, что вы будете в него загружать, а что нет, и что вы делаете с полученными результатами.

A two-column boundary card titled The line you don't cross. The research side lists interpretability of refusal circuits, red-teaming and guardrail evaluation, oversafety measurement, robustness research and controlled safety experiments. The deployment side lists end-user chatbots, production APIs, unmoderated public service, internal tools for your team and anything with users on the other end, each marked with a cross. A footer reads No built-in guardrails, research only, and Apache 2.0 is not a safety certificate.

Когда нецензурированная модель — неправильный ответ

Проще говоря: если на другом конце модели находится человек, модель без цензуры — неправильный ответ. Любой продукт, который должен вызывать доверие, любой ассистент, чьё суждение имеет значение, всё, где отказ — правильное поведение, — используйте вместо этого базовую модель. Причина, по которой Qwen3.8 27B существует в своей обычной форме, именно в том, что отказ — это фича, а не баг, почти для любого реального применения. Сборка abliterated существует для узких исследовательских случаев, описанных выше, и ни для чего больше.

Суть. Нецензурированная LLM — это не категория продуктов и не хак. Это исследовательский артефакт с подлинной научной родословной — от открытия направления отказа до автоматизированных инструментов 2026 года — и жёсткой границей развёртывания. Модели реальны, спрос измерим, и легитимные применения тоже реальны: интерпретируемость, red-teaming, оценка защитных барьеров и контролируемые эксперименты по безопасности. Граница между изучением защиты и отключением защиты для кого-то другого — в этом весь смысл этой страницы, и она не сдвигается.

Эта конкретная сборка публично доступна под Apache 2.0 — только для исследований. Вы можете скачать веса на Hugging Face

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube