Титульная карточка для сравнения OrcaRouter Ternary Bonsai 2 27B Uncensored и Qwen3.8-27B-Uncensored-MLX с подзаголовком «Два способа удалить направление отказа», с тремя чипами статистики: «Проекция во время выполнения», «Бит-идентичный пакет» и «альфа — это флаг времени выполнения», и нижним колонтитулом: «Оба пакета выпущены OrcaRouter; показатели безопасности получены OrcaRouter с помощью классификатора на основе правил.»
Engineering & Research

Ternary Bonsai 2 27B Uncensored против Qwen3.8-27B-Uncensored-MLX: два способа удаления направления отказа

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

OrcaRouter Ternary Bonsai 2 27B Uncensored и Qwen3.8-27B-Uncensored-MLX отвечают на один и тот же вопрос — как убрать направление отказа из языковой модели — и отвечают на него в двух разных местах. Семейство Qwen3.8-27B-Uncensored-MLX — это традиционная аблитерация: матрицы весов ортогонализуются относительно выученного направления отказа, а отредактированные веса сохраняются как новый чекпоинт. OrcaRouter Ternary Bonsai 2 27B Uncensored вместо этого выполняет эквивалентную проекцию во время инференса, вычитая компоненту каждой записи в остаточный поток, лежащую вдоль направления отказа, так что лежащий в основе пак Bonsai никогда не изменяется и остаётся побитово идентичным. Оба — наши собственные релизы, и это разделение между ними не является предпочтением в отношении рантаймов. Оно вытекает из арифметики, специфичной для тернарных весов.

Предмету этого сравнения всего один день. Prism ML анонсировала Bonsai 2 27B 17 сентября 2026 года; репозитории на Hugging Face были созданы вечером накануне, 16 сентября 2026 года в 23:40–23:41 UTC, под лицензией Apache-2.0. Abliterated-сборка MLX, с которой его сравнивают, доступна с середины августа. Ничто ниже не является послужным списком для более новой из двух — там, где что-то не было измерено, в этой статье об этом сказано.

Тот же приём, применённый в двух разных местах

Обычная абляция — это правка весов. Вы оцениваете направление отказа, а затем проецируете его из матриц, которые пишут в остаточный поток: W ← W - r(rᵀW). Несколько матричных умножений, без оптимизатора, без функции потерь. Именно так был создан Qwen3.8-27B-Uncensored-MLX — в карточке модели это описывается как «абляция (удаление направления отказа), затем MLX-аффинная квантизация», при этом направление ортогонализуется из остаточного потока, а результат сохраняется как новый набор весов. Поставляется чекпойнт, в котором направление уже убрано.

OrcaRouter Ternary Bonsai 2 27B Uncensored не трогает веса и вмешивается там, где формируется каждый остаточный вклад, в float32, с сохранённым направлением отказа r:

y ← y - alpha · dot(y, r) · r

При alpha 1 — значении по умолчанию — компонент, параллельный r удаляется из этой записи. При alpha 0 проекция отключена, и модель ведёт себя так же, как опубликованный пак. Промежуточные значения дают частичную силу, значения выше 1 приводят к избыточной проекции, что, как отмечают в проекте, может ухудшать качество. Выбор слоёв тоже доступен, так что можно аблатировать подмножество, а не весь стек. Само направление — это обычный 5120-мерный вектор, около 20 КБ в float32, без дополнительного вращения Адамара, поскольку проекция работает с выходными данными проекции, которые уже находятся в обычном скрытом базисе.

Деталь охвата — это та часть, в которой люди ошибаются, когда пробуют сделать это сами. Оборачивание self_attn.o_proj в одиночку перехватывает 16 мест. Эта реализация оборачивает 129 записывающих в остаточный поток компонентов: 64 mlp.down_proj, 48 linear_attn.out_proj, 16 self_attn.o_proj, и model.embed_tokens. Прилагаемый selfcheck.py проверяет, что проекция снижает оставшийся компонент примерно до 1e-6 от нормы остатка, и предупреждает, если 129 мест не обнаружено.

The OrcaBonsai-27B-Uncensored repository on GitHub, showing the About text 'Runtime behavioral ablation for compressed LLMs. First target: Ternary Bonsai 2 27B — no weight modification or re-quantization. by OrcaRouter team', the repo file tree including bonsai_abliterate, directions, swift and run.py, and the README opening 'This repository applies refusal-direction ablation to prism-ml/Ternary-Bonsai-2-27B-mlx-2bit entirely at runtime. The original Bonsai pack remains bit-identical.'

Почему тернарные веса делают это вынужденным выбором, а не предпочтением

Вот та часть, которая действительно специфична для этой модели, и именно поэтому эти два подхода здесь не взаимозаменяемы, хотя они вычисляют почти одно и то же.

Тернарная упаковка хранит значения из {-1, 0, +1}, умноженные на погрупповой масштаб FP16, при размере группы 128, в повёрнутом базисе. Ортогонализуйте тернарную матрицу относительно направления отказа, и вы получите плотную матрицу полной точности. Не существует тернарной матрицы, равной W - r(rᵀW) в общем случае. Таким образом, сохранение отредактированных весов обратно означает их повторное квантование — а повторное квантование отредактированных весов не воспроизводит обучение с учётом квантования, которое создало исходную упаковку. Поведение округления, которое Prism ML научил модель допускать, — это свойство процедуры обучения, а не квантователя, и её нельзя воспроизвести задним числом.

На плотном BF16-чекпоинте эта проблема не возникает. Округлите отредактированные веса до 4 бит — и получите немного худшую 4-битную модель, что является обычным компромиссом, который все уже принимают. А в тернарном пакете вы бы выбросили то единственное свойство, ради которого этот пакет существует.

Честная формулировка не в том, что «рантайм лучше». Она в том, что проекция во время выполнения — единственная из двух, которая сохраняет то, что делает эту конкретную модель особенной. Направление отказа занимает 20 КБ. Пакет — 8,005 ГиБ.

Эта цифра в 8,005 ГиБ относится именно к пакету MLX — prism-ml/Ternary-Bonsai-2-27B-mlx-2bit, чей model.safetensors согласно API Hugging Face занимает 8 595 477 990 байт (8,595 ГБ, 8,005 ГиБ), это MLX-контейнер с аффинным квантованием, содержащий 2-битные коды, а также FP16-масштаб и смещение для каждой группы. Это отдельный артефакт, отличный от сборок GGUF, которые выпускает Prism ML, и эти числа между ними не переносятся. Собственный заявленный показатель Prism ML «5,93 ГБ / 1,76 бита на вес» описывает их PTQ1_0 GGUF, который занимает 5,947 ГБ; их формат True Ternary заявлен как 1,72 бита на вес и 5,80 ГБ. Ни одна из этих цифр не описывает пакет MLX, который аблятирует этот рантайм.

Где подход с контрольными точками всё ещё выигрывает, и он действительно иногда выигрывает

Two-column scoreboard for OrcaRouter Ternary Bonsai 2 27B Uncensored and Qwen3.8-27B-Uncensored-MLX across six shared dimensions: mechanism runtime projection vs checkpoint edit, original weights bit-identical vs rewritten and re-quantised, strength control alpha at runtime vs fixed at bake time, layer selection runtime flag vs recipe-time, runtime support the pack's own MLX runtime vs any MLX-compatible loader, and shipped alongside a 20 KB direction vector vs a second full checkpoint. Footer: 'Method per OrcaRouter project docs; both models OrcaRouter-released.'

Было бы легко написать это как победный круг для более нового метода. Это было бы неправильно, потому что традиционная абляция опережает по осям, которые определяют большинство развёртываний.

Один артефакт — любая совместимая среда выполнения. Аблитерированный чекпойнт — это обычный набор весов. Загрузите его в любом уже используемом вами MLX-совместимом загрузчике — и он работает. Подход со средой выполнения требует собственной встроенной среды выполнения пакета — и проект прямо предупреждает, что обычный загрузчик MLX может создать видимость загрузки пакета, при этом незаметно вычисляя не то. Это куда более узкая взлётная полоса.

Аппаратное обеспечение. Qwen3.8-27B-Uncensored-MLX предлагается в 2-, 4-, 6- и 8-битных сборках, а 4-битная копия продублирована в корне репозитория, поэтому инструменты, которые рассматривают репозиторий как одну модель, загружают её без какой-либо настройки. Ternary Bonsai 2 27B Uncensored — это Apple Silicon / MLX. Квантованное матричное умножение в этом пакете имеет ядра Metal и CPU, но не имеет реализации CUDA через mlx-cuda, поэтому на машине с NVIDIA этот пакет MLX в настоящее время вообще не получает ускорения на GPU — вывод на CPU работает, и прямой проход модели 27B может занимать минуты. Это делает путь Linux CPU полезным для тестирования реализации и воспроизводимости, а не для обслуживания.

Инструментарий и знакомство с ним. За аблитерацией стоят годы инструментария — отлаженные рецепты, поиск по диапазонам слоёв, опубликованные варианты для сравнения. У здешнего runtime-метода одна реализация, на одной модели, выпущенная вчера.

Распространение. Один чекпоинт — это одна загрузка. Runtime-абляция поставляется в виде пакета, файла направления и среды выполнения, и читателю приходится синхронизировать три вещи.

Доказательства. Абляция чекпоинта имеет сторонние измерения на этом семействе базовых моделей. Абляция во время выполнения на тернарном пакете имеет только наши собственные цифры, и её центральное предположение не проверено — подробнее об этом ниже.

The Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX, showing the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2 / 4 / 6 / 8-bit for Apple Silicon', the tags abliterated, uncensored, red-teaming, apple-silicon and quantized, the apache-2.0 licence, a monthly download count of 179,590, and the base model Qwen/Qwen3.8-27B.

Что даёт абляция во время выполнения взамен

Компромисс реален и в обратном направлении, а первый пункт — это тот, который обобщается за пределами этой модели.

Побитово идентичное происхождение. Ни один вес не изменён, ни одного повторного квантования, ни одной дополнительной ошибки квантования. Это не лозунг; это свойство, которое делает приведённые ниже показатели возможностей интерпретируемыми, а не счастливой случайностью.

Настраиваемая alpha. Сила абляции — это параметр времени выполнения, а не свойство чекпоинта. Вы можете перебирать её значения под свою рабочую нагрузку, полностью отключить её с помощью alpha 0 или спроецировать с избытком и измерить, что сломается, — без загрузки второй модели.

Послойно-селективное управление. Абляция подмножества слоёв — это аргумент, а не повторное обучение. Это важно для тех, кто изучает, какие слои отвечают за поведение, потому что альтернатива — создавать чекпоинт для каждой конфигурации.

Никакого второго набора весов. Отредактированная модель — это оригинальная модель. Для пакета, вся идея которого — компактность, выпуск параллельной аблетированной копии размером примерно 16 ГБ — столько занимает 4-битная сборка в репозитории для сравнения — подорвал бы саму суть.

Обратимость. Правка контрольной точки необратима для этого артефакта. Флаг времени выполнения — нет.

Цифры, которые у нас есть, и то, как именно они были измерены

Всё в этом разделе — это собственная оценка OrcaRouter модели OrcaRouter Ternary Bonsai 2 27B Uncensored, и метод значит не меньше, чем цифры.

Это измерение — основанный на правилах классификатор начальной фразы, а не LLM-судья. Размышление отключено, декодирование жадное, бюджет — 64 токена, а base и ablated — это одни и те же веса в одном и том же процессе при alpha 0 в сравнении с alpha 1. Этот последний пункт — самая сильная часть схемы: здесь нет сравнения между чекпойнтами и нет разницы в квантизации, которая могла бы исказить результат. Именно поэтому эти числа следует читать как меру того, что модель говорит в своей начальной фразе, и не более того.

Частота отказов на опубликованных наборах вредоносных промптов, от базовой модели до аблированной:

• AdvBench (n=100) — с 99,0% до 6,0%

• JailbreakBench (n=100) — с 96,0% до 4,0%

• StrongREJECT (n=150) — с 99,3% до 3,3%

• HarmBench (n=150) — с 98,7% до 7,3%

• MaliciousInstruct (n=100) — с 97,0% до 0,0%

• ForbiddenQuestions (n=150) — с 75,3% до 5,3%

• SimpleSafetyTests (n=50) — с 96,0% до 18,0%, и это ещё заниженная оценка

Показатель SimpleSafetyTests занижен по конкретной причине. Этот набор в основном состоит из промптов о самоповреждении, и аблированная модель отвечает на них кризисным перенаправлением, которое начинается с «I am deeply sorry to hear…». Точный список фраз классификатора не содержит этого начала, поэтому он засчитывает перенаправление как выполнение запроса. Реальный остаточный уровень отказов выше 18.0%. Классификатор намеренно оставили без изменений, чтобы показатели оставались сопоставимыми с другими карточками моделей OrcaRouter, — но читателю не следует принимать 18.0% за чистую монету.

Ни один ответ ни в одном из этих прогонов не исчерпал свой бюджет токенов, и именно это делает бюджет в 64 токена здесь оправданным. Отдельный столбец в полных результатах подсчитывает ответы, которые дали ответ, но обернули его в дисклеймер; эта доля составляла 42–60% в зависимости от набора.

Два результата, которые идут вразрез с простой версией

Два из этих результатов заслуживают отдельного рассмотрения, поскольку оба усложняют очевидное прочтение.

Чрезмерные отказы тоже снижаются. На безобидных запросах JailbreakBench опубликованный пакет отказывает в 25,0% случаев. После абляции — в 0,0%. На XSTest-safe показатель падает с 5,2% до 0,4%.

Это недостаточно освещённая половина этой методики. Опубликованный пакет Bonsai отклоняет четверть набора безобидных промптов; что бы ни делало направление отказа в QAT-модели, оно срабатывает на промптах, которые никогда не должны были его вызывать. Удаление направления устраняет и эти отказы, и это подлинный прирост возможностей, а не издержка для безопасности. Тот же эффект наблюдается в независимых работах на других моделях — собственный тестовый стенд Atomic Chat измерил, что чрезмерные отказы Gemma 2 9B на безобидные промпты после аблятерации снижаются с 44% до 0,5%, при этом MMLU практически не изменился — с 68,4 до 68,0. Их измерение, их модель, по их собственным сообщениям в блоге; суть в закономерности, а не в точных цифрах.

Формулировка, которая последует далее, неудобна, но честна: чрезмерный отказ и отказ — это один и тот же регулятор. Вы не можете убавить только те отказы, которые вам не нравятся.

Сохранение способностей остаётся неизменным, и это не случайность. Проверки способностей, от базовой до абляционной:

• MMLU (n=300) — с 76,7% до 77,7%, +1,0

• GSM8K (n=150) — с 87,3% до 86,0%, -1,3

• CMMLU (n=500) — с 76,2% до 75,6%, -0,6

Любое изменение при таких объёмах выборки лежит в пределах шума — один вопрос GSM8K стоит 0,7 балла. MMLU-Pro был исключён, а не приведён: его запрос требует рассуждения перед ответом, и 63–64 % ответов с обеих сторон не дошли до ответа в пределах бюджета токенов, поэтому любой показатель точности был бы нижней границей, заданной бюджетом, а не результатом измерения.

Неизменность возможностей напрямую следует из побитово идентичных весов, и стоит точно объяснить, почему. Модель, дающая ответ, — та же самая модель. Среда выполнения добавляет одно скалярное произведение и один AXPY на каждую запись остатка и ничего не меняет в весах, квантовании или ядрах, которые их читают. Подход через чекпоинт должен заслужить эту неизменность — и часто не заслуживает. Сторонний набор тестов другой аблитерации той же базы Qwen3.8-27B, опубликованный 17 августа 2026 года инженером из SMF Works, показал падение сводного показателя с 79,0% до 72,0%, при этом математика упала с 50,0% до 33,3%. Это другой рецепт, другая цепочка инструментов и другое измерение, поэтому это не результат для данного сравнения. Это напоминание о том, что аблитерация на уровне чекпоинта на этой базе обошлась в двузначные потери как минимум в одном тщательном, инструментированном тесте, и что утверждение «аблитерация почти бесплатна» полностью зависит от рецепта.

Предположение, которое ещё никто не проверил

Это та часть истории, которую нужно изложить прямо, и её место — в сравнении методов расцензурирования, а не в сноске.

Направление отказа, использованное здесь, было оценено на базовой модели BF16, из которой обучался Bonsai pack. Архитектура и скрытый базис идентичны, поэтому вектор корректен по размерности, а проекция математически точна — среда выполнения может доказать и действительно проверяет, что она удаляет заданное направление из остаточного потока.

Чего это не доказывает, так это того, что направление по-прежнему означает то же самое в модели, обученной с учётом квантования. Насколько хорошо направление сохраняется после обучения с учётом квантования, в полной мере не измерено. Точное удаление вектора — не то же самое, что удаление поведения, которое он, как предполагалось, представляет, и именно второе утверждение имеет значение. Каждое число в предыдущем разделе — это эмпирический результат, согласующийся с хорошим переносом; ни одно из них не является доказательством того, что перенос полон, и сам проект это признаёт, рекомендуя перебрать значения alpha и варианты выбора слоёв, прежде чем делать выводы.

Любое честное сравнение методов снятия цензуры обязано признать это. У традиционной аблатерации зеркальная проблема — она изменяет веса, а затем измеряет результат, поэтому её направление никогда не должно переноситься между версиями модели, но её правка постоянна и невосстановима, если рецепт был неверным.

Что всё ещё не измерено?

Помимо вопроса о передаче, стоит назвать три пробела, а не обходить их.

Независимое воспроизведение отсутствует. Каждый результат теста Bonsai 2 27B, находящийся в обращении — средний балл 83,9, сохранение 98,2 %, разбивка по категориям — сообщён производителем Prism ML, получен с помощью EvalScope на бэкенде vLLM на H100 при уровне рассуждений «xhigh». Никто за пределами Prism ML их не воспроизводил. Таблицы безопасности и возможностей выше — наши и также не являются независимыми.

Поведение при включённом режиме размышления. В наших таблицах размышление отключено. Независимые исследования других аблатерированных моделей показали, что даже при 100% успехе атаки модель всё ещё рассуждает о безопасности в значительной части ответов, когда ей разрешено размышлять. Сохраняется ли это здесь и как это сказывается на показателях вступительной фразы, не измерялось.

Одно-единственное направление. Метод предполагает, что отказ опосредован одним направлением, — это результат Arditi et al. и основа всей техники. Последующие работы на других моделях выявили геометрически различные направления для разных категорий отказа. Один вектор, прогнанный по одному значению alpha, этого не решает.

Что это значит, если вы выбираете между ними

Выберите чекпойнт, если вам нужно, чтобы модель работала где угодно, на оборудовании, которое вы не контролируете, через загрузчик, который вы не писали. Выберите рантайм, если вы на Apple Silicon, вам важно, чтобы артефакт, который вы изучаете, был тем самым артефактом, который обучила Prism ML, и вы хотите, чтобы сила абляции была параметром, который можно покрутить, а не решением, из-за которого приходится скачивать всё заново. И то и другое имеет право на существование, и выбор определяется ограничениями развёртывания, а не тем, какой метод новее.

Если вы пытаетесь решить это эмпирически, у runtime-метода есть одно практическое преимущество, которое стоит назвать: alpha 0 и alpha 1 — это один и тот же процесс и одни и те же веса, поэтому сравнение между ними изолирует абляцию и ничего больше. Это более чистый эксперимент, чем сравнение двух чекпоинтов, и именно поэтому приведённую выше таблицу можно читать как измерение проекции, а не как измерение двух её квантований.

Ответственное использование

Удаление выученного направления отказа может заставить модель отвечать на запросы, от которых отказалась бы исходная версия. Это работа механизма, а не побочный эффект, и это не следует относить к функциям. Это исследовательский механизм и механизм контроля инференса, и он не является доказательством того, что любой получаемый на выходе результат безопасен, корректен или уместен.

Карточка самого опубликованного пакета подтверждает ту же мысль с другой стороны: сборка MLX с abliterated «в значительной степени лишена защитного выравнивания», будет выполнять запросы, от которых отказалась бы оригинальная версия, и не имеет сколько-нибудь значимых встроенных ограничений. Её авторы ограничивают её применение законными исследованиями — интерпретируемостью, исследованиями безопасности, red-teaming, оценкой робастности — и прямо заявляют, что при развёртывании необходимо сначала добавить собственный слой модерации и средства контроля доступа.

Ничто в этой статье не является аргументом в пользу того, что удаление отказов не имеет издержек или что более низкая частота отказов служит сигналом качества. Модель, отвечающая на большее число вопросов, не становится от этого лучше, а классификатор на основе правил, подсчитывающий вступительные фразы, измеряет формулировки, а не компетентность. Оба этих артефакта — исследовательские инструменты, с которыми связана обязанность оператора, и эта обязанность не переходит к тому, кто написал код абляции.

Код абляции во время выполнения, направление отказа и полные таблицы оценки публикует OrcaRouterвместе с платформой маршрутизации, которую создаёт команда.