Сгенерированная титульная карточка с текстом «Ternary Bonsai 2 27B против Qwen3.8-27B IQ2_XXS GGUF» и подзаголовком «Меньше битов, лучше результаты», над тремя карточками с текстом «Битов на вес: 1,76 против 2,2», «Размер: 5,93 ГБ против 7,3 ГБ» и «Среднее по набору тестов вендора: 83,9 против 75,2», с нижним колонтитулом «Показатели Bonsai заявлены вендором; показатели IQ2_XXS — по данным вендора и тестов сообщества». Логотип OrcaRouter находится в правом нижнем углу.
Engineering & Research

Ternary Bonsai 2 27B против Qwen3.8-27B IQ2_XXS GGUF: меньше битов — выше результаты

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Ternary Bonsai 2 27B меньше, чем сборка IQ2_XXS GGUF модели Qwen3.8-27B, и, судя по опубликованным вместе с ней показателям, также лучше — что было бы невозможно, если бы их разделял только бюджет битов. В сборке Bonsai — 1,76 бита на вес в файле размером 5,93 ГБ. Обычная 2-битная квантизация той же базовой модели несёт примерно 2,2 бита на вес в файле около 7,3 ГБ. Prism ML, объявившая о тернарной сборке 17 сентября 2026 года, сообщает о среднем результате 83,9 по 20 бенчмаркам для своей модели против 75,2 у точки сравнения IQ2_XXS — разрыв в 8,7 пункта в пользу модели, использующей меньше битов.

Вся суть — в этой инверсии, и это не уловка. Эти два файла создаются разными процессами на разных этапах жизненного цикла модели, и разница между этими процессами важнее, чем разница в разрядности. Это ещё и то сравнение, в котором популярный совет — «просто возьмите 2-битную квантованную модель, сейчас они нормальные» — наталкивается на свой самый явный контрпример, и где за контрпримером стоит независимое измерение, а не слово вендора.

Парадокс — это механизм

IQ2_XXS — это формат квантования после обучения. Модель обучается до сходимости в полной точности, а затем, после этого, её веса округляются в низкобитное представление, выбранное процедурой подгонки. Модель никогда не получает шанса адаптироваться; её измеряют постфактум и аппроксимируют. Семейство i-quant улучшает более старые k-quants за счёт использования матрицы важности — калибровочного прохода, который решает, какие веса заслуживают большей доли доступной точности, — но принципиальный порядок операций остаётся неизменным. Сначала обучение, затем сжатие.

Bonsai инвертирует этот порядок. Prism ML описывает свой собственный метод так: он полностью отказался от посттренировочного квантования и навязал тернарное ограничение во время обучения: прямой проход выполняет вычисления с весами, ограниченными множеством {−1, 0, +1}, тогда как обратный проход по-прежнему несёт градиенты полной точности. Модель в процессе обучения учится формировать представления, которые выдерживают ограничение, вместо того чтобы ограничение навязывалось представлениям, которые его никогда не ожидали. Алгоритм описывается как проприетарная интеллектуальная собственность, но его структура будет знакома любому, кто читал серию работ BitNet.

Сверху лежат два усовершенствования, и оба видны в арифметике. Первое — выборочная точность: 26,2 миллиона параметров — около 0,098% модели, примерно 52 МБ в bf16, в основном путь рекуррентного состояния слоёв линейного внимания плюс веса нормализации — сохраняются в полной точности, а не тернаризуются. Второе — блочное вращение. Каждая матрица весов преобразуется вращением Уолша–Адамара с размером блока 1 024 до выбора тернарных значений, что распределяет выбросы по координатам и делает трёхуровневую аппроксимацию менее разрушительной. Вращение зашивается в хранимые веса, поэтому оно не требует дополнительных байтов; вместо этого соответствующее преобразование применяется к активациям во время выполнения.

У этой последней детали есть следствие, с которым вы столкнётесь при первой же попытке запустить эту штуку, и в этом заключается настоящая цена такого подхода.

Какой именно IQ2_XXS вы имеете в виду и какие показатели он на самом деле набирает?

Прежде чем сравнивать качество, поправка, которую упускает большинство обзоров: «IQ2_XXS» — это не один артефакт. Это тип квантования llama.cpp, и один и тот же тип, применённый разными инструментальными цепочками к одной и той же базовой модели, даёт файлы, которые заметно различаются по размеру и существенно — по качеству.

Самое убедительное публичное доказательство — независимое сравнение, опубликованное 15 августа 2026 года пользователем, который изучал, стоило ли вообще создавать sub-2-битную версию Qwen3.8-27B. Этот тест представляет собой измерение KL-дивергенции на wikitext-2: 100 чанков при контексте 512, по сравнению с локально собранным эталоном Q8_0 с перплексией 6.7500, при этом все кандидаты используют одну и ту же матрицу важности, корпус, базовую линию и сборку llama.cpp в рамках одного сеанса. Результаты:

• unsloth UD-IQ2_XXS — 8,39 ГиБ, перплексия 7,6528, средний KLD 0,146, медианный KLD 0,076, согласованность top-1 82,98%

• bartowski IQ2_XXS — 8,75 ГиБ, перплексия 8,5352, средний KLD 0,301, медианный KLD 0,162, согласованность top-1 76,53%

Динамический вариант на 0,36 ГиБ меньше, чем статический, и примерно в 2,1 раза лучше по средней KLD — при перплексии в 1,13 раза выше базовой. Два файла под одной и той же меткой, различающиеся в два раза по метрике, которая измеряет, насколько сильно сместилось распределение выходов. Тот же тест показал, что все кандидаты с разрядностью менее 2 бит хуже обоих опубликованных вариантов IQ2, поэтому практический минимум для этой базовой модели находится на уровне IQ2, а не ниже него.

A screenshot of a Hugging Face community discussion titled 'Independent KLD benchmark: UD-IQ2_XXS beats bartowski IQ2_XXS on both size and quality', opened 15 August 2026, describing a wikitext-2 test of 100 chunks at 512 context against a locally built Q8_0 reference with perplexity 6.7500. Its table lists unsloth UD-IQ2_XXS at 8.39 GiB with perplexity 7.6528, mean KLD 0.146, median KLD 0.076 and 82.98% top-1 agreement; bartowski IQ2_XXS at 8.75 GiB with perplexity 8.5352, mean KLD 0.301, median 0.162 and 76.53%; stock IQ1_M at 7.33 GiB with mean KLD 0.659; and stock IQ1_S at 6.88 GiB with mean KLD 0.896.

Это важно для сравнения, потому что меняет то, что подразумевается под «сборкой IQ2_XXS на 7,3 ГБ». Показатель Prism ML получен из собственной квантизации базовой модели при 2,2 бита на вес. Динамическая сборка unsloth того же семейства измеряется в 8,39 ГиБ. Сборка bartowski измеряется в 8,75 ГиБ. Таким образом, разрыв в размере между Bonsai и «IQ2_XXS» составляет где-то от 1,4x до 1,5x в зависимости от того, какую сборку вы имеете в виду — больше, чем 1,23x, подразумеваемые заголовком, и всё это ещё до начала сравнения качества.

Где ломается посттренировочная сборка и почему это легко пропустить

Совокупный разрыв в 8,7 пункта — наименее информативный способ описать это различие, потому что деградация в сборке IQ2_XXS неравномерна. Она избирательна, и закономерность противоположна тому, что предсказало бы большинство людей.

• MMLU-Redux — сборка после постобучения держится вполне достойно, в районе 85–89.

• GPQA Diamond — около 65,5 против 85,76 у тернарной сборки

• AIME26 — в диапазоне от 57.5 до 78.6 в зависимости от сборки, против 95.83 для тернарной сборки

• LiveCodeBench — в диапазоне от 56,4 до 70,05 против 90,07 для тернарной сборки

Точные показатели IQ2 различаются между наборами тестов Prism ML и измерениями сообщества, и приведённые выше диапазоны охватывают и то, и другое, но картина неизменна во всех источниках: поверхностные знания сохраняются, а всё, что требует длительной цепочки рассуждений, резко деградирует. Именно это и есть тот режим отказа, который не выявит случайная проверка. Попросите 2-битную сборку пересказать документ или ответить на фактический вопрос — и она покажет себя как гораздо более крупная модель. Попросите её удержать многошаговый вывод или сгенерировать нетривиальный код — и обвал будет внезапным, а не постепенным. Вот почему «мне показалось, что всё нормально, когда я это попробовал» не является доказательством о квантованной модели — это доказательство о промптах, которые вам довелось попробовать.

Тернарная сборка не показывает этого коллапса на тех же бенчмарках. Prism ML сообщает о 95,83 на AIME26 против 94,58 у своей базовой модели полной точности и о 90,07 на LiveCodeBench против 90,05 — фактически на одном уровне, и это самое полезное утверждение в релизе, потому что оно говорит, что ограничение на этапе обучения дало именно то, что теряет ограничение на этапе после обучения.

Контраргумент, который реален и который таблица качества не учитывает

Всё вышесказанное говорит в пользу тернарной сборки по качеству на байт. Есть один аспект, по которому обычный GGUF безоговорочно выигрывает, и это не мелочь: он работает на программном обеспечении, которое у вас уже есть.

Сборка IQ2_XXS модели Qwen3.8-27B — это штатный артефакт llama.cpp. Она загружается в llama.cpp, Ollama, LM Studio, Jan и любом другом ПО, которое линкуется с ggml, на всех платформах, поддерживаемых ggml, без необходимости форка и без специальных ядер. Её матрицу важности можно перестроить или заменить. Она ведёт себя так же, как любая другая квантованная модель, имеющаяся у вас на диске.

А Ternary Bonsai 2 27B — нет. Тернарные ядра для гибридного внимания этой архитектуры находятся в собственном форке llama.cpp от Prism ML. Штатный llama.cpp отвергает PTQ1_0 и PQ2_0 как нераспознанные типы — и понятия не имеет, что делать с повёрнутым базисом, который предполагают эти пакеты. Сборка MLX для Apple Silicon имеет ядра Metal и CPU, но не имеет пути CUDA, поэтому на машине с NVIDIA она откатывается к прямому проходу на CPU, который может занимать минуты. Prism ML действительно указывает интеграцию с несколькими средами выполнения, но суть остаётся в силе: применимость этой модели ограничена тем, была ли выбранная вами среда выполнения обучена работе с ней.

Это честный компромисс. Вы выбираете между сборкой, которая в 1,4 раза больше, измеримо хуже именно в тех задачах, для которых вам, скорее всего, и нужна 27B-модель, и при этом универсально запускается, — и сборкой, которая меньше и лучше, но существует в экосистеме, которая на данный момент сводится к форку одной лаборатории плюс те рантаймы, которые его приняли.

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, showing the headline 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet' and the paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance while the new model retains over 98%.

Что нужно, чтобы запустить любой из них

Арифметика памяти ближе, чем предполагают размеры файлов, потому что файлы — не единственное, что находится в VRAM.

• Сборка IQ2_XXS — от 8,39 до 8,75 ГиБ весов, что оставляет примерно 7,5 ГБ свободными на 16-гигабайтной карте для контекста и черновых моделей. Независимый тест выше особо отмечает, что сборка объёмом 8,39 ГиБ уже вмещает рядом с собой черновую модель на 2,1 ГБ.

• Ternary Bonsai 2 27B — 5,93 ГБ для языковой модели PTQ1_0, плюс 0,63 ГБ для визуального модуля vision tower, если вы вообще используете изображения, плюс контекст. Упаковка PQ2_0 от Prism ML занимает 7,25 ГБ и является более быстрым вариантом на оборудовании, ограниченном скоростью выполнения инструкций, а не пропускной способностью памяти.

Что касается скорости, заявленные тернарные показатели составляют 142,5 tok/s при декодировании на RTX 5090 и 46,8 tok/s на Apple M5 Max; сторонних данных о сборке IQ2 меньше, и есть измерение через Vulkan на двух картах Radeon — около 3,8 tok/s при генерации, хотя это число говорит больше о конкретном бэкенде, чем о самой квантизации. Считайте показатели пропускной способности с обеих сторон в значительной степени зависящими от аппаратного обеспечения.

Где OrcaRouter подходит, а где — нет

Ни один из этих файлов не является тем, что раздаёт роутер. Это локальные артефакты, и честная формулировка такова: OrcaRouter не размещает ни один из них — это сравнение о том, что работает на вашем собственном оборудовании. А на нашей стороне находится модель, из которой оба они были получены. Qwen3.8-27B в полной точности доступна через собственную инфраструктуру OrcaRouter по цене $0.33 за миллион входных токенов и $2.40 за миллион выходных токенов, при этом собственный контекст модели в 262K и управление уровнем рассуждений low/medium/high сохранены без изменений.

Это даёт гибридную схему, о которой стоит поговорить конкретно. Запускайте сжатую сборку локально для задач, в которых она хороша, а редкие запросы, которым нужна полная точность, направляйте к размещённой базовой модели через тот же ключ — никакого второго договора с поставщиком, никаких изменений в коде, потому что обе стороны говорят на одном API. Если локальная сборка окажется неподходящей для какой-то нагрузки, запрос, который не срабатывает, может быть автоматически переключён при отказе, а не возвращён как ошибка, что является более дешёвым способом обнаружить, что квантование не подходит, чем обнаружить это в продакшене.

Краткая версия

• По опубликованному качеству на байт тернарная сборка явно выигрывает, причём этот выигрыш сосредоточен в рассуждениях и коде — категориях, где сборка после постобучения деградирует сильнее всего.

• По части переносимости сборка IQ2_XXS выигрывает так же явно. Везде стандартные среды выполнения, без форков, без специальных ядер, без режима отказа с незаметным мусором.

• Сравнение — это не «1,76 бита против 2,2 бита». Это «представление, выбранное во время обучения, против представления, подобранного после этого», и разница в 0,44 бита на этом фоне — просто ошибка округления.

• Каждый показатель качества для тернарной сборки в этой статье — это собственное измерение Prism ML на наборе тестов, который выбрала Prism ML. Результаты KLD для сборок IQ2 независимы, однократны и относятся только к одной базовой модели и одному тестовому набору; это сильнейшие сторонние доказательства в данном сравнении, и они ничего не говорят о Bonsai.

Разрыв закроется и с другой стороны, и, вероятно, скоро. Если тернарные ядра попадут в upstream llama.cpp, единственное серьёзное возражение против Bonsai исчезнет, и выбор станет очевидным. До тех пор сборка IQ2_XXS сохраняет реальное преимущество, не имеющее ничего общего с тем, насколько она хороша.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and a description stating the model is self-hosted on OrcaRouter's own infrastructure.

Если вы принимаете решение на этой неделе, тест, который его разрешит, займёт полдня: возьмите двадцать запросов из своей рабочей нагрузки, требующих более одного шага рассуждений, запустите обе сборки и оцените ответы вслепую. Опубликованные таблицы подскажут, где искать. Они не могут сказать, там ли находится ваша работа.