Сгенерированная титульная карточка с надписью «Bonsai против Ternary Bonsai 2 27B», подзаголовком «Две низкобитные ставки, две разные линейки», над тремя карточками с надписями «Веса: 0,43 ГБ против 5,93 ГБ», «Заявленное качество: сравнительное против 98,2% сохранения» и «Кремний: Hexagon NPU против Apple silicon и CUDA», с нижним колонтитулом «Все показатели качества заявлены производителем и не воспроизведены». Логотип OrcaRouter находится в правом нижнем углу.
Guides & Insights

Bonsai против Ternary Bonsai 2 27B: две низкобитовые ставки, два разных мерила

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поставьте 1-битную визуально-языковую модель Bonsai 2B рядом с Ternary Bonsai 2 27B, и очевидное сравнение — 2 миллиарда параметров против 27 миллиардов, 0,43 ГБ языковых весов против 5,93 ГБ — самое неинтересное в этой паре. Интересно другое: две модели от одного вендора и из одной программы сжатия заявляют о своём качестве не одинаково. Ternary Bonsai 2 27B заявляет о сохранении: она сохраняет более 98% совокупной производительности в бенчмарках своего полнопрецизионного аналога, измеренной относительно самой себя. 1-битная Bonsai 2B заявляет о сравнении: она достигла «сопоставимых результатов в бенчмарках» с моделью Qwen 3 1.7B при 4-битной квантизации, измеренных относительно чужой модели с другой точностью. Одно — это утверждение о том, сколько было потеряно. Другое — утверждение о том, как она выглядит на фоне других. Ни то, ни другое не говорит о том, насколько хороша каждая из моделей в абсолютном выражении, и эти два нельзя читать по одной шкале.

Это различие важнее количества параметров, потому что от него зависит, какие выводы вы действительно можете сделать из цифр вендора, — а судя по опубликованным на данный момент данным, честный ответ скромнее, чем позволяют предположить заглавные цифры.

Два утверждения о качестве, две разные мерки

Ternary Bonsai 2 27B, выпущенная 17 сентября 2026 года, — это троичная пересборка Qwen3.8-27B со значениями {−1, 0, +1} при 1,76 эффективного бита на вес, и главная цифра, которую приводит PrismML, состоит в том, что она сохраняет более 98% совокупной производительности полной модели по бенчмаркам. Это утверждение о сохранении, а утверждения о сохранении по своей конструкции самореферентны: они говорят, сколько от оригинала выдержало сжатие, а не о том, на каком уровне находился оригинал. Модель, сохраняющая 98% посредственной базовой модели, всё ещё остаётся посредственной моделью, а Qwen3.8-27B не посредственна — но одна лишь эта цифра этого не говорит, и её нельзя сравнивать между базовыми моделями.

1-битная визуально-языковая модель Bonsai 2B, анонсированная 23 сентября 2026 года для платформы очков Snapdragon AR1 Gen 1, представляет собой 1-битную языковую модель на 1,7 млрд параметров плюс 4-битный визуальный энкодер на 0,3 млрд параметров. Её опубликованное заявление о качестве иного рода: PrismML оценила её в сравнении с моделью Qwen 3 1.7B при 4-битной квантизации по BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K и GPQA Diamond и сообщила, что две конфигурации показали сопоставимые результаты. Это заявление о паритете по отношению к внешнему базовому уровню. Оно говорит, что сжатие явно не стоило вам потерь по сравнению с 4-битным путём, который вы бы иначе использовали, — а это именно тот вопрос, который уместен для релиза класса устройств, и гораздо более слабое утверждение, чем «эта модель хороша».

Так что нет такого прочтения, при котором 98,2% превосходит «comparative» или наоборот. Это ответы на два разных вопроса, заданных одним и тем же вендором по двум разным эталонам и на двух разных наборах тестов. Любой, кто ранжирует эти две модели на основании этих двух предложений, ранжирует сами предложения.

Базовые модели происходят из разных мест.

Есть второе структурное различие, и именно оно будет иметь значение в течение следующего года. Ternary Bonsai 2 27B — это пересжатие внешней модели, Qwen3.8-27B от Alibaba. Потолок её качества задаётся графиком выпусков кого-то другого, а частота смены поколений следует за Qwen, а не за PrismML. Когда Qwen выпускает новую 27B, линейка Bonsai 27B получает новый вход, и показатель сохранности пересчитывается относительно новой базовой линии.

1-битная Bonsai 2B построена на собственной модели PrismML — Bonsai 1.7B. Её потолок задаётся внутри компании, частоту обновлений выбирает PrismML, а улучшения обеспечиваются рецептом сжатия и путём ядра, а не заменой вышестоящей модели. Это актив иного рода: медленнее улучшается по базовым возможностям, полностью контролируется вендором и — как показывает релиз очков — может быть настроен под конкретный ускоритель так, как не способна универсальная повторная компрессия.

Обе стратегии законны. Они не взаимозаменяемы, и то, какая вам нужна, зависит от того, привязана ли ваша дорожная карта к Qwen или к устройству.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder running on the Snapdragon AR1 Gen 1 Platform.

Контраст спецификации, строка за строкой

• Параметры — 1,7B 1-битная LLM плюс 0,3B 4-битный визуальный энкодер в модели очков, против модели класса 27B, созданной на основе Qwen3.8-27B, в Ternary Bonsai 2 27B.

• Представление — бинарное {−1, +1} с групповым масштабированием FP16 в модели glasses, в отличие от тернарного {−1, 0, +1} с тем же масштабированием при 1,76 эффективного бита на вес в 27B.

• Веса языковой модели — 0,43 ГБ для 1-битной модели 1,7B против 5,93 ГБ для упаковки PTQ1_0 модели Ternary Bonsai 2 27B; также доступна упаковка PQ2_0 объёмом 7,25 ГБ.

• Контекст — 1 024 токена у модели для очков против полного контекста в 262 000 токенов у Ternary Bonsai 2 27B.

• Ускоритель — Qualcomm Hexagon NPU через QNN SDK с поддержкой 1-битных ядер, против Apple silicon через MLX и NVIDIA через CUDA.

• Заявление о качестве — «результаты сравнительного бенчмарка» против 4-битной Qwen 3 1.7B и против «более 98 %» сохранения относительно базовой модели Qwen3.8-27B полной точности. Оба показателя заявлены производителем, ни один не был независимо воспроизведён, измерялись на разных наборах тестов.

• Среда выполнения — инструментальная цепочка Qualcomm NPU для модели на очках, в отличие от собственного форка llama.cpp от PrismML и контейнера MLX для 27B, ни один из которых не поддерживается стандартным llama.cpp.

A screenshot of PrismML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces the memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

Что даёт ставка на низкую разрядность в каждом случае

Философия сжатия одинакова в обеих моделях, и её стоит назвать, потому что это фактический тезис семейства: низкобитное представление работает от начала до конца — эмбеддинги, внимание, MLP и LM-голова — с групповым масштабированием FP16 и без запасных путей к более высокой точности. Ни одна из моделей не держит страховочную сеть в виде float для частей, которые трудно квантовать. Это более агрессивная позиция, чем в большинстве работ по квантованию, и именно она делает возможными 1,76 бита на вес и 0,43 ГБ весов.

Где окупается ставка — различается. В Ternary Bonsai 2 27B выигрыш — это возможности на байт на оборудовании, которое у вас уже есть: модель класса 27B в 5,93 ГБ, работающая на ноутбуке или телефоне, на 98% от её базового уровня. В 1-битной Bonsai 2B выигрыш — это само существование на классе устройств, у которого не было вариантов: мультимодальная модель в 0,43 ГБ языковых весов, на NPU, со скоростью 15,36 токенов в секунду. Первый — это улучшенная версия того, что уже работало. Второй — это то, что раньше не работало.

Где проходит граница уровня

Эти две не являются альтернативами, и рассмотрение их как прямого противостояния упускает схему развертывания, на которую указывают оба релиза. Продукт в виде очков или носимого устройства запускает 2B локально, потому что больше ничего не подходит. Продукт для ноутбука или телефона запускает 27B, потому что может. Как только продукт охватывает оба — приложение для телефона в паре с очками, приложение для ноутбука с ассистентом на устройстве — вопрос перестаёт быть о том, какая модель, и становится о том, какие запросы разрешено обрабатывать каждому уровню.

Эту границу стоит вынести в конфигурацию, а не в код приложения, потому что оба уровня будут меняться. Линия 27B сдвигается, когда Qwen выпускает новую версию, линия 2B сдвигается, когда PrismML меняет рецептуру, а жёстко прописанное правило о длине контекста или возможностях ломается при обоих событиях. Политика маршрутизации, которая эскалирует запросы, выходящие за бюджет локального уровня, на хостируемую модель, переживает оба изменения; локальный уровень остаётся одним из нескольких уровней, а не допущением, протянутым через клиент. OrcaRouter — это слой, который выполняет такую эскалацию, — одна точка входа для более чем 200 хостируемых моделей, включая отказоустойчивость, с политикой, выраженной в конфигурации. Ни один Bonsai здесь не маршрутизируется; оба — локальные загрузки. Здесь находится уровень над ними, и при локальной модели с 1 024 токенами этот уровень выполняет большую часть работы.

A generated scoreboard titled 'Bonsai vs Ternary Bonsai 2 27B — the scoreboard'. The Bonsai column reads: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; weights 0.43 GB; context 1,024 tokens; representation binary; quality claim comparative against 4-bit Qwen 3 1.7B; accelerator Qualcomm Hexagon NPU. The Ternary Bonsai 2 27B column reads: parameters 27B on Qwen3.8-27B; weights 5.93 GB PTQ1_0; context 262K tokens; representation ternary at 1.76 bits per weight; quality claim over 98% retention of full precision; accelerator Apple MLX and NVIDIA CUDA. Footer reads 'All quality figures vendor-reported; the two claims use different baselines and suites.' The OrcaRouter logo sits in the bottom-right.

Что бы это уладило

Три измерения превратили бы эту пару из двух маркетинговых заявлений в сравнение. Разбивка по каждому бенчмарку, стоящая за строкой «сравнительные результаты», чтобы компромисс по сравнению с 4-битным вариантом был виден, а не обобщён. Показатель сохранения для 1-битной Bonsai 2B относительно её собственного базового уровня полной точности — то измерение, которое PrismML использует для линейки 27B и не опубликовал здесь. И независимая оценка любой из этих моделей, поскольку все цифры в обоих релизах сейчас исходят от вендора.

Пока ничего из этого не существует, защитимая позиция — та, которую действительно подтверждают цифры: Ternary Bonsai 2 27B — намного лучшая модель, а 1-bit Bonsai 2B — единственная из двух, которая работает на устройстве, для которого была создана. Эти два утверждения не противоречат друг другу, и то, что один и тот же производитель измерял их разными мерками, стоит помнить в следующий раз, когда одну из этих цифр процитируют без её базовой линии.