
Bonsai против Ternary Bonsai 2 27B: две низкобитовые ставки, два разных мерила
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Поставьте 1-битную визуально-языковую модель Bonsai 2B рядом с Ternary Bonsai 2 27B, и очевидное сравнение — 2 миллиарда параметров против 27 миллиардов, 0,43 ГБ языковых весов против 5,93 ГБ — самое неинтересное в этой паре. Интересно другое: две модели от одного вендора и из одной программы сжатия заявляют о своём качестве не одинаково. Ternary Bonsai 2 27B заявляет о сохранении: она сохраняет более 98% совокупной производительности в бенчмарках своего полнопрецизионного аналога, измеренной относительно самой себя. 1-битная Bonsai 2B заявляет о сравнении: она достигла «сопоставимых результатов в бенчмарках» с моделью Qwen 3 1.7B при 4-битной квантизации, измеренных относительно чужой модели с другой точностью. Одно — это утверждение о том, сколько было потеряно. Другое — утверждение о том, как она выглядит на фоне других. Ни то, ни другое не говорит о том, насколько хороша каждая из моделей в абсолютном выражении, и эти два нельзя читать по одной шкале.
Это различие важнее количества параметров, потому что от него зависит, какие выводы вы действительно можете сделать из цифр вендора, — а судя по опубликованным на данный момент данным, честный ответ скромнее, чем позволяют предположить заглавные цифры.
Два утверждения о качестве, две разные мерки
Ternary Bonsai 2 27B, выпущенная 17 сентября 2026 года, — это троичная пересборка Qwen3.8-27B со значениями {−1, 0, +1} при 1,76 эффективного бита на вес, и главная цифра, которую приводит PrismML, состоит в том, что она сохраняет более 98% совокупной производительности полной модели по бенчмаркам. Это утверждение о сохранении, а утверждения о сохранении по своей конструкции самореферентны: они говорят, сколько от оригинала выдержало сжатие, а не о том, на каком уровне находился оригинал. Модель, сохраняющая 98% посредственной базовой модели, всё ещё остаётся посредственной моделью, а Qwen3.8-27B не посредственна — но одна лишь эта цифра этого не говорит, и её нельзя сравнивать между базовыми моделями.
1-битная визуально-языковая модель Bonsai 2B, анонсированная 23 сентября 2026 года для платформы очков Snapdragon AR1 Gen 1, представляет собой 1-битную языковую модель на 1,7 млрд параметров плюс 4-битный визуальный энкодер на 0,3 млрд параметров. Её опубликованное заявление о качестве иного рода: PrismML оценила её в сравнении с моделью Qwen 3 1.7B при 4-битной квантизации по BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K и GPQA Diamond и сообщила, что две конфигурации показали сопоставимые результаты. Это заявление о паритете по отношению к внешнему базовому уровню. Оно говорит, что сжатие явно не стоило вам потерь по сравнению с 4-битным путём, который вы бы иначе использовали, — а это именно тот вопрос, который уместен для релиза класса устройств, и гораздо более слабое утверждение, чем «эта модель хороша».
Так что нет такого прочтения, при котором 98,2% превосходит «comparative» или наоборот. Это ответы на два разных вопроса, заданных одним и тем же вендором по двум разным эталонам и на двух разных наборах тестов. Любой, кто ранжирует эти две модели на основании этих двух предложений, ранжирует сами предложения.
Базовые модели происходят из разных мест.
Есть второе структурное различие, и именно оно будет иметь значение в течение следующего года. Ternary Bonsai 2 27B — это пересжатие внешней модели, Qwen3.8-27B от Alibaba. Потолок её качества задаётся графиком выпусков кого-то другого, а частота смены поколений следует за Qwen, а не за PrismML. Когда Qwen выпускает новую 27B, линейка Bonsai 27B получает новый вход, и показатель сохранности пересчитывается относительно новой базовой линии.
1-битная Bonsai 2B построена на собственной модели PrismML — Bonsai 1.7B. Её потолок задаётся внутри компании, частоту обновлений выбирает PrismML, а улучшения обеспечиваются рецептом сжатия и путём ядра, а не заменой вышестоящей модели. Это актив иного рода: медленнее улучшается по базовым возможностям, полностью контролируется вендором и — как показывает релиз очков — может быть настроен под конкретный ускоритель так, как не способна универсальная повторная компрессия.
Обе стратегии законны. Они не взаимозаменяемы, и то, какая вам нужна, зависит от того, привязана ли ваша дорожная карта к Qwen или к устройству.

Контраст спецификации, строка за строкой
• Параметры — 1,7B 1-битная LLM плюс 0,3B 4-битный визуальный энкодер в модели очков, против модели класса 27B, созданной на основе Qwen3.8-27B, в Ternary Bonsai 2 27B.
• Представление — бинарное {−1, +1} с групповым масштабированием FP16 в модели glasses, в отличие от тернарного {−1, 0, +1} с тем же масштабированием при 1,76 эффективного бита на вес в 27B.
• Веса языковой модели — 0,43 ГБ для 1-битной модели 1,7B против 5,93 ГБ для упаковки PTQ1_0 модели Ternary Bonsai 2 27B; также доступна упаковка PQ2_0 объёмом 7,25 ГБ.
• Контекст — 1 024 токена у модели для очков против полного контекста в 262 000 токенов у Ternary Bonsai 2 27B.
• Ускоритель — Qualcomm Hexagon NPU через QNN SDK с поддержкой 1-битных ядер, против Apple silicon через MLX и NVIDIA через CUDA.
• Заявление о качестве — «результаты сравнительного бенчмарка» против 4-битной Qwen 3 1.7B и против «более 98 %» сохранения относительно базовой модели Qwen3.8-27B полной точности. Оба показателя заявлены производителем, ни один не был независимо воспроизведён, измерялись на разных наборах тестов.
• Среда выполнения — инструментальная цепочка Qualcomm NPU для модели на очках, в отличие от собственного форка llama.cpp от PrismML и контейнера MLX для 27B, ни один из которых не поддерживается стандартным llama.cpp.

Что даёт ставка на низкую разрядность в каждом случае
Философия сжатия одинакова в обеих моделях, и её стоит назвать, потому что это фактический тезис семейства: низкобитное представление работает от начала до конца — эмбеддинги, внимание, MLP и LM-голова — с групповым масштабированием FP16 и без запасных путей к более высокой точности. Ни одна из моделей не держит страховочную сеть в виде float для частей, которые трудно квантовать. Это более агрессивная позиция, чем в большинстве работ по квантованию, и именно она делает возможными 1,76 бита на вес и 0,43 ГБ весов.
Где окупается ставка — различается. В Ternary Bonsai 2 27B выигрыш — это возможности на байт на оборудовании, которое у вас уже есть: модель класса 27B в 5,93 ГБ, работающая на ноутбуке или телефоне, на 98% от её базового уровня. В 1-битной Bonsai 2B выигрыш — это само существование на классе устройств, у которого не было вариантов: мультимодальная модель в 0,43 ГБ языковых весов, на NPU, со скоростью 15,36 токенов в секунду. Первый — это улучшенная версия того, что уже работало. Второй — это то, что раньше не работало.
Где проходит граница уровня
Эти две не являются альтернативами, и рассмотрение их как прямого противостояния упускает схему развертывания, на которую указывают оба релиза. Продукт в виде очков или носимого устройства запускает 2B локально, потому что больше ничего не подходит. Продукт для ноутбука или телефона запускает 27B, потому что может. Как только продукт охватывает оба — приложение для телефона в паре с очками, приложение для ноутбука с ассистентом на устройстве — вопрос перестаёт быть о том, какая модель, и становится о том, какие запросы разрешено обрабатывать каждому уровню.
Эту границу стоит вынести в конфигурацию, а не в код приложения, потому что оба уровня будут меняться. Линия 27B сдвигается, когда Qwen выпускает новую версию, линия 2B сдвигается, когда PrismML меняет рецептуру, а жёстко прописанное правило о длине контекста или возможностях ломается при обоих событиях. Политика маршрутизации, которая эскалирует запросы, выходящие за бюджет локального уровня, на хостируемую модель, переживает оба изменения; локальный уровень остаётся одним из нескольких уровней, а не допущением, протянутым через клиент. OrcaRouter — это слой, который выполняет такую эскалацию, — одна точка входа для более чем 200 хостируемых моделей, включая отказоустойчивость, с политикой, выраженной в конфигурации. Ни один Bonsai здесь не маршрутизируется; оба — локальные загрузки. Здесь находится уровень над ними, и при локальной модели с 1 024 токенами этот уровень выполняет большую часть работы.

Что бы это уладило
Три измерения превратили бы эту пару из двух маркетинговых заявлений в сравнение. Разбивка по каждому бенчмарку, стоящая за строкой «сравнительные результаты», чтобы компромисс по сравнению с 4-битным вариантом был виден, а не обобщён. Показатель сохранения для 1-битной Bonsai 2B относительно её собственного базового уровня полной точности — то измерение, которое PrismML использует для линейки 27B и не опубликовал здесь. И независимая оценка любой из этих моделей, поскольку все цифры в обоих релизах сейчас исходят от вендора.
Пока ничего из этого не существует, защитимая позиция — та, которую действительно подтверждают цифры: Ternary Bonsai 2 27B — намного лучшая модель, а 1-bit Bonsai 2B — единственная из двух, которая работает на устройстве, для которого была создана. Эти два утверждения не противоречат друг другу, и то, что один и тот же производитель измерял их разными мерками, стоит помнить в следующий раз, когда одну из этих цифр процитируют без её базовой линии.
