
Bonsai против Bonsai 27B: одно имя семейства, в шестнадцать раз больше параметров
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Любой, кто станет выбирать модель из этого семейства по названию, получит не ту модель, и причина в том, что само название «Bonsai» — не модель. Это семейство, и по состоянию на эту неделю в нём есть визуально-языковая модель с 2 миллиардами параметров, работающая на паре умных очков, и модель с 27 миллиардами параметров, работающая на телефоне, ноутбуке или настольном компьютере. Первая — это визуально-языковая модель Bonsai 2B с 1-битным квантованием, анонсированная 23 сентября 2026 года: языковая модель на 1,7 млрд параметров с 1-битным квантованием плюс визуальный энкодер на 0,3 млрд параметров с 4-битным квантованием, с контекстом 1 024 токена, построена на Bonsai 1.7B. Вторая — Bonsai 27B, выпущенная 14 июля 2026 года под лицензией Apache 2.0, построена на Qwen3.6-27B с контекстом 262 000 токенов и выбором между 5,9-ГБ троичной сборкой и 3,9-ГБ бинарной сборкой. Их объединяют название, производитель, философия сжатия и почти ничего больше. В шестнадцать раз больше параметров, в двести пятьдесят шесть раз больше контекста и два совершенно разных устройства.
Эта страница для того, кто искал одно из них, а попал на другое.
Проблема именования, изложенная прямо
В меню моделей PrismML сейчас перечислены Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B и Bonsai Image. Анонс очков добавляет визуально-языковую модель с 2 млрд параметров в дополнение к линейке Bonsai 1.7B. Таким образом, одно только «Bonsai» может означать любой из как минимум четырёх классов параметров и двух поколений, и суффикс размера — единственное, что устраняет неоднозначность. Это не критика названия — это обычная структура семейства моделей — но это означает, что название семейства не несёт никакой информации о том, что вы скачиваете.
Полезное разграничение — не генерация, а класс устройств. Всё в линейке 27B предполагает, что у вас есть от 4 до 8 ГБ памяти, которые можно отдать языковой модели, и вы готовы их на это потратить. Всё в линейке 1.7B предполагает, что у вас есть лишь несколько сотен мегабайт, и не больше. Этот единственный факт определяет, какая половина семейства имеет к вам отношение, ещё до того, как это сделает какой-либо бенчмарк.
Что каждый из них на самом деле из себя представляет
• Параметры — 1,7B 1-битная LLM плюс 0,3B 4-битный визуальный энкодер в модели очков против модели класса 27B, созданной на основе Qwen3.6-27B в Bonsai 27B.
• Контекст — 1 024 токена на модели очков, в отличие от полного контекста объёмом 262 000 токенов у Bonsai 27B.
• Веса языковой модели — 0,43 ГБ для 1-битной версии 1,7B, против 5,9 ГБ для тернарного Bonsai 27B и 3,9 ГБ для его 1-битной сборки.
• Представление — бинарные веса {−1, +1} с групповым масштабированием FP16 в обоих, что представляет собой 1-битный рецепт, вокруг которого построено всё семейство; Bonsai 27B дополнительно предлагает тернарную сборку {−1, 0, +1} при 1,71 эффективных битах на вес.
• Целевой чип — NPU Qualcomm Hexagon на платформе очков Snapdragon AR1 Gen 1, скомпилированный через QNN SDK с поддержкой 1-битных ядер, в сравнении с Apple silicon через MLX и NVIDIA через CUDA для Bonsai 27B.
• Скорость декодирования — 15,36 токенов в секунду на 4-ГБ тестовой платформе AR1 Gen 1 для модели очков, против примерно 11 токенов в секунду на iPhone 17 Pro, 87 — на Apple M5 Max и 163 — на RTX 5090 для 1-битной Bonsai 27B.
Все эти цифры принадлежат вендору, а два набора измерялись на разном оборудовании и относительно разных базовых уровней, так что они описывают два продукта, а не две точки на одной кривой.

Где Bonsai 27B побеждает — и с большим отрывом
Контекст стоит на первом месте, и запас — это не мелкая деталь. Окно в 262 000 токенов вмещает кодовую базу, длинный документ, расшифровку или рабочую сессию агента, да ещё с запасом. Окно в 1 024 токена вмещает одну короткую инструкцию и одно изображение. Если ваша рабочая нагрузка предполагает чтение чего-либо длиннее страницы, Bonsai 27B — единственная из двух, которая вообще способна справиться с задачей, и никакие ухищрения в промптинге для модели в очках не закроют этот разрыв, потому что ограничение — это память, зарезервированная для состояния ключ-значение, а не размер весов.
Возможности — на втором месте. Сообщается, что тернарная сборка Bonsai 27B сохраняет около 95% результатов своей базовой модели полной точности на наборе из 15 бенчмарков в режиме рассуждения, а её 1-битная сборка — около 90%, причём наибольшие потери — в зрении и использовании инструментов. Это показатели производителя на его собственном наборе тестов, и они всё ещё относятся к совершенно иному классу, чем модель с 2 миллиардами параметров, единственное опубликованное утверждение о качестве которой состоит в том, что она достигла «сопоставимых результатов в бенчмарках» с 4-битной Qwen 3 1.7B. Модель для очков не сравнивается её собственным производителем с 27B-моделью, потому что такое сравнение не было бы полезным.
Экосистема — третья. Bonsai 27B поставляется в упаковках GGUF, MLX и AWQ с документированными средами выполнения, так что есть путь к запуску её на оборудовании, которое у вас уже есть. Модель для очков существует внутри инструментальной цепочки Qualcomm NPU.

Где выигрывает 2B, и в этом весь смысл
Языковая модель объёмом 0,43 ГБ помещается там, где не поместится модель объёмом 5,9 ГБ, и платформа очков — одна из таких областей. В этом заключается весь аргумент, и он звучит сильнее, чем можно предположить из сравнения характеристик, потому что у рассматриваемых устройств нет альтернативы: пара очков с 4 ГБ общей памяти платформы не может вместить Bonsai 27B ни в одной сборке, а телефон не может вместить тернарную сборку, не отказавшись от большей части того, для чего предназначен телефон.
Есть второй выигрыш, которому уделяется меньше внимания: 1-битное представление не является компромиссом для этого класса устройств — это ключевой приём, делающий всё возможным. Согласно собственному позиционированию PrismML, 1-битный путь обеспечивает примерно эквивалентный интеллект той же модели при 4-битной точности, используя при этом около четверти памяти и генерируя токены более чем вдвое быстрее. Для всегда включённого устройства, где каждый милливатт и каждый мегабайт на счету, этот размен и есть продукт.
Итак, эти две модели не конкурируют. 2B — это то, что запускается, когда больше негде. 27B — это то, что запускается, когда есть где.
Граница уровня — это настоящее решение.
Почти никто не выбирает между этими двумя. Реалистичное развёртывание включает и то и другое: небольшую постоянно работающую модель на устройстве для запросов, которые укладываются в 1 024 токена, и что-то более крупное за ней для всего остального. Как только вы принимаете такую схему, инженерный вопрос перестаёт быть «какой Bonsai» и становится «где проходит граница и кто следит за её соблюдением».
Если проверять это в коде приложения, такая строка превращается в ветвление, которое приходится переписывать каждый раз, когда модель на устройстве меняет длину контекста или свои возможности — а судя по последним трём месяцам, это происходит примерно раз в месяц. Если же проверять это как политику маршрутизации, получается одно правило о бюджете контекста и требуемых возможностях, и локальный уровень остаётся уровнем, а не допущением, зашитым через весь клиент. Именно на этом слое работает OrcaRouter: одна точка входа перед более чем 200 размещёнными моделями, с отказоустойчивостью и политикой эскалации, выраженной в конфигурации. Ни один из Bonsai здесь не маршрутизируется — оба представляют собой загрузки, которые вы запускаете на собственном оборудовании, — так что честная формулировка такова: слой маршрутизации покрывает уровень выше локального, а при локальной модели на 1 024 токена именно на этот уровень попадёт большая часть трафика.

Если придётся выбрать одно
• Вы разрабатываете для очков, носимых устройств или любого постоянно включённого устройства — 1-битная визуально-языковая модель Bonsai 2B — здесь единственный вариант, а контекст в 1024 токена — это проектное ограничение, вокруг которого вы строите, а не против которого.
• Вы создаёте для телефона — 1-bit Bonsai 27B объёмом 3,9 ГБ — это самая крупная модель в этом семействе, которая укладывается в бюджет памяти класса iPhone, и она даёт вам контекст 262K, к которому модель для очков не может приблизиться.
• Вы делаете сборку для ноутбука или настольного компьютера — тернарная сборка Bonsai 27B — это ориентированный на качество выбор в этом семействе, а 1-битная сборка даёт скорость, а не возможности.
• Вы создаёте гибридную систему — сначала определите правило эскалации, а модель — потом. Модель можно заменить, а границу — нет, как только она окажется в клиенте.
За чем стоит следить, так это за тем, распространится ли вверх тот путь через NPU, который сделал возможным выпуск очков. Если 1-битные ядра на мобильных ускорителях окажутся универсальными, линейка 1.7B расширится, а аргументы в пользу 27B-модели на телефоне станут сильнее. До тех пор две половины семейства чётко разделены по классу устройств, что делает выбор проще, чем можно предположить по общему названию.
