Сгенерированная титульная карточка с надписью «Bonsai vs Bonsai 27B», подзаголовком «Одно название семейства, в шестнадцать раз больше параметров», над тремя карточками с надписями «Контекст: 1 024 токена против 262K», «Веса LLM: 0,43 ГБ против 5,9 ГБ» и «Целевое устройство: умные очки против телефона, ноутбука, настольного компьютера», с нижним колонтитулом «Цифры, заявленные производителем; две модели не тестировались на общем наборе бенчмарков». Логотип OrcaRouter расположен в правом нижнем углу.
Guides & Insights

Bonsai против Bonsai 27B: одно имя семейства, в шестнадцать раз больше параметров

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Любой, кто станет выбирать модель из этого семейства по названию, получит не ту модель, и причина в том, что само название «Bonsai» — не модель. Это семейство, и по состоянию на эту неделю в нём есть визуально-языковая модель с 2 миллиардами параметров, работающая на паре умных очков, и модель с 27 миллиардами параметров, работающая на телефоне, ноутбуке или настольном компьютере. Первая — это визуально-языковая модель Bonsai 2B с 1-битным квантованием, анонсированная 23 сентября 2026 года: языковая модель на 1,7 млрд параметров с 1-битным квантованием плюс визуальный энкодер на 0,3 млрд параметров с 4-битным квантованием, с контекстом 1 024 токена, построена на Bonsai 1.7B. Вторая — Bonsai 27B, выпущенная 14 июля 2026 года под лицензией Apache 2.0, построена на Qwen3.6-27B с контекстом 262 000 токенов и выбором между 5,9-ГБ троичной сборкой и 3,9-ГБ бинарной сборкой. Их объединяют название, производитель, философия сжатия и почти ничего больше. В шестнадцать раз больше параметров, в двести пятьдесят шесть раз больше контекста и два совершенно разных устройства.

Эта страница для того, кто искал одно из них, а попал на другое.

Проблема именования, изложенная прямо

В меню моделей PrismML сейчас перечислены Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B и Bonsai Image. Анонс очков добавляет визуально-языковую модель с 2 млрд параметров в дополнение к линейке Bonsai 1.7B. Таким образом, одно только «Bonsai» может означать любой из как минимум четырёх классов параметров и двух поколений, и суффикс размера — единственное, что устраняет неоднозначность. Это не критика названия — это обычная структура семейства моделей — но это означает, что название семейства не несёт никакой информации о том, что вы скачиваете.

Полезное разграничение — не генерация, а класс устройств. Всё в линейке 27B предполагает, что у вас есть от 4 до 8 ГБ памяти, которые можно отдать языковой модели, и вы готовы их на это потратить. Всё в линейке 1.7B предполагает, что у вас есть лишь несколько сотен мегабайт, и не больше. Этот единственный факт определяет, какая половина семейства имеет к вам отношение, ещё до того, как это сделает какой-либо бенчмарк.

Что каждый из них на самом деле из себя представляет

• Параметры — 1,7B 1-битная LLM плюс 0,3B 4-битный визуальный энкодер в модели очков против модели класса 27B, созданной на основе Qwen3.6-27B в Bonsai 27B.

• Контекст — 1 024 токена на модели очков, в отличие от полного контекста объёмом 262 000 токенов у Bonsai 27B.

• Веса языковой модели — 0,43 ГБ для 1-битной версии 1,7B, против 5,9 ГБ для тернарного Bonsai 27B и 3,9 ГБ для его 1-битной сборки.

• Представление — бинарные веса {−1, +1} с групповым масштабированием FP16 в обоих, что представляет собой 1-битный рецепт, вокруг которого построено всё семейство; Bonsai 27B дополнительно предлагает тернарную сборку {−1, 0, +1} при 1,71 эффективных битах на вес.

• Целевой чип — NPU Qualcomm Hexagon на платформе очков Snapdragon AR1 Gen 1, скомпилированный через QNN SDK с поддержкой 1-битных ядер, в сравнении с Apple silicon через MLX и NVIDIA через CUDA для Bonsai 27B.

• Скорость декодирования — 15,36 токенов в секунду на 4-ГБ тестовой платформе AR1 Gen 1 для модели очков, против примерно 11 токенов в секунду на iPhone 17 Pro, 87 — на Apple M5 Max и 163 — на RTX 5090 для 1-битной Bonsai 27B.

Все эти цифры принадлежат вендору, а два набора измерялись на разном оборудовании и относительно разных базовых уровней, так что они описывают два продукта, а не две точки на одной кривой.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, stating a 2-billion-parameter vision-language model runs locally on AI smart glasses powered by the Snapdragon AR1 Gen 1 Platform with a 1,024-token context.

Где Bonsai 27B побеждает — и с большим отрывом

Контекст стоит на первом месте, и запас — это не мелкая деталь. Окно в 262 000 токенов вмещает кодовую базу, длинный документ, расшифровку или рабочую сессию агента, да ещё с запасом. Окно в 1 024 токена вмещает одну короткую инструкцию и одно изображение. Если ваша рабочая нагрузка предполагает чтение чего-либо длиннее страницы, Bonsai 27B — единственная из двух, которая вообще способна справиться с задачей, и никакие ухищрения в промптинге для модели в очках не закроют этот разрыв, потому что ограничение — это память, зарезервированная для состояния ключ-значение, а не размер весов.

Возможности — на втором месте. Сообщается, что тернарная сборка Bonsai 27B сохраняет около 95% результатов своей базовой модели полной точности на наборе из 15 бенчмарков в режиме рассуждения, а её 1-битная сборка — около 90%, причём наибольшие потери — в зрении и использовании инструментов. Это показатели производителя на его собственном наборе тестов, и они всё ещё относятся к совершенно иному классу, чем модель с 2 миллиардами параметров, единственное опубликованное утверждение о качестве которой состоит в том, что она достигла «сопоставимых результатов в бенчмарках» с 4-битной Qwen 3 1.7B. Модель для очков не сравнивается её собственным производителем с 27B-моделью, потому что такое сравнение не было бы полезным.

Экосистема — третья. Bonsai 27B поставляется в упаковках GGUF, MLX и AWQ с документированными средами выполнения, так что есть путь к запуску её на оборудовании, которое у вас уже есть. Модель для очков существует внутри инструментальной цепочки Qualcomm NPU.

A screenshot of PrismML's July 2026 launch post for Bonsai 27B, titled 'Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone', listing a ternary build at 1.71 effective bits per weight and 5.9 GB and a 1-bit build at 1.125 bits per weight and 3.9 GB, with a 262K-token context.

Где выигрывает 2B, и в этом весь смысл

Языковая модель объёмом 0,43 ГБ помещается там, где не поместится модель объёмом 5,9 ГБ, и платформа очков — одна из таких областей. В этом заключается весь аргумент, и он звучит сильнее, чем можно предположить из сравнения характеристик, потому что у рассматриваемых устройств нет альтернативы: пара очков с 4 ГБ общей памяти платформы не может вместить Bonsai 27B ни в одной сборке, а телефон не может вместить тернарную сборку, не отказавшись от большей части того, для чего предназначен телефон.

Есть второй выигрыш, которому уделяется меньше внимания: 1-битное представление не является компромиссом для этого класса устройств — это ключевой приём, делающий всё возможным. Согласно собственному позиционированию PrismML, 1-битный путь обеспечивает примерно эквивалентный интеллект той же модели при 4-битной точности, используя при этом около четверти памяти и генерируя токены более чем вдвое быстрее. Для всегда включённого устройства, где каждый милливатт и каждый мегабайт на счету, этот размен и есть продукт.

Итак, эти две модели не конкурируют. 2B — это то, что запускается, когда больше негде. 27B — это то, что запускается, когда есть где.

Граница уровня — это настоящее решение.

Почти никто не выбирает между этими двумя. Реалистичное развёртывание включает и то и другое: небольшую постоянно работающую модель на устройстве для запросов, которые укладываются в 1 024 токена, и что-то более крупное за ней для всего остального. Как только вы принимаете такую схему, инженерный вопрос перестаёт быть «какой Bonsai» и становится «где проходит граница и кто следит за её соблюдением».

Если проверять это в коде приложения, такая строка превращается в ветвление, которое приходится переписывать каждый раз, когда модель на устройстве меняет длину контекста или свои возможности — а судя по последним трём месяцам, это происходит примерно раз в месяц. Если же проверять это как политику маршрутизации, получается одно правило о бюджете контекста и требуемых возможностях, и локальный уровень остаётся уровнем, а не допущением, зашитым через весь клиент. Именно на этом слое работает OrcaRouter: одна точка входа перед более чем 200 размещёнными моделями, с отказоустойчивостью и политикой эскалации, выраженной в конфигурации. Ни один из Bonsai здесь не маршрутизируется — оба представляют собой загрузки, которые вы запускаете на собственном оборудовании, — так что честная формулировка такова: слой маршрутизации покрывает уровень выше локального, а при локальной модели на 1 024 токена именно на этот уровень попадёт большая часть трафика.

A generated two-column scoreboard titled 'Bonsai vs Bonsai 27B — the scoreboard'. The Bonsai 2B VLM column reads: parameters 1.7B 1-bit plus 0.3B vision; context 1,024 tokens; weights 0.43 GB; base Bonsai 1.7B; device smart glasses; runtime Qualcomm NPU toolchain. The Bonsai 27B column reads: parameters 27B on Qwen3.6-27B; context 262K tokens; weights 5.9 GB ternary, 3.9 GB 1-bit; base Qwen3.6-27B; device phone and laptop; runtime MLX, CUDA, GGUF. Footer reads 'Vendor-reported; different hardware and baselines.' The OrcaRouter logo sits in the bottom-right.

Если придётся выбрать одно

• Вы разрабатываете для очков, носимых устройств или любого постоянно включённого устройства — 1-битная визуально-языковая модель Bonsai 2B — здесь единственный вариант, а контекст в 1024 токена — это проектное ограничение, вокруг которого вы строите, а не против которого.

• Вы создаёте для телефона — 1-bit Bonsai 27B объёмом 3,9 ГБ — это самая крупная модель в этом семействе, которая укладывается в бюджет памяти класса iPhone, и она даёт вам контекст 262K, к которому модель для очков не может приблизиться.

• Вы делаете сборку для ноутбука или настольного компьютера — тернарная сборка Bonsai 27B — это ориентированный на качество выбор в этом семействе, а 1-битная сборка даёт скорость, а не возможности.

• Вы создаёте гибридную систему — сначала определите правило эскалации, а модель — потом. Модель можно заменить, а границу — нет, как только она окажется в клиенте.

За чем стоит следить, так это за тем, распространится ли вверх тот путь через NPU, который сделал возможным выпуск очков. Если 1-битные ядра на мобильных ускорителях окажутся универсальными, линейка 1.7B расширится, а аргументы в пользу 27B-модели на телефоне станут сильнее. До тех пор две половины семейства чётко разделены по классу устройств, что делает выбор проще, чем можно предположить по общему названию.