Сгенерированная титульная карточка с надписью «Ternary Bonsai 2 27B vs Bonsai 27B» и подзаголовком «Два месяца, две базовые модели», над тремя карточками с надписями «Базовая модель: Qwen3.8-27B vs Qwen3.6-27B», «Самая маленькая сборка: 5,93 ГБ vs 3,9 ГБ» и «В этом поколении нет 1-битного варианта», с нижним колонтитулом «Показатели удержания 98,2% и 95% заявлены производителем, на разных наборах тестов». Логотип OrcaRouter расположен в правом нижнем углу.
Guides & Insights

Ternary Bonsai 2 27B против Bonsai 27B: два месяца, две базовые модели, один отсутствующий вариант

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Ternary Bonsai 2 27B появился 17 сентября 2026 года, через два месяца после того, как Bonsai 27B вышел 14 июля 2026 года, и главное сравнение между ними сводится к одной паре чисел: первое поколение сохранило около 95% среднего результата по бенчмаркам своей базовой модели полной точности, а второе — 98,2%. Это выглядит как прямое поколенческое улучшение, и в основном так и есть — но эти два показателя измеряют не одно и то же, потому что базовая модель под ними изменилась. Июльский релиз сжимал Qwen3.6-27B. Сентябрьский релиз сжимает Qwen3.8-27B. Часть прироста качества принадлежит рецепту сжатия, а часть — более новой Qwen3.8-27B, и ни одна опубликованная цифра не разделяет эти две составляющие.

Есть и второе различие между поколениями, которому уделялось гораздо меньше внимания, но которое важнее для определённой группы пользователей: первый Bonsai выпускался в двух вариантах, а второй — в одном. У сборки на 3,9 ГБ, благодаря которой модель класса 27B помещалась на iPhone 17 Pro, нет преемника в этом релизе. Если именно этот размер был причиной, по которой вы вообще заинтересовались Bonsai, новое поколение — не обновление: это другой продукт, который не покрывает ваш случай.

Что на самом деле поставлялось в первом поколении

Bonsai 27B был выпущен 14 июля 2026 года под лицензией Apache 2.0 в виде двух артефактов, построенных на одной и той же базовой модели, и именно это разделение между ними и было сутью релиза.

• Ternary Bonsai 27B — троичные веса {−1, 0, +1} с групповым масштабированием FP16, 1,71 эффективных бита на вес, объём 5,9 ГБ. Сборка, ориентированная на качество, рассчитанная на повседневный ноутбук с полноценными возможностями рассуждения, вызова инструментов и агентного поведения.

• 1-битный Bonsai 27B — бинарные веса {−1, +1} с тем же групповым масштабированием, 1,125 эффективного бита на вес, занимаемый объём 3,9 ГБ. Сборка, ориентированная на минимальный занимаемый объём, рассчитана на то, чтобы уместиться в бюджет памяти iPhone 17 Pro.

Обе модели имели контекст в 262 тыс. токенов, обе сохраняли компактный 4-битный визуальный блок, чтобы модель оставалась мультимодальной, и обе поддерживали спекулятивное декодирование с драфтером DSpark. Тогда Prism ML формулировала это так: низкобитное представление работало сквозным образом — эмбеддинги, внимание, MLP и LM-голова — без путей отхода к более высокой точности, а 1-битная сборка стала первой моделью класса 27B, которая вообще запустилась на телефоне. Заявленная пропускная способность 1-битного варианта составляла около 11 токенов в секунду на iPhone 17 Pro, 87 ток/с на Apple M5 Max и 163 ток/с на RTX 5090; для тернарного варианта заявляли 58 ток/с на M5 Max и 134 ток/с на 5090.

О потере качества сообщили вместе с этими цифрами, а не скрыли её. В наборе тестов из 15 бенчмарков в режиме размышления полноточная базовая модель набрала 85,0, тернарная сборка — 80,5, то есть около 95%, а однобитная сборка — 76,1, около 90%. Деградация была сосредоточена в агентном вызове инструментов — на однобитной сборке он упал с 80,0 до 66,0 — и в зрении, где показатель упал с 72,6 до 59,6. Математика и программирование показали себя значительно лучше в обоих вариантах.

A screenshot of Prism ML's launch post for the first-generation Bonsai 27B, dated July 14 2026 and titled 'Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone', describing the model as based on Qwen3.6 27B and listing two variants: Ternary Bonsai 27B with ternary weights and FP16 group-wise scaling at 1.71 effective bits per weight and 5.9 GB, and 1-bit Bonsai 27B with binary weights at 1.125 effective bits per weight and 3.9 GB, against roughly 54 GB for a 27B model in 16-bit precision and 18 GB for a good 4-bit build.

Что изменило второе поколение

Ternary Bonsai 2 27B сохраняет рецепт и меняет входные данные. Троичное представление по-прежнему {−1, 0, +1} с одним масштабом FP16 на группу из 128 весов, теперь упаковываясь в 1,76 бита на вес в файле размером 5,93 ГБ, с контекстом 262K и той же отдельной башней зрения — 0,63 ГБ в 4-битном формате в этом выпуске, загружается только при появлении изображения.

Есть две действительно новые вещи, и обе описываются как причина изменения показателя удержания.

Первое — это выборочная точность. В отличие от июльской сборки, которая тернаризовала практически всё, Bonsai 2 хранит 26 238 464 параметра в полной точности — 0,0976 % языковой модели, около 52 МБ в bf16, сосредоточенные в пути рекуррентного состояния слоёв линейного внимания, а также в весах нормализации. Это небольшая уступка в байтах и, по-видимому, большая — в поведении.

Второй — это повёрнутый базис весов. Матрицы весов хранятся после блочного преобразования Уолша–Адамара с размером блока 1 024, а соответствующее преобразование применяется к активациям во время выполнения — исходя из идеи, что разнесение выбросов по координатам уменьшает потери при трёхуровневой аппроксимации. Это не требует дополнительной памяти, поскольку поворот встроен в веса, но он всё же лежит на вычислительном пути.

И есть ещё изменение, которое вообще не является техническим приёмом: базовая модель. Qwen3.8-27B — это гибридная архитектура внимания, примерно 75 % линейного внимания и 25 % полного внимания, тогда как у её предшественницы это было не так. Опубликованные Prism ML оценки по категориям показывают, что дал этот шаг. Следование инструкциям составляет 82,66 у Bonsai 2 против 74,53 у Qwen3.6-27B — базовой модели, сжатой первым поколением. Рассуждение и знания — 83,95 против 84,71 у более старой базовой модели, а программирование — 81,58 против 82,57. Новая базовая модель значительно лучше в следовании инструкциям и немного отстаёт в двух других категориях, и именно такой профиль делает проценты сохранения между поколениями бесполезными сами по себе.

Почему эти два показателя удержания несопоставимы

95% и 98,2% выглядят как два значения на одной шкале. Но это не так — и здесь есть три причины, которые стоит чётко различать, прежде чем делать вывод, что рецепт улучшился на 3,2 пункта.

• Знаменатели различаются. 95% первого поколения были измерены на наборе из 15 бенчмарков против Qwen3.6-27B. 98,2% второго получены на наборе из 20 бенчмарков против Qwen3.8-27B. Разные наборы, разные базовые показатели, разный состав задач по сложности.

• Базовые показатели сместились независимо. Часть прироста в удержании связана с тем, что сжатая модель стала лучше сжимать, а часть — с тем, что базовая модель изменилась так, что это случайно оказалось более благоприятным для тернарных весов. Ни одна опубликованная работа не разделяет эти вклады.

• Сохранение относительно, поэтому оно может расти, тогда как абсолютные возможности в категории падают. Модель, сохраняющая 99% возможностей более слабого родителя, всё ещё может уступать модели, сохраняющей 96% возможностей более сильной.

Абсолютное сравнение информативнее относительного, и на этой основе картина получается более ясной. Совокупный результат Bonsai 2 — 83.9 — выше 83.6, которые полноточная Qwen3.6-27B набрала в старом наборе тестов, а значит, сжатый преемник теперь опережает несжатую модель, которую он заменил поколением ранее. Тернарная сборка первого поколения набрала 80.5 в собственном наборе тестов. Оба этих показателя принадлежат Prism ML, а наборы тестов различаются, поэтому ориентируйтесь на порядок, а не на десятичные знаки.

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

Вариант, который не вернулся

Это та часть сравнения, которая меняет решение о покупке, а не график бенчмарка.

1-битного Bonsai 2 не существует. Сентябрьский релиз поставляется в тернарной сборке, в двух вариантах упаковки — PTQ1_0 с 1,76 бита на вес и 5,93 ГБ и PQ2_0 с 2,16 бита на вес и 7,25 ГБ — плюс контейнер MLX для Apple Silicon. Бинарного варианта на 3,9 ГБ не существует, и никаких анонсов о нём не было. Цифра 3,9 ГБ для телефонного класса, которая встречается в текущих публикациях, по-прежнему относится к июльской модели.

Практическое следствие прямое. Если ваша целевая платформа — iPhone или iPad либо любое устройство, на котором не помещаются языковая модель на 5,9 ГБ, визуальный модуль на 0,63 ГБ и бюджет контекста, то 1-битная сборка первого поколения остаётся единственным вариантом в этом семействе — и будет таковой до тех пор, пока не появится 1-битный Bonsai 2. Обновление тернарного пути не обновляет этот путь. Любой, кто прочитает «Bonsai 2 лучше» и заново скачает его на телефон, обнаружит, что файл не помещается.

Если вы работаете на ноутбуке или настольном компьютере, расчёт обратный: нет причин запускать июльскую тернарную сборку, когда сентябрьская меньше на единицу качества, лучше по важным бенчмаркам и имеет тот же контекст 262K.

Скорость, где поколения действительно трудно ранжировать

Пропускная способность — это та часть данного сравнения, в которой честный ответ состоит в том, что опубликованные цифры не дают оснований для однозначного ранжирования, и об этом стоит сказать, а не выбирать выгодную пару.

Стандартизированные измерения второго поколения при размере батча 1 и без учёта визуальной башни составляют 142,5 ток/с при декодировании на RTX 5090 при упаковке PQ2_0, 46,8 ток/с на Apple M5 Max, 27,7 — на M5 Pro и 18,0 — на M4 Pro. Первое поколение для своей тернарной сборки заявляло 134 ток/с на RTX 5090 и 58 ток/с на M5 Max. Показатель для 5090 незначительно смещается в ожидаемом направлении. Показатель M5 Max движется в обратную сторону — с 58 до 46,8, — а это не то, как должен выглядеть двухмесячный шаг между поколениями.

Две оговорки не позволяют считать это выводом. Базы измерений различаются от выпуска к выпуску, а как минимум один опубликованный показатель M5 Max для более новой модели приписывают сборке, предшествующей оптимизации вращения. Но об этом стоит упомянуть как об открытом вопросе, потому что механизм, который мог бы это объяснить, прямо указан в примечаниях к выпуску: повёрнутый базис ставит преобразование на критический путь каждой проекции при размере батча 1, а декодирование на Apple Silicon — это режим, в котором это вредит сильнее всего. Техника, дающая качество, может стоить пропускной способности декодирования, а на оборудовании с унифицированной памятью этот компромисс проявляется наиболее остро.

Контейнер MLX добавляет отдельную загвоздку для пользователей Apple. Это аффинный 2-битный формат, блок которого хранит как масштаб, так и смещение для каждой группы из 128 весов, но тернарным весам нужен только масштаб, поэтому смещение — мертвый груз — блок занимает 36 байт на 128 весов вместо 34, и плотность упаковки составляет 2,25 бита на вес при измеренном размере файла 8,005 ГиБ. Это другой контейнер, содержащий те же значения, и это тот пакет, который демонстрационная установка загружает по умолчанию.

Запуск любого поколения

Оба поколения имеют одно общее эксплуатационное ограничение, которого не избежала ни одна версия этой модели: ни одно из них не работает на стандартном llama.cpp. Тернарные ядра для этой архитектуры находятся в собственном форке Prism ML, стандартный llama.cpp отвергает текущие упаковки как неизвестные, а — что хуже — он загрузит старый тернарный формат без жалоб и выдаст связную бессмыслицу, потому что не применяет вращение, на которое рассчитаны веса. Сборка MLX включает ядра Metal и CPU, но не содержит пути CUDA. Какое бы поколение вы ни выбрали, вопрос о среде выполнения решается собственным дистрибутивом Prism ML или средой выполнения, которая внедрила эти ядра, а не экосистемой ggml в целом.

Место OrcaRouter в подобном решении — на уровень выше. Ни одно из поколений Bonsai здесь не размещается — это загрузки, которые вы запускаете на собственном оборудовании. Слой маршрутизации полезен на границе: для запросов, на которые ваша локальная модель отвечать не должна. Определите политику эскалации один раз в конфигурации маршрутизации, а не в коде приложения, чтобы локально обслуживаемый уровень передавал запросы с длинным контекстом, с большим объёмом визуальных данных или иным образом выходящие за рамки на размещённую модель, а не завершался по ним ошибкой, и чтобы этот запасной вариант сохранялся независимо от того, какое поколение Bonsai у вас установлено. Тогда и локальный уровень, и размещённый оказываются за одним ключом, и политика находится в одном месте, когда появится следующее поколение Bonsai и границы уровней снова сместятся.

Что с этим делать

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Bonsai 27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: base model Qwen3.8-27B, released 17 September 2026, variants one ternary build, smallest footprint 5.93 GB, vendor-reported retention 98.2%, stock llama.cpp support none. The Bonsai 27B (first generation) column reads: base model Qwen3.6-27B, released 14 July 2026, variants ternary plus 1-bit, smallest footprint 3.9 GB, vendor-reported retention 95%, stock llama.cpp support none. Footer reads 'Retention measured on different suites by the vendor; both unreproduced.' The OrcaRouter logo sits in the bottom-right.

• Если вы запускаете июльскую тернарную сборку на ноутбуке или настольном компьютере — переходите на Ternary Bonsai 2 27B. Это модель получше при примерно том же занимаемом объёме, а оценки по категориям, где она выигрывает, — именно те, что важны для агентной работы и работы со следованием инструкциям.

• Если вы используете июльскую 1-битную сборку на телефоне — оставайтесь на ней. У неё нет преемника, и тернарная сборка на 5,93 ГБ не может напрямую заменить сборку на 3,9 ГБ.

• Если вы впервые оцениваете это семейство — сначала определите занимаемое место, а затем поколение. Нужный вам вариант определяет, в каком выпуске вы выбираете, и этот порядок противоположен тому, как обычно описывают это обновление.

• Если вы выбираете по бенчмаркам — рассматривайте 95% и 98,2% как два разных измерения, а не как две точки на одной линии, и считайте все цифры в обоих результатах собственными данными вендора, пока не появится независимая оценка сентябрьской модели. Именно за этой оценкой стоит следить, потому что она станет первой, которая позволит сравнить два поколения на общей основе.