
Ternary Bonsai 2 27B против Bonsai 27B: два месяца, две базовые модели, один отсутствующий вариант
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B появился 17 сентября 2026 года, через два месяца после того, как Bonsai 27B вышел 14 июля 2026 года, и главное сравнение между ними сводится к одной паре чисел: первое поколение сохранило около 95% среднего результата по бенчмаркам своей базовой модели полной точности, а второе — 98,2%. Это выглядит как прямое поколенческое улучшение, и в основном так и есть — но эти два показателя измеряют не одно и то же, потому что базовая модель под ними изменилась. Июльский релиз сжимал Qwen3.6-27B. Сентябрьский релиз сжимает Qwen3.8-27B. Часть прироста качества принадлежит рецепту сжатия, а часть — более новой Qwen3.8-27B, и ни одна опубликованная цифра не разделяет эти две составляющие.
Есть и второе различие между поколениями, которому уделялось гораздо меньше внимания, но которое важнее для определённой группы пользователей: первый Bonsai выпускался в двух вариантах, а второй — в одном. У сборки на 3,9 ГБ, благодаря которой модель класса 27B помещалась на iPhone 17 Pro, нет преемника в этом релизе. Если именно этот размер был причиной, по которой вы вообще заинтересовались Bonsai, новое поколение — не обновление: это другой продукт, который не покрывает ваш случай.
Что на самом деле поставлялось в первом поколении
Bonsai 27B был выпущен 14 июля 2026 года под лицензией Apache 2.0 в виде двух артефактов, построенных на одной и той же базовой модели, и именно это разделение между ними и было сутью релиза.
• Ternary Bonsai 27B — троичные веса {−1, 0, +1} с групповым масштабированием FP16, 1,71 эффективных бита на вес, объём 5,9 ГБ. Сборка, ориентированная на качество, рассчитанная на повседневный ноутбук с полноценными возможностями рассуждения, вызова инструментов и агентного поведения.
• 1-битный Bonsai 27B — бинарные веса {−1, +1} с тем же групповым масштабированием, 1,125 эффективного бита на вес, занимаемый объём 3,9 ГБ. Сборка, ориентированная на минимальный занимаемый объём, рассчитана на то, чтобы уместиться в бюджет памяти iPhone 17 Pro.
Обе модели имели контекст в 262 тыс. токенов, обе сохраняли компактный 4-битный визуальный блок, чтобы модель оставалась мультимодальной, и обе поддерживали спекулятивное декодирование с драфтером DSpark. Тогда Prism ML формулировала это так: низкобитное представление работало сквозным образом — эмбеддинги, внимание, MLP и LM-голова — без путей отхода к более высокой точности, а 1-битная сборка стала первой моделью класса 27B, которая вообще запустилась на телефоне. Заявленная пропускная способность 1-битного варианта составляла около 11 токенов в секунду на iPhone 17 Pro, 87 ток/с на Apple M5 Max и 163 ток/с на RTX 5090; для тернарного варианта заявляли 58 ток/с на M5 Max и 134 ток/с на 5090.
О потере качества сообщили вместе с этими цифрами, а не скрыли её. В наборе тестов из 15 бенчмарков в режиме размышления полноточная базовая модель набрала 85,0, тернарная сборка — 80,5, то есть около 95%, а однобитная сборка — 76,1, около 90%. Деградация была сосредоточена в агентном вызове инструментов — на однобитной сборке он упал с 80,0 до 66,0 — и в зрении, где показатель упал с 72,6 до 59,6. Математика и программирование показали себя значительно лучше в обоих вариантах.

Что изменило второе поколение
Ternary Bonsai 2 27B сохраняет рецепт и меняет входные данные. Троичное представление по-прежнему {−1, 0, +1} с одним масштабом FP16 на группу из 128 весов, теперь упаковываясь в 1,76 бита на вес в файле размером 5,93 ГБ, с контекстом 262K и той же отдельной башней зрения — 0,63 ГБ в 4-битном формате в этом выпуске, загружается только при появлении изображения.
Есть две действительно новые вещи, и обе описываются как причина изменения показателя удержания.
Первое — это выборочная точность. В отличие от июльской сборки, которая тернаризовала практически всё, Bonsai 2 хранит 26 238 464 параметра в полной точности — 0,0976 % языковой модели, около 52 МБ в bf16, сосредоточенные в пути рекуррентного состояния слоёв линейного внимания, а также в весах нормализации. Это небольшая уступка в байтах и, по-видимому, большая — в поведении.
Второй — это повёрнутый базис весов. Матрицы весов хранятся после блочного преобразования Уолша–Адамара с размером блока 1 024, а соответствующее преобразование применяется к активациям во время выполнения — исходя из идеи, что разнесение выбросов по координатам уменьшает потери при трёхуровневой аппроксимации. Это не требует дополнительной памяти, поскольку поворот встроен в веса, но он всё же лежит на вычислительном пути.
И есть ещё изменение, которое вообще не является техническим приёмом: базовая модель. Qwen3.8-27B — это гибридная архитектура внимания, примерно 75 % линейного внимания и 25 % полного внимания, тогда как у её предшественницы это было не так. Опубликованные Prism ML оценки по категориям показывают, что дал этот шаг. Следование инструкциям составляет 82,66 у Bonsai 2 против 74,53 у Qwen3.6-27B — базовой модели, сжатой первым поколением. Рассуждение и знания — 83,95 против 84,71 у более старой базовой модели, а программирование — 81,58 против 82,57. Новая базовая модель значительно лучше в следовании инструкциям и немного отстаёт в двух других категориях, и именно такой профиль делает проценты сохранения между поколениями бесполезными сами по себе.
Почему эти два показателя удержания несопоставимы
95% и 98,2% выглядят как два значения на одной шкале. Но это не так — и здесь есть три причины, которые стоит чётко различать, прежде чем делать вывод, что рецепт улучшился на 3,2 пункта.
• Знаменатели различаются. 95% первого поколения были измерены на наборе из 15 бенчмарков против Qwen3.6-27B. 98,2% второго получены на наборе из 20 бенчмарков против Qwen3.8-27B. Разные наборы, разные базовые показатели, разный состав задач по сложности.
• Базовые показатели сместились независимо. Часть прироста в удержании связана с тем, что сжатая модель стала лучше сжимать, а часть — с тем, что базовая модель изменилась так, что это случайно оказалось более благоприятным для тернарных весов. Ни одна опубликованная работа не разделяет эти вклады.
• Сохранение относительно, поэтому оно может расти, тогда как абсолютные возможности в категории падают. Модель, сохраняющая 99% возможностей более слабого родителя, всё ещё может уступать модели, сохраняющей 96% возможностей более сильной.
Абсолютное сравнение информативнее относительного, и на этой основе картина получается более ясной. Совокупный результат Bonsai 2 — 83.9 — выше 83.6, которые полноточная Qwen3.6-27B набрала в старом наборе тестов, а значит, сжатый преемник теперь опережает несжатую модель, которую он заменил поколением ранее. Тернарная сборка первого поколения набрала 80.5 в собственном наборе тестов. Оба этих показателя принадлежат Prism ML, а наборы тестов различаются, поэтому ориентируйтесь на порядок, а не на десятичные знаки.

Вариант, который не вернулся
Это та часть сравнения, которая меняет решение о покупке, а не график бенчмарка.
1-битного Bonsai 2 не существует. Сентябрьский релиз поставляется в тернарной сборке, в двух вариантах упаковки — PTQ1_0 с 1,76 бита на вес и 5,93 ГБ и PQ2_0 с 2,16 бита на вес и 7,25 ГБ — плюс контейнер MLX для Apple Silicon. Бинарного варианта на 3,9 ГБ не существует, и никаких анонсов о нём не было. Цифра 3,9 ГБ для телефонного класса, которая встречается в текущих публикациях, по-прежнему относится к июльской модели.
Практическое следствие прямое. Если ваша целевая платформа — iPhone или iPad либо любое устройство, на котором не помещаются языковая модель на 5,9 ГБ, визуальный модуль на 0,63 ГБ и бюджет контекста, то 1-битная сборка первого поколения остаётся единственным вариантом в этом семействе — и будет таковой до тех пор, пока не появится 1-битный Bonsai 2. Обновление тернарного пути не обновляет этот путь. Любой, кто прочитает «Bonsai 2 лучше» и заново скачает его на телефон, обнаружит, что файл не помещается.
Если вы работаете на ноутбуке или настольном компьютере, расчёт обратный: нет причин запускать июльскую тернарную сборку, когда сентябрьская меньше на единицу качества, лучше по важным бенчмаркам и имеет тот же контекст 262K.
Скорость, где поколения действительно трудно ранжировать
Пропускная способность — это та часть данного сравнения, в которой честный ответ состоит в том, что опубликованные цифры не дают оснований для однозначного ранжирования, и об этом стоит сказать, а не выбирать выгодную пару.
Стандартизированные измерения второго поколения при размере батча 1 и без учёта визуальной башни составляют 142,5 ток/с при декодировании на RTX 5090 при упаковке PQ2_0, 46,8 ток/с на Apple M5 Max, 27,7 — на M5 Pro и 18,0 — на M4 Pro. Первое поколение для своей тернарной сборки заявляло 134 ток/с на RTX 5090 и 58 ток/с на M5 Max. Показатель для 5090 незначительно смещается в ожидаемом направлении. Показатель M5 Max движется в обратную сторону — с 58 до 46,8, — а это не то, как должен выглядеть двухмесячный шаг между поколениями.
Две оговорки не позволяют считать это выводом. Базы измерений различаются от выпуска к выпуску, а как минимум один опубликованный показатель M5 Max для более новой модели приписывают сборке, предшествующей оптимизации вращения. Но об этом стоит упомянуть как об открытом вопросе, потому что механизм, который мог бы это объяснить, прямо указан в примечаниях к выпуску: повёрнутый базис ставит преобразование на критический путь каждой проекции при размере батча 1, а декодирование на Apple Silicon — это режим, в котором это вредит сильнее всего. Техника, дающая качество, может стоить пропускной способности декодирования, а на оборудовании с унифицированной памятью этот компромисс проявляется наиболее остро.
Контейнер MLX добавляет отдельную загвоздку для пользователей Apple. Это аффинный 2-битный формат, блок которого хранит как масштаб, так и смещение для каждой группы из 128 весов, но тернарным весам нужен только масштаб, поэтому смещение — мертвый груз — блок занимает 36 байт на 128 весов вместо 34, и плотность упаковки составляет 2,25 бита на вес при измеренном размере файла 8,005 ГиБ. Это другой контейнер, содержащий те же значения, и это тот пакет, который демонстрационная установка загружает по умолчанию.
Запуск любого поколения
Оба поколения имеют одно общее эксплуатационное ограничение, которого не избежала ни одна версия этой модели: ни одно из них не работает на стандартном llama.cpp. Тернарные ядра для этой архитектуры находятся в собственном форке Prism ML, стандартный llama.cpp отвергает текущие упаковки как неизвестные, а — что хуже — он загрузит старый тернарный формат без жалоб и выдаст связную бессмыслицу, потому что не применяет вращение, на которое рассчитаны веса. Сборка MLX включает ядра Metal и CPU, но не содержит пути CUDA. Какое бы поколение вы ни выбрали, вопрос о среде выполнения решается собственным дистрибутивом Prism ML или средой выполнения, которая внедрила эти ядра, а не экосистемой ggml в целом.
Место OrcaRouter в подобном решении — на уровень выше. Ни одно из поколений Bonsai здесь не размещается — это загрузки, которые вы запускаете на собственном оборудовании. Слой маршрутизации полезен на границе: для запросов, на которые ваша локальная модель отвечать не должна. Определите политику эскалации один раз в конфигурации маршрутизации, а не в коде приложения, чтобы локально обслуживаемый уровень передавал запросы с длинным контекстом, с большим объёмом визуальных данных или иным образом выходящие за рамки на размещённую модель, а не завершался по ним ошибкой, и чтобы этот запасной вариант сохранялся независимо от того, какое поколение Bonsai у вас установлено. Тогда и локальный уровень, и размещённый оказываются за одним ключом, и политика находится в одном месте, когда появится следующее поколение Bonsai и границы уровней снова сместятся.
Что с этим делать

• Если вы запускаете июльскую тернарную сборку на ноутбуке или настольном компьютере — переходите на Ternary Bonsai 2 27B. Это модель получше при примерно том же занимаемом объёме, а оценки по категориям, где она выигрывает, — именно те, что важны для агентной работы и работы со следованием инструкциям.
• Если вы используете июльскую 1-битную сборку на телефоне — оставайтесь на ней. У неё нет преемника, и тернарная сборка на 5,93 ГБ не может напрямую заменить сборку на 3,9 ГБ.
• Если вы впервые оцениваете это семейство — сначала определите занимаемое место, а затем поколение. Нужный вам вариант определяет, в каком выпуске вы выбираете, и этот порядок противоположен тому, как обычно описывают это обновление.
• Если вы выбираете по бенчмаркам — рассматривайте 95% и 98,2% как два разных измерения, а не как две точки на одной линии, и считайте все цифры в обоих результатах собственными данными вендора, пока не появится независимая оценка сентябрьской модели. Именно за этой оценкой стоит следить, потому что она станет первой, которая позволит сравнить два поколения на общей основе.
