Сгенерированная титульная карточка с надписью «Ternary Bonsai 2 27B vs Qwen3.8-27B» и подзаголовком «Одна и та же сеть при двух точностях», над тремя карточками с надписями «Размер файла: 5.93 ГБ vs 53.81 ГБ», «Сокращение: 9.05x» и «Контекст: 262K токенов, у обоих», с нижним колонтитулом: «Сохранение 98.2% заявлено производителем и не воспроизведено». Логотип OrcaRouter расположен в правом нижнем углу.
Guides & Insights

Ternary Bonsai 2 27B против Qwen3.8-27B: Что на самом деле дают 47,9 гигабайта точности

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Ternary Bonsai 2 27B и Qwen3.8-27B — это одна и та же модель в двух числовых мирах. Их объединяют архитектура, токенизатор, происхождение обучения и контекстное окно размером 262 144 токена. Различает их способ записи весов: Qwen3.8-27B хранит каждый вес как 16-битное число с плавающей запятой и занимает 53,81 ГБ в эталонной форме FP16, тогда как Ternary Bonsai 2 27B хранит каждый вес как один из трёх символов и занимает 5,93 ГБ. Prism ML анонсировала сжатую сборку 17 сентября 2026 года и выложила её на Hugging Face под лицензией Apache 2.0; исходные веса Qwen3.8-27B были опубликованы 13 августа 2026 года, также под лицензией Apache 2.0.

Сравнение, которое действительно важно, не в том, какая из них лучше. А в том, чего вам стоит недостача 47,9 ГБ, и честный ответ более узкий и конкретный, чем вам скажет любой из двух лагерей. Prism ML сообщает, что данная сборка сохраняет 98,2% от среднего показателя модели полной точности по набору из 20 бенчмарков — 83,9 против 85,4. Это число — от самого поставщика, измеренное на его собственном тестовом стенде, и через день после выпуска никто за пределами Prism ML его не воспроизвёл. Агрегированный показатель также скрывает то, что вам на самом деле важно, потому что 1,8 пункта распределены неравномерно. На двух бенчмарках, которые проверяют длительную разработку ПО, разрыв не 1,8% — он ближе к 25%.

Одна и та же сеть, записанная по-другому

Начнём с того, чего сжатие не затрагивает, потому что именно это и делает сравнение интересным. Число слоёв, размер скрытого слоя, словарь, схема внимания и визуальная башня — всё это от базовой модели. Qwen3.8-27B — это гибридная архитектура внимания: 48 слоёв линейного внимания Gated DeltaNet, чередующихся с 16 слоями полного внимания, примерно соотношение 3:1, всего 64 слоя при размере скрытого слоя 5 120 и словаре на 248 320 токенов. Именно этот преимущественно линейный каркас и делает контекст 262K доступным в принципе, и именно это свойство Bonsai наследует без изменений.

Что изменила Prism ML — это представление матриц языковой модели, а также ядра, необходимые для вычислений на них. В её whitepaper 27,36 млрд параметров распределены так: 24,35 млрд — в языковом бэкбоне на 64 блока, 2,54 млрд — в слое эмбеддингов и LM head, и 0,47 млрд — в 27-блочной визуальной башне. Визуальная башня поставляется отдельным 4-битным файлом mmproj размером около 0,63 ГБ и загружается только тогда, когда действительно приходит изображение, поэтому развёртывание, работающее только с текстом, никогда не платит за неё.

Практическое следствие этой в основном линейной архитектуры стоит отметить до любого обсуждения бенчмарков. Поскольку эта архитектура не является обычным трансформером, низкобитные ядра пришлось писать специально для неё. Стандартный llama.cpp отвергает обе упаковки Prism ML как неизвестные типы — и, что опаснее, без жалоб загружает более старый тернарный формат и выдаёт беглую бессмыслицу, потому что к активациям не применяется соответствующее вращение. Если вы запустите эту модель на бинарнике, который о ней не знает, вы не получите ошибку. Вы получите уверенный, но неверный вывод.

Сравнение, категория за категорией

Вот разбивка от вендора по 20 бенчмаркам, где в качестве эталона используется база полной точности. Каждый показатель в этом списке принадлежит Prism ML; ни один из них не был проверен независимо.

• Математика — 96,57 у Ternary Bonsai 2 27B против 97,06 у Qwen3.8-27B. Фактически на одном уровне.

• Программирование — 81,58 против 82,17. Тоже близко, и это как раз та категория, по которой идёт спор обо всей методике.

• Следование инструкциям — 82,66 против 81,25. Сжатая модель впереди здесь, и это единственная строка в таблице, которая действительно удивляет.

• Знания и рассуждения — 83,95 против 86,66. Падение на 2,7 пункта — и это самый крупный фактор, объясняющий недостающие 1,8 пункта.

• Агентные возможности и вызов инструментов — 77,57 против 79,74, включая τ2-Bench с 80,22 и BFCL v3 с 74,92.

• Зрение — 78,59 против 81,64, крупнейшая потеря по категории. Обратите внимание: сжатая часть — не сам vision tower, а языковая модель, читающая его выходные данные.

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Qwen3.8-27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: bits per weight 1.76 packed, file size 5.93 GB, 20-benchmark average 83.9, math 96.57, instruction following 82.66, Terminal-Bench 2.1 52.8. The Qwen3.8-27B FP16 column reads: bits per weight 16.0, file size 53.81 GB, 20-benchmark average 85.4, math 97.06, instruction following 81.25, Terminal-Bench 2.1 69.7. Footer reads 'Both columns are one vendor suite; the compressed figures are unaudited.' The OrcaRouter logo sits in the bottom-right.

Смотрите на форму, а не на среднее — и картина становится яснее. Сжатие почти бесплатно для математики, программирования и следования инструкциям и дорого обходится для знаний и зрения. Это противоположно народной мудрости о низкобитных моделях, согласно которой поверхностные знания выживают, а рассуждения разрушаются. Здесь именно знания разрушаются, а рассуждения сохраняются.

Где на самом деле живут 1,8 балла

Сводный показатель — это среднее по двадцати бенчмаркам, а средние — как раз то место, где прячутся разрывы. Вытащите отдельные результаты, и два из них окажутся намного хуже, чем следует из среднего.

• Terminal-Bench 2.1 — 52,8 для тернарной сборки против 69,7 для полной точности

• SWE-bench Verified — 60,8 против 80,6

Оба показателя приближаются к трём четвертям от результата модели полной точности. На этом фоне AIME26 показывает 95.83, LiveCodeBench — 90.07, а AA-LCR — 77.0, что в пределах одного пункта от несжатой модели. Это первый случай, когда семейство Bonsai вообще оценивалось на Terminal-Bench, и Prism ML прямо указывает в своих материалах, что способность к долгосрочной разработке программного обеспечения, обещанная в первом поколении, реализована частично, а не полностью.

Так что практический вопрос не в том, «сохраняет ли она 98,2 %», а в том, «какова моя рабочая нагрузка». Если вы запускаете кодирующего агента, который удерживает план на протяжении десятков вызовов инструментов и редактирует файлы в течение нескольких минут, вы относитесь к категории с разрывом в 25 %, и агрегированное число активно вводит в заблуждение. Если вы занимаетесь математикой, одношаговой генерацией кода, извлечением данных, классификацией или чатом, вы относитесь к категориям, где разрыв сглаживается при округлении. Самое полезное в собственной таблице поставщика — то, что она позволяет провести это разграничение, а не гадать.

Что каждому из них на самом деле нужно для запуска

Аппаратная часть не так симметрична, как предполагает соотношение размеров. Модель FP16 объёмом 53,81 ГБ вообще не помещается на ноутбук с 16 ГБ, поэтому сравнение — не столько «быстрее против медленнее», сколько «возможно против невозможно». Стандартизированные измерения Prism ML при размере батча 1, исключая vision tower:

• NVIDIA RTX 5090 — декодирование со скоростью 142,5 токен/с на упаковке PQ2_0, при 0,582 мВт·ч на токен

• Apple M5 Max — 46,8 tok/s при декодировании, а обработка промпта — около 765 tok/s

• Apple M5 Pro — 27,7 ток/с при декодировании

• Apple M4 Pro — 18,0 tok/s при декодировании, при этом обработка промпта со скоростью около 125 tok/s становится ограничивающим фактором на очень длинных контекстах

Важная оговорка: ничто из этого не является единым бинарным файлом. Упаковка PTQ1_0 даёт 5,93 ГБ при 1,76 бита на вес; PQ2_0 обходится в 7,25 ГБ при 2,16 бита на вес и даёт выигрыш в скорости декодирования на аппаратном обеспечении, где узким местом является пропускная способность инструкций, а не пропускная способность памяти. Сборка MLX для Apple Silicon — это третий артефакт с собственным учётом: аффинный 2-битный контейнер, который хранит смещение, не нужное тернарным весам, что в итоге даёт 2,25 бита на вес и 8,005 ГиБ на диске, с ядрами Metal и CPU, но без пути CUDA. «Это работает в 5,9 ГБ» верно ровно для одного из этих файлов и ровно в нужной среде выполнения.

Сравнение затрат, честно представленное

Существует два способа оплатить Qwen3.8-27B, и только один способ оплатить его сжатого собрата. Ternary Bonsai 2 27B — это загрузка: Apache 2.0, ваше оборудование, без счётчика. Qwen3.8-27B — это и загрузка, и хостинговый сервис, и если вы выбираете хостинговый вариант, соответствующая цифра — та, что на странице модели: $0,33 за миллион входных токенов и $2,40 за миллион выходных токенов, обслуживается собственной инфраструктурой OrcaRouter, а не перепродаётся у кого-то другого.

Именно здесь OrcaRouter заслуживает места в этом сравнении, а не сноски. Маршрутизированная сборка Qwen3.8-27B несёт тот же контекст в 262K, принимает текст, изображения и видео и предоставляет управление уровнем усилий рассуждения, с которым поставляется модель. Она находится за тем же ключом, что и более 200 других моделей, без наценки к прайсовой цене провайдера, и это важно сильнее, чем звучит: поскольку прайсовая цена передаётся напрямую, а не перепродаётся, изменение цены поставщика появляется здесь в тот же день, а не при следующем продлении контракта. Для команды, которой нужна база полной точности как уровень эскалации над локальным Bonsai, это одна конечная точка и один ключ, а не два отношения с поставщиками.

A screenshot of Prism ML's launch post for Bonsai 2 27B, dated September 17 2026 and titled 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', showing the opening paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance the new model retains over 98%.

Какой из них выбрать?

Решение в основном о том, где выполняется работа, а не о том, какая модель лучше, потому что в большинстве задач это одна и та же модель.

• Выбирайте Qwen3.8-27B в режиме полной точности, когда задача требует длительного горизонта и агентного подхода, когда вы проводите оценку или тонкую настройку, когда вам нужен контекст YaRN на 1 млн токенов или когда точность распознавания изображений критически важна. Причина — показатели Terminal-Bench и SWE-bench.

• Выбирайте Ternary Bonsai 2 27B, когда работу необходимо выполнять на принадлежащем вам оборудовании, когда альтернативой является вообще не запускать модель 27B, или когда рабочая нагрузка связана с математикой, программированием, извлечением данных или рассуждениями без использования инструментов, где категории находятся на одном уровне.

• Не выбирайте по агрегированному показателю. 83,9 и 85,4 достаточно близки, чтобы одна замена бенчмарка могла изменить их порядок, и только одно из этих двух чисел независимо проверено.

По-настоящему новое здесь не то, что модель на 27B помещается в шесть гигабайт — первое поколение Bonsai сделало это ещё в июле. А то, что следование инструкциям оказалось лучше, чем у родительской модели, а математика и программирование — на том же уровне; и это уже другое утверждение, нежели «маленькая для своего размера». Сохранится ли это на вашей рабочей нагрузке — именно то, чего не может сказать возраст модели в один день, а первый независимый анализ этой модели — тот результат, которого стоит дождаться.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and the description that the model is self-hosted on OrcaRouter's own infrastructure.

Если вы хотите запустить сравнение на своих собственных промптах, а не на наборе бенчмарков, самый быстрый путь — вызвать размещённую Qwen3.8-27B через один эндпоинт и запустить тернарную сборку локально, а затем сравнить выходные данные на задачах, которые у вас действительно есть. Это работа на одно утро, и она расскажет вам больше об этих 1,8 пунктах, чем любая опубликованная таблица.