
Bonsai на умных очках: 2B 1-битная VLM, работающая на Snapdragon AR1 Gen 1
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 36 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 182 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Число, которое определяет, для чего это объявление на самом деле годится, — не 4x и не 2x. Это 1 024 — длина контекста модели, которую PrismML поместила на умные очки на Snapdragon Summit 23 сентября 2026 года. 1-битная визуально-языковая модель Bonsai 2B, система на 2 миллиарда параметров, построенная на Bonsai 1.7B, работает локально на ИИ-умных очках под управлением платформы Snapdragon AR1 Gen 1, а показатели, которые PrismML приводит в первую очередь, — это память и скорость: 0,43 ГБ весов LLM против 1,66 ГБ для соответствующей 4-битной модели 1.7B, сокращение в 3,83 раза, и 15,36 токенов в секунду против 7,44, улучшение в 2,06 раза. Оба показателя — собственные данные производителя, оба измерены на тестовой платформе с 4 ГБ, и оба измеряются в сравнении с 4-битной моделью Qwen 3 1.7B. Они не измеряются в сравнении с какой-либо Bonsai 27B и не измеряются в сравнении с чем-либо, размещённым на хостинге. Воспринимать их как утверждение о качестве Bonsai было бы ошибкой; воспринимать их как утверждение о том, что умещается в бюджет памяти класса очков, — правильно.
Что было объявлено — в одном месте
Объявление PrismML — с пометкой «Пасадина», приуроченное к саммиту Snapdragon от Qualcomm — представляет визуально-языковую модель с 2 млрд параметров на платформе очков AR1 Gen 1. Состав такой: 1,7-миллиардная 1-битная языковая модель плюс 0,3-миллиардный 4-битный визуальный энкодер, с длиной контекста 1 024 токена. Она построена на Bonsai 1.7B от PrismML, так что это младший представитель семейства Bonsai, а не новая архитектура, и она скомпилирована для NPU Qualcomm Hexagon с использованием внутреннего QNN SDK с поддержкой 1-битных ядер.
В заголовке утверждается, как заявлено поставщиком:
• Позволяет разместить модель с в 4 раза большим количеством параметров при тех же ограничениях памяти на некоторых форм-факторах очков.
• Обеспечивает примерно эквивалентный интеллект той же модели при 4-битной точности, используя примерно в 4 раза меньше памяти.
• Генерирует токены более чем в 2 раза быстрее.
Эти три предложения — и есть релиз. Конкретные измерения, стоящие за утверждениями о памяти и скорости, — это 0,43 ГБ против 1,66 ГБ и 15,36 против 7,44 токена в секунду, причём оба — на платформе, сконфигурированной с 4 ГБ памяти. Сам AR1 Gen 1 заявлен с пиковой производительностью 6 TOPS и 2304 MAC за такт — это показатель для платформы, а не для инференса языковой модели; это различие становится ясным из собственных цифр анонса, где токены в секунду приводятся отдельно.

4x — это утверждение о памяти, а базовый вариант — это другая модель.
На этом стоит остановиться подробнее, потому что «4x» — это та самая цифра, которая разлетается дальше предложения, из которого она взялась. Каждое сравнение, которое PrismML опубликовала для модели очков, проводится с 4-битной квантизацией Qwen 3 1.7B — тот же класс параметров, та же задача, другая квантизация. Это правомерное и полезное сравнение: именно с таким сравнением OEM-производитель очков реально сталкивается на практике, где вопрос в том, высвобождает ли 1-битный путь достаточно памяти, чтобы оправдать работу над ядрами. Это не сравнение с 4-битной версией Bonsai, и это не сравнение с более крупной Bonsai, работающей где-то ещё.
Сноска о бенчмарках, приложенная к анонсу, столь же осторожна. PrismML в сентябре 2026 года оценивала 1-битную LLM Bonsai 1.7B против 4-битной модели Qwen 3 1.7B по BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K и GPQA Diamond, и заявленный результат состоит в том, что две конфигурации «показали сопоставимые результаты бенчмарков». Сопоставимые, а не превосходящие. В анонсе нет оценок по отдельным бенчмаркам и нет независимого воспроизведения чего-либо из этого, что нормально для краевого релиза на неделе запуска и именно поэтому эти цифры следует воспринимать как заявленные вендором, пока кто-нибудь за пределами PrismML их не прогонит.
1 024 токена — это спецификация, которая формирует продукт.
Визуально-языковая модель в очках — это иная рабочая нагрузка, чем визуально-языковая модель в окне чата, и именно это проявляется в длине контекста. При 1 024 токенах модель может удерживать короткую инструкцию плюс то, на что сейчас смотрит камера. Она не может удерживать историю разговора, документ или длинную цепочку предыдущих ходов. Это не дефект релиза — это ограничение, которое сделало релиз возможным, потому что KV-кэш и активации должны находиться в тех же 4 ГБ, что и веса, а модели класса 27B с контекстом в 262K токенов требуется на порядки больше места для этого состояния.
Итак, честное описание того, что выпущено, — это способный ассистент с коротким контекстом, который полностью работает на устройстве. Задачи в форм-факторе очков — распознай это, прочитай то, переведи вывеску передо мной, ответь на вопрос о том, на что я смотрю, — укладываются в 1 024 токена. А всё, что требует помнить последние десять минут, — нет, и никакое сжатие до 1 бита этого не изменит, потому что ограничение — это состояние, а не веса.
Что экосистема edge должна извлечь из этого
По-настоящему новое инженерное решение в этом анонсе — не модель. Это путь ядра: 1-битная LLM, скомпилированная для Hexagon NPU через QNN SDK с поддержкой 1-битных ядер. Низкобитные веса уже давно можно было запускать на CPU и GPU, и собственные релизы Bonsai 27B от PrismML продемонстрировали это на Apple silicon и оборудовании NVIDIA. Запустить ядра с бинарными весами на мобильном NPU — совсем другая задача, поскольку путь данных ускорителя, его формат упаковки и его планирование должны учитывать представление, которое вообще не является типом с плавающей запятой.
Если этот путь распространяется за пределы этой одной модели — а язык SDK предполагает, что PrismML намеревается именно этого — то интересным следствием становится то, что семейство 1-битных перестаёт быть историей о ноутбуках и телефонах и становится историей об устройствах, которые всегда включены. Платформа с 4 ГБ в анонсе — это текущий потолок. Всё, что снижает вес при фиксированном качестве, повышает размер модели, которая помещается под ним.

Утверждение о работе на устройстве заслуживает одной оговорки.
Полностью локальный мультимодальный инференс на паре очков — это сильное утверждение, и стоит отделить то, что продемонстрировано, от того, что подразумевается. AR1 Gen 1 — это платформа для очков, созданная для постоянно активного сенсорного восприятия и аудио; сама Qualcomm обычно описывает языковые модели на устройстве как гибридные: устройство обрабатывает то, что может, а остальное передаёт сопряжённому телефону или в облако. Первая публичная демонстрация малой языковой модели Qualcomm, работающей на устройстве, была связана с платформой AR1+ Gen 1, а не с AR1 Gen 1. Ни один из этих пунктов не противоречит анонсу PrismML — в анонсе говорится, что модель работает локально на AR1 Gen 1, а собственные показатели производителя по пропускной способности и памяти согласуются с тем, что небольшая модель делает именно это, — но они означают, что практический продукт, построенный на этом, почти наверняка будет локальным уровнем с возможностью эскалации, а не устройством, которое никогда ни с чем другим не взаимодействует.
Это в любом случае правильная архитектура. Локальная модель на 1,024 токена очень хорошо справляется с запросами, которые укладываются в 1,024 токена, и не может ответить на те, которые не укладываются.
Где место пути эскалации
Для любого, кто строит на основе такого релиза, вопрос дизайна не в том, хороша ли модель для очков, — а в том, что происходит с запросом, который она не может обслужить. Если решать это в коде приложения, получится куча особых случаев, которые придётся переписывать каждый раз, когда локальная модель меняет размер или контекст. Если решать это как политику маршрутизации, это становится одним правилом: запросы, выходящие за бюджет контекста локального уровня или требующие инструментов либо рассуждений, которых у локального уровня нет, эскалируются на хостируемую модель. Такая политика — как раз то, для чего существует OrcaRouter, — одна точка входа перед более чем 200 хостируемыми моделями, с отказоустойчивостью и политикой, выраженной в конфигурации, а не в клиенте. Сам Bonsai здесь не маршрутизируется; это загрузка, которую вы запускаете на своём оборудовании. Слой маршрутизации охватывает границу над ним, и именно на этой границе развёртывание для очков потратит большую часть времени инженерной работы.

Что посмотреть дальше
Три вещи превратили бы это из анонса в платформу. Разбивка по каждому бенчмарку, стоящая за строкой «сравнительные результаты», чтобы компромисс с 4-битным вариантом был виден, а не сведён к обобщению. Большее контекстное окно на том же NPU-пути, что является проблемой памяти состояний, а не проблемой весов, и поэтому это более сложная из двух задач. И независимая оценка 1-битной LLM 1,7B в сравнении с её 4-битным аналогом, потому что все цифры в этом релизе сейчас исходят от той стороны, которая это создала.
До тех пор точная формулировка остаётся узкой и полезной: мультимодальная модель с 2 млрд параметров теперь работает на устройстве класса очков с 0,43 ГБ языковых весов, примерно вдвое быстрее и примерно вчетверо меньшем объёме памяти, чем 4-битный эквивалент, при бюджете контекста в 1 024 токена. Это реальный шаг для инференса на устройстве и небольшой шаг для возможностей модели, и эти два утверждения — не одно и то же.
