
Bonsai na inteligentnych okularach: VLM 2B 1-bit działający na Snapdragon AR1 Gen 1
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 36 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 182 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Liczba, która decyduje o tym, do czego ta zapowiedź faktycznie się nadaje, to nie 4x i nie 2x. To 1024 — długość kontekstu modelu, który PrismML umieścił na parze inteligentnych okularów podczas Snapdragon Summit 23 września 2026 r. 1-bitowy model wizyjno-językowy Bonsai 2B, system z 2 miliardami parametrów zbudowany na Bonsai 1.7B, działa lokalnie na inteligentnych okularach AI zasilanych platformą Snapdragon AR1 Gen 1, a liczby, które PrismML wysuwa na pierwszy plan, to pamięć i szybkość: 0,43 GB wag LLM w porównaniu z 1,66 GB dla odpowiadającego mu 4-bitowego modelu 1.7B, co daje redukcję 3,83x, oraz 15,36 tokenów na sekundę w porównaniu z 7,44, co daje poprawę 2,06x. Obie liczby pochodzą od samego dostawcy, obie zostały zmierzone na platformie testowej o pojemności 4 GB i obie są mierzone w porównaniu z 4-bitowym modelem Qwen 3 1.7B. Nie są mierzone w porównaniu z żadnym Bonsai 27B ani z niczym hostowanym. Odczytanie ich jako twierdzenia o jakości Bonsai byłoby błędem; odczytanie ich jako twierdzenia o tym, co mieści się w budżecie pamięci klasy okularowej, jest właściwe.
Co zostało ogłoszone, w jednym miejscu
Ogłoszenie PrismML — opatrzone datą Pasadena, powiązane ze Snapdragon Summit Qualcomma — umieszcza model wizyjno-językowy o 2 miliardach parametrów na platformie okularów AR1 Gen 1. W skład wchodzi model językowy 1,7B 1-bit oraz 0,3B 4-bitowy enkoder wizyjny, z długością kontekstu 1024 tokenów. Jest zbudowany na Bonsai 1.7B od PrismML, więc to najmniejszy model z rodziny Bonsai, a nie nowa architektura, i został skompilowany dla Qualcomm Hexagon NPU przy użyciu wewnętrznego QNN SDK z obsługą 1-bitowych jąder.
Jak podaje dostawca, nagłówek głosi:
• Pozwala zmieścić model o 4x większej liczbie parametrów przy tych samych ograniczeniach pamięci w przypadku niektórych formatów okularów.
• Zapewnia w przybliżeniu równoważną inteligencję tego samego modelu w precyzji 4-bitowej, zużywając przy tym około 4 razy mniej pamięci.
• Generuje tokeny ponad 2x szybciej.
Te trzy zdania to komunikat prasowy. Konkretne pomiary stojące za twierdzeniami o pamięci i szybkości to 0,43 GB wobec 1,66 GB oraz 15,36 wobec 7,44 tokena na sekundę — w obu przypadkach na platformie skonfigurowanej z 4 GB pamięci. Sam AR1 Gen 1 jest podawany jako osiągający szczytowo 6 TOPS i 2304 MAC na cykl — wartość dotycząca platformy, a nie wnioskowania modelu językowego; tę różnicę same liczby z ogłoszenia jasno pokazują, podając osobno tokeny na sekundę.

4x to twierdzenie dotyczące pamięci, a punkt odniesienia to inny model.
To jest fragment, nad którym warto się zatrzymać, bo „4x” to taki rodzaj liczby, który rozchodzi się dalej niż zdanie, z którego pochodzi. Każde porównanie opublikowane przez PrismML dla modelu do okularów odnosi się do 4-bitowej kwantyzacji Qwen 3 1.7B — ta sama klasa parametrów, to samo zadanie, inna kwantyzacja. To uzasadnione i przydatne porównanie: dokładnie takie, z jakim mierzy się faktycznie producent okularów OEM, gdzie pytanie brzmi, czy ścieżka 1-bitowa odzyskuje wystarczająco dużo pamięci, by usprawiedliwić pracę nad kernelami. To nie jest porównanie z 4-bitową wersją Bonsai ani porównanie z większym Bonsai działającym gdzie indziej.
Przypis dotyczący benchmarku dołączony do ogłoszenia jest ostrożny w ten sam sposób. PrismML ocenił Bonsai 1.7B 1-bit LLM w zestawieniu z modelem Qwen 3 1.7B 4-bit we wrześniu 2026 r. w ramach BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K i GPQA Diamond, a zgłoszonym wynikiem jest to, że obie konfiguracje „osiągnęły porównywalne wyniki benchmarków”. Porównywalne, nie lepsze. W ogłoszeniu nie ma wyników dla poszczególnych benchmarków ani niezależnej reprodukcji czegokolwiek z tego, co jest normalne w przypadku wydania edge w tygodniu premiery i jest dokładnie tym, dlaczego liczby należy traktować jako podane przez dostawcę, dopóki ktoś spoza PrismML ich nie uruchomi.
1,024 tokeny to specyfikacja, która kształtuje produkt
Model wizyjno-językowy na okularach to inne obciążenie niż model wizyjno-językowy w oknie czatu, a długość kontekstu jest tym, gdzie to widać. Przy 1024 tokenach model może pomieścić krótką instrukcję plus to, na co aktualnie patrzy kamera. Nie może pomieścić historii rozmowy, dokumentu ani długiego łańcucha wcześniejszych tur. To nie jest wada wydania — to ograniczenie, które umożliwiło wydanie, ponieważ pamięć podręczna KV i aktywacje muszą znajdować się w tych samych 4 GB co wagi, a model klasy 27B z kontekstem 262K tokenów potrzebuje o rzędy wielkości więcej miejsca na ten stan.
Uczciwy opis tego, co trafiło na rynek, jest taki: to całkiem zdolny asystent o krótkim kontekście, który działa w całości na urządzeniu. Zadania w kształcie okularów — rozpoznaj to, odczytaj tamto, przetłumacz znak przede mną, odpowiedz na pytanie o to, na co patrzę — mieszczą się w 1024 tokenach. Wszystko, co wymaga zapamiętania ostatnich dziesięciu minut, już się nie mieści, a żadna ilość kompresji 1-bitowej tego nie zmieni, ponieważ ograniczeniem jest stan, a nie wagi.
Co ekosystem edge powinien z tego wyciągnąć dla siebie
Prawdziwie nową inżynierią w tym ogłoszeniu nie jest model. Jest nią ścieżka jąder: LLM 1-bitowy skompilowany dla Hexagon NPU przez QNN SDK z obsługą jąder 1-bitowych. Niskobitowe wagi od jakiegoś czasu można uruchamiać na CPU i GPU, a własne wydania Bonsai 27B od PrismML pokazały to na Apple silicon i sprzęcie NVIDIA. Przeniesienie jąder z wagami binarnymi na mobilny NPU to inny problem, ponieważ ścieżka danych akceleratora, jego format upakowania i szeregowanie — wszystko to musi uwzględniać reprezentację, która wcale nie jest typem zmiennoprzecinkowym.
Jeśli ta ścieżka uogólnia się poza ten jeden model — a język SDK sugeruje, że PrismML zamierza, by tak było — to ciekawą konsekwencją jest to, że rodzina 1-bit przestaje być historią o laptopach i telefonach, a staje się historią o urządzeniach zawsze włączonych. Platforma 4 GB z ogłoszenia to obecny pułap. Cokolwiek zmniejsza ślad wagowy przy stałej jakości, zwiększa rozmiar modelu, który się pod nim mieści.

Twierdzenie o przetwarzaniu na urządzeniu zasługuje na jedno zastrzeżenie.
W pełni lokalne wnioskowanie multimodalne na parze okularów to mocne twierdzenie i warto oddzielić to, co zostało zademonstrowane, od tego, co jest sugerowane. AR1 Gen 1 to platforma okularów zaprojektowana do ciągłego działania czujników i dźwięku; sam Qualcomm na ogół ujmuje modele językowe działające na urządzeniu jako rozwiązanie hybrydowe, w którym urządzenie obsługuje to, co może, a resztę przekazuje sparowanemu telefonowi lub chmurze. Pierwsza publiczna demonstracja małego modelu językowego działającego na urządzeniu ze strony Qualcomma była związana z platformą AR1+ Gen 1, a nie AR1 Gen 1. Żaden z tych punktów nie przeczy ogłoszeniu PrismML — ogłoszenie mówi, że model działa lokalnie na AR1 Gen 1, a własne dane producenta dotyczące przepustowości i pamięci są zgodne z tym, że mały model robi dokładnie to — ale oznaczają one, że praktyczny produkt zbudowany na tym będzie niemal na pewno lokalną warstwą z mechanizmem eskalacji, a nie urządzeniem, które nigdy nie rozmawia z niczym innym.
To i tak właściwa architektura. Lokalny model o 1,024 tokenach bardzo dobrze radzi sobie z żądaniami, które mieszczą się w 1,024 tokenach, a nie potrafi odpowiedzieć na te, które się nie mieszczą.
Gdzie należy ścieżka eskalacji
Dla każdego, kto buduje na takim wydaniu, pytanie projektowe nie brzmi, czy model działający na okularach jest dobry — lecz co dzieje się z żądaniem, którego nie może obsłużyć. Gdy odpowiada się na to w kodzie aplikacji, zamienia się to w stos przypadków szczególnych, które trzeba przepisywać za każdym razem, gdy model na urządzeniu zmieni rozmiar lub kontekst. Gdy odpowiada się na to jako politykę routingu, staje się to jedną regułą: żądania przekraczające budżet kontekstu warstwy lokalnej albo wymagające narzędzi lub rozumowania, których warstwa lokalna nie ma, są eskalowane do modelu hostowanego. Ta polityka to coś, do czego powstał OrcaRouter — jeden punkt końcowy przed ponad 200 hostowanymi modelami, z przełączaniem awaryjnym i polityką wyrażoną w konfiguracji, a nie w kliencie. Sam Bonsai nie jest tu routowany; to plik do pobrania, który uruchamiasz na własnym sprzęcie. To, co obejmuje warstwa routingu, to granica ponad nim, a właśnie na tej granicy wdrożenie na okularach spędzi większość swojego czasu inżynieryjnego.

Co obejrzeć dalej
Trzy rzeczy przeniosłyby to z ogłoszenia na platformę. Rozbicie na poszczególne benchmarki za wierszem „wyniki porównawcze”, aby kompromis względem 4-bit był widoczny, a nie tylko podsumowany. Większe okno kontekstu na tej samej ścieżce NPU, co jest problemem pamięci stanu, a nie problemem wag, i dlatego jest trudniejsze z tych dwóch. Oraz niezależna ocena 1-bitowego LLM 1.7B względem jego 4-bitowego odpowiednika, ponieważ każda liczba w tym wydaniu pochodzi obecnie od strony, która go zbudowała.
Do tego czasu trafne podsumowanie jest wąskie i użyteczne: model multimodalny o 2 miliardach parametrów działa teraz na urządzeniu klasy okularów, z 0,43 GB wag językowych, przy mniej więcej dwukrotnie większej szybkości i około jednej czwartej pamięci 4-bitowego odpowiednika, w budżecie kontekstu wynoszącym 1 024 tokeny. To realny krok dla wnioskowania na urządzeniu i mały krok dla możliwości modelu, a te dwie rzeczy to nie to samo twierdzenie.
