
Bonsai på smarta glasögon: En 2B 1-bitars VLM som körs på Snapdragon AR1 Gen 1
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 36 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 182 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Siffran som avgör vad detta tillkännagivande faktiskt är bra för är inte 4x och inte 2x. Det är 1 024 – kontextlängden för modellen som PrismML lade in i ett par smarta glasögon på Snapdragon Summit den 23 september 2026. Den 1-bitars vision-språkmodellen Bonsai 2B, ett system med 2 miljarder parametrar byggt på Bonsai 1.7B, körs lokalt på smarta AI-glasögon som drivs av Snapdragon AR1 Gen 1 Platform, och siffrorna som PrismML framhåller är minne och hastighet: 0,43 GB LLM-vikter mot 1,66 GB för motsvarande 4-bitars 1.7B-modell, en minskning med 3,83x, och 15,36 tokens per sekund mot 7,44, en förbättring med 2,06x. Båda siffrorna är leverantörens egna, båda uppmättes på en testplattform med 4 GB, och båda mäts mot en 4-bitars Qwen 3 1.7B-modell. De mäts inte mot någon Bonsai 27B, och de mäts inte mot något hostat. Att läsa dem som ett påstående om Bonsais kvalitet vore ett misstag; att läsa dem som ett påstående om vad som får plats i en minnesbudget av glasögonklass är det rätta.
Det som tillkännagavs, på ett ställe
PrismML:s tillkännagivande – daterat Pasadena, knutet till Qualcomms Snapdragon Summit – placerar en visions- och språkmodell med 2 miljarder parametrar på glasögonplattformen AR1 Gen 1. Uppdelningen är en 1,7B 1-bitars språkmodell plus en 0,3B 4-bitars visionskodare, med en kontextlängd på 1 024 tokens. Den är byggd på PrismML:s Bonsai 1.7B, så den utgör den lilla änden av Bonsai-familjen snarare än en ny arkitektur, och den kompilerades för Qualcomm Hexagon NPU med hjälp av ett internt QNN SDK med stöd för 1-bitarskärnor.
Rubriken hävdar, enligt vad leverantören uppger:
• Får plats med en modell med 4x så många parametrar inom samma minnesbegränsningar på vissa glasögonformfaktorer.
• Levererar ungefär motsvarande intelligens som samma modell vid 4-bitars precision, samtidigt som den använder cirka 4x mindre minne.
• Genererar tokens mer än 2x så snabbt.
De tre meningarna utgör pressmeddelandet. De specifika mätvärdena bakom minnes- och hastighetspåståendena är 0,43 GB mot 1,66 GB och 15,36 mot 7,44 tokens per sekund, båda på en plattform konfigurerad med 4 GB minne. Själva AR1 Gen 1 uppges ha en topp på 6 TOPS och 2 304 MACs per cykel – ett värde för plattformen, inte för inferens i språkmodeller, vilket är en distinktion som pressmeddelandets egna siffror tydliggör genom att separat ange tokens per sekund.

4x:et är ett minnespåstående, och baslinjen är en annan modell
Det här är delen som är värd att stanna upp vid, för "4x" är den typ av siffra som färdas längre än meningen den kom ifrån. Varje jämförelse som PrismML publicerade för glasögonmodellen är mot en 4-bitars kvantisering av Qwen 3 1.7B – samma parameterklass, samma uppgift, en annan kvantisering. Det är en legitim och användbar jämförelse: det är jämförelsen en glasögon-OEM faktiskt står inför, där frågan är om en 1-bitarsväg köper tillbaka tillräckligt mycket minne för att vara värd kernelarbetet. Det är inte en jämförelse mot en 4-bitarsversion av Bonsai, och det är inte en jämförelse mot en större Bonsai som körs någon annanstans.
Benchmark-fotnoten som bifogats tillkännagivandet är försiktig på samma sätt. PrismML utvärderade Bonsai 1.7B 1-bit LLM mot Qwen 3 1.7B 4-bit-modellen i september 2026 på BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K och GPQA Diamond, och det rapporterade resultatet är att de två konfigurationerna "uppnådde jämförbara benchmarkresultat". Jämförbara, inte överlägsna. Det finns inga per-benchmark-poäng i tillkännagivandet och ingen oberoende reproduktion av något av det, vilket är normalt för ett edge-släpp under lanseringsveckan och är precis anledningen till att siffrorna bör betraktas som leverantörsrapporterade tills någon utanför PrismML kör dem.
1 024 tokens är den specifikation som formar produkten
En visionsspråkmodell i glasögon är en annan typ av arbetsbelastning än en visionsspråkmodell i ett chattfönster, och det är i kontextlängden det visar sig. Vid 1 024 tokens kan modellen rymma en kort instruktion plus det en kamera för närvarande tittar på. Den kan inte rymma en konversationshistorik, ett dokument eller en lång kedja av tidigare turer. Det är inte en defekt i släppet – det är begränsningen som gjorde släppet möjligt, eftersom KV-cache och aktiveringar måste ligga i samma 4 GB som vikterna, och en modell i 27B-klassen med en kontext på 262K tokens behöver flera storleksordningar mer utrymme för det tillståndet.
Så den ärliga beskrivningen av det som levererades är en kapabel assistent med kort kontext som körs helt och hållet på enheten. Uppgifter i glasögonformat – känn igen det här, läs det där, översätt skylten framför mig, svara på en fråga om det jag tittar på – ryms inom 1 024 tokens. Allt som behöver komma ihåg de senaste tio minuterna ryms inte, och hur mycket 1-bitars komprimering som helst ändrar inte på det, eftersom gränsen är tillståndet, inte vikterna.
Vad edge-ekosystemet bör ta med sig av det
Det genuint nya ingenjörsarbetet i detta tillkännagivande är inte modellen. Det är kärnvägen: en 1-bitars LLM kompilerad för Hexagon-NPU:n via ett QNN SDK med stöd för 1-bitarskärnor. Lågbitarsvikter har varit körbara på CPU:er och GPU:er ett tag, och PrismML:s egna Bonsai 27B-släpp visade det på Apple silicon och NVIDIA-hårdvara. Att få binärviktskärnor att köra på en mobil NPU är ett annat problem, eftersom acceleratorns dataväg, dess packningsformat och dess schemaläggning alla måste hantera en representation som inte är en flyttalstyp över huvud taget.
Om den vägen generaliserar bortom den här enskilda modellen – och språket i SDK:n antyder att PrismML avser att den ska göra det – så är den intressanta konsekvensen att 1-bitarsfamiljen slutar vara en berättelse om bärbara datorer och telefoner och blir en berättelse om enheter som alltid är på. 4 GB-plattformen i tillkännagivandet är det nuvarande taket. Allt som minskar vikternas utrymmesbehov vid en fast kvalitetsnivå ökar storleken på den modell som ryms under det.

Påståendet om körning på enheten förtjänar en brasklapp.
Fullständigt lokal multimodal inferens på ett par glasögon är ett starkt påstående, och det är värt att skilja på vad som demonstreras och vad som antyds. AR1 Gen 1 är en glasögonplattform byggd för ständigt pågående avkänning och ljud; Qualcomms egen formulering för språkmodeller på enheten har i allmänhet varit hybrid, där enheten hanterar vad den kan och skickar resten till en ihopparad telefon eller molnet. Qualcomms första offentliga demonstration av en liten språkmodell på enheten var knuten till plattformen AR1+ Gen 1 snarare än AR1 Gen 1. Ingen av dessa punkter motsäger PrismML:s tillkännagivande – tillkännagivandet säger att modellen körs lokalt på AR1 Gen 1, och leverantörens egna siffror för genomströmning och minne stämmer med att en liten modell gör exakt det – men de innebär att den praktiska produkt som byggs på detta nästan säkert kommer att vara en lokal nivå med en eskaleringsväg, inte en enhet som aldrig pratar med något annat.
Det är rätt arkitektur ändå. En lokal modell med 1 024 tokens är mycket bra på de förfrågningar som ryms inom 1 024 tokens och kan inte svara på de som inte gör det.
Var eskaleringsvägen hör hemma
För den som bygger på en release som denna är designfrågan inte huruvida glasögonmodellen är bra – utan vad som händer med den förfrågan den inte kan hantera. Besvarad i applikationskoden blir den en hög specialfall som måste skrivas om varje gång modellen på enheten ändrar storlek eller kontext. Besvarad som en routingpolicy blir den en enda regel: förfrågningar som överskrider den lokala nivåns kontextbudget, eller som kräver verktyg eller resonemang som den lokala nivån inte har, eskalerar till en hostad modell. Den policyn är precis vad OrcaRouter finns till för – en endpoint framför över 200 hostade modeller, med failover och policyn uttryckt i konfiguration snarare än i klienten. Bonsai routas inte här; det är en nedladdning du kör på din egen hårdvara. Det routinglagret täcker är gränsen ovanför det, och den gränsen är där en glasögendistribution kommer att lägga större delen av sin engineeringtid.

Vad du ska titta på härnäst
Tre saker skulle flytta detta från ett tillkännagivande till en plattform. En uppdelning per benchmark bakom raden ”jämförande resultat”, så att avvägningen mot 4-bitars är synlig i stället för sammanfattad. Ett större kontextfönster på samma NPU-väg, vilket är ett problem med tillståndsminne snarare än ett problem med vikter och därför det svårare av de två. Och en oberoende utvärdering av 1-bitars 1,7B-LLM mot dess 4-bitars motsvarighet, eftersom varje siffra i den här utgåvan för närvarande kommer från aktören som byggde den.
Fram till dess är den korrekta sammanfattningen snäv och användbar: en multimodal modell med 2 miljarder parametrar körs nu på en enhet i glasögonklass med 0,43 GB språkvikter, med ungefär dubbel hastighet och ungefär en fjärdedel av minnet jämfört med 4-bitsekvivalenten, inom en kontextbudget på 1 024 tokens. Det är ett verkligt steg för inferens på enheten och ett litet steg för modellförmågan, och de två är inte samma påstående.
