
Bonsai op slimme brillen: Een 2B 1-bit VLM die draait op Snapdragon AR1 Gen 1
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 36 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 182 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Het getal dat bepaalt waar deze aankondiging eigenlijk goed voor is, is niet 4x en het is niet 2x. Het is 1.024 — de contextlengte van het model dat PrismML op een paar smartbrillen zette tijdens Snapdragon Summit op 23 september 2026. Het 1-bit Bonsai 2B vision-language model, een systeem met 2 miljard parameters gebouwd op Bonsai 1.7B, draait lokaal op AI-smartbrillen met het Snapdragon AR1 Gen 1 Platform, en de cijfers waarmee PrismML vooroploopt zijn geheugen en snelheid: 0,43 GB aan LLM-gewichten tegenover 1,66 GB voor het overeenkomstige 4-bit 1.7B-model, een reductie van 3,83x, en 15,36 tokens per seconde tegenover 7,44, een verbetering van 2,06x. Beide cijfers zijn afkomstig van de leverancier zelf, beide zijn gemeten op een testplatform van 4 GB, en beide worden gemeten tegen een Qwen 3 1.7B 4-bit-model. Ze worden niet gemeten tegen een Bonsai 27B, en ze worden niet gemeten tegen iets dat gehost is. Ze interpreteren als een bewering over de kwaliteit van Bonsai zou een fout zijn; ze interpreteren als een bewering over wat past binnen een geheugenbudget van brillenklasse is de juiste.
Wat er werd aangekondigd, op één plek
De aankondiging van PrismML — met Pasadena als datumregel, gekoppeld aan het Snapdragon Summit van Qualcomm — zet een vision-languagemodel met 2 miljard parameters op het AR1 Gen 1-brillenplatform. De opdeling bestaat uit een 1,7B 1-bit taalmodel plus een 0,3B 4-bit vision-encoder, met een contextlengte van 1.024 tokens. Het is gebouwd op de Bonsai 1.7B van PrismML, dus het is het kleine uiteinde van de Bonsai-familie in plaats van een nieuwe architectuur, en het is gecompileerd voor de Qualcomm Hexagon NPU met behulp van een interne QNN SDK met 1-bit-kernelondersteuning.
De kop beweert, zoals verklaard door de leverancier:
• Een model met 4x zoveel parameters past binnen dezelfde geheugenbeperkingen op sommige brilvormfactoren.
• Levert ongeveer dezelfde intelligentie als hetzelfde model bij 4-bits precisie, terwijl het ongeveer 4x minder geheugen gebruikt.
• Genereert tokens met meer dan 2x de snelheid.
Die drie zinnen vormen de aankondiging. De specifieke metingen achter de geheugen- en snelheidsclaims zijn de 0,43 GB tegenover 1,66 GB en de 15,36 tegenover 7,44 tokens per seconde, beide op een platform dat met 4 GB geheugen is geconfigureerd. Voor de AR1 Gen 1 zelf wordt een piek van 6 TOPS en 2.304 MACs per cyclus opgegeven — een cijfer voor het platform, niet voor taalmodelinferentie, een onderscheid dat de eigen cijfers van de aankondiging duidelijk maken door tokens per seconde afzonderlijk te vermelden.

De 4x is een geheugenclaim en de baseline is een ander model.
Dit is het deel waarbij het de moeite loont om even stil te staan, want "4x" is zo'n cijfer dat verder reist dan de zin waaruit het afkomstig is. Elke vergelijking die PrismML voor het brillenmodel heeft gepubliceerd, is met een 4-bits kwantisatie van Qwen 3 1.7B — dezelfde parameterklasse, dezelfde taak, een andere kwantisatie. Dat is een legitieme en nuttige vergelijking: het is de vergelijking waarmee een brillen-OEM daadwerkelijk wordt geconfronteerd, waarbij de vraag is of een 1-bits pad genoeg geheugen terugwint om het kernelwerk waard te zijn. Het is geen vergelijking met een 4-bits versie van Bonsai, en het is geen vergelijking met een grotere Bonsai die ergens anders draait.
De benchmarkvoetnoot die aan de aankondiging is gehecht, is op dezelfde manier voorzichtig. PrismML evalueerde het Bonsai 1.7B 1-bit-LLM ten opzichte van het Qwen 3 1.7B 4-bit-model in september 2026 op BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K en GPQA Diamond, en het gerapporteerde resultaat is dat de twee configuraties "vergelijkbare benchmarkresultaten behaalden". Vergelijkbaar, niet superieur. Er staan geen scores per benchmark in de aankondiging en er is geen onafhankelijke reproductie van welk onderdeel dan ook, wat normaal is voor een edge-release in de lanceringsweek en precies de reden waarom de cijfers als door de leverancier gerapporteerd moeten worden beschouwd totdat iemand buiten PrismML ze uitvoert.
1.024 tokens is de spec die het product vormgeeft
Een visie-taalmodel op een bril is een andere workload dan een visie-taalmodel in een chatvenster, en de contextlengte is waar dat tot uiting komt. Bij 1.024 tokens kan het model een korte instructie bevatten plus waar een camera op dat moment naar kijkt. Het kan geen gespreksgeschiedenis, een document of een lange reeks eerdere beurten bevatten. Dat is geen defect in de release — het is de beperking die de release mogelijk maakte, omdat KV-cache en activaties in dezelfde 4 GB moeten leven als de gewichten, en een model uit de 27B-klasse met een context van 262K tokens ordes van grootte meer ruimte nodig heeft voor die toestand.
Dus de eerlijke beschrijving van wat er is uitgeleverd, is een capabele assistent met een korte context die volledig op het apparaat zelf draait. Brilvormige taken — herken dit, lees dat, vertaal het bord voor me, beantwoord een vraag over waar ik naar kijk — passen binnen 1.024 tokens. Alles wat de afgelopen tien minuten moet onthouden, past daar niet in, en geen enkele mate van 1-bitcompressie verandert dat, want de beperking is de toestand, niet de gewichten.
Wat het edge-ecosysteem ervan moet leren
De werkelijk nieuwe engineering in deze aankondiging is niet het model. Het is het kernelpad: een 1-bit-LLM gecompileerd voor de Hexagon NPU via een QNN SDK met ondersteuning voor 1-bit-kernels. Low-bit-gewichten zijn al een tijdje uitvoerbaar op CPU's en GPU's, en PrismML's eigen Bonsai 27B-releases demonstreerden dat op Apple silicon en NVIDIA-hardware. Het krijgen van kernels met binaire gewichten op een mobiele NPU is een ander probleem, omdat het datapad van de accelerator, het packing-formaat en de scheduling allemaal een representatie moeten accommoderen die helemaal geen floattype is.
Als dat pad zich verder generaliseert dan dit ene model — en de bewoording in de SDK suggereert dat PrismML dat beoogt — dan is de interessante consequentie dat de 1-bit-familie ophoudt een laptop- en telefoonverhaal te zijn en een always-on-apparaatverhaal wordt. Het 4 GB-platform in de aankondiging is het huidige plafond. Alles wat de voetafdruk van de gewichten bij gelijkblijvende kwaliteit verlaagt, vergroot de omvang van het model dat eronder past.

De on-deviceclaim verdient één kanttekening.
Volledig lokale multimodale inferentie op een bril is een sterke claim, en het is de moeite waard om te scheiden wat wordt aangetoond van wat wordt gesuggereerd. De AR1 Gen 1 is een brilplatform dat is gebouwd voor altijdactieve sensing en audio; Qualcomms eigen kader voor taalmodellen op het apparaat is over het algemeen hybride geweest, waarbij het apparaat doet wat het kan en de rest doorstuurt naar een gekoppelde telefoon of de cloud. Qualcomms eerste openbare demonstratie van een klein taalmodel op het apparaat was gekoppeld aan het AR1+ Gen 1-platform in plaats van aan AR1 Gen 1. Geen van beide punten spreekt de aankondiging van PrismML tegen — de aankondiging zegt dat het model lokaal op de AR1 Gen 1 draait, en de door de leverancier zelf opgegeven doorvoer- en geheugencijfers zijn consistent met een klein model dat precies dat doet — maar ze betekenen wel dat het praktische product dat hierop wordt gebouwd vrijwel zeker een lokale laag met een escalatiepad zal zijn, niet een apparaat dat nooit met iets anders praat.
Dat is sowieso de juiste architectuur. Een lokaal model met 1,024 tokens is heel goed in de verzoeken die binnen 1,024 tokens passen en kan de verzoeken die daar niet in passen niet beantwoorden.
Waar het escalatiepad hoort
Voor iedereen die op een release als deze voortbouwt, is de ontwerpvraag niet of het brillenmodel goed is — maar wat er gebeurt met het verzoek dat het niet kan bedienen. Beantwoord in applicatiecode wordt dat een berg speciale gevallen die telkens opnieuw moet worden geschreven wanneer het model op het apparaat van grootte of context verandert. Beantwoord als routeringsbeleid wordt het één regel: verzoeken die het contextbudget van de lokale laag overschrijden, of die tools of redeneervermogen vereisen die de lokale laag niet heeft, escaleren naar een gehost model. Dat beleid is precies het soort ding waarvoor OrcaRouter bestaat — één endpoint vóór meer dan 200 gehoste modellen, met failover en het beleid uitgedrukt in configuratie in plaats van in de client. Bonsai zelf wordt hier niet gerouteerd; het is een download die je op je eigen hardware draait. Wat de routeringslaag dekt, is de grens daarboven, en die grens is waar een brillenimplementatie het grootste deel van zijn engineeringtijd aan zal besteden.

Wat nu te kijken
Drie dingen zouden dit van een aankondiging naar een platform tillen. Een uitsplitsing per benchmark achter de regel "vergelijkende resultaten", zodat de afweging tegen 4-bit zichtbaar is in plaats van samengevat. Een groter contextvenster op hetzelfde NPU-pad, wat een probleem met toestandsgeheugen is in plaats van met gewichten en daarom het moeilijkste van de twee is. En een onafhankelijke evaluatie van het 1-bit 1,7B-LLM tegenover zijn 4-bit-tegenhanger, omdat elk cijfer in deze release momenteel afkomstig is van de partij die het heeft gebouwd.
Tot die tijd is de accurate samenvatting smal en nuttig: een multimodaal model met 2 miljard parameters draait nu op een apparaat uit de brillenklasse met 0,43 GB aan taalgewichten, met ongeveer tweemaal de snelheid en ongeveer een kwart van het geheugen van het 4-bits equivalent, bij een contextbudget van 1.024 tokens. Dat is een echte stap voor inferentie op het apparaat en een kleine stap voor de capaciteit van het model, en die twee zijn niet dezelfde bewering.
